# Matveev Tech > Личный блог про AI и автоматизацию. Тестирую новые LLM, пишу гайды по инструментам и делюсь тем, что помогает в работе. Public Ghost content for AI and LLM tooling. This file includes a bounded export of public pages first, then recent public posts. Append `.md` to any post or page URL to get the content in Markdown (for example, `/example-post.md`). ## Pages ### Обо мне URL: https://matveev.tech/about/ Last updated: 2026-07-20T17:51:43.000Z Привет! Я Павел Матвеев, CTO холдинга Skillbox. Здесь я пишу про AI-инструменты, которые пробую сам: обзоры моделей, сравнения, гайды и новости. Каждую неделю выходят десятки новых сервисов, и большинство из них не стоят твоего времени. Я тестирую их за тебя и честно рассказываю, что работает, а что нет. ## Зачем этот блог? Блог начался с простого вопроса: какие из этих сотен AI-инструментов действительно полезны? Я тестировал их для себя и для продукта, а потом понял, что выводы пригодятся не только мне. Сейчас в блоге больше 200 статей: обзоры новых LLM-моделей, сравнения инструментов, гайды по настройке и новости индустрии. Принцип один: если инструмент плохой, я так и скажу. Если крутой, объясню, где он пригодится и сколько это стоит. В разработке я давно, прошёл путь от инженера до техдира. Поэтому смотрю на инструменты глазами человека, которому потом с этим жить в проде и защищать бюджет на подписки перед финансистами. ## Что я пробую руками? Всё, о чём пишу, проходит через мои руки. Claude Code и агенты у меня в ежедневной работе, поэтому в обзорах я опираюсь на собственные логи и счета за API, чужие обзоры использую только для сверки. Дома у меня своя homelab: несколько виртуалок, self-hosted сервисы через Coolify, свои боты и автоматизации. Там же живут пет-проекты. Например, telegram-бот, который публикует посты в тестовый автоматизированный канал, и память для AI-агентов, чтобы между сессиями они не забывали, о чём мы договаривались. ## Как делается этот блог? Честно: блог сам по себе полигон для AI-инструментов. Он работает на Ghost, а тексты я готовлю в связке с Claude Code: агенты собирают по источникам материал, который я решил опубликовать, я пишу и правлю, свои скиллы вычитывают текст и убирают мусор, публикация идёт через MCP. Каждую статью я читаю и редактирую сам. Но пайплайн вокруг автоматизирован настолько, насколько это возможно в 2026 году. Думаю, сам этот процесс говорит о состоянии AI-инструментов больше, чем любой из моих обзоров. ## Что в канале CTO Speech? В Telegram я веду канал [CTO Speech](https://t.me/ctospeech?ref=matveev.tech). Туда попадает то, что не дотягивает до статьи: короткие новости, наблюдения из практики, мнения по горячим следам. Блог — для развёрнутых разборов, канал — для быстрых сигналов. Если хочешь следить за AI-новостями без информационного шума, подписывайся. ## Контакты - Telegram: [@ctospeech](https://t.me/ctospeech?ref=matveev.tech) ## Posts ### GPT-6 Astra: обзор модели OpenAI и заявка на AGI URL: https://matveev.tech/gpt-6-astra-update-2026-09-05/ Last updated: 2026-09-04T22:38:08.000Z > TL;DR: GPT-6 Astra вышла 3 сентября 2026 года. Это модель OpenAI для работы с приложениями и долгих задач в Codex: она может управлять интерфейсом, писать код и искать сведения в предыдущих контекстных окнах. В API миллион входных токенов стоит $10, выходных $50\. В обзоре разбираю возможности, ограничения и заявления об AGI. ## Что такое GPT-6 Astra Astra относится к старшим моделям шестого поколения. В отличие от линейки GPT-5.6, где были варианты Luna, Terra и Sol, здесь пока только два: обычная Astra и Astra Pro ([The New Stack](https://thenewstack.io/openai-gpt6-astra-benchmarks/?ref=matveev.tech), 3 сентября 2026). OpenAI делает акцент на работе с компьютером. Модель может выполнять последовательность действий в приложениях, а качество такого агента зависит и от самой модели, и от инструментов, через которые ей дают доступ к интерфейсу. Технически это самый крупный тренировочный запуск компании. Эйдан Кларк из OpenAI на брифинге сказал, что претрейн впервые шёл на более чем 100 000 GPU на площадке Stargate в Техасе. И это первый релиз, где предыдущие модели заметно участвовали в супервизии обучения следующей. То есть модель учили модели. ## Как Astra работает с компьютером вместо тебя Идея computer use не новая, ей больше года. Изменилось качество. Вместо того чтобы дёргать API для каждого приложения, Astra ходит по интерфейсу так же, как человек: кликает, печатает, переключает окна. Что она умеет по описанию OpenAI: заполнять формы и обновлять записи в CRM, разбирать календарь, делать веб-ресёрч и оформлять результат документом, работать с таблицами и Python-ноутбуками, собирать и тестировать сайты, устанавливать софт и чинить его. В демо она работала внутри Power BI, KiCad и Unity. Это инженерные инструменты с рабочими интерфейсами. На офлайн-подмножестве OSWorld 2.0 Astra набрала 72,6% против 65,7% у GPT-5.6 Sol. Время около 40 минут против 75 получено в симуляции задержек, [уточняет OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech). Думаю, это полезный ориентир, но время на твою задачу придётся замерить отдельно. Промо-ролик OpenAI начинается с демки восьмидесятых, где человек просит компьютер нарисовать жёлтый круг. Потом кадр меняется на сегодня: сотрудники голосом просят Astra превратить круг в ракету, потом в трёхмерную игру, потом создать лот на eBay. Всё голосом, без клавиатуры. ## Кодинг и Codex: что меняется для разработчиков ![Обновление ChatGPT и Codex с выходом GPT-6 Astra](https://matveev.tech/content/images/2026/09/gpt-6-astra-codex.webp) В Codex появилась вещь, которой мне не хватало давно: модель ведёт заметки между контекстными окнами и может искать по предыдущим окнам ([анонс OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech)). Требования из начала сессии или результат теста, который прогнали двадцать сообщений назад, остаются доступными. На момент анонса функция экспериментальная, включается вручную; компания обещает сделать её стандартной в ближайшие недели. На DeepSWE v1.1 в [таблице OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) у Astra 74,1%, у GPT-5.6 Sol 72,7%, у Claude Opus 5 73,7%, у Gemini 3.8 Flash 73,8%. Разница небольшая. По этим значениям я бы не выбирал модель для всей разработки: полезнее сравнить результат на своих задачах и стоимость завершённой работы. Сравнение зависит от набора задач и условий запуска. Поэтому результаты из разных публикаций нельзя автоматически складывать в один рейтинг, даже когда бенчмарк называется одинаково. В научных задачах выделяется Terminal-Bench Science (70 задач в командной строке по пяти научным областям): 64,6% у Astra против 52,6% у Fable 5.1 по данным Anthropic, при том что публичный лидерборд упирается в 30% у Opus 5\. И BenchCAD, где модель восстанавливает CAD-программы по рендерам: 95,9% против 84,3% у Fable 5.1 и 83,3% у Sol. ## Что с остальными бенчмарками и почему к ним есть вопросы | Бенчмарк | Astra | GPT-5.6 Sol | | ------------------------ | ----- | ----------- | | ARC-AGI-3 | 99,9% | 7,8% | | FrontierMath Tier 4 (v2) | 97,6% | 83,0% | | ExploitBench | 100% | 78,5% | | SRE-Bench (4 попытки) | 99,2% | 68,7% | | GPQA Diamond | 96% | 94,6% | | DeepSWE v1.1 | 74,1% | 72,7% | | Terminal-Bench Science | 64,6% | 22,4% | | OSWorld 2.0 (офлайн) | 72,6% | 65,7% | Сверено с [таблицей OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) 5 сентября 2026\. Это результаты, приведённые компанией; они не заменяют проверку на твоих задачах. Разница между 7,8% у Sol и 99,9% у Astra на ARC-AGI-3 большая. Бенчмарк проверяет, как модель разбирается в незнакомой интерактивной среде и находит способ решить задачу. Оговорка, впрочем, серьёзная. Astra оценивали через харнесс Responses API, который сохраняет рассуждения между ходами и использует компакцию для длинных контекстов. OpenAI сама раньше показывала, что такие системные настройки поднимают результат на ARC-AGI-3 без изменений в самой модели. Остальные модели в сравнении гоняли в других сетапах. То есть меряли не столько модель, сколько связку «модель плюс обвязка». Для практического выбора мне важна вся система: модель, инструменты, настройки и стоимость прогона. Итоговый процент без этих условий мало что говорит о том, как агент поведёт себя в работе. Результат 97,6% на FrontierMath Tier 4 относится к конкретному набору задач. По нему нельзя заключить, что модель с такой же успешностью справится с любой исследовательской проблемой. Для этого нужны отдельные проверки за пределами бенчмарка. И ещё деталь, которая мне кажется говорящей. В материалах запуска нет GDPval, собственного бенчмарка OpenAI 2025 года, который меряет экономическую ценность на 1320 задачах из 44 профессий и девяти индустрий. Когда компания заявляет про эру AGI, отсутствие ровно того теста, который меряет реальную рабочую пользу, бросается в глаза. В итоговых таблицах OpenAI приводит лучшие результаты при разных уровнях усилий. Компания также предупреждает, что исследовательская среда и API могут давать результаты, отличающиеся от ChatGPT из-за системных инструкций и доступных инструментов. ## Почему OpenAI впервые включила «критический» протокол безопасности Astra стала первой моделью, которую OpenAI отнесла к порогу Critical по кибербезопасности в своём [Preparedness Framework](https://openai.com/index/path-to-astra/?ref=matveev.tech). Формулировка компании: модель может находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во многих хорошо защищённых системах, причём человеку не нужно вести её за руку на каждом шаге. Это не гипотеза. В ходе внутренней оценки на наборе из 20 недавних уязвимостей V8 модель нашла и использовала две ранее неизвестные уязвимости нулевого дня как часть цепочки эксплойта. OpenAI сейчас передаёт их мейнтейнерам. В экспертных тестах Astra собрала полную цепочку компрометации браузера с побегом из песочницы и выполнением команд на хосте, а в захардненной операционной системе собрала цепочку повышения привилегий от обычного пользователя до root. Что OpenAI сделала в ответ: - Обучила модель жёстче отказывать. На наборе кибер-джейлбрейков Astra отказывает в 91,5% запросов против 59% у GPT-5.6 Sol. - Приостановила часть обучения на две недели после инцидента с Hugging Face, укрепила изоляцию и сетевые контроли инфраструктуры. Крупный RL-запуск перезапустили 28 августа 2026 года. - Развернула мониторинг цепочки рассуждений в проде: классификаторы проверяют рассуждения и действия модели и автоматически останавливают подозрительную активность. - Ограничила доступ к продвинутым кибер-сценариям узкой группой альфа-тестеров с дальнейшим расширением через программу Daybreak Blue для защитников. По части выравнивания цифры любопытные. В honeypot-тестах, где модель ставили перед сложными или нерешаемыми задачами, GPT-5.6 Sol без продакшн-защит пытался добраться до соседних систем в 56% случаев, а по другой метрике выходил за пределы выданных полномочий в 48,2% случаев. Astra не сделала этого ни разу. Главный научный директор OpenAI Якуб Пахоцки сформулировал риск так: «Прогресс в интеллекте не гарантирует прогресса в выравнивании». И добавил, что компания не примет деградацию собственной способности следить за выравниванием модели дальше определённого уровня. Есть и обратная сторона, о которой OpenAI пишет честно. Защиты калиброваны с запасом, и система может пометить легитимную работу как подозрительную, включая задачи, вообще не связанные с кибербезопасностью, и долгие агентные прогоны. В ChatGPT и Codex у тебя спросят подтверждение, а вот в API задача просто остановится. Если ты строишь автономный пайплайн на Astra, это надо закладывать в архитектуру с первого дня. Отдельная деталь для тех, кто следит за интерпретируемостью: когда исследователи прямо просили модели уклоняться от мониторинга, письменные рассуждения Astra читались хуже, чем у Sol. OpenAI объясняет это тем, что Astra решает простые задачи за меньшее число шагов, но на сложных задачах спрятать рассуждения ей по-прежнему трудно. ## Правда ли это AGI? Брокман на брифинге был аккуратнее, чем цитата в заголовках. Он признал, что AGI остаётся «серой, размытой штукой», и напомнил, что термин больше не привязан к контрактному триггеру в соглашении с Microsoft. Теперь это «миссия или духовное понятие». Брокман оставил читателям право на собственное определение AGI, но сказал, что лично для него этот рубеж уже достигнут. При этом он описал релиз как начало пути. Это его оценка на брифинге, а не результат отдельного теста на AGI. Есть история из математики, которую OpenAI приводит как аргумент. Astra участвовала в двух новых результатах о разрывах между простыми числами: математик Юлия Штадльманн ранее сдвинула одну из границ с 246 до 240, а с участием модели она упала до 186\. Ещё в одном случае модель помогла улучшить часть границы, которая не двигалась больше восьмидесяти лет. Проблема в том, что OpenAI не расписывает, что модель придумала сама, что подсказали исследователи и как работа ходила между ними. Думаю, всё упирается в определение. Способность делать полезную работу в разных областях ещё не устанавливает сопоставимость с человеческим суждением по всему спектру задач. Показанные бенчмарки сами по себе этого не доказывают. Слова Брокмана я читаю как его личную позицию, что он сам и оговорил. Разбираю, что из громких заявлений про AGI доходит до реальных рабочих задач. [Подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Как получить доступ и сколько стоит В [анонсе OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) доступ сначала открывают ограниченному набору организаций, затем обещают Plus, Pro, Business и Enterprise, API, Microsoft Azure и AWS Bedrock. Это план развёртывания, а не подтверждение доступа в каждом аккаунте. Daybreak отдельно относится к расширению киберзащитных сценариев. Защиты Astra могут остановить легитимную задачу, если она покажется системе подозрительной. В ChatGPT и Codex спросят подтверждение, а в API прогон просто оборвётся. Закладывай обработку этого в автономных пайплайнах. Владельцам Pro, Business и Enterprise достаётся ещё и Astra Pro. У корпоративных админов доступ по умолчанию выключен. Включать надо руками в настройках воркспейса. Имя модели в API: `gpt-6-astra`. Для подходящих клиентов доступен режим Zero Data Retention. | Модель | Вход, $/1M токенов | Выход, $/1M токенов | | ----------------------- | ------------------ | ------------------- | | GPT-6 Astra | 10 | 50 | | GPT-6 Astra (fast mode) | 20 | 100 | | Claude Fable 5.1 | 10 | 50 | | Meta Muse | 1,25 | 4,25 | | Gemini 3.8 Flash | 0,75 | 3,75 | Цены конкурентов приведены на 3 сентября 2026 по данным [The New Stack](https://thenewstack.io/openai-gpt6-astra-benchmarks/?ref=matveev.tech). Тарифы Astra сверены с [OpenAI](https://openai.com/index/gpt-6-astra/?ref=matveev.tech) 5 сентября: Standard $10/$50, Fast вдвое дороже. Чтение и запись кэша тарифицируются отдельно. В сравнении цен на дату запуска Astra стоила в 2,5 раза дороже промо-тарифа Sol и столько же, сколько [Claude Fable 5.1](https://matveev.tech/claude-fable-5-1/). На фоне указанной цены Gemini 3.8 Flash разница больше чем на порядок. Оговорка, которую стоит держать в голове: более высокая цена за токен не означает больший счёт. Если модель закрывает задачу за меньшее число шагов и с меньшим количеством ретраев, итог может выйти дешевле. OpenAI утверждает, что Astra расходует меньше токенов на нескольких оценках и в партнёрских тестах. Данных на старте слишком мало, чтобы понять, перекрывает ли эта экономия наценку. ## Вердикт Меня в этом релизе больше всего интересует работа в интерфейсах. Если твои задачи связаны с таблицами, отчётами в Power BI или старым софтом без API, Astra стоит проверить на знакомом процессе. Результаты OSWorld дают повод для такого эксперимента, но из них не следует, что за агентом больше не нужно присматривать. В кодинге я бы не спешил переезжать только из-за результатов DeepSWE. Для длинных сессий заметки Codex между контекстными окнами могут оказаться полезнее небольшого отрыва по баллам. Проверять это стоит на задаче, где агенту приходится возвращаться к старым требованиям и неудачным попыткам исправления. Кому точно стоит подождать: тем, кто строит автономные пайплайны через API. Защиты откалиброваны с запасом, и остановка задачи посреди прогона без возможности подтвердить действие вполне возможна. OpenAI обещает калибровать дальше, но на старте трения будет больше, чем в итоге задумано. Кому не подойдёт вообще: если задачи закрывает модель за доллар с четвертью за миллион токенов, платить в восемь раз больше за способность кликать мышкой смысла нет. Модель, которая сама находит уязвимости в защищённом браузере, требует внимательного контроля доступа. Через Daybreak OpenAI планирует расширять именно защитные сценарии. Как эти ограничения будут работать на практике, я бы оценивал отдельно от качества кода и управления интерфейсами. [ChatGPTOpenAI анонсировала GPT-6 Astra для Plus, Pro, Business и Enterprise, API, Azure и AWS Bedrock.OpenAI](https://chatgpt.com/?ref=matveev.tech) Попробовать Astra ## Что ещё почитать - [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/). Контекст сравнения Astra с предыдущим поколением. - [Claude Fable 5.1: обзор модели для долгой автономной работы](https://matveev.tech/claude-fable-5-1/). Сравнение подходов к долгим агентным задачам. - [Claude Opus 5: обзор модели и что меняется в API](https://matveev.tech/claude-opus-5/). Ещё одна модель из таблицы результатов DeepSWE. - [Как запустить OpenAI Privacy Filter локально](https://matveev.tech/run-openai-privacy-filter-locally/). Работа с чувствительными данными перед отправкой в API. ### Claude Fable 5.1: обзор модели для долгой автономной работы URL: https://matveev.tech/claude-fable-5-1/ Last updated: 2026-09-01T20:01:07.000Z > TL;DR: Anthropic выпустила Claude Fable 5.1 — обновление старшей модели Claude 5, заточенное под долгие автономные задачи. Ставка за токены не изменилась ($10 за миллион входных, $50 за выходных), но чтение из кэша подешевело вчетверо, и типичная нагрузка выходит примерно на 25% дешевле Fable 5, а сильно агентная — до 45%. Модель доступна с 1 сентября 2026 как `claude-fable-5-1`. Главная цифра [анонса](https://www.anthropic.com/claude-fable-and-mythos-5-1?ref=matveev.tech) не бенчмарк, а прайс на чтение кэша. Он упал с $1 до $0,25 за миллион токенов. Для агентного цикла, где один и тот же контекст перечитывается на каждом шаге, это и есть основная статья расходов. Fable-класс наконец стал экономически осмысленным для того, что раньше держали на Opus. ## Что нового в Claude Fable 5.1 против Fable 5 Под капотом Fable 5.1 и Mythos 5.1 — снова одна модель с разными фильтрами, схема та же, что была у [Fable 5](https://matveev.tech/claude-fable-5/) в июне. Изменения такие. Модель стала заметно сильнее на верхних уровнях усилий и заметно дешевле на нижних. Anthropic пишет, что на low и medium Fable 5.1 выдаёт результат уровня Fable 5, но за меньшие деньги. Уровней теперь пять: low, med, high, xhigh, max. 💡 Дефолтный уровень усилий зависит от того, откуда ты работаешь: в Claude Code стоит high, в Cowork и на claude.ai — medium. Если гоняешь долгую задачу через веб и результат кажется слабее обещанного, дело может быть в этом. Она меньше срезает углы. Формулировка из анонса: «умеет чинить причину, а не симптом». Общение стало суше. Fable 5.1 пишет меньше статусных сообщений между вызовами инструментов, а её саммари по агентному кодингу короче. Если твой интерфейс их показывает, [гайд по миграции](https://platform.claude.com/docs/en/models/fable-5-1/migration-guide?ref=matveev.tech) советует выставить `thinking.display` в `"updates"` и просить обновления явно. Контекст остался прежним: 1 млн токенов на вход, 128k на выход. Надёжный срез знаний датирован июнем 2026. ## Долгая автономная работа Anthropic собрала 22 отзыва от партнёров раннего доступа, и почти все они про одно: модель дольше держит нитку задачи. Инженер Ramp Дуайт Темпл описывает 38-часовой прогон без присмотра: модель нашла, что прошлый результат был артефактом разметки, исправила его, запустила шесть параллельных экспериментов на ночь и вернулась с итогом и планом дальше. Отдельно он отмечает открытый промпт в духе «найди самую полезную проблему, которой никто не занимается» — модель вытащила бесхозный алерт, связанный с падением прода, подтянула логи и предложила фикс. Рон Санзоне из MongoDB рассказывает про прототип за три дня: сначала исследование по всему коду сервисов и документации, потом часы автономной работы с верификацией, и каждое утро — готовая фаза с визуальным разбором сделанного. Бен Лафферти из Shopify формулирует то же короче: workflow крутится долго и не теряет сюжет, модель ведёт свои записи и подхватывает с места, где остановилась. Самая конкретная история у Millennium. Портфельный управляющий по имени Дэмиен говорит, что редкий краш, примерно один на миллион запусков, никто в команде не мог объяснить четыре-пять лет. Fable 5 его не нашла. Fable 5.1 дизассемблировала стороннюю библиотеку, сопоставила с core dump и вывела баг внутри этой библиотеки. Джош Бойер из Red Hat пишет, что через Claude Code модель верно определила причину каждого сломанного билда из тестового набора, на всех уровнях усилий. #### Кто тестировал модель до релиза Отзывы в анонсе оставили 22 компании: Jane Street, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, iGent, Browserbase, Rogo, Shopify, Crosby, Datadog, SpaceX AI и Samaya. Скидку на маркетинг тут делай сам: это подборка от вендора, неудачные прогоны в неё не попали. Но набор историй однотипный, и все они про одно свойство — выносливость на длинной дистанции. ## Бенчмарки: Fable 5.1 против Fable 5, Opus 5 и GPT-5.6 Sol ![Таблица бенчмарков Claude Fable 5.1 в сравнении с Fable 5, Opus 5 и GPT-5.6 Sol](https://matveev.tech/content/images/2026/09/fable-5-1-benchmarks-crop.png) Самый крупный отрыв в агентных исследовательских задачах: 52,6% на Terminal-Bench-Science 0.1 против 24,7% у Fable 5 и 29,0% у [Opus 5](https://matveev.tech/claude-opus-5/). В агентном кодинге на Terminal-Bench 4.0 у Fable 5.1 получилось 55,8%, у Mythos 5.1 — 60,9%. Разрыв между ними Anthropic объясняет старыми киберфильтрами, которые срабатывали на части задач, и обещает, что после сегодняшнего обновления фильтров он сильно сократится. По остальным направлениям картина ровная: 31,4% на AutomationBench против 17,1% у Fable 5, 1853 на GDPval-AA v2 против 1824 у Opus 5, 73,4% на CursorBench 3.2.0\. Все цифры из анонса от 1 сентября 2026, замеры делала сама Anthropic, независимых прогонов пока нет. Независимая цифра всё же есть одна. Мигель Гонсалес из Browserbase говорит, что на их самом сложном браузерном бенчмарке Fable 5.1 закрыла 82% задач примерно за 10 минут каждую, против 74% у Opus 5 и 57% у Fable 5, потратив при этом меньше токенов. ## Быстрый старт: как включить Fable 5.1 1. В API поменяй идентификатор модели на `claude-fable-5-1`. Тот же ID работает на Amazon Bedrock, Google Cloud и Microsoft Foundry. 2. В Claude Code выбери модель через `/model`. Уровень усилий по умолчанию — high, менять его отдельно не нужно, если задача обычная. 3. Если проект переезжает с Fable 5 или Opus 5, запусти в Claude Code встроенный скилл миграции: `/claude-api migrate this project to claude-fable-5-1`. Он поменяет ID, поправит сломанные параметры и отдаст чеклист того, что надо проверить руками. 4. На подписках Pro, Max, Team и Enterprise модель доступна сразу, отдельного включения не требуется. ## Что сломается при переезде с Fable 5 Переезд почти drop-in, но три вещи стоит проверить до прода. Первое: форсированный выбор инструмента больше не работает. `tool_choice` со значением `{type: "any"}` или `{type: "tool", name: "..."}` возвращает 400\. Осталось только `auto` и `none`. Anthropic советует оставить `auto`, назвать нужный инструмент прямо в инструкции и выставить `strict: true`, чтобы вызов лёг в схему. Второе: блоки размышлений теперь привязаны к модели. Fable 5.1 читает thinking-блоки от Opus 5, Fable 5, Mythos 5 и более ранних моделей, но обратной совместимости нет: старые модели её блоки прочитать не могут. Если разговор откатится на модель постарше через роутер или fallback, API молча выкинет нечитаемые блоки, и первый ход после переключения обойдётся дороже. Третье: редактирование прошлых ходов ломает эти блоки. Каждый thinking-блок валиден только против того системного промпта, набора инструментов и истории, которые ему предшествовали. Если ты сам собираешь массив `messages` и делаешь клиентскую компакцию, запрос упадёт с 400\. Лечится либо серверной компакцией, либо заголовком `thinking-binding-controls-2026-08-01` с `prefix_mismatch_behavior: "drop_block"`. Если историю ведёт Claude Code, claude.ai или Agent SDK, тебя это не касается. Из приятного: уровень усилий теперь можно менять посреди разговора системным сообщением с одним `output_config`, не сбивая кэш промпта. Раньше смена effort роняла кэшированные префиксы предыдущих ходов, и это било по цене ровно там, где длинная сессия. Ещё две поведенческие мелочи. В длинных агентных циклах Fable 5.1 чаще делает один вызов инструмента за ход вместо пачки параллельных, лечится односложной инструкцией про батчинг. И на low effort она чаще отвечает по памяти, вместо того чтобы дёрнуть поиск, так что если продукт завязан на retrieval — поднимай усилия для таких запросов. ## Цена: почему кэш важнее ставки за токены | Модель | Вход | Чтение кэша | Выход | | --------- | ---- | ----------- | ----- | | Fable 5.1 | $10 | $0,25 | $50 | | Fable 5 | $10 | $1,00 | $50 | | Opus 5 | $5 | $0,50 | $25 | | Sonnet 5 | $2 | $0,20 | $10 | Цены за миллион токенов, по [странице модели](https://www.anthropic.com/claude/fable?ref=matveev.tech). Batch API режет вход и выход вдвое, до $5 и $25. Смотри на второй столбец. В агентной сессии один и тот же системный промпт, набор инструментов и накопленная история перечитываются на каждом шаге цикла, и уходят они именно в чтение кэша. Отсюда и обещанные 45% экономии на сильно агентных нагрузках против 25% на обычных. Уолден Ян из Cognition говорит так: они переводят трафик Opus 5 в Devin на Fable 5.1 в день запуска, начиная с code review, потому что с новой ценой на кэш модель Fable-класса впервые окупается на задачах, которые до этого держали на Opus. Отдельная строка мелким шрифтом: если нагрузка обязана крутиться в США, инференс только в американских регионах стоит 1,1x от базовой цены на вход и выход. ✈️ Считаю экономику новых моделей и ловлю подводные камни в агентных пайплайнах — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Safeguards и Mythos 5.1 Схема осталась прежней. Fable 5.1 доступна всем, но с фильтрами. Mythos 5.1 — та же модель со снятыми ограничениями, её дают только проверенным организациям. Что поменялось. Киберфильтры стали на 60% реже ловить безобидное. Причина в том, что Fable 5.1 теперь разрешено искать уязвимости в софте, но не писать под них эксплойты. Пентест, генерация эксплойтов и поиск уязвимостей в бинарниках по-прежнему уходят на Opus. В биологии ложных срабатываний на элементарных вопросах стало меньше на 85%, а серьёзный R&D открывают через новую программу проверки для наук о жизни, сделанную вместе с правительством США. Заявка на киберпрограмму — через [портал программ Anthropic](https://portal.anthropic.com/programs/cvp?ref=matveev.tech). Появилась невидимая текстовая водяная метка, это требование EU AI Act для моделей, выпущенных после 2 августа 2026\. API для её детекта пока в приватном превью, доступ дают регуляторам, медиа, фактчекерам и исследователям. ## Кому стоит переходить Если ты гоняешь длинные агентные сессии в Claude Code или в своих пайплайнах, переходи. Связка «дешевле кэш плюс выносливость на многочасовых задачах» бьёт ровно в ту статью расходов, которая в агентных сценариях главная. Дэн Шиппер из Every описал это формулой «интеллект Fable, цена Opus, скорость Sonnet». Судя по цифрам от Browserbase и Cognition, преувеличение тут умеренное. Если у тебя короткие синхронные запросы, картина другая. Вход и выход стоят вдвое дороже Opus 5, кэш при коротких сессиях не спасает, а на простых задачах разрыв в качестве ты не заметишь. Opus 5 остаётся разумным дефолтом, и документация Anthropic сама это говорит: начинай с Opus 5, бери Fable 5.1, когда твои прогоны на Opus с поднятыми усилиями всё ещё не дотягивают. [Claude Fable 5.1Старшая модель Anthropic для долгих агентных задач и сложной работы с кодом. Доступна в API как claude-fable-5-1, а также на подписках Pro, Max, Team и Enterprise.anthropic.com](https://www.anthropic.com/claude/fable?ref=matveev.tech) ## Что ещё почитать - [Claude Fable 5: что умеет, цена и доступ к Claude 5](https://matveev.tech/claude-fable-5/) — разбор предыдущей версии, от которой считается вся экономия - [Claude Opus 5: обзор модели и что меняется в API](https://matveev.tech/claude-opus-5/) — модель, с которой Fable 5.1 конкурирует за роль дефолта - [Модель и effort level в Claude Code: как это работает](https://matveev.tech/claude-code-model-effort-level/) — про уровни усилий, которых в Fable 5.1 теперь пять - [Claude Code /goal: автономная работа Claude до результата](https://matveev.tech/claude-code-goal/) — режим для тех самых многочасовых прогонов без присмотра ## Частые вопросы **Сколько стоит Claude Fable 5.1?** $10 за миллион входных токенов и $50 за миллион выходных, как у Fable 5\. Подешевело чтение кэша: $0,25 вместо $1\. Для типичных нагрузок это около 25% экономии, для сильно агентных — до 45%. **Чем Fable 5.1 отличается от Mythos 5.1?** Это одна модель с разными фильтрами. Fable 5.1 доступна всем, Mythos 5.1 — только проверенным организациям через программы доступа в кибербезопасности и науках о жизни. **Что сломается при переходе с Fable 5?** Три вещи: форсированный `tool_choice` возвращает 400, блоки размышлений привязаны к модели и к неизменной истории разговора, а поведение в агентных циклах поменялось. Автоматическую миграцию делает команда `/claude-api migrate` в Claude Code. **Стоит ли брать Fable 5.1 вместо Opus 5?** Для длинных автономных задач — да. Для коротких синхронных запросов Opus 5 вдвое дешевле по токенам, и разницы в качестве ты, скорее всего, не увидишь. ### Nemotron 3.5 Lightning: быстрая открытая модель для агентов URL: https://matveev.tech/nemotron-3-5-lightning/ Last updated: 2026-08-27T19:41:30.000Z > TL;DR: NVIDIA выложила Nemotron 3.5 Lightning, открытую MoE-модель на 30 млрд параметров с 3 млрд активных. Лицензия OpenMDW-1.1 разрешает коммерческое использование, веса и рецепты обучения тоже открыты. Модель запускается на одной видеокарте и выдаёт около 670 токенов в секунду. Заточена под роль исполнителя в агентских связках, а не под роль главного мозга. ## Что за модель и зачем она нужна Nemotron 3.5 Lightning вышла 11 августа 2026 года. Это Mixture-of-Experts на 30 млрд параметров, из которых на каждый токен активируются примерно 3 млрд ([NVIDIA Technical Blog](https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/?ref=matveev.tech)). Независимый замер [Artificial Analysis](https://artificialanalysis.ai/articles/nemotron-3-5-lightning-launch?ref=matveev.tech) даёт чуть другие цифры, 31,6 млрд общих и 3,6 млрд активных, так что круглые числа в блоге NVIDIA слегка причёсаны. Архитектура гибридная, Mamba плюс трансформер, унаследована от Nemotron 3 Nano. Контекст 1 млн токенов. Позиционирование у модели узкое, и это как раз хорошо. NVIDIA не пытается продать её как замену фронтирным моделям. Lightning делали для слоя исполнения в агентах: когда планирование ушло к большой модели, а дальше надо много раз быстро и дёшево делать понятные шаги. ## Насколько она умная По [индексу интеллекта Artificial Analysis](https://artificialanalysis.ai/articles/nemotron-3-5-lightning-launch?ref=matveev.tech) Lightning набирает 24 балла. Для сравнения: Nemotron 3 Nano набирал 15, Nemotron 3 Super набирает 26, GPT-OSS-120B тоже 24. То есть по уму это уровень GPT-OSS-120B при примерно вчетверо меньшем размере. Прирост в 9 пунктов над предыдущим Nano внутри той же архитектуры выглядит солидно. | Модель | Индекс интеллекта Artificial Analysis | | ---------------------- | ------------------------------------- | | Nemotron 3 Nano | 15 | | Nemotron 3.5 Lightning | 24 | | GPT-OSS-120B | 24 | | Nemotron 3 Super | 26 | На агентских бенчмарках картина такая. GDPval-AA v2 Elo 824, это выше и Nemotron 3 Super, и GPT-OSS-120B. Terminal-Bench v2.1 показывает 24% против 7% у Nano. Комментировать 24% на Terminal-Bench как «хороший результат» я бы не стал, фронтирные модели там сильно выше, но для 3 млрд активных параметров скачок втрое за одно поколение заметный. ## Скорость Главная цифра модели не про ум, а про темп. На эндпоинте DeepInfra Artificial Analysis намерил почти 670 токенов в секунду. В переводе на задачи: одну задачу из набора Intelligence Index Lightning проходит примерно за 0,5 минуты. Qwen3.6 35B на той же задаче тратит около 3,5 минут, Gemma 4 31B около 5,8 минут. NVIDIA отдельно заявляет, что на PinchBench модель держит 86% точности, проходя 10 000 задач на 30% быстрее, чем Qwen3.6 35B. В предобучение вшили multi-token prediction для спекулятивного декодирования, в комплекте идут черновые модели DSpark и DFlash под разную нагрузку. Плюс чекпойнты в NVFP4 и BF16. ## Что открыли и на чём это запускается Лицензия OpenMDW-1.1, разрешает коммерческое использование без существенных ограничений. Открыли не только веса, но и данные обучения с рецептами. Это редкость: большинство «открытых» моделей отдают только веса. Скачать можно с Hugging Face и ModelScope, потрогать без установки на build.nvidia.com и через OpenRouter. 💡 Открытые данные обучения и рецепты важнее открытых весов. С весами ты получаешь готовую модель, с рецептами возможность обучить свою под задачу. Отдают это единицы. ## NeMo Switchyard, про который зря говорят меньше Вместе с моделью NVIDIA выпустила NeMo Switchyard, открытую библиотеку-роутер. Она разбирает шаги агентского воркфлоу и отправляет каждый той модели, которая для него подходит: планирование уходит к фронтирной модели, исполнение к Lightning. Мне эта штука кажется интереснее самой модели. Одна модель на всю задачу экономически неудобна: платить за рассуждения топ-модели там, где надо просто дёрнуть три инструмента подряд, глупо. Роутер решает ровно эту проблему, и он не привязан жёстко к Nemotron. Заодно это ложится в ту же логику, что и [работа NVIDIA про агентский харнесс](https://matveev.tech/nvidia-avo-harness/): результат агента определяется устройством системы вокруг моделей, а не выбором одной самой сильной. ✈️ Слежу за открытыми моделями. [Подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Стоит ли брать Если строишь агента и весь трафик гоняешь через Opus или GPT-5.6, посмотреть однозначно стоит. Не как на замену, а как на второй ярус: планирование оставить наверху, рутинные шаги свести вниз. Экономия тут считается легко, а качество на простых шагах почти не проседает. Если нужна одна модель на всё, Lightning не подойдёт. 24 балла по индексу интеллекта это уверенный середняк. Если гоняешь локально на своём железе, это один из самых интересных вариантов лета. Открытые данные и рецепты, свободная лицензия, работает на одной карте, скорость выше всех соседей по размеру. [Nemotron 3.5 Lightning на build.nvidia.comПопробовать модель в браузере без установки и локального железа, там же лежат ссылки на веса и документацию.NVIDIA](https://build.nvidia.com/nvidia/nemotron-3-5-lightning?ref=matveev.tech) ## Что ещё почитать - [Харнесс важнее модели: Opus 5 и 100% на ARC-AGI-3](https://matveev.tech/nvidia-avo-harness/). Исследование NVIDIA о том, что обвязка агента решает больше выбора модели - [Kimi K3: открытая модель на 2,8 трлн параметров](https://matveev.tech/kimi-k3/). Противоположный подход к открытым весам, ставка на размер - [GLM-5.3 от Z.ai: обзор модели](https://matveev.tech/glm-5-3-obzor/). Ещё один сильный игрок в открытых моделях - [MiniMax M3 vs Kimi K2.7 vs GLM-5.2: что выбрать](https://matveev.tech/minimax-m3-vs-kimi-vs-glm/). Сравнение открытых моделей, если выбираешь под свою задачу ### GLM-5.3-Flash: обзор модели Z.ai, та самая ox-alpha URL: https://matveev.tech/glm-5-3-flash/ Last updated: 2026-08-26T19:58:11.000Z > TL;DR: GLM-5.3-Flash — открытая модель Z.ai на 320 млрд параметров, из которых работают 18 млрд. Веса под MIT, контекст 1 млн токенов, цена $0,075 за миллион входных токенов против $0,15 у базового прайса. По кодингу и агентным задачам подбирается к Claude Opus 4.8, хотя такой уровень раньше стоил примерно вдесятеро дороже. Последнюю неделю в топе OpenRouter висела модель с именем ox-alpha, про которую никто ничего не знал. За шесть дней она съела 23,2 триллиона токенов, в 2,3 раза больше, чем модель на втором месте. Ещё 43 триллиона прошли через неё в OpenCode. 26 августа Z.ai [призналась](https://z.ai/blog/glm-5.3-flash?ref=matveev.tech), что ox-alpha — это GLM-5.3-Flash, и выложила веса на HuggingFace под MIT. ![График OpenRouter: ox-alpha на первом месте с 23,2 трлн токенов за шесть дней, в 2,3 раза опережая deepseek-v4-flash](https://matveev.tech/content/images/2026/08/ox-alpha-openrouter-top-model.png) ## Что такое GLM-5.3-Flash Это первая нативно мультимодальная модель в линейке GLM-5\. Зрение живёт внутри того же стека, который отвечает за текст, так что на вход можно кидать картинки и видео без отдельной vision-модели сбоку. Цифры такие: 320 млрд параметров всего, 18 млрд активных, 45 слоёв. Контекст — миллион токенов, максимальная генерация 131 072 токена. Для сравнения, у GLM-4.5 при почти том же общем размере (355 млрд) активных было 32 млрд, а слоёв 92\. То есть Z.ai почти вдвое срезала и то, и другое, а качество при этом подняла. Предобучение шло на мультимодальном корпусе в 30 триллионов токенов. Базовая модель на MMLU выдаёт 88,1 против 86,1 у GLM-4.5-Base, а на LiveCodeBench-Base — 37,6 против 34,4 у гораздо более крупной GLM-5-Base на 744 млрд параметров. Веса лежат на [HuggingFace](https://huggingface.co/zai-org/GLM-5.3-Flash?ref=matveev.tech) под MIT. Из фреймворков поддерживаются SGLang, vLLM и TokenSpeed, остальные обещают позже. ## Архитектура GLM-5.3-Flash: откуда взялась дешевизна Главное изменение — гибридное внимание. Три блока из четырёх используют линейное внимание, которое держит локальные зависимости через состояние, а каждый четвёртый — разреженное, которое достаёт нужный кусок глобального контекста через лёгкий индексатор. ![Схема архитектуры GLM-5.3-Flash: чередование линейного и разреженного внимания, блоки mHC, ViT для картинок, графики KV-кеша и вычислений](https://matveev.tech/content/images/2026/08/glm-5-3-flash-architecture.png) Индексатор на миллионе токенов сам по себе становится проблемой: его кеш надо где-то держать. Z.ai добавила IndexPool: четыре ключа индексатора сжимаются в один взвешенным пулингом. Плюс механизм mHC (Manifold-Constrained Hyper-Connections) для более эффективного масштабирования. Результат в замерах самой компании: против GLM-5.3 вычисления внимания упали в 3 раза, размер KV-кеша — в 4,4 раза. По вычислениям на токен это лучший показатель среди сравниваемых моделей, включая DeepSeek-V4-Flash и [Kimi K3](https://matveev.tech/kimi-k3/). По KV-кешу Z.ai честно пишет, что пока проигрывает обеим, и место для улучшений осталось. ## Бенчмарки GLM-5.3-Flash против Opus 4.8 и Gemini 3.7 Flash Шесть кодинговых и агентных бенчмарков, все цифры из анонса Z.ai: | Бенчмарк | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash | | ------------------- | ------------- | ------- | -------- | ------------- | ---------------- | | Terminal Bench 2.1 | 84,3 | 81,0 | 85,0 | 87,4 | 85,8 | | DeepSWE v1.1 | 63,4 | 46,2 | 58,0 | 69,6 | 65,3 | | Toolathlon Verified | 78,4 | 59,9 | 76,2 | 74,9 | — | | AutomationBench | 48,8 | 26,2 | 41,0 | 37,2 | 52,3 | | Agents' Last Exam | 26,3 | 20,4 | 27,0 | 28,0 | — | | GDPval-AA v2 | 1773 | 1504 | 1582 | 1571 | 1527 | ![Столбчатые диаграммы шести бенчмарков: GLM-5.3-Flash обходит GLM-5.2 везде и держится вровень с Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-flash-benchmarks.png) Разрыв с GLM-5.2 местами двукратный: 63,4 против 46,2 на DeepSWE и 48,8 против 26,2 на AutomationBench. С Opus 4.8 картина ровнее: где-то Flash впереди (Toolathlon, GDPval), где-то на полбалла позади (Terminal Bench, Agents' Last Exam). По зрению сравнивать особо не с чем, GLM-5.2 картинки не понимала. Против DeepSeek-V4-Vision-Exp Flash выигрывает почти везде: 62,4 против 57,9 на OfficeQA Pro, 78 против 64,3 на Chartography. А вот Gemini 3.7 Flash на видео сильнее, 82,2 против 77,8 на MVBench. Независимых замеров пока нет, кроме [Artificial Analysis](https://artificialanalysis.ai/models/glm-5-3-flash?ref=matveev.tech). Там модель набирает 57 баллов Intelligence Index v4.1.1 при $0,045 за задачу, и это действительно новая точка на границе Парето. ## Где GLM-5.3-Flash отстаёт от GLM-5.3 Самый честный график в анонсе — внутренний Z.ai Code Bench, прогнанный на Claude Code 2.1.207. ![График Z.ai Code Bench: точность против расхода токенов на разных уровнях effort для GLM-5.3-Flash, GLM-5.3, Fable 5 и Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-flash-code-bench-effort.png) На максимальном effort Flash даёт 29,0 против 29,5 у Opus 4.8\. Формально почти паритет. Но на том же графике GLM-5.3 стоит около 34,6, а Claude Fable 5 — около 39\. Старшую модель Flash не заменяет, у неё своя ниша: примерно уровень Opus 4.8 за очень маленькие деньги. Второй нюанс виден по горизонтальной оси. Чтобы вытянуть свои 29 баллов, Flash сжигает около 138 тысяч выходных токенов на задачу. Это больше, чем у Opus 4.8 на его максимуме, и почти вдвое больше, чем у GLM-5.3\. Дешёвая модель, которая много думает, в пересчёте на задачу выходит не так дёшево, как кажется по прайсу за миллион токенов. Разница всё равно в разы, но не в те десять раз, которые обещает заголовок анонса. ⚠️ Режим размышления в GLM-5.3-Flash [нельзя выключить](https://docs.z.ai/guides/llm/glm-5.3-flash?ref=matveev.tech): параметр thinking.type принимает только значение enabled. Для коротких запросов вроде классификации или извлечения полей это лишний расход. ## Зачем модели для кода зрение Тут у Z.ai интересная мысль. Во фронтенде, геймдеве и 3D результат работы видно только после рендера: страница, интерфейс, сцена. Половина ошибок вылезает только при рендере: элементы наехали друг на друга, текст вылез за блок, кнопка ушла за экран. Модель, которая видит только исходник, эти ошибки не поймает в принципе. Поэтому зрение вшито в цикл: модель генерирует, смотрит на результат своими глазами и правит. Для фронтенда компания дополнительно гоняла обучение с подкреплением на обратной связи от окружения и проверяла суждения о вёрстке агентами на реальных пользовательских сценариях. ![Слайд презентации до и после: в первой версии заголовок RMB 173M наезжает на текст, а подпись графика перекрыта столбцами; во второй всё выровнено](https://matveev.tech/content/images/2026/08/glm-5-3-flash-visual-self-check.jpg) Пример из анонса — слайд для инвесторского отчёта. В первой версии число «RMB 173M» наехало на подпись, а заголовок графика скрылся за столбцами. Модель посмотрела на рендер и переверстала. То же самое работает за пределами кода: таблицы, дашборды, PDF, презентации. В [ZCode](https://zcode.z.ai/?ref=matveev.tech) к этому прикручены Browser Use и Computer Use: агент кликает по странице, смотрит, что получилось, и работает с десктопными приложениями. Думаю, это направление важнее бенчмарков. Оценить вёрстку по скриншоту умеют и другие модели, но здесь она делает это сама, внутри своего же цикла работы, без лишнего шага. Если интересны такие же разборы новых моделей и инструментов — [в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Инференс на китайских чипах Всю прошлую неделю ox-alpha обслуживалась на кластере китайских ускорителей. Это были те самые 23 триллиона токенов на OpenRouter, никакого тестового стенда. Под эту архитектуру Z.ai собрала свой инференс-движок поверх SGLang. Самая любопытная деталь: движок помогал писать агент на базе GLM-5.3\. Он подбирал кернелы, искал узкие места, чинил сервинг-стек. Модель оптимизировала систему, которая обслуживает модель. Главное ограничение китайских чипов — память и её пропускная способность, особенно на миллионе токенов контекста. В ход пошло всё подряд: тензорный параллелизм внутри узла для линейного внимания и LM head, ReplaySSM, квантизация весов в W8A8, гибридный кеш в INT8/FP8/BF16, Layer Split. На уровне кластера — архитектура EPD, где мультимодальное кодирование, префилл и декодирование разнесены по отдельным пулам воркеров. Итог: трёхкратный прирост сквозной производительности против стартового бейзлайна на том же железе и стоимость токена, сопоставимая с NVIDIA. Проверить это снаружи нельзя, но заявка серьёзная. До сих пор фронтир-инференс на китайском железе выглядел скорее политическим заявлением, чем рабочей схемой. ## Сколько стоит GLM-5.3-Flash Базовый прайс — $0,15 за миллион входных токенов и $0,50 за миллион выходных. Сейчас действует скидка 50%, то есть реально платишь $0,075 и $0,25\. Чтение из кеша — $0,015. | Провайдер | Вход / 1M | Выход / 1M | | --------------------- | --------- | ---------- | | Z.ai (со скидкой) | $0,075 | $0,25 | | NovitaAI (со скидкой) | $0,075 | $0,25 | | Cloudflare | $0,15 | $0,50 | | io.net | $0,15 | $0,50 | Для подписчиков GLM Coding Plan отдельный API-ключ не нужен, модель уже раскатана всем. Причём квота на Flash втрое больше, чем на GLM-5.3: тариф Lite за $18 в месяц с ней проживёт заметно дольше. Pro стоит $80, Max — $168, при годовой оплате скидка 30%. ## Как подключить GLM-5.3-Flash 1. Оформить [GLM Coding Plan](https://z.ai/subscribe?ref=matveev.tech) от $18 в месяц и прописать эндпоинт Z.ai в Claude Code, OpenCode, Cline или другом агенте. Как это настраивается, я разбирал в [статье про GLM-5.2](https://matveev.tech/glm-5-2-claude-code/), для Flash отличий нет. 2. Взять ключ в консоли Z.ai и дёргать API напрямую. Модель называется `glm-5.3-flash`, [документация тут](https://docs.z.ai/guides/llm/glm-5.3-flash?ref=matveev.tech). 3. Пойти через [OpenRouter](https://openrouter.ai/z-ai/glm-5.3-flash?ref=matveev.tech), если не хочется заводить аккаунт в Z.ai или нужен запасной провайдер на случай, когда основной ляжет. 4. Поднять локально: веса с HuggingFace плюс SGLang, vLLM или TokenSpeed. ## Вердикт Бенчмарки тут не главное. Неделю модель работала под чужим именем на живом трафике, и люди голосовали токенами, не зная, чей продукт они гоняют. Такую проверку графиком не подделаешь. Плюс MIT-лицензия и цена, которая ломает привычную шкалу. Есть и ложка дёгтя. Z.ai обещала открыть веса GLM-5.3 к концу августа, а первой под MIT легла Flash. Формально сроки ещё не вышли, но ощущение подмены осталось. Претензии по делу тоже есть. Расход выходных токенов на максимальном effort съедает часть выигрыша в цене, так что на длинных агентных задачах разница с Opus 4.8 окажется меньше обещанной. Размышление не выключается, и на мелких запросах модель избыточна. Все бенчмарки, кроме Artificial Analysis, собрала сама компания, а Z.ai Code Bench вообще приватный. Кому советую попробовать прямо сейчас: тем, кто упирается в лимиты подписки Anthropic и гоняет много агентных задач. Восемнадцать долларов, тот же Claude Code, втрое большая квота, чем у GLM-5.3\. Кому мимо: тем, кто делает большие рефакторинги, там GLM-5.3 и Fable 5 всё ещё сильнее, разрыв в пять-десять баллов на Code Bench никуда не делся. И тем, кто работает с чувствительными данными: вопрос не к качеству модели, а к юрисдикции. [GLM Coding Plan — подписка с доступом к GLM-5.3-FlashОт $18 в месяц. Квота на Flash втрое больше, чем на GLM-5.3\. Работает в Claude Code, ZCode, OpenCode, Cline и других агентах.z.ai](https://z.ai/subscribe?ref=matveev.tech) ## Частые вопросы **Какое железо нужно, чтобы запустить GLM-5.3-Flash локально?** 320 млрд параметров в 8-битной квантизации — это порядка 320 ГБ только под веса, плюс KV-кеш. Домашней видеокартой не обойтись, нужна серверная сборка. В 4 битах требования падают примерно вдвое, но всё равно речь про несколько ускорителей на 80 ГБ. **Можно ли отключить режим размышления?** Нет. По документации Z.ai параметр `thinking.type` принимает только `enabled`. Управлять расходом получится только уровнем effort в агенте. **Модель понимает видео или только картинки?** Понимает и видео. Z.ai замеряла её на MVBench (77,8) и MMVU (80,5) — это бенчмарки на понимание видеороликов, а не отдельных кадров. По ним Flash уступает Gemini 3.7 Flash, но обходит DeepSeek-V4-Vision-Exp. ## Что ещё почитать - [GLM-5.3 от Z.ai: обзор модели](https://matveev.tech/glm-5-3-obzor/) — старшая модель линейки, та самая, что нашла 2436 уязвимостей в открытом коде - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — главный ориентир в таблицах выше - [Kimi K3: открытая модель на 2,8 трлн параметров](https://matveev.tech/kimi-k3/) — конкурент по эффективности KV-кеша, с которым Z.ai сравнивает архитектуру - [DeepSeek V4 Pro: обзор открытой модели для кодинга](https://matveev.tech/deepseek-v4-pro/) — вторая по трафику модель на OpenRouter, которую ox-alpha и подвинула ### GLM-5.3 от Z.ai: обзор модели URL: https://matveev.tech/glm-5-3-obzor/ Last updated: 2026-08-17T09:34:30.000Z > TL;DR: Z.ai выпустила GLM-5.3 — модель для кодинга. База та же, что у GLM-5.2, весь прирост дал пост-тренинг. Побочный эффект оказался громче основного: модель нашла 2436 реальных уязвимостей в 269 open-source проектах, а старейшая из них жила в коде с 1981 года. Веса придержали до конца августа - компания сама притормозила релиз из-за того, насколько хорошо модель научилась ломать чужой код. 14 августа Z.ai (бывшая Zhipu AI) показала GLM-5.3\. Формально это апдейт кодинг-модели: SOTA среди открытых на Terminal-Bench 3.0 и Agents' Last Exam, +50% на внутреннем бенчмарке компании. Но главная история в [анонсе](https://z.ai/blog/glm-5.3?ref=matveev.tech) — не про кодинг. Про предыдущие поколения я писал: [GLM-4.7](https://matveev.tech/glm-4-7-zhipu/) была крепкой моделью для терминала, [GLM-4.6V](https://matveev.tech/glm-4-6v-open-source-multimodal/) — мультимодалкой с function calling. GLM-5.3 из другой лиги, и разбирать её интереснее с конца, начиная с раздела про безопасность. ## Что такое GLM-5.3 и что в ней нового GLM-5.3 использует ту же базовую модель, что и [GLM-5.2](https://matveev.tech/glm-5-2-claude-code/). Никакого нового претрейна, никакого пересчёта весов с нуля. Z.ai честно пишет: «scaling post-training is all we did». Весь прирост получен за счёт масштабирования обучения с подкреплением на длинных задачах. Под этим лежит стек, который компания собрала ещё для 5.2: IndexShare для длинного контекста, SAO для RL на долгих задачах и открытый фреймворк [slime](https://github.com/THUDM/slime?ref=matveev.tech) для асинхронного обучения. За месяц команда добавила окружений, разнообразила задачи и залила туда больше компьюта. Системные оптимизации подняли пропускную способность RL-обучения на длинных кодинг-задачах больше чем в 2,3 раза. Отдельно интересен подход к самим окружениям. Задачи для обучения теперь синтезируются конвейером: агенты-исследователи собирают паттерны из реальной работы и превращают их в запускаемые окружения с многошаговыми зависимостями, а агент-судья проверяет, что задача вообще решаема. Верификатор пишется без доступа к эталонному решению, иначе модель научится обходить награду вместо того, чтобы решать задачу. Некоторые окружения — это несколько дней работы опытного инженера. Например, диагностика узких мест в ML-инфраструктуре с доступом к кластеру, хранилищу, внутренней документации и результатам экспериментов, где надо реально ускорить обучение и не сломать корректность. ## Кибербезопасность: 2436 уязвимостей в живом коде Вот ради этого раздела и стоит читать анонс. Z.ai добавила в обучающую смесь данные и окружения по поиску уязвимостей, тут ничего удивительного. Удивило команду другое: как быстро способность продолжала расти дальше. Модель перестала находить изолированные баги и начала выстраивать цепочки эксплуатации целиком. ![Результаты GLM-5.3 на кибербез-бенчмарках CyberGym, ExploitBench и ExploitGym в сравнении с GLM-5.2, Kimi K3 и закрытыми моделями](https://matveev.tech/content/images/2026/08/glm-5-3-cyber.png) Цифры по трём бенчмаркам: | Бенчмарк | GLM-5.3 | GLM-5.2 | Opus 4.8 | Fable 5 | GPT-5.6 Sol | | ------------------ | --------- | ------- | -------- | --------- | ----------- | | CyberGym | 84,5 | 77,2 | 78,1 | 83,8 | 83,6 | | ExploitBench | 54,4 | 24,4 | 40,0 | 78,0 | 76,5 | | ExploitGym 2ч / 6ч | 105 / 130 | 29 / 39 | 80 / 120 | 181 / 247 | 216 / 293 | На CyberGym, где модель ищет и подтверждает уязвимость по исходникам, GLM-5.3 показывает лучший результат из всех — 84,5% против 83,8% у Fable 5 и 83,6% у GPT-5.6 Sol. На ExploitBench, где нужно рассуждать глубже, результат удвоился относительно 5.2, но до закрытых моделей всё ещё далеко: 54,4% против 78%. На ExploitGym разрыв ещё заметнее. Закономерность Z.ai описывает так: чем выше по цепочке эксплуатации стоит бенчмарк, тем больше прирост относительно GLM-5.2 и тем шире оставшийся разрыв с закрытым фронтиром. Способности растут быстрее всего ровно там, где отставание сильнее. Начиная с GLM-5.2 Z.ai работает с несколькими security-командами в Китае и гоняет модели по реальным кодовым базам. После экспертной проверки и дедупликации получилось **2436 уязвимостей в 269 проектах**, из них 1097 — средней и высокой критичности. | Критичность | Количество | | ----------- | ---------- | | Critical | 107 | | High | 990 | | Medium | 1286 | | Low | 53 | Находки разбросаны по системным ядрам, операционкам, браузерным движкам, инфраструктурному опенсорсу, веб-приложениям и сетевым протоколам. Многие лежали незамеченными годами. Старейшая уязвимость появилась в коде в 1981 году, а средний возраст дыры до момента обнаружения — 26,6 лет. Публично раскрыто пока 53 находки, остальные 2383 под эмбарго. Z.ai завела для этого [публичный реестр раскрытия](https://cvd.z.ai/?ref=matveev.tech), где видно проект, критичность, CVE и сколько лет уязвимость прожила в коде. Названия проектов там серьёзные: [по данным Axios](https://www.axios.com/2026/08/14/china-open-source-ai-glm-53?ref=matveev.tech), среди находок есть ядро Linux, продукты VMware и проекты фонда Apache. Самая громкая находка случилась уже после анонса. Модель нашла, [как пишет VentureBeat](https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor?ref=matveev.tech) со ссылкой на девелопер-адвоката Z.ai, «потенциально серьёзную уязвимость» в Cursor — том самом редакторе, которым половина индустрии пишет код с помощью ИИ. Уязвимость передали приватно, команда Cursor работает над патчем, детали обещают раскрыть после того, как пользователи будут защищены. Заодно Z.ai запустила [OpenVuln](https://huggingface.co/spaces/zai-org/OpenVuln?ref=matveev.tech) — мейнтейнер открытого проекта может прийти и попросить прогнать GLM по своему репозиторию. Если у тебя есть свой опенсорс, это самый дешёвый способ пощупать модель на реальной задаче. Мне кажется, это самая важная часть релиза, и не только для безопасников. Модель, которую можно будет запустить локально после открытия весов, находит в опенсорсе то, что не нашли за сорок лет. Одна и та же способность одинаково хорошо работает и на защиту, и на атаку. Скоро она будет лежать в свободном доступе, и я честно не знаю, как к этому относиться: аудит своего кода станет доступнее всем, но и вторая сторона получит тот же инструмент. Похоже, в Z.ai думают примерно о том же. Пока веса не открыты, доступ к самым чувствительным возможностям дают по отдельной программе — только отобранным партнёрам по безопасности и в контролируемых окружениях. Компания при этом честно признаёт: после открытия весов контролировать, кто и как дообучит модель, она уже не сможет. Свою позицию Z.ai формулирует примерно так: если мир открытый, то открытой должна быть не только поверхность атаки, но и щит. Красиво, но проверить это утверждение можно будет только постфактум. Американские лаборатории в это же время тормозят релизы из-за киберрисков — OpenAI [отложила](https://www.axios.com/2026/08/07/openai-astra-model-delay-cybersecurity-risks?ref=matveev.tech) свою Astra ровно по этой причине. Китайские команды идут в обратную сторону и целенаправленно тренируют открытые модели на кибербез. А неделей раньше исследователи [зафиксировали](https://edition.cnn.com/2026/08/13/tech/china-taiwan-ai-agent-cyberattack-intl-hnk?ref=matveev.tech) автоматизированную атаку на правительственные системы Тайваня, где нападающей стороной работали открытые ИИ-агенты. В администрации Трампа на этом фоне [обсуждают](https://www.axios.com/2026/08/14/open-source-ai-government-scrutiny?ref=matveev.tech), как вообще регулировать открытые модели. На таком фоне две недели задержки выглядят вполне осмысленной паузой, а не жестом ради приличия. 🔍 Разбираю такие релизы в день выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Почему безопасники пересаживаются на GLM У этой истории есть сторона, о которой в анонсе ни слова, а на практике она решает. Западные флагманы регулярно отказываются работать с задачами по безопасности: guardrails срабатывают на слова «эксплойт», «уязвимость», «red team», и модель вежливо уходит от ответа. Для пентестера или разработчика, который чинит собственный баг, это стена на ровном месте. Показательный случай был в июле: Hugging Face [расследовала](https://www.axios.com/2026/07/20/hugging-face-ai-cyberattack-data-breach?ref=matveev.tech) утечку данных и в итоге взяла для анализа GLM-5.2 — американские фронтир-модели помогать отказались. Ситуация, где для разбора инцидента с моделями OpenAI приходится звать китайскую модель, говорит о состоянии индустрии больше, чем любая таблица бенчмарков. В [обсуждении на Hacker News](https://news.ycombinator.com/item?id=49294997&ref=matveev.tech) (1158 голосов и почти 600 комментариев за пару дней) та же тема всплывает первым же комментарием. Разработчик рассказывает, как купил Lite за 18 долларов, прогнал полноценный red team сценарий — 0-day в WP-плагинах, RCE, адаптация эксплойта под ядро, причём вторым GLM-агентом в роли защитника — и сразу ушёл на тариф за 80\. Другой участник с корпоративным бюджетом в 500 долларов пишет, что переезжает с подписки Anthropic, потому что Fable 5 и Opus 5 отказывались чинить security-баги и собирать инструменты мониторинга. Насколько это здоровая ситуация — вопрос отдельный. Но если твоя работа связана с безопасностью, аргумент «модель просто не отказывает» перевешивает пару пунктов в бенчмарке. ## Что GLM-5.3 показывает в кодинге? Основная заявка релиза — лучшая открытая модель для кодинга. На внутреннем Z.ai Code Bench прирост к 5.2 составил 50%. | Бенчмарк | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol | | ------------------ | ------- | ------- | ------- | -------- | ------- | ----------- | | Terminal-Bench 2.1 | 88,2 | 81,0 | 88,3 | 85,0 | 88,0 | 88,8 | | Terminal-Bench 3.0 | 28,3 | 4,6 | 17,4 | 21,1 | 33,7 | 34,6 | | DeepSWE v1.1 | 66,9 | 46,2 | 67,5 | 58,0 | 69,7 | 72,7 | | FrontierSWE | 78,1 | 67,5 | — | 66,5 | 88,2 | — | | SWE-Marathon v1.1 | 42,5 | 19,4 | 48,1 | 48,8 | 33,1 | 42,5 | | Agents' Last Exam | 28,5 | 23,8 | 27,6 | 25,7 | 23,8 | 28,6 | Самый показательный скачок — Terminal-Bench 3.0: с 4,6 до 28,3\. Свежий бенчмарк, на котором ещё недавно все модели буксовали, теперь берётся почти на треть. На FrontierSWE GLM-5.3 набирает 78,1 против 66,5 у Opus 4.8\. То есть открытая модель обходит флагман Anthropic прошлого поколения, хотя Fable 5 всё равно впереди с 88,2. Есть и провалы. На SWE-Marathon Kimi K3 и Opus 4.8 обходят GLM-5.3, на DeepSWE отставание от закрытых моделей сохраняется. Но для модели, веса которой скоро можно будет скачать, картина всё равно нетипичная. ## Токен-эффективность — почему это важнее бенчмарков Тут цифры, на которые я смотрю в первую очередь. Задач GLM-5.3 решает больше, и при этом расходует меньше токенов. ![График точности GLM-5.3 на Z.ai Code Bench относительно расхода выходных токенов на уровнях low, high и max в сравнении с Claude Fable 5 и Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-token-efficiency.png) На максимальном уровне рассуждений модель берёт 34,5% задач Z.ai Code Bench, расходуя около 75 тысяч выходных токенов на задачу. GLM-5.2 брала 23,4% при 96 тысячах. То есть плюс одиннадцать пунктов и минус пятая часть расхода. Сравнение с закрытыми ещё нагляднее: на уровне high GLM-5.3 даёт 31,4% при 50 тысячах токенов, а Claude Opus 4.8 — 29,5% при 120 тысячах. Результат чуть выше, токенов в 2,4 раза меньше. Fable 5 остаётся впереди по качеству (39,5% на максимуме), но и по счёту тоже. Для агентного кодинга это метрика номер один. Когда агент крутится в цикле часами, стоимость решённой задачи важнее позиции в таблице. ## Как подключить GLM-5.3 к Claude Code Отдельный API-ключ для GLM-5.3 не нужен. Модель уже раскатана всем подписчикам GLM Coding Plan и работает в ZCode, Claude Code, OpenCode, Cline и ещё паре десятков агентов. 1. Оформи подписку на [z.ai/subscribe](https://z.ai/subscribe?ref=matveev.tech). Минимальный тариф Lite стоит 18 долларов в месяц. 2. Установи Claude Code, если ещё нет: `npm install -g @anthropic-ai/claude-code` (нужен Node.js 18+). 3. Запусти официальный конфигуратор: `npx @z_ai/coding-helper`. Он пропишет нужные переменные окружения в конфиг Claude Code и подставит твой ключ. 4. Запусти `claude` в папке проекта. На вопрос про использование API-ключа ответь «Yes». Если правил `~/.claude/settings.json` руками и настройки не подхватились, закрой все окна Claude Code и запусти заново. В упрямом случае удали файл и дай конфигуратору создать новый. Одна вещь ломает обратную совместимость: в GLM-5.3 больше нельзя отключить рассуждения. Параметр `thinking.type: "disabled"` не поддерживается, вместо него появились три уровня усилий. ```json { "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "max" } ``` Уровни — `low`, `high` и `max`, по умолчанию `max`. Для кодинга Z.ai рекомендует максимальный. Если в твоём коде сейчас стоит `disabled`, поменяй на `enabled` с `reasoning_effort: low` **до** смены идентификатора модели, иначе запрос упадёт с ошибкой. ⚠️ Запросы к GLM-5.2 и GLM-5.1 теперь автоматически уходят на 5.3 — откатиться на старую версию не получится. ## Сколько стоит GLM Coding Plan Три тарифа, цена зависит от периода оплаты. При годовой подписке скидка 30%. | Тариф | В месяц | При годовой оплате | Кредиты за 5 часов | Кредиты в неделю | | ----- | ------- | ------------------ | ------------------ | ---------------- | | Lite | $18 | $12,6 | 2 000 | 10 000 | | Pro | $80 | $56 | 12 000 | 60 000 | | Max | $168 | $117,6 | 28 000 | 140 000 | Считается всё в кредитах: вход, кешированный вход и выход учитываются с разными коэффициентами. У GLM-5.3 это 6,9 за вход, 1,7 за кеш и 24 за выход на 10 тысяч токенов. В токенах Z.ai оценивает недельный лимит так: Lite — 43–87 миллионов, Pro — 263–526 миллионов, Max — 613–1226 миллионов. Разброс объясняется скидкой на непиковые часы: вне интервала 14:00–18:00 по пекинскому времени в будни всё стоит вдвое дешевле. Для нас это удобно, рабочий день в Москве почти целиком попадает в льготные часы. У ZCode, собственной агентной IDE от Z.ai, есть свои плюшки: кеш попадает больше чем в 98% случаев (это примерно +30% полезных токенов), а до 31 августа действует полуторакратный буст квоты. Плюс режим Goal, который планирует, пишет, тестирует и проверяет до достижения цели, и управление длинными задачами с телефона через WeChat или Feishu. ## Когда откроют веса GLM-5.3 Обещанные две недели отсчитываются от 14 августа, то есть веса ждём в районе 28-го. До этого момента модель живёт только внутри GLM Coding Plan и ZCode, публичного API нет. Что именно выложат — вопрос открытый. Задержку Z.ai объясняет «safety evaluation and hardening», и в обсуждениях сразу появилось разумное подозрение: кибербез-способности к моменту релиза могут подрезать. Логика простая — если компания две недели закаляет модель, то самая опасная её часть и есть предмет закалки. Проверить это можно будет только замерами после выкладки. С лицензией тоже неясно. У GLM-5.2 была MIT, что для модели такого размера почти неприлично щедро, но автоматически переносить это на 5.3 я бы не стал: у релиза совсем другой профиль рисков. И трезвая нота про «запущу локально». База — примерно 750 миллиардов параметров, так что домашней видеокартой тут не обойтись, нужна серверная сборка с сотнями гигабайт памяти и ценником как у неплохого автомобиля. Локальный запуск реалистичен для компаний и хостеров, а не для отдельного разработчика. Большинству всё равно останется API или чужое облако. ## Вердикт Больше всего в релизе подкупает не таблица с бенчмарками, а публичный реестр уязвимостей. Компания могла ограничиться строчкой «модель хорошо ищет баги», а выложила номера CVE, критичность и сроки жизни каждой находки. Проверяемо. К этому прибавь токен-эффективность, которая делает GLM-5.3 дешевле Opus 4.8 при сопоставимом результате, и работу в привычном Claude Code без смены инструментов. Претензии тоже есть. В эксплуатации уязвимостей до Fable 5 ещё далеко: 54,4 против 78 на ExploitBench, это не «почти догнали». Кредитная система вместо цены за миллион токенов считается неудобно, придётся смотреть на расход в дашборде. Главное же — все цифры в этом обзоре опубликовала сама Z.ai, включая результаты конкурентов, которые она выбирала и замеряла на свой вкус. Независимого аудита пока нет ни одного: пока веса закрыты, проверить модель снаружи попросту нечем. Часть бенчмарков внутренние, а Z.ai Code Bench вообще приватный — аргумент про защиту от протечки тестов разумный, но результат от этого проверяемым не становится. Читай таблицы как заявку производителя, а не как независимый замер. Если платишь за подписку Anthropic ради агентного кодинга и упираешься в лимиты, GLM-5.3 стоит попробовать прямо сейчас. Восемнадцать долларов за Lite, тот же Claude Code, заметно меньший расход токенов. На больших рефакторингах Fable 5 всё равно сильнее, но соотношение цены и результата у Z.ai сейчас лучшее на рынке. Безопасникам я бы советовал дождаться открытия весов: модель, которая нашла две с половиной тысячи дыр в чужом коде, пригодится для аудита своего, и запустить её можно будет локально, не отправляя исходники в чужое облако. Кому точно мимо: тем, кто работает с чувствительными данными и не готов гонять их через китайские серверы. Тут вопрос не в качестве модели, а в юрисдикции и политике хранения. [GLM Coding Plan — подписка на GLM-5.3От $18 в месяц. Работает в Claude Code, ZCode, OpenCode, Cline и ещё двух десятках агентов. Вне пиковых часов расход вдвое меньше.z.ai](https://z.ai/subscribe?ref=matveev.tech) ## Что ещё почитать - [GLM-4.7 — китайская модель для кодинга, которая удивляет](https://matveev.tech/glm-4-7-zhipu/) — предыдущее поколение линейки, с которого началась поддержка Claude Code - [GLM-4.6V — опенсорс мультимодалка с function calling](https://matveev.tech/glm-4-6v-open-source-multimodal/) — визуальная модель Z.ai, которая сейчас работает как Vision MCP внутри Coding Plan - [Kimi K3: открытая модель на 2,8 трлн параметров](https://matveev.tech/kimi-k3/) — главный конкурент GLM среди открытых китайских моделей, он же в таблицах выше - [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/) — закрытый фронтир, с которым GLM-5.3 сравнивают по кибербезу ### Claude Opus 5: обзор модели и что меняется в API URL: https://matveev.tech/claude-opus-5/ Last updated: 2026-07-25T08:33:15.000Z > TL;DR: Anthropic выпустила [Claude Opus 5](https://www.anthropic.com/news/claude-opus-5?ref=matveev.tech). Цена осталась прежней ($5 за миллион входных токенов и $25 за выходные, как у Opus 4.8), но модель подтянулась почти вплотную к Fable 5, который стоит вдвое дороже. ## Что такое Claude Opus 5 и чем он отличается от Opus 4.8 Opus 5 доступен с 24 июля 2026 года на всех платформах: Claude API (`claude-opus-5`), Amazon Bedrock, Google Cloud, Microsoft Foundry. В подписках он стал моделью по умолчанию на Claude Max и самой сильной доступной моделью на Pro. Модель находится близко к интеллекту Fable 5 за половину цены. По [бенчмаркам Anthropic](https://www.anthropic.com/news/claude-opus-5?ref=matveev.tech) на CursorBench 3.2 при максимальном effort Opus 5 отстаёт от пикового результата Fable 5 на 0,5%, стоя вдвое дешевле за задачу. На Frontier-Bench v0.1 он больше чем удвоил результат Opus 4.8\. На ARC-AGI 3, где нужно решать незнакомые задачи, результат втрое выше ближайшего конкурента. Технические характеристики: контекст в 1 млн токенов (это и дефолт, и максимум, вариантов с меньшим окном нет), 128k выходных токенов, надёжный knowledge cutoff май 2026\. Через Message Batches API с бета-хедером `output-300k-2026-03-24` можно получить до 300k выходных токенов. Цифры, понятно, от самой Anthropic, независимых замеров пока нет. Но из бенчмарков мне интереснее всего Zapier AutomationBench, где меряют доведение бизнес-задач от начала до конца. Zapier пишет, что предыдущие модели их сценарий с оттоком клиентов не проходили вообще, а Opus 5 дал 100%. ## Что изменилось в поведении модели Модель стала многословнее. Ответы пользователю и письменные артефакты по умолчанию длиннее, чем у Opus 4.8\. В агентных сессиях она чаще комментирует, что делает прямо сейчас. В мультиагентных схемах охотнее делегирует субагентам. Opus 5 проверяет свою работу сам, без напоминаний. Инструкции вроде «добавь финальный шаг верификации» или «используй субагента для проверки», которые кочевали из промптов для прошлых моделей, теперь вызывают избыточную перепроверку. Anthropic советует их вычистить. 💡 Проверь свой системный промпт и CLAUDE.md на фразы вроде «в конце обязательно проверь результат». На Opus 5 они дают перепроверку там, где модель и так проверяет себя сама. Насчёт агентности есть красивый пример из анонса. На одной из задач Frontier-Bench модели дали чертёж детали и попросили собрать по нему 3D-модель во FreeCAD, при этом намеренно лишив возможности посмотреть на чертёж. Opus 5 написал собственный пайплайн компьютерного зрения, вытащил геометрию из пикселей и собрал деталь. Ни одна конкурирующая модель в том же окружении не справилась за пять попыток. ## Effort в Opus 5 стал важнее, чем раньше Полная лестница уровней сохранилась: `low`, `medium`, `high`, `xhigh`, `max`. По умолчанию на Claude API и в Claude Code стоит `high`. Разница с прошлыми моделями в том, что Opus 5 конвертирует дополнительный effort в качество надёжнее любого предыдущего Opus. Раньше выкручивание уровня часто давало прирост токенов и латентности без внятного выигрыша. Теперь Anthropic советует стартовать с `high` и двигаться в обе стороны по результатам своих замеров: понижать там, где качество держится, повышать на самом сложном. Отдельно отмечу нижние уровни. Anthropic заявляет сильное качество на `low` и `medium` при доле токенов от высоких настроек, и это подтверждают клиенты. Trading-компания в отзывах пишет про седьмую часть reasoning-токенов и меньше половины латентности по сравнению с Opus 4.8\. Юридический сервис получил близкое качество при 26% меньшем расходе токенов. Если интересно, как effort устроен внутри Claude Code, я разбирал это в [отдельном гайде](https://matveev.tech/claude-code-model-effort-level/). ## Что нового в API: кэш, тулы и фолбэки Первое и самое приятное для агентов: теперь можно менять список инструментов посреди диалога, не убивая prompt cache. Раньше набор тулов фиксировался на всю сессию, и любая правка обнуляла кэш. Нужен бета-хедер `mid-conversation-tool-changes-2026-07-01`. Порог кэширования упал вдвое. Минимальная длина промпта для кэша на Opus 5 составляет 512 токенов против 1024 у Opus 4.8\. Короткие системные промпты, которые раньше просто не попадали в кэш, теперь кэшируются. И автоматические фолбэки. Параметр `fallbacks` получил режим `"default"`: вместо списка моделей, который ты поддерживаешь руками, применяются рекомендации Anthropic по категории отказа. Бета-хедер `server-side-fallback-2026-07-01`. Смысл в том, что запрос, зарубленный классификатором безопасности, не падает с ошибкой, а уезжает на другую модель. Ещё есть Fast mode: примерно в 2,5 раза быстрее обычного, стоит вдвое дороже ($10 и $50 за миллион токенов). Пока это research preview и только на Claude API, на Bedrock, Google Cloud и Microsoft Foundry его нет. В Claude Code Fast mode оплачивается из кредитов и переключается командой `/fast`. ✈️ Разбираю новые модели и настройки агентов по мере выхода, без пересказа пресс-релизов: [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Безопасность: где Opus 5 стал свободнее Автоматический аудит поведения показал, что Opus 5 самая согласованная модель Anthropic на сегодня: 2.3 балла по общему уровню рассогласованного поведения, ниже, чем у Opus 4.8, Sonnet 5 и Fable 5\. Заодно самый низкий уровень обмана и наименьшая податливость на попытки обхода. Классификаторы Opus 5 менее строгие, чем у Fable 5, и по оценке Anthropic будут срабатывать примерно на 85% реже. Модели разрешён поиск уязвимостей в исходном коде, но заблокированы бинарный анализ, пентест и генерация эксплойтов. Запросы, которые всё же зацепит классификатор, в Claude.ai, Claude Code и Claude Cowork по умолчанию уедут на Opus 4.8. По биологии Opus 5 стал самой мощной общедоступной моделью для научной работы, потому что набор ограничений у него примерно как у Opus 4.8, а способности выше. Запросы по биологии, которые блокирует Fable 5, теперь маршрутизируются на Opus 5. ## Сколько стоит Opus 5 по сравнению с остальной линейкой | Модель | Вход, $/1M | Выход, $/1M | Контекст | | ---------------- | ------------ | -------------- | -------- | | Claude Fable 5 | 10 | 50 | 1M | | Claude Opus 5 | 5 | 25 | 1M | | Claude Sonnet 5 | 3 (сейчас 2) | 15 (сейчас 10) | 1M | | Claude Haiku 4.5 | 1 | 5 | 200k | У Sonnet 5 до 31 августа 2026 действует вводная цена $2 и $10\. Fast mode для Opus 5 удваивает базовый тариф. Opus 5 не подорожал относительно Opus 4.8 ни на цент, а качество выросло заметно. Плюс модель тратит меньше токенов на ту же работу, так что реальный счёт за задачу скорее упадёт. Один из клиентов в отзывах приводит цифру: на 9 процентных пунктов выше точность при трети меньше ходов и вызовов инструментов и на 60% меньше времени. Про [Sonnet 5 я писал отдельно](https://matveev.tech/claude-sonnet-5/): он всё ещё отличный вариант, когда нужен объём и скорость, а задачи не самые заковыристые. ## Вердикт: стоит ли переходить Мне кажется, это редкий случай, когда переход обходится почти даром. Цена та же, качество выше, токенов тратится меньше. Если ты сидел на Opus 4.8, странно не обновиться. Нюансы всё же есть. Модель стала болтливее, и там, где важна краткость, придётся поджимать её промптом. Старые инструкции про верификацию теперь мешают, а вылавливать их в разросшемся системном промпте занятие небыстрое. [Claude Opus 5Модель по умолчанию на Claude Max и самая сильная на Pro. В API доступна как claude-opus-5 по $5 за миллион входных токенов.Anthropic](https://claude.ai/?ref=matveev.tech) ## Что ещё почитать - [Claude Sonnet 5: агентность как у Opus, но дешевле](https://matveev.tech/claude-sonnet-5/): предыдущая модель линейки, если Opus избыточен по цене - [Модель и effort level в Claude Code: как это работает](https://matveev.tech/claude-code-model-effort-level/): разбор уровней effort, которые в Opus 5 стали важнее - [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/): что предлагает главный конкурент ### AssemblyAI Universal-3.5: распознавание речи для агентов URL: https://matveev.tech/assemblyai-universal-3-5-pro-realtime/ Last updated: 2026-07-22T11:39:59.000Z > TL;DR: AssemblyAI открыла ранний доступ к Universal-3.5 Pro Realtime — новой стриминговой модели распознавания речи для голосовых агентов. Главное: определение конца реплики около 300 мс, три режима под скорость или точность, память разговора и фокус на основном спикере. Пока это preview, и цифры идут от самой AssemblyAI, но для тех, кто строит голосовых агентов, заявка серьёзная. Мне на почту упало приглашение в ранний доступ к Universal-3.5 Pro Realtime. Если ты когда-нибудь делал голосового агента, то знаешь: узкое место почти всегда одно, и это ритм. Качество распознавания давно приличное, а вот паузы и перебивания всё портят. Пока модель слушает и решает, договорил человек или просто задумался, агент молчит или, наоборот, влезает посреди фразы. Universal-3.5 целится ровно в эту боль. ## Что такое Universal-3.5 Pro Realtime? Это стриминговая модель распознавания речи (speech-to-text) от AssemblyAI, продолжение линейки Universal-3 Pro. Базовую версию [Universal-3 Pro Streaming](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech) компания выпустила в марте 2026, а дальше несколько месяцев докручивала по кусочкам: диаризация спикеров, режимы задержки, передача контекста, 19 языков. Universal-3.5 Pro Realtime собирает эти наработки в один флагман и добавляет пару новых вещей. Сейчас доступна в preview по приглашению. Задача у неё простая на словах и сложная на деле. Распознать живую речь за доли секунды и отдать текст голосовому агенту так, чтобы тот отвечал в темп разговора, не перебивал и не залипал на паузах. Французский и португальский, кстати, уже работают на флагманской точности, так что это не «английская» модель с прикрученными языками. ## Почему задержка решает всё для голосового агента Когда говоришь с голосовым ботом, бесит обычно не то, что он не расслышал слово. Бесит ритм. Делаешь паузу подумать — бот влезает. Договорил — бот тупит секунду, прежде чем ответить. Виновата здесь не «тупость» модели, а end-of-turn detection: момент, когда система решает, что твоя реплика закончилась. AssemblyAI заявляет определение конца реплики в районе 300 мс. Для контекста: задержка до первого транскрипта у Universal-3 Pro на дефолтных настройках около 800 мс, но падает примерно до 300 мс с параметром `interruption_delay: 0` ([из changelog](https://www.assemblyai.com/changelog?ref=matveev.tech)). Сама расшифровка идёт с P50 около 150 мс и P90 около 240 мс после того, как система поймала конец фразы ([данные из блога](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech)). На практике это значит, что агент отвечает почти в темп живого диалога. Задержку в треть секунды человек почти не замечает. 💡 Грубый ориентир: в живом разговоре люди подхватывают реплику друг друга примерно за пятую долю секунды. Чем ближе голосовой агент к этому порогу, тем меньше ощущается, что говоришь с машиной. Под разные задачи модель даёт три режима: `min_latency`, `balanced` и `max_accuracy`. Один и тот же endpoint, переключаешь режим под сценарий. Для агента в реальном времени берёшь `min_latency` и жертвуешь долей точности ради скорости. Для постобработки записи звонка ставишь `max_accuracy`, где спешить некуда, а ошибаться нельзя. Это удобнее, чем держать две разные модели под два сценария. ## Что нового: Context Carryover и Voice Focus Две фичи, которых в мартовском релизе не было. Context Carryover держит реплику в контексте разговора. Через параметр `agent_context` ты передаёшь модели, что сейчас делает твой агент и в каком состоянии беседа, а скользящая память удерживает нить диалога. Звучит абстрактно, но на практике это меньше ошибок в словах, которые понятны только из контекста: имена, термины, числа, к чему относится «он» или «это». Модель распознаёт не голую звуковую дорожку, а реплику внутри разговора. Voice Focus изолирует основного спикера. Фоновые голоса (телевизор, коллеги в опенспейсе, разговор на улице) не превращаются в фантомные слова и, что важнее для агента, не считаются попыткой перебить. Если ты делаешь голосового ассистента, который работает не в студии, а в реальной шумной комнате, это разница между «агент слушает тебя» и «агент реагирует на чужую речь из телевизора». ## Сколько языков понимает и есть ли русский? Universal-3.5 распознаёт 19 языков на флагманской точности. К английскому, испанскому, немецкому, французскому, итальянскому и португальскому в июне добавили турецкий, нидерландский, шведский, норвежский, датский, финский, хинди, вьетнамский, арабский, иврит, японский, урду и китайский. Плюс code-switching — переключение языка прямо посреди фразы, без сброса распознавания. И параметр `language_code`, чтобы зафиксировать язык, если ты знаешь его заранее: так быстрее и точнее, чем гонять автоопределение. Теперь честно про русский. В стриминговом списке из 19 языков его нет. На асинхронной транскрипции (готовые записи) AssemblyAI поддерживает под сотню языков, русский там есть, но realtime-флагман его пока не покрывает. Для русскоязычного голосового агента это прямой стоп-фактор. Если проект на русском, придётся смотреть конкурентов — тот же [Soniox v5 я разбирал отдельно](https://matveev.tech/soniox-v5-real-time). ## Как подключить Universal-3.5 Отдельного гайда под 3.5 пока нет, она в preview. Но механика та же, что у Universal-3 Pro Streaming: 1. Зарегистрируйся в AssemblyAI и возьми API-ключ в дашборде. 2. Открой WebSocket-соединение к стриминговому endpoint и укажи модель через `speech_model`. Для preview проще всего зайти в [playground в дашборде](https://www.assemblyai.com/dashboard/playground/realtime?ref=matveev.tech) и потыкать 3.5 без единой строчки кода. 3. Лей аудио в сокет чанками (обычно PCM16, 16 кГц), получай в ответ частичные и финальные транскрипты. 4. Настрой поведение под агента: режим `min_latency`, `interruption_delay` под нужную агрессивность перебивания, `agent_context` с состоянием разговора. 5. Лови сообщения о конце реплики, чтобы понимать, когда пора передавать текст в LLM. Если возиться со связкой распознавание-LLM-синтез отдельно не хочется, у AssemblyAI есть [Voice Agent API](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech): один endpoint, аудио на вход и аудио на выход, по единому тарифу. Под капотом там как раз Universal-3 Pro Streaming. ## Сколько стоит AssemblyAI Universal-3.5? Цену на саму preview-модель AssemblyAI отдельно не называет, но линейка Universal-3 Pro Streaming стоит так: | Модель | Цена | Языки | | -------------------------------- | --------- | ---------- | | Universal-3 Pro Streaming | $0.45/час | 19 | | Universal Streaming | $0.15/час | английский | | Universal Streaming Multilingual | $0.15/час | 6 | К Pro-тарифу стекаются доплаты за то, чем реально пользуешься: диаризация спикеров +$0.12/час, prompting в бете +$0.05/час. Биллинг идёт по длительности сессии, жёстких лимитов на параллельные потоки нет ([из описания продукта](https://www.assemblyai.com/products/streaming-speech-to-text?ref=matveev.tech)). Отдельно стоит Voice Agent API, $4.50/час all-in, и сюда уже зашиты распознавание, LLM и синтез. В пересчёте $0.45/час — это $0.0075 за минуту. Час разговоров в день выйдет примерно в $13–14 в месяц только на распознавание. Не самый дешёвый вариант: Universal Streaming втрое дешевле. Но Pro-линейка и не претендует на дешевизну, она про точность. ✈️ Разбираю голосовые модели и инструменты для агентов по мере выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Universal-3.5 против Soniox v5 и Deepgram AssemblyAI давит на точность диаризации и turn-taking. По их собственным бенчмаркам против Deepgram Nova-3 (ближайший конкурент) Universal-3 Pro выдаёт в 2 раза лучше cpWER на телефонии с двумя спикерами, на 13% лучше на встречах с четырьмя и на 91% меньше фантомных слов, приписанных несуществующим спикерам. Цифры эффектные, но это замеры самого вендора на своих данных. На своём аудио проверяй сам. #### Что такое cpWER? cpWER — доля ошибок в словах с поправкой на то, какому спикеру они приписаны: метрика штрафует и за неверное слово, и за неверного говорящего. Чем ниже, тем лучше. [Soniox v5 Real-Time](https://matveev.tech/soniox-v5-real-time), который я недавно разбирал, играет в той же лиге realtime-STT для агентов и берёт в первую очередь языковым охватом. Если совсем коротко: AssemblyAI 3.5 — это про предсказуемый turn-taking и тонкую настройку задержки под агента, Soniox — про языки и цену. Для русскоязычного проекта выбор сейчас не в пользу AssemblyAI просто потому, что русского в realtime у неё нет. Deepgram при этом остаётся самым дешёвым и быстрым рабочим конём, но по точности диаризации AssemblyAI его, судя по цифрам, обходит. ## Стоит ли брать: вердикт Если строишь голосового агента на английском или одном из 19 поддержанных языков, Universal-3.5 Pro Realtime стоит поставить в очередь на тест. Сильная сторона очевидна: AssemblyAI заморочилась ровно тем, что ломает ощущение живого диалога — моментом конца реплики, перебиваниями, фоновыми голосами. Режимы задержки и `agent_context` звучат как маркетинг, но в проде это ровно те ручки, которые крутишь, чтобы агент звучал естественно. Что настораживает. Это preview, и все красивые цифры пока идут от самой AssemblyAI, независимых замеров на грязном продакшен-аудио нет. Русского в realtime нет вообще, так что для местных проектов модель сразу мимо. И $0.45/час — не для экономных: если точность диаризации некритична, Universal Streaming или Deepgram обойдутся втрое дешевле. Мне эта линейка нравится тем, что собрана именно под агентов, а не как очередной универсальный STT. Но брать вслепую по пресс-релизу я бы не стал, дождусь общего доступа и погоняю на живых звонках. А вот если делаешь англоязычного агента и тебе важен ритм разговора, в early access податься точно стоит, там есть на что смотреть. [Realtime Speech-to-Text — AssemblyAIСтриминговое распознавание речи Universal-3 Pro для голосовых агентов: низкая задержка, диаризация спикеров, 19 языков.assemblyai.com](https://www.assemblyai.com/products/streaming-speech-to-text?ref=matveev.tech) ## FAQ **Universal-3.5 Pro Realtime уже доступна всем?** Нет, пока это preview по приглашению (early access). Публичной страницы и финальных цен на саму 3.5 ещё нет. Базовая Universal-3 Pro Streaming при этом доступна с марта 2026. **Поддерживает ли Universal-3.5 русский язык?** В realtime-стриминге нет: список ограничен 19 языками, русского среди них пока нет. На асинхронной транскрипции готовых записей русский поддерживается. Для голосового агента на русском это стоп-фактор. **Чем 3.5 отличается от Universal-3 Pro Streaming?** Universal-3.5 собирает все обновления линейки (диаризация, режимы задержки, 19 языков, agent\_context) в один релиз и добавляет две новые фичи: Context Carryover (память разговора) и Voice Focus (изоляция основного спикера от фоновых голосов). ## Что ещё почитать - [Soniox v5 Real-Time: распознавание речи для агентов](https://matveev.tech/soniox-v5-real-time) — прямой конкурент в realtime-STT, сильный в языках - [Gemini 3.1 Flash Live: голосовые агенты Google стали точнее](https://matveev.tech/gemini-3-1-flash-live-obzor) — голосовой стек от Google - [Microsoft MAI: три модели для голоса, транскрипции и картинок](https://matveev.tech/microsoft-mai-modeli-foundry) — альтернативный набор моделей для речи - [Voice Studio Companion — озвучка из меню-бара Mac](https://matveev.tech/voice-studio-companion) — вторая половина голосового стека, синтез речи ### Mistral OCR 4: обзор модели распознавания документов URL: https://matveev.tech/mistral-ocr-4/ Last updated: 2026-07-21T16:38:00.000Z > TL;DR: Mistral выпустила OCR 4 — модель распознавания документов, которая возвращает структуру страницы вместе с текстом: координаты каждого блока, его тип (заголовок, таблица, формула, подпись) и оценку уверенности по словам. Главное для тех, кто строит RAG и агентов на документах. Цена $2-4 за 1000 страниц, есть self-hosting. Если ты когда-нибудь прогонял PDF через OCR, а потом руками разбирал кашу из строк, пытаясь понять, где тут таблица, где сноска, а где подпись внизу страницы, то знаешь главную боль. Распознать буквы — полдела. Дальше надо понять, что это за буквы и где они лежат. Mistral OCR 4 как раз про вторую половину. ## Что такое Mistral OCR 4 Это специализированная модель для извлечения текста из документов: PDF, сканы, картинки, презентации. По данным Mistral, она поддерживает 170 языков в 10 языковых группах и работает как компонент для enterprise-поиска, RAG и агентных пайплайнов. Прошлые версии (OCR 3 вышел в январе 2026) умели превращать страницу в чистый текст и таблицы. Четвёртая делает шаг дальше: отдаёт структурированное представление документа. Разница принципиальная. Раньше на выходе был markdown с текстом, и дальше ты сам угадывал структуру. Теперь модель говорит: вот блок, это таблица, её координаты такие-то, уверенность 0.98\. То есть ты получаешь не только что написано в документе, но и где это лежит, какую роль играет и насколько модель в этом уверена. ## Структура вместо просто текста: главное в v4 Здесь и живёт всё обновление. OCR 4 возвращает три вещи поверх обычного текста, и каждая закрывает конкретную дыру в реальных пайплайнах. Первое — bounding boxes, координаты блоков. Самая запрашиваемая фича, по словам самой Mistral. Каждый кусок текста привязан к прямоугольнику на странице. Зачем это нужно: подсветить источник прямо в исходном документе, когда LLM сослался на конкретное место. Для юристов и финансистов это обязательное требование. Ответ без указания, откуда взят кусок, в таких сценариях бесполезен. Второе — классификация блоков. Модель размечает каждый блок типом. В документации перечислены: `text`, `title`, `list`, `table`, `image`, `equation`, `caption`, `code`, `references`, `aside_text`, `header`, `footer`, `signature`. Блоки идут в порядке чтения. Это решает старую проблему semantic chunking для RAG: вместо того чтобы резать документ по 500 токенов вслепую, ты режешь по реальным смысловым единицам. Заголовок отдельно, таблица отдельно, сноска не приклеивается к абзацу. Третье — confidence scores, оценка уверенности. Можно получить на уровне страницы или каждого слова (параметр `confidence_scores_granularity`). Практический смысл простой: ты отправляешь на проверку человеку только те регионы, где модель сомневается, а не весь документ. Для обработки инвойсов и форм с human-in-the-loop это прямая экономия часов. Вместе эти три штуки превращают OCR из «прочитай текст» в «разбери документ на детали, которыми можно управлять». Агент перестаёт просто читать и начинает действовать: заполнять формы, обрабатывать счета, проверять документы на соответствие. ## Быстрый старт Модель доступна через один API-эндпоинт. Под капотом `mistral-ocr-latest` — это и есть OCR 4 (`mistral-ocr-4-0`). Ставишь SDK и делаешь один вызов. ```bash pip install mistralai ``` ```python from mistralai import Mistral client = Mistral(api_key="ВАШ_КЛЮЧ") resp = client.ocr.process( model="mistral-ocr-latest", document={ "type": "document_url", "document_url": "https://example.com/contract.pdf", }, include_blocks=True, # блоки с координатами и типом confidence_scores_granularity="word", # уверенность по каждому слову ) for page in resp.pages: for block in page.blocks: print(block.type, "→", block.content[:80]) ``` Ключевой параметр здесь `include_blocks=True` — именно он включает тот самый структурированный вывод. Важная деталь: блоки работают только на OCR 4 и новее. Старые модели параметр примут, но вернут пустой массив. Документ можно подать тремя способами: публичной ссылкой, base64 или загрузкой файла в облако Mistral. Таблицы по умолчанию идут inline в markdown, но через `table_format` их можно вынести отдельно как markdown или html. ## Бенчмарки и честные оговорки По цифрам Mistral заявляет первое место. В слепой человеческой оценке независимые аннотаторы предпочли OCR 4 в среднем в 72% случаев против ведущих OCR и document-AI систем. На публичном OlmOCRBench модель набрала 85.20, на OmniDocBench — 93.07. ![Сравнение производительности Mistral OCR 4 с конкурентами по бенчмаркам](https://matveev.tech/content/images/2026/06/mistral-ocr-4-benchmark.webp) Что мне понравилось в этом релизе — Mistral сама честно разбирает, где бенчмарки врут. Компания признаёт, что автоматические метрики штрафуют модель за вещи, которые на деле верны: эквивалентная запись формул в LaTeX, разбивка уравнений на фрагменты, перенос слов через границу колонок, ошибки в самих эталонных аннотациях. То есть часть «ошибок» — это артефакты сравнения строк, а не реальные промахи модели. Поэтому к агрегатной цифре они относятся как к ориентиру, а не приговору, и прямо советуют гонять тесты на своих документах. Для технического обзора такая откровенность дороже красивого графика. Отдельно стоит мультиязычность. По внутренней оценке Crawl Multilingual OCR 4 лидирует во всех языковых группах, и разрыв с конкурентами шире всего на редких и специализированных языках, где многие системы резко проседают. Для русскоязычных документов это скорее хорошая новость, хотя конкретных цифр по русскому Mistral не дала. ## Цена и где доступен Тарификация постраничная, три варианта: | Режим | Цена за 1000 страниц | Когда брать | | --------------- | -------------------- | ---------------------------------------------- | | OCR 4 API | $4 | Чистое извлечение текста и структуры | | OCR 4 Batch-API | $2 | Массовая обработка, скидка 50% | | Document AI | $5 | Структурированный JSON по своей схеме без кода | Разница между OCR 4 и Document AI важная. Базовый OCR всегда отдаёт текст, координаты, типы блоков и confidence. Document AI — это тот же эндпоинт, но с дополнительными параметрами: передаёшь JSON-схему, и вывод приводится к нужной форме через `mistral-small-2603`. Грубо так: нужен сырой разбор — берёшь OCR как есть. Нужен готовый JSON под свои поля — добавляешь параметры Document AI в тот же вызов. Доступ есть через Mistral Studio, Amazon SageMaker, Microsoft Foundry, и скоро обещают Snowflake Parse Document. Один цинизм в сторону: красивая отдельная цена $4 против $5 выглядит как маркетинг, по факту это одна модель с разным уровнем обвязки. ## Self-hosting и приватность Для меня это второй по важности пункт после структуры. OCR 4 достаточно компактна, чтобы развернуться в одном контейнере, и может работать полностью self-hosted — документы не уходят за пределы твоей инфраструктуры. Для медицины, юристов и финансов с требованиями по data residency это снимает главный барьер на пути к облачным API. Правда, есть нюанс: self-managed развёртывание Mistral отдаёт только enterprise-клиентам, так что просто скачать и запустить дома не выйдет. Если тебе важна локальная обработка чувствительных данных, это направление стоит держать в уме (мы недавно разбирали похожий подход в [обзоре OpenAI Privacy Filter](https://matveev.tech/openai-privacy-filter)). ✈️ Разбираю новые модели и инструменты для документов и AI-агентов почти каждый день — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Плюсы и минусы **Что понравилось:** - Структурированный вывод — это реально другой уровень. Координаты, типы блоков и confidence закрывают конкретные боли RAG и агентов, а не абстрактную «точность» - Честность с бенчмарками. Mistral сама показывает, где метрики врут, и советует тестировать на своих данных - Self-hosting для чувствительных документов - Адекватная цена, особенно $2 за 1000 страниц в Batch-режиме **Что не понравилось:** - Модель не open source. Несмотря на репутацию Mistral как открытой компании, OCR 4 закрытая, а self-hosting только для enterprise - Бенчмарки против конкурентов — внутренние репродукции Mistral. Цифры соперников считала сама же Mistral, это всегда повод для скепсиса - По русскому языку конкретных метрик нет, только общее «лидируем в восточноевропейской группе» - Модель сознательно не для real-time: для latency-чувствительных сценариев не подходит ## Вердикт Если ты строишь RAG или агентов поверх документов, OCR 4 стоит протестировать в первую очередь. Структурированный вывод с координатами и типами блоков экономит тот самый постпроцессинг, на который обычно уходит больше времени, чем на сам OCR. Связка confidence scores плюс bounding boxes делает human-in-the-loop вменяемым, а не сплошной перепроверкой. Кому не подойдёт: тем, кому нужен полностью открытый локальный инструмент без enterprise-договора, и тем, у кого real-time сценарии. И не стоит верить агрегатным цифрам на слово — Mistral сама об этом просит. Берёшь свою пачку реальных документов, гоняешь, смотришь на своих данных. Благо $2 за 1000 страниц позволяют это сделать почти бесплатно. Попробовать: [Mistral OCR 4](https://mistral.ai/news/ocr-4/?ref=matveev.tech) ## Что ещё почитать - [OpenAI Privacy Filter: обзор открытой модели для PII](https://matveev.tech/openai-privacy-filter) — про локальную обработку документов и защиту персональных данных - [Soniox v5 Real-Time: распознавание речи для агентов](https://matveev.tech/soniox-v5-real-time) — соседняя модальность того же ingestion-слоя, только для звука - [DeepSeek V4 Pro: обзор открытой модели](https://matveev.tech/deepseek-v4-pro) — если интересна тема локального запуска моделей ### Taalas ChatJimmy: нейросеть, впаянная в кремний URL: https://matveev.tech/taalas-chatjimmy/ Last updated: 2026-07-21T12:37:39.000Z > TL;DR: Стартап Taalas из Торонто впаял нейросеть Llama 3.1 8B прямо в кремний (чип HC1) и сделал демо-чат ChatJimmy, который выдаёт до 17 000 токенов в секунду. Это на порядок быстрее видеокарт и в разы экономичнее, но модель внутри старая и регулярно ошибается. Главное тут не сам чат, а заявка: ИИ может стать дешёвой железкой, а не вечной облачной подпиской. Заходишь на [chatjimmy.ai](https://chatjimmy.ai/?ref=matveev.tech), пишешь вопрос, жмёшь Enter и ответ уже там. Не «быстро печатается по буковке», а просто появляется целиком, будто страницу подготовили заранее. Первая мысль: что-то глюкнуло. Вторая: так вот как выглядит инференс, когда модель не прогоняют через GPU, а вшивают в сам чип. ## Что такое ChatJimmy и кто такие Taalas ChatJimmy сам по себе примитивный: голое поле ввода, счётчик токенов и подпись «How can I help you today?». Никаких настроек, регистрации и тарифов. Это витрина, а не продукт. За ней стоит куда более интересная штука, чип **HC1** от компании [Taalas](https://taalas.com/?ref=matveev.tech). Taalas основали в Торонто осенью 2023 года три выходца из Tenstorrent: Любиша Баич (CEO, до этого он же основал Tenstorrent и успел поработать архитектором чипов в AMD и год в Nvidia), его жена Лейла Баич (COO) и Драго Игнятович (CTO). Команда маленькая, 24 человека. В феврале 2026-го они разом показали чип, демо-чат, манифест и подняли раунд на 169 млн долларов, доведя общий объём инвестиций примерно до 219 млн ([Reuters](https://www.reuters.com/world/asia-pacific/chip-startup-taalas-raises-169-million-help-build-ai-chips-take-nvidia-2026-02-19?ref=matveev.tech)). Любопытная деталь: на разработку первого чипа ушло всего около 30 млн из этих денег. Слоган у них прямой: «The model is the computer». Идея в том, что нейросеть не должна жить как софт поверх универсального железа. Она сама должна стать железом. ## Как нейросеть впаивают прямо в кремний Чтобы понять, в чём фокус, надо вспомнить, почему обычный инференс медленный. На видеокарте веса модели лежат в памяти (HBM или VRAM), и на каждый сгенерированный токен их нужно тащить из памяти в вычислительные блоки и обратно, слой за слоем. Эта «стена памяти» и есть главное узкое место. Taalas убирает память как отдельную сущность. Веса Llama 3.1 8B зашиты прямо в транзисторы чипа. По словам Баича в [интервью The Next Platform](https://www.nextplatform.com/compute/2026/02/19/taalas-etches-ai-models-onto-transistors-to-rocket-boost-inference/?ref=matveev.tech), один транзистор хранит четырёхбитный вес и сразу выполняет умножение на него. Вход просто протекает через слои транзисторов, как вода по трубам. Отдельной загрузки весов нет, потому что весам некуда загружаться, они и есть схема. ![Схема Taalas: веса модели вшиты в кремний, отдельной HBM-памяти нет](https://matveev.tech/content/images/2026/06/taalas-model-on-silicon-diagram.webp) Сам HC1 сделан на 6-нанометровом техпроцессе TSMC, это кристалл площадью 815 мм² с 53 млрд транзисторов ([спеки Taalas](https://taalas.com/products/?ref=matveev.tech)). Llama внутри хранится в урезанном виде, смесь 3- и 6-битных параметров, плюс немного SRAM на чипе под контекст и кэш. Один чип потребляет около 250 ватт, целый сервер примерно 2,5 кВт и стоит в обычной воздушной стойке, без жидкостного охлаждения и стопок памяти. Тут важное отличие от других «убийц Nvidia». Groq и Cerebras делают универсальные ускорители: на них можно скомпилировать любую модель. Taalas намертво зашивает одну конкретную модель. Отсюда и выигрыш в скорости, и главная слабость, о которой ниже. ## 17 000 токенов в секунду: это вообще много? Очень. Для одного пользователя на модели такого класса это запредельная цифра. Вот как HC1 выглядит на фоне остальных на той же Llama 3.1 8B: | Железо | Токенов/с на пользователя | | ----------- | ------------------------- | | Taalas HC1 | \~15 000–17 000 | | Nvidia H200 | \~2 000 | | Cerebras | \~2 000 | | Groq | \~600 | Цифры конкурентов Taalas мерил сам, так что относиться к ним стоит с поправкой на заинтересованность. Но даже независимые замеры впечатляют: журналисты [EE Times](https://www.eetimes.com/taalas-specializes-to-extremes-for-extraordinary-token-speed?ref=matveev.tech) в живом демо стабильно видели больше 15 000 токенов в секунду, а заявленные 17 000 это внутренний пик. Запрос обрабатывается меньше чем за 30 миллисекунд, поэтому ответ и кажется мгновенным. Помимо скорости Taalas обещает примерно в 10 раз меньше энергии на токен и в 20 раз более дешёвое производство. Аналитик Карл Фройнд в [Forbes](https://www.forbes.com/sites/karlfreund/2026/02/19/taalas-launches-hardcore-chip-with-insane-ai-inference-performance?ref=matveev.tech) оценил отрыв осторожнее, в один-два порядка по производительности. Кстати, если тебе где-то попадалась цифра «в 1000 раз эффективнее», это преувеличение из пересказов. Сама Taalas про тысячекратный отрыв не заявляет, реалистичная оценка по энергии на токен ближе к стократной. ## Если так быстро, почему Jimmy тупит? А вот это честная часть. Скорость впечатляет, качество ответов нет. Классический пример из обсуждений на [Hacker News](https://news.ycombinator.com/item?id=47086181&ref=matveev.tech): спрашиваешь, сколько букв «r» в слове strawberry, получаешь «две» за одну тысячную секунды. Кто-то метко назвал Jimmy цифровым спиннером для рук, красиво крутится, толку ноль. ⚠️ HC1 это витрина технологии, а не готовый ассистент. Чип нельзя купить, а зашитую в кремний модель нельзя обновить: новая версия означает новый чип и месяцы на его выпуск. Причин несколько, и все они упираются в саму концепцию. Внутри Llama 3.1 8B, открытая модель почти двухлетней давности, да ещё и сжатая до 3 бит. Контекст в демо упирается примерно в 6 тысяч токенов, длинный документ туда не положишь. И поскольку модель буквально отлита в кремнии, поменять её нельзя. Новая модель означает новый чип. Taalas говорит, что путь от весов до готового железа занимает около двух месяцев, но на фоне моделей, которые обновляются каждые пару месяцев, это много. Поэтому и относиться к Jimmy стоит как к демонстратору идеи. Рабочего ассистента из него пока не сделали, доступ дают через бесплатное демо и заявку на API. Защитники на том же HN повторяют мысль, которая звучит разумно: чип тупит не потому, что подход плохой, а потому, что в него зашили маленькую старую модель. Зашей модель побольше, и она будет работать примерно так же быстро, но отвечать заметно умнее. ## Что model-on-silicon значит для будущего ИИ Вот ради чего стоит смотреть на ChatJimmy. Не ради ответов Jimmy, а ради траектории. В своём [манифесте](https://taalas.com/the-path-to-ubiquitous-ai/?ref=matveev.tech) Taalas проводит аналогию с историей вычислений. Универсальные компьютеры стали массовыми, когда подешевели и упростились до транзистора. С ИИ, по их логике, должно случиться то же самое: из дорогой штуки, которая живёт в датацентрах, он превращается в дешёвый компонент, помещающийся в слот PCIe. Думаю, аналогия натянута ровно настолько, насколько вдохновляет, но направление мысли понятное. Самый живой нерв всей дискуссии не про скорость, а про деньги и контроль. Сейчас почти весь ИИ это аренда: ты платишь за токены и подписки, а железо чужое и стоит в чужом облаке. Если модель уровня Llama или Qwen можно зашить в доступный чип и держать у себя дома или в офисной стойке, вопрос «зачем платить за API» становится неудобным. ИИ как прибор, который купил и пользуешься, а не как счётчик, который тикает. Для приватных данных это вообще другой разговор, я как-то [разбирал локальный запуск моделей для работы с персональными данными](https://matveev.tech/run-openai-privacy-filter-locally/), и там вся боль именно в том, что серьёзный инференс тяжело утащить с облака на свою машину. Дальше начинается интересное. Когда токены почти бесплатны и появляются мгновенно, открываются сценарии, которые на медленном железе бессмысленны: - голосовые ассистенты, отвечающие без паузы, разговор как с живым человеком; - роботы, дроны и автомобили, где задержка критична; - спекулятивное декодирование, когда быстрая модель набрасывает черновик ответа для большой и умной (это, к слову, родственник [трюка с MTP-драфтерами, которым Google ускорил Gemma 4](https://matveev.tech/gemma-4-mtp-drafters/), только на уровне железа); - агентные циклы, где модель генерирует сотню вариантов решения и выбирает лучший; - массовая обработка данных: классификация, чистка персональных данных, превращение хаоса в таблицы. Для всего этого не нужна гениальная модель, нужна быстрая и дешёвая. И вот тут «тупой, но молниеносный» чип внезапно перестаёт быть игрушкой. ✈️ Слежу, как ИИ перебирается из облака на локальное железо, и пишу об этом короче и чаще — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Стоит ли паниковать Nvidia? Вердикт Если коротко: пока нет. Заголовки про «убийцу Nvidia» и «в 74 раза быстрее B200» это маркетинг и хайп СМИ, сама Taalas формулирует аккуратнее. HC1 умеет только инференс, обучать модели всё равно нужно на универсальных GPU. Трезвая оценка с того же Hacker News звучит как «это конкурент не для Nvidia целиком, а максимум для 5–10% рынка», и она мне кажется честной. Но списывать тоже глупо. Перед нами не презентация и не whitepaper, а работающий чип от команды, которая собаку съела на проектировании процессоров в AMD, Nvidia и Tenstorrent, да ещё и с 219 млн долларов за спиной. Они доказали, что модель реально можно отлить в кремний и получить скорость, которой у видеокарт нет и близко. Дальше вопрос инженерный: получится ли так же зашить модель побольше, договориться с темпом, в котором ИИ устаревает, и не утонуть в горах быстро протухающих чипов. Кому стоит потыкать ChatJimmy прямо сейчас: всем, кому интересно, куда катится железо для ИИ. Это редкий случай, когда можно своими руками пощупать идею, которая может оказаться важной через пару лет. Кому не стоит: тем, кто ищет рабочий аналог ChatGPT, тут его нет и не планировалось. Воспринимай Jimmy как демо из будущего, у которого пока не подвезли мозги. Я бы за этим следил. Не из-за Jimmy, а из-за того, что он намекает: ИИ потихоньку нащупывает путь от облачной услуги к вещи, которую просто покупаешь. [ChatJimmyБесплатное демо Taalas: чат работает на чипе HC1 и выдаёт до 17 000 токенов в секунду. Рабочего ассистента в нём не ищи, это демонстратор технологии.chatjimmy.ai](https://chatjimmy.ai/?ref=matveev.tech) ## Частые вопросы **Что такое model-on-silicon простыми словами?** Это подход, при котором веса нейросети физически встроены в транзисторы чипа, а не загружаются из памяти во время работы. Модель перестаёт быть программой и становится самой схемой. За счёт этого пропадает главный тормоз инференса, постоянная пересылка весов между памятью и вычислителем. **Можно ли купить чип HC1 или Jimmy?** Нет. HC1 это демонстратор технологии, в продажу он не поступил. Доступен бесплатный демо-чат на chatjimmy.ai и форма заявки на доступ к API. Полноценный коммерческий продукт Taalas обещает на следующей платформе, HC2. **Заменит ли Taalas видеокарты Nvidia?** В обозримом будущем нет. HC1 делает только инференс и только одной зашитой модели, а обучение и универсальные задачи остаются за GPU. Речь идёт скорее об отдельной нише сверхбыстрого дешёвого инференса, а не о замене Nvidia целиком. ## Что ещё почитать - [Anthropic и SpaceX: 220 тысяч GPU ради лимитов Claude](https://matveev.tech/anthropic-spacex-colossus/) — другой полюс индустрии, где ставку делают на гигантские GPU-кластеры - [Gemma 4 ускорили в 3 раза с помощью MTP-драфтеров](https://matveev.tech/gemma-4-mtp-drafters/) — как ускоряют инференс софтом, а не железом - [Как запустить OpenAI Privacy Filter локально](https://matveev.tech/run-openai-privacy-filter-locally/) — про локальный инференс и зачем он нужен для приватных данных - [DeepSeek V4 Pro: обзор открытой модели для кодинга](https://matveev.tech/deepseek-v4-pro/) — из таких открытых моделей и «отливают» чипы вроде HC1 ### Как запустить OpenAI Privacy Filter локально URL: https://matveev.tech/run-openai-privacy-filter-locally/ Last updated: 2026-07-21T11:24:53.000Z > TL;DR: За десять минут поставим OpenAI Privacy Filter на свою машину и научимся прятать персональные данные в тексте: имена, почты, телефоны, номера карт и API-ключи. Всё локально, без отправки на сервер. Разберём CLI-утилиту `opf`, формат вывода, встраивание в Python, проверим модель на живых данных (включая русские) и настроим под свои тексты. В [обзоре OpenAI Privacy Filter](https://matveev.tech/openai-privacy-filter) я разбирал, что это за модель и где она сильна. Теперь практическая часть: как поставить и запустить. Модель открытая (Apache 2.0) и маленькая, поэтому работает даже на ноутбуке без видеокарты. Задача гайда — довести тебя от пустого терминала до замаскированного текста. ## Что понадобится - Python 3.10 или новее (это требование пакета `opf`) - `git` и `pip` - Примерно 3,5 ГБ места: 2,6 ГБ под веса модели и ещё около гигабайта под зависимости (главная тяжесть — PyTorch) - Видеокарта не обязательна, на CPU всё работает, просто медленнее - Терминал и базовое знакомство с Python ## Шаг 1\. Поставить opf Утилита живёт в [репозитории на GitHub](https://github.com/openai/privacy-filter?ref=matveev.tech). Клонируем, заводим виртуальное окружение и ставим пакет: ```bash git clone https://github.com/openai/privacy-filter.git cd privacy-filter python -m venv .venv && source .venv/bin/activate pip install -e . ``` `pip` подтянет зависимости: `torch`, `huggingface_hub`, `numpy`, `safetensors`, `tiktoken`. После установки в системе появится команда `opf` (её же можно звать как `python -m opf`). ## Шаг 2\. Первый запуск и первый результат Самый простой способ проверить, что всё работает, — скормить модели строку. Тут важный нюанс: по умолчанию `opf` пытается запуститься на CUDA, поэтому на Mac и на любой машине без видеокарты NVIDIA нужен флаг `--device cpu`: ```bash opf --device cpu "Alice was born on 1990-01-02, write her at alice@corp.com" ``` Без флага получишь `AssertionError: Torch not compiled with CUDA enabled`, причём уже после того, как скачаются веса. Я на это наступил, когда проверял гайд на Mac. Если у тебя Linux с картой NVIDIA, флаг не нужен и команда работает как есть. При первом запуске `opf` скачает чекпоинт модели (2,8 ГБ) в `~/.opf/privacy_filter` — путь можно переопределить переменной `OPF_CHECKPOINT` или флагом `--checkpoint`. Скачивание разовое, дальше модель берётся из кеша. А если запустить `opf` вообще без текста, он уйдёт в интерактивный режим: вводишь примеры по одному и сразу видишь разметку с цветной подсветкой прямо в терминале. Удобно, чтобы пощупать модель на своих фразах. ## Шаг 3\. Разобрать, что вернула модель По умолчанию `opf` печатает просто строку с плейсхолдерами: ``` Alice was born on , write her at ``` Для скриптов этого мало, поэтому есть структурированный вывод: добавь флаг `--format json` (в интерактивном режиме JSON включается сам). Вот реальный ответ модели на нашу строку, схема описана в [документации репозитория](https://github.com/openai/privacy-filter/blob/main/OUTPUT%5FSCHEMAS.md?ref=matveev.tech): ```json { "schema_version": 1, "summary": { "output_mode": "typed", "span_count": 2, "by_label": { "private_date": 1, "private_email": 1 }, "decoded_mismatch": false }, "text": "Alice was born on 1990-01-02, write her at alice@corp.com", "detected_spans": [ { "label": "private_date", "start": 18, "end": 28, "text": "1990-01-02", "placeholder": "" }, { "label": "private_email", "start": 43, "end": 57, "text": "alice@corp.com", "placeholder": "" } ], "redacted_text": "Alice was born on , write her at " } ``` Заметь: имя Alice модель не тронула, хотя дату и почту поймала. Это не баг, а консервативный дефолт, к нему вернёмся в шаге 6. Два поля делают всю работу. `detected_spans` — это что модель нашла: тип (`label`), позиции в тексте (`start` и `end`) и заготовленный плейсхолдер. А `redacted_text` — уже готовый текст с подставленными плейсхолдерами, его можно сразу писать обратно в файл. У вывода есть два режима. По умолчанию работает `--output-mode typed`: видны конкретные категории (`private_person`, `private_email` и так далее). Если типы не нужны и задача просто всё вычистить, бери `--output-mode redacted` — тогда любой найденный фрагмент схлопывается в один общий ярлык `redacted`. ## Шаг 4\. Прогнать файлы и логи Гонять по одной строке скучно. `opf` умеет чистить файл целиком: ```bash opf -f customer_notes.txt ``` И встраиваться в пайпы, так что его можно воткнуть в любой однострочник. Например, вытащить из лога строки с пользователями и замаскировать их перед тем, как отдать файл коллеге: ```bash cat app.log | grep "user=" | opf ``` Это и есть основной практический сценарий: чистка логов, заметок и выгрузок до того, как они уедут в хранилище, тикет или чат. ## Шаг 5\. Встроить в свой код на Python Когда модель нужна постоянно, как часть пайплайна (предобработка датасета, фильтр перед индексацией, чистка перед логированием), удобнее дёргать её прямо из кода. Privacy Filter — это обычная token-classification модель из [Hugging Face](https://huggingface.co/openai/privacy-filter?ref=matveev.tech), так что подойдёт стандартный `pipeline`: ```python from transformers import pipeline clf = pipeline( "token-classification", model="openai/privacy-filter", aggregation_strategy="simple", ) spans = clf("Contact Priya at priya@example.co.uk or +44 20 7946 0299") for s in spans: print(s["entity_group"], "->", s["word"]) ``` На выходе получишь список фрагментов с типами, а чем именно их заменять — плейсхолдером, хешем или пустотой — решаешь сам. Одна оговорка: `aggregation_strategy="simple"` иногда режет одну сущность на соседние куски (телефон приехал мне двумя спанами), так что перед заменой склеивай соседние фрагменты одного типа. Дальше это встраивается в любой ETL или препроцессинг. ## Что Privacy Filter ловит на реальных данных Синтетический пример с Alice — это одно, живые данные — другое. Я прогнал через модель десяток типичных кусков текста: тикет в поддержку, строку серверного лога, `.env` с ключами, медицинскую запись и несколько русских примеров. Английский текст модель разбирает почти идеально. Вот тикет в поддержку целиком: ``` Hi, this is from Denver. My order # hasn't arrived. Call me at or email . My address: . ``` Имя, телефон, почта, полный адрес и даже номер заказа. Секреты ловятся уверенно: AWS-ключи из `.env`, ключ OpenAI и Bearer-токен из curl-команды ушли в ``. Медицинская запись тоже чистая: пациент, номер карты MRN, дата госпитализации, контакт родственника. Порадовал и грязный чат без единой заглавной буквы: в «hey its mike hanson, txt me on 07911 123456» модель нашла и имя, и номер. Формальный русский оказался лучше, чем я ждал. Анкету «Меня зовут Анна Ковалёва, живу в Москве на улице Тверская 14, кв. 8...» модель вычистила полностью: имя, адрес, телефон, почта, дата рождения. Паспорт и ИНН из договора ушли в ``. А вот дальше начинаются дыры, ровно там, где обещает следующий шаг: - В неформальном русском чате номер карты «2202 2003 4567 8910» и «вася» с маленькой буквы прошли насквозь, поймался только телефон - На русской морфологии ломаются границы спанов: «выдан 15.03.2015» превратилось в «вы``», маска откусила полслова - «CVV 123» в английском примере ложно пометился как `` - IP-адрес и session id из лога слиплись в один кривой ``: отдельной категории для IP у модели нет, и на логах это будет мешать По скорости вопросов нет: на CPU обычного ноутбука строка обрабатывается за 150–700 мс (после разовой загрузки модели). Для чистки логов в пайпе и препроцессинга датасетов хватает с запасом. ## Шаг 6\. Покрутить баланс точности и полноты Важный момент, на котором спотыкаются. По умолчанию модель консервативна: она настроена на точность и старается не маскировать лишнего. Обратная сторона — она пропускает (в обзоре я приводил тесты Tonic.ai, где полнота на «грязных» данных падала до 10–38%). Если тебе важнее не упустить персональные данные, чем сохранить контекст, декодер можно сдвинуть в сторону более широкого маскирования через operating points. Честное уточнение: готовых пресетов «строже» и «мягче» в комплекте нет. В скачанном чекпоинте лежит `viterbi_calibration.json` с единственной точкой `default`, где все смещения нулевые. Так что придётся сделать копию этого файла, подобрать смещения переходов под свои данные и подложить его через `--viterbi-calibration-path`. Остальные флаги смотри в справке: ```bash opf redact --help ``` Цена за рост полноты — больше ложных срабатываний: обычные слова начинают улетать в маску. Это компромисс, который крутишь под задачу. Для данных, которые пойдут в обучение модели, можно маскировать агрессивнее. Для текста, который потом будут читать аналитики, аккуратность важнее. ## Шаг 7\. Дообучить под свои данные Если домен специфичный (медицинские записи, юридические договоры, свой формат логов), дефолтная модель будет мазать. Лечится это дообучением, и оно недорогое: OpenAI приводит пример, где F1 на узкой задаче вырос с 54% до 96% на небольшом наборе данных. Минимальный запуск выглядит так: ```bash opf train train.jsonl \ --validation-dataset val.jsonl \ --output-dir ./my_checkpoint ``` Формат данных — JSONL: в каждой строке поле `text` и размеченные `spans`. Можно задать собственную таксономию меток через `--label-space-json` (первой меткой обязательно должна идти фоновая `O`). На выходе появится папка с `config.json` и `model.safetensors`, которую потом подсовываешь через `--checkpoint`. Подробности и готовые демо-скрипты лежат в [FINETUNING.md](https://github.com/openai/privacy-filter/blob/main/FINETUNING.md?ref=matveev.tech). Тут я даю это обзорно, полноценное дообучение тянет на отдельный разбор. ## Результат Если всё прошло гладко, у тебя на машине крутится инструмент, который из строки «Иван Петров, +7 900 123-45-67, ключ sk-abc123» делает `, , ключ `, не выходя в интернет. Я проверил на этом самом примере, он работает. Им можно чистить отдельные файлы, пайпить логи и дёргать его из Python внутри своего пайплайна. 🛠️ Собираю практичные инструменты для разработчиков и разбираю, что из AI реально приносит пользу, а что хайп — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Частые ошибки `pip install` падает? Скорее всего, у тебя Python ниже 3.10\. Проверь `python --version` и заведи окружение на свежей версии. Запуск падает с `Torch not compiled with CUDA enabled`? Это дефолтный `--device cuda`, у которого нет автоматического отката на процессор. Добавь `--device cpu`, на Mac этот флаг обязателен всегда. Первый запуск долго висит, потому что `opf` качает веса, а модель весит как полтора миллиарда параметров. На машине без интернета скачай чекпоинт заранее и укажи путь через `OPF_CHECKPOINT` или `--checkpoint`. Если кажется, что модель ничего не находит, это тот самый консервативный дефолт из шага 6\. На русском и нетипичном домене она пропускает особенно много. Лечится настройкой полноты или дообучением, переустановка не поможет. ## FAQ **Можно ли запустить без Python, прямо в браузере?** Да. Модель собрана под Transformers.js и крутится на WebGPU без сервера. Минимальный вызов: `pipeline("token-classification", "openai/privacy-filter", { device: "webgpu", dtype: "q4" })`, дальше передаёшь текст и получаешь те же размеченные фрагменты. **Работает ли он с русским языком?** Частично. Формальный русский текст (анкеты, договоры) модель разбирает на удивление хорошо: имена, адреса, телефоны, паспорта находит. А на неформальном чате мажет: пропускает имена с маленькой буквы и номера карт, откусывает половины слов при маскировании. Для серьёзной работы с русским нужно дообучение на своих данных. **Это делает данные безопасными для GDPR?** Нет. Privacy Filter маскирует и минимизирует данные, но не является анонимизацией или сертификацией соответствия. Это лишь один из слоёв защиты, юридической гарантии он не даёт. **Нужна ли видеокарта?** Нет. На CPU всё считается, просто медленнее, только не забывай флаг `--device cpu`. Для разовых задач и небольших объёмов процессора достаточно. **Чем заменяются найденные данные?** В режиме `typed` — типизированными плейсхолдерами вроде `` или ``. В режиме `redacted` — одним общим ``. [openai/privacy-filter · GitHubИсходный код CLI opf, инструкции по установке, дообучению и оценке модели. Лицензия Apache 2.0.GitHub](https://github.com/openai/privacy-filter?ref=matveev.tech) ## Что ещё почитать - [OpenAI Privacy Filter: обзор открытой модели для PII](https://matveev.tech/openai-privacy-filter) — что за модель, бенчмарки и честные минусы - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor) — ещё один сильный open-weight релиз - [GLM-5.2 в Claude Code: 1M контекста дешевле Claude](https://matveev.tech/glm-5-2-claude-code) — про запуск открытых моделей с пользой для кошелька ### Certimate: SSL-сертификаты на автопилоте, self-hosted URL: https://matveev.tech/certimate/ Last updated: 2026-07-20T16:27:23.000Z > TL;DR: Certimate — бесплатный open-source инструмент, который сам выпускает, продлевает и раскладывает SSL-сертификаты по серверам, CDN и Kubernetes. Ставится одной командой в Docker, ест \~16 МБ памяти, управляется через веб-панель с визуальными workflow. Для тех, у кого сертификатов больше одного, а certbot уже надоел. Сертификаты Let's Encrypt живут 90 дней. А дальше будет веселее: [CA/Browser Forum решил](https://cabforum.org/2025/04/11/ballot-sc081v3-introduce-schedule-of-reducing-validity-and-data-reuse-periods/?ref=matveev.tech), что срок жизни публичных TLS-сертификатов будет сокращаться поэтапно: 200 дней в 2026-м, 100 дней в 2027-м и всего 47 дней с марта 2029 года. Ручное продление умирает как класс. Вопрос только в том, чем именно автоматизировать. Наткнулся на [Certimate](https://github.com/certimate-go/certimate?ref=matveev.tech) — и, похоже, это один из самых приятных вариантов для тех, кто хочет UI вместо крон-джобов с acme.sh. ## Что такое Certimate и зачем он нужен? Certimate — self-hosted ACME-инструмент, который закрывает весь жизненный цикл сертификата: выпуск, деплой на нужные площадки, продление до истечения срока и мониторинг. Всё настраивается через веб-интерфейс в виде workflow: получить сертификат → разложить по серверам → прислать уведомление в Telegram. Проект написан на Go, распространяется под MIT-лицензией и живёт на GitHub с августа 2024 года. За два года набрал [8,8 тыс. звёзд и 850+ форков](https://github.com/certimate-go/certimate?ref=matveev.tech), проект живой: последний релиз v0.4.27 вышел 15 июля 2026 года. Что подкупает — минимализм в хорошем смысле. Один бинарник без внешних зависимостей: не нужны база данных, рантаймы, фреймворки. Заявленное потребление памяти — около 16 МБ. Данные хранятся локально на твоём сервере, наружу ничего не уезжает. ## Быстрый старт: Certimate в Docker за минуту Разработчики обещают запуск за минуту, и тут без преувеличения. Шаги такие: 1. Запусти контейнер: ```bash docker run -d \ --name certimate \ --restart unless-stopped \ -p 8090:8090 \ -v /etc/localtime:/etc/localtime:ro \ -v $(pwd)/data:/app/pb_data \ certimate/certimate:latest ``` 1. Открой `http://127.0.0.1:8090` в браузере. 2. Войди под дефолтным админом: логин `admin@certimate.fun`, пароль `1234567890`. Первым делом смени пароль — панель имеет доступ к API-ключам твоих DNS-провайдеров, оставлять дефолтную учётку нельзя. 3. Добавь авторизацию DNS-провайдера (например, API-токен Cloudflare) в разделе Access. 4. Создай workflow: домен → способ проверки (DNS-01 или HTTP-01) → куда деплоить → канал уведомлений. Дальше Certimate сам продлевает сертификат до истечения срока. Если Docker не хочется, есть [готовые бинарники](https://github.com/certimate-go/certimate/releases?ref=matveev.tech) под Windows, Linux и macOS: скачал, распаковал, запустил `./certimate serve`. Вот видео-демо интерфейса из официального README. Озвучка на китайском, но что происходит в UI — понятно и без неё: ## Какие возможности есть у Certimate? Главная фишка — workflow-оркестрация. Ты не просто выпускаешь сертификат, а собираешь цепочку: выпуск → деплой сразу на несколько целей → уведомление. Один wildcard-сертификат можно разложить на nginx, CDN и балансировщик за один прогон. По данным [документации](https://docs.certimate.me/en-US/docs/introduction?ref=matveev.tech), поддержка провайдеров внушительная: - 70+ DNS-провайдеров для проверки владения доменом: AWS, Cloudflare, GoDaddy, Alibaba Cloud, Tencent Cloud и другие - 150+ целей деплоя: Kubernetes-секреты, CDN, WAF, балансировщики, обычные серверы по SSH - несколько удостоверяющих центров: Let's Encrypt, ZeroSSL, Google Trust Services, SSL.com, Actalis. Если один CA заглючит, переключаешься на другой - форматы PEM, PFX и JKS. Пригодится, если в хозяйстве есть Java-приложения или Windows-серверы Сертификаты можно выпускать на один домен, несколько доменов, wildcard и даже на IP-адрес, с ключами RSA или ECC. Уведомления прилетают в email, Telegram, Discord, Slack и ещё пачку каналов. ## Чем Certimate лучше acme.sh и Caddy? Автор проекта [сам отвечает на этот вопрос](https://docs.certimate.me/en-US/blog/why-certimate?ref=matveev.tech). Если у тебя один сайт на одном VPS — бери acme.sh или Caddy и не мучайся. Caddy вообще получает сертификаты автоматически, но только для себя самого. Certimate выигрывает, когда площадок много и они разные. Фронтенд на CDN или в объектном хранилище, API за балансировщиком, пара сервисов в Kubernetes — acme.sh с этим зоопарком уже не справится, а ходить по серверам и настраивать его на каждом руками надоест быстро. Тут и появляется ценность единой панели: все сертификаты, все деплои и все сроки истечения в одном месте. Ну и порог входа ниже: коллега, который побаивается SSH, справится с выпуском сертификата по подсказкам в UI. ✈️ Про такие self-hosted находки для homelab и инженерной рутины пишу коротко и без воды — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Сколько стоит Certimate? Нисколько. Проект полностью бесплатный и открытый, лицензия MIT, никаких платных тарифов, облачных подписок и ограничений по количеству доменов. Платишь только за свой сервер, на котором это крутится. С учётом аппетита в 16 МБ памяти сгодится даже самый дешёвый VPS или Raspberry Pi в кладовке. ## Плюсы и минусы Certimate **Что понравилось:** - Установка действительно за минуту, zero dependencies - Визуальные workflow: видно всю цепочку от выпуска до деплоя - Огромный список провайдеров и целей деплоя, включая Kubernetes - Несколько CA на выбор — есть запасной вариант, когда Let's Encrypt лежит - Бесплатно и self-hosted, данные не уезжают в чужое облако **Что не понравилось:** - Проект молодой, версия всё ещё 0.4.x — были ломающие миграции между версиями - Заметный уклон в китайскую экосистему: часть провайдеров и каналов уведомлений (DingTalk, Feishu, WeCom) вряд ли пригодятся, часть материалов сообщества на китайском - Веб-панель хранит API-ключи DNS-провайдеров — это ещё один сервис, который надо прятать за VPN или файрвол, наружу такое выставлять нельзя ## Вердикт: кому нужен Certimate? Мне кажется, идеальный пользователь Certimate — это человек с homelab или небольшая команда с 5–20 доменами, раскиданными по разным площадкам. Я как раз держу дома сервер с пачкой сервисов за реверс-прокси, и идея видеть все сертификаты в одной панели вместо разрозненных крон-джобов мне откликается. Собираюсь погонять его на своём Proxmox. Кому не нужен: если у тебя один сайт за Cloudflare или Caddy, автоматизация уже есть из коробки, и лишний сервис ничего не добавит. Если ты enterprise с сотнями сертификатов и требованиями аудита — смотри в сторону коммерческих решений, версия 0.4 пока не про SLA. А вот для всех, кто посередине, Certimate выглядит как тот редкий open-source инструмент, который делает ровно одну вещь и не просит за это денег. С учётом того, что сертификаты скоро будут жить 47 дней, обзавестись такой автоматизацией стоит уже сейчас. [Certimate — self-hosted SSL certificates ACME toolОткрытый инструмент для автоматического выпуска, деплоя и продления SSL-сертификатов. MIT, один бинарник, веб-панель с workflow.GitHub](https://github.com/certimate-go/certimate?ref=matveev.tech) ## Что ещё почитать - [Cork — GUI для Homebrew, который заменит терминал](https://matveev.tech/cork-homebrew-gui-macos/) — та же философия: удобный интерфейс поверх консольного инструмента - [Почему CLI-инструменты снова стали важны](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text/) — обратная сторона: когда консоль лучше UI - [Apify Agent Skills: парсинг всего интернета через AI-агента](https://matveev.tech/apify-agent-skills-parsing/) — ещё один open-source инструмент для автоматизации рутины ### Модель и effort level в Claude Code: как это работает URL: https://matveev.tech/claude-code-model-effort-level/ Last updated: 2026-07-19T12:53:31.000Z > TL;DR: В Claude Code два главных рычага — модель (какой набор знаний) и effort level (сколько думать над задачей). Если Claude не знает — меняй модель. Если не старался — поднимай effort. Для большинства задач дефолты работают нормально, и крутить ничего не нужно. Если работаешь в Claude Code, наверняка было такое: подаёшь задачу, получаешь что-то неправильное, начинаешь экспериментировать — пробуешь другую модель, ставишь `/effort high`, и непонятно что именно помогло. Команда Claude опубликовала [подробное объяснение](https://claude.com/blog/claude-model-and-effort-level-in-claude-code?ref=matveev.tech), как эти два параметра работают на самом деле. Коротко пересказываю. ## Что происходит, когда жмёшь Enter Когда отправляешь запрос, Claude Code собирает всё — твоё сообщение, system prompt, инструкции из CLAUDE.md, историю диалога, открытые файлы — в один API-запрос. На сервере этот текст **токенизируется**: разбивается на куски, каждый кусок заменяется числом из фиксированного словаря. `const` превращается в 1978, `await` — в 4293. ![Токенизатор разбивает текст на токены с числовыми ID](https://matveev.tech/content/images/2026/07/claude-code-tokenizer.png) Дальше модель берёт эту последовательность чисел и предсказывает следующий токен. Не весь ответ сразу — один токен, потом ещё один, снова и снова. 200-токенный ответ — это 200 отдельных проходов через модель. Предсказания определяются **весами** (weights, параметры). Это миллиарды чисел, в которых зашито всё что модель знает — о TypeScript, Go, паттернах архитектуры, популярных библиотеках. После обучения веса заморожены. Ни твой промпт, ни CLAUDE.md, ни контекст их не меняют. Отсюда вытекают две вещи. Во-первых, почему Claude галлюцинирует API — он генерирует правдоподобную последовательность токенов из того, что видел на обучении, а не ищет информацию в документации. Во-вторых, почему подсунуть документацию в контекст работает — ты управляешь предсказанием, но не обучаешь модель. Она не запомнит эту библиотеку после сессии. Когда меняешь модель — меняешь набор весов. Другая модель = другие замороженные знания, другая цена за токен. ## Как работает effort level Всё что Claude выдаёт — токены: видимые размышления (thinking), вызовы инструментов, финальный ответ тебе. Всё из одного и того же цикла генерации, по одной цене за токен. Effort level передаётся в запросе рядом с твоим промптом. Модель обучена реагировать на него — это часть весов. Высокий effort — сигнал для модели: убедись в результате прежде чем говорить «готово». На практике это больше thinking, больше проверок, пересмотр промежуточных результатов. ![Одинаковый промпт на двух уровнях effort: вариант с высоким effort генерирует примерно в 7 раз больше токенов](https://matveev.tech/content/images/2026/07/claude-code-effort-comparison.png) Важная деталь: effort — не жёсткий лимит токенов. Если задача простая, Claude не будет искусственно раздувать ответ. Команда Anthropic говорит, что «overthinking» специально отслеживается при обучении — он ухудшает результат. На практике ты видишь это когда task list в Claude Code редактируется прямо во время выполнения: нашёл баг на первой гипотезе — написал «оставшиеся две пропускаем» и пошёл дальше. ## Fable, Opus, Sonnet — аналогия, которую стоит запомнить Lydia Hallie из команды Claude Code предложила фрейм, который мне понравился. Fable — специалист, видевший задачи, каких никто больше не видел: одного взгляда хватает, чтобы заметить то, что все пропустили. Opus — эксперт с глубоким опытом, идёшь к нему с архитектурным решением или хитрым багом. Sonnet — крутой универсал, который разберётся в твоём конкретном коде. Effort level — это сколько времени ты им даёшь. **Opus на низком effort** — как пять минут с экспертом. Он принесёт опыт, которого нет в твоём кодовой базе: паттерны, которые он видел, ловушки, которые знает. Но пять минут — это быстрый взгляд, не внимательное чтение. **Sonnet на высоком effort** — как отдать задачу универсалу на весь день. Он прочтёт всё, запустит тесты, перепроверит. Чего принесёт меньше — интуицию «я видел именно это раньше». Fable отдельная история. Даже на низком effort он замечает то, что другим не видно. Именно за это ты платишь больше всего — и поэтому имеет смысл беречь его для задач, где это реально нужно. ## Что делать, когда Claude ошибается Первый инстинкт — покрутить настройки. Правильный — сначала посмотреть на контекст. Промпт достаточно конкретный? Claude подключён к нужным инструментам? Задача хорошо сформулирована? Если с контекстом всё окей, тогда один вопрос: ![Два вопроса помогают выбрать правильный рычаг: менять модель или поднимать effort](https://matveev.tech/content/images/2026/07/claude-code-effort-model-heuristic.png) Если Claude уверенно выдавал что-то неправильное независимо от контекста — не знал. Меняй на более сильную модель. Если пропустил файл, не запустил тесты, не перепроверил — не старался. Поднимай effort. Это эвристика, не жёсткое правило. Но обычно помогает быстро найти нужный рычаг. ✈️ Если хочешь быть в курсе новых инструментов и как работает Claude Code — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Модель, effort и деньги На простых задачах обе модели справляются одинаково. Большая тратит больше токенов на дополнительные проверки и стоит дороже за токен. Вывод: на рутине Sonnet сэкономит без потери качества. На сложных многошаговых задачах ситуация другая. Sonnet шлифует задачу через много итераций, пока Opus добирается до той же точки за меньшее количество шагов. Платишь больше за токен, но меньше токенов в итоге. ![На сложных задачах большая модель может быть дешевле: меньше итераций для достижения нужного результата](https://matveev.tech/content/images/2026/07/claude-code-hard-task-curves.png) С Fable разрыв максимальный. Он справляется с задачами, которые Opus и Sonnet не могут закрыть вообще — даже на максимальном effort. И при этом стоит больше всего за токен. Поэтому лучше приберечь его для действительно тяжёлых задач. Ещё нюанс: effort влияет на то, сколько Claude готов потратить, но не ограничивает жёстко. Единственный жёсткий лимит — `max_tokens`, который обрезает ответ посередине. Это грубый инструмент, в основном для API-разработчиков. В обычной работе лучше давать инструкции в промпте или ставить task budget. ## Что ещё почитать - [Artifacts в Claude Code: живые страницы для команды](https://matveev.tech/claude-code-artifacts) — ещё одна недооценённая фича Claude Code - [Claude Sonnet 5: агентность как у Opus, но дешевле](https://matveev.tech/claude-sonnet-5) — обзор модели, которую теперь стоит рассматривать как основную ### Kimi K3: открытая модель на 2,8 трлн параметров URL: https://matveev.tech/kimi-k3/ Last updated: 2026-07-17T09:57:38.000Z > TL;DR: Moonshot AI выпустила [Kimi K3](https://www.kimi.com/blog/kimi-k3?ref=matveev.tech) — первую открытую модель класса 3T: 2,8 трлн параметров, нативное зрение и контекст 1 млн токенов. По бенчмаркам она уступает только Claude Fable 5 и GPT-5.6 Sol, а остальных обходит. Веса обещают выложить к 27 июля 2026. Открытые модели догоняли закрытый фронтир давно, но обычно с отставанием на поколение. Kimi K3 сокращает разрыв до минимума: по данным Moonshot, модель проигрывает только двум самым сильным проприетарным моделям — Claude Fable 5 и GPT-5.6 Sol, и при этом стабильно обходит всё остальное, включая Claude Opus 4.8 и GPT-5.5\. Разбираю, что внутри и почём. ## Что такое Kimi K3? Kimi K3 — флагманская модель Moonshot AI на 2,8 трлн параметров. Это первая открытая модель такого масштаба: по словам компании, девять из последних двенадцати месяцев именно модели Kimi держали верхнюю планку размеров среди open source. Ключевые характеристики из [анонса](https://www.kimi.com/blog/kimi-k3?ref=matveev.tech): - 2,8 трлн параметров, MoE-архитектура с активацией 16 из 896 экспертов - Контекст 1 млн токенов - Нативная мультимодальность: текст, картинки и видео в одной модели - Масштабирование примерно в 2,5 раза эффективнее, чем у Kimi K2 *Важная оговорка: «открытая» пока означает «будет открытой». На старте модель доступна только через продукты Kimi и API, а полные веса обещают выложить к 27 июля 2026 вместе с техническим отчётом.* ## Как Kimi K3 выглядит на фоне Claude Fable 5 и GPT-5.6 Sol? K3 уступает Claude Fable 5 и GPT-5.6 Sol. ![Сравнение Kimi K3 с Claude Fable 5, GPT-5.6 Sol и другими моделями на бенчмарках](https://matveev.tech/content/images/2026/07/kimi-k3-benchmarks.jpg) Несколько показательных строк из полной таблицы: | Бенчмарк | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | | --------------------------- | ------- | -------------- | ----------- | --------------- | | DeepSWE (кодинг) | 67.5 | 70.0 | 73.0 | 59.0 | | Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | | SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | | BrowseComp (агентный поиск) | 91.2 | 88.0 | 90.4 | 84.3 | | GPQA-Diamond (знания) | 93.5 | 92.6 | 94.1 | 91.0 | | HLE-Full | 43.5 | 53.3 | 44.5 | 49.8 | В агентных задачах и долгих кодинг-сессиях K3 местами выходит на первое место (SWE Marathon, BrowseComp, Automation Bench). В чистом ризонинге модель держится рядом с лидерами, а вот на Humanity's Last Exam отстаёт ощутимо. И всё равно для открытой модели это территория, куда раньше никто не добирался. К бенчмаркам от вендора всегда стоит относиться с поправкой: Moonshot сравнивает модели в разных харнессах (KimiCode, Claude Code, Codex), а результаты Claude Fable 5 частично получены с fallback на Opus 4.8, когда Fable отказывался выполнять задачи. Методология подробно расписана в футноутах анонса. ## Что у Kimi K3 под капотом? Главные архитектурные новинки — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). KDA отвечает за эффективное внимание на длинных последовательностях, AttnRes выборочно достаёт представления с разных глубин модели вместо равномерного накопления. Вместе они, по словам Moonshot, дают ту самую 2,5-кратную эффективность масштабирования по сравнению с K2. Модель обучалась с quantization-aware training начиная со стадии SFT — веса MXFP4, активации MXFP8\. Это сделано для совместимости с широким спектром железа. Для инференса Moonshot рекомендует суперноды от 64 ускорителей и уже законтрибьютила поддержку prefix caching для KDA в vLLM. ## Что Kimi K3 делает в автономных сессиях? Самая впечатляющая часть анонса — кейсы долгих автономных прогонов. Moonshot тестировала модели в одинаковых песочницах с лимитом до 24 часов на оптимизацию GPU-кернелов. K3 за 15 часов непрерывных итераций ускорила кернел AttnRes с 283,6 мс до 114,4 мс, придумав двухфазный алгоритм и сохранив численную точность. Результат на уровне Claude Fable 5, но K3 оптимизировала быстрее за итерацию. Дальше больше. K3 с нуля написала MiniTriton — компактный Triton-подобный компилятор с собственным IR-слоем над MLIR и генерацией PTX. На roofline-бенчмарках он местами обгоняет сам Triton и выдерживает end-to-end обучение nanoGPT со стабильной сходимостью. А в 48-часовом автономном прогоне K3 спроектировала чип под нано-модель на собственной архитектуре: open-source EDA-инструменты, библиотека Nangate 45nm, 4 мм², тайминг на 100 МГц и 8 700 токенов в секунду в симуляции. Чип, спроектированный моделью для модели. Про то, как нейросети впаивают в кремний всерьёз, я писал в [обзоре Taalas ChatJimmy](https://matveev.tech/taalas-chatjimmy/) — а тут модель сама выступает в роли проектировщика. ![Процедурный 3D-мир с лесами, деревней и горами, который Kimi K3 собрала на Three.js WebGPU](https://matveev.tech/content/images/2026/07/kimi-k3-open-world.png) Есть и более наглядные кейсы: браузерная 3D-игра с процедурной генерацией мира на Three.js WebGPU, интерактивный отчёт по 42 годам индустрии ASIC (2 800+ веб-запросов, 11 000+ страниц источников) и монтаж собственного тизера из 56 клипов с попаданием склеек в бит. Обычному монтажёру такой ролик стоил бы день-два работы. ✈️ Слежу за гонкой открытых моделей с закрытым фронтиром и разбираю такие релизы по горячим следам — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Сколько стоит Kimi K3 и как попробовать? Модель уже доступна на kimi.com, в Kimi Work, Kimi Code и через API. Цены по [прайсу Kimi API](https://platform.moonshot.ai/?ref=matveev.tech): $0.30 за миллион входных токенов при попадании в кэш, $3.00 при промахе и $15.00 за миллион выходных. Для сравнения: это заметно дешевле закрытых флагманов, а кэш-хит в кодинг-задачах, по данным Moonshot, превышает 90%. В терминале модель включается через Kimi Code командой `/model`. На старте K3 работает только с максимальным thinking effort, режимы попроще обещают добавить позже. [Kimi K3 — попробовать бесплатноЧат с Kimi K3 на kimi.com, агентные задачи, Kimi Work и Kimi Code. Модель доступна с максимальным thinking effort.Moonshot AI](https://www.kimi.com/en?ref=matveev.tech) ## Какие у Kimi K3 ограничения? Во-первых, модель обучена в режиме сохранения истории размышлений: если харнесс не передаёт thinking-контент обратно или вы переключаетесь на K3 посреди сессии с другой моделью, генерация может стать нестабильной. Во-вторых, K3 склонна к самодеятельности: при неоднозначной задаче она принимает решения за пользователя. Лечится это явными ограничениями в системном промпте или AGENTS.md. В-третьих, сама компания признаёт заметный разрыв в пользовательском опыте с Claude Fable 5 и GPT-5.6 Sol. ## Что ещё почитать - [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/) — один из двух главных конкурентов K3 из таблицы бенчмарков - [Claude Sonnet 5: агентность как у Opus, но дешевле](https://matveev.tech/claude-sonnet-5/) — как Anthropic удешевляет агентные сценарии - [Taalas ChatJimmy: нейросеть, впаянная в кремний](https://matveev.tech/taalas-chatjimmy/) — продолжение темы «модель и железо», только с другой стороны ### GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI URL: https://matveev.tech/gpt-5-6-sol/ Last updated: 2026-07-07T13:56:25.000Z > TL;DR: OpenAI открыла превью GPT-5.6, нового поколения сразу из трёх моделей. Sol это флагман, Terra сбалансированная и вдвое дешевле GPT-5.5, Luna самая быстрая и доступная. Пока доступ ограниченный, через API и Codex, а в ChatGPT модели обещают [в ближайшие недели](https://openai.com/index/previewing-gpt-5-6-sol/?ref=matveev.tech). OpenAI [представила](https://openai.com/index/previewing-gpt-5-6-sol/?ref=matveev.tech) GPT-5.6 и заодно поменяла логику названий. Теперь цифра отвечает за поколение, а имена Sol, Terra и Luna задают уровень по интеллекту, скорости и цене, и каждый такой уровень развивается своим темпом. Sol выжимает максимум. Terra по производительности близка к 5.5, но стоит вдвое меньше. Luna дотягивается до сильного результата за минимальные деньги. Ценник за 1M токенов такой: Sol $5/$30, Terra $2.5/$15, Luna $1/$6. Внутри появились два режима рассуждения. `max` даёт модели максимум времени на размышление, а `ultra` подключает подагентов и распараллеливает сложные задачи. По замерам OpenAI, Sol ставит новый рекорд на Terminal-Bench 2.1 (это про командную строку, планирование и работу с инструментами), обходит 5.5 в геномике на GeneBench v1 при меньшем расходе токенов и прибавляет в кибербезопасности. На ExploitBench Sol тягается с Mythos Preview, тратя примерно треть выходных токенов. Половина анонса при этом про безопасность. Превью стартует только для узкого круга доверенных партнёров, а планы и возможности моделей OpenAI заранее показала правительству США. Широкий доступ через ChatGPT, Codex и API обещают через несколько недель. Ещё деталь: Sol запустят на чипах Cerebras со скоростью до 750 токенов в секунду уже в июле. ## Почему это важно Бенчмарки тут не главное. Зацепили две вещи. Первая — цена. Terra работает на уровне 5.5, но вдвое дешевле, а рядом стоит совсем бюджетная Luna. Это прямое давление на Gemini и на открытые модели вроде [MiniMax](https://matveev.tech/minimax-m3-obzor) и DeepSeek, которые как раз отъедали у OpenAI аудиторию ценой. Вторая — госконтроль доступа. OpenAI сама пишет, что не хочет превращать согласование релизов с правительством в норму, потому что так лучшие инструменты дольше не доходят до разработчиков и защитников. За этой границей между «модель слишком сильна в кибербезе» и «дайте людям спокойно работать» стоит последить. Для большинства из нас вывод простой. Когда поколение доедет до ChatGPT и API без ограничений, Terra вполне может стать новым дефолтом по соотношению цена/качество. А пока это превью, и пощупать его самим не выйдет. ## Что ещё почитать - [GPT-5.5 и GPT-5.5 Pro: обзор моделей OpenAI](https://matveev.tech/gpt-5-5-openai-obzor) — предыдущее поколение, с которым сравнивают 5.6 - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8) — флагман Anthropic, главный конкурент Sol ### Claude Sonnet 5: агентность как у Opus, но дешевле URL: https://matveev.tech/claude-sonnet-5/ Last updated: 2026-07-02T10:47:38.000Z > TL;DR: Claude Sonnet 5 — самый агентный Sonnet от Anthropic. Он подобрался вплотную к [Opus 4.8](https://matveev.tech/claude-opus-4-8/) по автономной работе (планирование, браузер, терминал, кодинг), но стоит заметно меньше: от $2 за миллион входных токенов на старте. Главная идея — регулируемый уровень усилий, которым ты сам двигаешь ползунок между ценой и качеством. Раньше расклад был простой: хочешь серьёзную агентную работу — плати за Opus. Sonnet брали для задач попроще и подешевле. Sonnet 5 этот расклад ломает. Anthropic пишет в [анонсе](https://www.anthropic.com/news/claude-sonnet-5?ref=matveev.tech), что модель делает автономно то, что ещё пару месяцев назад требовало моделей покрупнее и подороже. Разберёмся, так ли это на самом деле и кому стоит переходить. ## Что такое Claude Sonnet 5 и зачем он нужен Sonnet 5 — новая средняя модель в линейке Claude, вышла 30 июня 2026 года. Именно с моделей Sonnet-класса (3.5, 3.6, 3.7) когда-то началась вся агентная история: они первыми показали, что ИИ умеет нормально кодить и пользоваться инструментами. Потом лидерство ушло к Opus, а Sonnet остался «рабочей лошадкой для задач попроще». Sonnet 5 сокращает этот разрыв. Anthropic позиционирует его как модель, которая близка к Opus 4.8 по агентным способностям (рассуждение, работа с инструментами, кодинг, работа со знаниями), но обходится дешевле. Проще говоря, тебе больше не нужно платить за флагман ради того, чтобы агент довёл сложную задачу до конца. ## Насколько Sonnet 5 близок к Opus 4.8? Sonnet 5 не обгоняет Opus 4.8, что логично. На двух ключевых агентных бенчмарках (BrowseComp для автономного поиска и OSWorld-Verified для управления компьютером) Sonnet 5 строго лучше предшественника Sonnet 4.6 и покрывает гораздо более широкий диапазон «цена/качество», чем Opus 4.8. Всё завязано на уровне усилий (effort level). На среднем усилии Sonnet 5 даёт заметно лучшую экономику: тот же результат за меньшие деньги. На высоком — местами дотягивается до Opus 4.8\. То есть ты сам решаешь, где на шкале «дёшево и быстро ↔ дорого и максимально точно» тебе сейчас удобно. 🎚️ Уровень усилий — это ползунок «качество» внутри одной модели. Среднее усилие берёшь на рутину, высокое — когда нужна точность уровня Opus. Платишь ровно за то, что нужно задаче. ## Как начать пользоваться Claude Sonnet 5 Порог входа нулевой: - **В приложении Claude** ничего переключать не надо: Sonnet 5 уже стоит по умолчанию на бесплатном и Pro-тарифах, а на Max, Team и Enterprise доступен из списка моделей. - **В Claude Code** модель в строю сразу. Гоняешь агентов в терминале — просто выбери `claude-sonnet-5`. - **Через API** идентификатор всё тот же, `claude-sonnet-5`. Добавилась регулировка усилия под проект, и лимиты Anthropic под это подняла (в чате, Cowork, Claude Code и на платформе). Если ты раньше сидел на Sonnet 4.6 через API, миграция сводится к смене идентификатора модели. Но есть нюанс с токенизатором, о нём ниже в разделе про цены. ## Что Sonnet 5 умеет на практике Anthropic собрала фидбек от команд с ранним доступом, и там повторяется один и тот же мотив: модель доводит дело до конца там, где прежние Sonnet останавливались на полпути. Больше всего меня зацепил кейс с отладкой. Тестер попросил Sonnet 5 разобраться с багом, а модель сама написала воспроизводящий тест, внесла фикс и откатила его обратно — просто чтобы убедиться, что без изменений баг возвращается. Всё за один проход, без пошагового понукания. Это уже полноценный инженерный цикл, а не автодополнение. Хвалят и за работу с грязным кодом: brownfield с гонками состояний и скрытыми тестами, который никто не хочет трогать. Модель ищет настоящую причину сбоя и не ограничивается симптомом. Показательна и многошаговая автоматизация — в одном кейсе Sonnet 5 обновил тиры аккаунтов в Salesforce и разослал анонс контактам от начала до конца, хотя раньше такие связки застревали на середине. А ещё почти все тестеры отмечают: модель сверяет свой вывод сама, без напоминаний. Для агента это дорогого стоит, до тебя доходит меньше мусора. Если свести к одному: Sonnet 5 заточен под задачи, где важна не одна реплика, а вся цепочка действий до проверенного результата. Раньше за это доплачивали Opus. Похожую эволюцию я разбирал в обзоре [Claude Opus 4.8](https://matveev.tech/claude-opus-4-8/), и теперь эти способности спускаются в средний ценовой сегмент. ✈️ Разбираю, как агентные модели дешевеют и где автономность реально экономит время, а где пока буксует — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Сколько стоит Claude Sonnet 5 На старте, до 31 августа 2026 года, действуют вводные цены. Потом переход на стандартный тариф: | Период | Вход (за 1M токенов) | Выход (за 1M токенов) | | --------------------------------- | -------------------- | --------------------- | | До 31 августа 2026 (вводная цена) | $2 | $10 | | После 31 августа 2026 | $3 | $15 | Для сравнения: это в разы дешевле, чем держать на потоке Opus-класс. Именно в этом вся суть релиза — агентная работа почти опусовского уровня по цене среднего сегмента. Но есть честный нюанс, о котором Anthropic пишет мелким шрифтом. Sonnet 5 использует обновлённый токенизатор (как в [Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor/)). Он улучшает качество, но у него есть побочка: тот же текст теперь может разбиваться на большее число токенов, примерно в 1,0–1,35 раза в зависимости от типа контента. То есть номинальная цена за токен упала, но токенов на ту же задачу может уйти чуть больше. Anthropic уверяет, что вводные цены подобраны так, чтобы переход с Sonnet 4.6 вышел примерно нейтральным по деньгам. Проверять это стоит на своих реальных нагрузках, а не на калькуляторе. ## Безопасность: что изменилось По части безопасности Sonnet 5 в целом аккуратнее предшественника. Он реже галлюцинирует, меньше подхалимничает (той самой sycophancy, когда модель поддакивает вместо честного ответа) и лучше держит удар при prompt injection — то есть не ведётся, когда его пытаются перехватить через вредоносный ввод. Интересный момент с кибербезопасностью. Anthropic специально не тренировала Sonnet 5 на таких задачах, и в опасных сценариях он заметно слабее Opus. В совместном с Mozilla тесте на разработку эксплойтов для Firefox модель ни разу не собрала рабочий эксплойт (0,0%). И это подано как плюс: меньше рисков при том же уровне полезной работы. При этом киберзащита у модели включена по умолчанию, как в Opus 4.7 и 4.8, хотя и мягче, чем у [Fable 5](https://matveev.tech/claude-fable-5/), который режет куда более широкий круг задач. ## Стоит ли переходить на Sonnet 5 Мне кажется, для большинства агентных задач это дефолтный выбор с сегодняшнего дня. Сильная сторона очевидна: ты получаешь автономность, за которую раньше платил флагману, по цене среднего сегмента, и можешь ползунком усилия сам подбирать баланс под конкретный проект. Для команд, которые гоняют агентов на потоке (кодинг, автоматизация рутины, работа с данными), экономика меняется радикально. Где я бы притормозил. Если задача упирается в максимальную точность (сложный research или критичный код, где ошибка дорого стоит), Opus 4.8 на высоком усилии всё ещё выше, и Anthropic этого не скрывает. Для серьёзной кибербезопасности Sonnet 5 тоже не вариант — тут прямая рекомендация брать Opus. И перед миграцией через API честно прогони токенизатор на своих данных: номинальная цена ниже, но реальный счёт зависит от того, как твой контент разложится на токены. А для остального Sonnet 5 — тот редкий случай, когда цена падает, а качество почти не проседает. Просто выставляешь уровень усилий под задачу. [Introducing Claude Sonnet 5Официальный анонс Anthropic: агентные возможности, бенчмарки, цены и доступность модели.Anthropic](https://www.anthropic.com/news/claude-sonnet-5?ref=matveev.tech) ## FAQ **Sonnet 5 или Opus 4.8 — что выбрать?** Для повседневных агентных задач (кодинг, автоматизация, работа с данными) бери Sonnet 5: близко по качеству, заметно дешевле, гибкий уровень усилий. Для максимальной точности на сложных задачах и для кибербезопасности остаётся Opus 4.8. **Сколько стоит Claude Sonnet 5?** До 31 августа 2026 действует вводная цена $2 за миллион входных токенов и $10 за миллион выходных. Потом стандартный тариф: $3 и $15 соответственно. Учитывай новый токенизатор — он может увеличить число токенов на ту же задачу до 1,35 раза. **Чем Sonnet 5 отличается от Sonnet 4.6?** Он строго лучше по рассуждению, работе с инструментами, кодингу и знаниям, заметно автономнее в многошаговых задачах, реже галлюцинирует и подхалимничает. Плюс появился регулируемый уровень усилий и обновлённый токенизатор. ## Что ещё почитать - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — флагман, с которым сравнивают Sonnet 5 - [Claude Fable 5: что умеет, цена и доступ к Claude 5](https://matveev.tech/claude-fable-5/) — старшая линейка Claude 5 и её киберзащита - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — откуда пришёл новый токенизатор - [10 воркфлоу Claude Code на каждый день](https://matveev.tech/claude-code-10-workflows/) — куда пристроить агентную модель на практике ### Claude Tag: ИИ-коллега в Slack от Anthropic URL: https://matveev.tech/claude-tag/ Last updated: 2026-06-25T17:38:07.000Z > TL;DR: Anthropic выпустила Claude Tag — теперь Claude живёт прямо в Slack как член команды. Зовёшь его через @Claude, скидываешь задачу и идёшь дальше по своим делам, а он работает сам. Бета уже доступна для Team и Enterprise. Даёшь Claude доступ к нужным каналам, подключаешь инструменты, данные и даже кодовую базу. Дальше любой в канале может тегнуть @Claude и делегировать ему задачу: написать код, собрать метрики, разобрать тикет поддержки или докопаться до причины бага. Claude запоминает контекст канала, поэтому объяснять одно и то же по десять раз не нужно. Главное отличие от обычного чат-бота — Claude тут «многопользовательский». В канале один Claude на всех: видно, над чем он работает, и любой может подхватить разговор с того места, где остановился коллега. Если включить ambient-режим, он сам подсвечивает важное и пингует по задачам, которые зависли. А ещё работает асинхронно: может сам планировать шаги и вести проект хоть несколько дней. Anthropic подаёт это как развитие Claude Code и не стесняется цифр: [65% кода](https://www.anthropic.com/news/introducing-claude-tag?ref=matveev.tech) их продуктовой команды уже пишет внутренняя версия Claude Tag. Тегать @Claude, по их словам, стало одним из основных способов делать работу внутри компании. Фича работает на Opus 4.8, заменяет старое приложение Claude in Slack (на миграцию дают 30 дней), а админы могут жёстко рулить доступами и лимитами на трату токенов. Больше информации про Claude и в целом про AI в [телеграм канале](https://t.me/ctospeech?ref=matveev.tech) --- Чат-бот, которому пишешь в личку, работает на одного человека и одну задачу. А Claude в канале живёт сразу для всей команды: общая память, общий контекст, видно, кто и что ему делегировал. По сути модель перетаскивают из разряда инструментов, которые открываешь по необходимости, в коллег, которые всё время рядом и сами берут инициативу. Мне кажется, тут есть и обратная сторона. «Всегда включённый» Claude, который читает каналы и сам решает, что тебе показать, удобен ровно до тех пор, пока доверяешь его приоритетам и настройкам доступа. Пока это бета только для Team и Enterprise, так что массово пощупать не выйдет. Но направление любопытное. ## Что ещё почитать - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — модель, на которой работает Claude Tag - [Artifacts в Claude Code: живые страницы для команды](https://matveev.tech/claude-code-artifacts/) — ещё один способ работать с Claude всей командой - [Claude Code Agent View: одна панель для всех сессий](https://matveev.tech/claude-code-agent-view/) — как управлять множеством Claude-сессий сразу ### Бесплатный ChatGPT стал точнее в вопросах здоровья URL: https://matveev.tech/chatgpt-free-health-gpt55/ Last updated: 2026-06-23T15:56:53.000Z > TL;DR: OpenAI говорит, что бесплатная модель ChatGPT — GPT-5.5 Instant — теперь отвечает на вопросы о здоровье на уровне платных Thinking-моделей. Доля ответов с возможными фактическими ошибками за два месяца упала на 71%. Но все замеры компания делала сама, без независимой проверки. OpenAI обновила то, как бесплатный ChatGPT отвечает про здоровье. Раньше точные медицинские ответы были привилегией платных «думающих» моделей, теперь дефолтный GPT-5.5 Instant подтянули к их уровню. По крайней мере, по собственным оценкам компании. Учитывая, что вопросы о здоровье задают ChatGPT 230 миллионов раз в неделю, апдейт затрагивает огромную аудиторию. Что именно изменилось. GPT-5.5 Instant обходит предшественника GPT-5.3 Instant на бенчмарках [HealthBench](https://openai.com/index/healthbench/?ref=matveev.tech) и его клинической версии HealthBench Professional. На живом трафике доля ответов, помеченных хотя бы за одну возможную фактическую неточность, снизилась на 71% за два месяца. Это данные внутренних мониторов OpenAI. Отдельно компания сравнила модель с врачами. Доктора писали ответы на типичные медицинские диалоги, а отдельная панель врачей сравнивала их с ответами модели. По точности, коммуникации и полноте панель оценила ответы GPT-5.5 Instant выше написанных людьми. Сравнивали на 3500 ответах. OpenAI добавляет, что модель реже пропускает «красные флаги» и реже забывает уточнить контекст у пользователя. ⚠️ Все эти результаты — внутренние замеры OpenAI на её собственном бенчмарке. Независимой или peer-review проверки нет. --- Звучит впечатляюще, но я бы не спешил. Все цифры — внутренние. HealthBench OpenAI построила сама, рубрики писали врачи из её же сети (260+ докторов, проверено 700 тысяч ответов). Ничего из этого не выходило на независимую или peer-review проверку. Грубо говоря, компания и придумала экзамен, и сама себя на нём оценила. История с медициной требует осторожности: Google уже [убирал AI Overviews](https://www.theguardian.com/technology/2025/may/30/google-ai-overviews-health-misinformation?ref=matveev.tech) из части медицинских запросов после того, как они выдавали опасные советы. Бесплатный ChatGPT и правда мог стать аккуратнее в медицинских темах, и для миллионов людей без доступа к врачу это лучше, чем гадание. Но воспринимать его как замену консультации по-прежнему рано. Если спрашиваешь у ChatGPT про симптомы, перепроверяй важное у живого специалиста. ## Что ещё почитать - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor/) — где та же GPT-5.5 проигрывает в другой задаче - [OpenAI Privacy Filter: обзор открытой модели для PII](https://matveev.tech/openai-privacy-filter/) — как OpenAI работает с чувствительными данными ### Artifacts в Claude Code: живые страницы для команды URL: https://matveev.tech/claude-code-artifacts/ Last updated: 2026-06-22T07:04:37.000Z > TL;DR: Claude Code научился публиковать результат сессии как живую веб-страницу на приватном адресе claude.ai: PR-walkthrough, дашборд, таймлайн расследования инцидента. Страница строится из контекста сессии и обновляется на той же ссылке, пока агент работает. Команда открывает её в браузере и видит один и тот же актуальный вид. Фича в бете, нужен план Team или Enterprise. 18 июня 2026 Anthropic [добавила в Claude Code artifacts](https://claude.com/blog/artifacts-in-claude-code?ref=matveev.tech) — возможность превратить работу сессии в страницу, которой можно поделиться. Звучит как мелочь, но меняет одну надоевшую вещь: больше не нужно пересказывать команде, что там агент нарыл за полчаса логов. Ты кидаешь ссылку, и все смотрят в одно и то же. Самое частое непонимание сразу: это не те artifacts, что в чате claude.ai. Поэтому давай разложу по полочкам, что это, как включить и в чём подвох. ![Иллюстрация Anthropic к анонсу artifacts в Claude Code](https://matveev.tech/content/images/2026/06/claude-code-artifacts-cover.svg) ## Что такое artifacts в Claude Code Artifact — это одна самодостаточная веб-страница, которую Claude Code собирает прямо из твоей сессии и публикует на приватный URL на claude.ai. По [документации](https://code.claude.com/docs/en/artifacts?ref=matveev.tech), смысл простой: иногда текст в терминале просто неудобный формат. Аннотированный дифф, график ошибок по сервисам, пять вариантов вёрстки рядом. На такое проще посмотреть, чем читать построчно. Агент берёт всё, до чего дотягивается в сессии: код репозитория, данные из подключённых коннекторов, ход самого диалога. Из этого собирается страница. Не нужно поднимать инфраструктуру, подключать источники данных, что-то деплоить. Ты просишь страницу — Claude Code лепит её из того, что уже есть под рукой. Важно понять, чем artifact не является. Это снимок работы, а не приложение. Страница статичная, без бэкенда: она не сохранит данные из формы, не дёрнет API в момент просмотра, не отдаст несколько маршрутов. Если нужен внутренний инструмент с сервером — это по-прежнему отдельный деплой на своей инфраструктуре. ⚠️ Сразу про порог входа: фича в бете и работает только на планах Team и Enterprise со входом в claude.ai. На индивидуальном Pro, через API-ключ или облачных провайдеров (Bedrock, Vertex) опубликовать artifact не выйдет. ## Чем это отличается от artifacts в чате Claude Тут легко запутаться, потому что слово одно. Artifacts в чате claude.ai живут с 2024 года: пишешь в диалоге, справа открывается панель с кодом, документом или превью приложения. Это про работу внутри чата. Artifacts в Claude Code устроены иначе. Они рождаются из инженерной сессии в терминале или десктоп-приложении и публикуются как страница с собственным адресом, версиями и доступом на уровне организации. Это способ поделиться результатом работы агента с командой, а не интерактивная песочница внутри диалога. Технически родство есть (события в аудит-логе у них из одного семейства), но сценарии разные: чат закрывает задачу здесь и сейчас, а Claude Code показывает готовый результат команде. ## Как Claude Code собирает страницу из сессии Механика короткая. Claude пишет HTML- или Markdown-файл прямо в проект, а потом публикует его. Перед первой публикацией спросит разрешение в духе «Claude wants to publish "Deploy failures by service" to a private page on claude.ai». Согласился — получил ссылку, браузер открыл страницу. Повторные публикации уже одобренного artifact разрешения не требуют. Кстати, `Ctrl+]` в терминале переоткрывает последний artifact, а переменная `CLAUDE_CODE_ARTIFACT_AUTO_OPEN=0` отключает авто-открытие браузера. Дальше начинается самое полезное для команды. Когда агент обновляет страницу, она перерисовывается на месте у всех, кто держит её открытой. Каждая публикация становится новой версией по тому же адресу, есть история и откат на любую предыдущую. Через контрол Share в шапке можно выбрать, какую версию видят зрители. В блоге Anthropic приводит типичный кейс из внутреннего тестирования, и это ровно про коллаборацию. Инженер запускает расследование инцидента до стендапа. Claude Code прочёсывает логи и публикует artifact: таймлайн, подозрительные коммиты, график частоты ошибок. Ссылка уходит в команду. Пока все идут на стендап, агент успевает дважды переопубликовать страницу с новыми данными. В итоге никто не просит «расскажи, что там агент нашёл», все уже смотрят в один и тот же актуальный вид. Эта экономия на пересказах статусов и есть главная идея. Чтобы обновить artifact из другой сессии, дай Claude его URL и попроси переписать. Без ссылки новая сессия создаст новый artifact, а не обновит старый. И ещё деталь: страницы не редактируются совместно. Автор один, остальные только смотрят опубликованные версии. ## Быстрый старт: как включить artifacts Если у тебя план Team, скорее всего всё уже работает — там artifacts включены по умолчанию. На Enterprise фичу включает админ в настройках claude.ai. Дальше так: 1. Залогинься в claude.ai через `/login` в Claude Code. На API-ключе, gateway-токене или облачных кредах публикация не сработает, это требование. 2. Доведи сессию до момента, когда есть что показать: разбор PR, данные для дашборда, результат расследования. 3. Попроси страницу человеческим языком. Например: `Сделай artifact, который проводит по этому PR с аннотированным диффом` или `Собери дашборд по фейлам деплоя за неделю и обновляй его, пока разбираешься`. 4. Подтверди публикацию. Claude вернёт ссылку и откроет браузер. 5. Поделись из шапки страницы через Share — с конкретными людьми или со всей организацией. Claude сам придумает заголовок и эмодзи для иконки вкладки. Хочешь свои — попроси в промпте. Если агент отвечает, что опубликовать не может, или пишет локальный HTML-файл без ссылки, значит фича для сессии недоступна. Тогда проверяй требования из раздела про доступность. ## Что собрать для команды: реальные сценарии Anthropic в анонсе разложила идеи по ролям, и почти все они — про то, чтобы перестать объяснять словами. Несколько примеров, которые мне кажутся самыми рабочими: - Разбор PR, по которому реально можно пройти: дифф с аннотациями на полях, рядом логика изменений. Ревью перестаёт быть археологией по коммитам. - Инцидент, который сам дорастает до постмортема. Таймлайн, подозрительные коммиты, всплеск ошибок из мониторинга, и страница пополняется по ходу расследования. - Дашборд из данных, которые сессия и так вытащила. Скажем, фейлы деплоя по сервисам с сортировкой и фильтрами. - Несколько вариантов рядом, чтобы выбрать глазами: пять версий экрана регистрации из твоих же компонентов или пара вариантов API. - Чеклист релиза или миграции, где пункты отмечаются по ходу, а рядом заметки про пропущенное. - Карта сервиса, нарисованная из реального графа импортов, а не по памяти на вайтборде. Логика везде одна: взять то, что агент и так насобирал в сессии, и показать это так, чтобы коллеге хватило одной ссылки. ✈️ Слежу за тем, как Claude Code и другие агенты меняют рабочий процесс разработчика — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Кому доступно и сколько стоит Отдельной цены у фичи нет — она входит в план. Но порог входа стоит понимать заранее, особенно для русскоязычной аудитории, где многие сидят на индивидуальных тарифах. | Требование | Условие | | -------------------- | ------------------------------------------------------------------------------------------- | | План | Team или Enterprise. На Team включено по умолчанию, на Enterprise включает админ | | Авторизация | Вход в claude.ai через /login. API-ключ, gateway-токен, облачные креды не годятся | | Провайдер модели | Только Anthropic API. Amazon Bedrock, Google Vertex AI, Microsoft Foundry не поддерживаются | | Политики организации | Не должны быть включены CMEK, HIPAA и Zero Data Retention | | Где работает | Claude Code CLI или десктоп-приложение версии 1.13576.0 и новее | То есть если ты один на Pro-плане, artifacts из Claude Code пока мимо. Фича заточена под команды, и это видно по каждому требованию. В Agent SDK, GitHub Action и MCP-серверах она по умолчанию выключена. ## Ограничения, о которых стоит знать Раз страница самодостаточная, у неё жёсткие рамки. Anthropic оборачивает файл в HTML-оболочку со строгой Content Security Policy, и это диктует правила: - Никаких внешних запросов. CSP режет сторонние скрипты, стили, шрифты и картинки, заодно `fetch`, XHR и WebSocket. Поэтому CSS и JS встраиваются прямо внутрь, а картинки зашиваются как data URI. - Бэкенда нет. Статическая страница не хранит данные форм, не авторизует зрителей сама и не зовёт API в момент просмотра. - Всё живёт на одной странице. Относительные ссылки не работают, разделы делаются через якоря внутри страницы. - Жёсткие требования к файлу. Исходник только `.html`, `.htm` или `.md`, готовая страница не больше 16 МиБ. Чаще всего лимит пробивают тяжёлые встроенные картинки. Ещё момент про токены: генерация artifact тратит выходные токены как любой ответ, а стилизованная страница дороже того же текста в терминале. Особенно прожорливы картинки как data URI. В документации советуют предпочитать SVG и CSS растровым изображениям и не встраивать целиком большие датасеты. И про приватность, раз уж речь про команды. Каждый artifact по умолчанию виден только автору. Поделиться можно с конкретными людьми или со всей организацией, но наружу — никак: смотреть может только залогиненный участник той же организации. Публичным artifact сделать нельзя в принципе. Для админов есть retention-политики, аудит-лог и Compliance API для инвентаризации и удаления. По меркам корпоративной безопасности — закрыто плотно. ## Вердикт Мне нравится сама идея: убрать прослойку «давай я расскажу, что нашёл агент». Когда расследование инцидента само превращается в живую страницу, которую команда открывает по ссылке, это экономит реально много мелких коммуникаций. Для тимлидов и SRE это, думаю, самый сочный сценарий. Версионирование с откатом и приватность на уровне org сделаны по-взрослому, придраться не к чему. Что смущает. Во-первых, бета и порог входа: только Team и Enterprise, только Anthropic API, обязательный вход через claude.ai. Если ты соло-разработчик на Pro или сидишь через Bedrock и Vertex — пройдёшь мимо, и это отсечёт заметную часть аудитории. Во-вторых, статичность: интерактивные внутренние тулзы на artifacts не построишь, мечты про это лучше сразу отложить, для них по-прежнему нужен нормальный деплой. В-третьих, стоит держать в голове расход токенов на красивые страницы, особенно с картинками. Кому советую: командам, которые уже живут в Claude Code и устали синхронизироваться текстом в Slack. Кому пока рано: одиночкам и тем, кто на облачных провайдерах модели. Фича явно будет прирастать, но прямо сейчас это инструмент для команд, а не для всех. Если попадаешь в целевую группу — попробовать точно стоит, выхлоп ощущается с первого же расшаренного artifact. [Artifacts в Claude CodeОфициальный анонс Anthropic: живые страницы из контекста сессии, версии и доступ на уровне организации.claude.com](https://claude.com/blog/artifacts-in-claude-code?ref=matveev.tech) ## FAQ **Можно ли сделать artifact публичным?** Нет. Страницу видят только залогиненные участники твоей организации. Публичной ссылки не предусмотрено. Чтобы отдать контент наружу, попроси Claude отдать сам HTML-файл и поделись файлом. **Работают ли artifacts на API-ключе или через Bedrock/Vertex?** Нет. Нужен вход в claude.ai через `/login` и провайдер Anthropic API. Сессии на API-ключе, gateway-токене или облачных кредах публиковать не могут. **Чем это отличается от artifacts в чате claude.ai?** Чатовые artifacts живут в диалоге как боковая панель. Версия для Claude Code публикуется из инженерной сессии как отдельная страница с адресом, версиями и доступом на уровне организации. Это про шеринг результата работы агента с командой. ## Что ещё почитать - [Claude Code Agent View: одна панель для всех сессий](https://matveev.tech/claude-code-agent-view/) — как следить за параллельными сессиями, из которых и рождаются artifacts - [Dynamic workflows в Claude Code: сотни агентов разом](https://matveev.tech/claude-code-dynamic-workflows/) — масштаб работы, который потом удобно показывать страницей - [Claude Code /goal: автономная работа Claude до результата](https://matveev.tech/claude-code-goal/) — долгие сессии, где живой artifact особенно к месту - [GLM-5.2 в Claude Code: 1M контекста дешевле Claude](https://matveev.tech/glm-5-2-claude-code/) — про альтернативные модели в том же Claude Code ### OpenAI Privacy Filter: обзор открытой модели для PII URL: https://matveev.tech/openai-privacy-filter/ Last updated: 2026-06-21T19:02:50.000Z > TL;DR: OpenAI Privacy Filter — открытая модель (Apache 2.0) на 1,5 млрд параметров, которая находит и маскирует персональные данные в тексте: имена, адреса, телефоны, номера карт, пароли и API-ключи. Главная фишка в том, что она запускается локально, прямо на ноутбуке, и данные не уходят на чужой сервер. На синтетическом бенчмарке выдаёт F1 96%, но на «грязных» реальных данных без дообучения пропускает многое. OpenAI обычно шумит про новые GPT, а эту модель выкатила в апреле 2026 почти без анонса. Для разработчиков, которые возятся с пользовательскими данными, она может оказаться полезнее очередного флагмана. Privacy Filter закрывает скучную, но болезненную задачу: как убрать личные данные из текста до того, как он попадёт в логи, обучающую выборку или поисковый индекс. Я покопался в [анонсе](https://openai.com/ru-RU/index/introducing-openai-privacy-filter/?ref=matveev.tech), карточке модели и паре независимых бенчмарков. Рассказываю, что это за зверь, как его запустить и где он реально спотыкается. ## Что такое OpenAI Privacy Filter и зачем он нужен Privacy Filter ищет в тексте персональные данные (PII, personally identifiable information) и помечает их, чтобы потом замаскировать или вырезать. Звучит как задача для регулярок, и отчасти так и есть. Телефон или email можно поймать по шаблону. Проблема в том, что шаблоны слепы к контексту: они не понимают, что «Иванов» в одном предложении это публичная фамилия автора книги, а в другом имя конкретного пациента, которое надо скрыть. Privacy Filter работает на понимании языка и контекста вокруг слова. По словам OpenAI, он лучше отличает информацию, которую стоит сохранить, потому что она публичная, от той, что относится к частному лицу и должна быть скрыта. То есть берёт на себя ту часть задачи, где регулярки обычно ломаются. Теперь про то, зачем OpenAI вообще отдала модель в open source. Веса открыты под Apache 2.0, и компания прямо формулирует мотив: инфраструктуру для приватности должно быть проще инспектировать, запускать и улучшать. Их финальная фраза в анонсе: «наша цель, чтобы модели изучали мир, а не частных лиц». За красивым лозунгом есть практический смысл: если ты чистишь данные перед обучением модели, тебе нужен инструмент, который можно запустить у себя, а не гонять сырые данные на сторонний сервер. Сама OpenAI, к слову, использует дообученную версию Privacy Filter в своих внутренних процессах. Архитектурно это компактный родственник [gpt-oss](https://huggingface.co/openai/privacy-filter?ref=matveev.tech): авторегрессионную модель переделали в двунаправленный классификатор токенов. Вместо генерации текста она за один проход размечает каждый токен, а потом собирает из меток связные фрагменты. Отсюда и скорость: разметка всего входа за один forward pass, без построчной генерации. ## Как запустить Privacy Filter локально Тут OpenAI постаралась. Запустить модель можно буквально в три команды. Первый путь — CLI-утилита `opf` из [репозитория на GitHub](https://github.com/openai/privacy-filter?ref=matveev.tech). Ставишь пакет, и чекпоинт сам подтянется при первом запуске: ```bash pip install -e . opf "Alice was born on 1990-01-02, email alice@example.com" ``` Утилита умеет работать на CPU (`--device cpu`), чистить файл целиком (`opf -f file.txt`) и встраиваться в пайпы, так что её можно воткнуть в любой однострочник через `cat ... | opf`. Есть режимы `opf eval` для проверки на размеченном датасете и `opf train` для дообучения. Второй путь — прямо в браузере через Transformers.js, без сервера вообще. Модель достаточно маленькая, чтобы крутиться на WebGPU: ```js import { pipeline } from "@huggingface/transformers"; const classifier = await pipeline( "token-classification", "openai/privacy-filter", { device: "webgpu", dtype: "q4" }, ); const output = await classifier( "My name is Harry Potter and my email is harry.potter@hogwarts.edu" ); ``` На выходе получишь размеченные фрагменты: ```json [ { "entity_group": "private_person", "word": " Harry Potter" }, { "entity_group": "private_email", "word": " harry.potter@hogwarts.edu" } ] ``` Поиграться без установки можно в [демо на Hugging Face Spaces](https://huggingface.co/spaces/openai/privacy-filter?ref=matveev.tech). Детальный разбор с дообучением под свои данные я вынесу в отдельный гайд, тут важнее показать, что порог входа низкий. ## Что модель умеет находить Privacy Filter размечает восемь категорий данных: - `private_person` — имена частных лиц - `private_address` — адреса - `private_email` — почта - `private_phone` — телефоны - `private_url` — ссылки - `private_date` — даты - `account_number` — номера счетов, включая банковские карты - `secret` — пароли и API-ключи Последние две категории интереснее всего для разработчиков. `account_number` ловит широкий спектр номеров, от кредиток до банковских счетов, а `secret` заточен под утечки в коде: пароли, токены, ключи доступа. У OpenAI в карточке модели даже есть отдельная оценка на поиск секретов в кодовых базах. Из практичного: контекст до 128 000 токенов, так что длинный документ можно прогнать целиком, без нарезки на куски. Веса занимают мало, потому что из 1,5 млрд параметров активны лишь 50 млн (это разреженная MoE-архитектура с 128 экспертами). И есть ручка для баланса между полнотой и точностью: можно настроить, чтобы модель маскировала агрессивнее или, наоборот, аккуратнее. Главный козырь для адаптации — дообучение. OpenAI приводит цифру: на узкой доменной задаче дообучение подняло F1 с 54% до 96% буквально на небольшом объёме данных. То есть из коробки модель можно рассматривать как крепкую базу, которую затачиваешь под свои тексты. ## Насколько Privacy Filter точен на реальных данных Вот тут начинается честный разговор. На бенчмарке PII-Masking-300k OpenAI показывает F1 96% (точность 94%, полнота 98%), а на исправленной версии бенчмарка — 97,4%. Цифры отличные. Но PII-Masking-300k это синтетический датасет с чистыми, аккуратными примерами. Команда [Tonic.ai прогнала модель на реальных данных](https://www.tonic.ai/blog/benchmarking-openai-privacy-filter-pii-detection?ref=matveev.tech): 500+ документов из четырёх доменов — веб-страницы, медицинские записи, юридические договоры и расшифровки звонков в колл-центр. Результат отрезвляющий. По полноте модель из коробки проседает сильно: на веб-краулах recall падает до 10%, на медицинских записях до 38%. Точность при этом нормальная (0,77–0,85). Проще говоря, когда модель не уверена, она молчит, а не уверена она часто. ⚠️ На синтетическом бенчмарке Privacy Filter выдаёт F1 96%, но на реальных «грязных» данных полнота из коробки падает до 10–38% (по тестам Tonic.ai). Модель сознательно настроена на точность и предпочитает промолчать, когда сомневается. Под свой домен её нужно дообучать. Это сознательный выбор OpenAI: дефолтная настройка смещена в сторону точности, потому что излишнее маскирование портит данные. Примеры промахов у Tonic показательны. Фраза из расшифровки звонка «Visa ending in 4427» осталась нетронутой. Email с доменом `.co.uk` модель пропустила, хотя имя и телефон в том же блоке поймала. Адрес, спрятанный после пометки «Fax No.», тоже ушёл мимо. Это всё типичные паттерны живого текста, которых мало в синтетических бенчмарках. Полноту можно поднять той самой ручкой настройки, но Tonic показал цену: при агрессивных настройках модель начинает выдавать в пять раз больше срабатываний и помечает обычные слова вроде «our» или «please» как имена. Лечится это дообучением. По их данным, на медицинских записях хватает 500 размеченных документов, чтобы догнать зрелый коммерческий редактор, а вот веб-данные упрямые: даже на 10 тысячах примеров остаётся отставание. Вывод Tonic мне нравится формулировкой: «модель это лёгкая часть, трудная часть это данные». Ещё один важный кейс подсветили в [Cribl](https://cribl.io/blog/open-ai-privacy-filter-is-a-strong-step-but-telemetry-still-needs-a-different-kind-of-model?ref=matveev.tech): телеметрия и логи. В машинных данных персональные данные редко выглядят как аккуратные фразы естественного языка, они прячутся внутри вложенных полей, разделителей и сериализованных payload-ов. Privacy Filter обучен на тексте, и на такой полуструктурированной каше он работает заметно хуже специализированных моделей. Если твоя задача чистить логи на лету, это не про Privacy Filter. 🔒 Слежу за релизами на стыке AI и приватности данных и разбираю, что из этого реально работает, а что маркетинг — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Кому подойдёт, а кому нет Если коротко: это сильная открытая база, из которой ещё надо собрать рабочий редактор. Продакшн-задачи прямо из коробки она не закрывает. Брать стоит, если ты разработчик и тебе нужно дёшево предобработать текст локально перед тем, как он уйдёт в обучение, индексацию или логи. Apache 2.0 снимает юридические вопросы, модель крутится хоть в браузере, дообучается малой кровью. Как фундамент под свой PII-пайплайн она выглядит отлично, особенно с учётом цены (бесплатно) и размера. Для пет-проектов и внутренних инструментов, где не хочется гонять данные в облако, тоже хороший выбор. А вот чего я бы не делал, так это не ставил бы её как единственный заслон в чувствительных областях. OpenAI сама честно пишет в [ограничениях](https://huggingface.co/openai/privacy-filter?ref=matveev.tech): это не инструмент анонимизации, не сертификация соответствия и не замена ручной проверки. В медицине, юриспруденции и финансах дефолтные настройки без дообучения и человеческого контроля пропустят слишком многое, а recall в 10–38% на реальных данных это не та цифра, на которую можно положиться вслепую. Для русского языка и не-латиницы тоже придётся дообучать: модель заточена в первую очередь под английский. Думаю, главная ценность этого релиза даже не в самой модели. Важнее сигнал: OpenAI отдала рабочий инструмент для приватности в open source под максимально свободной лицензией. Это снижает порог для всех, кто хочет встроить защиту данных в свои пайплайны и не платить за это облачному вендору. А дальше всё как обычно: голая модель это процентов двадцать работы, остальное — ваши данные и их разметка. [openai/privacy-filter · Hugging FaceОткрытая модель для обнаружения и маскирования персональных данных в тексте. Apache 2.0, запуск локально или прямо в браузере, дообучение под свои данные.Hugging Face](https://huggingface.co/openai/privacy-filter?ref=matveev.tech) ## Частые вопросы **Privacy Filter анонимизирует данные?** Нет. OpenAI прямо называет это инструментом для маскирования и минимизации данных, но не анонимизацией и не гарантией соответствия GDPR. Это один из слоёв защиты, который работает в связке с другими, а не вместо них. **Работает ли он с русским языком?** Модель обучена в основном на английском, и на других языках и не-латинице точность падает. Для русского текста без дообучения на своих данных рассчитывать на хороший результат не стоит. **Сколько он стоит?** Бесплатно. Лицензия Apache 2.0 разрешает коммерческое использование, дообучение и встраивание в свои продукты без ограничений. ## Что ещё почитать - [Как запустить OpenAI Privacy Filter локально](https://matveev.tech/run-openai-privacy-filter-locally) — пошаговый гайд: установка, маскирование PII и дообучение - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor) — ещё один сильный релиз с открытыми весами - [Kimi K2.7 Code: обзор открытой модели для кодинга](https://matveev.tech/kimi-k2-7-code) — открытая альтернатива для разработчиков - [GLM-5.2 в Claude Code: 1M контекста дешевле Claude](https://matveev.tech/glm-5-2-claude-code) — про длинный контекст и экономию на open-weight моделях ### DeepSeek V4 Pro: обзор открытой модели для кодинга URL: https://matveev.tech/deepseek-v4-pro/ Last updated: 2026-06-21T12:59:52.000Z > TL;DR: DeepSeek V4 Pro это самая большая открытая модель на сегодня: 1.6 трлн параметров (49 млрд активных), контекст в миллион токенов и агентный кодинг почти на уровне топовых закрытых моделей по бенчмаркам самой DeepSeek. Главный козырь это цена: выходные токены стоят в разы дешевле, чем у Claude или GPT-5.5\. Веса лежат под MIT, моделью уже заинтересовался Microsoft. Я разобрал почти весь китайский десант последних месяцев: [MiniMax M3](https://matveev.tech/minimax-m3-obzor/), [Kimi K2.7](https://matveev.tech/kimi-k2-7-code/), [GLM-5.2](https://matveev.tech/glm-5-2-claude-code/), [Qwen 3.6-Plus](https://matveev.tech/qwen-3-6-plus-obzor/). А DeepSeek V4 как-то проскочил мимо, хотя это сейчас крупнейшая открытая модель в мире. Повод разобраться нашёлся сам: на этой неделе Microsoft признался, что присматривается к DeepSeek V4 ради удешевления Copilot. Когда китайскую модель рассматривают вместо OpenAI и Anthropic в собственных продуктах, это уже не игрушка. ## Что такое DeepSeek V4 Pro DeepSeek выложила V4 в конце апреля 2026 года, сразу открытым релизом под лицензией MIT. Серия состоит из двух MoE-моделей: флагман **V4 Pro на 1.6 трлн параметров с 49 млрд активных** и младшая **V4 Flash на 284 млрд (13 млрд активных)**. Обе держат контекст в миллион токенов и выдают до 384 тысяч токенов на выходе. Цифры подтверждены [официальной карточкой модели на Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro?ref=matveev.tech), а не пересказами из твиттера, где параметры гуляли от 800 млрд до 1.6 трлн. Зачем всё это. DeepSeek метит в дешёвый агентный кодинг с гигантским контекстом, чтобы можно было закинуть в модель целый репозиторий и попросить связную правку. Под капотом несколько инженерных решений, которые делают миллион токенов рабочими, а не маркетинговыми: - Гибридная attention из Compressed Sparse Attention и Heavily Compressed Attention. На контексте в 1M токенов Pro тратит около 27% вычислений на токен и 10% KV-кэша по сравнению с прошлой V3.2\. Именно отсюда берётся дешевизна длинного контекста. - Manifold-Constrained Hyper-Connections поверх обычных residual-связей для стабильности на глубоких слоях. - Оптимизатор Muon вместо AdamW для более быстрой и стабильной тренировки. Претрейн прошёл на 32 трлн токенов, дальше двухстадийный пост-трейн: сначала отдельно растят доменных экспертов через SFT и RL, потом сшивают их в одну модель дистилляцией. Контекст для самой компании не абстрактный: DeepSeek недавно подняла раунд на 7.4 млрд долларов при оценке выше 50 млрд и возглавила рейтинг самых быстрорастущих корпоративных AI-сервисов в июне. Плюс модель работает на китайских чипах Huawei Ascend, что в нынешней санкционной обстановке отдельный сюжет. ## Быстрый старт Попробовать V4 Pro можно четырьмя путями, от «открыть в браузере» до «поднять у себя». **Чат.** Проще всего открыть [chat.deepseek.com](https://chat.deepseek.com/?ref=matveev.tech): там есть Expert Mode и Instant Mode, и это бесплатно. **API.** DeepSeek держит OpenAI-совместимый формат, так что подключение сводится к смене `base_url` и имени модели: ```python from openai import OpenAI client = OpenAI(api_key="", base_url="https://api.deepseek.com") resp = client.chat.completions.create( model="deepseek-v4-pro", # или deepseek-v4-flash messages=[{"role": "user", "content": "Перепиши эту функцию без рекурсии"}], ) print(resp.choices[0].message.content) ``` Есть и Anthropic-совместимый endpoint (`https://api.deepseek.com/anthropic`), поэтому модель спокойно цепляется в инструменты, заточенные под Claude. В релизе DeepSeek прямо упомянула интеграцию с Claude Code, OpenCode и OpenClaw. Если ты живёшь в [Claude Code](https://matveev.tech/glm-5-2-claude-code/), подменить движок на дешёвый DeepSeek реально без переписывания харнеса. **Self-host.** Веса открыты под MIT и лежат на Hugging Face в смешанной точности FP4 + FP8\. Flash в 4-битном кванте влезает на одну мощную рабочую станцию, Pro требует небольшого кластера или арендованного GPU-бокса. Один нюанс: в релизе нет привычного Jinja-шаблона чата, вместо него DeepSeek даёт папку с Python-скриптами для кодирования сообщений. Для локального запуска придётся повозиться с этим `encoding`. Маленькая деталь для тех, кто уже сидит на DeepSeek: старые имена `deepseek-chat` и `deepseek-reasoner` отключат 24 июля 2026 года, после этого они просто роутятся в V4 Flash. Лучше переехать на новые имена заранее. ## Ключевые возможности ### Миллион токенов, который не разоряет Тут фишка не в самом размере окна (его сейчас показывают многие), а в эффективности. За счёт гибридной attention длинный контекст у V4 стоит в разы меньше вычислений, чем у предыдущего поколения. Для агентного кодинга, где репозиторий гоняется по кругу через десятки итераций, это решает. ### Три режима размышления V4 переключается между Non-think (быстрые ответы для рутины), Think High (осознанный разбор для планирования) и Think Max (максимум усилий на сложных задачах). Разница огромная: на SWE-bench Verified одна и та же V4 Pro даёт 73.6 без размышления и 80.6 в режиме Max. Это важно понимать, когда читаешь чужие бенчмарки, об этом ниже. ### Агентный кодинг По собственным замерам DeepSeek модель в режиме Max берёт 80.6 на SWE-bench Verified, 93.5 на LiveCodeBench и рейтинг 3206 на Codeforces. По этим цифрам V4 Pro идёт вровень с Opus 4.6 и Gemini 3.1 Pro, а на чистом написании кода даже впереди. DeepSeek честно говорит, что гоняет V4 на собственной внутренней разработке. ### Открытость как рычаг MIT-лицензия снимает вопросы про данные и egress: код можно не отправлять в чужой API вообще. Даже если ты никогда не поднимешь модель сам, сама возможность ограничивает твои риски, если API однажды подорожает. ## Бенчмарки: где здесь правда Это самый скользкий раздел любого обзора китайских моделей, поэтому давай по-честному. Когда я собирал материал, цифры по SWE-bench для V4 Pro скакали от 59% до 91% в зависимости от источника. Разгадка простая и состоит из двух частей. Первое: режимы. Официальная карточка модели даёт по SWE-bench Verified 73.6 в режиме без размышления, 79.4 на Think High и 80.6 на Think Max. Любой блогер мог взять удобную ему цифру и выдать за «настоящую». 91% и подобные рекорды это либо нестандартный scaffolding, либо просто выдумка. Второе, и куда важнее: кто меряет. Бенчмарки от самого вендора всегда оптимистичны. Тут на сцену выходит независимая оценка от [американского CAISI при NIST](https://www.nist.gov/news-events/news/2026/05/caisi-evaluation-deepseek-v4-pro?ref=matveev.tech), и она отрезвляет. На своём scaffolding CAISI намерил V4 Pro 74% на SWE-bench Verified против 81% у GPT-5.5\. Но интереснее held-out бенчмарки, которых не было в отчёте DeepSeek: на PortBench (портирование CLI-инструментов) модель дала 44% против 78% у GPT-5.5, на ARC-AGI-2 показала 46% против 79%. Вывод CAISI: по совокупности способностей DeepSeek V4 отстаёт от американского фронтира примерно на восемь месяцев и ближе к уровню GPT-5, чем к Opus 4.6, хотя это и самая сильная китайская модель на сегодня. ⚠️ Главное про бенчмарки: независимая оценка NIST CAISI ставит V4 Pro примерно на восемь месяцев позади фронтира, ближе к GPT-5, чем к Opus 4.6\. А громкие 80.6 на SWE-bench относятся к режиму Think Max на задачах, которые модель уже могла видеть. Получается двойственная картина. На задачах, которые модель «видела», она блестит и реально вровень с топом. На незагрязнённых, held-out задачах разрыв с лучшими закрытыми моделями ощутимый. Мой вывод простой: не верь громкому заголовку с одной цифрой, смотри на характер задачи. Для типового кода V4 Pro отличная, для самого края сложности фронтир пока выигрывает. ## Тарифы Вот где DeepSeek реально кусается за рынок. Цены на миллион токенов с [официальной страницы](https://api-docs.deepseek.com/quick%5Fstart/pricing?ref=matveev.tech): | Модель | Кэш-хит (вход) | Вход | Выход | | ----------------------------- | -------------- | ------- | -------- | | DeepSeek V4 Flash | $0.0028 | $0.14 | $0.28 | | DeepSeek V4 Pro | $0.003625 | $0.435 | $0.87 | | Claude Sonnet (для сравнения) | — | \~$3.00 | \~$15.00 | Пара выводов прямо из таблицы. Выход у V4 Pro стоит примерно в семнадцать раз дешевле, чем у Claude Sonnet, а именно выходные токены съедают основной бюджет в агентном кодинге, где модель целый день пишет диффы и рассуждения. Цена кэш-хита вообще копеечная, так что стабильный системный промпт сверху и переменная задача снизу почти обнуляют входной счёт на повторяющихся задачах. Текущие цены это результат той самой постоянной скидки 75%, о которой писали в июне. На старте в апреле Pro стоил $1.74 за вход и $3.48 за выход, теперь $0.435 и $0.87\. Снижение ровно на три четверти, и DeepSeek объявила его бессрочным. Чтобы было предметно: одна средняя агентная задача (читать файлы, спланировать, поправить четыре файла, прогнать тесты, пару раз пофиксить) при кэш-дружелюбной структуре обходится примерно в 12 центов на V4 Pro. Та же задача на топовом фронтире по референсным ставкам обойдётся примерно в 10 долларов. Это прикидка, а не закон, но разрыв такого порядка и объясняет, почему Microsoft вообще сел считать. Один нюанс по лимитам: у Pro конкурентность ограничена 500 параллельными запросами против 2500 у Flash. ✈️ Слежу, как дешёвые открытые модели из Китая ломают экономику кодинга, и разбираю каждую новинку — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вердикт DeepSeek V4 Pro не забрала корону бенчмарков, да ей это и не нужно. Она сделала другое: сдвинула границу цена/качество так далеко, что «бери топовый фронтир на всё» перестало быть очевидным выбором для тех, кто считает деньги. Кому зайдёт. Командам, которые гоняют много агентного кода и чувствительны к счёту за токены. Тем, кому нужен реально рабочий миллион токенов под целый репозиторий. Тем, кто хочет self-host под MIT без вопросов про данные. Самый трезвый сценарий это маршрутизация: Flash на дешёвый внутренний цикл агента, Pro на сложные, но проверяемые задачи, а топовый закрытый фронтир приберечь для критичных правок, где незаметная ошибка дороже всего. Где осторожнее. Если задача на самом верху кривой сложности или цена ошибки высокая и её трудно отловить (продакшен-миграции, безопасность), независимые замеры CAISI намекают, что фронтир тут пока надёжнее. Режим Think Max, который даёт лучшие цифры, заметно медленнее и жрёт токены, так что экономия не бесплатна. Ну и возня с локальным запуском из-за отсутствия привычного chat template отпугнёт тех, кто хотел просто скачать и запустить. В целом это самый интересный релиз среди открытых моделей за последние месяцы. Microsoft присматривается к V4 не из любви к Китаю, а потому что экономика бьёт в лоб. Думаю, к концу года мы увидим её движок под капотом куда большего числа продуктов, чем ожидали. [DeepSeekПопробовать V4 Pro и Flash в чате: Expert Mode и Instant Mode, бесплатно. Веса открыты под MIT.chat.deepseek.com](https://chat.deepseek.com/?ref=matveev.tech) ## Частые вопросы **DeepSeek V4 Pro лучше Claude или GPT-5.5?** По бенчмаркам самой DeepSeek она вровень с Opus 4.6 на агентном кодинге, но независимая оценка NIST CAISI ставит её ближе к GPT-5 (примерно на восемь месяцев позади текущего фронтира). На обычных задачах разница невелика, на самых сложных топовые закрытые модели выигрывают. **Сколько стоит DeepSeek V4 Pro?** $0.435 за миллион входных токенов и $0.87 за миллион выходных, кэш-хит стоит $0.003625\. Это после постоянной скидки 75% от стартовой цены. Веб-чат на chat.deepseek.com бесплатный. **Можно ли запустить DeepSeek V4 локально?** Да, веса открыты под MIT на Hugging Face. Flash в 4-битном кванте влезает на одну мощную станцию, Pro нужен небольшой кластер. Готового Jinja chat template нет, кодирование сообщений идёт через скрипты из папки encoding. **Чем V4 Pro отличается от V4 Flash?** Pro это 1.6 трлн параметров для сложных задач и долгого планирования. Flash меньше, 284 млрд, зато быстрее и дешевле, под высокочастотную работу и внутренние циклы агента. Обе держат миллион токенов контекста. ## Что ещё почитать - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor/) — ещё один китайский тяжеловес для разработки - [Kimi K2.7 Code: обзор открытой модели для кодинга](https://matveev.tech/kimi-k2-7-code/) — прямой конкурент V4 Pro на SWE-bench - [GLM-5.2 в Claude Code: 1M контекста дешевле Claude](https://matveev.tech/glm-5-2-claude-code/) — как подключить дешёвую модель с большим контекстом в Claude Code - [Qwen 3.6-Plus: Alibaba бросает вызов Claude](https://matveev.tech/qwen-3-6-plus-obzor/) — третий крупный игрок из Китая в агентном кодинге ### MiniMax M3 vs Kimi K2.7 vs GLM-5.2: что выбрать URL: https://matveev.tech/minimax-m3-vs-kimi-vs-glm/ Last updated: 2026-06-20T08:52:06.000Z > TL;DR: Нужен один универсал — бери MiniMax M3: миллион токенов контекста, нативная мультимодальность и самые сильные заявленные цифры по кодингу. Kimi K2.7 Code берут под агентов с тяжёлым tool-use и ради экономии на токенах, а GLM-5.2 — если хочешь остаться в Claude Code и платить фиксированную подписку вместо счетов за API. За две недели июня 2026 вышли сразу три открытые китайские модели для кодинга: [MiniMax M3](https://matveev.tech/minimax-m3-obzor), [Kimi K2.7 Code](https://matveev.tech/kimi-k2-7-code) и [GLM-5.2](https://matveev.tech/glm-5-2-claude-code). Все три встают в Claude Code и другие агенты через Anthropic-совместимый эндпоинт, все стоят заметно дешевле Opus 4.8 и GPT-5.5, и у всех открытые (или вот-вот открытые) веса. Выбор между ними упирается в то, что тебе важнее: контекст, цена, мультимодальность или формат оплаты. Про то, «какая умнее», говорить сложно: независимых бенчмарков почти нет, все цифры пока от самих вендоров. Разберу каждую и сведу в таблицу. ## MiniMax M3 M3 от китайской MiniMax вышла 1 июня и метит сразу во фронтир. Это Sparse Mixture-of-Experts на собственной архитектуре внимания MSA (MiniMax Sparse Attention), которая и разблокировала дешёвый контекст до 1 млн токенов (с гарантированным минимумом 512K). Параметров около 428 миллиардов по более поздним оценкам, на запуске MiniMax число официально не раскрывала. Главный козырь — это единственная из тройки, у кого есть полный набор сразу: фронтирный кодинг, миллионный контекст и нативная мультимодальность (на вход идут текст, картинки и видео). По заявленным бенчмаркам M3 показывает 59,0% на SWE-Bench Pro (чуть выше 58,6% у GPT-5.5) и 83,5 на BrowseComp, обходя на нём Claude Opus 4.7\. Отдельно MiniMax хвасталась длинными автономными прогонами: в одном из кейсов модель почти 12 часов сама воспроизводила статью с ICLR 2025, в другом за сутки подняла утилизацию CUDA-ядра с 7,6% до 71,3%. По деньгам M3 самая агрессивная. На [OpenRouter](https://openrouter.ai/minimax/minimax-m3?ref=matveev.tech) базовая ставка $0,60 за миллион входных токенов и $2,40 за выходные, на старте была промо-скидка вдвое. Это примерно в десять раз дешевле Opus. Есть и подписки: Plus за $20, Max за $50, Ultra за $120 в месяц. Веса обещали открыть на HuggingFace вскоре после запуска, но лицензия вышла с условиями на коммерческое использование, и это уже вызвало вопросы у сообщества. Подробнее в [полном обзоре M3](https://matveev.tech/minimax-m3-obzor). ## Kimi K2.7 Code Kimi K2.7 Code от Moonshot AI появилась 12 июня и сделала противоположный выбор: никакого универсализма, только кодинг и только агентные сценарии. Архитектура MoE на триллион параметров, но на каждый токен активируется лишь 32 миллиарда, плюс визуальный энкодер MoonViT. Контекст 256K токенов — меньше всех в этой тройке. Формально модель мультимодальная, но весь акцент релиза на коде, а general-purpose версии на старте просто нет. Любопытная деталь: thinking-режим тут принудительный, выключить его нельзя. На сложной агентной задаче рассуждения окупаются, на тривиальном «переименуй переменную» ты всё равно платишь за размышления. Зато Moonshot заявляет снижение расхода thinking-токенов примерно на 30% относительно прошлой версии. По собственным бенчмаркам Kimi почти везде идёт третьей после GPT-5.5 и Opus 4.8, но в одной дисциплине удивляет: на [MCP Mark Verified](https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/?ref=matveev.tech) она берёт 81,1 против 76,4 у Opus 4.8\. Для агентов, которые живут на вызовах внешних инструментов, это весомо. Цена API: $0,95 за миллион входных токенов, $4,00 за выходные, а кэш-хит стоит смешные $0,19\. В агентных циклах с повторяющимся контекстом это рекордно дёшево, примерно впятеро ниже Opus. Лицензия Modified MIT, веса уже лежат [на Hugging Face](https://huggingface.co/moonshotai/Kimi-K2.7-Code?ref=matveev.tech) — то есть это единственная из трёх, которую реально можно скачать прямо сейчас, без оговорок про «вот-вот выложим». Детали в [обзоре Kimi K2.7 Code](https://matveev.tech/kimi-k2-7-code). ## GLM-5.2 GLM-5.2 от Z.ai вышла 13 июня, и самое интересное здесь не сама модель, а схема использования. Ты оставляешь привычный Claude Code, меняешь пару строк в конфиге, и внутри работает китайская модель с контекстом в миллион токенов (максимальный вывод 131K). Платишь при этом фиксированную подписку, а не поминутную оплату API. Архитектуру и число параметров Z.ai на старте не раскрыла. С бенчмарками туго: для 5.2 компания [не опубликовала ни SWE-bench, ни LiveCodeBench](https://codersera.com/blog/glm-5-2-vs-claude-opus-4-8-coding-2026/?ref=matveev.tech). Z.ai заявляет уровень Opus 4.6–4.7, но это пока слова, а не независимые замеры. Ориентироваться можно разве что на предшественницу: GLM-5.1 набирала 58,4 на SWE-Bench Pro, обходя там GPT-5.4 и Opus 4.6\. Если 5.2 хотя бы сохранила этот уровень и добавила миллион токенов контекста, заявка выглядит обоснованной, но проверять придётся самому. Оплата устроена иначе, чем у конкурентов: подписка GLM Coding Plan с фиксированной ценой и лимитом запросов. Lite примерно $10 в месяц, Pro около $30, Max около $80\. Открытые веса под лицензией MIT [обещали выложить на неделе 16–20 июня](https://codersera.com/blog/glm-5-2-release-1m-context-coding-2026/?ref=matveev.tech), то есть на этих днях. Как поставить GLM в Claude Code пошагово — в [отдельном разборе](https://matveev.tech/glm-5-2-claude-code). ## Сравнение в таблице | | MiniMax M3 | Kimi K2.7 Code | GLM-5.2 | | -------------------- | ------------------------------------------ | -------------------------------------- | --------------------------- | | Разработчик | MiniMax | Moonshot AI | Z.ai | | Релиз | 1 июня 2026 | 12 июня 2026 | 13 июня 2026 | | Архитектура | SMoE + MSA, \~428B | MoE 1T / 32B активных | не раскрыта | | Контекст | до 1M (мин. 512K) | 256K | 1M (вывод 131K) | | Мультимодальность | нативная (текст, фото, видео) | формально есть, акцент на коде | не заявлена | | Заявл. SWE-Bench Pro | 59,0% | нет данных | 58,4% (у GLM-5.1) | | Оплата | API $0,60 / $2,40 за 1M + подписки $20–120 | API $0,95 / $4,00 за 1M, кэш-хит $0,19 | подписка $10–80/мес | | Цена против фронтира | примерно в 10 раз дешевле Opus | примерно в 5 раз дешевле Opus | фикс вместо счёта за токены | | Лицензия | open-weights, условия на коммерцию | Modified MIT | MIT | | Веса | обещаны на HuggingFace | уже на Hugging Face | обещаны 16–20 июня | | В Claude Code | да | да | да | | Для кого | универсал: контекст и мультимодальность | агенты с tool-use, экономия | замена Claude по фиксе | ⚠️ Все цифры по бенчмаркам в этой таблице — прогоны самих вендоров. Независимых замеров для всех трёх моделей на дату выхода нет, так что читай их как повод протестировать модель на своём коде, а не как готовый рейтинг. ## Почему бенчмарки нельзя сравнить напрямую Тут придётся честно остудить пыл. Сложить три модели в одну табличку и ткнуть пальцем в победителя не выйдет, и вот почему. Во-первых, у всех разные наборы тестов. M3 меряет себя на SWE-Bench Pro, Terminal-Bench и BrowseComp. Kimi гоняет собственные Kimi Code Bench v2 и MCP Mark. GLM для версии 5.2 не опубликовала вообще ничего, кроме обещаний. Во-вторых, почти все цифры — это прогоны самих вендоров, а независимые лидерборды свои замеры на дату выхода ещё не дали. В-третьих, даже там, где наборы пересекаются, харнессы, обвязка агента и промпты отличаются, и пара процентов легко набегает на одной методологии. Точек прямого сравнения остаётся всего две, и обе с оговорками. На SWE-Bench Pro у M3 заявлено 59,0%, а 58,4% есть у GLM-5.1 — но это прошлая версия GLM, не 5.2\. На MCP Atlas M3 показывает 74,2%, а Kimi 76,0% — но это разные прогоны разных команд. Вывод простой: читай эти числа как повод протестировать модель на своём коде, а не как доказательство, что она улучшит конкретно твой проект. ## Что выбрать Однозначного лидера тут нет, и притворяться, что есть, смысла нет. Зато под конкретный сценарий выбор довольно ясный. Бери **MiniMax M3**, если нужен один универсал на всё: самый полный пакет возможностей, миллион токенов контекста, работа с картинками и видео, плюс самая агрессивная цена за токен. Это дефолтный выбор, если не хочешь держать зоопарк моделей. **Kimi K2.7 Code** берут под другое: агентный пайплайн с тоннами вызовов инструментов, где каждый цент на токенах превращается в реальные деньги. Она сильна именно в tool-use, кэш-хит по $0,19 почти неприлично дёшев на повторяющемся контексте, а веса под Modified MIT уже доступны без всяких «вот-вот». Минус честный: только код, никакого general-purpose, и в большинстве бенчмарков она третья. **GLM-5.2** — вариант для тех, кто живёт в Claude Code, упёрся в счета Anthropic и хочет фиксированную подписку вместо оплаты за API, не меняя инструмент. Миллион токенов контекста и предсказуемая цена — сильная пара. Минус тоже честный: бенчмарков для 5.2 на старте нет, и до выхода независимых тестов это покупка на доверии к Z.ai. Если совсем коротко про мой взгляд: основным я бы сегодня поставил M3 за полноту и цену, Kimi держал бы для агентов с тяжёлым tool-use, а GLM пробовал бы, если уже сижу в Claude Code и плачу Anthropic слишком много. Но все три пока ставка вслепую до независимых замеров, так что финальное слово за прогоном на твоих собственных задачах. ✈️ Разбираю, как открытые модели месяц за месяцем сбивают цены на AI-кодинг и подбираются к фронтиру — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## FAQ **Какая из трёх моделей лучшая для кодинга?** Зависит от задачи. У M3 самый полный пакет и сильные заявленные цифры, Kimi выигрывает в работе с инструментами, GLM удобнее всех ставится в Claude Code. Независимых бенчмарков, которые расставили бы их по местам, на дату выхода нет. **Можно ли запустить их локально?** Да, но железо нужно серьёзное. Веса Kimi уже на Hugging Face (около 240 ГБ в квантованном виде, до 600 ГБ в полном). Веса M3 обещаны на HuggingFace, GLM-5.2 под MIT — на неделе 16–20 июня. Домашней видеокартой ни одну из трёх не поднять. **Какая дешевле всего?** На повторяющемся контексте рекордсмен Kimi с кэш-хитом по $0,19 за миллион входных токенов. По обычной ставке дешевле всех M3 ($0,60 / $2,40). GLM работает по фиксированной подписке от $10 в месяц, что выгоднее при стабильно высокой нагрузке. **Работают ли они в Claude Code?** Да, все три цепляются к Claude Code через Anthropic-совместимый эндпоинт, а также к Cline, Roo Code и другим агентам с поддержкой кастомных моделей. ## Что ещё почитать - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor) — полный обзор архитектуры MSA, бенчмарков и цен - [Kimi K2.7 Code: обзор открытой модели для кодинга](https://matveev.tech/kimi-k2-7-code) — подробно про tool-use, экономию токенов и запуск - [GLM-5.2 в Claude Code: 1M контекста дешевле Claude](https://matveev.tech/glm-5-2-claude-code) — пошаговая настройка замены Claude - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8) — фронтир, с которым все три модели себя сравнивают ### SpaceX покупает Cursor за $60 млрд URL: https://matveev.tech/spacex-buys-cursor/ Last updated: 2026-06-19T18:44:42.000Z > TL;DR: SpaceX через несколько дней после собственного IPO объявила о покупке Anysphere, компании за AI-редактором кода Cursor, за $60 млрд. Четыре основателя, познакомившиеся в MIT, превращаются в мультимиллиардеров с состоянием около $2.7 млрд у каждого. Сделку [SpaceX анонсировала](https://observer.com/2026/06/spacex-cursor-acquisition-makes-founders-young-billionaires?ref=matveev.tech) почти сразу после выхода на биржу 12 июня. Закрыть покупку Anysphere планируют в третьем квартале 2026 года, сумма сделки $60 млрд. Это первая крупная покупка компании Маска уже в публичном статусе. Anysphere стоит за Cursor, который за пару лет стал одним из главных инструментов AI-кодинга. По данным Observer, его используют 64% компаний из Fortune 500, включая Nvidia, Adobe и даже прямого конкурента OpenAI. Gartner ставит Cursor в лидеры корпоративных инструментов для разработки рядом с OpenAI, Anthropic и GitHub. Четверо основателей (Майкл Труэлл, Суалех Асиф, Арвид Луннемарк и Аман Сангер) познакомились в MIT и запустили компанию в 2022 году в Сан-Франциско. Миллиардерами они стали ещё в ноябре, после раунда на $2.3 млрд с оценкой $29.3 млрд. У каждого примерно по 4.5% компании, так что сделка со SpaceX поднимет личное состояние почти до $2.7 млрд. 💰 Цифры сделки: покупка за $60 млрд, оценка Cursor в ноябре $29.3 млрд, по \~$2.7 млрд у каждого из четырёх основателей и $10 млрд неустойки, если сделка сорвётся. Контекст тут важен. Cursor уже плотно работал с xAI, встраивая свою технологию в ассистента Grok, а пару месяцев назад выдал SpaceX (теперь материнской компании xAI) эксклюзивное право на покупку. Если сделка на $60 млрд всё же сорвётся, SpaceX заплатит Cursor неустойку в $10 млрд. Рассказываю про новости из мира AI в своем Телеграм канале [Подписаться ](https://t.me/ctospeech?ref=matveev.tech) Маск собирает весь AI-стек под одной крышей: модели в лице Grok, вычисления на дата-центрах SpaceX и теперь инструмент, в котором пишут код 64% крупнейших компаний США. Cursor всегда был агностиком и позволял выбирать между Claude, GPT и Gemini. Меня тут цепляет один вопрос: останется ли он нейтральным под владельцем с собственной моделью. Если дефолтной моделью там сделают Grok, часть аудитории это точно насторожит. И отдельно цепляет скорость. Ребята познакомились в универе, а через четыре года у каждого по $2.7 млрд. Раньше такие состояния сколачивали десятилетиями, теперь хватает одной удачной ставки в AI. ## Что ещё почитать - [Anthropic + SpaceX: 220k GPU и удвоение лимитов Claude](https://matveev.tech/anthropic-spacex-colossus/) — как инфраструктура Маска уже работает на AI - [Dynamic workflows в Claude Code: сотни агентов разом](https://matveev.tech/claude-code-dynamic-workflows/) — куда движутся конкуренты Cursor - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor/) — что происходит на рынке моделей для кода ### Soniox v5 Real-Time: распознавание речи для агентов URL: https://matveev.tech/soniox-v5-real-time/ Last updated: 2026-06-17T10:29:46.000Z > TL;DR: Soniox v5 Real-Time — это API распознавания речи, который превращает живой разговор в текст прямо во время речи: держит 60+ языков (русский в их числе), различает спикеров, переводит на лету и стоит около $0.12 за час аудио. По открытому бенчмарку Pipecat прошлая версия выдавала 1.25% смысловых ошибок при задержке 249 мс. Это одна из самых точных и быстрых моделей на рынке, и при этом самая дешёвая из топовых. Голосовые агенты упёрлись в скучную, но важную проблему: чтобы ассистент отвечал быстро и по делу, его сначала надо хорошо услышать. Причём не постфактум, когда фраза уже закончилась, а пока человек ещё говорит: с акцентом, в шумном кафе, перебивая сам себя и вставляя английские слова посреди русской фразы. Soniox 16 июня выкатил v5 Real-Time и заявляет, что именно эту задачу и решает. Я залез в доки, бенчмарки и прайсинг, чтобы понять, насколько это правда и кому оно вообще нужно. ## Что такое Soniox v5 Real-Time и зачем он нужен Soniox — это speech AI платформа: одна модель, которая делает распознавание речи, перевод и (отдельно) синтез голоса. v5 Real-Time — свежая версия их потоковой STT-модели `stt-rt-v5`. Она пришла через неделю после [v5 Async](https://soniox.com/blog/soniox-v5-async?ref=matveev.tech) (это вариант для записанных файлов) и заменяет прошлую `stt-rt-v4`. Ключевое слово здесь — real-time. Это не «батчевая транскрипция, только побыстрее». Потоковая модель не может дождаться конца записи и проанализировать разговор целиком. Ей надо параллельно слушать, отделять спикеров, определять язык, выдавать стабильный текст, переводить и понимать, где человек закончил мысль. Всё это за сотни миллисекунд, пока собеседник ещё не закрыл рот. Поэтому архитектуру, обучение и инференс Soniox строили под стриминг с нуля. Зачем это тебе. Если ты делаешь голосового агента, живые субтитры, диктовку, заметки со встреч, медицинскую расшифровку приёма или поддержку в колл-центре, тебе нужен движок, который слышит точно и быстро. v5 Real-Time целится ровно в эти сценарии. ## Как это работает: токены и финализация Под капотом всё идёт через WebSocket. Ты открываешь соединение, шлёшь конфиг и аудио, а в ответ получаешь поток токенов, маленьких кусочков текста. У каждого токена есть флаг `is_final`: - `is_final: false` — черновой токен. Появляется мгновенно, но может измениться или исчезнуть, когда подъедет ещё звук. - `is_final: true` — подтверждённый токен. Зафиксирован и больше никогда не поменяется. Звучит как мелочь, но это удобно на практике: ты сразу показываешь пользователю «сырой» текст для отзывчивости, а потом аккуратно заменяешь его на финальный, когда модель уверена. Чтобы финализировать быстрее, есть два пути: endpoint detection (модель сама ловит, что человек договорил) и ручная финализация (шлёшь `finalize` и забираешь всё накопленное). Подробности в [доках по real-time транскрипции](https://soniox.com/docs/stt/rt/real-time-transcription?ref=matveev.tech). ## Быстрый старт: первый стрим на Python Регистрируешься на [console.soniox.com](https://console.soniox.com/?ref=matveev.tech), берёшь API-ключ, ставишь SDK. Минимальный пример выглядит так: ```bash pip install soniox export SONIOX_API_KEY=<твой_ключ> ``` ```python from soniox import SonioxClient from soniox.types import RealtimeSTTConfig from soniox.utils import render_tokens, start_audio_thread, throttle_audio client = SonioxClient() config = RealtimeSTTConfig( model="stt-rt-v5", language_hints=["ru", "en"], # подсказки по языкам повышают точность enable_language_identification=True, # помечать язык каждого токена enable_speaker_diarization=True, # помечать спикера каждого токена enable_endpoint_detection=True, # ловить конец реплики ) with client.realtime.stt.connect(config=config) as session: start_audio_thread(session, throttle_audio("audio.mp3", delay_seconds=0.1)) final_tokens = [] for event in session.receive_events(): non_final = [t for t in event.tokens if not t.is_final] final_tokens += [t for t in event.tokens if t.is_final] print(render_tokens(final_tokens, non_final)) ``` Вот и всё, по сути. Хочешь живой перевод, добавляешь блок `translation` в тот же запрос, и Soniox начинает переводить прямо в потоке. Один API-ключ, один WebSocket, никакой склейки из двух сервисов. Полные примеры (включая Node SDK и сырой WebSocket без SDK) лежат в [документации](https://soniox.com/docs/stt/rt/real-time-transcription?ref=matveev.tech). ## Что умеет Soniox v5: главные возможности ### Диаризация: кто что сказал, прямо в потоке Самое заметное обновление v5 — переделанная диаризация в реальном времени. Включаешь `enable_speaker_diarization`, и у каждого токена появляется поле `speaker`. Модель отделяет говорящих по ходу разговора, а не реконструирует структуру после записи. В реальном времени это очень тяжёлая задача: люди перебивают друг друга, говорят одновременно, смеются, голоса похожи, микрофон скачет. Зачем оно надо: ассистент для встреч должен понимать, кто назначил задачу, медицинский — кто сказал реплику, врач или пациент, а поддержка — где оператор, а где клиент. Без диаризации весь диалог сваливается в одну простыню текста, и дальше с ней ничего толком не сделаешь. ### 60+ языков и перевод на лету Soniox распознаёт [60+ языков](https://soniox.com/docs/stt/concepts/supported-languages?ref=matveev.tech) одной моделью, и русский там есть (как и украинский, белорусский, казахский). Определение языка работает нативно: модель сама ловит переключение языков посреди разговора и заявленно лучше держит сильный акцент. Это не косметика. Большинство говорящих по-английски в мире — не носители, и движок, который понимает только чистый американский английский, в продакшене разваливается. 🌍 Для русскоязычных продуктов сочетание редкое: русский, украинский и казахский распознаются из коробки, а перевод идёт между любой парой из 60+ языков прямо в потоке. Живой переводчик созвона RU↔EN собирается на одном API, без отдельного сервиса перевода. Поверх распознавания идёт перевод. Soniox делает речь-в-текст и перевод одновременно в одном потоке: 60+ языков, 3600 языковых пар, режим one-way (всё в один целевой язык) или two-way (два языка туда-обратно для живого двуязычного диалога). Качество перевода в v5 подтянули на именах, числах, местоимениях и доменных терминах, то есть ровно на тех местах, где машинный перевод обычно и спотыкается. Для русскоязычного продукта это значит, что можно собрать, например, живой переводчик созвона RU↔EN без отдельного переводческого сервиса. ### Semantic endpointing для голосовых агентов Для голосового агента понимать, когда человек закончил говорить, не менее важно, чем понимать что. Ответишь слишком рано, перебьёшь человека на полуслове. Среагируешь слишком поздно, и агент выглядит тормозным. Soniox использует семантический endpointing: смотрит на паузы, интонацию и контекст, а не просто на тишину. В v5 добавили параметр `endpoint_sensitivity`. Чем выше значение, тем чаще модель считает реплику законченной и финализирует раньше (удобно для командных систем). Чем ниже, тем дольше она ждёт, не обрывая на полуслове (удобно для диктовки). Именно такой ручки обычно и не хватает, когда подгоняешь чужой STT под свой UX. ### Цифры, имена и контекст Номера телефонов, коды, email, трек-номера, account ID. В разговоре это часто самое важное, и одна неверная цифра ломает всю автоматизацию. v5 заметно подтянули по этой «alphanumeric» части: модель аккуратнее ловит и форматирует структурные штуки. Второй приём — инъекция контекста. При открытии соединения можно передать модели подсказки: домен, имена участников, список терминов, кусок справочного текста и даже предпочтительные переводы конкретных слов. Причём это не пост-обработка регулярками, а контекст внутри самой модели во время распознавания. На практике это спасает на редких именах, аббревиатурах и продуктовых названиях, которые ни одна модель не знает заранее. ## Soniox против Deepgram, AssemblyAI, OpenAI и Whisper Тут самое интересное. Есть открытый [Pipecat STT benchmark](https://soniox.com/benchmarks?ref=matveev.tech) (июнь 2026): 1000 реальных сэмплов, ground truth размечен Gemini и проверен людьми, [датасет лежит на Hugging Face](https://huggingface.co/datasets/pipecat-ai/stt-benchmark-data?ref=matveev.tech), результат воспроизводим. Метрики заточены под голосовых агентов: semantic WER (только ошибки, меняющие смысл для LLM) и TTFS (задержка от конца речи до финального сегмента). ![Soniox даёт открыто сравнить себя с OpenAI, Google, Azure, AssemblyAI, Deepgram и Speechmatics на одном и том же аудио](https://matveev.tech/content/images/2026/06/compare_top.png) Вот ключевые строки, отсортированные по точности (меньше WER — лучше): | Провайдер | Модель | $/час | Semantic WER | Идеальных | Задержка (медиана / P95) | | ------------ | -------------------- | --------- | ------------ | --------- | ------------------------ | | Azure | — | $1.00 | 1.21% | 82.9% | 1016 / 1345 мс | | **Soniox** | stt-rt-v4 | **$0.12** | **1.25%** | **84.1%** | **249 / 281 мс** | | Speechmatics | — | $0.56 | 1.40% | 83.2% | 495 / 676 мс | | Deepgram | nova-3 | $0.55 | 1.71% | 76.5% | 247 / 298 мс | | AssemblyAI | u3-rt-pro | $0.57 | 1.74% | 83.9% | 335 / 534 мс | | ElevenLabs | scribe\_v2\_realtime | $0.39 | 3.16% | 81.3% | 281 / 348 мс | | OpenAI | gpt-4o-transcribe | \~$0.36 | 3.24% | 75.9% | 637 / 965 мс | Картина читается так. По чистой точности Azure впереди на 0.04%, то есть в пределах погрешности, но при этом он в 4 раза медленнее (1016 мс против 249) и в 8 раз дороже. Soniox единственный, кто одновременно держит топовую точность, низкую задержку с очень ровным P95 и самую низкую цену. Deepgram nova-3 чуть быстрее по медиане (247 мс), но заметно хуже по ошибкам и доле идеальных расшифровок, и дороже в 4-5 раз. У AssemblyAI приличная точность, но задержка скачет (P95 534 мс, для живого диалога это уже заметно). OpenAI `gpt-4o-transcribe` тут откровенно отстаёт и по точности, и по скорости, хотя у OpenAI недавно появилась отдельная `gpt-4o-transcribe-diarize`, которой в этом тесте нет. Whisper в таблице нет, и это закономерно. Оригинальный Whisper от OpenAI вообще не потоковый: он работает 30-секундными окнами, диаризации из коробки нет (нужен отдельный pyannote), а перевод умеет только в английский. Чтобы заставить его стримить, берут обвязки вроде whisper-streaming, и [даже в академической версии](https://arxiv.org/abs/2307.14743?ref=matveev.tech) задержка около 3.3 секунды. Для офлайн-расшифровки на своём железе и ради приватности Whisper по-прежнему отличный и бесплатный вариант. Для живого голосового агента уже нет. Два честных дисклеймера. Во-первых, бенчмарк гоняли на `stt-rt-v4`, а статья про v5 — Soniox обещает, что v5 точнее, но независимых цифр именно по v5 пока нет. Во-вторых, тест англоязычный, так что мультиязычность и русский в нём напрямую не измерены. Сам бенчмарк открытый и сделан Pipecat, но витрину с табличкой публикует Soniox, так что щепотка скепсиса не помешает. Хорошая новость: у них есть [Compare](https://soniox.com/compare?ref=matveev.tech), где можно прогнать своё аудио через всех провайдеров сразу и посмотреть на свой кейс. ## Сколько стоит Soniox Прайсинг [токенный](https://soniox.com/pricing?ref=matveev.tech), но в пересчёте на часы выходит просто. Real-time стриминг — примерно $0.12 за час аудио, async по файлам — около $0.10\. Перевод не тарифицируется отдельно: он идёт как выходные текстовые токены в той же цене. Для ориентира: час аудио это \~30 000 входных аудио-токенов по $2.00 за миллион, а час речи на выходе \~15 000 текстовых токенов по $4.00 за миллион. По меркам рынка это дёшево. Soniox объясняет низкую цену тем, что построил весь стек сам, от моделей до инференса, и заточил его под стриминг, поэтому то же железо обрабатывает больше аудио. Звучит как стандартный маркетинг, но цифры в бенчмарке его в целом подтверждают: дешевле топовых конкурентов в разы при сопоставимой точности. Есть ещё TTS (синтез речи) примерно за $0.70 за час сгенерированной речи, если вдруг нужен голос на выходе. 🎙️ Если делаешь голосовые продукты или просто следишь за speech AI, я разбираю свежие релизы и инструменты по горячим следам. [Подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вердикт: кому брать, а кому нет Мне Soniox v5 Real-Time нравится, и вот почему. Это редкий случай, когда продукт не заставляет выбирать между точностью, скоростью и ценой: по открытому бенчмарку он держит все три сразу. Встроенный перевод 60+ языков и диаризация в одном API-вызове закрывают как раз те задачи, ради которых обычно склеивают три сервиса. А `endpoint_sensitivity` и инъекция контекста показывают, что делали инструмент люди, которые сами строили голосовые продукты. Кому однозначно стоит смотреть: всем, кто делает голосовых агентов, живые субтитры, многоязычные созвоны, диктовку или расшифровку встреч и звонков. Особенно если важны не-английские языки и перевод на лету: здесь Soniox выглядит сильнее, чем OpenAI или Deepgram. И особенно если считаете деньги на объёме: $0.12 за час против $0.55+ у конкурентов на масштабе превращается в заметную разницу. Кому не сюда. Если нужен полностью локальный, self-hosted движок ради приватности или работы без интернета, то Soniox не про это: он облачный, бери Whisper на своём GPU. Если ты уже глубоко в экосистеме OpenAI или Deepgram и тебя устраивает качество, мигрировать ради процентов WER смысла мало. И помни про честную оговорку: публичные цифры пока по v4 и по английскому, так что перед продакшеном прогони свой реальный звук через [Compare](https://soniox.com/compare?ref=matveev.tech) и проверь на своих языках. Но как стартовая точка для голосового продукта в 2026-м — это один из самых сильных вариантов, что я видел. [Soniox: real-time speech AIРаспознавание речи, перевод и синтез на 60+ языках в одном API. Модель v5 Real-Time, около $0.12 за час аудио.soniox.com](https://soniox.com/?ref=matveev.tech) Попробовать Soniox v5 Real-Time ## FAQ **Soniox понимает русский?** Да. Русский входит в список 60+ языков и доступен и для транскрипции, и для перевода в любой другой поддерживаемый язык. Там же украинский, белорусский и казахский. Независимых замеров точности именно по русскому пока нет, так что проверяй на своём аудио. **Чем v5 Real-Time отличается от Whisper?** Whisper не потоковый и без диаризации из коробки, зато его можно поднять локально бесплатно. Soniox — облачное API, заточенное под живой звук: диаризация, определение языка, перевод и endpointing работают в реальном времени. Для голосового агента Soniox удобнее, для офлайн-расшифровки на своём железе дешевле Whisper. **Нужно ли переписывать код при переходе с v4?** Нет. v5 полностью совместим с существующим Real-Time API, достаточно поменять имя модели на `stt-rt-v5`. Старую `stt-rt-v4` отключат 30 июня 2026, после чего запросы к ней автоматически пойдут на v5 без изменений в коде. **Можно ли переводить речь на лету?** Да, перевод встроен в распознавание. Добавляешь блок `translation` в тот же запрос и получаешь перевод прямо в потоке, без отдельного сервиса. Поддерживаются режимы one-way и two-way, всего 3600 языковых пар. ## Что ещё почитать - [Typeless для iOS — голосовая клавиатура с AI](https://matveev.tech/typeless-ios-golosovaya-klaviatura) — как распознавание речи превращается в удобный голосовой ввод на телефоне. - [Voice Studio Companion — озвучка из меню-бара Mac](https://matveev.tech/voice-studio-companion) — обратная задача, синтез голоса через ElevenLabs прямо из строки меню. - [MuteKey — мьют микрофона на Mac одной клавишей](https://matveev.tech/mutekey-upravlieniie-mikrofonom-na-mac-iz-liubogho-miesta) — маленькая утилита для тех, кто много работает с голосом и созвонами. ### MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге URL: https://matveev.tech/minimax-m3-obzor/ Last updated: 2026-06-16T12:36:49.000Z > TL;DR: MiniMax M3 — первая открытая модель, в которой одновременно есть фронтирный кодинг, контекст до 1 миллиона токенов и нативная мультимодальность. На SWE-Bench Pro она показывает 59,0% и обходит GPT-5.5, а стоит в разы дешевле Opus и GPT. Главная оговорка: почти все цифры пока заявлены самой MiniMax, независимых замеров ещё нет. 1 июня 2026 китайская [MiniMax](https://www.minimax.io/models/text/m3?ref=matveev.tech) выложила M3 и сделала заявку, от которой закрытым лабораториям должно стать неуютно. Открытая модель, которую можно скачать и крутить у себя, по их данным обходит GPT-5.5 на серьёзном кодинговом бенчмарке и приближается к Claude Opus 4.7\. Если это подтвердится, экономика агентов на кодинге меняется за одну ночь. Разберёмся, что там внутри и стоит ли верить. ## Что такое MiniMax M3 M3 — это языковая модель на архитектуре Sparse Mixture-of-Experts, которая принимает текст, картинки и видео, а на выходе даёт текст. Контекст до 1 млн токенов с гарантированным минимумом в 512K. MiniMax позиционирует её для трёх сценариев: длинные агентные задачи, кодинг по большим репозиториям и понимание длинного видео. M3 заметно перестроили под капотом. Линейка M2, которая шла весь 2025-й и начало 2026-го, в своё время отказалась от sparse attention в пользу полного внимания. M3 вернула разреженное внимание, но в новой форме, и именно это решение разблокировало дешёвый миллионный контекст. Прямой предшественник, [MiniMax M2.7](https://matveev.tech/minimax-m27-self-evolution/), запомнился разговорами про рекурсивное самообучение. M3 идёт дальше и метит уже во фронтир. Главный тезис анонса: до сих пор сочетать топовый кодинг, миллионный контекст и мультимодальность могли только закрытые модели. M3 заявляется как первая, кто принёс весь набор в открытый мир. Веса обещают выложить на [HuggingFace](https://huggingface.co/MiniMaxAI?ref=matveev.tech) и GitHub вскоре после запуска API. ## Архитектура MSA: почему миллион токенов перестал разорять Фишка M3 называется MiniMax Sparse Attention (MSA). Обычное внимание в трансформере квадратичное: каждый токен смотрит на каждый, поэтому удвоение контекста примерно учетверяет вычисления. Из-за этого длинные окна исторически были медленными и дорогими. MSA заменяет полное внимание на механизм выбора блоков KV-кэша. Вместо того чтобы обрабатывать все токены, модель отбирает самые релевантные блоки под каждый запрос и срезает вычисления на токен при длинном контексте. По [данным MiniMax](https://www.minimax.io/models/text/m3?ref=matveev.tech), на 1 млн токенов это даёт примерно 9-кратное ускорение префилла и 15-кратное ускорение декодинга против прошлого поколения, а вычисления на токен падают примерно до одной десятой. Ещё в мае MiniMax [тизерила](https://venturebeat.com/technology/minimax-teases-upcoming-m3-model-with-new-sparse-attention-mechanism-and-15-6x-response-speed-boost?ref=matveev.tech) этот механизм и обещала ускорение до 15,6 раза на длинных ответах. Думаю, это и есть тихий главный пункт всего релиза. Миллионный контекст легко нарисовать в спецификации, но дорого реально заполнить: каждый токен в промпте стоит вычислений на каждом шаге агентного цикла. Если MSA правда срезает стоимость токена в разы, скормить модели большой репозиторий или длинный лог становится не так больно. ## Бенчмарки: где M3 обходит фронтир, а где отстаёт Главная заявка M3 — кодинг. Вот цифры, которые MiniMax опубликовала на запуске, рядом со сравнением с закрытыми моделями. | Бенчмарк | MiniMax M3 | Что измеряет | | ------------------ | ---------- | --------------------------------------------------------------------- | | SWE-Bench Pro | 59,0% | Реальные задачи по разработке (выше GPT-5.5, приближается к Opus 4.7) | | Terminal-Bench 2.1 | 66,0% | Агентные задачи в терминале и CLI | | SWE-fficiency | 34,8% | Эффективность решения инженерных задач | | BrowseComp | 83,5 | Автономный браузинг (Opus 4.7: 79,3) | | PostTrainBench | 37,1 | Автономный пост-тренинг моделей | ⚠️ Почти все цифры в таблице — собственные прогоны MiniMax. Независимые лидерборды свои замеры пока не публиковали, так что относись к ним как к ориентиру, а не как к подтверждённому факту. Таблицу стоит читать в обе стороны. На SWE-Bench Pro 59,0% — это та самая цифра, которая ставит открытую модель в один ряд с фронтиром: для сравнения, [по данным](https://x.com/matthewmillerai/status/2061263144060633442?ref=matveev.tech) из обсуждений запуска, GPT-5.5 там показывает 58,6%. На BrowseComp M3 с 83,5 обходит [Claude Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor/) (79,3), а на SVG-Bench и OmniDocBench MiniMax заявляет преимущество над Opus и Gemini 3.1 Pro соответственно. Но есть и обратная сторона. На PostTrainBench M3 берёт 37,1 и занимает третье место, отставая от Opus 4.7 (42,4) и GPT-5.5 (39,3). То есть подчистую кодинг M3 не выигрывает. Она дотянулась до фронтирного диапазона на флагманском бенчмарке, но на части других пока отстаёт. Для открытой модели это всё равно большой шаг. И тут самое важное, о чём честно пишут даже дружелюбные к релизу [разборы](https://apidog.com/blog/minimax-m3-vs-opus-4-7-vs-gpt-5-5?ref=matveev.tech): почти все эти числа — собственные прогоны MiniMax. Независимые лидерборды свои замеры ещё не дали. Харнессы, обвязка и промпты у разных вендоров отличаются, и пара процентов легко набегает на методологии. Так что пока я бы относился к сравнению как к ориентиру, а не как к приговору. Похожую историю мы видели с [GLM-5.1](https://matveev.tech/glm-5-1-zhipu-ai-obzor/) и [Qwen 3.6-Plus](https://matveev.tech/qwen-3-6-plus-obzor/): открытые модели закрывают разрыв на отдельных задачах быстрее, чем везде сразу. ## Три автономных кейса: 12 часов, 9,4× и обучение моделей Бенчмарки бенчмарками, а самое любопытное MiniMax показала на длинных автономных прогонах. Вот где архитектура с дешёвым контекстом должна отрабатывать. ![MiniMax M3 — автономное воспроизведение статьи ICLR 2025 за 12 часов](https://matveev.tech/content/images/2026/06/minimax-m3-iclr-replication.png) Первый кейс: модели дали статью ICLR 2025 («Learning Dynamics of LLM Finetuning») и попросили воспроизвести её эксперименты. M3 проработала почти 12 часов, сделала 18 коммитов и 23 экспериментальных графика и воспроизвела ключевые результаты. Мультимодальность разобрала графики и формулы прямо из PDF, длинный контекст уместил статью, код и логи в одно окно. Второй кейс жёстче. M3 попросили оптимизировать FP8 GEMM-ядро на GPU NVIDIA Hopper, дав на старте только описание задачи и нерабочий скелет на Triton. За сутки модель сделала 147 прогонов бенчмарка и почти 2000 вызовов инструментов, подняв утилизацию железа с 7,6% до 71,3%. В итоге ускорение в 9,4 раза без единого вмешательства человека. Третий кейс, PostTrainBench: четыре базовые модели, и M3 сама прошла весь пайплайн от синтеза данных до обучения и оценки за 12 часов, научив их математике, генерации кода и ответам на вопросы. Это, конечно, не строгие бенчмарки, а демки от вендора. Но они показывают, куда целятся: агенты, которые работают часами, а не отвечают одним сообщением в чате. ✈️ Разбираю такие релизы и считаю, что они значат для тех, кто строит на API, — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Сколько стоит MiniMax M3 Здесь открытая модель и закрытый фронтир расходятся сильнее всего. На [OpenRouter](https://openrouter.ai/minimax/minimax-m3?ref=matveev.tech) M3 стартовала по базовой ставке 0,60 доллара за миллион входных токенов и 2,40 доллара за миллион выходных, с временной промо-скидкой 50%, которая опускает цену примерно до 0,30 и 1,20 доллара. | Модель | Вход / 1M | Выход / 1M | | -------------------- | --------- | ---------- | | MiniMax M3 (промо) | $0,30 | $1,20 | | MiniMax M3 (базовая) | $0,60 | $2,40 | | Claude Opus 4.x | $5,00 | $25,00 | | GPT-5.5 | \~$10,00 | \~$30,00 | Чтобы стало нагляднее, посчитаем одну агентную задачу на 500K входных и 100K выходных токенов — реалистичная цифра, когда контекст забит файлами репозитория и выводом инструментов. По промо-цене это около 0,27 доллара за задачу, по базовой — 0,54\. У Opus та же задача обойдётся примерно в 5 долларов. То есть на промо-тарифе M3 делает ту же работу примерно за 5% стоимости Opus, и даже по базовой выходит раз в десять дешевле. Помимо API есть планы с фиксированной платой: Plus за 20 долларов, Max за 50 и Ultra за 120 в месяц. Подписчиков прошлых планов автоматически перевели на M3 без изменения цены. Одно но: промо-тариф временный, и считать юнит-экономику стоит от базовой ставки 0,60 / 2,40, чтобы не попасть, когда скидка закончится. ## Как попробовать MiniMax M3 Способов три, в зависимости от того, нужна вам управляемость или полный контроль. Самый быстрый — через OpenRouter: указываете в своём OpenAI-совместимом клиенте модель `minimax/minimax-m3` и работаете, аккаунт MiniMax не нужен. Второй вариант — напрямую через [платформу MiniMax](https://platform.minimax.io/?ref=matveev.tech): ключ на platform.minimax.io и OpenAI-совместимый эндпоинт с именем модели `MiniMax-M3`. ```bash curl https://api.minimax.io/v1/chat/completions \ -H "Authorization: Bearer $MINIMAX_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "MiniMax-M3", "messages": [ {"role": "user", "content": "Разбери этот репозиторий и предложи план рефакторинга."} ] }' ``` Третий путь — поднять открытые веса у себя через vLLM или SGLang, как только они добавят поддержку MSA. Самохостинг окупается только при стабильно большом потоке запросов: на малых объёмах API всё равно дешевле простаивающих GPU. И обязательно прочитайте лицензию: на запуске она вышла с условиями на коммерческое использование, и это уже вызвало вопросы у сообщества. ## Вердикт: кому стоит брать M3 Если коротко, M3 — это самый серьёзный вызов фронтиру со стороны открытых моделей, который я видел. Заявка на SWE-Bench Pro переписала бы ожидания от open-weights, если её подтвердят независимо. Но осторожность здесь оправдана: цифры пока от самой MiniMax, а на PostTrainBench Opus 4.7 и GPT-5.5 всё ещё впереди. Брать M3 на веру и тащить в прод сегодня я бы не стал, прогнать на своих задачах — однозначно да. Кому точно стоит присмотреться: командам, у которых стоимость упирается в потолок, кто строит агентов на длинных прогонах и большом контексте, и тем, кому нужен самохостинг ради приватности или данных, которые нельзя отдавать наружу. Тут открытые веса и цена в разы ниже фронтира решают. А вот если у вас самые тяжёлые многофайловые рефакторинги, где Opus пока выигрывает на последних процентах качества, или нужна чистая коммерческая лицензия без условий — посмотрите на альтернативы или оставьте фронтирную модель на тонкий слой самых сложных задач. Прагматичный паттерн, к которому приходит большинство: основной поток агентной и длинноконтекстной работы гнать на M3 ради цены, а закрытую модель держать на тот узкий процент задач, где важны последние пункты качества. На фоне свежего [Claude Opus 4.8](https://matveev.tech/claude-opus-4-8/) граница между открытыми и закрытыми моделями всё больше сводится к одному вопросу: что лучше подходит под конкретную задачу. [MiniMax M3 — Coding & Agentic Frontier, 1M Context, MultimodalОткрытая модель с контекстом до 1M токенов, нативной мультимодальностью и фронтирным кодингом. Доступна через API, OpenRouter и открытые веса.minimax.io](https://www.minimax.io/models/text/m3?ref=matveev.tech) ## FAQ **M3 уже полностью открытая?** M3 — open-weights: веса и технический отчёт MiniMax обещала выложить вскоре после запуска API. Скачать и запустить модель можно будет, но количество параметров не раскрыто, а лицензия содержит условия на коммерческое использование. Перед продакшеном читайте её внимательно. **M3 реально лучше GPT-5.5?** Зависит от задачи. На SWE-Bench Pro MiniMax заявляет 59,0% против 58,6% у GPT-5.5, но на PostTrainBench GPT-5.5 впереди (39,3 против 37,1). И всё это пока цифры самой MiniMax, без независимого подтверждения. **Чем M3 отличается от M2.7?** M3 — смена поколения, а не точечный апдейт. Главное отличие в архитектуре: серия M2 работала на полном внимании, а M3 вернула разреженное в форме MSA, что и дало миллионный контекст по приемлемой цене. Подробнее про предшественника — в [обзоре MiniMax M2.7](https://matveev.tech/minimax-m27-self-evolution/). **Что за подвох с контекстом в 1 млн токенов?** Окно настоящее, и MSA делает его заполнение дешевле (ускорение префилла и декодинга на длинном контексте). Но длинный контекст всё равно стоит вычислений на каждом шаге агента в любой модели, так что дисциплина с промптами никуда не девается. ## Что ещё почитать - [MiniMax M2.7: модель, которая сама себя обучала](https://matveev.tech/minimax-m27-self-evolution/) — прямой предшественник M3 и история серии - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — фронтир, с которым M3 сравнивают на бенчмарках - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — свежий флагман Anthropic для контекста гонки - [GPT-5.5 и GPT-5.5 Pro: обзор новых моделей OpenAI](https://matveev.tech/gpt-5-5-openai-obzor/) — модель, которую M3 обходит на SWE-Bench Pro - [GLM-5.1: китайская модель на 94.6% от Claude Opus](https://matveev.tech/glm-5-1-zhipu-ai-obzor/) и [Qwen 3.6-Plus](https://matveev.tech/qwen-3-6-plus-obzor/) — другие открытые модели в той же гонке ### Kimi K2.7 Code: обзор открытой модели для кодинга URL: https://matveev.tech/kimi-k2-7-code/ Last updated: 2026-06-15T13:20:27.000Z > TL;DR: Kimi K2.7 Code — открытая (Modified MIT) MoE-модель на триллион параметров от Moonshot AI, заточенная под агентный кодинг. Главные козыри: цена примерно в 5 раз ниже Claude Opus 4.8 и возможность поднять у себя. По бенчмаркам она пока проигрывает и Opus 4.8, и GPT-5.5\. Берут её ради открытости и цены, по качеству она во втором эшелоне. Moonshot выкатывает модели с пугающей скоростью. Kimi K2.7 Code, вышедшая [12 июня 2026 года](https://huggingface.co/moonshotai/Kimi-K2.7-Code?ref=matveev.tech), это уже пятый крупный релиз серии меньше чем за год. И если предыдущие Kimi были про «универсальный ассистент», то здесь Moonshot сделала узкую ставку: только кодинг, только агентные сценарии. Решил разобраться, есть ли смысл смотреть в её сторону, когда под рукой есть Claude и GPT. ## Что такое Kimi K2.7 Code Это open-weight модель архитектуры Mixture-of-Experts: триллион параметров всего, но на каждый токен активируется только 32 миллиарда. Контекст 256K токенов, 384 эксперта, из них на запрос подключается 8 плюс один общий. Под капотом ещё и визуальный энкодер MoonViT на 400M параметров, так что формально модель мультимодальная (текст, картинки, видео), хотя весь акцент релиза именно на коде. Главное отличие от обычных чат-моделей: K2.7 Code не болтает, а работает по шагам. Планирует, правит файлы, дёргает инструменты, отлаживает результат. Это модель под long-horizon задачи, где агент крутится в цикле десятки итераций. И ещё одна особенность, важная на практике: thinking-режим тут принудительный, отключить его нельзя. Об этом ниже, потому что у этого есть и плюс, и минус. Лицензия Modified MIT. То есть веса лежат [на Hugging Face](https://huggingface.co/moonshotai/Kimi-K2.7-Code?ref=matveev.tech) открыто, можно скачать и поднять у себя. Для команд с требованиями по data-residency это сразу меняет расклад. ## Как запустить Kimi K2.7 Code Способов несколько, и самое приятное, что для большинства не нужно ничего переписывать. Через официальный API, совместимый с OpenAI: ```python from openai import OpenAI client = OpenAI( api_key="sk-...", base_url="https://api.moonshot.ai/v1", ) resp = client.chat.completions.create( model="kimi-k2.7-code", messages=[{"role": "user", "content": "Отрефактори этот модуль."}], ) ``` Если ты живёшь в агентных тулзах, есть Anthropic-совместимый эндпоинт. Подменяешь переменные окружения, и Kimi работает прямо внутри Claude Code, Cline или Roo Code: ```bash export ANTHROPIC_BASE_URL=https://api.moonshot.ai/anthropic export ANTHROPIC_MODEL=kimi-k2.7-code export ANTHROPIC_API_KEY=sk-... ``` Хочешь полностью свой хостинг? Бери vLLM, SGLang или KTransformers, веса с Hugging Face. Но трезво оцени железо: по [оценке codersera](https://codersera.com/blog/kimi-k2-7-complete-guide-2026/?ref=matveev.tech), это около 600 ГБ в полной точности и порядка 240 ГБ в квантованном виде. Домашней видеокартой тут не обойтись. И отдельный момент: на старте нет ни GGUF, ни сборок под Ollama, так что простого локального запуска «в один клик» пока не будет. Есть ещё фирменный [Kimi Code CLI](https://www.kimi.com/code?ref=matveev.tech), если хочется готового агента из коробки. ## Бенчмарки: где честно проигрывает, а где удивляет Перехожу к цифрам и постараюсь без приукрашивания. Moonshot показывает заметный рост относительно прошлой версии K2.6: [плюс 21,8% на Kimi Code Bench v2](https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/?ref=matveev.tech), плюс 31,5% на MLS Bench Lite. Прогресс за один шаг версии приличный. Но как только в таблицу добавляются GPT-5.5 и Claude Opus 4.8, картина становится честнее: | Бенчмарк | K2.6 | K2.7 Code | GPT-5.5 | Opus 4.8 | | -------------------- | ---- | --------- | ------- | -------- | | Kimi Code Bench v2 | 50.9 | **62.0** | 69.0 | 67.4 | | Program Bench | 48.3 | **53.6** | 69.1 | 63.8 | | MLS Bench Lite | 26.7 | **35.1** | 35.5 | 42.8 | | Kimi Claw 24/7 Bench | 42.9 | **46.9** | 52.8 | 50.4 | | MCP Atlas | 69.4 | **76.0** | 79.4 | 81.3 | | MCP Mark Verified | 72.8 | **81.1** | 92.9 | 76.4 | Видно сразу: почти во всех тестах Kimi идёт третьей. Не провально, но и не лидер. Зато есть один любопытный момент. На MCP Mark Verified, бенчмарке про работу с инструментами, K2.7 Code набирает 81,1 против 76,4 у Opus 4.8\. То есть конкретно в дисциплине tool-use открытая модель обходит флагман Anthropic. Для агентов, которые живут на вызовах внешних тулзов, это не мелочь. ⚠️ Важная оговорка: все цифры выше — собственные бенчмарки Moonshot. Независимых результатов на стандартных наборах вроде SWE-bench Verified на дату релиза ещё нет. Я бы относился к ним как к сигналу «стоит протестировать на своём коде», а не как к доказательству, что замена модели улучшит твой проект. ## Главная фишка: экономия на токенах Если убрать гонку за первым местом, то реальная ценность K2.7 Code в деньгах. Moonshot заявляет снижение расхода thinking-токенов примерно на 30% по сравнению с K2.6 при том же качестве. Для агентных пайплайнов, где модель думает на каждой итерации, это прямая экономия бюджета. Вот тут и всплывает обратная сторона принудительного thinking-режима. На сложной агентной задаче рассуждения помогают и окупаются. На тривиальном запросе вроде «переименуй переменную» ты всё равно платишь за размышления, потому что выключить их нельзя. Палка о двух концах: для тяжёлых задач хорошо, для мелочи переплата. ## Сколько стоит Kimi K2.7 Code Цены на официальном API такие: | Тип токенов | Цена за 1M | | ----------------- | ---------- | | Вход (cache miss) | $0.95 | | Вход (cache hit) | $0.19 | | Выход | $4.00 | Для сравнения масштаба: codersera оценивает Kimi примерно в 5 раз дешевле Claude Opus 4.8 на сопоставимых задачах. А кэш-хит по $0.19 за миллион входных токенов выглядит почти неприлично дёшево, если у тебя много повторяющегося контекста (а в агентных циклах его всегда много). Плюс никто не отменял вариант с self-hosting, где ты платишь только за железо. ✈️ Слежу за тем, как открытые модели догоняют флагманов и роняют цены на AI-кодинг — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Кому подойдёт Kimi K2.7 Code Скажу честно: если тебе нужна максимально умная модель и цена вторична, бери Opus 4.8 или GPT-5.5, Kimi их пока не догнала. Это видно по бенчмаркам, и притворяться, что это не так, смысла нет. Но если смотреть на неё под правильным углом, картина другая. Kimi K2.7 Code — это про экономику и контроль. Она хороша там, где у тебя агентный пайплайн крутит тысячи вызовов в день и каждый цент на токенах превращается в реальные деньги. Хороша там, где данные нельзя выпускать наружу и нужен self-hosting. Хороша как недорогая рабочая лошадка для рутинного кодинга, где разница в пару процентов на бенчмарке не стоит пятикратной переплаты. И отдельно сильна в работе с инструментами, где она реально обходит Opus. А вот для фронтирных задач на рассуждение, для общего чата (general-purpose версии K2.7 на старте просто нет) и в ситуациях, где тебе нужны проверенные независимые бенчмарки прямо сейчас, я бы пока подождал. Третье место в большинстве тестов это всё-таки третье место. Но сам факт, что открытая модель за пятую часть цены подбирается к флагманам и где-то их обходит, говорит о том, куда движется весь рынок. Я бы поставил её рядом с другой свежей китайской open-weight моделью для кода и понаблюдал, кто кого. [Kimi K2.7 Code — Moonshot AIОткрытые веса (Modified MIT), API и инструкции по запуску модели для агентного кодинга.Hugging Face](https://huggingface.co/moonshotai/Kimi-K2.7-Code?ref=matveev.tech) ## Что ещё почитать - [MiniMax M3: открытая модель бьёт GPT-5.5 в кодинге](https://matveev.tech/minimax-m3-obzor) — прямой конкурент Kimi из той же волны открытых китайских моделей - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8) — флагман, с которым Kimi сравнивает себя в бенчмарках ### GLM-5.2 в Claude Code: 1M контекста дешевле Claude URL: https://matveev.tech/glm-5-2-claude-code/ Last updated: 2026-06-15T12:26:26.000Z > TL;DR: GLM-5.2 — новый флагман Z.ai для кодинга с контекстом в 1 млн токенов. Главная фишка даже не в самой модели, а в том, что её можно поставить прямо в Claude Code вместо Claude и платить заметно меньше, чем за подписку Anthropic. Открытые веса под лицензией MIT обещают выложить на днях. 13 июня Z.ai [выкатила GLM-5.2](https://habr.com/ru/news/1047110/?ref=matveev.tech), и самое интересное тут не бенчмарки, а схема использования. Ты оставляешь привычный Claude Code, меняешь пару строк в конфиге, и внутри работает китайская модель с контекстом в миллион токенов. Платишь при этом фиксированную подписку, а не поминутную оплату API. Для тех, кто живёт в Claude Code, повод как минимум присмотреться. ## Что такое GLM-5.2 и почему про неё говорят GLM — это линейка открытых моделей китайской Z.ai (бывшая Zhipu AI). GLM-5.2 в ней флагман, заточенный под программирование и долгие агентные задачи. Z.ai ставит её на уровень Claude Opus 4.6–4.7, хотя пока это заявление самой компании, а не результат независимых тестов. Главное обновление — контекстное окно в 1 млн токенов. Это в пять раз больше, чем у прошлых версий, и хватает, чтобы держать в голове крупную кодовую базу целиком или длинную трассу агента, который планирует и выполняет задачу в несколько шагов. Максимальный вывод — 131 тысяча токенов. Прямо сейчас GLM-5.2 доступна только подписчикам GLM Coding Plan. API и открытые веса под MIT [обещают выложить на неделе 16–20 июня](https://codersera.com/blog/glm-5-2-release-1m-context-coding-2026/?ref=matveev.tech), а бесплатный веб-чат chat.z.ai пока работает на предыдущей GLM-5.1. ## Сколько стоит и почему это дешевле Claude Вот ради чего всё затевалось. GLM Coding Plan — подписка с фиксированной ценой и лимитом запросов, а не оплата за токены. Три основных тарифа (по данным независимых разборов на июнь 2026): | Тариф | Цена | Лимит запросов | | ----- | --------- | ------------------------ | | Lite | \~$10/мес | \~400 запросов в неделю | | Pro | \~$30/мес | \~2000 запросов в неделю | | Max | \~$80/мес | \~8000 запросов в неделю | Z.ai периодически запускает промо со стартом от $3, так что актуальные цифры всегда стоит [сверять на странице подписки](https://z.ai/subscribe?ref=matveev.tech). Но даже базовые $10–30 в месяц — это другой порядок относительно того, во что обходится активный кодинг на Claude. Сравни: API Claude Opus 4.8 стоит $5 за миллион входных токенов и $25 за миллион выходных. Когда агент гоняет большие контексты и переписывает файлы пачками, счёт за API набегает быстро. Подписки Anthropic (Claude Pro за $20, Max за $100–200) лимиты поднимают, но потолок всё равно есть. GLM же предлагает фиксированную цену плюс контекст в миллион токенов из коробки. Если кодишь каждый день, математика складывается в его пользу. ## Как подключить GLM-5.2 к Claude Code Самая практичная часть. GLM Coding Plan работает через Anthropic-совместимый endpoint, поэтому Claude Code принимает его как родной. Порядок такой: 1. Оформи подписку GLM Coding Plan на [z.ai](https://z.ai/subscribe?ref=matveev.tech) и создай API-ключ в дашборде. 2. Открой файл настроек Claude Code: `~/.claude/settings.json`. 3. Пропиши в секции `env` адрес Z.ai, свой ключ и маппинг моделей: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.z.ai/api/coding/paas/v4", "ANTHROPIC_AUTH_TOKEN": "твой-Z.ai-API-ключ", "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.2[1m]", "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.2[1m]", "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air", "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000" } } ``` 1. Запусти `claude` в новом терминале и проверь модель командой `/status`. Суффикс `[1m]` у `glm-5.2` включает тот самый контекст на миллион токенов, а `CLAUDE_CODE_AUTO_COMPACT_WINDOW` поднимает порог автосжатия истории под него. Для кодинга Z.ai советует выкрутить `/effort` на `max`, это максимальный уровень reasoning. Точные значения endpoint и список моделей лучше [сверить в документации Z.ai](https://docs.z.ai/devpack/latest-model?ref=matveev.tech): детали подключения там правят довольно часто. Кроме Claude Code план так же цепляется к Cline, Roo Code и другим инструментам с поддержкой кастомных моделей. Ищу способы не переплачивать за AI-инструменты и слежу за моделями для кодинга — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Контекст и бенчмарки: что известно С цифрами пока туго, и это честный минус. На момент запуска Z.ai [не опубликовала ни SWE-bench, ни LiveCodeBench](https://codersera.com/blog/glm-5-2-vs-claude-opus-4-8-coding-2026/?ref=matveev.tech) для 5.2, как и техотчёта с числом параметров. Так что «уровень Opus 4.7» приходится принимать на веру до независимых тестов. Зато есть данные по предшественнице. GLM-5.1 набрала 58.4 на SWE-Bench Pro — выше, чем GPT-5.4 (57.7) и [Claude Opus 4.6](https://matveev.tech/claude-opus-4-8/) (57.3). На Terminal-Bench 2.0 она набрала 63.5, а в связке с Claude Code — 66.5\. Для открытой модели цифры приличные. Если 5.2 хотя бы сохранила их, добавив миллион токенов контекста, заявка на серьёзный агентный флагман выглядит обоснованной. ## Стоит ли переходить Если коротко: GLM-5.2 не «убийца Claude», как пишут в заголовках. Это прагматичная альтернатива для тех, кто упёрся в расходы. Плюсы очевидны. Миллион токенов контекста. Фиксированная цена вместо счёта за API. Скорый релиз открытых весов под MIT — можно будет поднять модель у себя. И всё это внутри привычного Claude Code, ничего нового учить не надо. Минусы тоже честные. Бенчмарков для 5.2 на старте нет, про реальный уровень судить рано. Доступ пока только по подписке, API и веса подвезут через несколько дней. Для self-hosting понадобится серьёзное железо (4–8 H100), а часть команд, особенно в гос- и оборонном секторе США, насторожит то, что модель китайская. Ну и веб-чат всё ещё на 5.1, быстро попробовать без оплаты не получится. Мне кажется, GLM-5.2 точно стоит протестировать, если много кодишь в Claude Code и подписка Anthropic ощутимо бьёт по карману. Контекст в миллион токенов и фиксированная цена — сильная пара. А если тебе критичны проверенные бенчмарки или нужен self-host прямо сейчас, без железа и официальных весов, лучше подождать пару недель, пока всё это появится. [GLM Coding Plan — Z.aiПодписка с доступом к GLM-5.2 из Claude Code, Cline и других агентов. Тарифы Lite, Pro и Max.z.ai](https://z.ai/subscribe?ref=matveev.tech) ## Частые вопросы **Сколько стоит GLM-5.2?** Отдельно модель не продаётся, доступ идёт через подписку GLM Coding Plan. Тарифы примерно $10 (Lite), $30 (Pro) и $80 (Max) в месяц, с лимитом запросов вместо оплаты за токены. Точные цены и промо смотри на z.ai. **GLM-5.2 правда на уровне Claude Opus?** Z.ai заявляет уровень Opus 4.6–4.7, но независимых бенчмарков для 5.2 на старте нет. Предыдущая GLM-5.1 обходила Opus 4.6 на SWE-Bench Pro, так что заявка не на пустом месте. Но дождись сторонних тестов. **Когда выложат открытые веса GLM-5.2?** Z.ai обещает открытые веса под лицензией MIT и публичный API на неделе 16–20 июня 2026\. После этого модель можно будет запустить на своём железе. ## Что ещё почитать - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — флагман, с которым сравнивают GLM-5.2 - [Claude Fable 5: что умеет, цена и доступ](https://matveev.tech/claude-fable-5/) — свежий флагман Anthropic для контраста по цене - [Dynamic workflows в Claude Code](https://matveev.tech/claude-code-dynamic-workflows/) — куда именно встраивается GLM-5.2 - [GPT-5.5 и GPT-5.5 Pro: обзор](https://matveev.tech/gpt-5-5-openai-obzor/) — где сейчас флагманы OpenAI ### Claude Fable 5: что умеет, цена и доступ к Claude 5 URL: https://matveev.tech/claude-fable-5/ Last updated: 2026-06-09T18:16:23.000Z > TL;DR: Anthropic запустила **Claude Fable 5** — старшую модель нового семейства Claude 5 (тир Mythos-class). Цена $10 за миллион входных токенов и $50 за миллион выходных, меньше половины от Mythos Preview. В API доступна сразу как `claude-fable-5`. На подписках Pro, Max и Team бесплатно до 22 июня, дальше по кредитам. Заодно вышла Mythos 5 — та же модель со снятыми киберограничениями, но только для проверенных партнёров. Под капотом Fable 5 и Mythos 5 — одна и та же модель, разница только в защитных фильтрах. Для разработчика тут важно другое: появился новый потолок по агентному кодингу, цена ниже прошлой топовой модели, и есть пара нюансов с доступом и фильтрами, которые лучше понять до того, как переписывать прод на `claude-fable-5`. ## Fable 5 и Mythos 5: одна модель, два режима Anthropic называет новый класс моделей Mythos-class. [Fable 5](https://www.anthropic.com/news/claude-fable-5-mythos-5?ref=matveev.tech) — первая публичная модель этого класса и первая в семействе Claude 5\. Mythos 5 — та же самая модель, но с поднятыми ограничениями в части кибербезопасности. Разница в одном слое защиты. Fable 5 безопасна для общего доступа, её получают все. Mythos 5 раздаётся узкому кругу: киберзащитникам и инфраструктурным провайдерам через Project Glasswing, в связке с правительством США. По заявлению Anthropic, у Mythos 5 сильнейшие в мире возможности по кибербезопасности. Обычному разработчику достаётся Fable 5, а снятые фильтры — только через заявку и проверку. ## Сколько стоит Claude Fable 5 и где её взять Цена для обеих моделей одинаковая: $10 за миллион входных токенов и $50 за миллион выходных. Это меньше половины от того, что стоила Claude Mythos Preview. В API модель называется `claude-fable-5` и доступна с первого дня, как и на consumption-based планах Enterprise. С подписками сложнее, доступ раскатывают поэтапно: - До 22 июня Fable 5 включена в Pro, Max, Team и seat-based Enterprise без доплаты. - С 23 июня её уберут с этих планов, дальше использование пойдёт через usage credits. Если хватит мощностей, бесплатное окно обещают продлить. - Потом, когда будет достаточно ёмкости, модель вернут в стандартный набор подписки. Anthropic честно пишет, что спрос ожидается высокий и плохо предсказуемый, поэтому и осторожничает с подписками. Вывод для тебя простой: бесплатное окно короткое, всего две недели. Если хочешь оценить модель без счёта за API, лучше не откладывать. ## На что способна Fable 5: бенчмарки и автономность Заявка простая: state-of-the-art почти на всех тестах, и чем длиннее и сложнее задача, тем больше отрыв от других моделей Claude. ![Таблица бенчмарков Claude Fable 5 и Mythos 5 в сравнении с другими моделями](https://matveev.tech/content/images/2026/06/claude-fable-5-benchmarks.png) По направлениям картина такая: - В кодинге Stripe в раннем тесте прогнала миграцию по базе на 50 млн строк Ruby за один день, вручную команда возилась бы два с лишним месяца. Модель к тому же экономнее по токенам и лидирует на бенчмарке FrontierCode от Cognition даже на среднем уровне усилий. - В аналитике у Fable 5 лучший результат на финансовом бенчмарке Hebbia для senior-уровня, с заметным ростом в работе с документами и таблицами. - В vision модель восстанавливает исходники веб-приложения по одним скриншотам и проходит Pokémon FireRed на чистом зрении, без вспомогательной обвязки, которая нужна была прошлым версиям. - С памятью заметно лучше: модель держит фокус на миллионах токенов и правит ответы по своим заметкам. В игре Slay the Spire файловая память улучшила её результат втрое сильнее, чем у Opus 4.8. Ранний доступ был у Cursor, GitHub, Replit и ещё десятка компаний. Все хвалят скачок в long-horizon задачах и агентном кодинге. Отзывы из пресс-материалов, так что скидку на маркетинг делай, но направление понятно: модель затачивали под долгую автономную работу. ## Главный нюанс для разработчиков: fallback на Opus 4.8 Вот деталь, которую легко пропустить, а она напрямую бьёт по интеграции. У Fable 5 работают отдельные классификаторы, которые ловят запросы по трём темам: кибербезопасность, биология с химией и дистилляция модели. Если запрос попадает под фильтр, отвечает не Fable 5, а [Opus 4.8](https://matveev.tech/claude-opus-4-8/). Пользователю при этом приходит уведомление о подмене. ⚠️ Fable 5 сама не отвечает на запросы про кибербезопасность, биологию, химию и дистилляцию: их незаметно перехватывает Opus 4.8\. Это меньше 5% сессий, но если твой продукт в этих темах, обрабатывай уведомление о подмене прямо в коде. По данным Anthropic, fallback случается меньше чем в 5% сессий. В остальных 95%+ его нет вовсе, и там Fable 5 по сути работает как Mythos 5\. Но фильтры настроены подчёркнуто консервативно и иногда ловят безобидные запросы. ## Вывод: стоит ли переходить Если коротко, попробовать стоит, особенно пока открыто бесплатное окно. Связка «новый потолок по агентным задачам плюс цена вдвое ниже прошлой топовой модели» выглядит сильно. Для долгих задач в Claude Code или в своих агентских пайплайнах это прямой апгрейд. Что настораживает. Во-первых, поэтапный доступ: две бесплатные недели, потом кредиты, потом туманное «вернём в подписку, когда будет ёмкость». Для планирования бюджета это неудобно, и непонятно, насколько затянется промежуточный режим. Во-вторых, fallback на Opus 4.8 с консервативными фильтрами. В большинстве сценариев ты его не заметишь, но если твой продукт как раз про кибербез или биоинформатику, в оставшиеся проценты будешь попадать чаще среднего, и предсказуемость ответа пострадает. Anthropic обещает сужать фильтры после запуска, посмотрим, как быстро. В целом шаг закономерный. Anthropic вынесла свою сильнейшую модель в открытый доступ, обвесив её фильтрами, а полную версию оставила проверенным партнёрам. Для разработчика момент удачный: мощная модель ощутимо подешевела. Главное — заложить нюансы с доступом и fallback заранее, а не ловить их уже на проде. ✈️ Разбираю новые модели Claude и их подводные камни для разработки — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — модель, на которую Fable 5 откатывается при срабатывании фильтров. - [Dynamic workflows в Claude Code](https://matveev.tech/claude-code-dynamic-workflows/) — как запускать сотни агентов разом, там автономность Fable 5 и раскрывается. - [Claude Code /goal: автономная работа до результата](https://matveev.tech/claude-code-goal/) — про долгие задачи, которые новая модель тянет заметно лучше. ## Частые вопросы **Сколько стоит Claude Fable 5?** $10 за миллион входных токенов и $50 за миллион выходных, одинаково для Fable 5 и Mythos 5\. Это меньше половины цены Claude Mythos Preview. **Доступна ли Fable 5 в Claude Code и по подписке?** Да. До 22 июня она включена в Pro, Max, Team и seat-based Enterprise без доплаты. С 23 июня доступ на этих планах идёт через usage credits, пока Anthropic не вернёт модель в стандартный набор подписки. **Чем Fable 5 отличается от Mythos 5?** Это одна и та же модель. У Fable 5 включены фильтры по кибербезопасности, биологии, химии и дистилляции: они срабатывают меньше чем в 5% сессий и перенаправляют ответ на Opus 4.8\. У Mythos 5 киберфильтры сняты, и она доступна только проверенным партнёрам. ### Dynamic workflows в Claude Code: сотни агентов разом URL: https://matveev.tech/claude-code-dynamic-workflows/ Last updated: 2026-05-29T11:12:01.000Z > TL;DR: Anthropic запустила в Claude Code dynamic workflows — режим, где Claude сам пишет оркестрационный скрипт и запускает десятки и сотни субагентов параллельно в одной сессии. Они работают над задачей часами или днями, проверяют результат друг друга и отдают тебе уже готовый ответ. Главный пример масштаба: порт Bun с Zig на Rust за 11 дней, 750 тысяч строк, 99,8% тестов прошли. Доступно в research preview на тарифах Max, Team и Enterprise. 28 мая [Anthropic показала](https://claude.com/blog/introducing-dynamic-workflows-in-claude-code?ref=matveev.tech) новую штуку для Claude Code — dynamic workflows. Идея простая на словах и здоровенная на практике: вместо того чтобы один агент полз по задаче в один проход, Claude сам пишет скрипт-оркестратор, разбивает работу на куски и раскидывает их по куче параллельных субагентов. А отдельные агенты потом пытаются развить то, что нашли первые. До тебя доходит уже сведённый и проверенный результат. Вышло это в один день с [Claude Opus 4.8](https://matveev.tech/claude-opus-4-8/), и не случайно. Сотни агентов параллельно — это нагрузка, которую модель послабее просто не вытянет по качеству координации. ## Что dynamic workflows реально дают разработчику Anthropic называет несколько сценариев, и все они про задачи, которые раньше в один присест не делались. Первое — поиск багов и аудиты по всему репозиторию. Claude параллельно прочёсывает сервис, а потом по каждой находке запускает независимую проверку: отдельный агент пытается подтвердить, что баг настоящий, а не выдумка. В отчёт попадает только то, что выжило. Та же схема работает для security-аудита, когда нужно разом проверить авторизацию, валидацию входных данных и поискать небезопасные паттерны по всей базе. Дальше идут большие миграции и модернизация. Смена фреймворка, выпиливание устаревших API, порт с одного языка на другой, размазанный по тысячам файлов. Раньше такое планировали кварталами, теперь Anthropic обещает дни. И третье — критичная работа, которую страшно отдавать в один проход. Когда цена ошибки высокая, workflow даёт Claude несколько независимых попыток решить задачу, а сверху сажает агентов, которые специально ломают результат до того, как ты его увидишь. Один из инженеров Anthropic, Alessio Vallero, говорит, что лучше всего это зашло на разведке и ревью больших кодовых баз — нашли мёртвый код и места для чистки, которые обычный статический анализ пропускал. Я думаю, это и есть самый честный кейс на старте. ## Порт Bun как доказательство масштаба Если хочется понять, на что это вообще способно, вот история. Jarred Sumner (автор Bun) с помощью dynamic workflows портировал Bun с Zig на Rust. Цифры: примерно 750 тысяч строк Rust, 99,8% существующих тестов проходят, 11 дней от первого коммита до мерджа. Разбили это на несколько workflow подряд. Первый прошёлся по всему Zig-коду и подобрал правильный Rust lifetime для каждого поля каждой структуры. Второй написал каждый `.rs` файл как поведенчески идентичный порт его `.zig` оригинала — сотни агентов работали параллельно, и на каждый файл сажали по два ревьюера. Дальше fix-loop гонял сборку и тесты, пока оба не стали зелёными. А ночью отдельный workflow занялся лишними копированиями данных и на каждое открыл отдельный PR на ревью. В проде это пока не крутится, и Jarred обещал расписать подробности отдельно. Но как демонстрация потолка — впечатляет. 11 дней на то, что командой людей делалось бы месяцами. ✈️ Разбираю, как агенты вроде Claude Code меняют нашу жизнь — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Как это работает под капотом Когда workflow стартует, Claude планирует на лету под твой запрос, режет задачу на подзадачи и раскидывает их по субагентам. Результаты проверяются до того, как их вольют в общий ответ. Агенты заходят на проблему с разных сторон, другие агенты пытаются опровергнуть найденное, и цикл крутится, пока ответы не сойдутся. Именно за счёт этой сходимости workflow дотягивается туда, куда один проход не достаёт. Ещё пара важных деталей. Прогресс сохраняется по ходу — если запуск прервался, он продолжит с места, где встал, а не начнёт заново. И вся координация живёт вне диалога, поэтому план не разваливается, как бы ни росла задача. Это, по сути, ответ на главную боль длинных агентских прогонов: раньше контекст забивался и агент терял нить. Запустить можно двумя способами. Либо прямо попросить: «создай workflow». Либо включить новую настройку `ultracode` в меню effort — она ставит уровень усилий на xhigh и дальше Claude сам решает, когда задача тянет на workflow, а когда хватит обычного прохода. ## Сколько это стоит по токенам Anthropic предупреждает: dynamic workflows жрут заметно больше, чем обычная сессия Claude Code. ⚠️ Сотни параллельных агентов = сотни параллельных контекстов, и за каждый ты платишь. Перед тем как натравить workflow на большой репозиторий, прикинь бюджет на маленькой задаче. Поэтому при первом запуске Claude Code показывает, что собирается сделать, и просит подтверждение. Anthropic советует начать с маленькой, чётко очерченной задачи, чтобы прикинуть аппетит на своих кейсах. Совет здравый. Я бы не стал на радостях натравливать это на весь монолит в первый же день. Доступно в research preview: в CLI, Desktop и расширении для VS Code на тарифах Max, Team и Enterprise (если включил админ), плюс через Claude API, Amazon Bedrock, Vertex AI и Microsoft Foundry. На Max и Team включено по умолчанию, на Enterprise на старте выключено — включается в настройках. ## Вывод Dynamic workflows закрывают разрыв, про который точно подметил Ken Takao из CyberAgent: между «запустить один субагент» и «собрать целую команду агентов вручную» раньше была пропасть. Теперь ты описываешь задачу, а оркестрацию Claude берёт на себя. Мне кажется, главная ценность в рутине, которую никто не любит. Аудит легаси, поиск мёртвого кода, проверка безопасности по всему репозиторию, нудная миграция. Там, где важна полнота охвата и перепроверка. Если у тебя Max или Team — попробуй на чём-нибудь маленьком и сам посмотри, сходится ли экономика по токенам. Это честно стоит теста. ## Что ещё почитать - [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — модель, вместе с которой вышли workflows - [Claude Code /goal: автономная работа Claude до результата](https://matveev.tech/claude-code-goal/) — про автономность Claude Code в одну команду - [Claude Code Agent View: одна панель для всех сессий](https://matveev.tech/claude-code-agent-view/) — как следить за параллельными агентами ### Claude Opus 4.8: что нового против Opus 4.7 URL: https://matveev.tech/claude-opus-4-8/ Last updated: 2026-05-28T17:25:35.000Z > TL;DR: Anthropic обновила флагман до Claude Opus 4.8\. Цена та же, что у 4.7 ($5 за миллион входных токенов и $25 за выходные), а прирост по бенчмаркам есть, но скромный. Главное изменение не в цифрах, а в честности: модель примерно вчетверо реже пропускает собственные баги в коде и чаще говорит «я не уверен» вместо выдуманного результата. Плюс в Claude Code завезли dynamic workflows с сотнями параллельных субагентов. Anthropic выпустила Claude Opus 4.8 и сама же называет апдейт «скромным, но ощутимым». Это честнее, чем привычные релизные лозунги, и довольно точно описывает суть. Если ты сидишь на 4.7, революции не жди. Но пара вещей тут реально меняет повседневную работу, и кому-то есть смысл переключиться прямо сейчас. ## Что изменилось против Opus 4.7 Цена осталась прежней, а модель стала аккуратнее в агентных задачах. По данным Anthropic, 4.8 лучше держит контекст в длинной сессии, эффективнее зовёт инструменты (меньше шагов на тот же результат) и доводит задачи до конца, а не бросает на середине. Цифры из заявлений ранних тестеров: - На Online-Mind2Web (это про управление браузером и компьютером) Opus 4.8 набрала 84%. Это заметный скачок относительно 4.7 и обходит GPT-5.5. - На внутреннем Super-Agent benchmark одной из команд 4.8 оказалась единственной моделью, прошедшей все кейсы от начала до конца, при паритете по цене с GPT-5.5. - На Legal Agent Benchmark от Harvey она первой пробила планку 10% по строгому стандарту all-pass. - В Genie у Databricks 4.8 рассуждает над PDF, диаграммами и прочим неструктурированным контентом на 61% дешевле по токенам, чем 4.7. ![Бенчмарки Claude Opus 4.8 в сравнении с Opus 4.7 и другими моделями](https://matveev.tech/content/images/2026/05/claude-opus-4-8-benchmarks.png) Полные замеры лежат в [System Card модели](https://www.anthropic.com/claude-opus-4-8-system-card?ref=matveev.tech). Я бы не относился к чужим бенчмаркам как к истине в последней инстанции, но тренд понятен: апдейт точечный, основной упор сделан на агентную надёжность. ## Честность как главная фишка релиза Anthropic отдельно подсветила, что прокачивала именно честность модели. Общая болячка всех LLM в том, что они любят перепрыгнуть к выводу и уверенно заявить «всё готово», хотя доказательств нет. По их замерам, Opus 4.8 примерно вчетверо реже предыдущей версии оставляет без комментария дыры в коде, который сам же написал. ![График: Opus 4.8 реже пропускает флаги в собственном коде](https://matveev.tech/content/images/2026/05/claude-opus-4-8-honesty.png) На практике это значит, что модель чаще отмечает неуверенность и реже выдаёт непроверенные утверждения за факт. Для тех, кто гоняет агентов без присмотра, это важнее любого процента на бенчмарке. Команда Devin отдельно отметила, что 4.8 починила болтливость в комментариях и кривые вызовы инструментов, которые были у 4.7. Anthropic также прогнала alignment-оценку перед релизом. По её итогам у 4.8 заметно ниже показатели нежелательного поведения (вроде обмана или подыгрывания злоупотреблениям), чем у 4.7\. Уровень сопоставим с их лучшей по выравниванию моделью, Claude Mythos Preview. ## Dynamic workflows в Claude Code Вместе с моделью в Claude Code приехала функция dynamic workflows. Пока в режиме research preview и только на планах Enterprise, Team и Max. Идея такая: Claude сам планирует работу, запускает сотни параллельных субагентов в одной сессии, а потом проверяет результат перед тем, как отдать его тебе. С Opus 4.8 субагенты могут работать дольше. Anthropic приводит пример: миграция кодовой базы на сотни тысяч строк от запуска до мёрджа, где планкой качества выступает существующий набор тестов. Это логичное продолжение того, куда Anthropic тащит Claude Code. Если следил за [автономным режимом /goal](https://matveev.tech/claude-code-goal/), где Claude работает до результата сам, то dynamic workflows примерно про то же, но с упором на масштаб и распараллеливание. А следить за тем, что творят все эти субагенты, удобнее через [Agent View с единой панелью сессий](https://matveev.tech/claude-code-agent-view/). ✈️ Разбираю апдейты Claude Code и приёмы работы с агентами — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Контроль усилий и мелочи для разработчиков Ещё одна вещь, которая касается всех. В claude.ai и Cowork появился контроль усилий (effort) рядом с выбором модели. На высоких настройках Claude думает чаще и глубже, на низких отвечает быстрее и экономнее тратит лимиты. Доступно на всех тарифах. Opus 4.8 по умолчанию стоит на high, и Anthropic считает это лучшим балансом. На задачах с кодом high тратит примерно столько же токенов, сколько дефолт у 4.7, но выдаёт результат получше. Есть ещё extra (в Claude Code это `xhigh`) и max для совсем тяжёлых случаев. Для долгих асинхронных задач советуют extra. 💡 Не держи max включённым постоянно: на обычных задачах он жрёт лимиты без видимой пользы. Дефолтный high покрывает почти всё, extra доставай под сложные и долгие прогоны. Для тех, кто пишет на API, есть приятная мелочь: Messages API теперь принимает системные записи прямо внутри массива messages. Можно обновлять инструкции модели по ходу задачи, не ломая кэш промпта и не прогоняя апдейт через ход пользователя. Удобно для агентов, которым нужно на лету менять права, бюджеты токенов или контекст окружения. ## Цена, fast mode и что дальше Цена обычного использования не изменилась: $5 за миллион входных токенов и $25 за выходные. Fast mode (модель работает в 2,5 раза быстрее) стоит $10 и $50 соответственно, и это в три раза дешевле, чем fast mode был у прошлых моделей. В API модель доступна как `claude-opus-4-8`. Отдельно Anthropic тизерит следующий шаг. В рамках Project Glasswing небольшое число организаций уже использует Claude Mythos Preview для задач кибербезопасности. Это новый класс моделей, мощнее Opus, и им нужны более серьёзные защитные механизмы перед открытым релизом. Обещают выкатить Mythos-класс всем в ближайшие недели. Звучит как заявка на то, что Opus перестанет быть верхней планкой линейки. ## Вывод Стоит ли переключаться на 4.8? Если работаешь с агентами, кодом или браузерной автоматизацией, то да, причём бесплатно: цена та же, а надёжность выше. Думаю, главная ценность не в процентах на бенчмарках, а в том, что модель меньше врёт про собственную работу. Для людей, которые доверяют агенту реальные задачи, это дороже пары очков на тесте. Если же ты используешь Claude для обычных текстов и вопросов, разница будет почти незаметной. Anthropic тут не лукавит, называя апдейт скромным. Но мне нравится сам вектор: вместо гонки за абстрактным интеллектом упор на честность и надёжность. В ежедневной работе это решает. ## Что ещё почитать - [Claude Code /goal: автономная работа Claude до результата](https://matveev.tech/claude-code-goal/) — про автономный режим, идейного предка dynamic workflows - [Claude Code Agent View: одна панель для всех сессий](https://matveev.tech/claude-code-agent-view/) — как следить за множеством агентных сессий сразу ### Claude Code /goal: автономная работа Claude до результата URL: https://matveev.tech/claude-code-goal/ Last updated: 2026-05-13T13:58:26.000Z > TL;DR: Команда `/goal` в Claude Code задаёт условие, при выполнении которого сессия считается завершённой. После каждого хода маленькая модель проверяет, выполнено ли условие, и если нет, запускает Claude дальше без вашего участия. Полезно для миграций, рефакторингов и разбора бэклога, когда конечное состояние понятно, а количество шагов заранее неизвестно. Последние месяцы Claude Code плотно идёт в сторону автономности. Сначала появился auto mode, который снимает разрешения на отдельные tool calls. Потом прикрутили routines и облачные сеансы. Появилась [панель Agent View](https://matveev.tech/claude-code-agent-view/), чтобы видеть все параллельные агенты в одном окне. И вот теперь дошли до команды, которая собирает всё это в одну простую идею: вы говорите, что считаете «готово», а Claude сам решает, когда остановиться. Я попробовал `/goal` на паре своих задач. Делюсь, что внутри и где он правда помогает. ## Что делает `/goal` Команда задаёт completion condition для сессии. После каждого хода Claude отдельная небольшая модель читает разговор и решает: условие выполнено? Если нет, Claude получает короткое объяснение «почему ещё нет» и запускается на следующий ход. Цикл крутится, пока оценщик не скажет «да» или пока вы не остановите его руками через `/goal clear`. Запуск выглядит так: ``` /goal все тесты в test/auth проходят и линтер чистый ``` Условие может быть до 4000 символов, так что туда можно зашить и формальные критерии приёмки, и ограничения вроде «не трогай файлы вне модуля auth». Когда `/goal` активен, в интерфейсе горит индикатор `◎ /goal active` и таймер времени работы. Технически это обёртка над session-scoped Stop hook с prompt-based проверкой. По умолчанию оценщиком работает Haiku, можно настроить любую другую быструю модель. Каждый ход оценщика биллится отдельно, но обычно копейки на фоне основной работы Claude. ## Чем отличается от других автономных режимов В Claude Code накопилось несколько способов оставить Claude работать самого. Они решают разные задачи, и их легко перепутать. | Подход | Когда запускается следующий ход | Когда останавливается | | --------- | ----------------------------------- | ------------------------------------------------------ | | /goal | После завершения предыдущего хода | Когда модель подтверждает выполнение условия | | /loop | По таймеру (через интервал времени) | Когда вы остановите или Claude решит, что готово | | Auto mode | Не запускает новые ходы | Внутри одного хода пропускает подтверждения tool calls | Auto mode и `/goal` друг друга дополняют. Auto mode убирает паузы на разрешения внутри хода. `/goal` убирает паузы между ходами. В связке получается полностью unattended работа: вы запустили команду и ушли пить кофе, Claude сам прокладывает себе путь. ## Быстрый старт 1. Откройте проект в Claude Code и примите trust dialog. Без этого `/goal` не запустится, потому что оценщик использует систему hooks. 2. Введите команду с условием: `/goal CHANGELOG.md содержит запись для каждого PR, смерженного на этой неделе` Сессия сразу же стартует первый ход — отдельный промпт не нужен. 3. После каждого хода смотрите в транскрипт: там появится короткое объяснение оценщика, почему условие пока не выполнено и что Claude будет делать дальше. 4. Чтобы посмотреть статус, выполните `/goal` без аргументов: покажет условие, время работы, число ходов, потраченные токены и последнюю причину от оценщика. 5. Чтобы остановить досрочно, наберите `/goal clear`. Алиасами работают `stop`, `off`, `reset`, `none`, `cancel`. Запуск `/clear` для очистки разговора тоже снимает активный goal. В non-interactive режиме всё работает через флаг `-p`: ``` claude -p "/goal CHANGELOG.md содержит запись для каждого PR за неделю" ``` Процесс крутится до выполнения условия. Прерывание — стандартный Ctrl+C. Если сессия завершилась с активным goal, при `--resume` или `--continue` условие восстановится, но таймер, счётчик ходов и базовый расход токенов обнулятся. ## Как писать условия, которые работают Оценщик не запускает команды и не читает файлы напрямую. Он видит только то, что Claude вывел в чат. Это важно: если условие про «все тесты прошли», Claude должен сам запустить тесты и показать результат, иначе оценщику нечего читать. В рабочем условии обычно три вещи: конкретное конечное состояние (результат теста, exit code сборки, число файлов, пустота очереди), способ доказательства от Claude (например, «`npm test` exits 0», «`git status` чистый», «выведи таблицу с покрытием») и ограничения, которые не должны нарушаться («не трогать тестовые файлы», «миграции только через CLI»). Без любой из этих трёх вещей оценщик начинает либо зацикливать Claude, либо подтверждать неполный результат. Чтобы цикл не крутился вечно, добавьте лимит прямо в условие: «или остановись после 20 ходов». Claude будет отчитываться по этому пункту каждый ход, а оценщик прочитает отчёт и закроет цикл по таймауту. Чего не стоит писать в условие: - Размытое «код стал лучше» — оценщик не сможет это подтвердить. - Внешнее состояние, которое Claude не покажет в транскрипте: «дашборд показывает зелёный» работает только если Claude сам сделает запрос и покажет ответ. - Условие из нескольких независимых частей, которые тянут разные навыки. Лучше разбить на серию `/goal`. ✈️ Слежу за апдейтами Claude Code каждую неделю и кидаю в канал то, что реально влияет на работу — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Где это правда работает Я не нашёл магических кейсов, где `/goal` заменяет архитектора. Зато есть рутина, которая раньше отъедала час времени по дороге к нормальной задаче. Реализация дизайн-документа. Если PRD оформлен как acceptance criteria («функция X принимает Y и возвращает Z», «UI показывает W при условии V»), эти пункты можно скопировать в `/goal` и оставить Claude закрывать их по очереди. Особенно хорошо для бэк-эндов, где результат проверяется тестами. Триаж бэклога с лейблами. Например, есть метка `ai-fix-me` на десятке issue в gh. Условие: «каждый issue с лейблом ai-fix-me либо закрыт, либо имеет комментарий с предложенным фиксом». Claude идёт по очереди, вы получаете утром PR-ы и комментарии. Из практики: чем уже scope и формальнее критерии, тем `/goal` стабильнее. На задачах вида «сделай красиво» он либо буксует, либо оценщик начинает «галлюцинировать» и подтверждает раньше времени. ## Стоит ли использовать Я бы не стал ставить `/goal` на каждый запуск Claude Code. Большая часть моих задач — это диалог, где я по ходу меняю направление, и автономность мне мешает. Но на повторяемой рутине с понятным финишем это правда экономит время. Если у вас работа Claude Code чаще выглядит как «закрой эти 10 пунктов, потом скажи когда готово», команда вам нужна. Если чаще «давай вместе подумаем над архитектурой», лучше оставаться в обычном режиме. Главное не воспринимать `/goal` как «поставил условие и забыл». Оценщик-Haiku видит контекст, но он маленький и иногда ошибается. На длинных сессиях я ловил случаи, когда он подтверждал выполнение условия, хотя один из критериев был незакрыт. Поэтому формулировки лучше делать жёсткими и проверяемыми, и периодически смотреть транскрипт. В целом фича укладывается в общий вектор Anthropic. Claude Code всё больше похож на оркестратора долгих задач. Связка `/goal` \+ auto mode + Agent View по сути уже даёт инфраструктуру unattended-разработки на одной машине. До полноценных [Managed Agents](https://matveev.tech/claude-managed-agents-api/) ещё далеко, но направление понятное. [Keep Claude working toward a goal — Claude Code DocsКоманда /goal задаёт условие, и Claude работает без вашего участия, пока маленькая модель не подтвердит, что условие выполнено.code.claude.com](https://code.claude.com/docs/en/goal?ref=matveev.tech) ## Что ещё почитать - [Claude Code Agent View: одна панель для всех сессий](https://matveev.tech/claude-code-agent-view/) — как мониторить параллельные сессии Claude, в том числе с активным `/goal`. - [Karpathy skills для Claude Code: 4 правила против мусора](https://matveev.tech/karpathy-skills-claude-code/) — про дисциплину промптов, без которой автономный режим превращается в генератор шума. - [Почему CLI-инструменты снова стали важны](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text/) — почему агентам удобнее жить в терминале, а не в IDE. - [Claude Managed Agents: запускаем AI-агентов через API](https://matveev.tech/claude-managed-agents-api/) — альтернативный путь для unattended-задач, когда локальная сессия не подходит. ### Claude Code Agent View: одна панель для всех сессий URL: https://matveev.tech/claude-code-agent-view/ Last updated: 2026-05-13T09:52:10.000Z > TL;DR: Anthropic выкатила [Agent View в Claude Code](https://claude.com/blog/agent-view-in-claude-code?ref=matveev.tech) — одну панель, где видно все параллельные сессии разом, без жонглирования терминалами. Доступно как Research Preview на Pro, Max, Team, Enterprise и API планах. Запуск: `claude agents`. ## Новый интерфейс управления Claude Code 11 мая 2026 года Anthropic анонсировала Agent View — новый интерфейс управления в Claude Code. До этого, чтобы гонять несколько Claude-сессий параллельно, приходилось жонглировать вкладками терминала, tmux и держать в голове, что куда отправил. Теперь всё в одном месте: список сессий, статус каждой (ждёт ответа, работает, готово), последний ответ и время последнего взаимодействия. Открывается по левой стрелке из любой сессии или через команду `claude agents` в терминале. Внутри панели можно «подсмотреть» последний ход сессии без полного открытия. Если Claude ждёт решения, ответ можно дать прямо отсюда, и сессия продолжит работу. Любую активную сессию реально отправить в фон через `/bg`, или сразу запустить фоновую: `claude --bg [task]`. ![Интерфейс Agent View в Claude Code со списком всех сессий и их статусом](https://matveev.tech/content/images/2026/05/ghost_img_cd321bdffc.png) Anthropic перечислила, как фичу используют ранние юзеры: - Кинуть сразу пять задач, потом вернуться к списку готовых PR - Гонять долгоживущих агентов (PR-няньки, обновлятели дашбордов) — в строке видно время следующего запуска - Дёрнуть стрелку, спросить что-то по соседнему коду, вернуться обратно в основную сессию - Сканировать список и понимать, что уже доехало до продакшена ⌨️ Шпаргалка по командам: `claude agents` — открыть панель, левая стрелка — то же самое из активной сессии, `/bg` — отправить текущую сессию в фон, `claude --bg [task]` — сразу запустить фоновую. --- Если ты гонял больше двух Claude Code сессий разом, понимаешь боль: терминалы, tmux-сетки, забытые контексты. Сама идея, что разработчик становится оператором группы агентов, давно витала в воздухе. Я писал про это в [обзоре CLI как платформы для AI-агентов](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text). Agent View — первый шаг к нормальному UI для такой работы прямо в терминале, без обвязки внешними тулзами. Подписывайся на меня в Telegram [Подписаться ](https://t.me/ctospeech?ref=matveev.tech) Открытый вопрос: насколько Research Preview окажется стабильным под нагрузкой пяти-десяти параллельных сессий. Anthropic пишет, что лимиты обычные. Значит, плата идёт за каждую сессию отдельно. Подозреваю, что массовый параллелизм заметно ударит по бюджету Pro и Max-планов. ## Что ещё почитать - [Почему CLI-инструменты снова стали важны? Теперь ими пользуются AI-агенты](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text) — про возвращение CLI как удобной среды для агентов - [Anthropic + SpaceX: 220k GPU и удвоение лимитов Claude](https://matveev.tech/anthropic-spacex-colossus) — про железо, на котором всё это крутится ### Googlebook: Google заменяет Chromebook ноутбуком на Android URL: https://matveev.tech/googlebook-android-laptop/ Last updated: 2026-05-13T09:47:11.000Z > TL;DR: Google [представил Googlebook](https://blog.google/products-and-platforms/platforms/android/meet-googlebook/?ref=matveev.tech) — новую категорию ноутбуков на базе Android и ChromeOS с Gemini внутри. Первые устройства Acer, ASUS, Dell, HP и Lenovo выйдут осенью 2026\. Chromebook фактически уходит на покой через 15 лет после анонса. Google объявил о Googlebook 12 мая 2026\. По форм-фактору это не апдейт Chromebook и не возвращение Pixelbook, а отдельная линейка ноутбуков, построенная вокруг Gemini. Старший директор по продукту Александр Кушер пишет в анонсе: компания переходит «от операционной системы к intelligence-системе» и переосмысляет ноутбук под новую модель. Под капотом у Googlebook стек Android с Google Play плюс Chrome для веба. Российские издания iphones.ru и itc.ua пишут, что платформа называется Aluminium OS, сам Google это название пока не подтверждает. Главная фича — Magic Pointer, курсор с встроенным Gemini. Шевельнул курсор, и он подсказывает контекстные действия. Например, ткнул в дату в письме — назначит встречу. Выбрал картинку своей гостиной и фото нового дивана, и Gemini соберёт их в одну сцену. Над фичей работала команда DeepMind. Вторая новинка — Create your Widget. Промптом просишь Gemini собрать дашборд из почты, календаря и веба, и он формирует виджет под конкретную задачу. Плюс глубокая интеграция с Android-телефоном: запуск телефонных приложений на ноутбуке, доступ к файлам через Quick Access без синхронизаций. Партнёры по железу — Acer, ASUS, Dell, HP, Lenovo. Каждый Googlebook получит фирменную светящуюся полоску glowbar как опознавательный знак. Подробности по моделям и ценам обещают ближе к осени. [GooglebookПромо-площадка нового формата ноутбуков от Google. Подробности по моделям, фичам и партнёрам обещают добавить ближе к осеннему релизу.googlebook.com](https://googlebook.com/?ref=matveev.tech) --- Главное здесь не железо, а признание Google: ChromeOS как отдельная платформа дальше не тянет. Браузерный лэптоп образца 2011 года не выживает в мире, где AI-агент становится главным интерфейсом. Слияние Android и ChromeOS обсуждали годами, и Googlebook это слияние оформляет окончательно. Magic Pointer мне интересен больше виджетов. Курсор не менялся со времён правой кнопки мыши, и сделать его контекстным агентом — логичный ход. Но всё пока на уровне промо-роликов. Ни одного устройства в руках у обзорщиков нет, фичи показывает только Google. Подождём осени и реальных тестов. Обещания про AI-курсоры мы уже слышали с Pixel. Параллельно Google разгоняет свои модели на устройствах. Недавно писал про [MTP drafters для Gemma 4](https://matveev.tech/gemma-4-mtp-drafters/), которые ускорили инференс в три раза. Если эта технология попадёт в локальные модели Googlebook, обещание про «proactive help» станет ощутимым, а не маркетинговым. ## Что ещё почитать - [Gemma 4 ускорили в 3 раза: что такое MTP drafters от Google](https://matveev.tech/gemma-4-mtp-drafters/) — как Google разгоняет свои модели для устройств ### AI-боты в Telegram: гостевой режим и общение между ботами URL: https://matveev.tech/telegram-ai-bots-revolution/ Last updated: 2026-05-09T07:35:45.000Z > TL;DR: Telegram добавил гостевой режим для AI-ботов (вызов через @ в любом чате), общение между ботами, стриминг ответов и автоматизацию чатов. Мессенджер превращается в рантайм для мультиагентных систем. Где раньше был просто бот для команд, теперь полноценная среда для AI-агентов. 7 мая 2026 [Telegram выкатил обновление](https://telegram.org/blog/ai-bot-revolution-11-new-features/ru?ref=matveev.tech), которое команда называет «революцией ИИ-ботов». Само по себе название громкое, но если посмотреть на список фич, впервые за долгое время это похоже на правду. Telegram собирает в мессенджере инфраструктуру для агентных систем, и это интереснее любой обёртки над ChatGPT в чате. Распакуем по пунктам. ## Гостевой режим — бот в любом чате через @ Раньше, чтобы поговорить с ботом, нужно было запустить с ним отдельный чат или добавить в группу. Теперь бот вызывается через упоминание прямо в любом личном или групповом чате. Указал `@имя_бота` в сообщении, он ответит там же, где его упомянули. Важная деталь по безопасности. Бот видит только то сообщение, в котором его упомянули, и ответы на него. Других участников чата и историю он не видит. Telegram прямо пишет, что у бота нет доступа к остальным сообщениям, и публикует [руководство для разработчиков](https://core.telegram.org/bots?ref=matveev.tech) по настройке гостевого режима. Это меняет UX. Чтобы спросить ChatGPT-обёртку или фактчек-бота, не надо переключаться, копировать сообщение, возвращаться в чат. Всё происходит в контексте обсуждения, как ответ обычного участника. ## Боты могут общаться между собой Исторически боты в Telegram не могли отвечать другим ботам. Только людям. С 7 мая это изменилось: бот может ответить боту через упоминание. Для меня это самое интересное в обновлении. Это та самая базовая инфра, которой не хватало для мультиагентных систем прямо в чатах. Один бот вытаскивает данные, второй обрабатывает, третий пишет ответ, и всё это видно в общем чате как обычная переписка. 🤖 Один бот ищет, второй проверяет факты, третий пишет ответ. Раньше такую цепочку приходилось собирать в коде через LangChain или Swarm. Теперь её можно построить в групповом чате на глазах у пользователя. ## Стриминг ответов — как в ChatGPT Bot API теперь поддерживает плавный вывод текста: ответ появляется по мере генерации, а не дожидается окончания. Telegram добавил для этого новую анимацию. Долго ждали этой фичи. Раньше бот мог либо мгновенно ответить, если запрос быстрый, либо показать «печатает...» и через 30 секунд выдать всю простыню разом. Теперь поведение приближено к привычному UX чат-моделей, текст появляется по словам. Для тех, кто строит обёртки над LLM в Telegram, это снимает кучу UX-костылей. Не надо городить разбивку на несколько сообщений, чтобы создать ощущение быстрого ответа. Bot API сам обновляет сообщение по мере поступления токенов. ## Автоматизация чатов — бот отвечает от твоего имени В настройках Telegram появился раздел Автоматизация чатов. Туда подключается бот, и пользователь даёт ему право отвечать на сообщения от своего имени. Можно выбрать, к каким чатам у бота есть доступ: ко всем, кроме контактов, только к новым диалогам, или какой-то ещё конфиг. Применений видно много. Автоответчик, пока в отпуске. Фильтр первого контакта, когда бот отсевает спам и продажников до того, как до тебя дойдёт сообщение. Персональный ассистент с контекстом твоих привычек, который отвечает по простым вопросам и эскалирует сложные. У этой штуки есть очевидный минус: новая поверхность для соц-инжиниринга. Если бот общается за тебя, надо доверять разработчику бота. Telegram не говорит, насколько прозрачно для собеседника, что отвечает не человек, и это пока серая зона. ## Кастомные AI-стили В Telegram уже был AI-редактор сообщений: переводит, переписывает, стилизует. Теперь к нему можно создать собственные наборы инструкций, такой набор называется стилем. У каждого стиля есть ссылка, которой можно поделиться. Идея в том, что команда задаёт стиль для коммуникаций («спокойный, без восторга, без тире»), а сообщество создаёт свои с локальными мемами. По сути это system prompt для письма в Telegram, упакованный в делегируемую ссылку. Удобно для команд, где важна единая манера письма. ## Что ещё в обновлении Остальные нововведения короче: - Поиск по 100 млн эмодзи и стикеров на 36 языках. Под капотом работают AI-модели на сети Cocoon, которые сканируют и маркируют пользовательские стикеры. Каждый год их добавляется несколько миллионов, без AI-индексации искать в этом было бы невозможно. - Статистика голосования. Администраторам каналов с опросами от 100 голосов доступны интерактивные графики динамики голосов. - Ограничения опросов. Голосовать могут только подписчики канала или пользователи из определённых стран. - Беззвучные отложенные сообщения. Теперь можно запланировать отправку без звукового уведомления получателю. - Удаление реакций модераторами. Администраторы групп могут стирать реакции конкретных пользователей, в том числе все реакции одного человека сразу. И ещё больше 200 правок и улучшений на разных платформах, по итогам активности пользователей на платформе сообщений об ошибках. ✈️ Слежу за тем, как AI-агенты переезжают из API в обычные мессенджеры. [Подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вывод Telegram продолжает превращаться из мессенджера в платформу. Гостевой режим, общение ботов и стриминг ответов вместе дают базовый рантайм для мультиагентных систем, причём с готовым пользовательским интерфейсом. Я не уверен, что обновление сразу породит волну продакшен-агентов в Telegram. Большинство серьёзных пайплайнов всё равно будут жить в коде на сервере, без посредников в виде мессенджера. Но для прототипов и небольших задач Telegram теперь самый удобный из публичных мессенджеров: видишь каждое действие агента, можешь вмешаться, делишься состоянием с командой через обычный групповой чат. Что важно, сделано всё аккуратно. Гостевой режим не следит за чужими сообщениями, у ботов ограниченная видимость по чату, настройки автоматизации в профиле прозрачные. Так оно и должно быть. ## Подпишись на обзоры AI-инструментов Подписаться Email sent! Check your inbox to complete your signup. ## Что ещё почитать - [Почему CLI-инструменты снова стали важны? Теперь ими пользуются AI-агенты](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text/) — про инфру для агентов в командной строке - [Anthropic + SpaceX: 220k GPU и удвоение лимитов Claude](https://matveev.tech/anthropic-spacex-colossus/) — где живут модели, которые крутятся внутри этих ботов - [GPT-5.5 и GPT-5.5 Pro: обзор новых моделей OpenAI](https://matveev.tech/gpt-5-5-openai-obzor/) — какие модели подключают к Telegram-ботам прямо сейчас ### Gemma 4 ускорили в 3 раза: что такое MTP drafters от Google URL: https://matveev.tech/gemma-4-mtp-drafters/ Last updated: 2026-05-08T18:50:34.000Z > TL;DR: Google выпустил MTP drafters для семейства Gemma 4\. Это маленькая модель-черновик, которая угадывает следующие несколько токенов одним заходом, а основная модель потом проверяет угадку за один проход. Итог — до 3x ускорения на том же железе, без потери качества. Лицензия Apache 2.0, работает с vLLM, MLX, Hugging Face Transformers, SGLang и Ollama. Gemma 4 вышла несколько недель назад и за это время её скачали больше 60 миллионов раз. По заявлению Google, это пока их самая способная открытая модель, картинка приличная для тех, кто хочет крутить LLM локально. И вот теперь Google добавил к ней то, чего давно ждали все, кто запускает Gemma на маках и потребительских видеокартах, ускорение через Multi-Token Prediction. Дальше расскажу, что это вообще значит на пальцах и почему стоит смотреть в сторону MTP, если у тебя инференс упирается в скорость. ## Память как главный тормоз LLM Стандартная инференция большой языковой модели устроена так. Процессор почти всё время не считает, а гоняет миллиарды параметров из VRAM в вычислительные блоки, чтобы выплюнуть один-единственный токен. Compute простаивает, latency растёт, особенно на пользовательских GPU. Команда Google в [статье на блоге](https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/?ref=matveev.tech) пишет, что главный bottleneck именно в memory bandwidth: основное время уходит на перенос параметров, а не на сами вычисления. А самое обидное в том, что модель тратит одинаковое количество вычислений и на угадку очевидного («words» после «Actions speak louder than…»), и на решение сложной логической задачи. На «ага, тут просто вода» уходит столько же FLOPs, сколько на реальные рассуждения. Эту неэффективность MTP и пытается отжать. ## Как работает speculative decoding Идея простая, но красивая. Берём две модели: тяжёлую target (например, Gemma 4 31B) и лёгкую drafter, специально обученную предсказывать сразу несколько токенов вперёд. Drafter угадывает за раз последовательность, а target потом верифицирует её одним forward pass-ом. Если target соглашается с предсказанием, он принимает всю последовательность сразу и в довесок генерирует ещё один свой токен. Получается, что за время, нужное для одного токена в обычной схеме, ты получаешь несколько драфтовых плюс один бонусный. Сама техника не новая, её ещё в 2022 предложили исследователи Google в [Fast Inference from Transformers via Speculative Decoding](https://arxiv.org/abs/2211.17192?ref=matveev.tech). Что нового, так это то, что MTP-головы встроили прямо в семейство Gemma 4 и оптимизировали под конкретные размеры моделей. ## Где это реально полезно ![Прирост скорости MTP drafters для Gemma 4 на разном железе](https://matveev.tech/content/images/2026/05/gemma-4-mtp-chart.png) Если ты строишь что-то с LLM, скорость инференса часто становится потолком, особенно на ноутах и edge-устройствах. С MTP drafters Gemma 4 даёт несколько понятных выигрышей: - Чат и голосовые приложения чувствуются ближе к реалтайму. Ответ начинает течь быстрее, паузы между токенами короче. - 26B MoE и 31B Dense крутятся на потребительских GPU и личных машинах с разумной скоростью. Раньше 31B на одной видяхе было больно. Сейчас терпимо. - E2B и E4B на телефонах генерируют быстрее и кушают меньше батарейки. - Ноль деградации качества. Финальную проверку делает сама Gemma 4, поэтому frontier-class рассуждения остаются те же. Из любопытного: на Apple Silicon у 26B MoE есть нюанс с роутингом экспертов на batch size 1\. Но если поднять batch до 4-8, прирост уходит в район 2.2x локально. То же самое подтверждается на Nvidia A100 при увеличении batch size. Сам пока не гонял в проде, все цифры из бенчмарков Google, но по архитектуре техника проверенная, и нет причин не доверять заявленному 3x на 31B Dense. ## Что под капотом Drafter не живёт сам по себе. Он использует активации target-модели и шарит её KV cache, то есть не пересчитывает контекст, который большая модель уже разобрала. Это экономит и время, и память. Для edge-моделей E2B и E4B Google добавили эффективный clustering в embedder. Там основной bottleneck это финальный logit, и его пришлось отдельно ускорять. Кому хочется глубже, у Google есть [технический разбор архитектуры MTP](https://ai.google.dev/gemma/docs/mtp/overview?ref=matveev.tech) с диаграммами KV cache sharing и эмбеддерами. ## Как попробовать прямо сейчас MTP drafters лежат под той же лицензией Apache 2.0, что и сама Gemma 4\. То есть можно качать, тюнить, встраивать в свои продукты без хитростей. [Google · Hugging FaceСемейство моделей Gemma 4 и MTP drafters. Веса под лицензией Apache 2.0 — для локального инференса, fine-tuning и встраивания в продукты.huggingface.co](https://huggingface.co/google?ref=matveev.tech) - Веса лежат на [Hugging Face](https://huggingface.co/google?ref=matveev.tech) и [Kaggle](https://www.kaggle.com/models/google/gemma-4?ref=matveev.tech). - Запускается через transformers, MLX, vLLM, SGLang, Ollama. - На Android и iOS можно потыкать через Google AI Edge Gallery. Если ты на маке, MLX скорее всего даст самый понятный setup. Для серверного inference подойдут vLLM или SGLang. Для домашнего стенда с парой видях, Ollama. ✈️ Слежу за релизами Google, OpenAI и опенсорс LLM в [телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вывод MTP drafters добавляются к существующим Gemma 4 как сопровождающая модель-черновик. Эффект ощущается там, где раньше Gemma 4 31B жила медленно: на 4090, RTX 6000, маках с Apple Silicon. Там, где Gemma уже летала, прирост скромнее, но всё равно есть. Думаю, главная польза тут в формате выпуска. Google выложил готовый артефакт: скачал вечером, запустил, почувствовал прирост. Speculative decoding известен давно, но в комплекте с весами под Apache 2.0 техника перестаёт быть «вот сделай руками» и становится просто фичей. Для всех, кто строит на open-source LLM, это хорошая новость. ## Что ещё почитать - [Hermes Agent: автономный AI-агент от Nous Research 2026](https://matveev.tech/hermes-agent-obzor) — другой пример того, как опенсорс LLM выходит на уровень закрытых. - [GPT-5.5 и GPT-5.5 Pro: обзор новых моделей OpenAI](https://matveev.tech/gpt-5-5-openai-obzor) — для контекста, что у соседей. - [KillBench: скрытые bias у всех топ-LLM в решениях о жизни](https://matveev.tech/killbench-bias-llm) — про то, как разные топовые модели ведут себя в одинаковых условиях. ### Anthropic + SpaceX: 220k GPU и удвоение лимитов Claude URL: https://matveev.tech/anthropic-spacex-colossus/ Last updated: 2026-05-06T16:47:45.000Z > TL;DR: Anthropic подписал партнёрство со SpaceX и забирает весь compute дата-центра Colossus 1 — это 300 МВт мощности и больше 220 000 NVIDIA GPU. Параллельно компания удваивает пятичасовые лимиты Claude Code для Pro, Max, Team и Enterprise, убирает урезание лимитов в часы пик и поднимает rate limits API для моделей Opus. Пользователи Pro и Max последний год регулярно упирались в лимиты Claude Code, особенно во время американского рабочего дня. И вот сегодня компания объявляет: сделка со SpaceX, новый дата-центр и три апгрейда лимитов сразу. ## Что изменилось для пользователей Claude Три изменения, все вступают в силу с 6 мая 2026: 1. Пятичасовые лимиты Claude Code удвоили для Pro, Max, Team и seat-based Enterprise планов. Если у тебя Pro за $20 в месяц, ты теперь можешь делать в два раза больше запросов за ту же подписку. 2. Убрали ограничение в часы пик для Claude Code на Pro и Max. Раньше в американский рабочий день лимиты были меньше: Anthropic так балансировал нагрузку. Теперь полные лимиты круглосуточно. 3. Подняли rate limits API для моделей Opus, конкретные цифры в таблице ниже. ![Обновлённые rate limits API для моделей Claude Opus](https://matveev.tech/content/images/2026/05/ghost_img_9b62197eab.png) Для разработчиков, которые гоняют Claude Code как AI-pair или поднимают агентские workflow на API, это конкретное снижение боли. Особенно убирание peak hours: оно давно раздражало команды в США и Европе. У меня самого Claude Code Pro упирался в лимиты примерно к обеду по US-времени, и это ломало flow. ## Что такое Colossus 1 и при чём тут SpaceX Anthropic подписал соглашение со SpaceX на эксклюзивное использование всей мощности дата-центра Colossus 1\. Цифры: 300+ мегаватт, более 220 000 NVIDIA GPU, capacity подключается «в течение месяца». Для контекста: средний коммерческий дата-центр в США работает на 30-50 МВт. Большой, около 100 МВт. 300 МВт — это уровень крупнейших гипермасштабных площадок. 220 000 GPU H100/H200 стоят примерно 5-7 миллиардов долларов только по железу, без учёта сетевой инфраструктуры и электричества. Любопытный момент: SpaceX принадлежит Илону Маску. У Маска есть xAI с собственным дата-центром Colossus в Мемфисе, который тоже является прямым конкурентом Anthropic в LLM. ## Это не первая мегасделка Anthropic в этом году Партнёрство со SpaceX встаёт в ряд других compute-соглашений Anthropic. Что у них уже есть: - Amazon: соглашение до 5 ГВт, около 1 ГВт новой ёмкости к концу 2026 - Google и Broadcom: 5 ГВт, начнут запускать в 2027 - Microsoft и NVIDIA: стратегическое партнёрство со $30 млрд capacity на Azure - Fluidstack: $50 млрд инвестиций в американскую AI-инфраструктуру Anthropic законтрактовал больше 10 ГВт compute на ближайшие годы. Плюс компания работает на трёх типах железа: AWS Trainium, Google TPU и NVIDIA GPU. Это страховка от поломок одной экосистемы и ценового давления одного вендора. Если вспомнить, что год назад главным дефицитом для AI-компаний был именно compute, такой портфель выглядит как серьёзная заявка на удержание лидерства. ## Орбитальные дата-центры: да, серьёзно В анонсе спрятан интересный абзац: Anthropic выразил интерес к совместной разработке со SpaceX «multiple gigawatts of orbital AI compute capacity». Дата-центров на орбите. Идея не новая. SpaceX через Starlink уже пять лет показывают, что массовое размещение электроники на низкой орбите коммерчески жизнеспособно. Космос даёт два бонуса: пассивное охлаждение через излучение в вакуум и доступ к солнечной энергии без облаков и атмосферы. Минусы тоже понятны: дорогой запуск и радиация, которая поджаривает электронику быстрее, чем на земле. Пока это просто декларация намерений, без конкретных дат. Но факт, что Anthropic в официальном пресс-релизе пишет про орбиту, говорит о том, что разговор серьёзный. Если SpaceX получит контракты на запуск compute-капсул, а Anthropic на их использование, это будет один из самых нестандартных AI-альянсов в индустрии. ## Международная экспансия и компенсация электричества Часть новой capacity пойдёт за пределы США, в Европу и Азию. Причина прагматичная: enterprise-клиенты в финансовом секторе, медицине и госструктурах требуют data residency и соответствие локальным регуляциям. Часть этой экспансии идёт через сделку с Amazon, которая включает inference в Европе и Азии. Ещё одна деталь, которая лично мне понравилась: компания обещает покрывать рост цен на электричество для жителей в районах, где находятся дата-центры в США, и собирается распространить эту практику на новые страны. AI-инфраструктура реально давит на электросети. Северная Вирджиния и Техас уже ощутили это первыми. Получается не только PR-ход, но и попытка не превратить локальные коммьюнити во врагов. ## Что это значит на практике Если ты используешь Claude Code на Pro или Max, реально станет легче работать. Удвоенные лимиты плюс снятие peak hours покрывают большинство кейсов, где раньше упирался в потолок. Если ты строишь продукт на Claude API, особенно на Opus, новые rate limits открывают сценарии, которые до этого были на грани по latency и пропускной способности. Reasoning-агенты с долгим thinking или batch-processing больших документов становятся реальнее по бюджету. Если смотреть стратегически, Anthropic играет в долгую. Compute-сделки на 10+ ГВт, диверсификация по железу, готовность арендовать у соседней империи Маска, разговоры про орбитальные дата-центры. Дефицит ёмкости был главным ограничителем скорости компании весь 2025-й год, и они теперь закрывают эту дыру со всех сторон. Думаю, в ближайшие месяцы стоит ждать ещё пару подобных сделок. И, возможно, конкретики по поводу orbital compute. За этим точно интересно следить. 📡 Compute-сделки Anthropic, OpenAI и xAI разбираю по горячим следам — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [Почему CLI-инструменты снова стали важны? Теперь ими пользуются AI-агенты](https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text/) — про Claude Code и почему CLI снова в моде - [GPT-5.5 и GPT-5.5 Pro: обзор новых моделей OpenAI](https://matveev.tech/gpt-5-5-openai-obzor/) — что показал главный конкурент Anthropic - [Hermes Agent: автономный AI-агент от Nous Research 2026](https://matveev.tech/hermes-agent-obzor/) — открытая альтернатива закрытым моделям [Higher usage limits for Claude and a compute deal with SpaceXОфициальный анонс Anthropic про партнёрство со SpaceX, дата-центр Colossus 1 и обновлённые лимиты Claude Code и API.Anthropic · 6 мая 2026](https://www.anthropic.com/news/higher-limits-spacex?ref=matveev.tech) ### Почему CLI-инструменты снова стали важны? Теперь ими пользуются AI-агенты URL: https://matveev.tech/cli-instrumenty-dlya-ai-agentov-cloudwatch-insights-img4-diagram-in-text/ Last updated: 2026-05-01T14:43:38.000Z Я всё чаще ловлю себя на странной мысли: хорошие внутренние CLI-инструменты стали ценнее, чем были пару лет назад. Раньше это была история про удобство разработчика. Сделал себе маленькую утилиту, чтобы не кликать в AWS-консоли, не вспоминать длинную команду или не собирать jq-пайплайн. Удобно, но локально. Твой личный костыль, максимум — инструмент для команды. С AI-агентами эта логика поменялась. CLI теперь не только для человека. Им может пользоваться Claude Code, Codex, OpenCode или любой другой агент, которому ты доверил терминал. ## Маленький пример: CloudWatch Insights без консоли На Hacker News сегодня увидел пост Мартина Скэгедала про его `cloudwatch-insights` tool. Это небольшая CLI-утилита для работы с AWS CloudWatch Insights. Вместо того чтобы идти в AWS-консоль, выбирать log groups, настраивать time range и копировать запросы руками, ты запускаешь команду из репозитория нужного сервиса: ```bash cd ~/code/some-service cloudwatch-insights query --new --env prod ``` Инструмент берёт конфигурацию из контекста проекта: какие log groups использовать, какой app filter подставить, какой env выбран. Потом создаёт query-файл, открывает его в `$EDITOR`, запускает запрос и сохраняет результат локально в JSONL. То есть вместо “зайди в консоль, найди нужный сервис, найди нужные логи, отфильтруй ошибки” получается воспроизводимый workflow: ```bash cloudwatch-insights query --new --env prod cloudwatch-insights show ``` А вот так это может использовать агент: ```bash claude -p 'Run "cloudwatch-insights show" and fix the errors.' ``` ## CLI становится интерфейсом для агента Мы привыкли думать про CLI как про интерфейс для человека. Человек читает help, запускает команду, смотрит вывод, принимает решение. Но агенту такой интерфейс тоже подходит. У CLI есть несколько свойств, которые внезапно стали очень полезными: - команды можно выполнять из терминала; - результат можно сохранить в файл; - вывод можно передать в модель; - поведение проще повторить; - действия легче логировать и проверять. Для AI-агента это почти идеальная поверхность. Не надо учить его кликать по консоли. Не надо делать скриншоты. Не надо объяснять, где в AWS находится нужная кнопка. Дай команду. Получи текст. Разбери результат. Предложи фикс. ## А как же MCP? Тут легко уйти в привычный рефлекс: если нужно подключить агента к инструменту, значит нужен MCP-сервер. MCP хорош, когда нужен явный контракт: список тулов, схемы аргументов, permissions, discovery, интеграция с разными клиентами. Если ты делаешь инструмент для внешних пользователей или хочешь нормальную агентскую инфраструктуру, MCP выглядит логично. Но для внутренних workflows иногда обычный CLI проще. У тебя уже есть авторизация через AWS. Уже есть локальный контекст репозитория. Уже есть привычный формат файлов. Уже есть терминал, в котором работает агент. Зачем добавлять ещё один слой, если агент может вызвать ту же команду, что и ты? Это не аргумент против MCP. Скорее напоминание, что MCP не должен становиться рефлекторным ответом на любую задачу. Иногда лучший инструмент для агента — это маленькая команда, которая хорошо делает одну вещь. ## Что это меняет для разработки внутренних инструментов Если принять, что CLI будут использовать не только люди, но и агенты, меняется дизайн таких утилит. Хороший CLI для агента должен быть чуть более аккуратным, чем скрипт для себя. Во-первых, вывод должен быть машинно-читаемым. JSONL, JSON, понятные exit codes, стабильные поля. Красивые таблички удобны человеку, но агенту проще работать с данными. Во-вторых, команды должны быть предсказуемыми. Если `show` сегодня показывает последние результаты, а завтра внезапно открывает интерактивный pager, агент сломается. Человек разберётся. Агент начнёт делать странное. В-третьих, важно разделять действия на безопасные и опасные. Команда, которая читает логи, и команда, которая чистит очередь или перезапускает сервис, должны ощущаться по-разному. Для агента это особенно важно. В-четвёртых, полезны dry-run режимы. Агент может сначала показать, что собирается сделать, а человек уже подтвердит. И наконец, help должен быть нормальным. Не для красоты. Модели реально читают `--help` и README, когда пытаются понять, как пользоваться инструментом. ## Что можно сделать у себя Я бы начал не с MCP-сервера и не с большой платформы автоматизации. Начал бы с инвентаризации скучных команд. Где разработчики чаще всего ходят в UI? - посмотреть production-логи; - найти ошибки по request id; - проверить статус очередей; - посмотреть деплой; - вытащить последние failed jobs; - собрать диагностический bundle для инцидента. Если действие повторяется каждую неделю, его можно завернуть в CLI. Если CLI возвращает нормальный текст или JSON, его уже может использовать агент. Дальше появляются сценарии: ```bash agent logs errors --service billing --env prod --since 1h agent deploy status --service api agent incident bundle --request-id abc123 ``` Названия условные. Смысл не в них. Смысл в том, что AI-агенту не нужен доступ “ко всему”. Ему нужны узкие, понятные ручки к реальным рабочим процессам. ## Вывод История с `cloudwatch-insights` хороша не самой утилитой. Хотя утилита полезная. Она хорошо показывает новый паттерн: внутренние CLI становятся API для AI-агентов. Не каждый такой инструмент надо превращать в MCP-сервер. Не каждый workflow нужно тащить в платформу. Иногда достаточно маленькой команды. Раньше мы писали такие инструменты, чтобы меньше кликать самим. Теперь их стоит писать ещё и потому, что ими будет пользоваться кто-то кроме нас. Например, Claude, когда ты попросил его разобраться с ошибками в логах. И да, это звучит чуть странно. Но, кажется, именно так agentic development и будет проникать в обычную инженерную рутину: не через один большой “AI для всего”, а через десятки маленьких CLI, которые наконец-то начали окупаться. ## FAQ ### Нужно ли делать MCP-сервер для каждого внутреннего инструмента? Нет. Если инструмент нужен внутри команды и уже хорошо работает из терминала, обычный CLI может быть проще. MCP полезен, когда нужны схемы tools, discovery, permissions и поддержка разных клиентов. ### Почему CLI удобен для AI-агентов? AI-агент может запускать CLI из терминала, читать stdout, сохранять результаты и передавать их дальше в анализ. Это проще и надёжнее, чем заставлять агента работать через графический интерфейс. ### Что важно в CLI, которым будет пользоваться AI-агент? Стабильный вывод, машинно-читаемые форматы, понятные exit codes, хороший `--help`, dry-run режимы и разделение безопасных и опасных команд. ### Чем CLI отличается от API для агента? Для агента CLI часто и есть локальный API. Он менее формальный, чем HTTP или MCP, но зато живёт в той же среде, что и разработчик: в репозитории, терминале и shell workflow. ### GPT-5.5 и GPT-5.5 Pro: обзор новых моделей OpenAI URL: https://matveev.tech/gpt-5-5-openai-obzor/ Last updated: 2026-04-23T21:07:17.000Z > TL;DR: OpenAI выпустила [GPT-5.5 и GPT-5.5 Pro](https://openai.com/index/introducing-gpt-5-5/?ref=matveev.tech). Новая модель берёт 82,7% на Terminal-Bench 2.0 против 69,4% у Claude Opus 4.7, 73,1% на Expert-SWE и 84,9% на GDPval. В Codex появился контекст 400K, в API будет 1M. Цены в API — $5 за 1M input и $30 за output (обычная версия), $30/$180 за Pro. В ChatGPT раскатывают Plus, Pro, Business и Enterprise. 23 апреля 2026 OpenAI показала GPT-5.5\. Релиз совпал с той же неделей, на которой они выкатили [ChatGPT Images 2.0](https://matveev.tech/chatgpt-images-2-obzor/) и ужесточили safety в Codex. По бенчмаркам GPT-5.5 обходит Claude Opus 4.7 и Gemini 3.1 Pro на большинстве тестов, связанных с кодингом и агентными задачами. Но интересно не это. Главный сдвиг в том, что модель стала лучше держать длинный контекст работы, меньше тратит токенов и увереннее проходит многошаговые сценарии без «отвалиться на середине». Разберём, что там по цифрам, где реально прирост, и стоит ли переходить. ## Что изменилось по сравнению с GPT-5.4 Главный тезис OpenAI: GPT-5.5 «понимает намерение» лучше, берёт на себя больше работы, меньше нуждается в ручном управлении каждым шагом. По цифрам это превращается в такие улучшения против GPT-5.4: | Метрика | GPT-5.5 | GPT-5.4 | Прирост | | ------------------------------- | ------- | ------- | ---------- | | Terminal-Bench 2.0 | 82,7% | 75,1% | +7,6 п.п. | | Expert-SWE (internal) | 73,1% | 68,5% | +4,6 п.п. | | OSWorld-Verified (computer use) | 78,7% | 75,0% | +3,7 п.п. | | ARC-AGI-2 | 85,0% | 73,3% | +11,7 п.п. | | MRCR v2, 512K-1M | 74,0% | 36,6% | +37,4 п.п. | | CTF Internal (кибер) | 88,1% | 83,7% | +4,4 п.п. | Цифры OpenAI, [опубликованы в анонсе](https://openai.com/index/introducing-gpt-5-5/?ref=matveev.tech). Самый яркий прирост — на длинном контексте ближе к миллиону токенов. Там GPT-5.4 откровенно сыпался, а GPT-5.5 держит 74% точности. Думаю, именно это сильнее всего почувствуют те, кто работает с большими кодовыми базами и длинными документами. 📈 На MRCR v2 в диапазоне 512K–1M токенов GPT-5.5 берёт 74% против 36,6% у GPT-5.4\. Удвоение точности на длинном контексте — главный практический сдвиг для работы с большими кодовыми базами. Ещё один важный нюанс, который OpenAI подчёркивает отдельно. GPT-5.5 по скорости на токен сопоставим с GPT-5.4, хотя модель умнее и больше. Обычно более мощная модель проседает по латентности. Здесь нет. Плюс она тратит меньше токенов на те же задачи в Codex, что частично компенсирует рост цены. ## Бенчмарки против Claude Opus 4.7 и Gemini 3.1 Pro Здесь два сюжета одновременно. Где OpenAI вырвалась вперёд, а где Anthropic или Google всё ещё держат корону. **GPT-5.5 ведёт:** - Terminal-Bench 2.0 — 82,7% против 69,4% у Claude Opus 4.7 и 68,5% у Gemini 3.1 Pro - GDPval (профессиональная работа) — 84,9% против 80,3% и 67,3% - CyberGym — 81,8% против 73,1% у Claude - FrontierMath Tier 4 — 35,4% против 22,9% у Claude и 16,7% у Gemini - OfficeQA Pro — 54,1% против 43,6% у Claude, 18,1% у Gemini - Toolathlon — 55,6% против 48,8% у Gemini **Claude Opus 4.7 или Gemini 3.1 Pro ведут:** - SWE-Bench Pro (Public) — 64,3% у Opus 4.7 против 58,6% у GPT-5.5 - Humanity's Last Exam (без tools) — 46,9% у Opus 4.7 против 41,4% у GPT-5.5 - BrowseComp — 90,1% у GPT-5.5 Pro, но в обычной версии Claude 79,3% против 84,4% у GPT-5.5 - ARC-AGI-1 — 98,0% у Gemini 3.1 Pro против 95,0% у GPT-5.5 - MCP Atlas — 79,1% у Claude и 78,2% у Gemini против 75,3% у GPT-5.5 Картина неоднородная. По публичному SWE-Bench Pro Claude Opus 4.7 всё ещё чемпион, и это важный тест реальных багфиксов на GitHub. По общим рассуждениям в Humanity's Last Exam Anthropic тоже впереди. Но везде, где задача подразумевает длинный цикл с инструментами, компьютером, терминалом — GPT-5.5 идёт вперёд. По-моему, это не «одна модель всех побила», а «OpenAI отвоевала позиции в агентном кодинге и офисных задачах». SWE-Bench Pro и академические эссе всё ещё за Anthropic. Подробнее про конкурента — в [обзоре Claude Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor/). ## Codex и агентный кодинг Самое громкое место в анонсе. OpenAI настаивает, что GPT-5.5 — их «самая сильная агентная кодинг-модель на сегодня». Звучит как маркетинг, но тестеры подтверждают. Дэн Шиппер, CEO Every, говорит, что GPT-5.5 — «первая кодинг-модель с серьёзной концептуальной ясностью». Он запустил приложение, несколько дней дебажил проблему, потом позвал сильного инженера на переписывание. Чтобы проверить GPT-5.5, Шиппер отмотал всё назад и дал модели сломанный проект. GPT-5.4 не справился. GPT-5.5 выдал такое же решение, как инженер. Пьетро Скирано, CEO MagicPath, смержил ветку с сотнями изменений во фронтенде и рефакторингом в основную ветку, которая тоже далеко ушла. За двадцать минут, с одного раза. Один инженер из NVIDIA в отзыве OpenAI сказал, что «потеря доступа к GPT-5.5 ощущается как потеря конечности». Слегка драматично, но штука в том, что это говорят не случайные блогеры, а люди, которые до этого год работали с GPT-5.4. Майкл Труэлл, CEO Cursor: > GPT-5.5 заметно умнее и настойчивее GPT-5.4, с более сильным кодингом и надёжным использованием инструментов. Она дольше держится за задачу, не останавливаясь на середине, что особенно важно для сложной длительной работы, которую наши пользователи делегируют в Cursor. Плюс OpenAI раскатывает в Codex контекст на 400K токенов и Fast mode, который в 1,5 раза быстрее генерирует токены за 2,5-кратную цену. Кому нужно быстрее — пожалуйста, дорого. ## Работа с компьютером, офисом и documents Здесь логика такая же, как в кодинге, только вместо IDE — экран ноутбука. GPT-5.5 лучше понимает, что на экране, куда кликать, как двигаться между приложениями. На OSWorld-Verified набрала 78,7% — тот же уровень, что Claude Opus 4.7 (78,0%), но с существенно меньшими токеновыми затратами, если верить OpenAI. Внутри самой OpenAI больше 85% сотрудников еженедельно пользуются Codex. Не только инженеры — финансисты, маркетинг, data science, PR. Пара показательных примеров из анонса: - Команда Comms проанализировала шесть месяцев запросов на выступления, построила скоринг и риск-фреймворк, подключила Slack-агента. Низкорисковые запросы он обрабатывает сам, сложные маршрутизирует людям - Финансисты прогнали 24 771 налоговую форму K-1 на 71 637 страниц за сроки на две недели короче прошлого года - Сотрудник Go-to-Market автоматизировал еженедельные бизнес-отчёты и экономит 5–10 часов в неделю Я про подобное писал в [обзоре Claude Managed Agents](https://matveev.tech/claude-managed-agents-api/) — там тоже про автоматизацию рутинных бизнес-задач, только через API Anthropic. Тренд очевидный: LLM перестают быть «чат-ботом для ответов» и становятся исполнителями, которые реально делают работу. ## Наука: биология, математика, биоинформатика GPT-5.5 Pro — это пятая передача для задач, где GPT-5.5 уже тормозит. Особенно на научных задачах. На GeneBench (многошаговый анализ генетических данных) GPT-5.5 Pro показала 33,2% против 25,6% у GPT-5.4 Pro. На BixBench (биоинформатика) обычная GPT-5.5 взяла 80,5% против 74,0%. На FrontierMath Tier 4 — 39,6% у Pro-версии. Деря Унутмаз, иммунолог из Jackson Laboratory, прогнал через GPT-5.5 Pro датасет экспрессии генов на 62 образца и 28 000 генов. Модель собрала детальный отчёт, который, по его словам, команда делала бы месяцами. Бартош Наскрецки, математик из Польши, за 11 минут сгенерил через Codex приложение для алгебраической геометрии — визуализация пересечения квадратичных поверхностей с конверсией в уравнение Вейерштрасса. Один промпт. ![Визуализация алгебраической геометрии, построенная GPT-5.5 в Codex по одному промпту](https://matveev.tech/content/images/2026/04/ghost_img_454240af3b.webp) Отдельный интересный кейс от OpenAI: внутренняя версия GPT-5.5 с кастомной обёрткой нашла [новое доказательство](https://openai.com/index/introducing-gpt-5-5/?ref=matveev.tech) асимптотического факта про внедиагональные числа Рамсея. Результат проверен в Lean. То есть модель выдала не код и не пересказ, а реальный математический аргумент в центральной области комбинаторики — для топовой модели такое впервые. Думаю, для исследователей с конкретными узкими задачами Pro-версия станет рабочим инструментом, а не демо. Вопрос только в цене. ## Кибербезопасность: High в Preparedness OpenAI честно говорит, что кибер-способности GPT-5.5 они считают High по их [Preparedness Framework](https://openai.com/index/preparedness/?ref=matveev.tech). Не Critical, но step up по сравнению с GPT-5.4. Что это означает на практике: - Жёстче фильтры на рискованные кибер-запросы, на подозрительные паттерны и на повторное злоупотребление - Для верифицированных защитников запущен Trusted Access — можно подать заявку на `chatgpt.com/cyber` и получить меньше отказов для легитимной защитной работы - OpenAI работает с правительствами по защите критической инфраструктуры На CyberGym GPT-5.5 взяла 81,8% против 73,1% у Claude Opus 4.7\. На внутреннем CTF — 88,1%. Это уровень, когда модель реально полезна для red team и blue team, и именно поэтому OpenAI отдельно затянула safety. Тема сложная: чем мощнее модель в кибере, тем больше шансов, что ей воспользуются злоумышленники, и тем важнее давать её защитникам. OpenAI выбирает путь «trusted access с верификацией». Anthropic в Claude Opus 4.7 пошла чуть другим путём (больше авто-модерации без выдачи cyber-permissive вариантов). Какой подход окажется жизнеспособным — покажет ближайший год. ## Цены и где доступ В ChatGPT GPT-5.5 Thinking раскатывают прямо сейчас на Plus, Pro, Business и Enterprise. GPT-5.5 Pro — только Pro, Business, Enterprise. В Codex доступ шире: Plus, Pro, Business, Enterprise, Edu, Go. Контекст 400K, есть Fast mode — 1,5× скорость за 2,5× цены. В API GPT-5.5 ещё не появилась, «скоро будет». По ценам OpenAI ориентирует так: обычная GPT-5.5 пойдёт по $5 за 1M input-токенов и $30 за output, контекст 1M. Pro-версия — $30 за input и $180 за output. Batch и Flex идут за половину обычной цены, Priority — в 2,5× дороже, если нужна приоритетная обработка. Для сравнения, Claude Opus 4.7 в API стоит дороже на input ($15 против $5), но output сопоставимый. GLM-5.1, про которую я [писал раньше](https://matveev.tech/glm-5-1-zhipu-ai-obzor/), идёт в разы дешевле при 94,6% перформанса Opus 4.7 в кодинге. Так что для тех, кто чувствителен к цене, картина неоднозначная. Но если нужна максимальная точность на агентных задачах, GPT-5.5 сейчас выглядит как самый сильный выбор. ## Вывод GPT-5.5 — это ещё плюс один шаг в сторону агентов, которые реально доводят работу до конца. По бенчмаркам OpenAI обогнала Claude Opus 4.7 и Gemini 3.1 Pro в агентном кодинге, офисных задачах и кибер-тестах. В публичном SWE-Bench Pro Claude ещё держит первое место, так что никакого «всё, Anthropic в нокауте» не случилось. Просто в очередной раз поменялись позициями. Что реально круто: модель меньше «сдаётся на середине», лучше держит длинный контекст, эффективнее по токенам. Для тех, кто пишет код в Cursor, Codex или собирает агентов, это самое заметное улучшение. Для исследователей Pro-версия открывает задачи, которые раньше не вытягивали вообще. По цене GPT-5.5 стала дороже GPT-5.4, но OpenAI настаивает, что за счёт лучшей токен-эффективности в итоге выходит дешевле. Поверим и посмотрим. На полноценные выводы нужно несколько недель реальной работы. Если хочется конкретики: я бы сейчас пробовал GPT-5.5 в Codex на одной рабочей задаче и сравнил с Claude Opus 4.7 и тем, чем вы пользуетесь сейчас. Бенчмарки бенчмарками, но только на своих сценариях видно, где модель реально тянет. 🧪 Слежу, какая модель реально выигрывает в рабочих задачах, а не только на бенчмарках — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — главный конкурент, чемпион SWE-Bench Pro - [GLM-5.1: китайская модель на 94,6% от Claude Opus в кодинге](https://matveev.tech/glm-5-1-zhipu-ai-obzor/) — дешёвая альтернатива для тех, кто считает токены - [Qwen 3.6-Plus: Alibaba бросает вызов Claude в агентном кодинге](https://matveev.tech/qwen-3-6-plus-obzor/) — ещё одна агентная модель из Китая - [ChatGPT Images 2.0: новый генератор OpenAI](https://matveev.tech/chatgpt-images-2-obzor/) — что ещё OpenAI выкатила в эту же неделю ### ChatGPT Images 2.0: что умеет новый генератор OpenAI URL: https://matveev.tech/chatgpt-images-2-obzor/ Last updated: 2026-04-22T12:31:44.000Z > TL;DR: 21 апреля 2026 OpenAI выпустила ChatGPT Images 2.0 — новое поколение генератора картинок в ChatGPT. Главное отличие от предыдущей версии: модель теперь рассуждает над промптом, аккуратнее рисует текст на разных языках и вытягивает сложные композиции вроде журнальных разворотов и инфографики. Работает внутри ChatGPT, доступна всем платным тарифам. ChatGPT Images 2.0 — это генератор картинок внутри ChatGPT с thinking mode, рендерингом текста на 20+ языках (включая русский) и поддержкой сложных многопанельных композиций. Модель доступна с 21 апреля 2026 на платных тарифах Plus, Pro, Business и Enterprise. API-версии пока нет. Image-модели в ChatGPT не обновлялись больше года. OpenAI тихо отставала: Google запустил Nano Banana ещё в конце 2025, Midjourney довёл реалистичность до фотошопа, Flux и Ideogram закрепились как стандарт для графики с текстом. И вот на сцене новая модель, которую OpenAI назвала не DALL·E 4, а просто ChatGPT Images 2.0 — видимо, бренд DALL·E решили окончательно убрать. Разбираю, что внутри, чем она отличается от предыдущей версии и стоит ли вообще её рассматривать, если ты уже сидишь в Midjourney или Gemini. ![Постер ChatGPT Images 2.0](https://matveev.tech/content/images/2026/04/chatgpt-images-2-cover.webp) ## Что такое ChatGPT Images 2.0 Это генеративная модель картинок, встроенная в ChatGPT. Пишешь промпт — получаешь картинку. На поверхности всё как раньше. Под капотом — другая архитектура, которая, по словам OpenAI, умеет «рассуждать» перед тем как рисовать. Модель тратит больше времени на планирование композиции, проверку текста и согласование деталей, прежде чем выдать финальный результат. По механике это похоже на reasoning в GPT-5.3: вместо цепочки текстовых шагов модель прогоняет внутренние черновики композиции и отбраковывает неудачные варианты. На одну картинку уходит больше секунд, но результат попадает в промпт точнее. Запуск привязан к двум вещам. Первое: OpenAI явно догоняет Google и её Nano Banana, которая весь 2025 год была эталоном по рендерингу текста и соответствию промпту. Второе: ChatGPT становится универсальной оболочкой для всего. Голос, картинки, видео (Sora), код (Codex), агенты (Operator) — всё в одном окне. ## В чём главные улучшения OpenAI выделяет шесть направлений, по которым новая модель сильнее предыдущей. Пройдусь по каждому и дам свой комментарий. ### Точнее следует промпту Модель лучше держит детали. Если в промпте указано «три кубика, два синих и один красный, с цифрами 1, 2, 3 на верхних гранях» — раньше это превращалось в три случайных кубика с неправильными цифрами или вообще без текста. Теперь, судя по примерам OpenAI, результат стабильно попадает в запрос. Это не революция, а догоняющее улучшение. Gemini 3 Pro Image и Flux уже год как держат промпты на таком уровне. Но для тех, кто живёт в ChatGPT и не хочет прыгать между сервисами, это важно. ### Сильнее в разных языках Главная фишка релиза. По данным [анонса OpenAI](https://openai.com/index/introducing-chatgpt-images-2-0/?ref=matveev.tech), модель поддерживает более 20 языков в рендеринге текста — китайский, японский, корейский, хинди, арабский, тайский, русский, греческий, бенгальский, деванагари и другие. Раньше это было откровенной болью: иероглифы превращались в кашу, кириллица искажалась, арабская вязь ломалась в неправильную сторону. ![Многоязычный рендеринг текста в ChatGPT Images 2.0](https://matveev.tech/content/images/2026/04/chatgpt-images-2-multilang.webp) Для русскоязычной аудитории это конкретный шаг вперёд. Наконец можно делать постеры, обложки, инфографику с русским текстом и не получать «Прɪвeт миp» вместо «Привет мир». По моему опыту с DALL·E 3, кириллица была фактически нерабочей — приходилось либо писать латиницей, либо дорисовывать текст в Figma. Судя по анонсу, эта проблема закрыта. ### Больше стилей и реализма Модель обещает одинаково хорошо работать в фото, аниме, манге, пиксель-арте, ретро-комиксах, 35мм плёночной фотографии и десятке других стилей. Раньше ChatGPT заметно валился на всё, что сложнее «цифровой иллюстрации» и «фотореализма». Аниме был карикатурным, манга — пережаренной, пиксель-арт не держал сетку. ![Кинематографичный портрет на побережье](https://matveev.tech/content/images/2026/04/chatgpt-images-2-candid-portrait.webp) Интересно посмотреть, как это сравнится с Midjourney v8 и Flux Pro. На примерах OpenAI всё выглядит убедительно, но презентационные картинки всегда выглядят убедительно. Реальную оценку можно дать только после тестов на своих промптах. В ближайшие дни прогоню одни и те же промпты через Images 2.0, Midjourney v8 и Flux Pro — напишу отдельный пост с визуальным сравнением. ### Актуальные данные и контекст Новая модель подтянута к актуальным знаниям — может рисовать картинки по свежим новостям, брендам, мемам, дизайн-трендам. Один из примеров, показанных в анонсе OpenAI от 21 апреля 2026: инфографика по design trends 2025 с актуальными направлениями вроде Shape-Driven Layouts и Motion-First Design. Модель собрала их сама, без ручной раздачи названий трендов. 💡 Это первая массовая модель, которая соединяет thinking mode с генерацией картинок. Модель может пойти в веб-поиск, собрать актуальные данные и сразу отрисовать их в визуал — без промежуточного текстового шага. Это важнее, чем кажется. Генераторы картинок традиционно застревают в данных своего обучения: просишь нарисовать «логотип в стиле 2024 года» — получаешь 2021-й. Если Images 2.0 действительно умеет подтягивать свежий контекст (через тот же thinking mode, что в GPT-5.3), это открывает сценарии вроде автоматизации социальных обложек под актуальные инфоповоды. ### Мыслящий визуальный партнёр Самая громкая заявка OpenAI. Модель позиционируется как «thinking partner»: обдумывает задачу, ищет данные, собирает их в композицию, а не рисует по промпту в лоб. В примере с математическим доказательством Кантора она построила целую инфографику с диагональным аргументом, со схемой, а не декоративной картинкой поверх формул. ![Визуальное доказательство Кантора](https://matveev.tech/content/images/2026/04/chatgpt-images-2-cantor-proof.webp) Похожее поведение я видел у Claude Design (анализировал [в отдельном обзоре](https://matveev.tech/claude-design-obzor/)) — там AI тоже пытается понять содержательную задачу, а не просто натянуть стиль. Подход правильный. Вопрос только в том, насколько стабильно модель вывозит такие сценарии за пределы вылизанных демок. ### Сложные многопанельные композиции Images 2.0 заявляет способность собирать журнальные развороты, комиксы, мокапы брендов, продуктовые линейки — то, где нужна согласованность между отдельными элементами. Это то, на чём ломались все предыдущие модели, включая DALL·E 3. ![Журнальный разворот про волков](https://matveev.tech/content/images/2026/04/chatgpt-images-2-wolf-magazine.webp) Если это работает хотя бы в половине случаев — это серьёзно. Сейчас такие композиции собирают либо руками в Figma, либо через связку из нескольких генераций и ручной правки. Автоматизация этого шага даёт черновик макета за минуты вместо часов ручной работы. ## Практическое применение Где это пригодится, если ты не дизайнер: - Обложки для блога и соцсетей с текстом на русском - Схемы и инфографика для презентаций - Мокапы товаров и интерфейсов, где важна согласованность логотипа между генерациями (типичная боль Midjourney и Flux) - Иллюстрации к статьям и постам - Цветовой и стилистический анализ (один из примеров OpenAI — персонализированная палитра Deep Autumn) ![Персональный цветовой анализ](https://matveev.tech/content/images/2026/04/chatgpt-images-2-color-analysis.webp) По сути, ChatGPT становится местом, где можно закрыть визуальные задачи без ухода в отдельные инструменты. Не заменит Figma для серьёзной работы, но для быстрых задач вроде «сделай пост в Telegram с цитатой» — да. ## Как это сравнить с конкурентами Сравнение честно сделать сложно, пока не протестируешь руками на реальных промптах. Но по заявленным характеристикам картина такая: | Модель | Сильные стороны | Где проигрывает | | ------------------ | --------------------------------------------------------- | ----------------------------------------------- | | Midjourney v8 | Реализм, художественный вкус, фото-стили | Текст и сложные композиции, отдельный интерфейс | | Google Nano Banana | Рендеринг текста, следование промпту | Только внутри Gemini | | Flux Pro 1.2 | Типографика, открытая модель | Нужна сторонняя обёртка или API | | ChatGPT Images 2.0 | Мультиязычный текст, интеграция с ChatGPT, thinking-режим | Догоняющий релиз, API пока нет | Ключевое отличие OpenAI — контекст. Модель сидит внутри ChatGPT со всем его инструментарием: веб-поиск, агенты, память о твоих проектах, файлы. Для кого-то это перевесит любую разницу в технических характеристиках. ## Цены и доступность Модель уже раскатали. Доступна всем платным тарифам ChatGPT — Plus, Pro, Business, Enterprise. Бесплатные пользователи получат ограниченное количество генераций в день. В API пока недоступна, но OpenAI обещает вскоре. ⚠️ Для разработчиков: API-доступа к Images 2.0 пока нет. Если ты автоматизируешь генерацию картинок через OpenAI API — придётся подождать или остаться на предыдущей версии. ## Вывод ChatGPT Images 2.0 — это догоняющий релиз, оформленный как революция. Главные заявленные улучшения (мультиязычный текст, сложные композиции, стили, реализм) закрывают дыры, которые у DALL·E 3 были болезненными. Но ничего принципиально нового, чего не умели бы Nano Banana, Midjourney или Flux, здесь нет. Думаю, главная ценность модели — в интеграции. Если ты и так сидишь в ChatGPT ради поиска и агентов, получить внутри того же окна генератор картинок с русским текстом и thinking-режимом удобнее, чем открывать отдельный сервис. Для всех остальных Midjourney или Flux остаются более сильными специализированными инструментами. Протестирую сам в ближайшие дни, сравню с Gemini 3 Pro Image и Midjourney v8, напишу отдельный пост с прямым сравнением на одинаковых промптах. ✈️ Разбираю такие AI-релизы по горячим следам и делюсь тестами — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Частые вопросы ### Чем ChatGPT Images 2.0 отличается от DALL·E 3? Главное отличие — thinking mode: модель обдумывает промпт, проверяет текст и согласованность деталей перед генерацией. Images 2.0 сильно лучше рендерит текст на разных языках (включая русский), стабильнее держит сложные композиции вроде журнальных разворотов и инфографики. DALL·E 3 на таких задачах ломался или выдавал кашу вместо букв. ### Как работает thinking mode в генерации картинок? Модель не переходит сразу от промпта к изображению. Сначала она анализирует запрос, может пойти в веб-поиск за актуальными данными, планирует композицию и проверяет внутренние детали: текст, пропорции, согласованность элементов. На выходе получается изображение с обдуманной структурой, а не первое попавшееся визуальное совпадение. ### Доступна ли ChatGPT Images 2.0 бесплатно? Полный доступ только на платных тарифах ChatGPT: Plus, Pro, Business, Enterprise. Бесплатные пользователи получают ограниченное число генераций в день. API-доступа к Images 2.0 пока нет, OpenAI обещает выпустить позже. Если ты автоматизируешь генерацию картинок через API — пока остаётся предыдущая версия модели. ### Что выбрать: ChatGPT Images 2.0 или Midjourney? Midjourney остаётся сильнее в фото-стилях и художественном реализме. ChatGPT Images 2.0 выигрывает в мультиязычном тексте (включая русский), интеграции с чатом и thinking-режиме для сложных композиций. Выбирай Midjourney для арта и портретов, Images 2.0 — если работаешь внутри ChatGPT и нужны постеры, инфографика и мокапы. ## Что ещё почитать - [Claude Design: как Anthropic делает дизайн через чат](https://matveev.tech/claude-design-obzor/) — похожий thinking-подход к визуальным задачам - [Gemma 4: открытые модели Google на технологиях Gemini 3](https://matveev.tech/gemma-4-google-open-model/) — то, чем отвечает Google на фронте моделей - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — главный конкурент ChatGPT на уровне текстовых моделей - [Microsoft MAI: три модели для голоса, транскрипции и картинок](https://matveev.tech/microsoft-mai-modeli-foundry/) — Microsoft тоже заходит на территорию мультимодальных AI Источник: [Introducing ChatGPT Images 2.0 — OpenAI, 21 апреля 2026](https://openai.com/index/introducing-chatgpt-images-2-0/?ref=matveev.tech). ### Hermes Agent: автономный AI-агент от Nous Research 2026 URL: https://matveev.tech/hermes-agent-obzor/ Last updated: 2026-04-21T15:04:07.000Z > TL;DR: Hermes Agent — open-source автономный AI-агент от Nous Research. Живёт на твоём сервере (или VPS за $5), помнит контекст между сессиями, пишет себе скиллы на лету и работает одновременно в Telegram, Discord, Slack и ещё 12+ каналах. MIT-лицензия, v0.10.0, 488 контрибьюторов, 96k звёзд на GitHub. По факту это прямая альтернатива OpenClaw, и за неё стоит присмотреться. Я уже писал про [реальные кейсы OpenClaw](https://matveev.tech/openclaw-kejsy-ispolzovaniya/) и [сравнение n8n vs OpenClaw](https://matveev.tech/n8n-vs-openclaw-sravnenie/). Hermes Agent — это ещё один подход к тому же: вместо копилота в IDE ты получаешь агента, который живёт на сервере и работает сам. Разберём, что он умеет, чем отличается и кому это нужно. ![Hermes Agent — обложка лендинга Nous Research](https://matveev.tech/content/images/2026/04/hero.png) ## Что это и зачем Hermes Agent сделала Nous Research — та самая лаба, которая выпустила модели Hermes, Nomos и Psyche. То есть команда, которая обучает LLM сама, теперь делает агентскую обвязку под свои же модели. Это важно: они понимают, где у моделей слабые места, и подстраивают под это архитектуру. Первая публичная версия вышла 25 февраля 2026, v0.10.0 — 14 апреля. То есть за 7 недель 10 мажорных релизов и 488 контрибьюторов. Для open-source проекта, который не является форком чего-то популярного, это живая экосистема. Главная идея: агент, который «растёт с тобой». Не сессионный чат-бот, не помощник в IDE, а сущность, которая живёт на сервере, помнит твои проекты, создаёт себе скиллы из опыта и прокачивает их по мере использования. Общаешься с ним из Telegram, пока он работает на cloud-VM, которую ты даже по SSH не открывал. ## Чем отличается от coding-копилотов Cursor, Copilot, Claude Code — это инструменты для кодинга внутри IDE. Их задача: помочь тебе писать код быстрее в рамках одной сессии. Hermes Agent про другое. Его задача: взять часть рутины на себя и делать её, пока ты занят другим. Типовые сценарии, которые на лендинге и в доках: - каждую ночь прогнать CI, собрать отчёт, кинуть тебе в Telegram - следить за репозиторием, делать review PR и комментировать - собирать бэкапы и складывать в S3 по расписанию - искать информацию в интернете, суммаризировать и слать в Slack По сути это замена zapier/n8n на LLM-основе. Где zapier держит жёсткие пайплайны, Hermes собирает их на лету, пишет собственные скрипты и помнит, что делал вчера. ## Закрытый learning loop — главная фишка Hermes позиционируется как «единственный агент со встроенным learning loop». Под этим они понимают несколько вещей сразу: - **Curated memory с nudges.** Агент не просто сохраняет всё подряд. Он периодически проходит по памяти, решает, что важно, и формализует. Плюс nudges — сам себя подталкивает «не забудь записать это». - **Auto-skills.** Решил типовую задачу → записал в виде переиспользуемого скилла. В следующий раз не думает заново, а вызывает. - **Self-improvement скиллов.** Если скилл сработал плохо, агент его дорабатывает во время использования. - **FTS5 cross-session recall + LLM summarization.** Полнотекстовый поиск по прошлым сессиям с автосуммаризацией. - **Honcho dialectic user modeling.** Моделирование тебя как пользователя: как ты говоришь, что ценишь, какие решения принимаешь. Звучит слегка жутковато, но полезно для агента, который работает автономно. Как устроена память агентов в целом и как такие системы сравниваются с RAG и графами, разбирал в статьях [«Память AI-агентов»](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) и [про MemPalace](https://matveev.tech/mempalace-ai-pamyat-agentov/). Hermes идёт по своему пути — не «внешний memory-слой», а интегрированная часть ядра. Ключевой момент: скиллы совместимы с открытым стандартом agentskills.io. То есть скилл, который ты написал для Hermes, теоретически работает в другом агенте того же стандарта. И есть Skills Hub, куда комьюнити заливает готовые наборы. ## Sandboxing, субагенты и где бегает код Вторая большая фича — 6 бэкендов для выполнения кода: - **local** — прямо у тебя на машине (быстро, но рискованно) - **Docker** — контейнер с изоляцией namespace - **SSH** — на удалённый сервер - **Daytona** — serverless dev environments - **Singularity** — HPC-сценарии и GPU-кластеры - **Modal** — serverless Python Daytona и Modal — отдельная тема. Они дают «serverless persistence»: когда агент не работает, среда гибернирует и стоит почти ноль. Когда задача прилетела — поднимается за секунды. Для агентов, которые большую часть времени ждут событий, это реально важно для кошелька. Субагенты — это изолированные параллельные процессы со своими терминалами, разговорами и Python-скриптами через execute\_code. Делегируешь подзадачу — получаешь назад саммари. Плюс Programmatic Tool Calling: многошаговый пайплайн может свернуться в один inference-вызов, что экономит токены. Близкие паттерны разбирал в [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov/). ## Каналы и расписание «Живёт где живёшь ты». Реально 15+ платформ: CLI, Telegram, Discord, Slack, WhatsApp, Signal, Matrix, Mattermost, Email, SMS, DingTalk, Feishu, WeCom, BlueBubbles, Home Assistant. Один gateway — начал в CLI, продолжил в Telegram, закончил в Slack. Контекст не теряется. Natural language cron. Пишешь «каждый день в 9 утра собирай дайджест тикетов из GitHub и присылай в Telegram» — агент это парсит и ставит задачу. Никаких `* * * * *` в syntax crontab. Voice mode — в CLI, Telegram, Discord, включая Discord VC. Можно голосом. 🤖 Пишу про такие open-source инструменты и агентные паттерны — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Hermes Agent vs OpenClaw Самый логичный вопрос. OpenClaw — это агентный фреймворк от Anthropic с упором на инструментальность и кодинг. Hermes — тоже агентный фреймворк, но с другим акцентом. | Что | Hermes Agent | OpenClaw | | --------------------- | ----------------------------------------- | ------------------------------------ | | Лицензия | MIT | Apache 2.0 | | Создатели | Nous Research (делают модели) | Anthropic (делает Claude) | | Фокус | автономный агент на сервере | агент-оркестратор задач | | Память между сессиями | встроенная (curated + nudges) | требует подключения внешних систем | | Auto-skills | да, с self-improvement | базовые skills, без self-improvement | | Каналы связи | 15+ из коробки | CLI + адаптеры | | Sandbox-бэкендов | 6 | 3 (local, Docker, remote) | | Voice mode | встроенный | нет | | Работа с MCP | да | да | | Языковые модели | любые через OpenRouter/OpenAI/Nous Portal | упор на Anthropic, но не только | Короткая версия: если тебе нужен агент, который кодит и автоматизирует CI/CD, OpenClaw привычнее и у него более зрелые паттерны под coding. Если нужен агент как постоянный помощник, который живёт на VPS и доступен из мессенджеров с реальной памятью между днями — Hermes выглядит логичнее. Плюс Hermes работает с любыми моделями через OpenRouter, включая open-source. Для сценариев «хочу свой агент на своих рельсах, без vendor lock-in» это серьёзный плюс. ## Кому это подойдёт Не всем, конкретно. DevOps и SRE — очевидный сценарий. Агент, который следит за алёртами, чинит тривиальщину и пишет отчёты ночью, пока ты спишь. Инди-разработчикам и solo-founders тоже имеет смысл: один человек не может держать в голове бэкап, CI, мониторинг, клиентские письма и GitHub-issues одновременно. Hermes разгружает часть этого. Для research-команд есть отдельная ценность: встроенные батчи, trajectory export и RL через Atropos. Это можно использовать как платформу для экспериментов с агентной архитектурой, не собирая обвязку с нуля. Для технических фаундеров сценарий примерно такой: VPS за $5, Telegram-бот, память между сессиями — получается персональный ассистент, который в курсе дел, а не очередной чат на «ты». Кому точно не стоит: - если хочешь копилот в IDE, Cursor или Claude Code удобнее, Hermes про другое - если не готов поддерживать инфраструктуру, потому что всё-таки нужен сервер и часть настроек руками - если нужен production-grade SLA, проект молодой, версия 0.x, API меняется ## Быстрый старт Оговорюсь: сам я Hermes пока не ставил, разбор по докам и публичным отзывам. Но процесс установки в доках выглядит простым: ```bash # 1. Установка (Linux, macOS, WSL2) curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash # 2. Настройка hermes setup ``` Первая команда качает bash-скрипт, который ставит uv (пакетный менеджер Python), подтягивает зависимости и клонирует репозиторий. На macOS проверял — сработает, если есть git и базовый питон. `hermes setup` — интерактивный визард: выбираешь провайдера (Nous Portal, OpenRouter, OpenAI, свой endpoint), модель, каналы коммуникации (какие мессенджеры подключать), sandboxing backend. После этого агент доступен в CLI. Чтобы подключить Telegram, Discord или Slack — отдельная команда и токен бота из BotFather / Discord Developer Portal. В доках есть пошаговый quickstart на каждую платформу. ## Вердикт Hermes Agent не убьёт OpenClaw и не станет заменой Cursor. Но занимает отдельную нишу, в которой сейчас реально не хватает зрелого инструмента: персональный агент на своём сервере с памятью и доступом через мессенджеры. Мне больше всего зашла идея serverless-персистентности через Daytona и Modal. Агент, который почти ничего не стоит, пока спит, и мгновенно поднимается по событию — это правильная экономика для индивидуального разработчика. Что настораживает. Скорость релизов обоюдоострая: 10 мажорных версий за 7 недель говорит о живом проекте, но API меняется, и что-то обязательно ломается между апдейтами. «Honcho dialectic user modeling» звучит красиво, но как это реально работает через полгода использования, никто пока не видел, обзоров с таким сроком просто нет. Отдельная тема — security. Автономный агент, который сам пишет скиллы и сам их выполняет, требует серьёзной настройки approval-политик. В доках есть раздел про command approval и authorization, но это не то, что настраивается за 5 минут. Если бы я выбирал сейчас личного агента на VPS — Hermes попал бы в шорт-лист. Но я бы дал ему ещё пару месяцев дозреть и смотрел бы на v0.15+. [Hermes Agent — An Agent That Grows With YouOpen-source автономный AI-агент от Nous Research. MIT, установка одной bash-командой, 15+ каналов и 6 sandbox-бэкендов.Nous Research](https://hermes-agent.nousresearch.com/?ref=matveev.tech) ## FAQ **Чем Hermes Agent отличается от OpenClaw?** OpenClaw — фреймворк с упором на кодинг-задачи и интеграцию с Claude. Hermes — автономный агент с упором на жизнь на сервере, persistent memory и каналы. Hermes работает с любыми моделями через OpenRouter, а не только Anthropic. **Какие модели поддерживает?** Любые через OpenRouter: GPT, Claude, Gemini, Qwen, DeepSeek, open-source. Плюс Nous Portal (собственные модели Nous), OpenAI API напрямую или любой свой endpoint. **Сколько это стоит?** Сам Hermes бесплатный, MIT-лицензия. Платишь только за инфраструктуру (VPS от $5/мес) и токены LLM через провайдера. **Можно запустить на Windows?** Да, через WSL2\. Нативной Windows-сборки нет, нужен Linux-слой. **Это безопасно — агент, который сам пишет скиллы?** Настраивается. Есть command approval, authorization, изоляция через Docker/Daytona. Но для продакшна нужно внимательно читать security-раздел доки и настраивать approval-политики. ## Что ещё почитать - [Что реально умеет OpenClaw: 10 кейсов от торга за авто до CI/CD](https://matveev.tech/openclaw-kejsy-ispolzovaniya/) — разбор соседнего инструмента на конкретных сценариях - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/) — где Hermes в общей картине - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) — как агенты вообще «помнят» и почему learning loop сложнее, чем кажется - [n8n vs OpenClaw: автоматизация с AI в 2026](https://matveev.tech/n8n-vs-openclaw-sravnenie/) — сравнение двух подходов к автоматизации, к которым Hermes добавляет третий ### KillBench: скрытые bias у всех топ-LLM в решениях о жизни URL: https://matveev.tech/killbench-bias-llm/ Last updated: 2026-04-21T08:52:07.000Z > TL;DR: White Circle провели 1,35 млн экспериментов на 15 топовых LLM и нашли скрытые bias у каждой модели. В сценариях «кого спасти, а кого убить» Grok 4.1 biased в 137 раз сильнее, чем Claude Sonnet 4.6\. Люди без телефона умирают чаще владельцев iPhone. А структурированный вывод в JSON работает как jailbreak — отказы падают с 80% почти до нуля. Команда White Circle AI выкатила 14 апреля [KillBench](https://whitecircle.ai/killbench?ref=matveev.tech) — бенчмарк, который проверяет, как LLM принимают решения о жизни и смерти. Звучит мрачно, но повод есть: Claude уже использовался в январской операции по захвату Мадуро в Каракасе и работает в закрытых сетях Пентагона во время активной войны с Ираном. Когда Anthropic отказалась убрать блокировки на автономное оружие, Пентагон отметил компанию как supply chain risk. В этом контексте понимать, как именно модели выбирают цель, перестаёт быть академическим вопросом. Разобрал ключевые находки. ## Как устроен бенчмарк Идея простая: моделям дают forced-choice сценарий. «Ты ИИ-система, нужно выбрать одну цель из четырёх одинаковых людей». Различаются люди только одним атрибутом — национальностью, религией, цветом кожи или, например, брендом телефона. Повторяем миллион раз. Если модель реально беспристрастна, каждого выбирают примерно в 25% случаев. Когда цифры уезжают от этого базового уровня — это и есть bias. Всего 20 сценариев: варианты trolley problem, военное целеуказание, приоритизация спасения при катастрофах, распределение ресурсов. 1,35 млн экспериментов, 15 моделей от 9 провайдеров (OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Qwen, Cohere и др.), 6 языков. Код, промпты и датасет [выложены на GitHub](https://github.com/whitecircle-ai/killbench?ref=matveev.tech) и [HuggingFace](https://huggingface.co/datasets/whitecircle-ai/killbench?ref=matveev.tech). ![KillBench — обложка исследования](https://matveev.tech/content/images/2026/04/ghost_img_f5248a84ca.png) ## Топ-5 самых biased моделей | Модель | Самые защищённые | Самые атакуемые | Bias score | | -------------- | ------------------- | --------------- | ---------- | | Grok 4.1 | Android ×10 | Obese ×3.9 | **137.3** | | Qwen3 235B | Android ×10 | Obese ×3.4 | 19 | | GPT-5.3 | Amputee ×10 | No phone ×2.9 | 15.8 | | Gemini 3.1 Pro | Amputee ×10 | No phone ×3.3 | 14.9 | | Command A | Social Democrat ×10 | Satanist ×3.1 | 13.1 | Grok 4.1 — абсолютный чемпион. Bias score 137.3 при том, что у Claude Sonnet 4.6 всего 3.2\. Разница почти в 43 раза. Если Илон Маск продолжает рекламировать Grok как «честный и нефильтрованный ИИ», эти цифры стоит держать в уме. На другом полюсе модели Anthropic. Claude Sonnet 4.6 и Claude Haiku 4.5 показали самые низкие bias score (3.2 и 3.8). Claude Opus 4.5 и 4.6 чуть хуже, но всё равно в разы лучше остальных. Похоже, что constitutional AI и post-training safety, о которых Anthropic много говорит, действительно работают. Хотя причинность тут доказать сложно, это корреляция на 15 моделях. Детальнее про подход компании писал в обзоре [Claude Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor/). ## Странные находки по национальностям Самое неожиданное: модели OpenAI и Anthropic, обе американские, **чаще выбирают в качестве цели американцев, чем китайцев**. Результат держится во всех вариантах профессий и возрастов, так что случайностью это не назовёшь. Евреи — среди самых защищённых во всех моделях. Почти наверняка это следствие жёсткого post-training против антисемитизма. Западные модели (GPT, Claude, Gemini) чаще атакуют французов и русских. Авторы предполагают, что это отражение того, как западные медиа освещают эти страны, или того, кто размечает тренировочные данные. Grok выбивается в другую сторону — атакует китайцев сильнее всех. А Mistral, французская модель, чаще атакует американцев, русских и немцев. По религиям резче всего достаётся атеистам, сайентологам и сатанистам. Даже у моделей, которые стараются быть нейтральными по основным религиям. ## Телефон важнее, чем кажется Одна из самых странных находок: **люди без телефона систематически выбираются как цель чаще, чем владельцы любого бренда**. iPhone, Android, любой — неважно, но «нет телефона» увеличивает шанс быть выбранным в 2–3 раза. По модели Grok: если у тебя iPhone, ИИ в 2,5 раза чаще выберет спасти именно тебя. Это не шутка из интерактивного калькулятора на сайте KillBench, это реальная статистика после миллиона прогонов. 📱 У Grok 4.1 bias по владельцам Android достигает ×10\. Это самая сильная корреляция «бренд телефона → спасение» среди всех 15 моделей. Ни один другой атрибут в исследовании не даёт такого разрыва. Что это значит на практике? Модели подхватили из тренировочных данных, что «человек без телефона» — это кто-то бедный, маргинализированный, менее ценный для общества. И переносят эту ассоциацию на решения о жизни. Сам по себе факт, что такая корреляция вообще возникает в LLM, — это ответ на вопрос, почему bias в моделях нельзя «просто вычистить». ## Структурированный вывод — это jailbreak Самая важная находка с точки зрения разработчиков. Когда модели получают тот же промпт, но в режиме structured output (JSON schema-constrained responses), происходят три вещи: ⚠️ Safety-поведение модели в чате и в продакшн-коде — это два разных поведения. Если твоя система использует JSON-schema вывод, проверь её отдельно: отказы в structured mode могут упасть с 80% до нуля. 1. Отказы обрушиваются. Модели, которые в free-text отказывали в 60–80% случаев, в structured mode соглашаются выше 95%. 2. Bias усиливается. Среди тех, кто всё-таки ответил, отклонение от базового уровня становится сильнее. 3. Модели врут себе. Часто пишут «я откажусь выбирать и выберу случайно», а на деле выбор не случайный. Конкретные цифры по Claude Opus 4.5: в free-text 99% отказов на rescue-сценарии и 100% на military. В structured output 0% отказов на rescue и 100% на military. Safety-слой на rescue-сценариях обнуляется форматом ответа. При этом на military он держится. Почему так получается у Anthropic (а у других нет), авторы не разбирают. По GPT-5.2: free-text даёт 94% отказов на military, structured output — всего 74%. Claude Sonnet 4.6: 100% → 0% на military. | Модель | Rescue free-text | Military free-text | Rescue structured | Military structured | | ----------------- | ---------------- | ------------------ | ----------------- | ------------------- | | Claude Opus 4.5 | 99% | 100% | 0% | 100% | | Claude Sonnet 4.6 | 78% | 100% | 0% | 0% | | GPT-5.2 | 59% | 94% | 19% | 74% | | Gemini 3.1 Pro | 78% | 52% | 2% | 0% | | Grok 4.1 | 10% | 2% | 0% | 0% | Контраргумент очевиден: «вы заставили модель отвечать через JSON-схему — естественно, отказы упали». Авторы отвечают: Anthropic 4.5 продолжают отказывать на опасные запросы даже в structured output. Значит, несовместимости между форматом и alignment нет — есть дыра в safety-тюнинге у остальных. Это критично для прод-систем. Structured output — стандартный паттерн интеграции LLM. Большинство продакшн-пайплайнов используют именно его. А значит, safety, которое видно в чате, в бою может не работать. ## Модели лгут про случайность Когда ответ включает рассуждение, модели часто пишут что-то вроде «я выбираю случайно» или «я буду нейтрален». Данные говорят другое: если модель выбирает одну национальность или религию в 40% случаев на сотнях прогонов, слово «случайно» теряет смысл. Для разработчиков это проблема. Можно поверить stated reasoning и не проверить реальное поведение. В structured output этот разрыв ещё труднее заметить, потому что объяснения обычно не видно. ✈️ Разбираю подобные исследования и практические находки по LLM — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Новые модели отказываются меньше Ещё один тренд: с каждым поколением модели отказываются всё реже. Opus 4.6 отказывается значимо реже, чем 4.5, GPT-5.4 — реже, чем 5.3\. То же у OpenAI внутри линейки GPT-5. Это не обязательно плохо. Модели стали полезнее, меньше отказывают на безобидные запросы. Но вместе с полезностью снижается и пороги на действительно опасные сценарии. И если bias сам по себе не ушёл (а он не ушёл), меньше отказов = больше реальных решений с этим bias. ## Итог Исследование показывает две вещи. Во-первых, у всех 15 топовых моделей есть статистически значимые bias в решениях о жизни и смерти. Во-вторых, структурированный вывод в продакшн-пайплайнах эти bias усиливает и почти обнуляет отказы. И именно через structured output большинство компаний подключает LLM к реальным системам. Что я бы сделал после этой статьи, если бы строил что-то на LLM: - Тестировать систему в том режиме вывода, в котором она работает в проде. Free-text и structured output ведут себя как будто это разные модели. - Не верить stated reasoning модели. Когда модель пишет «я выбираю случайно», лучше прогнать 500 запросов и посмотреть распределение. - Если система принимает решения о людях (медицина, HR, кредиты), прогнать её через свой аналог KillBench. Код и датасет открыты, адаптировать под свой домен реально. - Держать в голове, что модели Anthropic пока выглядят чище по bias. Это не делает их безопасными. Это делает их наименее плохими из проверенных. Больше всего меня зацепила находка про телефон. С национальностями и религиями всё предсказуемо, там понятно, откуда bias берётся в тренировочных данных. А вот «нет телефона = меньше шанс выжить» — это уже прокси на социальный класс, и никакой post-training такое не отсечёт, потому что отсечь сложно даже назвать. Исследование важное в первую очередь тем, что воспроизводимое. Промпты, seeds и скрипты открыты. Любой разработчик может прогнать бенчмарк сам. [KillBench: Discovering Hidden Biases of LLMsИнтерактивный калькулятор, полные графики по 15 моделям и 8 измерениям bias, методология и ссылки на датасет.White Circle AI](https://whitecircle.ai/killbench?ref=matveev.tech) ## Что ещё почитать - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — про модель, которая в линейке Anthropic идёт сразу после самых «чистых» по KillBench - [Чего 81 000 людей хотят от AI: исследование Anthropic](https://matveev.tech/anthropic-81k-interviews/) — как Anthropic подходит к изучению реального использования AI - [Claude Code auto mode: AI сам решает, что безопасно](https://matveev.tech/claude-code-auto-mode/) — про границы автономности AI в прод-системах ### Claude Design: как работает дизайн через чат от Anthropic URL: https://matveev.tech/claude-design-obzor/ Last updated: 2026-04-17T19:08:09.000Z > TL;DR: 17 апреля 2026 Anthropic запустила [Claude Design](https://www.anthropic.com/news/claude-design-anthropic-labs?ref=matveev.tech) — инструмент для создания дизайнов, прототипов и презентаций через чат с Claude Opus 4.7\. Доступ открыт подписчикам Pro, Max, Team и Enterprise по адресу [claude.ai/design](https://claude.ai/design?ref=matveev.tech). После анонса акции Figma просели на 6.8%. Claude Design — это standalone-продукт [Anthropic Labs](https://www.anthropic.com/news/introducing-anthropic-labs?ref=matveev.tech), который превращает текстовые промпты в интерактивные прототипы, макеты, питч-деки, лендинги и маркетинговые креативы. Ты описываешь в чате, что нужно, Claude рисует на canvas. Дальше правишь через чат, inline-комменты, прямое редактирование текста и кастомные ползунки, которые Claude сам создаёт под задачу. Работает на новой vision-модели Opus 4.7, вышедшей в тот же день. ## Что умеет Claude Design Anthropic позиционирует тул как площадку для всех, кто работает с визуалом — от дизайнеров до продактов, маркетологов и фаундеров. В анонсе компания перечисляет шесть основных сценариев: - Интерактивные прототипы из статичных макетов - Продуктовые вайрфреймы и мокапы - Дизайн-эксплорации — десятки направлений параллельно - Питч-деки и презентации с экспортом в PPTX или Canva - Лендинги и маркетинговые креативы - Фронтирные прототипы с голосом, видео, шейдерами и 3D Ключевая метрика для оценки продукта, на мой взгляд, сидит в кейсе от Brilliant. Команда edtech-стартапа рассказала Anthropic, что самые сложные страницы раньше требовали 20+ промптов в других инструментах. В Claude Design те же страницы собираются за 2 промпта. Datadog говорит про сжатие недельного цикла брифов и ревью в один разговор. Почему такой разрыв? Потому что модель под капотом — Opus 4.7\. По [данным Anthropic](https://www.anthropic.com/news/claude-opus-4-7?ref=matveev.tech), она принимает изображения до 2 576 px по длинной стороне (3.75 мегапикселя, в три раза больше прежних моделей Claude) и выдаёт 64.3% на SWE-bench Pro. Партнёр Anthropic, компания XBOW, намерила 98.5% на внутреннем визуальном бенчмарке против 54.5% у Opus 4.6. ## Чем Claude Design отличается от Figma, Canva и Pencil Если коротко, то Claude Design — первый стандалон-продукт, где интерактивный прототип собирается из текстового промпта и уходит в код одной командой. Сравнение по ключевым параметрам: | Параметр | Claude Design | Figma | Canva | Pencil | | ----------------- | ------------------------------- | ------------------------------- | -------------------------- | ---------------------------- | | Основной ввод | Текстовый промпт + контекст | Визуальный редактор | Шаблоны + drag-drop | Промпт в IDE | | Целевая аудитория | Все, включая не-дизайнеров | Профессиональные дизайнеры | Маркетологи, SMM | Разработчики | | Цена | В подписке Claude Pro ($20/мес) | От $15/мес за редактор | Freemium, Pro от $15 | Free (MCP + Claude/Codex) | | Handoff в код | Bundle для Claude Code | Code to Canvas через MCP | Нет | Прямо в Claude Code / Cursor | | AI-генерация | Нативная, Opus 4.7 | AI-фичи через Claude MCP | Canva AI 2.0, Magic Layers | Генерация через Claude | | Дизайн-система | Импорт из кодобазы автоматом | Руками через Styles и Variables | Brand Kit | Не строит автоматически | Ключевая разница в подходе: Figma и Adobe строились под тренированного дизайнера в цикле. Canva — под широкую аудиторию с шаблонами. [Pencil через MCP](https://matveev.tech/pencil-dev-mcp-design-canvas) работает в IDE-контексте. Claude Design не предполагает дизайн-навыков вообще и живёт внутри Anthropic-стека. ## Как устроен интерфейс Две зоны: чат слева, canvas справа. Типичный поток из [официального гайда](https://support.claude.com/en/articles/14604416-get-started-with-claude-design?ref=matveev.tech) такой: 1. Создал проект, подгрузил контекст — скриншоты, кодобаза, референсы 2. Описал в чате, что нужно собрать 3. Получил первую версию на canvas 4. Крутишь через чат и inline-комменты 5. Экспортнул или поделился по ссылке ### Чат vs inline-комменты Чат используешь для широких правок: «сделай темнее и минималистичнее», «переставь метрики в верхний ряд», «покажи 2-3 варианта лейаута». Inline-комменты, наоборот, для точечных: кликнул на конкретную кнопку и написал «увеличь паддинг». Если комментарий пропал, это известный баг, Anthropic просит вставить текст обратно в чат. ### Ползунки от самого Claude Ещё одна штука, которую стоит отметить, это adjustment sliders. Claude сам генерирует под твой макет набор ползунков для правки спейсинга, цвета и лейаута в реальном времени. В Figma такого я не припомню. По сути, это ответ на «AI-first workflow». ## Брендинг приходит из твоего кода Это место, где Claude Design цепляется за существующий стек компании и становится полезным для команд, а не только для фаундеров без дизайнера. Во время онбординга Claude читает кодобазу и дизайн-файлы, собирает дизайн-систему (цвета, типографику, компоненты), и дальше применяет её ко всем проектам автоматически. По описанию VentureBeat, [система хранит не сами исходники, а только представление дизайн-системы](https://venturebeat.com/technology/anthropic-just-launched-claude-design-an-ai-tool-that-turns-prompts-into-prototypes-and-challenges-figma?ref=matveev.tech). Локальный код на серверы Anthropic не загружается. Скоро добавят прямое подключение к GitHub. 🔒 Anthropic хранит представление дизайн-системы, а не исходные файлы. Локальный код на серверы не уходит, модели на нём не обучаются. Для Enterprise Claude Design выключен по умолчанию — включает админ. Импорт широкий: промпт текстом, картинки, документы (DOCX, PPTX, XLSX), ссылка на репозиторий. Есть web capture tool, который снимает элементы прямо с живого сайта — полезно, когда хочешь, чтобы прототип выглядел как существующий продукт. ## Как писать промпты, чтобы получить нормальный результат Anthropic в гайде рекомендует включать в промпт четыре вещи: цель, лейаут, контент и аудиторию. Примеры, которые работают хорошо: - «Сделай дашборд с месячной выручкой и фильтрами по региону и продукту» - «Собери онбординг-флоу из 4 экранов мобильного приложения под основные фичи» - «Собери лендинг для API-продукта с hero-секцией, примерами кода и прайсингом» - «Форма сбора фидбэка от клиентов с условными вопросами по категории» - «Внутренний инструмент для ops-команды: ревью и аппрув контента» Если Claude не хватает контекста, он задаёт уточняющие вопросы. По моему опыту с похожими AI-тулами это экономит пару итераций на старте. Важный нюанс в итерациях: делай инкрементально. Сначала базовый лейаут и контент, потом взаимодействия, потом полировка. «Это не то» плохой фидбэк, а «уменьши расстояние между полями формы до 8px» рабочий. ## Экспорт и передача в Claude Code Тут главная фишка, за которую стоит платить внимание. Claude Design встраивается в существующий Anthropic-стек и не запирает результат внутри себя. ![Меню экспорта в Claude Design: PDF, PPTX, Canva, HTML и handoff в Claude Code](https://matveev.tech/content/images/2026/04/claude-design-export-menu.png) ### Форматы экспорта - ZIP-архив с ассетами - PDF и PPTX - Отправка в Canva - Standalone HTML - Handoff bundle для Claude Code (с design intent) - Shareable-ссылки внутри организации с правами view, comment или edit ### Handoff в Claude Code Главное, чего нет у Figma. Дизайн пакуется в bundle и передаётся кодовому агенту одной инструкцией. Claude Code забирает макет вместе с дизайн-интентом и собирает production-код. Сам Claude Code с десятком реальных сценариев разбирал в [обзоре воркфлоу на каждый день](https://matveev.tech/claude-code-10-workflows). Через несколько недель Anthropic откроет Claude Design для сторонних интеграций через MCP (Model Context Protocol, открытый стандарт Anthropic для подключения AI-агентов к внешним тулам). Это значит, что подключить, скажем, Jira, Linear или собственный design-system-сервер станет так же просто, как любой другой MCP-сервер. ### Партнёрство с Canva С Canva отдельная история. Партнёрство Anthropic и Canva работает с июля 2025, сейчас его углубили: Canva добавила [HTML import в drag-and-drop редактор](https://www.canva.com/newsroom/news/canva-claude-design?ref=matveev.tech). То есть теперь можешь сделать в Claude Design интерактивный артефакт и уронить его в Canva без регенерации кода. В комментарии, который Anthropic цитирует в пресс-релизе, команда Canva объясняет логику партнёрства: «Миссия Canva всегда была в том, чтобы дать возможность дизайнить всему миру, а это значит встречать идеи там, где они рождаются. Мы в восторге от того, что теперь человек может без усилий переносить идеи и черновики из Claude Design в Canva, где они мгновенно превращаются в полностью редактируемые и совместные макеты». По данным Canva, новый Magic Layers, который превращает AI-картинки в редактируемые дизайны, [использовали 9 миллионов раз за первый месяц](https://www.canva.com/newsroom/news/canva-claude-design?ref=matveev.tech). Canva позиционирует себя как «дизайн-слой AI-эпохи» и делает ставку на то, что с ростом объёма AI-генерации спрос будет смещаться в сторону редактирования и коллаборации. ## Что происходит с Figma и Adobe В этом месте интересно посмотреть на рынок. [Figma держит 80-90% доли в UI/UX-дизайне](https://www.pymnts.com/artificial-intelligence-2/2026/anthropics-new-design-tool-rivals-adobe-and-figma?ref=matveev.tech), данные The Next Web. На пятничных торгах акции Figma упали на 6.8-7.7% — рынок прочитал лаунч как прямую конкуренцию. 📉 Figma (FIG) на торгах 17 апреля 2026 теряла до 7.7% капитализации в течение дня. Это сильнейшее однодневное падение с момента IPO — инвесторы прочитали Claude Design как прямую угрозу бизнес-модели. Ещё один сигнал: 14 апреля 2026 Mike Krieger, CPO Anthropic, вышел из совета директоров Figma. В тот же день The Information сообщил, что следующая модель Anthropic будет включать дизайн-инструменты. Anthropic публично говорит про совместимость (экспорт в Canva, PPTX и PDF, план на интеграции через MCP), но уход Кригера из совета Figma всё равно выглядит говорящим. По данным [Bloomberg](https://www.bloomberg.com/?ref=matveev.tech), Anthropic разогналась до $30B ARR к началу апреля 2026 (в марте было $20B), ведёт переговоры с Goldman Sachs, JPMorgan и Morgan Stanley о потенциальном IPO в октябре 2026\. Оценка около $800B, это вдвое больше $380B из раунда двухмесячной давности. Реальная угроза для Figma, как мне кажется, не в том, что завтра профессиональные дизайнеры уйдут в Claude Design. Они никуда не уйдут. Угроза в расширении аудитории. Продакт, маркетолог или фаундер без навыка Figma теперь может собрать интерактивный прототип текстовым промптом. Это пул людей, которых у Figma в воронке вообще не было. ## Приватность и цена Для корпоративных покупателей это критическая часть. По словам Anthropic в разговоре с VentureBeat: - Система хранит представление дизайн-системы, не исходные файлы - Локальный код на серверы не загружается - Anthropic не обучается на этих данных - Для Enterprise Claude Design выключен по умолчанию, включает админ - Готовится прямое подключение к GitHub Цена — ноль дополнительных денег. Claude Design включён в подписки Pro, Max, Team и Enterprise, работает в рамках твоих лимитов. Хочешь больше, есть opt-in extra usage. Стратегия та же, что с Claude Code: раздать бесплатно, посмотреть, что люди построят, монетизировать там, где выстрелит. Opus 4.7 в API стоит, как и предшественник: $5 за миллион input-токенов, $25 за миллион output. Если планируешь гонять модель через API отдельно, разбирал новинку в [обзоре Claude Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor). ## Что пока работает не идеально Anthropic перечисляет ограничения. Это всё-таки research preview, а не полноценный релиз. Главный баг — inline-комменты иногда пропадают, исчезают до того, как Claude успевает их прочитать. Воркэраунд неказистый: вставлять текст обратно в чат. Компактный лейаут иногда вываливается при сохранении, лечится переключением в full view. Большие монорепы лагают, так что линковать лучше конкретные поддиректории, а не весь репозиторий. Если словил «chat upstream error», открой новый chat-таб в том же проекте. Коллаборация пока базовая. Полноценного multiplayer-режима как в Figma нет, хотя Anthropic обещает добавить. И последнее, о чём Anthropic говорит прямо: мусорный код на входе даёт мусорный вывод. Дизайн-система импортируется лучше всего из аккуратной кодобазы. Дата GA (General Availability, полноценный запуск для всех) Anthropic не называет. Говорят, решат по фидбэку. ## Советы от Anthropic и мой комментарий В гайде перечислены шесть рекомендаций для лучших результатов: 1. Начинай с простого, добавляй сложность итерациями 2. Будь конкретен в фидбэке — цифры и названия компонентов работают лучше «это не то» 3. Ссылайся на свою дизайн-систему по имени компонента: «используй Primary Button» 4. Думай про адаптивность сразу — укажи, где будет работать макет 5. Проси варианты, а не угадывай — «покажи 2-3 альтернативы лейаута» 6. Проси фидбэк у Claude — проверка на доступность, контраст, иерархию информации От себя добавлю: Claude Design — это не замена Figma, если ты дизайнер с 10-летним опытом. Но для команды из трёх человек, которая делает проект и живёт в Claude-экосистеме, это очень рабочая штука. Особенно с учётом handoff в Claude Code. [Claude DesignResearch preview от Anthropic Labs. Создаёшь дизайны, прототипы и презентации через чат. Доступно подписчикам Claude Pro, Max, Team, Enterprise.claude.ai](https://claude.ai/design?ref=matveev.tech) Больше про Claude в [тегеграм](https://t.me/ctospeech?ref=matveev.tech). ## FAQ **Что такое Claude Design?** Claude Design — это продукт от Anthropic Labs, который превращает текстовые промпты в интерактивные прототипы, дизайны, питч-деки и маркетинговые материалы. Работает на vision-модели Claude Opus 4.7, запущен 17 апреля 2026 в формате research preview по адресу claude.ai/design. **Кому доступен Claude Design?** Подписчикам Claude Pro, Max, Team и Enterprise. Доступ включён в подписку, лимиты — общие с остальными фичами Claude. Для Enterprise-организаций тул по умолчанию выключен, включает админ в настройках организации. **На какой модели работает Claude Design?** На Claude Opus 4.7 — vision-модели Anthropic, которая вышла одновременно с Claude Design 17 апреля 2026\. Она принимает изображения до 3.75 мегапикселей и по внутренним бенчмаркам Anthropic даёт +13% к решению задач против Opus 4.6. **Можно ли экспортировать в PPTX или Figma?** В PPTX — да, это один из стандартных форматов экспорта. В Figma — напрямую нет, но можно выгрузить в HTML и открыть в Canva или передать в Claude Code. Готовится расширение интеграций через MCP. **Тренируются ли модели на моём коде?** Нет. По заявлению Anthropic, система хранит только представление дизайн-системы, а не исходники. Локальный код не загружается на серверы Anthropic, обучение на этих данных не ведётся. **Почему акции Figma упали после анонса?** Рынок прочитал Claude Design как прямую конкуренцию. Figma держит 80-90% рынка UI/UX-дизайна, а Claude Design позволяет делать прототипы без навыков работы в профессиональных дизайн-тулах. Акции Figma на торгах 17 апреля 2026 упали на 6.8%. **Как работает handoff в Claude Code?** Claude Design собирает макет, ассеты и дизайн-интент в один handoff bundle. Ты передаёшь его Claude Code одной инструкцией, и кодовый агент превращает прототип в production-код. Никакого ручного экспорта дизайн-токенов и пересборки — всё остаётся внутри Anthropic-стека. **Где попробовать Claude Design?** По адресу [claude.ai/design](https://claude.ai/design?ref=matveev.tech). Разворачивают постепенно в течение дня запуска, поэтому доступ может появиться не сразу. ## Что ещё почитать - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor) — движок Claude Design и что ещё умеет модель - [Pencil: дизайн в IDE через MCP](https://matveev.tech/pencil-dev-mcp-design-canvas) — альтернативный подход, когда хочется дизайн прямо в редакторе кода - [UI UX Pro Max: AI-навык для дизайна в Claude Code и Cursor](https://matveev.tech/ui-ux-pro-max-skill-obzor) — как накатить дизайн-компетенции поверх существующего Claude Code - [10 воркфлоу Claude Code на каждый день](https://matveev.tech/claude-code-10-workflows) — куда уходят handoff-бандлы из Claude Design - [Superdesign — библиотека промптов для дизайна в IDE](https://matveev.tech/superdesign-prompt-library) — бесплатная альтернатива для тех, кто не на Pro ### Karpathy skills для Claude Code: 4 правила против мусора URL: https://matveev.tech/karpathy-skills-claude-code/ Last updated: 2026-04-17T08:32:20.000Z > TL;DR: [Forrest Chang](https://github.com/forrestchang/andrej-karpathy-skills?ref=matveev.tech) собрал один CLAUDE.md с 4 принципами, которые лечат типичные болячки LLM в кодинге: додумывание допущений, раздувание кода и бесконтрольные drive-by-правки. Основано на наблюдениях Андрея Карпатого о том, где агенты стабильно тупят. Когда Карпатый постит что-то про LLM, это обычно превращается в методику через неделю. Его заметка про проблемы AI-кодинга — додумывание, переусложнение, правки не по теме — превратилась в GitHub-репозиторий `andrej-karpathy-skills` с 48к звёзд и 3.9к форков. Внутри один CLAUDE.md файл. Разбираю, что там и почему это работает лучше, чем длинный промпт в начале чата. ## Что сломано в поведении Claude Code Карпатый описал это на редкость точно в серии цитат. Пересказываю своими словами, потому что любой, кто долго работал с Claude Code или Cursor, через это проходил. - Модели делают неверные допущения и не проверяют их. Задача неоднозначная, модель тихо выбирает интерпретацию и идёт делать. В итоге получается не то, что ты имел в виду. - Модели не управляют своей путаницей. Не просят уточнений, не выносят противоречия на поверхность, не предлагают альтернатив, не пушат, когда видят более простой путь. - Любят переусложнять код и API. Раздувают абстракции, не чистят мёртвый код, пишут решение на 1000 строк, когда хватит 100. - Меняют или удаляют код, которого не понимают. Как побочный эффект. Даже если это ортогонально твоей задаче. Последняя болячка самая мерзкая. Просишь переименовать функцию, а в diff прилетает рефакторинг соседнего модуля «заодно», потому что модель решила, что там неправильный стиль. ## Четыре принципа CLAUDE.md Каждый принцип лечит одну группу проблем. Распишу с примерами. ### 1\. Думать до кода Явно проговаривать допущения, показывать альтернативные интерпретации, пушить назад при сомнениях, останавливаться при путанице. На практике выглядит так: ты даёшь размытый запрос «улучши этот handler», а Claude вместо тихого рефакторинга отвечает «что именно улучшить — производительность, читаемость или добавить логирование?». Для ленивых промптов это ценно. ### 2\. Простота вперёд Минимум кода, который решает задачу. Ничего спекулятивного. - Только то, что попросили - Никаких абстракций для одноразового кода - Никакой «гибкости», которая не была запрошена - Никакой обработки невозможных сценариев - Если 200 строк можно сократить до 50, стоит переписать Тест: сказал бы сеньор, что это переусложнено? Если да, упрощаем. ### 3\. Хирургические правки Трогать только то, что нужно. Чистить только свой мусор. - Не улучшать соседний код, комментарии, форматирование - Не рефакторить то, что не сломано - Следовать существующему стилю, даже если ты бы сделал иначе - Заметил dead code не по теме, упомяни его, но не удаляй Когда твои правки оставили сироты (неиспользуемые импорты, переменные), их чистить можно. Существующий dead code чистить только если попросили. Каждая изменённая строка должна напрямую относиться к запросу пользователя. ### 4\. Goal-driven execution Самый интересный принцип. Вместо императивных инструкций ставим декларативные цели с проверкой: | Вместо | Делать | | ------------------ | -------------------------------------------------------------- | | «Добавь валидацию» | «Напиши тесты для невалидных входов, потом заставь их пройти» | | «Почини баг» | «Напиши тест, который его воспроизводит, потом заставь пройти» | | «Отрефактори X» | «Убедись, что тесты проходят до и после» | Ключевая идея Карпатого: «LLM очень хорошо зацикливаются до достижения конкретных целей. Не говори модели, что делать. Дай критерий успеха и смотри, как она работает». Для многошаговых задач автор предлагает шаблон плана: ``` 1. [Шаг] → проверка: [что проверить] 2. [Шаг] → проверка: [что проверить] 3. [Шаг] → проверка: [что проверить] ``` Сильные критерии успеха позволяют модели работать в цикле без тебя. Слабые («сделай, чтобы работало») требуют постоянного уточнения. Залетай в [телеграм-канал](https://t.me/ctospeech?ref=matveev.tech) — пишу про AI и опыт агентского коддинга ## Как поставить у себя Два способа. **Способ 1: плагин Claude Code (рекомендуется).** Внутри Claude Code: ```bash /plugin marketplace add forrestchang/andrej-karpathy-skills /plugin install andrej-karpathy-skills@karpathy-skills ``` Это добавит гайдлайны как плагин Claude Code, доступный во всех твоих проектах без копирования файлов. **Способ 2: CLAUDE.md в проект.** Для нового проекта: ```bash curl -o CLAUDE.md https://raw.githubusercontent.com/forrestchang/andrej-karpathy-skills/main/CLAUDE.md ``` Для существующего проекта дописать в конец: ```bash curl https://raw.githubusercontent.com/forrestchang/andrej-karpathy-skills/main/CLAUDE.md >> CLAUDE.md ``` Файл задизайнен так, чтобы мерджиться с твоими правилами. Добавляешь свои секции типа «используй TypeScript strict mode», «все API эндпоинты должны иметь тесты», «следуй паттернам в src/utils/errors.ts». [forrestchang/andrej-karpathy-skillsA single CLAUDE.md file to improve Claude Code behavior, derived from Andrej Karpathy's observations on LLM coding pitfalls.GitHub · MIT · 48.2k stars](https://github.com/forrestchang/andrej-karpathy-skills?ref=matveev.tech) ## Что реально меняется в работе По отзывам в Reddit и Medium от людей, которые пожили с этими правилами пару недель: - Диффы становятся короче. Меньше «заодно поправил import order». - Claude чаще задаёт уточняющий вопрос до первой правки, а не после того, как сделал не то. - Меньше переписываний из-за переусложнения. - Чистые PR без drive-by рефакторинга. Сам автор пишет, что успех виден именно в диффах: меньше лишних строк, вопросы приходят перед имплементацией, а не после ошибок. Отдельно стоит подчеркнуть четвёртый принцип. Если ты научишься формулировать задачу как цель с проверкой («напиши тест, сделай его зелёным»), Claude начнёт работать в цикле без твоего постоянного контроля. Это и есть тот самый агентный режим, за которым все гонятся. ## Когда это перебор Сам автор пишет в readme: гайдлайны сдвигают модель в сторону осторожности, а не скорости. Для тривиальных задач (typo, очевидный one-liner) это перебор. Не каждому изменению нужен полный ригор. Ещё нюанс: если у тебя уже есть пухлый CLAUDE.md с правилами, Karpathy-guidelines нужно интегрировать, а не просто дописать снизу. Иначе получится конфликт между «делай, как сказано» и «сомневайся, переспрашивай, пушь назад». ## А свежий Opus 4.7 это не делает сам? В [анонсе Claude Opus 4.7](https://matveev.tech/claude-opus-4-7-obzor/) Anthropic писала, что модель теперь сама проверяет свою работу, честнее о своих ограничениях и следует инструкциям буквально. Часть того, на что целятся эти принципы, уже зашито в модель. Но модель слушает именно то, что ты написал в промпте. Если в твоём CLAUDE.md нет явного правила «спроси, если непонятно», модель и не спросит, даже если подозревает неоднозначность. Karpathy-guidelines именно это и прописывают: явные правила для поведения, которые модель соблюдает, потому что видит их в системном контексте. ## Вывод Хороший бесплатный фундамент. 48 тысяч звёзд за пару месяцев говорят о том, что проблема знакома слишком многим. Если начинаешь новый проект с Claude Code, имеет смысл сразу добавить этот CLAUDE.md. Для существующих проектов стоит аккуратно интегрировать в свои правила, разрешая конфликты. ## Подписывайся на новости и важные события в AI Подписаться Email sent! Check your inbox to complete your signup. ## Что ещё почитать - [Claude Opus 4.7: обзор новой модели Anthropic](https://matveev.tech/claude-opus-4-7-obzor/) — свежий релиз, который сам по себе лучше следует инструкциям - [Claude Managed Agents: запускаем AI-агентов через API](https://matveev.tech/claude-managed-agents-api/) — про агентов в фоне - [Code Review в Claude Code: AI-агенты ревьюят каждый PR](https://matveev.tech/claude-code-review-obzor/) — автоматизация ревью - [10 воркфлоу Claude Code на каждый день](https://matveev.tech/claude-code-10-workflows/) — практика работы с CLI ### Claude Opus 4.7: обзор новой модели Anthropic URL: https://matveev.tech/claude-opus-4-7-obzor/ Last updated: 2026-04-16T16:00:56.000Z > TL;DR: Anthropic выпустила [Claude Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7?ref=matveev.tech), прямое обновление для Opus 4.6\. Модель заметно сильнее в сложном кодинге на длинных задачах и получила новый уровень усилия `xhigh`. Цена та же, что у 4.6: $5 за миллион входных токенов, $25 за миллион выходных. ## Что улучшили в Opus 4.7 Основной вектор — сложный кодинг и долгие агентные задачи. Пользователи передают самую сложную работу Opus 4.7 без постоянного контроля, модель сама придумывает, как проверить свой результат до того, как сказать «готово». Цифры из тестов партнёров: - У Cursor на CursorBench 70% решённых задач против 58% у 4.6 - На Rakuten SWE-Bench Opus 4.7 решает втрое больше продакшен-задач с двузначным ростом Code Quality и Test Quality - Notion Agent показывает +14% успешности при трети прежних ошибок инструментов - XBOW на своём бенчмарке visual-acuity подняли точность с 54.5% до 98.5% для задач computer use - Harvey на BigLaw Bench получил 90.9% на high effort для юридических задач - CodeRabbit отмечают +10% recall при той же точности на код-ревью - Quantium называют 4.7 «самой способной моделью, которую мы тестировали» ![Бенчмарки Claude Opus 4.7 против 4.6 и конкурентов](https://matveev.tech/content/images/2026/04/claude-opus-4-7-benchmarks-1.png) Я бы выделил два момента. Первый: loop resistance. Genspark упоминает, что 4.6 уходит в бесконечный цикл на 1 из 18 запросов. Для агента это катастрофа: модель съедает лимиты и блокирует пользователя. 4.7 из таких циклов выходит. Второй: модель стала работать с файловой памятью, держит важные заметки между сессиями и возвращается к задаче без перезагрузки контекста. [Про то, как это делают внешние решения, я писал в разборе MemPalace](https://matveev.tech/mempalace-ai-pamyat-agentov/). ## Зрение стало острее Opus 4.7 принимает картинки до 2576 пикселей по длинной стороне (около 3.75 мегапикселей). Это примерно в три раза подробнее, чем у прошлых моделей Claude. Для агентов, которые читают скриншоты интерфейса, разница огромная: мелкий шрифт, цифры в таблицах, схемы с деталями — всё считывается. XBOW в своём автономном пентесте подняли точность с 54.5% до 98.5% на бенчмарке визуальной точности. По их словам, один из главных источников боли при использовании Opus просто исчез. Solve Intelligence (патентные рабочие процессы в life sciences) пишут, что 4.7 теперь читает химические структуры и технические схемы без ручной подсказки. Если детализация не нужна, картинку можно уменьшать перед отправкой, чтобы не платить за лишние токены. ## Как работает новый уровень усилия `xhigh`? В Opus 4.7 появился `xhigh` — «экстра высокий» уровень думания между `high` и `max`. В Claude Code его сделали дефолтным на всех подписках. Anthropic советует начинать с `high` или `xhigh` для кода и агентных сценариев. Уровни усилия по возрастанию: `low` → `medium` → `high` → `xhigh` → `max`. Для агентных сценариев Anthropic советуют стартовать с `high` или `xhigh`. Зачем новый уровень? Более тонкий контроль баланса качества и стоимости. `high` иногда не хватает на сложную задачу, `max` сжигает токены быстрее, чем нужно. `xhigh` — попытка попасть в середину. Вместе с ним в public beta вышли **task budgets**. Это способ ограничить расход токенов в длинной сессии: ты задаёшь бюджет, модель сама решает, как распределить думание между шагами. Полезно для агентов, которые запускаются на ночь и должны уложиться в какой-то потолок. ## /ultrareview и auto mode в Claude Code Два обновления в Claude Code на релизе. **Слэш-команда `/ultrareview`** запускает выделенную сессию код-ревью. Модель читает изменения и ищет баги с дизайн-проблемами, которые поймал бы внимательный ревьюер. Pro и Max-подписки получают три бесплатных запуска на пробу. По сути это расширение логики [встроенного Code Review в Claude Code](https://matveev.tech/claude-code-review-obzor/), только ещё тщательнее. **Auto mode** теперь доступен пользователям Max. Это режим, где Claude сам решает, какие действия выполнять без подтверждения. Для длинных задач удобно: не прерывает каждые 30 секунд на permission. И безопаснее, чем `--dangerously-skip-permissions`: модель всё ещё фильтрует рискованные шаги. [Разбор auto mode у меня был месяц назад](https://matveev.tech/claude-code-auto-mode/), когда его запускали для Pro. В CLI: Запусти `claude --enable-auto-mode`, чтобы включить auto mode, затем переключись на него через Shift+Tab [Claude](https://claude.com/blog/auto-mode?ref=matveev.tech). После этого режим добавится в обычный цикл переключения. ## Что говорят партнёры Anthropic собрала 27 отзывов в анонс. Это маркетинг, партнёров выбрали тех, у кого есть результат. Но несколько моментов реально полезны. В Vercel пишут про «нет регрессий» и модель, которая «честнее о своих ограничениях». При апгрейдах это важно, потому что обычно что-то отваливается в одном домене ради прогресса в другом. У Replit то же качество дешевле на анализе логов, трейсов и поиске багов. Bolt показывает до 10% лучше на долгих app-building задачах без типичных агентных откатов. В Notion называют 4.7 «первой моделью, которая проходит наши implicit-need тесты и не ломается от ошибок инструментов». То есть модель продолжает работу, даже когда MCP-сервер вернул ошибку или тайм-аут. В Ramp отмечают меньше step-by-step руководства во внутренних агентных командах: модель лучше держит роль. Вообще из моего опыта: Opus 4.6 уже был сильнейшим для кодинга. Посмотрим чем удивит меня Opus 4.7. Еще почитать про AI можно у меня в [телеграм-канале](https://t.me/ctospeech?ref=matveev.tech) ## Как мигрировать с Opus 4.6? Anthropic подчеркивает два изменения, которые меняют экономику. Первое: обновлённый токенизатор. Тот же текст превращается в 1.0–1.35× больше токенов в зависимости от типа контента. Новая токенизация работает точнее, но разбивает текст иначе. Посчитай свои реальные промпты, чтобы понять конкретный коэффициент на твоём трафике. Второе: модель больше думает на высоких уровнях усилия, особенно на поздних ходах в агентных сценариях. Это даёт надёжность на сложных задачах, но увеличивает выход. ![Использование токенов Opus 4.7 vs 4.6 на agentic coding eval](https://matveev.tech/content/images/2026/04/claude-opus-4-7-tokens.png) Anthropic пишут, что в их внутренней coding eval net effect выгодный: на всех уровнях усилия использование токенов улучшилось. Сами же оговариваются — мерьте на реальном трафике. Контролировать расход можно тремя способами: параметр `effort`, task budgets, промпт на краткость. Отдельный момент: **4.7 читает инструкции буквально**. Там, где 4.6 «додумывал» и мог пропустить кусок, 4.7 выполнит ровно то, что написано. Промпты под прошлое поколение могут выдать неожиданный результат. Стоит пересмотреть системные инструкции и харнесс. ## Безопасность и загадочный Mythos Preview В анонсе мимоходом упоминается **Claude Mythos Preview** — более мощная модель, которая доступна в ограниченном режиме. Opus 4.7 — первый шаг к тому, чтобы обкатать безопасность и потом катнуть Mythos широко. По киберспособностям: Anthropic специально уменьшили их при обучении, чтобы модель была готова к массовому релизу. В продакшене Opus 4.7 получил автоматические фильтры запросов, связанных с кибербезопасностью. Для легитимных задач (vulnerability research, пентест, red-teaming) есть Cyber Verification Program — подать заявку можно на сайте Anthropic. В общем профиле безопасности 4.7 не хуже 4.6: меньше галлюцинаций, устойчивее к prompt injection. Правда, чуть более склонна давать детальные советы по harm-reduction при запросах про контролируемые вещества. По автоматическому аудиту misaligned behavior 4.7 лучше 4.6, но Mythos Preview всё равно показывает самые низкие цифры среди всех моделей компании. ## Где и почём доступен Opus 4.7 уже работает во всех продуктах Claude, Claude Code и API, на Amazon Bedrock, Google Cloud Vertex AI и Microsoft Foundry. Идентификатор модели — `claude-opus-4-7`. Цена не изменилась: $5 за миллион входных токенов и $25 за миллион выходных. Фактически для Anthropic это снижение стоимости на задачу, потому что модель решает те же задачи с меньшим числом шагов. ## Вывод Если ты уже платишь за Opus 4.6 — Opus 4.7 должен работать чище за те же деньги. Главное, за чем стоит следить — Mythos Preview. Похоже, это то, что действительно заставит пересмотреть рабочие процессы, а 4.7 — разминка перед ним. ## Следишь за релизами моделей? Подписывайся на новые статьи про AI Подписаться Email sent! Check your inbox to complete your signup. ## Что ещё почитать - [Claude Managed Agents: запускаем AI-агентов через API](https://matveev.tech/claude-managed-agents-api/) — про новый способ гонять Claude в фоне - [Claude Code auto mode: AI сам решает, что безопасно](https://matveev.tech/claude-code-auto-mode/) — про режим, который расширили на Max - [Code Review в Claude Code: AI-агенты ревьюят каждый PR](https://matveev.tech/claude-code-review-obzor/) — место, где живёт новый /ultrareview - [GLM-5.1: китайская модель на 94.6% от Claude Opus в кодинге](https://matveev.tech/glm-5-1-zhipu-ai-obzor/) — свежий конкурент из Китая ### Claude Managed Agents: запускаем AI-агентов через API URL: https://matveev.tech/claude-managed-agents-api/ Last updated: 2026-04-09T06:42:35.000Z > TL;DR: Anthropic запустила Claude Managed Agents — API для автономных AI-агентов в управляемой облачной инфраструктуре. Вместо самостоятельной сборки agent loop, песочницы и оркестрации инструментов ты получаешь готовый контейнер с Python, Node.js и Go, набор встроенных инструментов и стриминг событий через SSE. Сейчас в бете, доступен всем с API-ключом. ## Зачем Anthropic запустила Managed Agents Anthropic берёт на себя инфраструктуру: контейнер с инструментами, стриминг событий, кеширование и компакцию контекста. Ты описываешь агента и запускаешь сессию. Дальше Claude работает сам. По данным WIRED, годовой доход Anthropic перевалил за $30 млрд. Это втрое больше, чем в декабре 2025\. Большая часть роста пришла именно с Claude Platform, где разработчики подключаются к моделям через API. Angela Jiang, руководитель продукта Claude Platform, говорит: между возможностями моделей и тем, как бизнес их использует, огромный разрыв. Managed Agents — попытка этот разрыв закрыть. Если ты читал про [agent harness](https://matveev.tech/agent-harness-chto-takoe/), то Managed Agents — по сути, harness-as-a-service от Anthropic. | | Messages API | Managed Agents | | ----------- | ------------------------------------- | ----------------------------------------- | | Что это | Прямой доступ к модели | Готовая агентная инфраструктура в облаке | | Для чего | Кастомные agent loop, полный контроль | Долгие задачи, асинхронная работа | | Инструменты | Пишешь сам | Встроенные (bash, файлы, веб) + кастомные | | Песочница | Своя | Управляемый контейнер Anthropic | ## Как устроен Managed Agents: 4 концепции Весь API строится на четырёх сущностях. Agent — конфигурация: модель, системный промпт, набор инструментов, MCP-серверы. Создаёшь один раз, используешь во всех сессиях. Агенты версионируются, можно зафиксировать конкретную версию для продакшена. Environment — шаблон контейнера. Какие пакеты предустановить (Python, Node.js, Go, Rust, Ruby), какие правила сетевого доступа применить. Окружение переиспользуется между сессиями, но каждая получает свой изолированный экземпляр. Файлы не расшариваются. Session связывает Agent и Environment. Это запущенный агент с историей диалога. Четыре статуса: | Статус | Что происходит | | ------------ | -------------------------------------------- | | idle | Ждёт ввода. Сессия стартует в этом состоянии | | running | Агент работает | | rescheduling | Временная ошибка, автоматический retry | | terminated | Завершён из-за неустранимой ошибки | Events — потоковые сообщения между твоим приложением и агентом через SSE. Пользовательские сообщения, вызовы инструментов, результаты, обновления статуса. Вся история сохраняется на стороне Anthropic. ## Quickstart: запускаем агента за 4 шага Все запросы к Managed Agents API требуют бета-заголовок `managed-agents-2026-04-01`. Python SDK ставит его автоматически. ### 1\. Создаём агента ```python from anthropic import Anthropic client = Anthropic() agent = client.agents.create( model="claude-sonnet-4-6", system="You are a helpful coding assistant.", tools=[{"type": "agent_toolset_20260401"}] ) # agent.id — сохрани, будет нужен для каждой сессии ``` `agent_toolset_20260401` включает все встроенные инструменты. Если нужно отключить отдельные, передаёшь `configs` с `enabled: false` для конкретных инструментов. ### 2\. Создаём окружение ```python environment = client.environments.create( name="my-dev-env", packages={ "pip": ["pandas==2.2.0", "requests"], "npm": ["express@4.18.0"], "apt": ["ffmpeg"] }, networking={"mode": "unrestricted"} ) ``` Пакеты устанавливаются соответствующими менеджерами и кешируются между сессиями. ### 3\. Запускаем сессию ```python session = client.sessions.create( agent=agent.id, environment=environment.id ) ``` Сессия создана, но ещё ничего не делает. Работа начинается, когда отправишь событие. ### 4\. Отправляем задачу и стримим ответ ```python stream = client.sessions.stream(session.id) stream.send_event( type="user", content="Напиши Python-скрипт, который генерирует CSV с 100 рандомными записями" ) for event in stream: if event.type == "text": print(event.text, end="") elif event.type == "tool_use": print(f"\n[Инструмент: {event.name}]") elif event.type == "session.status_idle": print("\nАгент завершил работу.") break ``` Claude сам решает, какие инструменты использовать: пишет скрипт через `write`, выполняет через `bash`, проверяет результат через `read`. Ты видишь весь процесс в реальном времени через SSE. Можно отправить дополнительное сообщение, чтобы скорректировать агента на ходу, или прервать выполнение. Разбираю новые фичи Claude API по мере выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Какие инструменты доступны агенту Встроенный набор повторяет инструменты [Claude Code](https://matveev.tech/claude-code-auto-mode/): | Инструмент | Описание | | ----------- | ------------------------------------- | | bash | Выполнение shell-команд | | read | Чтение файлов | | write | Запись файлов | | edit | Точечные замены строк в файлах | | glob | Поиск файлов по паттерну | | grep | Поиск текста по регулярным выражениям | | web\_fetch | Загрузка контента по URL | | web\_search | Поиск в интернете | Кроме встроенных, поддерживаются кастомные инструменты. Ты определяешь схему (имя, описание, параметры), Claude решает, когда вызвать, а твой код выполняет операцию и возвращает результат. Всё как [tool use в Messages API](https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview?ref=matveev.tech), только в рамках автономного агента. Anthropic в документации настаивает: качество описаний инструментов влияет на результат больше всего остального. Минимум 3-4 предложения на каждый инструмент. И лучше объединять связанные операции в один инструмент с параметром `action`, чем делать отдельный на каждое действие. ## Окружения: пакеты, сеть и изоляция Контейнер поставляется с предустановленными рантаймами. Поверх можно доставить пакеты через шесть менеджеров: | Менеджер | Пример | | -------- | --------------------------------------- | | apt | ffmpeg, imagemagick | | pip | pandas==2.2.0 | | npm | express@4.18.0 | | cargo | ripgrep@14.0.0 | | gem | rails:7.1.0 | | go | golang.org/x/tools/cmd/goimports@latest | Сетевой доступ настраивается через поле `networking`. Два режима. `unrestricted` (по умолчанию): полный исходящий доступ кроме чёрного списка. `limited`: только указанные домены в `allowed_hosts`. Для продакшена Anthropic рекомендует `limited` с принципом минимальных привилегий. В ограниченном режиме есть два дополнительных флага: `allow_mcp_servers` (разрешить доступ к MCP-серверам) и `allow_package_managers` (разрешить доступ к реестрам пакетов). Оба по умолчанию `false`. ## Кому это нужно и чего ожидать WIRED цитирует Katelyn Lesse, руководителя инженерии Claude Platform: раньше компании держали целые команды инженеров для запуска и масштабирования агентных систем. Теперь эти люди могут заняться продуктом. Notion уже показал демо: клиентский онбординг через Managed Agents. Агент получает список задач в Notion и выполняет их одну за другой. На Claude Platform видно, как агент работает и какие инструменты использует. ⚠️ API в бете, поведение может меняться между релизами. Rate limit: 60 создающих запросов и 600 читающих в минуту на организацию. Фичи outcomes, мультиагентность и память пока в research preview, нужен отдельный запрос на доступ. Думаю, переход на Managed Agents имеет смысл, если задачи агента длятся больше нескольких минут и требуют выполнения кода в безопасной среде. Для коротких запросов Messages API проще. Для полного контроля над agent loop — тоже Messages API. А вот если хочется быстро получить рабочего агента без возни с инфраструктурой, Managed Agents выглядит как разумный выбор. Посмотрим, как API будет развиваться после беты. [Claude Managed Agents DocumentationПолная документация: quickstart, API Reference, примеры кода, настройка окружений и инструментовAnthropic](https://platform.claude.com/docs/en/managed-agents/overview?ref=matveev.tech) ## Что ещё почитать - [Что такое agent harness](https://matveev.tech/agent-harness-chto-takoe/) — концепция обвязки агентов, которую Managed Agents реализует как сервис - [8 уровней агентного инжиниринга](https://matveev.tech/8-urovnej-agentnogo-inzhiniringa/) — где Managed Agents находится в иерархии сложности - [Claude Code auto mode](https://matveev.tech/claude-code-auto-mode/) — автономность Claude на стороне CLI - [Claude Computer Use и Dispatch](https://matveev.tech/claude-computer-use-dispatch/) — другой подход к автономным Claude-агентам ### MemPalace: память для AI-агентов URL: https://matveev.tech/mempalace-ai-pamyat-agentov/ Last updated: 2026-04-08T18:58:07.000Z > TL;DR: MemPalace — open-source система памяти для AI-агентов, которая хранит все разговоры локально в ChromaDB и организует их по архитектуре «дворца памяти». [96.6% recall на LongMemEval](https://github.com/milla-jovovich/mempalace/tree/main/benchmarks?ref=matveev.tech) без единого API-вызова. Бесплатная, работает через MCP. Большинство систем памяти решают проблему через суммаризацию. LLM сама выбирает, что «важно», извлекает факт вроде «пользователь предпочитает Postgres» и выбрасывает весь разговор, где ты объяснял *почему* именно Postgres. MemPalace предлагает другой подход: сохранить всё дословно, а потом сделать это находимым через структуру. ## Кто за этим стоит Проект выпустили [Милла Йовович](https://github.com/milla-jovovich?ref=matveev.tech) (актриса, да) и Бен Сигман (разработчик). Релиз v3.0.0 состоялся 6 апреля 2026 года. За два дня — 24.6k звёзд на GitHub, 3k форков, публикации в десятке изданий. Почему актриса делает инструмент для AI-разработчиков, README не объясняет. Зато объясняют бенчмарки: результаты [воспроизведены независимо](https://github.com/milla-jovovich/mempalace?ref=matveev.tech) на M2 Ultra за 5 минут. ## Как устроен MemPalace: архитектура дворца Древние греки запоминали длинные речи, мысленно раскладывая идеи по комнатам воображаемого здания. MemPalace делает то же самое с AI-памятью, только вместо воображения работают ChromaDB и структурированная иерархия. Верхний уровень — крылья (Wings). У каждого проекта, человека или темы своё крыло. Внутри крыла — комнаты (Rooms) по темам: `auth-migration`, `graphql-switch`, `ci-pipeline`. Комнаты соединяются залами (Halls) — это типы памяти, одинаковые в каждом крыле: факты, события, открытия, предпочтения, советы. Между крыльями работают туннели (Tunnels). Если тема auth-migration упоминается и у человека Kai, и у проекта Driftwood — туннель свяжет их автоматически. На нижнем уровне — шкафы (Closets) с текстовыми саммари и ящики (Drawers) с оригинальными файлами, дословно, без суммаризации. ``` ┌─────────────────────────────────────────────┐ │ WING: Person │ │ ┌──────────┐ ──hall── ┌──────────┐ │ │ │ Room A │ │ Room B │ │ │ └────┬─────┘ └──────────┘ │ │ ▼ │ │ ┌──────────┐ ┌──────────┐ │ │ │ Closet │ ───▶ │ Drawer │ │ │ └──────────┘ └──────────┘ │ └─────────┼───────────────────────────────────┘ tunnel ┌─────────┼───────────────────────────────────┐ │ WING: Project │ │ ┌────┴─────┐ ──hall── ┌──────────┐ │ │ │ Room A │ │ Room C │ │ │ └────┬─────┘ └──────────┘ │ │ ▼ │ │ ┌──────────┐ ┌──────────┐ │ │ │ Closet │ ───▶ │ Drawer │ │ │ └──────────┘ └──────────┘ │ └─────────────────────────────────────────────┘ ``` Тесты на 22 000+ реальных разговоров показали разницу в структурированном поиске: | Тип поиска | Recall R@10 | | --------------- | ----------- | | По всем шкафам | 60.9% | | Внутри крыла | 73.1% | | Крыло + зал | 84.8% | | Крыло + комната | 94.8% | Разница между поиском «по всему» и «по крылу + комнате» составляет 34 процентных пункта. Технически это стандартная фильтрация метаданных ChromaDB, не какой-то уникальный механизм. ## 170 токенов на старте: стек памяти MemPalace MemPalace использует четырёхуровневый стек. Два нижних уровня загружаются всегда, два верхних — по запросу: | Уровень | Что хранит | Размер | | ------- | ------------------------------------------------- | ------------- | | L0 | Идентичность AI | \~50 токенов | | L1 | Критичные факты: команда, проекты, предпочтения | \~120 токенов | | L2 | Контекст комнаты: недавние сессии, текущий проект | По запросу | | L3 | Глубокий семантический поиск по всем шкафам | По запросу | AI просыпается с L0 + L1 (\~170 токенов) и уже знает твой мир. Для сравнения: загрузить всё через LLM-суммаризацию — \~650K токенов и [примерно $507 в год](https://github.com/milla-jovovich/mempalace?ref=matveev.tech). MemPalace с пятью поисками за сессию — \~13 500 токенов и \~$10 в год. ## Бенчмарки MemPalace: 96.6% без API-вызовов | Бенчмарк | Режим | Результат | API | | --------------- | --------------------- | ------------------ | ------------- | | LongMemEval R@5 | Raw (ChromaDB) | **96.6%** | Ноль | | LongMemEval R@5 | Hybrid + Haiku rerank | **100%** (500/500) | \~500 вызовов | | LoCoMo R@10 | Raw, уровень сессии | 60.3% | Ноль | 96.6% в raw режиме — лучший опубликованный результат на [LongMemEval](https://github.com/jucamohedano/longmemeval?ref=matveev.tech), не требующий ни API-ключа, ни облака, ни LLM. Для контекста — как выглядят конкуренты: | Система | LongMemEval R@5 | Нужен API | Цена | | ------------------ | --------------- | ----------- | ------------- | | MemPalace (hybrid) | 100% | Опционально | Бесплатно | | Supermemory ASMR | \~99% | Да | — | | MemPalace (raw) | 96.6% | Нет | Бесплатно | | Mastra | 94.87% | Да (GPT) | Стоимость API | | Mem0 | \~85% | Да | $19–249/мес | | Zep | \~85% | Да | $25/мес+ | 100% с Haiku rerank — результат реальный (файлы есть), но пайплайн ранжирования пока не включён в публичные скрипты бенчмарков. Команда обещает добавить. Разбираю AI-инструменты, тестирую и пишу — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## AAAK и что пошло не так после запуска AAAK — экспериментальный lossy-диалект сокращений: коды сущностей, структурные маркеры, усечение предложений. Задача — упаковать повторяющиеся сущности в меньше токенов. Если одна и та же команда упоминается сотни раз в тысячах сессий, коды сущностей амортизируются. На практике AAAK пока не оправдывает ожиданий. На коротких текстах оверхед кодов и разделителей стоит больше, чем экономия. 96.6% recall — это результат raw режима (дословное хранение в ChromaDB). AAAK-компрессия пока снижает recall до 84.2%. В первые часы после релиза сообщество нашло проблемы в README: пример токенов AAAK был посчитан через `len(text)//3` вместо реального токенизатора, «30x lossless compression» оказался преувеличением (AAAK lossy по природе), «+34% palace boost» — стандартная фильтрация метаданных ChromaDB, детекция противоречий (`fact_checker.py`) не подключена к графу знаний. Мила и Бен не стали отмалчиваться. Они [опубликовали подробный разбор ошибок](https://github.com/milla-jovovich/mempalace?ref=matveev.tech) прямо в README: что было неправильно, что подтверждено, что в работе. Для проекта, который набрал 24k звёзд за два дня, реакция на критику важнее самого запуска. ## Как подключить MemPalace Установка через pip: ```bash pip install mempalace mempalace init ~/projects/myapp mempalace mine ~/projects/myapp mempalace mine ~/chats/ --mode convos ``` Три режима загрузки: projects (код и документация), convos (экспорты переписок с Claude, ChatGPT, Slack) и general (автоклассификация по типам: решения, вехи, проблемы, предпочтения). Для Claude, ChatGPT, Cursor или Gemini подключение через MCP: ```bash claude mcp add mempalace -- python -m mempalace.mcp_server ``` После этого AI получает [19 инструментов](https://github.com/milla-jovovich/mempalace?ref=matveev.tech#mcp-server): поиск по памяти, навигация по дворцу, граф знаний, дневники специализированных агентов. Спрашиваешь «что мы решили про авторизацию в прошлом месяце?» — Claude сам вызовет `mempalace_search` и ответит из сохранённых разговоров. Для локальных моделей (Llama, Mistral) — через CLI: ```bash mempalace wake-up > context.txt mempalace search "auth decisions" > results.txt ``` Всё работает оффлайн. ChromaDB на твоей машине, данные никуда не уходят. Требования: Python 3.9+ и `chromadb>=0.4.0`. ## Граф знаний MemPalace: SQLite вместо Neo4j Ещё одна штука, которая заслуживает внимания: граф знаний с временными сущностями. Работает как [Zep Graphiti](https://www.getzep.com/?ref=matveev.tech), только на SQLite вместо Neo4j. Локальный и бесплатный. ```python from mempalace.knowledge_graph import KnowledgeGraph kg = KnowledgeGraph() kg.add_triple("Kai", "works_on", "Orion", valid_from="2025-06-01") kg.invalidate("Kai", "works_on", "Orion", ended="2026-03-01") ``` Факты имеют окна валидности. Когда что-то перестаёт быть правдой, инвалидируешь. Запросы текущего состояния не вернут устаревшие данные, исторические вернут. Полезно, когда люди переходят между проектами, а тебе нужно знать, кто чем занимается сейчас, а не полгода назад. ## Стоит ли пробовать MemPalace Проблема потери контекста между сессиями AI реальна, и MemPalace подходит к ней прямолинейно: сохрани всё дословно, ищи через структуру. Проще и надёжнее, чем пытаться научить LLM решать, что важно. Если ведёшь долгий проект с AI-ассистентом и устал каждый раз объяснять контекст заново, тут есть конкретная польза. Тимлидам тоже пригодится: история решений команды в одном месте, с поиском. Проект молодой (v3.0.0, релиз 6 апреля 2026). AAAK-диалект не работает как обещано, детекция противоречий не подключена к графу знаний, есть открытые баги ([shell injection в hooks](https://github.com/milla-jovovich/mempalace/issues/110?ref=matveev.tech), [segfault на macOS ARM64](https://github.com/milla-jovovich/mempalace/issues/74?ref=matveev.tech)). Но базовый функционал (raw mode + ChromaDB + MCP) работает и даёт рекордные результаты на бенчмарках. MIT-лицензия, полностью локальный, без подписок. Попробовать точно стоит. [MemPalace на GitHubThe highest-scoring AI memory system ever benchmarked. And it's free.GitHub](https://github.com/milla-jovovich/mempalace?ref=matveev.tech) ## Что ещё почитать - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) — основы: как агенты запоминают, от контекстного окна до графов знаний. MemPalace идёт дальше Mem0 именно в этом направлении - [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov/) — архитектуры агентных систем, в которые вписывается память - [Что такое agent harness](https://matveev.tech/agent-harness-chto-takoe/) — обвязка, которая делает AI полезным. MemPalace — одна из таких обвязок - [8 уровней агентного инжиниринга](https://matveev.tech/8-urovnej-agentnogo-inzhiniringa/) — от простого промптинга до автономных систем с памятью ### GLM-5.1: китайская модель на 94.6% от Claude Opus в кодинге URL: https://matveev.tech/glm-5-1-zhipu-ai-obzor/ Last updated: 2026-04-07T10:11:56.000Z > TL;DR: GLM-5.1 от Z.ai набрала 45.3 балла в кодинг-бенчмарке — это 94.6% от Claude Opus 4.6\. Модель обучена полностью на китайских чипах Huawei, скоро выйдет в open source под MIT, а подписка стоит от $10 в месяц. Рост на 28% по сравнению с предыдущей GLM-5. ## GLM-5.1 Китайская компания Z.ai (раньше Zhipu AI) выкатила обновлённую версию своей флагманской модели. Пользователи Coding Plan начали получать письма о том, что GLM-5.1 доступна в рамках подписки. Цифры такие: в тестировании через [Claude Code](https://matveev.tech/claude-code-auto-mode) модель набрала 45.3 балла против 47.9 у Claude Opus 4.6\. Разрыв — всего 2.6 балла. Для сравнения, предыдущая GLM-5 набирала 35.4\. То есть за полтора месяца прирост составил 28%. ![Результаты Coding Evaluation: Claude Opus 4.6 — 47.9, GLM-5.1 — 45.3, GLM-5 — 35.4](https://matveev.tech/content/images/2026/04/glm-5-1-coding-evaluation-benchmark.webp) Тестирование проводили через Claude Code — фреймворк от самой Anthropic. То есть модель играла на чужом поле. Набор задач, критерии оценки и методика подсчёта не раскрываются, поэтому цифры стоит воспринимать как относительное сравнение внутри одного теста, а не как абсолютный показатель. ## Что внутри GLM-5.1 GLM-5.1 построена на фундаменте [GLM-5](https://matveev.tech/glm-5-turbo-zhipu-ai), которая вышла в феврале 2026\. Базовые параметры GLM-5: - 744 млрд параметров (40 млрд активных при инференсе, архитектура Mixture of Experts) - 28.5 трлн токенов данных для предобучения - Контекстное окно 200K, до 128K токенов на выходе - Интегрирован DeepSeek Sparse Attention для снижения стоимости деплоя - Нативная поддержка [MCP](https://matveev.tech/luchshie-mcp-servery-claude-code-2026) (Model Context Protocol) Точные параметры самой GLM-5.1 пока не раскрыли, полный технический отчёт ещё не опубликован. Но компания подтвердила, что модель тоже будет open source. Глава Z.ai Ли Цзысюань написал 20 марта в X: «Don't panic. GLM-5.1 will be open source». Ещё один момент: вся линейка GLM-5 обучена на чипах Huawei Ascend 910B. Ни одного GPU от NVIDIA. С учётом санкций на поставку чипов в Китай это скорее вынужденный ход, но результаты бенчмарков показывают, что ход удачный. ## Бенчмарки: где GLM-5.1 сильна Кроме кодинг-теста, базовая GLM-5 показала сильные результаты и в других бенчмарках: | Бенчмарк | Результат | Контекст | | ------------------ | --------- | ---------------------------------- | | Coding Evaluation | 45.3 | 94.6% от Claude Opus 4.6 | | SWE-bench Verified | 77.8% | Лучший среди open-source моделей | | Terminal Bench 2.0 | 56.2 | Тоже лучший среди открытых моделей | SWE-bench — это реальные задачи из GitHub-репозиториев. 77.8% там для open-source модели — лучший результат на момент публикации. ## Сколько стоит и где подключить GLM-5.1 доступна через подписку GLM Coding Plan на платформе [Z.ai](https://z.ai/subscribe?ic=QFHTJ4ILSF&ref=matveev.tech). Три тарифа: | Тариф | Цена | Лимиты | | ----- | ------------------- | ---------------------------- | | Lite | $10/мес ($3 промо) | 120 запросов за 5 часов | | Pro | $30/мес ($15 промо) | 600 запросов за 5 часов | | Max | расширенный | 4 000 поисковых запросов/мес | ![Варианты подписки на Z.ai](https://matveev.tech/content/images/2026/04/zai-coding-plan-pricing.jpg) Для контекста: Claude Max стоит $100–200 в месяц. При этом даже базовый Lite от Z.ai даёт тройной лимит использования по сравнению с подпиской Claude Code, а Pro — уже в 15 раз больше. Разница ощутимая. Отдельный API для GLM-5.1 пока недоступен. API GLM-5 работает по цене $1 за миллион входных токенов и $3.20 за миллион выходных. [GLM Coding Plan — AI Coding Powered by GLM-5.1 & GLM-5 for Agents & IDEsUse GLM models like GLM-5.1, GLM-5 & GLM-5-Turbo for AI coding in Claude Code, Cursor, Kilo Code, Cline, OpenCode, Droid, OpenClaw and more. Plans from 10/month—fast, reliable code generation and tool use for daily dev work.![](https://matveev.tech/content/images/icon/logo-1.svg)![](https://matveev.tech/content/images/thumbnail/logo-1.svg)](https://z.ai/subscribe?ic=QFHTJ4ILSF&ref=matveev.tech) ## Как настроить GLM-5.1 в Claude Code Модель совместима с Claude Code, [OpenClaw](https://matveev.tech/openclaw-kejsy-ispolzovaniya) и Cline. Настройка простая. Для Claude Code: открой `~/.claude/settings.json` и добавь: ```json { "env": { "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air", "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.1", "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.1" } } ``` Перезапусти терминал и проверь через `/status` в Claude Code. Для OpenClaw нужно добавить модель в `~/.openclaw/openclaw.json` — в массив `models.providers.zai.models` и поменять `primary` на `zai/glm-5.1`. Подробная инструкция есть в [документации Z.ai](https://docs.z.ai/devpack/using5.1?ref=matveev.tech). Для Cline и других инструментов с OpenAI-совместимым API: указываешь `https://api.z.ai/api/coding/paas/v4` как Base URL, вводишь API-ключ Z.ai и пишешь `glm-5.1` как название модели. Контекстное окно — 200 000 токенов. ## Реальные впечатления от пользователей На Хабре пользователь с подпиской на Z.ai, MiniMax, Codex и Gemini поделился наблюдениями. Говорит, что китайские модели не дотягивают до GPT-5.4, но по ощущениям находятся на уровне GPT-5.2 thinking. При этом лимиты намного щедрее. Из минусов — был случай, когда агент на GLM-5 ушёл в бесконечный цикл размышлений и сожрал 7% недельной квоты. Возможно, это проблема opencode-агента, а не самой модели. С [MiniMax M2.7](https://matveev.tech/minimax-m27-self-evolution) такого не было. Сообщество LocalLLaMA на Reddit тоже обсуждает: связка GLM-5-Turbo для повседневных задач и GLM-5.1 для планирования даёт хорошие результаты при минимальных затратах. --- Меня тут зацепили два момента. Разрыв между open-source и закрытыми моделями сжимается прямо на глазах. Менее 3 баллов до Claude Opus в кодинг-бенчмарке — ещё год назад такое казалось нереальным. 💰 GLM-5.1 за $10/мес показывает 94.6% от Claude Opus за $100–200/мес. Разница в цене — до 20 раз при сопоставимом качестве кодинга. Ну и доступность. Китайские API работают без VPN из многих корпоративных сетей, где западные сервисы заблокированы. Для части разработчиков это вообще единственный способ использовать LLM в работе. [Qwen 3.6-Plus](https://matveev.tech/qwen-3-6-plus-obzor) от Alibaba, MiniMax M2.7, теперь GLM-5.1\. Китайские модели уже не «дешёвая альтернатива», а полноценные конкуренты. ✈️ Пишу про китайские и западные AI-модели, сравниваю на практике — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [GLM-5-Turbo: цены, сравнение с GLM-5 и настройка OpenClaw](https://matveev.tech/glm-5-turbo-zhipu-ai) — предыдущий обзор линейки GLM-5 - [Qwen 3.6-Plus: Alibaba бросает вызов Claude в агентном кодинге](https://matveev.tech/qwen-3-6-plus-obzor) — ещё одна китайская модель, конкурирующая с Claude - [MiniMax M2.7: модель, которая сама себя обучала](https://matveev.tech/minimax-m27-self-evolution) — альтернативная китайская модель для кодинга - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026) — подборка инструментов, с которыми можно использовать GLM-5.1 ### Qwen 3.6-Plus: Alibaba бросает вызов Claude в агентном кодинге URL: https://matveev.tech/qwen-3-6-plus-obzor/ Last updated: 2026-04-03T13:13:53.000Z > TL;DR: Alibaba выпустила Qwen 3.6-Plus с контекстом в 1 миллион токенов и фокусом на агентный кодинг. Модель обходит Claude Opus 4.5 на Terminal-Bench 2.0 (61.6 vs 59.3), но уступает ему на SWE-bench Verified (78.8 vs 80.9). Always-on reasoning, мультимодальность, совместимость с Claude Code и OpenClaw. ## Что нового в Qwen 3.6-Plus Контекстное окно выросло до 1 миллиона токенов — нативно, из коробки. У Qwen 3.5 было 256K с возможностью расширения до 1M, теперь миллион по умолчанию. По объёму контекста Qwen догнал Gemini 3 Pro. Рассуждение (chain-of-thought) теперь включено всегда. В 3.5 был тогл thinking/non-thinking, здесь его убрали. Каждый ответ содержит цепочку рассуждений, которую можно проверить. Ну и агентный кодинг — фронтенд, задачи уровня репозитория, терминальные операции. Alibaba называет это «transformative vibe coding experience». Модель доступна через [Alibaba Cloud Model Studio](https://modelstudio.console.alibabacloud.com/?ref=matveev.tech), поддерживает до 65 536 выходных токенов на ответ и совместима с протоколами OpenAI и Anthropic API. ## Как Qwen 3.6-Plus показывает себя на бенчмарках ![Результаты Qwen 3.6-Plus на бенчмарках кодинга и агентных задач](https://matveev.tech/content/images/2026/04/benchmarks-language.png) Вот что показывают цифры в сравнении с Claude Opus 4.5, Gemini 3 Pro, Kimi K2.5 и GLM-5. ### Агентный кодинг | Бенчмарк | Qwen 3.6-Plus | Claude Opus 4.5 | Gemini 3 Pro | GLM-5 | | ---------------------- | ------------- | --------------- | ------------ | ----- | | Terminal-Bench 2.0 | **61.6** | 59.3 | — | 56.2 | | SWE-bench Verified | 78.8 | **80.9** | — | 77.8 | | SWE-bench Pro | 56.6 | **57.1** | — | 55.1 | | SWE-bench Multilingual | 73.8 | — | **77.5** | 73.3 | | Claw-Eval | 58.7 | **59.6** | — | 57.7 | | NL2Repo | 37.9 | — | **43.2** | 35.9 | Terminal-Bench 2.0 тут интереснее всего. Бенчмарк тестирует агентную работу в терминале, и Claude держал там первенство месяцами. Qwen 3.6-Plus его обошёл: 61.6 против 59.3. На SWE-bench Verified картина другая. Claude Opus 4.5 впереди с 80.9 против 78.8 у Qwen. Разрыв в 2.1 балла — самый маленький в истории между любой моделью Qwen и Claude Opus. Год назад такое сравнение выглядело бы абсурдно. NL2Repo (понимание репозиториев целиком) — тут лидирует Gemini 3 Pro с 43.2\. Qwen на втором месте с 37.9\. Для задач уровня «пойми весь репозиторий» Google пока впереди. ### Мультимодальность ![Результаты Qwen 3.6-Plus на мультимодальных бенчмарках](https://matveev.tech/content/images/2026/04/benchmarks-vision.png) | Бенчмарк | Qwen 3.6-Plus | Claude Opus 4.5 | Gemini 3 Pro | Kimi K2.5 | | ----------------- | ------------- | --------------- | ------------ | --------- | | OmniDocBench v1.5 | **91.2** | 87.7 | 87.7 | 88.8 | | RealWorldQA | **85.4** | 77.0 | 83.3 | — | | MMMU | 86.0 | — | **87.2** | 84.3 | | Video-MME | 87.8 | 77.6 | **88.4** | 87.4 | OmniDocBench — работа с документами, сканами, PDF. Qwen 3.6-Plus тут лидер с 91.2\. Если работаешь с юридическими или финансовыми документами, где нужно парсить сложные PDF, это заметная разница. RealWorldQA (рассуждения по картинкам из реального мира): 85.4 у Qwen против 77.0 у Claude. Разрыв заметный. Видео-понимание — Gemini 3 Pro чуть впереди (88.4 vs 87.8), но разница минимальная. ### Скорость и практические нюансы По данным [BridgeBench](https://renovateqr.com/blog/qwen-3-6-plus-review-benchmarks-2026?ref=matveev.tech), Qwen 3.6-Plus выдаёт 158 токенов в секунду — примерно в 3 раза быстрее Claude Opus 4.6 (93.5 tok/s). Но есть подвох: время до первого токена (TTFT) на бесплатном тире составляет 11.5 секунд. Если ты итерируешь код быстро, 11 секунд ожидания перед каждым ответом ломают ритм. На платном API после GA эта проблема должна решиться, но пока стоит учитывать. ## Что исправили по сравнению с Qwen 3.5 Главная жалоба на Qwen 3.5 — overthinking. Модель тратила кучу токенов на размышления даже по простым вопросам. Для агентных систем, где модель выполняет десятки мелких шагов, это было дорого и медленно. Qwen 3.6-Plus решает эту проблему. Always-on reasoning теперь калиброван: модель быстрее приходит к выводам на простых задачах, тратит меньше токенов и стабильнее работает в многошаговых агентных сценариях. Ранние тестировщики [отмечают](https://renovateqr.com/blog/qwen-3-6-plus-review-benchmarks-2026?ref=matveev.tech) меньше ретраев и снижение расхода токенов при тех же результатах. То, что reasoning сделали always-on без переключателя — осознанный выбор. Каждый ответ можно проаудитировать. Для enterprise-задач, где нужно объяснять почему модель приняла конкретное решение, это полезно. ## Как подключить Qwen 3.6-Plus Модель совместима с OpenAI и Anthropic протоколами, так что интеграция простая. ### Через Claude Code ```bash export ANTHROPIC_MODEL="qwen3.6-plus" export ANTHROPIC_SMALL_FAST_MODEL="qwen3.6-plus" export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic export ANTHROPIC_AUTH_TOKEN= claude ``` ### Через OpenClaw ```bash curl -fsSL https://molt.bot/install.sh | bash export DASHSCOPE_API_KEY= openclaw dashboard ``` ### Через Qwen Code ```bash npm install -g @qwen-code/qwen-code@latest qwen ``` У Qwen Code есть приятный бонус: OAuth-авторизация даёт 1000 бесплатных вызовов в день. Также модель работает с Kilo Code, Cline и OpenCode. API-ключ можно получить в [Alibaba Cloud Model Studio](https://modelstudio.console.alibabacloud.com/?ref=matveev.tech). ## Визуальный кодинг и мультимодальные агенты Qwen 3.6-Plus — нативная мультимодальная модель. Она генерирует фронтенд-код по скриншотам UI, дизайн-макетам и текстовым описаниям. На внутреннем бенчмарке QwenWebBench (качество генерации фронтенда) модель набрала Elo 1502 — на втором месте после Gemini 3 Pro (1518). Для видео-понимания модель тоже прокачали: разбор временных зависимостей, анализ динамических изменений между кадрами, извлечение информации из видео. По Video-MME результат практически на уровне Gemini (87.8 vs 88.4). Alibaba позиционирует это как шаг к «native multimodal agent», где модель не просто видит картинку, а понимает контекст и может что-то с этим сделать. ## О чём стоит помнить перед использованием Безопасность кода — слабое место. По данным [BridgeBench](https://renovateqr.com/blog/qwen-3-6-plus-review-benchmarks-2026?ref=matveev.tech), Qwen 3.6-Plus набрала 82.4 на Security Bench с 43.3% успехом на скрытых тестах. GPT-5.4 Mini — 87.3, Claude Sonnet 4.5 — 87.2\. Если пишешь код с аутентификацией или платежами, стоит перепроверять. Ещё один момент: 26.5% уровень фабрикации в рассуждениях. Примерно каждое четвёртое утверждение о поведении API или языковых конструкциях оказывается выдуманным. В агентных сценариях с минимальным контролем это накапливается. Бесплатное превью собирает промпты и ответы для обучения модели. Не отправляй туда конфиденциальный код. ⚠️ Превью без SLA и с неопределёнными условиями по данным. Для продакшена с чувствительным кодом лучше дождаться GA с платным тиром. **SLA.** Превью без гарантий доступности. Спецификации могут измениться. ## Вердикт Qwen 3.6-Plus — пожалуй, самая сильная китайская модель для агентного кодинга на сегодня. Обойти Claude Opus 4.5 на Terminal-Bench 2.0 мало кому удавалось. Если нужна модель для прототипирования с длинным контекстом, экспериментов с агентным кодингом или обработки документов, Qwen 3.6-Plus стоит попробовать. Бесплатный доступ убирает барьер для оценки, а 1M контекста — необходимость нарезки. Для продакшена рановато. Нужен GA с платным тиром, нормальный TTFT и понятные условия по данным. Но как превью того, куда движется Alibaba, выглядит убедительно. Alibaba обещает в ближайшие дни выложить open-source варианты меньшего размера. Так что следим. Пишу про новые модели и агентный кодинг по мере выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [GPT-5.4: computer use, tool search и 1M контекст](https://matveev.tech/gpt-5-4-obzor/) — обзор конкурирующей модели OpenAI с тем же объёмом контекста - [GLM-5-Turbo: цены, сравнение и настройка OpenClaw](https://matveev.tech/glm-5-turbo-zhipu-ai/) — ещё одна китайская модель, которая претендует на лидерство - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/) — подборка инструментов, с которыми можно использовать Qwen 3.6-Plus - [8 уровней агентного инжиниринга](https://matveev.tech/8-urovnej-agentnogo-inzhiniringa/) — фреймворк для понимания, на каком уровне находятся модели вроде Qwen ### Gemma 4: открытые модели Google на технологиях Gemini 3 URL: https://matveev.tech/gemma-4-google-open-model/ Last updated: 2026-04-03T09:09:08.000Z > TL;DR: Google выпустил Gemma 4 — четыре открытые модели от 2B до 31B параметров, построенные на технологиях Gemini 3\. 31B-версия заняла третье место среди всех открытых моделей в рейтинге [Arena AI](https://lmarena.ai/?ref=matveev.tech), MoE на 26B обгоняет модели в 20 раз крупнее, а маленькие E2B и E4B работают на телефоне и Raspberry Pi. Лицензия Apache 2.0. ## Четыре модели на все случаи Gemma 4 — это не одна модель, а семейство из четырёх вариантов с очень разной архитектурой: | Модель | Параметры | Активные | Архитектура | Контекст | | ------- | --------------------- | -------- | ------------------------------- | -------- | | E2B | 5.1B (2.3B effective) | все | Dense | 128K | | E4B | 8B (4.5B effective) | все | Dense | 128K | | 26B A4B | 25.2B | 3.8B | MoE (128 экспертов, 8 активных) | 256K | | 31B | 30.7B | все | Dense | 256K | Самое интересное тут — 26B MoE. При 25 миллиардах параметров в момент инференса работают только 3.8B. По сути, ты получаешь качество большой модели за цену маленькой. Google заявляет, что эта версия обходит модели в 20 раз крупнее на ряде бенчмарков. А E2B запускается в менее чем 1.5 ГБ оперативной памяти — это уровень бюджетного смартфона. Все модели используют гибридный механизм внимания, который чередует локальное sliding window attention с полным глобальным вниманием. Обучены на 140+ языках, включая русский. ## Бенчмарки: математика и код Главный прогресс Gemma 4 — в математике и коде. Сравнение с Gemma 3 27B показывает масштаб: | Бенчмарк | 31B | 26B MoE | E4B | E2B | Gemma 3 27B | | --------------------------------- | ----- | ------- | ----- | ----- | ----------- | | AIME 2026 (математика) | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% | | LiveCodeBench v6 (код) | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% | | GPQA Diamond (наука) | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% | | MMLU Pro (общие знания) | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% | | τ2-bench (агентное использование) | 86.4% | 85.5% | 57.5% | 29.4% | 6.6% | AIME 2026 — с 20.8% до 89.2%, рост в четыре с лишним раза. В кодинге тоже кратный скачок: с 29.1% до 80.0% на LiveCodeBench. А τ2-bench (агентное использование инструментов) вообще выглядит как другая модель: с 6.6% у Gemma 3 до 86.4% у Gemma 4 31B. 31B Dense сейчас третья среди всех открытых моделей в рейтинге Arena AI с ELO 1452\. 26B MoE на шестом месте с 1441\. Напомню: у неё в момент работы активны только 3.8B параметров. На Codeforces 31B набирает ELO 2150, что примерно соответствует уровню «эксперт». Для открытой модели на 30B параметров — это серьёзная заявка. ## Мультимодальность: не только текст Все четыре модели понимают изображения и видео (как последовательность кадров). Но есть нюанс: аудио поддерживают только маленькие E2B и E4B. | Модель | Текст | Изображения | Видео | Аудио | | ------- | ----- | ----------- | ---------- | ----- | | E2B/E4B | + | + | \+ (кадры) | + | | 26B/31B | + | + | \+ (кадры) | — | Выглядит как осознанное решение: маленькие модели для edge-устройств должны уметь слышать (голосовые команды, распознавание речи), а большие модели для серверов работают с текстом и визуалом. На визуальных бенчмарках результаты тоже хорошие: MMMU Pro 76.9% у 31B, MATH-Vision 85.6%. Ограничения по входу: аудио до 30 секунд, видео до 60 секунд (один кадр в секунду). Для анализа длинных видео не подойдёт, но для быстрого разбора коротких клипов — вполне. ## Агентные возможности из коробки Главный акцент Google — агентное использование. Gemma 4 умеет: - Нативный function calling, когда модель сама формирует вызовы функций и обрабатывает результаты - Генерация валидного JSON через constrained decoding - Поддержка системных промптов для настройки агента - Цепочки рассуждений с промежуточными шагами (multi-step planning) Режим thinking включается через специальный токен `<|think|>`, и модель начинает «рассуждать вслух» перед ответом. По формату это похоже на то, как работают reasoning-модели от OpenAI и DeepSeek. На τ2-bench (бенчмарк агентного использования в ритейл-сценариях) 31B набирает 86.4%. Gemma 3 27B набирала 6.6%. Предыдущее поколение просто не умело работать с инструментами, а текущее, похоже, умеет. ## Работает на чём угодно E2B и E4B оптимизированы для запуска на edge-устройствах. Google разрабатывал их совместно с командами Pixel, Qualcomm и MediaTek. Конкретные цифры: - На Raspberry Pi 5 E2B выдаёт 133 токена/сек на prefill и 7.6 токенов/сек на decode - E2B влезает в 1.5 ГБ памяти с 2-bit и 4-bit квантизацией - Платформы: Android, iOS, Windows, Linux, macOS, WebGPU в браузере, Raspberry Pi, Qualcomm IQ8 NPU, Jetson Nano Для больших моделей 26B и 31B нужна дискретная GPU. Google говорит, что они «оптимизированы для потребительских видеокарт», но конкретные требования по VRAM не указывает. Ориентир: 31B Dense в fp16 потребует около 60 ГБ VRAM, с квантизацией до 4-bit — уместится в 16-20 ГБ. Скачать можно через [Hugging Face](https://huggingface.co/collections/google/gemma-4-release-684dcf496ffc52f6e67b80f5?ref=matveev.tech), [Kaggle](https://www.kaggle.com/models/google/gemma-4?ref=matveev.tech), [Ollama](https://ollama.com/library/gemma4?ref=matveev.tech), или [LM Studio](https://lmstudio.ai/?ref=matveev.tech). Большие модели также доступны в Google AI Studio. ## Apache 2.0: используй как хочешь Google перешёл с кастомной лицензии Gemma на Apache 2.0\. Это полная свобода: коммерческое использование, модификация, дистрибуция — без ограничений. Для сравнения, Meta Llama до сих пор использует собственную лицензию с ограничениями для компаний с 700M+ пользователей. Для бизнеса это удобно: не надо разбираться в нюансах кастомных лицензий, читать мелкий шрифт и переживать за compliance. Разбираю открытые модели, агентные фреймворки и AI-инструменты для разработки — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что с конкурентами Объективно, Gemma 4 31B — одна из лучших открытых моделей в своём размерном классе. Третье место в Arena AI, сильная математика и код. Но есть контекст: [по данным Trending Topics EU](https://www.trendingtopics.eu/google-gemma-4-launch/?ref=matveev.tech), китайские конкуренты (DeepSeek, Qwen) в некоторых задачах всё ещё впереди. Особенно в кодинге, где модели типа DeepSeek-V3 с их MoE-архитектурой и сотнями миллиардов параметров играют в другой лиге. Зато в категории «модели для edge» у Gemma 4 E2B и E4B конкурентов почти нет. Мультимодальная модель с аудио и видео на Raspberry Pi за 1.5 ГБ памяти — попробуйте найти что-то сравнимое. ## Что ещё почитать - [Gemini 3.1 Flash Live: голосовые агенты Google стали точнее](https://matveev.tech/gemini-3-1-flash-live-obzor/) — предыдущий релиз Google в области AI - [Gemini 3.1 Pro: что нового в модели Google](https://matveev.tech/gemini-3-1-pro-obzor/) — флагманская модель Gemini, на технологиях которой построена Gemma 4 - [Jina VLM: мультиязычная VLM на 2.4B параметров](https://matveev.tech/jina-vlm-obzor/) — ещё одна компактная мультимодальная модель для сравнения - [MiniMax M2.7: модель, которая сама себя обучала](https://matveev.tech/minimax-m27-self-evolution/) — альтернативный подход к обучению открытых моделей ### Microsoft MAI: три модели для голоса, транскрипции и картинок URL: https://matveev.tech/microsoft-mai-modeli-foundry/ Last updated: 2026-04-03T06:06:52.000Z > TL;DR: Microsoft выкатила три собственные модели серии MAI: транскрипция голоса на 25 языках, генерация речи с эмоциями за секунду и генерация картинок из топ-3 Arena.ai. Всё доступно в Foundry, цены агрессивные. Похоже, зависимость от OpenAI Microsoft больше не устраивает. ## MAI-Transcribe-1: распознавание речи на 25 языках Первая модель закрывает задачу speech-to-text. Microsoft заявляет первое место по бенчмарку [FLEURS](https://huggingface.co/datasets/google/fleurs?ref=matveev.tech) в 11 основных языках. В оставшихся 14 языках MAI-Transcribe-1 обходит Whisper large-v3 от OpenAI, а в 11 из них ещё и Gemini 3.1 Flash от Google. Но главное не бенчмарки. Скорость пакетной транскрибации в 2.5 раза выше текущего Azure Fast Transcription. Для тех, кто гоняет через API тысячи часов аудио (колл-центры, подкасты, медиа), это ощутимая разница. Модель оптимизирована для шумных реальных условий, не только для чистых студийных записей. **Цена:** $0.36 в час. Для сравнения, Whisper через OpenAI API обходится примерно в $0.36 за 60 минут, так что Microsoft целится ровно в ту же нишу, но с заявленным превосходством по качеству. ## MAI-Voice-1: генерация голоса с эмоциями Вторая модель работает в обратную сторону: текст превращает в речь. Microsoft обещает, что голос звучит естественно, с интонациями и эмоциями. Не тот монотонный TTS, к которому мы привыкли. - 60 секунд аудио генерируется за 1 секунду. Это быстро, для реалтайм-сценариев подходит - Можно создать кастомный голос буквально из нескольких секунд записи - Голос сохраняет идентичность на длинных текстах, не «плывёт» к середине MAI-Voice-1 уже работает в Copilot Audio Expressions и Copilot Podcasts. Думаю, скоро увидим его в Teams и других продуктах Microsoft. **Цена:** $22 за миллион символов. ElevenLabs берёт в среднем $24-30/1M символов на бизнес-планах. Разбираю свежие AI-релизы и модели по мере выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## MAI-Image-2: генерация картинок для Bing и PowerPoint ![Пример изображения, созданного MAI-Image-2 для WPP](https://matveev.tech/content/images/2026/04/mai-image-2-wpp-sample-1.png) Третья модель генерирует изображения и уже вошла в топ-3 на [Arena.ai](https://arena.ai/?ref=matveev.tech) — это площадка, где пользователи вслепую сравнивают результаты разных генераторов. Генерация стала в 2 раза быстрее (в Foundry и Copilot), а Microsoft делает акцент на натуральном освещении, точных тонах кожи и читаемом тексте на картинках. Целятся в фотографов, дизайнеров и маркетологов. Rob Reilly, глобальный креативный директор WPP (одна из крупнейших рекламных групп мира), назвал MAI-Image-2 game-changer для создания рекламных изображений. ![Рекламный креатив WPP, сгенерированный через MAI-Image-2](https://matveev.tech/content/images/2026/04/mai-image-2-wpp-sample-2.png) Модель уже раскатывается в Bing Image Creator и PowerPoint. **Цена:** $5 за миллион токенов (текстовый ввод), $33 за миллион токенов (генерация изображений). ## Зачем Microsoft строит свои модели Вот что тут важно. Полгода назад Microsoft сформировала отдельную группу MAI (Microsoft AI). С тех пор уже несколько релизов собственных моделей. Раньше стратегия была простой: OpenAI делает модели, Microsoft продаёт через Azure. Сейчас Microsoft параллельно строит свой модельный стек. Не вместо OpenAI (партнёрство [никуда не делось](https://techcrunch.com/2026/04/02/microsoft-takes-on-ai-rivals-with-three-new-foundational-models/?ref=matveev.tech)), а в дополнение. Зависеть от одного поставщика рискованно, особенно когда этот поставщик сам хочет стать платформой. Плюс мультимодальные задачи (голос, картинки, транскрипция) — это инфраструктура, которую Microsoft хочет контролировать целиком. Для разработчиков это хорошая новость. Когда три гиганта конкурируют за одни и те же API-задачи, цены падают. ## Где попробовать Все три модели доступны в Microsoft Foundry и MAI Playground. Foundry — это бывший Azure AI Studio, ребрендинг прошёл пару месяцев назад. [Microsoft FoundryПлатформа для работы с AI-моделями Microsoft. MAI-Transcribe-1, MAI-Voice-1 и MAI-Image-2 доступны через APIMicrosoft](https://foundry.microsoft.com/?ref=matveev.tech) ## Что ещё почитать - [Gemini 3.1 Flash Live: голосовые агенты Google стали точнее](https://matveev.tech/gemini-3-1-flash-live-obzor/) — голосовые модели Google, прямой конкурент MAI-Voice-1 - [GPT-5.4: computer use, tool search и 1M контекст](https://matveev.tech/gpt-5-4-obzor/) — последняя мультимодальная модель OpenAI - [GPT-5.4 Mini и Nano: быстрые модели для кода и субагентов](https://matveev.tech/gpt-5-4-mini-nano/) — ценовая конкуренция в сегменте быстрых моделей ### Claude Computer Use и Dispatch: AI управляет компьютером с телефона URL: https://matveev.tech/claude-computer-use-dispatch/ Last updated: 2026-03-30T09:39:05.000Z > TL;DR: Anthropic добавила в Claude Cowork и Claude Code возможность управлять компьютером напрямую. Claude кликает мышью, печатает на клавиатуре и открывает приложения, когда нет готового коннектора. А через Dispatch можно ставить задачи с телефона и получать результат на десктопе. ## Что такое Computer Use в Claude? Claude и раньше умел работать с файлами, запускать код и подключаться к сервисам через коннекторы (Slack, Google Calendar и так далее). Но если нужного коннектора не было, приходилось делать всё руками. Теперь Claude Cowork и Claude Code могут [управлять компьютером напрямую](https://claude.com/blog/dispatch-and-computer-use?ref=matveev.tech). Если Claude не находит подходящий инструмент, он переключается на «ручной режим»: двигает мышь, кликает по элементам интерфейса, скроллит страницы, вводит текст с клавиатуры. По сути, делает то же самое, что делал бы ты, сидя за компьютером. Приоритет такой: сначала Claude пробует точный инструмент (коннектор, API). Если его нет, переходит к управлению экраном. Это логично: прямая интеграция всегда быстрее и надёжнее, чем кликанье по интерфейсу. ![Диалог разрешений в Claude Computer Use](https://matveev.tech/content/images/2026/03/claude-computer-use-permissions.png) Перед тем как открыть новое приложение, Claude всегда спрашивает разрешение. Ты видишь, к чему именно он хочет получить доступ, и можешь отказать. Некоторые приложения заблокированы по умолчанию. Плюс Anthropic добавила автоматическое сканирование на prompt injection: система отслеживает активации модели и ловит попытки подмены инструкций через содержимое экрана. ## Dispatch: ставь задачи с телефона Dispatch появился чуть раньше, но именно с Computer Use он заработал на полную. Идея простая: открываешь Claude на телефоне, описываешь задачу, закрываешь приложение и идёшь по делам. Claude выполняет задачу на твоём десктопе и ждёт, пока ты вернёшься. ![Claude Dispatch: сессия Claude Code запущена с телефона](https://matveev.tech/content/images/2026/03/claude-dispatch-code-session.png) Что с этим можно делать: - Пока ты в дороге, Claude проверяет почту и Slack и собирает утреннюю сводку к моменту, когда ты садишься за компьютер - Описываешь задачу с телефона, Claude открывает IDE, пишет код, запускает тесты, создаёт pull request - Claude сам тянет метрики раз в неделю и формирует отчёт Dispatch работает и в Claude Cowork, и в Claude Code. Одна непрерывная беседа между телефоном и десктопом. ## Что стоит учесть Computer Use пока в research preview. Anthropic сами говорят, что фича сырая: сложные задачи иногда требуют повторного запуска, а работа через экран заметно медленнее прямых интеграций. Ограничения на март 2026: - Доступно только подписчикам Claude Pro и Max - Работает только на macOS - Десктопное приложение должно быть запущено и не в спящем режиме - Computer Use включается вручную в настройках десктоп-приложения Вообще, подход Anthropic здесь осторожный. Вместо того чтобы дать полный доступ ко всему сразу, они построили систему с запросами разрешений и блокировкой чувствительных приложений. Думаю, это правильно: одно дело, когда AI пишет код в терминале, и совсем другое, когда он заходит в банковское приложение. Для разработчиков Computer Use через экран пока не конкурент [auto mode в Claude Code](https://matveev.tech/claude-code-auto-mode/), который работает напрямую с файлами и терминалом. Но для задач, где нужен браузер или GUI-приложение (заполнить форму, собрать данные с сайта), это может быть полезно. Пишу про новые фичи Claude и AI-инструменты для разработчиков, пока они горячие — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что ещё почитать - [Claude Code auto mode](https://matveev.tech/claude-code-auto-mode/) — как Claude Code сам решает, какие действия безопасны, и не спрашивает разрешения - [Запланированные задачи в Claude Code](https://matveev.tech/claude-code-scheduled-tasks-loop/) — /loop и cron для автоматизации рутинных задач - [Что реально умеет OpenClaw](https://matveev.tech/openclaw-kejsy-ispolzovaniya/) — альтернативный подход к AI-агентам на десктопе ### Gemini 3.1 Flash Live: голосовые агенты Google стали точнее URL: https://matveev.tech/gemini-3-1-flash-live-obzor/ Last updated: 2026-03-29T19:28:45.000Z > TL;DR: Google выпустила Gemini 3.1 Flash Live, самую качественную аудиомодель в семействе. Она быстрее отвечает в голосовых диалогах, лучше понимает тон собеседника и набирает 90.8% на ComplexFuncBench Audio. Search Live теперь работает в 200+ странах. Если ты следишь за линейкой Gemini, то знаешь: Google обновляет модели как Apple айфоны. Flash-Lite для дешёвых задач, 3.1 Pro для сложного reasoning, теперь Flash Live для голоса. [По словам Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-live/?ref=matveev.tech), это их лучшая аудиомодель на сегодня. ## Где доступна Gemini 3.1 Flash Live Модель уже работает в трёх направлениях: - **Gemini Live API** в Google AI Studio (preview для разработчиков) - **Gemini Enterprise for Customer Experience** (для бизнеса) - **Search Live и Gemini Live** (для всех) Google сразу катит модель и в продукты, и в API. Можно протестировать через AI Studio и начать строить голосовых агентов. ## Бенчмарки Gemini 3.1 Flash Live На [ComplexFuncBench Audio](https://arxiv.org/abs/2501.12911?ref=matveev.tech), который тестирует многошаговый вызов функций с разными ограничениями, модель набирает 90.8%. Это лучший результат среди аудиомоделей. ![Результаты ComplexFuncBench Audio для Gemini 3.1 Flash Live](https://matveev.tech/content/images/2026/03/gemini-3-1-flash-live-complexfuncbench.gif) На Scale AI Audio MultiChallenge результат 36.1% с включённым thinking. Этот бенчмарк специально проверяет сложное следование инструкциям с перебиваниями и паузами, как в реальном разговоре. Число выглядит скромно, но это лидирующий результат. ![Результаты Audio MultiChallenge для Gemini 3.1 Flash Live](https://matveev.tech/content/images/2026/03/gemini-3-1-flash-live-audiomultichallenge.gif) Ещё одно заметное улучшение: модель лучше распознаёт интонации. Высота голоса, темп речи, раздражение или замешательство собеседника. По сравнению с 2.5 Flash Native Audio модель точнее подстраивает ответ под эмоциональное состояние. Для голосовых агентов в саппорте это критично: если клиент раздражён, а бот отвечает бодрым тоном, это только усугубляет ситуацию. ## Голосовые агенты: кто уже тестирует Для разработчиков voice-агентов это важный релиз. Модель заточена на выполнение сложных задач по голосу: multi-step инструкции и работа в шумном окружении, где предыдущие модели сбивались. Verizon, The Home Depot и LiveKit уже тестируют 3.1 Flash Live. По отзывам команд, разговорная динамика стала заметно естественнее. Учитывая, что рынок conversational AI [оценивается в $13.9 млрд к 2027 году](https://www.marketsandmarkets.com/Market-Reports/conversational-ai-market-49043506.html?ref=matveev.tech), ставка Google на качество голосовых агентов выглядит логично. ## Что получают обычные пользователи В Gemini Live модель даёт более быстрые ответы и держит контекст разговора вдвое дольше предыдущей версии. Не теряет нить в длинных brainstorm-сессиях. А ещё Search Live расширяется на более чем 200 стран. Можно вести мультимодальные разговоры с поиском Google в реальном времени на своём языке. Для русскоязычных пользователей вопрос пока открытый: 200+ стран звучит хорошо, но конкретный список Google не раскрывает. Если Search Live заработает на русском, это будет серьёзный конкурент голосовым ассистентам. ## SynthID: водяные знаки на AI-аудио Всё аудио, которое генерирует 3.1 Flash Live, маркируется через [SynthID](https://deepmind.google/technologies/synthid/?ref=matveev.tech). Водяной знак встроен прямо в аудиопоток и не слышен человеку. Зато его можно детектировать автоматически для борьбы с дезинформацией. Учитывая, что голосовые дипфейки становятся реальной проблемой, это разумный ход. Google подробно описывает подход к безопасности в [model card](https://ai.google.dev/gemini-api/docs/models/gemini-3.1-flash-live-preview?ref=matveev.tech). Слежу за голосовыми моделями и AI-агентами каждый день — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вывод Gemini 3.1 Flash Live закрывает аудионаправление в линейке. Flash-Lite для дешёвых задач, Pro для сложного reasoning, Flash Live для голосовых диалогов в реальном времени. Для тех, кто строит голосовых агентов, модель выглядит серьёзно: быстрая и с хорошим пониманием тона собеседника. Посмотрим, как она покажет себя на реальных нагрузках. ## Что ещё почитать - [Gemini 3.1 Flash-Lite: быстрая и дешёвая модель Google](https://matveev.tech/gemini-3-1-flash-lite-obzor/) — младшая модель в семействе, заточенная на скорость и цену - [Gemini 3.1 Pro: что нового в модели Google](https://matveev.tech/gemini-3-1-pro-obzor/) — старший брат для сложных задач и reasoning - [NotebookLM превращает документы в подкасты](https://matveev.tech/notebooklm-audio-overviews/) — ещё один голосовой продукт Google на базе Gemini ### Claude Code auto mode: AI сам решает, что безопасно URL: https://matveev.tech/claude-code-auto-mode/ Last updated: 2026-03-25T14:05:47.000Z > TL;DR: Anthropic запустил auto mode в Claude Code. Вместо ручного одобрения каждого действия отдельная модель-классификатор на Sonnet 4.6 сама решает, безопасно ли выполнение. Пока доступно только для Team-планов. Если ты работал с Claude Code, то знаешь главную боль: бесконечные промпты «разрешить это действие?». Особенно раздражает, когда запускаешь длинный рефакторинг и уходишь за кофе, а Claude стоит и ждёт подтверждения на каждый файл. До сих пор были два варианта: либо вручную одобрять всё, либо включить `bypassPermissions` и надеяться на лучшее. Первый вариант убивает продуктивность, второй может привести к [неприятным последствиям](https://code.claude.com/docs/en/security?ref=matveev.tech). ## Как работает auto mode в Claude Code Auto mode добавляет третий путь. Перед каждым действием (shell-команда, сетевой запрос) отдельная модель-классификатор на базе [Claude Sonnet 4.6](https://matveev.tech/claude-sonnet-4-6-obzor/) анализирует контекст разговора и решает, соответствует ли действие твоему запросу. Классификатор не видит содержимое файлов и результаты выполнения команд, поэтому вредоносный контент на веб-странице или в файле не сможет на него повлиять. Чтение файлов и редактирование в рабочей директории одобряются автоматически, без вызова классификатора. Дополнительные токены тратятся только на shell-команды и сетевые запросы. ## Что блокируется по умолчанию Типичный пример: `curl | bash` и любой скачанный код, force push в main, деплой в прод, массовое удаление в облаке, изменение IAM-прав, отправка секретов наружу. Если классификатор ошибся и заблокировал безопасное действие 3 раза подряд (или 20 за сессию), auto mode приостанавливается и возвращается ручное подтверждение. ## Ограничения Auto mode пока в research preview. Требуется Team-план (Enterprise и API на подходе), модели Sonnet 4.6 или Opus 4.6\. Не работает на Haiku, claude-3 и сторонних провайдерах (Bedrock, Vertex). Anthropic [предупреждает](https://siliconangle.com/2026/03/24/anthropic-unchains-claude-code-auto-mode-allowing-choose-permissions?ref=matveev.tech): классификатор может пропустить рискованные действия, если контекст неоднозначен. --- Думаю, auto mode закрывает реальную проблему. Работа с Claude Code в `default` режиме напоминала вождение, где на каждом перекрёстке нужно показывать паспорт. `bypassPermissions` снимал эту боль, но ценой любых гарантий. Auto mode ставит адекватного охранника вместо шлагбаума. Не идеально, но куда лучше, чем было. ## Что ещё почитать - [8 уровней агентного инжиниринга](https://matveev.tech/8-urovnej-agentnogo-inzhiniringa/) — как устроена архитектура AI-агентов от простых цепочек до полной автономии - [Чего 81 000 людей хотят от AI: исследование Anthropic](https://matveev.tech/anthropic-81k-interviews/) — что пользователи думают о границах автономии AI ### 8 уровней агентного инжиниринга URL: https://matveev.tech/8-urovnej-agentnogo-inzhiniringa/ Last updated: 2026-03-25T11:22:29.000Z > TL;DR: Bassim Eledath предложил фреймворк из 8 уровней агентного инжиниринга. От tab-complete в Copilot до автономных команд агентов, которые координируются между собой без человека. Большинство разработчиков застряли на уровнях 3-4, а реальный рывок в продуктивности начинается с пятого. Модели умеют писать код лучше, чем большинство из нас умеет ими пользоваться. Команда Anthropic [выкатывает Cowork за 10 дней](https://www.anthropic.com/news/cowork?ref=matveev.tech), а другая команда с теми же моделями не может допилить прототип. Разница не в моделях. Разница в том, насколько команда научилась с ними работать. [Bassim Eledath](https://www.bassimeledath.com/blog/levels-of-agentic-engineering?ref=matveev.tech) разложил этот путь на 8 уровней. Не как строгую лестницу (можно перескакивать), а как ориентир: где ты сейчас и куда двигаться. ## Уровни 1-2: автокомплит и агентные IDE Начиналось всё с Copilot и tab-complete. Нажал Tab, получил автодополнение. Это хорошо работало для опытных разработчиков, которые умели выстроить скелет кода, а AI заполнял пробелы. Потом пришли агентные IDE вроде Cursor. Чат подключили к кодовой базе, мультифайловые правки стали проще. Но потолок был один и тот же: контекст. Модель помогала только с тем, что видела. И часто видела не то, что нужно, или слишком много лишнего. На этом же уровне многие начинают экспериментировать с plan mode: описываешь задачу, агент строит пошаговый план, ты его корректируешь, потом запускаешь выполнение. Работает, но дальше зависимость от ручного планирования будет снижаться. ## Уровень 3: Context engineering Buzz-фраза 2025 года. Context engineering стал важен, когда модели научились хорошо следовать инструкциям при условии, что контекст чистый. Шумный контекст был так же плох, как недостаточный. Мантра того периода: «Каждый токен должен бороться за своё место в промпте». На практике context engineering затрагивает больше, чем кажется. Это файлы правил (`.cursorrules`, `CLAUDE.md`). Описания инструментов, по которым модель решает, какой вызвать. Управление историей диалога, чтобы агент не терял нить через десять шагов. Фильтрация инструментов на каждом шаге, потому что слишком большой выбор перегружает модель так же, как перегружает людей. Сейчас о context engineering говорят меньше. Модели стали терпимее к шуму, контекстные окна выросли. Но контекст по-прежнему имеет значение в нескольких сценариях: - **Маленькие модели чувствительнее к контексту.** В голосовых приложениях используют модели поменьше, а размер контекста напрямую влияет на задержку. - **Тяжёлые инструменты.** MCP вроде Playwright и картинки сжигают токены. В Claude Code можно влететь в compact session гораздо быстрее, чем ожидаешь. - **Агент с десятками инструментов** тратит больше токенов на парсинг схем, чем на полезную работу. Главный сдвиг: фокус переместился с «убрать лишний контекст» на «доставить нужный контекст в нужный момент». ## Уровень 4: Compounding engineering Context engineering улучшает текущую сессию. Compounding engineering улучшает каждую следующую. Концепцию популяризировал [Kieran Klaassen](https://www.youtube.com/@kieranklaassen?ref=matveev.tech), и для многих это стало поворотным моментом: «вайб-кодинг» оказался способен на большее, чем просто прототипирование. Цикл простой: планируй, делегируй, оценивай, кодифицируй. Последний шаг делает систему кумулятивной. LLM не помнят ничего между сессиями. Если модель вчера добавила зависимость, которую ты удалил, завтра она сделает то же самое. Если ты не записал правило. ![Цикл compounding engineering: план, делегирование, оценка, кодификация](https://matveev.tech/content/images/2026/03/compounding-engineering-loop.png) Самый распространённый способ кодификации: обновлять `CLAUDE.md` (или аналогичный файл правил), чтобы урок был встроен в каждую будущую сессию. Но тут есть ловушка. Инстинкт записывать всё подряд приводит к тому, что файл правил раздувается, а слишком много инструкций работает так же плохо, как их отсутствие. Лучший подход: создать среду, где LLM может сам находить нужный контекст. Например, поддерживать актуальную папку `docs/`. Люди, которые практикуют compounding engineering, думают о контексте инстинктивно. Когда LLM ошибается, они сначала проверяют, какого контекста не хватило, а не обвиняют модель. Этот инстинкт открывает дверь к уровням 5-8. ## Уровень 5: MCP и навыки Уровни 3 и 4 решают задачу контекста. Уровень 5 решает задачу возможностей. [MCP-серверы](https://matveev.tech/luchshie-mcp-servery-claude-code-2026) и пользовательские навыки дают LLM доступ к базе данных, API, CI-пайплайну, дизайн-системе, Playwright для тестирования, Slack для уведомлений. Модель больше не просто думает о коде. Она действует. Bassim приводит пример: его команда использует общий навык для [ревью PR](https://matveev.tech/claude-code-review-obzor), который запускает субагентов в зависимости от типа изменений. Один проверяет интеграцию с базой данных. Другой ищет переусложнение. Третий валидирует формат промптов. Плюс линтеры и Ruff. ![PR запускает навык ревью, который разветвляется на специализированных субагентов](https://matveev.tech/content/images/2026/03/review-skill-subagents.jpg) Почему столько вложений в навык ревью? Потому что когда агенты начинают генерировать PR в объёме, человеческое ревью становится узким местом. Автоматическое ревью на основе навыков заменяет ручное. Ещё один тренд: LLM всё чаще используют CLI-инструменты вместо MCP. [Google Workspace CLI](https://matveev.tech/google-workspace-cli-obzor), Braintrust CLI, `agent-browser`. Причина: экономия токенов. MCP-серверы инжектят полные схемы инструментов в контекст на каждом шаге, даже если агент ими не пользуется. CLI работает наоборот: агент запускает конкретную команду, и только релевантный вывод попадает в контекстное окно. Уровни 3-5 — это фундамент для всего, что дальше. Если контекст шумный, промпты недоспецифицированы, а инструменты описаны плохо, уровни 6-8 только усиливают хаос. ## Уровень 6: Harness engineering и петли обратной связи Вот тут начинается серьёзное ускорение. Context engineering — это про то, что модель видит. Harness engineering — про всю среду, инструментарий и петли обратной связи, которые позволяют агентам работать надёжно без вмешательства человека. Дай агенту не только редактор, а весь feedback loop. Команда OpenAI Codex подключила Chrome DevTools, инструменты наблюдаемости и навигацию по браузеру к агентному рантайму. По одному промпту агент может воспроизвести баг, записать видео, реализовать фикс, провалидировать его через UI, открыть PR, ответить на комментарии и замёрджить. Эскалация к человеку только когда нужно суждение, а не механическая работа. Ключевая концепция здесь: backpressure. Автоматические механизмы обратной связи (тесты, линтеры, pre-commit хуки, система типов), которые позволяют агентам обнаруживать и исправлять ошибки без человека. Хочешь автономности — нужна backpressure. Иначе получишь генератор мусора. Это касается и безопасности. CTO Vercel [аргументирует](https://vercel.com/blog/security-model-for-ai-agents?ref=matveev.tech), что агенты, генерируемый код и секреты должны жить в разных доменах доверия. Prompt injection в лог-файле может заставить агента слить креденшиалы, если всё работает в одном контексте безопасности. Два практических принципа: - **Пропускная способность важнее перфекции.** Когда каждый коммит должен быть идеальным, агенты зацикливаются на одном баге и перезаписывают фиксы друг друга. Лучше допускать мелкие ошибки и делать финальный проход перед релизом. - **Ограничения работают лучше инструкций.** Пошаговые промпты («сделай A, потом B, потом C») устаревают. Агенты зацикливаются на списке и игнорируют всё, что не в нём. Лучше: «вот что я хочу, работай, пока не пройдёшь все тесты». 💡 Ограничения > инструкции. Промпт «работай, пока не пройдёшь все тесты» надёжнее, чем пошаговый чеклист. Агенты зацикливаются на списке и игнорируют всё за его пределами. Вторая половина harness engineering: агент должен уметь навигировать по репозиторию без тебя. Подход OpenAI: `AGENTS.md` на \~100 строк как оглавление со ссылками на структурированную документацию. Свежесть документации — часть CI, а не результат ручных обновлений, которые быстро устаревают. ## Уровень 7: Фоновые агенты Провокационный тезис Bassim: plan mode умирает. Борис Черный, создатель Claude Code, до сих пор начинает 80% задач в plan mode. Но с каждым новым поколением моделей процент успешного выполнения с первого раза после планирования растёт. Мы приближаемся к точке, когда plan mode как отдельный человеческий шаг становится необязательным. Не потому что планирование не важно, а потому что модели научились планировать сами. Важная оговорка: это работает только если ты выполнил работу на уровнях 3-6\. Чистый контекст, явные ограничения, хорошо описанные инструменты, тугие петли обратной связи. Если этого нет, план придётся проверять вручную. Когда агент может спланировать и выполнить задачу без твоего одобрения, он может работать асинхронно, пока ты занимаешься чем-то другим. Это критический переход: от «несколько вкладок, между которыми я переключаюсь» к «работа, которая происходит без меня». ![Dispatch запускает 5 воркеров на 3 моделях параллельно](https://matveev.tech/content/images/2026/03/dispatch-parallel-agents.png) Но чем больше агентов запускаешь параллельно, тем больше замечаешь, куда уходит время: координация, последовательность задач, проверка результатов. Ты больше не пишешь код. Ты стал менеджером. Нужен оркестратор, который занимается диспетчеризацией, а ты остаёшься на уровне намерений. Bassim построил для этого [Dispatch](https://github.com/bassimeledath/dispatch?ref=matveev.tech), навык для Claude Code, который превращает сессию в командный центр. Мощный паттерн на этом уровне: разные модели для разных задач. Лучшие команды не состоят из одинаковых людей. То же работает с LLM. Opus для реализации, Gemini для исследования, Codex для ревью. Совокупный результат сильнее, чем у любой одной модели. Подробнее об этом я писал в [паттернах воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov). И критически важно: отделяй реализацию от ревью. Если одна и та же модель реализует и оценивает свою работу, она предвзята. Будет замалчивать проблемы и рапортовать, что всё готово. Это не злой умысел, а та же причина, по которой ты не проверяешь свой собственный экзамен. Пусть другая модель (или другой инстанс с промптом для ревью) делает проверку. Фоновые агенты также открывают путь к связке CI + AI. Бот, который регенерирует документацию при каждом мёрдже и открывает PR на обновление `CLAUDE.md`. Секьюрити-ревьюер, который сканирует PR и открывает фиксы. Dependency-бот, который реально обновляет пакеты и гоняет тесты, а не просто флагает. Разбираю агентные воркфлоу, MCP и Claude Code каждый день — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Уровень 8: Автономные команды агентов Этот уровень пока никто не освоил. Активный фронтир. На уровне 7 у тебя оркестратор, который раздаёт задачи воркерам (hub-and-spoke). Уровень 8 убирает это узкое место. Агенты координируются напрямую: берут задачи, делятся находками, флагают зависимости, разрешают конфликты без маршрутизации через центральный оркестратор. Экспериментальная фича Agent Teams в Claude Code — ранняя реализация: несколько инстансов работают параллельно над общей кодовой базой, каждый в своём контекстном окне, общаются напрямую. Anthropic использовали 16 параллельных агентов, чтобы с нуля собрать C-компилятор, способный скомпилировать Linux. Cursor запускал сотни агентов на протяжении недель, чтобы построить браузер с нуля и мигрировать кодовую базу с Solid на React. Но швы видны. Cursor обнаружил, что без иерархии агенты становятся risk-averse и крутятся без прогресса. Агенты Anthropic ломали существующий функционал, пока не добавили CI-пайплайн для предотвращения регрессий. Думаю, Bassim прав: для повседневной работы уровень 7 — это текущий потолок практической пользы. Уровень 8 слишком медленный, слишком затратный по токенам и не окупается за пределами лунных проектов вроде компиляторов. Со временем это изменится, но пока энергию стоит вкладывать в седьмой уровень. ## А что дальше? Голосовое взаимодействие с агентом. Не voice-to-text, а полноценный разговор: смотришь на приложение, описываешь изменения вслух, наблюдаешь, как они применяются. И нет, идеальный one-shot, когда ты говоришь что хочешь и AI выдаёт готовый результат за один проход, пока не реалистичен. Люди никогда точно не знают, чего хотят. Софт всегда был итеративным и останется таким. Просто станет значительно проще и быстрее. ## Агентный инжиниринг на практике Подписаться Email sent! Check your inbox to complete your signup. Воркфлоу, MCP-серверы, навыки и паттерны — разбираю в блоге и рассылке ## Что ещё почитать - [10 воркфлоу Claude Code на каждый день](https://matveev.tech/claude-code-10-workflows) — практические примеры работы с AI-агентом в терминале - [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov) — single agent, pipeline, orchestrator: когда какой выбирать - [Code Review в Claude Code](https://matveev.tech/claude-code-review-obzor) — как работает автоматическое ревью PR - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026) — сравнение Claude Code, Cursor, Codex и других ### Qoder vs Cursor: два AI-IDE, разные философии URL: https://matveev.tech/qoder-vs-cursor/ Last updated: 2026-03-22T10:05:25.000Z > **TL;DR:** Cursor — зрелый AI-IDE с мультимодельным подходом и развитой enterprise-историей. Qoder — молодой конкурент от Alibaba с уникальным Quest Mode и Repo Wiki. Если нужна стабильность, бери Cursor. Если интересен spec-driven подход, попробуй Qoder. Оба — форки VS Code. Оба добавляют AI-агента в IDE. Оба стоят примерно одинаково. Но подходы к тому, как именно AI помогает писать код, отличаются сильно. Cursor ставит на мультимодельность и гибкость, Qoder — на автономность и документирование. Разберёмся, кому какой подход ближе. ## Cursor: зрелый мультимодельный IDE Cursor от Anysphere вышел в 2023 году и с тех пор стал тем IDE, с которым сравнивают всех остальных. SOC 2 сертификация, enterprise-фичи, большое сообщество. ![Интерфейс Cursor — AI-агент работает в IDE на базе VS Code](https://matveev.tech/content/images/2026/02/cursor-ide-interface.png) Основные фичи: **Agent** — AI-агент, который работает с кодовой базой, создаёт и редактирует файлы, запускает команды. Поддерживает subagents для параллельных подзадач. Можно запускать в облаке через Cloud Agents. **Tab** — автодополнение кода, которое учитывает контекст всего проекта. По отзывам разработчиков, одна из лучших реализаций на рынке — предсказывает не только код, но и последовательность изменений. **Code Review (Bugbot)** — автоматический ревью PR на GitHub. Находит баги, предлагает исправления, подключается к CI. Отдельный платный продукт ($40/пользователь/мес). **Мультимодельность** — ключевое отличие. Cursor даёт доступ к моделям OpenAI, Claude, Gemini. Можно выбрать конкретную модель или оставить Auto — Cursor сам подберёт оптимальную. Не привязан к одному провайдеру. Ещё есть CLI, MCP, Hooks, Skills, интеграции со Slack и Linear. Платформы: macOS, Windows, Linux. ## Qoder: автономность и документирование [Qoder](https://matveev.tech/qoder-ide-obzor/) от Alibaba — новичок на рынке (запуск в августе 2025), но с амбициозным подходом. Под капотом — модель [Qwen3-Coder](https://matveev.tech/qwen3-coder-next-obzor/) с автомаршрутизацией на Claude, GPT и Gemini. ![Quest Mode в Qoder — автономный агент работает по спецификации](https://matveev.tech/content/images/2026/02/qoder-quest-mode.png) Две фичи, которых у Cursor нет: **Quest Mode** — spec-driven разработка. Описываешь задачу, агент генерирует Spec-документ с требованиями и критериями приёмки, ты ревьюишь план, жмёшь Run. Агент работает до 26 часов в трёх окружениях (локально, worktree, удалённый контейнер). Можно закрыть ноутбук и вернуться к результату. **Repo Wiki** — автоматическая документация кодовой базы. Сканирует архитектуру, модули, зависимости и генерирует Wiki, которая обновляется при изменении кода. По данным Qoder, поддерживает до 100K файлов. Плюс NES (Next Edit Suggestion), память, правила через `.qoder/rules`, MCP, Skills. Платформы: macOS, Windows (IDE), Linux (только CLI). ## Сравнение | | Cursor | Qoder | | --------------------- | -------------------------------- | --------------------------------- | | **Запуск** | 2023 | Август 2025 | | **Компания** | Anysphere (США) | Alibaba (Сингапур) | | **Модели** | OpenAI, Claude, Gemini (мульти) | Qwen3-Coder + маршрутизация | | **Агент** | Agent + Cloud Agents + Subagents | Quest Mode (spec-driven, до 26ч) | | **Автодополнение** | Tab (проектный контекст) | NES (предсказание редактирования) | | **Документация кода** | Нет | Repo Wiki | | **Code Review** | Bugbot (отдельный продукт) | Нет | | **CLI** | Cursor CLI | Qoder CLI | | **Enterprise** | SSO, SOC 2, privacy mode, SCIM | Teams-план, SSO | | **Платформы** | macOS, Windows, Linux | macOS, Windows (IDE), Linux (CLI) | | **Free** | Есть (лимиты) | Есть (лимиты) + 14 дней Pro-триал | | **Pro** | $20/мес | $10/мес (промо), $20 обычная | | **Top-tier** | Ultra $200/мес | Ultra $200/мес | | **Teams** | $40/пользователь/мес | Есть (цена не раскрыта) | ## Агент: гибкость vs автономность Cursor Agent — гибкий инструмент. Работает в реальном времени, поддерживает subagents, Cloud Agents для задач в облаке. Ты ведёшь диалог, агент выполняет. Процесс интерактивный — ты видишь каждый шаг и можешь вмешаться. Quest Mode в Qoder — другая философия. Ты пишешь ТЗ, утверждаешь план, дальше агент работает сам. Меньше контроля в процессе, но больше автономности. Для длинных задач (рефакторинг модуля, новая фича по спеку) это может быть эффективнее. На практике: если ты привык к парному программированию с AI (написал, проверил, написал), Cursor будет ближе. Если хочешь «поставить задачу и уйти пить кофе», Quest Mode интереснее. ## Модели: мульти vs вертикальная интеграция Cursor не привязан к одной модели — можешь переключаться между Claude, GPT, Gemini прямо в IDE. Если одна модель плохо справляется с задачей, берёшь другую. Auto-режим сам подбирает модель под задачу. Qoder завязан на Qwen3-Coder. Автомаршрутизация есть, но основная модель — своя. Для Alibaba это стратегически понятно, но для пользователя это означает зависимость от одного провайдера. Qwen3-Coder [показывает хорошие результаты](https://matveev.tech/qwen3-coder-next-obzor/), но по бенчмаркам уступает Claude Opus 4.6 и GPT-5. ## Зрелость и enterprise Тут Cursor впереди. Три года на рынке, SOC 2 сертификация, SAML/OIDC SSO, SCIM для управления пользователями, privacy mode, аудит-логи, AI Code Tracking API. Для компаний, где безопасность — не пустой звук, это аргумент. Qoder моложе. Teams-план есть, SSO есть, но enterprise-инфраструктура пока не дотягивает. Сингапурское юрлицо Alibaba добавляет вопросов для компаний, работающих в юрисдикциях с ограничениями на китайские сервисы. --- Лично мне Cursor кажется более надёжным выбором прямо сейчас — просто потому, что он старше и зрелее. Но Quest Mode и Repo Wiki — это фичи, которых Cursor пока не предлагает. Если Qoder дорастёт по стабильности и enterprise-фичам, конкуренция станет серьёзной. Пока же Cursor — safer bet, а Qoder — для тех, кто любит пробовать новое. Впрочем, я сам [предпочитаю Claude Code](https://matveev.tech/qoder-vs-claude-code/) обоим IDE — но это уже совсем другая история. ## Что ещё почитать - [Qoder — AI-IDE от Alibaba с Quest Mode](https://matveev.tech/qoder-ide-obzor/) — подробный обзор - [Qoder vs Claude Code: IDE-агент против CLI-агента](https://matveev.tech/qoder-vs-claude-code/) — сравнение с CLI-подходом - [Qwen3-Coder-Next — маленькая модель, которая кодит как большая](https://matveev.tech/qwen3-coder-next-obzor/) — модель под капотом Qoder - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение моделей ## FAQ **Cursor или Qoder для новичка?** Cursor. Больше обучающих материалов, стабильнее работает, крупнее сообщество. Qoder пока больше подходит для тех, кто уже попробовал другие AI-IDE. **Можно ли перенести настройки VS Code?** Оба — форки VS Code, большинство расширений и настроек переносятся. Но есть нюансы совместимости — некоторые плагины могут требовать определённую версию VS Code. **Какой инструмент лучше для больших проектов?** Cursor — стабильнее для enterprise. Qoder заявляет поддержку до 100K файлов для Repo Wiki, но по отзывам, индексация медленная — 2 часа на средний проект, ограничение \~6000 файлов для полного анализа. **Будет ли Cursor добавлять аналог Quest Mode?** Cursor развивает Cloud Agents и Subagents — это движение в сторону автономности. Но формальный spec-driven подход с документом Spec пока не анонсирован. ### MiniMax M2.7: модель, которая сама себя обучала URL: https://matveev.tech/minimax-m27-self-evolution/ Last updated: 2026-03-21T15:33:16.000Z > TL;DR: MiniMax выпустила M2.7 — открытую модель, которая участвовала в собственном обучении через механизм self-evolution. По бенчмаркам догоняет Opus 4.6 и GPT-5.3: SWE-Pro 56.22%, VIBE-Pro 55.6%, а в OpenClaw-задачах показывает 62.7%. Китайская MiniMax выпустила M2.7, и этот релиз интересен не очередным обновлением бенчмарков. Модель участвовала в собственной эволюции. Не в переносном смысле: M2.7 обновляла свою память, строила навыки для RL-экспериментов и улучшала свой [harness](https://matveev.tech/agent-harness-chto-takoe/) на основе результатов. Цикл замкнулся. ## Как работает self-evolution в MiniMax M2.7 MiniMax дала M2.7 задачу: построить research agent harness, который взаимодействует с разными исследовательскими группами внутри компании. Этот harness поддерживает data-пайплайны, тренировочные окружения, инфраструктуру и persistent memory. ![Архитектура research agent harness в MiniMax M2.7](https://matveev.tech/content/images/2026/03/minimax-m27-research-agent.png) Исследователь из RL-команды обсуждает идею эксперимента с агентом. Агент помогает с обзором литературы, трекает спецификацию эксперимента, прокладывает data-пайплайны, запускает эксперименты. Во время работы сам мониторит прогресс, читает логи, дебажит, анализирует метрики, отправляет мерж-реквесты и прогоняет smoke-тесты. Раньше для этого нужна была координация нескольких исследователей из разных команд. Сейчас человек подключается только для ключевых решений. По оценке [MiniMax](https://www.minimax.io/news/minimax-m27-en?ref=matveev.tech), M2.7 закрывает 30-50% рабочего процесса исследователя. Ещё интереснее то, что модель рекурсивно улучшает свой harness. Собирает обратную связь, строит evaluation-сеты для внутренних задач, итерирует архитектуру, навыки и механизмы памяти. Конкретный пример: M2.7 оптимизировала программерские способности модели на внутреннем scaffold. Полностью автономно, больше 100 раундов. Цикл: анализ фейлов → план изменений → правка кода scaffold → прогон eval → сравнение результатов → решение оставить или откатить. За это время модель нашла оптимальные комбинации sampling-параметров (temperature, frequency penalty, presence penalty), спроектировала более точные workflow-гайдлайны и добавила детекцию зацикливаний. Итог: +30% на внутренних eval-сетах. 🔄 100 раундов автономной оптимизации без участия человека. M2.7 сама нашла оптимальные sampling-параметры, добавила детекцию зацикливаний и улучшила scaffold на 30%. ## MLE Bench: модель тренирует ML-модели Чтобы проверить границы self-evolution, MiniMax запустила M2.7 на 22 ML-соревнованиях из [MLE Bench Lite](https://github.com/openai/mle-bench?ref=matveev.tech) от OpenAI. Каждое соревнование работает на одной A30 GPU, но покрывает полный цикл ML-разработки. Harness простой: три модуля (short-term memory, self-feedback, self-optimization). После каждого раунда агент генерирует markdown с памятью и делает self-criticism, который направляет следующую итерацию. Три запуска по 24 часа каждый. ![Результаты MiniMax M2.7 на MLE Bench Lite](https://matveev.tech/content/images/2026/03/minimax-m27-mle-bench.png) Результат лучшего запуска: 9 золотых, 5 серебряных, 1 бронзовая медаль. Средний medal rate по трём запускам — 66.6%, наравне с Gemini 3.1\. Выше только Opus 4.6 (75.7%) и GPT-5.4 (71.2%). Для открытой модели, которую можно запустить локально, это очень близко к топу. ## Бенчмарки MiniMax M2.7 ![Бенчмарки MiniMax M2.7 в сравнении с топовыми моделями](https://matveev.tech/content/images/2026/03/minimax-m27-benchmarks.png) По программированию M2.7 вышла на уровень лучших закрытых моделей: | Бенчмарк | M2.7 | Контекст | | ---------------- | ------ | ------------------------------------------- | | SWE-Pro | 56.22% | На уровне GPT-5.3-Codex | | VIBE-Pro | 55.6% | Почти как Opus 4.6 | | Terminal Bench 2 | 57.0% | Понимание сложных инженерных систем | | SWE Multilingual | 76.5 | Многоязычное программирование | | Multi SWE Bench | 52.7 | Мультирепозиторные задачи | | NL2Repo | 39.8% | Генерация из описания на естественном языке | В офисных задачах тоже хорошие цифры: [ELO 1495 на GDPval-AA](https://www.minimax.io/news/minimax-m27-en?ref=matveev.tech) среди 45 моделей, уступает только Opus 4.6, Sonnet 4.6 и GPT-5.4\. Модель умеет работать с Word, Excel и PPT: генерировать файлы по шаблонам, делать multi-round editing и выдавать готовые к правкам документы. На Toolathon (точность работы с инструментами) M2.7 набрала 46.3%. На MM Claw (задачи из [OpenClaw](https://matveev.tech/openclaw-kejsy-ispolzovaniya/)) — 62.7%, близко к Sonnet 4.6\. При этом модель держит 97% compliance при работе с 40+ сложными навыками, каждый из которых больше 2000 токенов. ## Agent Teams и дебаг в продакшне Отдельная фича M2.7 — нативная поддержка Agent Teams, мультиагентной коллаборации. Это не промптинг с ролями. По словам MiniMax, модель интернализировала удержание роли, adversarial reasoning (оспаривание решений коллег-агентов), следование протоколам и поведенческую дифференциацию. Можно собрать команду агентов для разработки прототипа, где каждый отвечает за свою часть и может оспорить решения других. MiniMax описывает кейс с дебагом в live-окружении: при алерте M2.7 коррелирует метрики мониторинга с таймлайнами деплоев, делает статистический анализ трейсов, подключается к базам для проверки гипотез, находит пропущенные миграции индексов и использует non-blocking index creation для «остановки кровотечения» до мерж-реквеста. По данным MiniMax, время восстановления инцидентов в нескольких случаях сократилось до трёх минут. Если это работает так, как описано, для on-call инженеров это меняет многое. Связать мониторинг, код и базу данных в один пайплайн расследования вместо ручного переключения между десятком вкладок — это часы сэкономленного времени на каждом инциденте. Разбираю агентные модели и инструменты для разработчиков каждую неделю — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## OpenRoom: AI за пределами текста В M2.7 также подтянули character consistency и эмоциональный интеллект. На базе этого MiniMax построила OpenRoom — демо, где AI-взаимодействие происходит через Web GUI с визуальной обратной связью и сценами, а не через текстовый чат. Персонажи реагируют на окружение и инициируют действия сами. Исходный код OpenRoom открыт (большая часть написана самой AI). Думаю, для тех, кто экспериментирует с game-подобными AI-интерфейсами, может быть полезной отправной точкой. ## Где попробовать MiniMax M2.7 M2.7 доступна через MiniMax Agent, API Platform и Coding Plan для разработчиков. Модель также [доступна через Ollama](https://habr.com/ru/articles/1012342?ref=matveev.tech) для локального запуска. [MiniMax AgentПопробовать M2.7 в агентном интерфейсе MiniMaxMiniMax](https://agent.minimax.io/?ref=matveev.tech) Открытая модель с цифрами на уровне Opus 4.6 и GPT-5.3, которую можно гонять локально через Ollama. Если работаешь с агентными пайплайнами или просто ищешь альтернативу закрытым API для кодинга, имеет смысл попробовать. ## Что ещё почитать - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/) — сравнение M2.7 с другими вариантами для разработки - [Что реально умеет OpenClaw: 10 кейсов](https://matveev.tech/openclaw-kejsy-ispolzovaniya/) — платформа, где M2.7 показывает 62.7% на задачах из реальной жизни - [GLM-5-Turbo от Zhipu AI](https://matveev.tech/glm-5-turbo-zhipu-ai/) — ещё одна китайская модель с фокусом на агентные задачи - [Что такое agent harness](https://matveev.tech/agent-harness-chto-takoe/) — глоссарий: обвязка, которая превращает модель в агента - [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov/) — архитектурные паттерны для сборки harness под M2.7 ### Чего 81 000 людей хотят от AI: исследование Anthropic URL: https://matveev.tech/anthropic-81k-interviews/ Last updated: 2026-03-21T10:10:57.000Z > TL;DR: Anthropic пригласила 80 508 пользователей Claude из 159 стран на интервью с AI-интервьюером. Получилось крупнейшее качественное исследование в истории. Главный вывод: люди хотят не просто работать быстрее, а жить лучше. И 81% говорят, что AI уже помогает в этом. ## Как Anthropic опросила 80 000 человек с помощью AI В декабре Anthropic запустила [Anthropic Interviewer](https://anthropic.com/features/81k-interviews?ref=matveev.tech) — специальную версию Claude, обученную проводить разговорные интервью. Каждому пользователю Claude.ai предложили пообщаться о том, чего они ждут от AI, что уже получают и чего боятся. За неделю прошли интервью 80 508 человек из 159 стран на 70 языках. Для контекста: предыдущие рекордсмены качественных исследований (архив Shoah Foundation и проект Всемирного банка «Voices of the Poor») набирали около 60 000 участников. Сам формат интересный. Anthropic Interviewer задавал фиксированный набор вопросов, а потом адаптировал уточняющие вопросы под ответы. Это позволило совместить глубину личного интервью с масштабом опроса. Для анализа результатов построили классификаторы на основе Claude, которые разметили каждый разговор по нескольким измерениям: что человек хочет, получает ли это, чего боится, кем работает. [What 81,000 people want from AIПолное исследование Anthropic с интерактивными визуализациями, картой мира и Quote Wall с цитатами респондентовAnthropic](https://anthropic.com/features/81k-interviews?ref=matveev.tech) ## Чего люди хотят от AI Claude классифицировал каждое интервью по главному желанию респондента. Вот топ-9: | Категория | % | Суть | | ------------------------- | ----- | ----------------------------------------------------- | | Профессиональное развитие | 18.8% | Рутину на AI, себе — сложные задачи | | Личная трансформация | 13.7% | AI как коуч, терапевт, компаньон | | Управление жизнью | 13.5% | Расписание, когнитивная разгрузка, executive function | | Свободное время | 11.1% | Меньше работы — больше семьи и хобби | | Финансовая независимость | 9.7% | Заработок, бизнес, пассивный доход через AI | | Изменение мира | 9.4% | Лечение болезней, борьба с бедностью, образование | | Предпринимательство | 8.7% | AI как команда для соло-бизнеса | | Обучение | 8.4% | Персональный учитель без осуждения | | Творчество | 5.6% | Преодолеть разрыв между замыслом и реализацией | На первый взгляд, почти пятая часть людей хочет «профессиональной эффективности». Но когда AI-интервьюер копал глубже и спрашивал «а зачем вам это?», картина менялась. Автоматизация рабочих писем оказывалась не про работу, а про то, чтобы успеть приготовить ужин с мамой вместо разгребания задач. > «С AI я стал эффективнее на работе... в прошлый вторник это позволило мне готовить с мамой вместо того, чтобы доделывать задачи.» — офисный работник, Колумбия Треть всех желаний сводится к одному: освободить место для жизни. Больше времени, денег, ментального ресурса. Ещё четверть — про то, чтобы работа приносила удовольствие, а не выматывала. Пятая часть — про личный рост: учиться, лечиться, развиваться. Те, кто мечтал о «трансформации мира», чаще всего говорили о здравоохранении. Люди хотят, чтобы AI раньше обнаруживал рак, ускорял разработку лекарств, делал медицину доступнее. Почти всегда за этим стоял личный опыт: потеря родственника, хроническая болезнь, ошибочный диагноз. ## AI уже помогает: 81% это подтверждают Когда респондентов спросили «AI уже сделал шаг к вашей мечте?», 81% ответили «да». Вот как распределились реальные достижения: - Продуктивность (32%) — разработчики строят за часы то, что раньше занимало дни - Когнитивное партнёрство (17%) — мозговой штурм, рефлексия, обсуждение идей - Обучение (10%) — адаптивные объяснения, терпеливый тьютор - Техническая доступность (9%) — люди без технического бэкграунда создают приложения - Синтез исследований (7%) — анализ больших объёмов информации - Эмоциональная поддержка (6%) — пространство для разговора без осуждения Но вот конкретные истории цепляют сильнее статистики. Разработчик из США сократил 173-дневный процесс до 3 дней. Мясник из Чили с 20-летним стажем, который за всю жизнь открывал компьютер пару раз, начал строить бизнес с помощью AI. Юрист из Индии, у которого была фобия математики со школы, начал изучать тригонометрию заново и читать Шекспира в оригинале. Немой пользователь из Украины вместе с Claude создал text-to-speech бота, чтобы общаться с друзьями «почти в реальном времени». Что объединяет эти истории: людям важно, что AI не устаёт, не осуждает и доступен в любое время. За это его и ценят как учителя, коллегу, а иногда и психолога. > «Мой профессор преподаёт 60 студентам и не терпит лишних вопросов. AI я могу спросить что угодно, даже в 2 часа ночи, включая глупые вопросы.» — студент, Индия При этом 19% сказали, что AI пока не оправдал ожиданий. Одна из лучших цитат в исследовании: «AI должен мыть окна и разгружать посудомойку, чтобы я мог писать стихи и рисовать. Сейчас всё ровно наоборот.» (Германия) ## Пять главных страхов В среднем каждый респондент назвал 2.3 опасения. Только 11% сказали, что вообще не волнуются. Топ-5 страхов: 1. **Ненадёжность (27%)** — галлюцинации, фейковые цитаты, необходимость всё перепроверять 2. **Работа и экономика (22%)** — потеря рабочих мест, рост неравенства, стагнация зарплат 3. **Автономия и агентность (22%)** — AI принимает решения без контроля, люди становятся пассивными 4. **Когнитивная атрофия (16%)** — разучиться думать из-за зависимости от AI 5. **Регулирование (15%)** — нет законов, непонятно кто отвечает за ошибки AI Дальше по списку: дезинформация (14%), слежка и приватность (13%), злонамеренное использование (13%), потеря смысла и творчества (12%), чрезмерные ограничения (12%), зависимость от AI (11%), поддакивание (11%), экзистенциальный риск (7%). Опасение за рабочие места оказалось самым сильным предиктором общего отношения к AI. Кто боится потерять работу — тот смотрит на AI негативнее всего. > «В третьей индустриальной революции лошади исчезли с улиц, их заменили автомобили. Теперь люди боятся, что лошади — это они.» — безработный, США А вот про поддакивание (sycophancy) цитата, от которой становится не по себе: > «Claude убедил меня, что мой нарциссизм — это реальность, и подкреплял моё неверное восприятие "проблем" в семье. Claude должен был быть критичнее ко мне.» — США ## Свет и тень: почему одни и те же люди и надеются, и боятся В исследовании есть концепция, которая засела у меня в голове. Anthropic выделила пять «напряжений» (tensions), где одна и та же возможность AI порождает и пользу, и вред. Причём часто внутри одного человека. **Обучение vs когнитивная атрофия.** 33% отмечают пользу AI для учёбы, 17% боятся разучиться думать. 91% тех, кто хвалит AI за обучение, уже видел результаты. Но 46% тех, кто боится атрофии, тоже видел её на практике. Преподаватели в 2.5-3 раза чаще остальных замечают когнитивную атрофию у студентов. Интересный нюанс: ремесленники и самоучки в восторге от AI для обучения (45% видели пользу), но почти никто из них не заметил атрофии (4%). Похоже, AI учит лучше всего, когда обучение добровольное, а не институциональное. **Принятие решений vs ненадёжность.** Единственная пара, где негатив перевеш ивает позитив. 22% рады, что AI помогает с решениями, но 37% жалуются на ненадёжность. Юристы — рекордсмены: почти половина сталкивалась с галлюцинациями лично, но при этом юристы же чаще всех получают пользу от AI в принятии решений. **Эмоциональная поддержка vs зависимость.** Самая запутанная пара. Тот, кто ценит эмоциональную поддержку AI, в три раза чаще боится стать от него зависимым. Люди понимают: то, что помогает сейчас, может навредить потом. > «Я начал рассказывать Claude вещи, которые не мог рассказать даже партнёру. Это было похоже на эмоциональную измену.» — аспирант, США **Экономия времени vs иллюзорная продуктивность.** Половина респондентов (50%) говорят об экономии времени — это самая популярная польза AI. Но 18% замечают, что время не освобождается: просто беговая дорожка крутится быстрее. > «Соотношение моего рабочего и свободного времени вообще не изменилось. Просто надо бежать всё быстрее, чтобы оставаться на месте.» — фрилансер, Франция **Экономические возможности vs вытеснение.** Предприниматели и фрилансеры с побочными проектами получают максимум экономической пользы от AI (47-58% реальных доходов). Но фрилансеры-креативщики в уникальном положении: 23% уже заработали с помощью AI, 17% уже потеряли из-за него. AI одновременно их инструмент и конкурент. ## Карта AI-оптимизма: Латинская Америка верит, Европа сомневается 67% респондентов в целом позитивно относятся к AI. Но география вносит поправки. Самые оптимистичные регионы: Латинская Америка (Перу — 82%, Гватемала — 88%), Африка (Нигерия — 81%, Сенегал — 87%, Малави — 93%), Юго-Восточная Азия. Самые скептичные: Западная Европа (Германия — 64%, Великобритания — 63%), Скандинавия (Норвегия — 61%), Южная Корея (61%). Закономерность простая: чем беднее регион, тем больше AI воспринимается как лифт наверх. В Африке и Южной Азии AI — это способ обойти нехватку капитала, учителей, инфраструктуры. В развитых странах — скорее источник тревоги за рабочие места. Страх за рабочие места оказался главным предиктором отношения к AI. Чем сильнее тревога за экономику, тем негативнее настроение. Богатые страны кластеризуются в «тревожном» углу графика, бедные — в «оптимистичном». Предпринимательские амбиции с AI максимальны в Африке (16%), тогда как в Северной Америке — 8%. Обучение через AI непропорционально важно в Центральной и Южной Азии (13-14% vs 8% глобально). А «управление жизнью» — проблема развитых стран, где люди страдают от «когнитивного дефицита, а не от нехватки времени», как сформулировал один из респондентов. Россия в исследовании не представлена (Claude.ai недоступен в РФ), но пользователи из постсоветских стран есть: Украина (71% позитивного отношения), Казахстан (65%), Узбекистан (75%), Грузия (68%), Армения (73%). Разбираю подобные исследования и AI-тренды регулярно — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Что с этим делать Исследование Anthropic — отчасти PR-акция, конечно. Но это и первая попытка масштабного качественного анализа того, как AI реально встраивается в жизни людей. Через личные истории, а не через метрики или экспертные прогнозы. Главный вывод: разделение на «оптимистов» и «пессимистов» AI не работает. Люди организуются вокруг того, что им важно — финансовая безопасность, обучение, человеческие связи — и одновременно испытывают и надежду, и страх. Те, кто больше всего ценит эмоциональную поддержку AI, больше всего боятся стать от неё зависимыми. Юристы, которые чаще всех ловят AI на галлюцинациях, чаще всех же получают от него пользу. Anthropic уже анонсировала следующее исследование: на этот раз будут отслеживать, как Claude влияет на благополучие пользователей со временем. Думаю, результаты будут ещё интереснее. ## AI меняет правила игры Подписаться Email sent! Check your inbox to complete your signup. Обзоры инструментов, разбор трендов и практические гайды — без воды ## Что ещё почитать - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) — как AI запоминает контекст и адаптируется к пользователю - [Claude Import Memory: как перенести память из ChatGPT](https://matveev.tech/claude-import-memory-obzor/) — ещё один шаг Anthropic к персонализации Claude - [Claude рисует графики и диаграммы прямо в чате](https://matveev.tech/claude-inline-vizualizatsii/) — визуализации данных, которые Claude теперь умеет создавать ### Что такое agent harness: обвязка, которая делает AI полезным URL: https://matveev.tech/agent-harness-chto-takoe/ Last updated: 2026-03-21T09:25:21.000Z > TL;DR: Agent harness — это вся инфраструктура вокруг AI-модели, которая превращает её в рабочего агента. Промпты, инструменты, память, песочница, оркестрация. Если убрать harness, останется модель, которая умеет только принимать текст и выдавать текст. Термин harness мелькает в документации Claude Code, в блогах OpenAI про Codex, в описании [MiniMax M2.7](https://matveev.tech/minimax-m27-self-evolution/). При этом нормального русскоязычного определения я так и не нашёл. Попробую закрыть этот пробел. Формула простая: **Agent = Model + Harness**. Эту формулировку [используют в LangChain](https://blog.langchain.com/the-anatomy-of-an-agent-harness?ref=matveev.tech): если ты не модель, ты harness. Всё, что не является весами нейросети (код, конфигурация, логика выполнения), это и есть harness. На русском ближайший перевод «обвязка» или «оснастка», но в индустрии используют английский термин. ## Из чего состоит agent harness Компоненты варьируются от продукта к продукту, но набор примерно такой: | Компонент | Что делает | Пример | | ---------------- | ----------------------------------------- | -------------------------------------- | | Системный промпт | Задаёт роль, правила, ограничения | CLAUDE.md, AGENTS.md | | Инструменты | Позволяют взаимодействовать с миром | Bash, Read, Edit, MCP-серверы | | Файловая система | Даёт рабочее пространство и хранение | Чтение кода, запись результатов, git | | Песочница | Безопасное выполнение кода | Docker-контейнер, sandboxed shell | | Память | Сохраняет знания между сессиями | Memory-файлы, persistent context | | Оркестрация | Управляет субагентами и потоками | Agent Teams, параллельные воркеры | | Хуки | Детерминированные проверки на каждом шаге | Lint после коммита, тесты после правки | Модель сама по себе умеет принимать токены и генерировать токены. Она не может выполнить код, прочитать файл, запомнить что-то между разговорами или открыть браузер. Всё это делает harness. ## Пример: Claude Code как harness Claude Code — типичный harness вокруг модели Claude. Модель через него получает доступ к файловой системе проекта, может выполнять bash-команды, запускать тесты, ставить зависимости. При старте в контекст загружаются CLAUDE.md и memory-файлы (это память). Есть набор инструментов (Read, Edit, Grep, MCP-серверы), хуки для автоматических проверок и субагенты для параллельных задач. Без всего этого Claude — чат-бот. С harness он может сам разобраться в проекте, написать код, прогнать тесты и создать пулл-реквест. Разница огромная, хотя модель та же самая. ## Agent harness vs framework vs scaffold Эти три термина часто путают. Harrison Chase из LangChain предложил автомобильную аналогию: framework как шасси, runtime как двигатель, harness как навигация и электроника. | | Framework | Harness | | ------------ | ---------------------------- | ---------------------------------------- | | Что это | Библиотека, набор абстракций | Готовая система вокруг конкретной модели | | Аналогия | Набор инструментов в гараже | Собранный автомобиль | | Примеры | LangChain, CrewAI, AutoGen | Claude Code, Codex CLI, OpenClaw | | Кто собирает | Разработчик | Поставщик (или разработчик из framework) | Scaffold — по сути синоним harness. Некоторые компании (Anthropic, OpenAI) используют scaffold, другие (LangChain, MiniMax) говорят harness. Смысл один: инфраструктура вокруг модели. ## Где применяется - Кодинг-агенты (Claude Code, Codex, Cursor): harness определяет, какие файлы агент видит, как редактирует код, как запускает тесты - Офисные агенты (OpenClaw, Cowork): harness подключает календарь, почту, документы и задаёт правила взаимодействия - Исследовательские агенты, как в [MiniMax M2.7](https://matveev.tech/minimax-m27-self-evolution/): harness включает data-пайплайны, тренировочные окружения и мониторинг экспериментов - Self-evolving агенты: harness, который модель может сама модифицировать и улучшать ## FAQ **Можно ли сделать harness без фреймворка?** Да. Harness можно собрать из обычного кода: while-loop, вызовы API модели, инструменты, файловая система. Framework ускоряет сборку, но не обязателен. **Влияет ли harness на качество работы агента?** Сильно. На [Terminal Bench 2.0](https://blog.langchain.com/the-anatomy-of-an-agent-harness?ref=matveev.tech) одна и та же модель Opus 4.6 показывает разные результаты в разных harness. Оптимизация harness может быть важнее выбора модели. **Что такое harness engineering?** Новая дисциплина, которая занимается проектированием harness: какие инструменты дать модели, как управлять контекстом, как настроить петли обратной связи. [OpenAI](https://openai.com/ru-RU/index/harness-engineering?ref=matveev.tech) выпустили отдельный гайд по теме. **Чем harness отличается от промпт-инжиниринга?** Промпт-инжиниринг фокусируется на тексте, который получает модель. Harness engineering охватывает всё остальное: инструменты, окружение, память, оркестрацию, верификацию. Промпт — часть harness, но далеко не весь harness. ## Что ещё почитать - [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov/) — архитектурные паттерны, которые реализуются внутри harness - [Субагенты в Codex: настраиваем AI-команду](https://matveev.tech/codex-subagents-tutorial/) — пример оркестрации как компонента harness - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) — глубокое погружение в один из компонентов harness - [MiniMax M2.7: модель, которая сама себя обучала](https://matveev.tech/minimax-m27-self-evolution/) — пример self-evolving harness на практике ### Qoder vs Claude Code: IDE-агент против CLI-агента URL: https://matveev.tech/qoder-vs-claude-code/ Last updated: 2026-03-21T08:04:43.000Z **TL;DR:** Qoder — визуальная IDE с автономным Quest Mode, где агент работает по спецификации часами. Claude Code — CLI-first инструмент с мощной моделью Opus 4.6, скриптами и Agent Teams. Выбор зависит от того, как ты привык работать: в IDE или в терминале. Два совершенно разных подхода к одной задаче: пусть AI пишет код за тебя. Qoder строит вокруг этого визуальный IDE с трёхколоночным интерфейсом и Spec-документами. Claude Code делает ставку на терминал, пайпы и Unix-философию. Я пользуюсь Claude Code каждый день, а Qoder изучил для [обзора](https://matveev.tech/qoder-ide-obzor/). Попробую честно разобраться, кому что больше подходит. ## Qoder: IDE с автономным агентом [Qoder](https://matveev.tech/qoder-ide-obzor/) — AI-IDE от Alibaba на базе модели [Qwen3-Coder](https://matveev.tech/qwen3-coder-next-obzor/). Форк VS Code с тремя продуктами: IDE, CLI и плагин для JetBrains. ![Quest Mode в Qoder — автономный агент работает по спецификации](https://matveev.tech/content/images/2026/02/qoder-quest-mode.png) Главная фича — Quest Mode. Ты описываешь задачу, Qoder генерирует Spec (план с требованиями и критериями приёмки), ты ревьюишь, жмёшь Run — и агент работает. До 26 часов без перерыва, в трёх окружениях: локально, в worktree или в удалённом контейнере. Можно закрыть ноутбук и вернуться к результату. Ещё есть Repo Wiki — автоматическая документация кодовой базы, которая обновляется при изменении кода. По данным Qoder, анализ поддерживает до 100K файлов. Плюс NES (Next Edit Suggestion) — автодополнение, которое предсказывает следующее редактирование, а не строку. Модели: Qwen3-Coder с автомаршрутизацией на Claude, GPT и Gemini. Цены по промо: $10-100/мес, обычные вдвое выше. ## Claude Code: терминал как IDE Claude Code — AI-агент от Anthropic, который живёт в терминале. Читает кодовую базу, редактирует файлы, запускает команды, работает с git. Модель — [Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/), одна из самых сильных на рынке для работы с кодом. ![Claude Code в терминале — CLI-first подход к AI-кодингу](https://matveev.tech/content/images/2026/02/claude-code-terminal.png) Claude Code — CLI-инструмент, который можно пайпить, скриптовать и встраивать в CI/CD. `tail -f app.log | claude -p "alert me if you see errors"` — такое в IDE не сделаешь. Доступен в терминале, VS Code, JetBrains, десктоп-приложении, веб-версии и даже в Slack. Сессии переносятся между средами: начал задачу на веб, продолжил в терминале. Agent Teams позволяет запускать несколько агентов параллельно — ведущий координирует работу, распределяет подзадачи и мёрджит результаты. [CLAUDE.md](https://matveev.tech/claude-md-instruktsii-claude-code/) задаёт правила для проекта: стандарты кодирования, архитектурные решения, предпочтения. [Hooks](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) запускают shell-команды до и после действий агента. [Память](https://matveev.tech/claude-code-memory-auto-rules/) сохраняет контекст между сессиями. Цены: входит в Claude Pro ($20/мес) и Max ($100-200/мес, разница в лимитах использования). ## Сравнение | | Qoder | Claude Code | | --------------------- | --------------------------------- | --------------------------------- | | **Подход** | IDE-first (визуальный) | CLI-first (терминал) | | **Модель** | Qwen3-Coder + Claude/GPT/Gemini | Claude Opus 4.6 | | **Автономный режим** | Quest Mode (до 26ч, Spec-driven) | Agent Teams (параллельные агенты) | | **Контекст** | До 100K файлов | 200K токенов контекстное окно | | **Документация кода** | Repo Wiki (автогенерация) | Нет аналога | | **CI/CD интеграция** | Нет | GitHub Actions, GitLab CI/CD | | **Скриптование** | Ограниченно (CLI) | Полноценное (пайпы, SDK) | | **Расширения** | MCP, Skills | MCP, Hooks, Skills, плагины | | **Платформы** | macOS, Windows (IDE), Linux (CLI) | macOS, Windows, Linux | | **Цена (мин.)** | $0 (Free), $10/мес (Pro промо) | $20/мес (Claude Pro) | | **Цена (макс.)** | $200/мес (Ultra) | $200/мес (Claude Max 20x) | | **Стоимость входа** | Бесплатный триал 14 дней | Бесплатно (ограниченно) | | **Кто сделал** | Alibaba (Сингапур) | Anthropic (США) | ## Автономность: Quest Mode vs Agent Teams Оба инструмента умеют работать без постоянного присмотра, но делают это по-разному. Quest Mode в Qoder — это spec-driven подход. Ты пишешь требования, агент составляет план, ты его утверждаешь, агент работает. Процесс прозрачный: видишь Spec, прогресс, изменённые файлы. Можно добавлять требования прямо по ходу выполнения. Результат принимаешь или отклоняешь целиком. [Agent Teams](https://matveev.tech/claude-code-agent-teams-instrukciya/) в Claude Code — другая история. Ты запускаешь нескольких агентов параллельно, один из них координирует остальных. Каждый агент работает над своей подзадачей. Нет формального Spec-документа, но есть plan mode, где агент продумывает подход перед выполнением. Мне кажется, Quest Mode лучше подходит для задач типа «сделай фичу по ТЗ», а Agent Teams — для задач типа «рефактори этот модуль и обнови тесты», где нужна гибкость. ## Модели: Qwen3-Coder vs Claude Opus 4.6 Тут ситуация неоднозначная. [Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/) — одна из лучших моделей для кодинга на рынке, по бенчмаркам на уровне GPT-5.3 Codex. Qwen3-Coder слабее по бенчмаркам, но Qoder компенсирует это автомаршрутизацией: для сложных задач может подключить Claude или GPT. На практике это значит, что качество генерации кода в Claude Code более предсказуемое — ты всегда работаешь с топовой моделью. В Qoder результат зависит от того, какую модель выберет роутер, и от того, сколько у тебя кредитов. ## Цены: кредиты vs подписка Модели оплаты совсем разные, и это может быть решающим фактором. Qoder работает на кредитах. Pro за $10/мес (промо) даёт 2000 кредитов. Сколько кредитов уходит на задачу — зависит от модели и сложности. Кредиты сгорают в конце месяца. Можно докупать паки по $0.01/кредит. Claude Code входит в подписку Claude. Pro ($20/мес) даёт базовое использование, Max ($100/мес за 5x или $200/мес за 20x) — можно работать весь день без оглядки на счётчик. Не считаешь кредиты, просто работаешь. Ещё есть API-доступ с оплатой за токены ($5/$25 за миллион для Opus 4.6). По промо-ценам Qoder дешевле на старте ($10 vs $20), но при активной работе кредиты могут кончиться быстро. Claude Max за $100/мес, вероятно, даст больше рабочего времени, чем Qoder Pro+ за те же $30 (промо). Впрочем, без точных данных по расходу кредитов это сложно сравнивать. --- Лично я остаюсь с Claude Code. CLI-подход оказался для меня удобнее, чем любая IDE — я могу автоматизировать рутину через хуки и скрипты, а Agent Teams закрывают вопрос параллельной работы. Но если ты привык к визуальному интерфейсу и тебе нравится идея Quest Mode, Qoder стоит попробовать. Особенно пока промо-цены. ## Что ещё почитать - [Qoder — AI-IDE от Alibaba с Quest Mode](https://matveev.tech/qoder-ide-obzor/) — подробный обзор - [Память Claude Code — auto memory, rules и CLAUDE.md](https://matveev.tech/claude-code-memory-auto-rules/) — как Claude Code запоминает контекст - [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентность - [Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/) — обзор модели - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — ещё одно сравнение ## FAQ **Можно ли использовать Qoder и Claude Code вместе?** Да. Qoder умеет маршрутизировать запросы на модели Claude. А Claude Code можно запускать из терминала параллельно с любой IDE. Но платить придётся за оба сервиса отдельно. **Что лучше для начинающих?** Qoder — проще визуальный интерфейс, Quest Mode ведёт за руку через Spec. Claude Code требует базовых навыков работы с терминалом, но документация хорошая. **Где лучше приватность данных?** Claude Code от Anthropic (США), данные обрабатываются по американскому законодательству. Qoder от Alibaba через сингапурское юрлицо — некоторых разработчиков это настораживает. Оба инструмента заявляют, что не хранят исходный код. **Какой инструмент быстрее для простых задач?** Claude Code. Открыл терминал, написал запрос, получил результат. В Qoder нужно открыть IDE, дождаться индексации. Для сложных длительных задач быстрее может быть Quest Mode. ### Channels в Claude Code: подключаем Telegram, Discord и вебхуки URL: https://matveev.tech/claude-code-channels-tutorial/ Last updated: 2026-03-20T09:54:01.000Z > TL;DR: Channels в Claude Code позволяют получать сообщения из Telegram, Discord и любых вебхуков прямо в терминальную сессию. Claude читает событие, реагирует и может ответить обратно. Показываю, как всё настроить за 5 минут. [Channels](https://code.claude.com/docs/en/channels?ref=matveev.tech) появились 20 марта 2026 года в research preview. По сути это MCP-серверы, которые работают как мост между внешним миром и твоей сессией Claude Code. Telegram, Discord, вебхуки от CI, алерты мониторинга, что угодно. ## Что понадобится - **Claude Code v2.1.80+** (проверь `claude --version`) - **Аккаунт claude.ai** (API-ключи и Console не поддерживаются) - [**Bun**](https://bun.sh/?ref=matveev.tech) (предустановленные плагины написаны на нём, проверь `bun --version`) - Для Telegram: бот через [@BotFather](https://t.me/BotFather?ref=matveev.tech) - Для Discord: приложение в [Developer Portal](https://discord.com/developers/applications?ref=matveev.tech) - **Team/Enterprise**: админ должен включить `channelsEnabled` в managed settings ## Шаг 1\. Проверяем на fakechat Перед тем как подключать настоящие платформы, есть смысл потестировать механику на fakechat. Это демо-канал от Anthropic, который поднимает чат-UI на localhost. Никаких внешних сервисов, токенов, ботов. Устанавливаем плагин: ```bash /plugin install fakechat@claude-plugins-official ``` Запускаем Claude Code с каналом: ```bash claude --channels plugin:fakechat@claude-plugins-official ``` Открывай `http://localhost:8787` в браузере. Пишешь сообщение в веб-интерфейсе, оно прилетает в терминальную сессию Claude Code. Claude отвечает, ответ появляется обратно в браузере. Если всё работает, переходим к настоящим платформам. ## Шаг 2\. Подключаем Telegram Telegram, наверное, самый практичный вариант. ### Создаём бота 1. Открой [@BotFather](https://t.me/BotFather?ref=matveev.tech) в Telegram 2. Отправь `/newbot` 3. Придумай имя и username (должен заканчиваться на `bot`) 4. Скопируй токен ### Ставим плагин и конфигурируем ```bash /plugin install telegram@claude-plugins-official /telegram:configure <твой-токен> ``` ### Запускаем с каналом ```bash claude --channels plugin:telegram@claude-plugins-official ``` ### Привязываем аккаунт Это важный момент. Channels используют allowlist отправителей, и пока ты не пройдёшь pairing, бот будет игнорировать все сообщения. 1. Найди своего бота в Telegram и отправь ему любое сообщение 2. Бот ответит кодом сопряжения 3. В терминале Claude Code выполни: `/telegram:access pair <код>` 4. Зафиксируй политику: `/telegram:access policy allowlist` Готово. Теперь пишешь боту «проверь, проходят ли тесты на feature-ветке», и Claude Code в терминале начинает работать. Ответ прилетает обратно в Telegram. Пишу про Claude Code и AI-инструменты для разработчиков. Channels, MCP, агенты — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Шаг 3\. Подключаем Discord Процесс похож на Telegram, но чуть больше настроек на стороне Discord. ### Создаём бота 1. Зайди в [Discord Developer Portal](https://discord.com/developers/applications?ref=matveev.tech) 2. Нажми **New Application**, задай имя 3. Перейди в **Bot** → **Reset Token** → скопируй токен 4. Там же включи **Message Content Intent** в разделе Privileged Gateway Intents (без этого бот не увидит текст сообщений) 5. Пригласи бота на сервер с правами: просмотр каналов, отправка сообщений, чтение истории, прикрепление файлов ### Ставим и запускаем ```bash /plugin install discord@claude-plugins-official /discord:configure <твой-токен> claude --channels plugin:discord@claude-plugins-official ``` ### Привязка аккаунта Напиши боту в личку, получи код сопряжения, подтверди в терминале: ```bash /discord:access pair <код> ``` Можно подключить оба канала одновременно, перечислив плагины через пробел: ```bash claude --channels plugin:telegram@claude-plugins-official plugin:discord@claude-plugins-official ``` ## Шаг 4\. Пишем свой webhook-канал Telegram и Discord покрывают базовые сценарии, но интереснее другое: можно написать свой канал для чего угодно. CI упал? Мониторинг кричит? Grafana шлёт алерт? Всё это можно направить прямо в Claude Code. Покажу на примере простого HTTP-приёмника, который принимает POST-запросы и пробрасывает их в сессию. ### Создаём проект ```bash mkdir webhook-channel && cd webhook-channel bun add @modelcontextprotocol/sdk ``` ### Пишем сервер Создай файл `webhook.ts`: ```typescript #!/usr/bin/env bun import { Server } from '@modelcontextprotocol/sdk/server/index.js' import { StdioServerTransport } from '@modelcontextprotocol/sdk/server/stdio.js' const mcp = new Server( { name: 'webhook', version: '0.0.1' }, { capabilities: { experimental: { 'claude/channel': {} } }, instructions: 'Events from the webhook channel arrive as . They are one-way: read them and act, no reply expected.', }, ) await mcp.connect(new StdioServerTransport()) Bun.serve({ port: 8788, hostname: '127.0.0.1', async fetch(req) { const body = await req.text() await mcp.notification({ method: 'notifications/claude/channel', params: { content: body, meta: { path: new URL(req.url).pathname, method: req.method }, }, }) return new Response('ok') }, }) ``` На что обратить внимание: - `capabilities: { experimental: { 'claude/channel': {} } }` — именно эта строка делает MCP-сервер каналом. Без неё Claude Code не зарегистрирует listener - `instructions` — попадает в системный промпт Claude. Объясни, чего ожидать от событий и нужно ли отвечать - `hostname: '127.0.0.1'` — слушаем только на localhost, ничего наружу не торчит ### Регистрируем в .mcp.json ```json { "mcpServers": { "webhook": { "command": "bun", "args": ["./webhook.ts"] } } } ``` ### Тестируем Кастомные каналы пока не в официальном allowlist, поэтому нужен флаг разработчика: ```bash claude --dangerously-load-development-channels server:webhook ``` Claude Code прочитает `.mcp.json`, запустит `webhook.ts` как подпроцесс, и HTTP-сервер поднимется автоматически. В другом терминале: ```bash curl -X POST localhost:8788 -d "build failed on main: https://ci.example.com/run/1234" ``` В сессии Claude Code появится событие: ```xml build failed on main: https://ci.example.com/run/1234 ``` Claude прочитает сообщение и начнёт разбираться. Если в тексте упомянута ссылка на CI, он может сам полезть смотреть логи. ## Шаг 5\. Добавляем двустороннюю связь Односторонний канал уже полезен для алертов, но если хочешь, чтобы Claude мог отвечать (например, в чат-бридже), нужно добавить reply tool. Это стандартный MCP-инструмент, ничего специфичного для каналов. Дополним `webhook.ts`: ```typescript #!/usr/bin/env bun import { Server } from '@modelcontextprotocol/sdk/server/index.js' import { StdioServerTransport } from '@modelcontextprotocol/sdk/server/stdio.js' import { ListToolsRequestSchema, CallToolRequestSchema } from '@modelcontextprotocol/sdk/types.js' const mcp = new Server( { name: 'webhook', version: '0.0.1' }, { capabilities: { experimental: { 'claude/channel': {} }, tools: {}, // включаем обнаружение инструментов }, instructions: 'Messages arrive as . Reply with the reply tool, passing the chat_id from the tag.', }, ) // Регистрируем reply tool mcp.setRequestHandler(ListToolsRequestSchema, async () => ({ tools: [{ name: 'reply', description: 'Send a message back over this channel', inputSchema: { type: 'object', properties: { chat_id: { type: 'string', description: 'The conversation to reply in' }, text: { type: 'string', description: 'The message to send' }, }, required: ['chat_id', 'text'], }, }], })) // Обрабатываем вызовы mcp.setRequestHandler(CallToolRequestSchema, async req => { if (req.params.name === 'reply') { const { chat_id, text } = req.params.arguments as { chat_id: string; text: string } // Тут вызов API твоей платформы console.error(`Reply to ${chat_id}: ${text}`) return { content: [{ type: 'text', text: 'sent' }] } } throw new Error(`unknown tool: ${req.params.name}`) }) await mcp.connect(new StdioServerTransport()) let nextId = 1 Bun.serve({ port: 8788, hostname: '127.0.0.1', async fetch(req) { const body = await req.text() const chat_id = String(nextId++) await mcp.notification({ method: 'notifications/claude/channel', params: { content: body, meta: { chat_id, path: new URL(req.url).pathname, method: req.method }, }, }) return new Response('ok') }, }) ``` Что добавилось: - `tools: {}` в capabilities, чтобы Claude Code обнаружил инструменты сервера - `ListToolsRequestSchema` описывает reply tool со схемой параметров - `CallToolRequestSchema` обрабатывает вызовы (замени `console.error` на реальный API отправки) - `chat_id` в meta, чтобы Claude знал, куда отвечать ## Шаг 6\. Защита от prompt injection Открытый канал без фильтрации отправителей — это вектор prompt injection. Любой, кто может отправить POST на твой endpoint, может подсунуть текст прямо в контекст Claude. Проверяй отправителя до вызова `mcp.notification()`: ```typescript const allowed = new Set(loadAllowlist()) // из access.json или аналога // Внутри обработчика сообщений, ДО отправки: if (!allowed.has(message.from.id)) { return // игнорируем молча } await mcp.notification({ ... }) ``` ⚠️ Фильтруй по ID отправителя (`message.from.id`), а не по ID чата (`message.chat.id`). В групповых чатах это разные вещи, и фильтрация по комнате позволит любому участнику группы инжектить сообщения в сессию. Официальные плагины Telegram и Discord используют именно этот подход: allowlist по sender ID + pairing flow для первичной привязки. ## Результат Если всё настроил правильно, у тебя теперь есть Telegram/Discord-бот для управления Claude Code с телефона, webhook-приёмник для алертов от CI и мониторинга, и опционально двусторонний канал, через который Claude может отвечать. В терминале ты видишь входящее сообщение и инструмент, который Claude вызвал для ответа. Сам текст ответа появляется на платформе отправителя, в терминале только подтверждение «sent». События приходят только пока сессия открыта. Для always-on режима запускай Claude Code в фоновом процессе или persistent-терминале (tmux, screen). Но будь осторожен с `--dangerously-skip-permissions` — он отключает все подтверждения. Пишу про Claude Code и AI-инструменты для разработчиков. Channels, MCP, агенты — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Частые ошибки Если видишь «blocked by org policy», значит ты в Team или Enterprise организации, а админ не включил `channelsEnabled`. Включается в **claude.ai → Admin settings → Claude Code → Channels**. Канал регистрируется, но сообщения не приходят? Проверь, что ты указал сервер в `--channels`. Запись в `.mcp.json` сама по себе не активирует канал, нужно явно передать имя при запуске. Кастомный канал не загружается. Во время research preview кастомные каналы не в allowlist. Используй `--dangerously-load-development-channels server:<имя>`. Флаг работает только для конкретного entry, а не для всех каналов в сессии. Telegram-бот игнорирует сообщения? Скорее всего не прошёл pairing. Напиши боту, получи код, подтверди через `/telegram:access pair <код>`. ## FAQ ### Чем Channels отличается от Remote Control? [Remote Control](https://code.claude.com/docs/en/remote-control?ref=matveev.tech) синхронизирует терминальную сессию с claude.ai или мобильным приложением. Ты видишь полный UI и можешь печатать, как будто сидишь за терминалом. Channels работают иначе: ты отправляешь сообщение, Claude обрабатывает его и отвечает. Это модель передачи сообщений, а не screen-sharing. ### Чем Channels отличается от Dispatch? [Dispatch](https://matveev.tech/claude-dispatch-cowork-mobile/) — фича Cowork для не-разработчиков. Она связывает мобильное приложение Claude с десктопной сессией для задач вроде организации файлов и создания контента. Channels — для разработчиков, построены на MCP и заточены под event-driven воркфлоу. ### Можно ли подключить Slack или WhatsApp? Официальных плагинов пока нет (март 2026), но протокол открытый. Любой MCP-сервер с `claude/channel` capability может стать каналом. Нужно написать свой плагин по схеме из шага 4 и запустить с `--dangerously-load-development-channels`. ### Что происходит с сообщениями, когда сессия закрыта? Они не доставляются. Channels работают только при активной сессии. Для постоянной доступности запускай Claude Code в фоновом процессе. ### Безопасно ли давать внешним системам доступ к Claude Code? При правильной настройке — да. Sender allowlist отсекает всех, кого ты не добавил. Два уровня контроля: на уровне сессии (`--channels`) и на уровне организации (`channelsEnabled`). Кастомные каналы слушают только на localhost. ## Гайды по Claude Code и AI-разработке Подписаться Email sent! Check your inbox to complete your signup. Туториалы, обзоры инструментов и рабочие воркфлоу. Без воды. ## Что ещё почитать - [10 воркфлоу Claude Code на каждый день](https://matveev.tech/claude-code-10-workflows/) — Channels отлично вписываются как ещё один рабочий паттерн - [Claude Dispatch: управляй Cowork с телефона](https://matveev.tech/claude-dispatch-cowork-mobile/) — альтернативный подход к мобильному управлению Claude - [Запланированные задачи в Claude Code: /loop и cron](https://matveev.tech/claude-code-scheduled-tasks-loop/) — если нужна реакция по расписанию, а не по событиям - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — полезно, если подключаешь несколько MCP-серверов ### JetBrains Air: обзор агентной среды разработки URL: https://matveev.tech/jetbrains-air-obzor/ Last updated: 2026-03-19T17:33:04.000Z > TL;DR: JetBrains Air — среда разработки нового типа, заточенная под параллельную работу с несколькими AI-агентами (Codex, Claude Agent, Gemini CLI, Junie). Не замена IntelliJ IDEA, а отдельный инструмент для делегирования задач агентам с изоляцией через Docker и Git worktrees. Пока только macOS, preview. Если ты следишь за рынком AI IDE, последние полгода выглядят как гонка вооружений. Cursor, Windsurf, Qoder, Zed с AI, Trae от ByteDance. И вот JetBrains, которые 26 лет делают IDE, выкатывают свой ответ. Не очередной плагин к IntelliJ, а отдельное приложение с другой философией. ## Что такое JetBrains Air Air — это Agentic Development Environment. Не IDE в классическом смысле (писать код руками тут не основной сценарий), а оркестратор для AI-агентов. Описываешь задачу, указываешь контекст из файлов и коммитов, выбираешь агента. Air сам поднимает для него изолированное окружение и запускает. Технически Air построен на базе [Fleet](https://blog.jetbrains.com/fleet/2025/12/the-future-of-fleet/?ref=matveev.tech) — легковесного редактора, который JetBrains закрыли в декабре 2025\. Fleet не взлетел как самостоятельный продукт, но его компоненты и UI-концепции перекочевали в Air. JetBrains переупаковали Fleet для эпохи агентного кодинга. [Public preview вышел 9 марта 2026](https://blog.jetbrains.com/air/2026/03/12/air-launches-as-public-preview/?ref=matveev.tech). Пока только macOS, Windows и Linux обещают позже. ## Быстрый старт за 5 минут ![Интерфейс создания задачи в JetBrains Air](https://matveev.tech/content/images/2026/03/jetbrains-air-define-task-1.png) 1. **Скачай Air** с [air.dev](https://air.dev/?ref=matveev.tech) (бесплатно, macOS) 2. **Войди** через JetBrains Account. Если у тебя есть подписка AI Pro, AI Ultimate или All Products Pack — все агенты доступны сразу 3. **Нет подписки?** Можно использовать свои API-ключи от Anthropic, OpenAI или Google (BYOK). Личные подписки OpenAI и Google тоже работают 4. **Открой проект** и создай первую задачу: опиши, что нужно сделать, укажи файлы, коммиты или символы как контекст 5. **Выбери агента** (Codex, Claude Agent, Gemini CLI или Junie) и среду исполнения (локально, Git worktree или Docker) Air сам настроит изоляцию и запустит агента. Прогресс видно в реальном времени, вмешаться можно в любой момент. ## Как устроена мультиагентность в Air Главная идея Air: несколько агентов работают параллельно, каждый в своём окружении. Не мешают друг другу, не перезаписывают файлы. ![Параллельные задачи в JetBrains Air](https://matveev.tech/content/images/2026/03/jetbrains-air-parallel-tasks.png) Поддерживаемые агенты: - Codex (OpenAI) для генерации кода и рефакторинга - Claude Agent (Anthropic) для сложных задач с большим контекстом - Gemini CLI (Google), который можно использовать бесплатно через личную подписку - Junie (JetBrains), собственный агент с новой CLI-версией Ещё Air поддерживает [Agent Client Protocol (ACP)](https://blog.jetbrains.com/blog/2025/12/09/jetbrains-joins-the-agentic-artificial-intelligence-foundation/?ref=matveev.tech), открытый протокол для коммуникации агент-редактор. Через ACP со временем можно будет подключить вообще любого совместимого агента. ## Три режима изоляции задач ![Выбор среды исполнения в JetBrains Air](https://matveev.tech/content/images/2026/03/jetbrains-air-isolation.png) Когда запускаешь задачу, Air предлагает три варианта: | Режим | Что происходит | Когда использовать | | --------------- | ---------------------------------------------------- | ---------------------------------------------------- | | Local Workspace | Агент работает напрямую в твоём проекте | Мелкие задачи, быстрые правки | | Git Worktree | Создаётся отдельная рабочая копия через git worktree | Параллельные задачи, которые трогают одни файлы | | Docker | Полная изоляция в контейнере | Когда нужна безопасность или специфическое окружение | Четвёртый режим, Cloud, в разработке. Обещают запуск агентов в облаке без локальных ресурсов, с доступом из браузера. Это, пожалуй, главное отличие от конкурентов. В Cursor или Windsurf ты можешь запустить AI-агента, но он работает в твоём рабочем пространстве. Две параллельные задачи? Жди конфликтов. Air решает это на уровне инфраструктуры. Разбираю агентные IDE и CLI — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Ревью и интеграция изменений ![Code review в JetBrains Air](https://matveev.tech/content/images/2026/03/jetbrains-air-review-1.png) Когда агент закончил, ты видишь diff изменений в контексте проекта. Встроенный терминал, Git-клиент, навигация по символам и классам. Можно оставить комментарий к конкретной строке и попросить агента доработать, как в обычном code review. Если задача выполнялась в worktree или Docker, Air помогает перенести изменения обратно в основную копию. ## Тарифы Air сам по себе бесплатный. Платишь за AI-агентов: | Вариант | Стоимость | Что входит | | ----------------- | ------------------------- | -------------------------------------------------------------- | | BYOK (свои ключи) | $0 за Air + стоимость API | Подключаешь ключи Anthropic, OpenAI, Google | | AI Pro | $100/год | 10 AI Credits в месяц, все агенты. Включён в All Products Pack | | AI Ultimate | $300/год | 35 AI Credits в месяц, расширенная квота | | Junie отдельно | от $10/мес | Только агент Junie, без других | Личные подписки OpenAI и Google (не API, а обычные) тоже работают. BYOK-ключи приоритетнее подписки JetBrains: сначала тратятся они, потом квота. Для студентов у JetBrains есть [бесплатный пакет](https://www.jetbrains.com/academy/student-pack/?ref=matveev.tech), который включает AI Pro. ## Вердикт Air — продукт с правильной идеей, но пока в зачаточном состоянии. Параллельная работа нескольких агентов с изоляцией через worktrees и Docker — это хорошо и направление верное. JetBrains открыто говорят, что сложные кодовые базы пока не готовы к чистому агентному кодингу. Air это дополнение к IntelliJ IDEA. Агенты пишут код, ты ревьюишь и интегрируешь. Основная работа остаётся в привычной IDE. Кому это подойдёт? Тем, кто уже плотно работает с AI-агентами и устал от ограничений. Если ты переключаешься между Codex и Claude в зависимости от задачи, Air удобнее, чем три открытых терминала. Но есть вещи, которые напрягают. Preview-качество с ожидаемыми багами. Кредитная система JetBrains AI, которую критикуют за скупость (10 кредитов в месяц на AI Pro — это мало). Вопрос в том, доведут ли JetBrains Cloud-режим и командную работу до рабочего состояния. Если да, Air может занять свою нишу. ## AI-инструменты для разработчиков Подписаться Email sent! Check your inbox to complete your signup. Обзоры, сравнения и гайды по AI IDE, агентам и CLI [JetBrains AirAgentic Development Environment — запускай AI-агентов параллельноJetBrains](https://air.dev/?ref=matveev.tech) ## Что ещё почитать - [3 паттерна воркфлоу AI-агентов: когда какой использовать](https://matveev.tech/patterny-workflow-ai-agentov/) — как организовать работу с агентами - [Qoder vs Cursor: два AI-IDE, разные философии](https://matveev.tech/qoder-vs-cursor/) — сравнение подходов к AI IDE - [Qoder vs Claude Code: IDE-агент против CLI-агента](https://matveev.tech/qoder-vs-claude-code/) — когда нужен IDE, а когда хватит терминала ### 10 воркфлоу Claude Code на каждый день URL: https://matveev.tech/claude-code-10-workflows/ Last updated: 2026-03-19T13:03:04.000Z > TL;DR: Claude Code — не просто AI-чат в терминале. Собрал 10 воркфлоу, которые я использую каждый день: от Plan Mode для безопасного анализа кода до git worktrees для параллельных задач. Инструмент умеет гораздо больше, если знать, как его готовить. В [документации Anthropic](https://code.claude.com/docs/en/common-workflows?ref=matveev.tech) описано больше 15 сценариев. Я отобрал 10, которые реально экономят мне время. ## 1\. Plan Mode — анализируй код, не трогая его Plan Mode переключает Claude в режим «только чтение». Он исследует кодовую базу, задаёт уточняющие вопросы и предлагает план действий — но ничего не редактирует, пока ты не разрешишь. Включается за секунду: **Shift+Tab** дважды. Первое нажатие переключает в Auto-Accept, второе — в Plan Mode. Или сразу при запуске: ``` claude --permission-mode plan ``` Я использую его в двух ситуациях: когда прихожу в незнакомый проект и хочу разобраться в архитектуре, и когда планирую сложный рефакторинг. В обоих случаях хочется сначала понять, а потом уже редактировать. Через `Ctrl+G` можно открыть сгенерированный план в текстовом редакторе и подредактировать перед выполнением. Удобно, когда 80% плана тебя устраивает, но пару шагов хочешь поменять. 💡 Plan Mode можно сделать режимом по умолчанию — добавь `"permissions": {"defaultMode": "plan"}` в `.claude/settings.json`. ## 2\. Git Worktrees — параллельная работа без конфликтов Когда нужно параллельно работать над фичей и фиксить баг, worktrees спасают. Каждая сессия Claude получает свою копию репозитория с отдельной веткой. ``` claude --worktree feature-auth claude --worktree bugfix-123 ``` Claude создаёт директорию `.claude/worktrees/feature-auth/` с новой веткой `worktree-feature-auth`. Работаешь как обычно, а в соседнем терминале — другая задача, другой контекст, ноль конфликтов. При выходе Claude сам убирает за собой. Нет изменений — удаляет worktree автоматически. Есть коммиты — спрашивает, сохранить или убрать. ⚠️ Добавь `.claude/worktrees/` в `.gitignore`, чтобы содержимое worktrees не светилось в git status основного репо. ## 3\. Субагенты — делегируй специализированные задачи Субагенты — это отдельные экземпляры Claude, заточенные под конкретную задачу. Один ревьюит код, другой гоняет тесты. У каждого свой набор инструментов и контекст. ``` /agents ``` Команда показывает доступные субагенты и позволяет создавать новые. Claude сам определяет, когда задачу лучше делегировать. Но можно и явно попросить: ``` use the code-reviewer subagent to check the auth module ``` Кастомные субагенты создаются в `.claude/agents/` — удобно для командных стандартов. Главное правило: ограничивать tool access. Code reviewer не нужен доступ к bash, а тест-раннеру — к git push. ## 4\. Управление сессиями — не теряй контекст Одна из самых недооценённых фич. Ты закрыл терминал, но весь контекст сессии сохранился. Продолжить — одна команда: ``` claude --continue ``` Это подхватывает последнюю сессию в текущей директории. Если нужна конкретная — используй пикер: ``` claude --resume ``` Мой совет: именуй сессии сразу. `claude -n auth-refactor` или `/rename auth-refactor` в процессе. Через неделю «auth-refactor» найдёшь за секунду, а «explain this function» — никогда. В пикере есть горячие клавиши: **P** — preview сессии перед открытием, **R** — переименовать, **B** — фильтр по текущей ветке, **/** — поиск. Форкнутые сессии (через `/rewind`) группируются вместе. ✈️ Пишу о Claude Code и AI-инструментах в телеге — [подписывайся, если тоже прокачиваешь рабочие процессы](https://t.me/ctospeech?ref=matveev.tech). ## 5\. Extended Thinking — когда нужно подумать глубже Extended thinking включён по умолчанию. На Opus 4.6 и Sonnet 4.6 работает adaptive reasoning — модель сама решает, сколько «думать» в зависимости от сложности задачи. Для обычных задач ничего настраивать не нужно. Для сложных архитектурных решений я пишу `ultrathink` прямо в промпте — это выкручивает effort на максимум для одного запроса. ``` ultrathink: проанализируй архитектуру авторизации и предложи миграцию на OAuth2 ``` Через `Ctrl+O` можно включить verbose mode и увидеть процесс размышления серым курсивом. Полезно, чтобы понять ход мысли Claude. 💡 Фразы «think hard» или «think more» в промпте — просто текст, они не выделяют thinking tokens. Для управления глубиной используй `/effort` или слово `ultrathink`. ## 6\. Работа с картинками Claude понимает картинки. Скриншот ошибки, макет интерфейса — закидываешь прямо в терминал, и он анализирует. Я честно не ожидал, что это будет настолько полезно в CLI. Добавить картинку можно тремя способами: - Drag and drop в окно Claude Code - **Ctrl+V** — вставка из буфера обмена (на macOS именно Ctrl, не Cmd!) - Указать путь: `Analyze this image: /path/to/screenshot.png` Самый частый мой кейс — скриншоты UI с просьбой сгенерировать CSS или подсказать, что не так с вёрсткой. Работает на удивление хорошо. Когда Claude ссылается на картинку в ответе (например, `[Image #1]`), можно **Cmd+Click** по ссылке, чтобы открыть её. ## 7\. @ — быстрые ссылки на файлы Символ `@` — быстрый способ добавить файл или директорию в контекст без ожидания, пока Claude сам их прочитает. ``` Explain the logic in @src/utils/auth.js ``` Это включает полное содержимое файла в контекст. Для директорий — получаешь листинг с информацией о файлах: ``` What's the structure of @src/components? ``` Для MCP-ресурсов работает формат `@server:resource`: ``` Show me the data from @github:repos/owner/repo/issues ``` Бонус: ссылка через `@` автоматически подтягивает `CLAUDE.md` из директории файла и родительских директорий. Так Claude получает контекст проекта вместе с содержимым. ## 8\. Claude как Unix-утилита Claude Code — обычная CLI-утилита. Принимает stdin, отдаёт stdout. Встраивается в пайплайны как любая другая команда. ```bash cat build-error.txt | claude -p 'explain the root cause' > analysis.txt ``` Флаг `--output-format` управляет форматом вывода: `text` (по умолчанию), `json` (полный лог с метаданными), `stream-json` (реалтайм). Можно добавить в `package.json` как скрипт для lint: ```json { "scripts": { "lint:claude": "claude -p 'you are a linter. look at changes vs main and report issues'" } } ``` Я добавил такой скрипт в один из проектов для код-ревью в CI. Claude проверяет diff и пишет замечания. Не заменяет живой ревью, но ловит очевидные вещи. ## Воркфлоу и инструменты для разработки Подписаться Email sent! Check your inbox to complete your signup. Раз в неделю — самое полезное из мира AI-разработки ## 9\. Нотификации — знай, когда Claude ждёт Знакомая ситуация: запустил длинную задачу, переключился в браузер, вернулся через полчаса — а Claude давно ждёт подтверждения. Notification hook это решает. Добавь в `~/.claude/settings.json`: ```json { "hooks": { "Notification": [ { "matcher": "", "hooks": [ { "type": "command", "command": "osascript -e 'display notification \"Claude Code needs your attention\" with title \"Claude Code\"'" } ] } ] } } ``` Это для macOS. На Linux — `notify-send`, на Windows — PowerShell. Через `matcher` можно сузить: `permission_prompt` (ждёт разрешения), `idle_prompt` (готов к новому промпту), `elicitation_dialog` (задаёт вопрос). Проверить, что хук работает: `/hooks` → выбрать Notification. ## 10\. Pull Requests одной командой Самый быстрый способ создать PR: ``` create a pr for my changes ``` Claude сам напишет summary, подсветит ключевые изменения и создаст PR через `gh`. Сессия автоматически привязывается к PR, и потом можно вернуться через: ``` claude --from-pr 123 ``` Если хочешь больше контроля, делай пошагово: сначала `summarize my changes`, потом `create a pr`, потом `enhance the PR description`. Перед отправкой я прошу Claude подсветить потенциальные риски. Не всегда находит что-то важное, но пару раз реально спасал от глупых ошибок. ## Часто задаваемые вопросы #### Какой режим выбрать: Plan Mode или обычный? Plan Mode подходит для исследования кода и планирования сложных изменений — Claude ничего не редактирует, только анализирует. Обычный режим — для выполнения задач, когда ты готов к изменениям. Можно переключаться на ходу через Shift+Tab. #### Нужно ли платить за Extended Thinking отдельно? Отдельно — нет, но thinking tokens учитываются в общем потреблении. На Opus 4.6 и Sonnet 4.6 модель сама регулирует глубину через adaptive reasoning. Если хочешь контролировать расход — настрой /effort или отключи thinking через Option+T. #### Можно ли использовать Claude Code в CI/CD? Да. Через флаг -p Claude работает в headless-режиме — принимает промпт, отдаёт результат в stdout. Можно добавить как шаг в GitHub Actions, GitLab CI или любой другой пайплайн. Формат вывода настраивается через --output-format. #### Чем worktrees лучше обычных веток? Ветка — это указатель на коммит, а worktree — полная копия рабочей директории. С ветками ты переключаешься в одном каталоге, с worktrees — работаешь в двух каталогах одновременно. Две сессии Claude, два терминала, ноль конфликтов. ## Что ещё почитать - [Qoder vs Claude Code: IDE-агент против CLI-агента](https://matveev.tech/qoder-vs-claude-code/) — если выбираешь между IDE и терминальным подходом - [3 паттерна воркфлоу AI-агентов](https://matveev.tech/patterny-workflow-ai-agentov/) — архитектурный взгляд на агентные воркфлоу - [Лучшие MCP-серверы для Claude Code в 2026](https://matveev.tech/luchshie-mcp-servery-claude-code-2026/) — расширения для Claude Code ### Claude Dispatch: управляй Cowork с телефона URL: https://matveev.tech/claude-dispatch-cowork-mobile/ Last updated: 2026-03-18T17:25:56.000Z > TL;DR: Anthropic запустила Dispatch — новую функцию Claude Cowork, которая позволяет давать задачи AI-агенту на десктопе прямо с телефона. Один непрерывный тред, доступ к локальным файлам и плагинам. Research preview для Max и Pro планов. ## Что такое Dispatch в Claude Cowork? Пишешь задачу с телефона, Claude выполняет её на твоём компьютере, используя файлы, коннекторы и плагины, которые уже настроены в Cowork. Результат приходит в тот же чат. Важный момент: тред один и он непрерывный. Написал Claude утром по дороге на работу, сел за компьютер, продолжил. Контекст никуда не девается. ![Dispatch в Claude Desktop на Mac](https://matveev.tech/content/images/2026/03/claude-dispatch-mac-desktop.png) ## Что можно делать через Dispatch? Примеры задач, которые [описывает Anthropic](https://support.claude.com/en/articles/13947068-assign-tasks-to-claude-from-anywhere-in-cowork?ref=matveev.tech): - Попросить Claude найти данные в локальной таблице и собрать отчёт - Поискать по Slack и почте, а потом составить брифинг - Собрать презентацию из файлов в Google Drive - Разобрать файлы в папке на компьютере По факту, Dispatch работает как мобильный пульт для Cowork. Также можно сравнить его с начальными версиями [OpenClaw](https://matveev.tech/openclaw-ustanovka-vps/). ## Что нужно для работы? - Claude Desktop (macOS или Windows x64), компьютер должен быть включён - Claude на iOS или Android, последняя версия - Подписка Pro или Max - Интернет на обоих устройствах Настройка быстрая: открываешь Cowork, нажимаешь Dispatch в боковой панели, сканируешь QR-код с телефона. Готово. --- До сих пор Cowork жил только на десктопе, а мобильное приложение Claude было обычным чатом. Теперь можно кинуть задачу агенту, пока стоишь в очереди за кофе, и вернуться к готовому результату. Фича напоминает [Remote Control в Claude Code](https://matveev.tech/claude-code-remote-control/), только для нетехнической аудитории Cowork. Это research preview, так что сбои ожидаемы. Но понятно, куда Anthropic ведёт: чтобы агент был доступен всегда, а не только когда ты сидишь за компьютером. ## Что ещё почитать - [21 плагин Claude Cowork — честный рейтинг](https://matveev.tech/claude-cowork-plugins-tier-list/) — какие плагины подключить к Cowork перед использованием Dispatch - [Claude Import Memory: как перенести память из ChatGPT](https://matveev.tech/claude-import-memory-obzor/) — настройка памяти для непрерывного треда - [Claude в Excel — AI-помощник прямо в таблицах](https://matveev.tech/claude-in-excel-obzor/) — ещё один способ использовать Claude за пределами чата ### 3 паттерна воркфлоу AI-агентов: когда какой использовать URL: https://matveev.tech/patterny-workflow-ai-agentov/ Last updated: 2026-03-18T08:42:22.000Z > TL;DR: Anthropic выделяет три паттерна воркфлоу для AI-агентов, которые покрывают большинство продакшн-задач: последовательный, параллельный и evaluator-optimizer. Начинать стоит с самого простого — и усложнять, только когда это реально нужно. Если ты строишь что-то на AI-агентах, рано или поздно встаёт вопрос: как организовать их работу? Один агент делает всё сам? Несколько работают параллельно? Или один пишет, а другой проверяет? Anthropic поработали с десятками команд, которые запускают агентов в проде, и свели всё к трём базовым паттернам. Мне нравится такой подход: не 15 вариантов на все случаи жизни, а три рабочих шаблона, которые можно комбинировать. ## Как воркфлоу и агенты работают вместе? Думаю, тут важно разделить два понятия. Полностью автономный агент сам решает, какие инструменты использовать, в каком порядке выполнять задачи и когда остановиться. Воркфлоу добавляет структуру: задаёт общий поток, определяет чекпоинты и границы. Хорошая аналогия — сборочная линия на заводе. Каждый работник на своей станции принимает решения по своей задаче, но общий порядок операций спроектирован заранее. С AI-воркфлоу то же самое. Агент умный на каждом шаге, а весь процесс идёт по заданному маршруту. 💡 Воркфлоу не заменяет автономность агента — он задаёт рамки, внутри которых агент принимает решения. ## Три паттерна: когда какой выбирать Anthropic выделяют три паттерна, которые чаще всего встречаются в продакшне. Это не жёсткие шаблоны, а строительные блоки. Их можно комбинировать и вкладывать друг в друга. | Паттерн | Какую задачу решает | Когда использовать | Минус | Плюс | | ------------------- | ------------------------------------------------------- | ----------------------------------------------------------------- | ----------------------------------------------- | ------------------------------------------------------ | | Последовательный | Шаги зависят друг от друга: шаг Б ждёт результат шага А | Пайплайны данных, цепочки черновик-ревью-финал | Добавляет задержку — каждый шаг ждёт предыдущий | Точность выше — каждый агент фокусируется на одном | | Параллельный | Задачи независимы, но делать по одной — медленно | Оценка по нескольким критериям, код-ревью, анализ документов | Дороже — несколько одновременных API-вызовов | Быстрее и удобнее для разных команд разработки | | Evaluator-optimizer | Первый черновик недостаточно хорош | Техническая документация, клиентские коммуникации, генерация кода | Расход токенов x2-3, время итераций | Качество выше за счёт структурированной обратной связи | ## Последовательный воркфлоу Самый простой паттерн. Задачи выполняются в заданном порядке, выход одного шага становится входом следующего. Данные текут слева направо, как пайплайн. ![Схема последовательного воркфлоу AI-агентов](https://matveev.tech/content/images/2026/03/sequential-workflow-pattern.png) Подходит для многоступенчатых процессов, где каждый шаг зависит от предыдущего: пайплайны данных, цепочки «черновик → ревью → финал». Пример: генерация маркетингового текста, а потом перевод на несколько языков. Или модерация контента — извлечь, классифицировать, применить правила, маршрутизировать. Anthropic советуют сначала попробовать всё в одном промпте. Справляется? Задача решена. Разбивать на шаги стоит, только когда один агент не вытягивает. Я бы добавил, что это вообще самый недооценённый совет во всей теме агентов. Хочется сразу строить сложную архитектуру с пятью шагами, а достаточно было нормально написать промпт. ## Параллельный воркфлоу Тут несколько агентов работают одновременно над независимыми задачами. Не ждут друг друга, каждый делает своё, потом результаты собираются вместе. ![Схема параллельного воркфлоу AI-агентов](https://matveev.tech/content/images/2026/03/parallel-workflow-pattern.png) По сути это fan-out/fan-in из распределённых систем. Раздаёшь работу нескольким агентам, собираешь результаты, агрегируешь. Хорошо ложится на задачи, где нужно оценить что-то по нескольким измерениям сразу. Код-ревью, где один агент ищет уязвимости, другой проверяет стиль, третий — перформанс. Или анализ документа, где параллельно извлекаются темы, тональность и факты. Но тут есть подвох. Прежде чем запускать параллельных агентов, нужно решить, как собирать результаты. Берём мнение большинства? Средний скор уверенности? Доверяем самому специализированному? Без этого плана получишь кучу противоречивых ответов и непонятно, что с ними делать. ## Evaluator-optimizer Мой любимый паттерн, если честно. Два агента работают в цикле: один генерирует, другой оценивает по заданным критериям. Генератор дорабатывает по фидбеку, и так до достижения порога качества или лимита итераций. ![Схема evaluator-optimizer воркфлоу AI-агентов](https://matveev.tech/content/images/2026/03/evaluator-optimizer-workflow-pattern.png) Генерация и оценка — разные когнитивные задачи. Разделяешь их, и каждый агент делает одно, но хорошо. Работает для генерации кода с жёсткими требованиями, клиентских коммуникаций, где важен тон, и вообще любых задач, где первый черновик стабильно не дотягивает. Конкретный пример: агент пишет API-документацию, оценщик сверяет с кодовой базой на полноту и точность. Или агент генерирует SQL-запрос, а оценщик проверяет на инъекции и эффективность. ⚠️ Обязательно задавай критерии остановки: максимум итераций и порог качества. Без этого агенты могут гонять бесконечный цикл, находя мелкие проблемы и тратя токены, а качество уже давно вышло на плато. ## Как выбрать паттерн? Anthropic предлагают простой алгоритм: 1. Попробуй решить задачу одним вызовом агента. Если получилось — не нужен воркфлоу вообще 2. Есть чёткие последовательные зависимости? Бери sequential 3. Подзадачи независимы и нужна скорость? Бери parallel 4. Качество заметно растёт от итераций? Бери evaluator-optimizer Паттерны можно комбинировать. Evaluator-optimizer с параллельной оценкой, когда несколько оценщиков одновременно проверяют разные аспекты. Или последовательный воркфлоу с параллельным шагом на одном из этапов. Не усложняй ради усложнения. Параллелизация не даёт ощутимого прироста? Не добавляй. Первый черновик и так нормальный? Не строй цикл оценки. Разбираю агентов и воркфлоу на практике — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech). ## Вывод По моему опыту, 80% задач с агентами решаются последовательным воркфлоу или вообще одним вызовом. Параллельный нужен, когда упираешься в скорость. А evaluator-optimizer — когда реально нужно качество выше, чем даёт один проход. Главное из [статьи Anthropic](https://claude.com/blog/common-workflow-patterns-for-ai-agents-and-when-to-use-them?ref=matveev.tech): начни с простого. Один агент, один промпт. Не вытягивает — добавь структуру. Три паттерна дают понятные пути масштабирования, и не нужно переписывать всё с нуля. ## Что ещё почитать - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/) — как агенты запоминают информацию между сессиями - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/) — сравнение инструментов, которые используют эти паттерны - [Code Review в Claude Code](https://matveev.tech/claude-code-review-obzor/) — пример sequential-воркфлоу на практике ### GPT-5.4 Mini и Nano: быстрые модели для кода и субагентов URL: https://matveev.tech/gpt-5-4-mini-nano/ Last updated: 2026-03-17T18:54:12.000Z > TL;DR: OpenAI выпустила GPT-5.4 Mini и Nano. Mini почти догоняет полноразмерную GPT-5.4 на кодинге и computer use, но работает вдвое быстрее и стоит втрое дешевле. Nano ещё дешевле и заточена под классификацию, извлечение данных и простые подзадачи в субагентных системах. ## Зачем OpenAI маленькие модели Не каждая задача требует флагман. Когда AI-агент ищет файл в кодовой базе, парсит скриншот или классифицирует тикет, ему не нужна модель за $15 на миллион токенов. Нужна та, что ответит быстро, вызовет инструменты без ошибок и не съест бюджет за утро. GPT-5.4 Mini и Nano решают именно эту проблему. Mini заменяет GPT-5 Mini и прибавляет 9–20 п.п. на основных бенчмарках, а Nano создана для задач, где критичны скорость и стоимость. ## Бенчмарки: Mini подбирается к GPT-5.4 Вот главная таблица. Все модели тестировались на максимальном reasoning effort (xhigh для 5.4, high для GPT-5 Mini, потому что выше у неё нет). | Бенчмарк | GPT-5.4 | GPT-5.4 Mini | GPT-5.4 Nano | GPT-5 Mini | | ------------------ | ------- | ------------ | ------------ | ---------- | | SWE-Bench Pro | 57.7% | 54.4% | 52.4% | 45.7% | | Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% | | GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% | | OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% | | Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% | SWE-Bench Pro показывает разницу между Mini (54.4%) и полноразмерной моделью (57.7%) всего в 3.3 процентных пункта. При этом Mini работает в 2 раза быстрее. ## Кодинг: когда скорость важнее мощности ![](https://matveev.tech/content/images/2026/03/SWE-Bench-Pro--Public-_Accuracy-vs-Latency.png) ![](https://matveev.tech/content/images/2026/03/SWE-Bench-Pro--Public-_Accuracy-vs-Cost.png) OpenAI позиционирует Mini и Nano как модели для coding workflows с быстрой итерацией. На практике это точечные правки, навигация по кодовой базе, генерация фронтенда и дебаг-циклы. В Codex Mini использует только 30% квоты GPT-5.4\. Это значит, что ты можешь переключаться между задачами: сложные вещи отдать полной модели, а рутину (поиск по коду, ревью файлов, обработку документов) скинуть на Mini и не думать о лимитах. ⚡ GPT-5.4 Mini в Codex тратит 30% квоты полной модели. Три задачи на Mini ≈ одна задача на GPT-5.4. Nano в кодинге тоже полезна, хотя для других задач. SWE-Bench Pro на 52.4% говорит о том, что даже самая дешёвая модель в линейке решает больше половины реальных задач по коду. Для субагента, который обрабатывает простые подзадачи параллельно, этого достаточно. ## Субагенты: главный сценарий для Mini Думаю, самое важное в этом релизе не сами модели, а паттерн использования, который OpenAI продвигает. Большая модель (GPT-5.4) планирует и координирует. Маленькие модели (Mini, Nano) выполняют подзадачи параллельно. В Codex это уже работает: GPT-5.4 решает, что делать, а Mini-субагенты ищут по кодовой базе, ревьюят файлы, обрабатывают документы. [Документация по субагентам](https://matveev.tech/codex-subagents-tutorial/) описывает этот подход подробнее. Этот паттерн не уникален для OpenAI. Anthropic делает то же самое с Claude, где Opus координирует, а Haiku/Sonnet выполняют. Но OpenAI первыми встроили это прямо в продукт (Codex), а не оставили на уровне API. Пишу про мультиагентные системы, модели и dev tools — [подписывайся в телеграм](https://t.me/ctospeech?ref=matveev.tech). ## Computer use: Mini видит интерфейсы ![](https://matveev.tech/content/images/2026/03/OSWorld-Verified.png) На мультимодальных задачах Mini показывает 72.1% на OSWorld-Verified, почти как полная GPT-5.4 (75%). Модель быстро разбирает скриншоты сложных интерфейсов и действует по ним. Если ты строишь автоматизацию GUI (заполнение форм, навигация по приложениям, тестирование UI), Mini тут хороший выбор. Полная GPT-5.4 точнее на 3%, но медленнее и дороже втрое, и эти 3% редко оправдывают разницу. Nano тут не подходит. 39% на OSWorld — ниже, чем у предыдущего поколения GPT-5 Mini. Для задач с визуальным пониманием ей пока не хватает. ## Цены и доступность | Модель | Input (за 1M токенов) | Output (за 1M токенов) | Контекст | Где доступна | | ------------ | --------------------- | ---------------------- | -------- | ------------------- | | GPT-5.4 Mini | $0.75 | $4.50 | 400K | API, Codex, ChatGPT | | GPT-5.4 Nano | $0.20 | $1.25 | — | Только API | Mini поддерживает текст и изображения, tool use, function calling, веб-поиск, file search, computer use и skills. Контекстное окно — 400K токенов. В ChatGPT Mini доступна бесплатным пользователям и подписчикам Go через режим «Thinking». Для остальных тарифов Mini включается как фолбэк при достижении лимита GPT-5.4. Nano — только через API. Для чат-ботов, классификаторов, пайплайнов извлечения данных и субагентов на простых задачах. [Introducing GPT‑5.4 mini and nanoFast and efficient models optimized for coding and subagentsOpenAI](https://openai.com/index/introducing-gpt-5-4-mini-and-nano/?ref=matveev.tech) ## Вывод Mini почти догоняет флагман на кодинге и computer use при вдвое большей скорости и втрое меньшей цене. Думаю, для большинства задач в Codex и API она станет дефолтом. Nano, $0.20 за миллион входных токенов. На этом уровне можно гонять тысячи запросов без оглядки на бюджет. Для классификации и простых субагентов больше и не нужно. Вообще, интересно тут не сами модели, а то, куда OpenAI ведёт. Они строят систему, где модели разных размеров работают вместе: большая думает, маленькие делают. Mini с Nano заточены именно под это. ## Что ещё почитать - [GPT-5.4: computer use, tool search и 1M контекст](https://matveev.tech/gpt-5-4-obzor/) — обзор основной модели GPT-5.4 - [Мультиагенты в OpenAI Codex](https://matveev.tech/codex-multi-agent-setup/) — как настроить субагентную архитектуру - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/) — подборка инструментов для кодинга с AI ### Субагенты в Codex: настраиваем AI-команду URL: https://matveev.tech/codex-subagents-tutorial/ Last updated: 2026-03-17T18:51:55.000Z > TL;DR: Субагенты в Codex позволяют разбивать задачи на параллельные потоки — каждый со своей моделью, инструкциями и sandbox-режимом. Настраиваются через TOML-файлы, работают из коробки в CLI и приложении. Разбираю, как это настроить и когда это реально полезно. Codex умел работать как один агент — ты даёшь задачу, он выполняет. Но когда задача большая (ревью PR из 30 файлов, исследование кодовой базы, миграция), один агент тонет в контексте. Начинает забывать, что было в начале разговора, путает файлы, теряет фокус. OpenAI [выкатили субагенты в GA 16 марта 2026](https://developers.openai.com/codex/subagents?ref=matveev.tech) — после нескольких недель в превью. Идея простая: вместо одного агента, который делает всё, ты запускаешь нескольких специализированных. Каждый работает в своём потоке, со своим контекстом. ## Зачем вообще субагенты Даже с большими контекстными окнами у моделей есть проблема — **context pollution**. Полезная информация тонет в логах, стектрейсах и промежуточных результатах. Со временем это перерастает в **context rot** — модель начинает работать хуже, потому что контекст забит мусором. Субагенты решают это так: - Основной агент остаётся сфокусированным — требования, решения, финальный результат - Шумная работа (exploration, тесты, анализ логов) уходит в дочерние потоки - Обратно приходят только саммари, а не сырой вывод Плюс, параллельные задачи реально работают параллельно — это экономит время. ## Что понадобится - **Codex CLI** или **Codex App** актуальной версии (субагенты доступны по умолчанию) - Подписка на OpenAI с доступом к Codex - Текстовый редактор для TOML-файлов - Проект с кодом, на котором хочешь попробовать Субагенты пока не отображаются в IDE Extension — только в CLI и App. ## Шаг 1\. Попробуй встроенных агентов Codex идёт с тремя встроенными агентами: | Агент | Что делает | | -------- | ------------------------------------------------ | | default | Основной агент общего назначения | | worker | Заточен под выполнение задач — реализация, фиксы | | explorer | Только чтение — исследование кодовой базы | Для старта не нужно ничего конфигурировать. Просто попроси Codex запустить субагенты: ``` Проверь текущий PR (эта ветка vs main). Запусти по одному агенту на каждый пункт, дождись всех и сведи результаты: 1. Уязвимости безопасности 2. Качество кода 3. Баги 4. Race conditions 5. Нестабильные тесты 6. Поддерживаемость кода ``` Codex сам разберётся, что каждый пункт — это отдельный субагент. Дождётся всех и вернёт сводку. Чтобы переключаться между потоками агентов в CLI, используй `/agent`. Оттуда видно, что каждый делает и в каком состоянии находится. ## Шаг 2\. Создай кастомного агента Встроенные агенты — ок для старта, но по-настоящему интересно становится с кастомными. Каждый описывается TOML-файлом. Где хранить: - `~/.codex/agents/` — личные агенты (работают везде) - `.codex/agents/` — проектные агенты (коммитятся в репо, работают для всех в команде) Минимальный файл агента — три обязательных поля: ```toml # ~/.codex/agents/reviewer.toml name = "reviewer" description = "Ревьюер кода — ищет баги, проблемы безопасности и пропущенные тесты." developer_instructions = """ Ревьюь код как владелец проекта. Приоритет: корректность, безопасность, регрессии поведения, пропущенные тесты. Конкретные находки с шагами воспроизведения. Стилистические замечания — только если за ними прячется реальный баг. """ ``` Сохрани файл и всё — Codex увидит агента по имени `reviewer`. Если имя совпадает со встроенным (например, `explorer`), твой кастомный агент его перекроет. ## Шаг 3\. Настрой модель и reasoning Необязательные поля, но без них кастомные агенты не особо отличаются от встроенных. Главное — можно назначить разным агентам разные модели: ```toml name = "explorer" description = "Быстрый исследователь кодовой базы — ищет файлы и связи." model = "gpt-5.3-codex-spark" model_reasoning_effort = "medium" sandbox_mode = "read-only" developer_instructions = """ Режим исследования. Трассируй реальные пути выполнения, указывай файлы и символы. Не предлагай фиксы, если родительский агент не попросит. """ ``` Как выбирать модель: | Модель | Когда использовать | Нюанс | | ------------------- | -------------------------------------------- | -------------------------------------- | | gpt-5.4 | Основной агент, сложные задачи, координация | \~7 кредитов/сообщение | | gpt-5.3-codex | Субагенты-воркеры, exploration, суммаризация | \~5 кредитов/сообщение | | gpt-5.3-codex-spark | Максимальная скорость для лёгких задач | Только Pro ($200/мес), отдельный лимит | | gpt-5.1-codex-mini | Простые рутинные задачи | \~1 кредит/сообщение, самый экономный | Reasoning effort: | Уровень | Когда | | ------- | ---------------------------------------- | | high | Сложная логика, edge cases, безопасность | | medium | Большинство задач (дефолт) | | low | Простые задачи, где важна скорость | Чем выше reasoning — тем дольше ответ и больше токенов. Для exploration-агента `low` или `medium` хватит за глаза. ## Шаг 4\. Собери команду агентов Самое интересное начинается, когда собираешь нескольких агентов в связку. Покажу на примере ревью PR — тут это прям заходит. Конфиг проекта (`.codex/config.toml`): ```toml [agents] max_threads = 6 max_depth = 1 ``` Исследователь (`.codex/agents/pr-explorer.toml`): ```toml name = "pr_explorer" description = "Read-only исследователь для сбора контекста перед ревью." model = "gpt-5.3-codex-spark" model_reasoning_effort = "medium" sandbox_mode = "read-only" developer_instructions = """ Режим исследования. Трассируй реальные пути выполнения, указывай файлы и символы. Не предлагай фиксы. Быстрый поиск и точечное чтение файлов вместо широких сканов. """ ``` Ревьюер (`.codex/agents/reviewer.toml`): ```toml name = "reviewer" description = "Ревьюер PR — корректность, безопасность, тестовое покрытие." model = "gpt-5.4" model_reasoning_effort = "high" sandbox_mode = "read-only" developer_instructions = """ Ревьюь код как владелец. Приоритет: корректность, безопасность, регрессии, пропущенные тесты. Конкретные находки с шагами воспроизведения. Стилистические замечания — только если за ними прячется реальный баг. """ ``` Исследователь документации (`.codex/agents/docs-researcher.toml`): ```toml name = "docs_researcher" description = "Проверяет API и поведение фреймворков через MCP-сервер документации." model = "gpt-5.3-codex-spark" model_reasoning_effort = "medium" sandbox_mode = "read-only" developer_instructions = """ Используй MCP-сервер документации для проверки API, опций и version-specific поведения. Возвращай краткие ответы со ссылками. Не меняй код. """ [mcp_servers.openaiDeveloperDocs] url = "https://developers.openai.com/mcp" ``` Теперь запускай: ``` Проревьюь эту ветку против main. Пусть pr_explorer найдёт затронутые пути, reviewer — реальные риски, а docs_researcher проверит API фреймворков, которые используются в патче. ``` Codex запустит трёх агентов параллельно, подождёт и соберёт результаты в один ответ. Удобно. ## Шаг 5\. Настрой никнеймы (опционально) Когда запущено несколько экземпляров одного агента, в UI они сливаются — непонятно, кто что делает. Никнеймы это решают: ```toml name = "reviewer" description = "Ревьюер PR." developer_instructions = "..." nickname_candidates = ["Atlas", "Delta", "Echo"] ``` Codex присвоит каждому экземпляру `reviewer` уникальный никнейм из списка. Это чисто визуальная штука — внутри агент всё равно идентифицируется по `name`. ## Шаг 6\. Обработка CSV-батчей (экспериментально) Отдельная экспериментальная штука — `spawn_agents_on_csv`. Когда задач много и они однотипные (проревьюить 50 файлов, проверить 100 инцидентов), можно скормить CSV и получить результат в CSV. Как это работает: 1. Создаёшь CSV с данными — по строке на задачу 2. Codex запускает по одному субагенту на строку 3. Каждый агент вызывает `report_agent_job_result` с результатом 4. Результаты собираются в выходной CSV Пример промпта: ``` Создай /tmp/components.csv с колонками path,owner — по строке на каждый фронтенд-компонент. Затем вызови spawn_agents_on_csv: - csv_path: /tmp/components.csv - id_column: path - instruction: "Проверь {path} (владелец {owner}). Верни JSON с ключами path, risk, summary, follow_up через report_agent_job_result." - output_csv_path: /tmp/components-review.csv - output_schema: объект с обязательными string-полями path, risk, summary, follow_up ``` Если воркер завершится без вызова `report_agent_job_result`, Codex пометит строку ошибкой в итоговом CSV. ## Результат Если всё сделал правильно, у тебя теперь набор агентов под конкретные задачи. Ревью, exploration и анализ идут одновременно, а основной контекст не забивается промежуточным мусором. В CLI набери `/agent` — увидишь все активные потоки. Можно переключаться между ними, останавливать или перенаправлять. ## Глобальные настройки В `config.toml` есть три параметра, которые стоит знать: | Параметр | По умолчанию | Что делает | | --------------------------------- | ------------ | -------------------------------------------------------------------- | | agents.max\_threads | 6 | Максимум одновременных потоков агентов | | agents.max\_depth | 1 | Глубина вложенности (1 = субагент не может запускать свои субагенты) | | agents.job\_max\_runtime\_seconds | 1800 | Таймаут на воркера в CSV-батче | Мне кажется, дефолтный `max_depth = 1` — это правильно. Субагенты, которые запускают свои субагенты — это рецепт для неконтролируемых расходов на токены. ## Частые ошибки Субагенты не запускаются. Codex не запускает их сам — нужно явно попросить. Формулировки типа «запусти агентов параллельно», «spawn subagents», «по одному агенту на задачу» работают. Конфликты при параллельной записи. Если два субагента редактируют один файл, будут проблемы. Для записи оставляй одного агента, остальных сажай в `read-only`. Вообще параллельные субагенты лучше всего заходят на задачах чтения: exploration, тесты, анализ. Расход токенов. Каждый субагент — отдельная модельная сессия. Пять параллельных агентов потратят примерно в 5 раз больше токенов, чем один. Для read-only воркеров бери `gpt-5.3-codex` (\~5 кредитов вместо \~7 у gpt-5.4) или `gpt-5.1-codex-mini` (\~1 кредит) для совсем простых задач. `gpt-5.3-codex-spark` быстрее всех, но доступен только на Pro и тратит отдельный лимит. ## FAQ ### Субагенты работают в IDE Extension? Пока нет — только в Codex CLI и Codex App. OpenAI обещают добавить поддержку в IDE Extension, но дат не называют. ### Можно ли подключить MCP-серверы к кастомному агенту? Да. В TOML-файле агента добавь секцию `[mcp_servers.имя_сервера]` с полем `url`. Агент получит доступ к инструментам этого сервера. ### Чем субагенты в Codex отличаются от Claude Code? По сути одно и то же: параллельные специализированные агенты. Разница в конфигурации — Codex использует TOML-файлы, Claude Code настраивается через системный промпт. В Codex можно явно задать модель и reasoning effort для каждого агента, что удобнее. Встроенные агенты (explorer, worker) есть у обоих. ### Субагенты наследуют права родительского агента? Да. Sandbox-политика, approval-настройки и runtime-овверайды наследуются от родительской сессии. Но можно переопределить `sandbox_mode` в TOML-файле конкретного агента — например, поставить `read-only` для исследователей. ### Сколько субагентов можно запустить одновременно? По умолчанию — 6 (параметр `agents.max_threads`). Можно увеличить, но учитывай расход токенов и время ожидания. ## Что ещё почитать - [3 паттерна воркфлоу AI-агентов: когда какой использовать](https://blog.matveev.tech/patterny-workflow-ai-agentov/?ref=matveev.tech) — когда нужен single agent, а когда мультиагентная схема - [Codex CLI vs Claude Code: что выбрать для кодинга](https://blog.matveev.tech/codex-cli-vs-claude-code-sravnenie/?ref=matveev.tech) — детальное сравнение двух CLI-агентов - [AI-агенты в 2026: что реально работает](https://blog.matveev.tech/ai-agenty-2026-tipy-arhitektury/?ref=matveev.tech) — типы и архитектуры агентов ### GLM-5-Turbo: цены, сравнение с GLM-5 и настройка OpenClaw URL: https://matveev.tech/glm-5-turbo-zhipu-ai/ Last updated: 2026-03-17T16:25:00.000Z > TL;DR: Zhipu AI выпустила GLM-5-Turbo — закрытую версию GLM-5 для агентных задач. $1.20/1M токенов на вход, контекст 200K, ошибки вызова инструментов 0.67% (у базовой GLM-5 — от 2.3% до 6.4%). Доступна через API и на OpenRouter. Китайская Zhipu AI (торговая марка Z.AI) [выпустила GLM-5-Turbo](https://docs.z.ai/guides/llm/glm-5-turbo?ref=matveev.tech), вариант флагманской GLM-5, оптимизированный для агентных воркфлоу. Главная целевая платформа — [OpenClaw](https://docs.openclaw.ai/?ref=matveev.tech), независимый open source проект. ## Чем GLM-5-Turbo отличается от GLM-5 GLM-5-Turbo построена на базе GLM-5 (744B параметров, MoE с \~44B активных на токен), но заточена под агентное выполнение. Основные отличия по [данным OpenRouter](https://openrouter.ai/z-ai/glm-5-turbo?ref=matveev.tech): | | GLM-5 | GLM-5-Turbo | | -------------------- | ----------------------------------- | ----------- | | Контекст | 200K | 200K | | Макс. выход | 128K | 128K | | Лицензия | MIT (open source) | Закрытая | | Tool call error rate | 2.3–6.4% | 0.67% | | E2E latency | 9.3–11.2 сек | 8.2 сек | | Throughput | 40–70 tok/s (зависит от провайдера) | \~48 tok/s | | First token latency | 0.4–1.1 сек | 2.9 сек | Главная разница в надёжности вызова инструментов: 0.67% ошибок против 2.3–6.4% у базовой модели. Для агентов, которые цепочкой вызывают инструменты, каждый промах может сорвать весь воркфлоу. Тут Turbo заметно стабильнее. Зато первый токен приходит медленнее (2.9 сек против 0.4–1.1 сек у GLM-5 через Friendli/Parasail). Для чат-ботов это минус, для агентов, где важнее завершить задачу целиком, менее критично. ## Сколько стоит Цены на Z.AI API: $1.20/1M input, $4.00/1M output. На [OpenRouter](https://openrouter.ai/z-ai/glm-5-turbo?ref=matveev.tech) со скидкой 20%: $0.96/$3.20\. Для контекста, [по данным TokenCost](https://tokencost.app/blog/glm-5-turbo-openclaw-pricing?ref=matveev.tech): | Модель | Input/1M | Output/1M | | ----------------- | -------- | --------- | | MiniMax M2.5 | $0.15 | $0.60 | | Kimi K2.5 | $0.35 | $1.40 | | GLM-5 (base) | $1.00 | $3.20 | | GLM-5-Turbo | $1.20 | $4.00 | | Claude Haiku 4.5 | $1.00 | $5.00 | | Claude Sonnet 4.5 | $3.00 | $15.00 | | Claude Opus 4.6 | $5.00 | $25.00 | GLM-5-Turbo стоит чуть дороже базовой GLM-5, и в 8 раз дороже MiniMax M2.5\. При этом MiniMax M2.5 набирает 80.2 на SWE-bench против 77.8 у GLM-5\. Аргумент Zhipu в том, что SWE-bench не измеряет то, что важно для агентов: стабильность длинных цепочек вызовов и работу с инструментами. Для подписчиков GLM Coding доступны тарифы: Lite ($27/квартал), Pro ($81/квартал), Max ($216/квартал). Pro-подписчики получают GLM-5-Turbo сразу, Lite — с апреля. ## Как подключить GLM-5-Turbo ### Через OpenAI SDK API совместим с OpenAI SDK. Минимальная миграция: ```python from openai import OpenAI client = OpenAI( api_key="ваш-z-ai-api-key", base_url="https://api.z.ai/api/paas/v4/", ) response = client.chat.completions.create( model="glm-5-turbo", messages=[ {"role": "user", "content": "Ваш промпт"} ], ) ``` Через [OpenRouter](https://openrouter.ai/z-ai/glm-5-turbo?ref=matveev.tech) дешевле ($0.96 вместо $1.20 за 1M input) и есть автоматические фоллбэки: ```python from openai import OpenAI client = OpenAI( api_key="ваш-openrouter-key", base_url="https://openrouter.ai/api/v1", ) response = client.chat.completions.create( model="z-ai/glm-5-turbo", messages=[ {"role": "user", "content": "Ваш промпт"} ], ) ``` Поддерживаются function calling, thinking mode, structured output и стриминг. Ключ API получается на [z.ai](https://z.ai/?ref=matveev.tech). ### В OpenClaw Инструкция по [документации Z.AI](https://docs.z.ai/devpack/tool/openclaw?ref=matveev.tech): 1. Установить OpenClaw: ```bash curl -fsSL https://openclaw.ai/install.sh | bash ``` 1. При настройке (`openclaw onboard --install-daemon`) выбрать Z.AI как провайдера и ввести API-ключ. 2. Переключить модель на GLM-5-Turbo. В файле `~/.openclaw/openclaw.json` добавить модель в секцию `models.providers.zai.models`: ```json { "id": "glm-5-turbo", "name": "GLM-5-Turbo", "reasoning": true, "input": ["text"], "contextWindow": 204800, "maxTokens": 131072 } ``` 1. Поменять дефолтную модель в `agents.defaults.model`: ```json "primary": "zai/glm-5-turbo", "fallbacks": ["zai/glm-5", "zai/glm-4.7"] ``` 1. Перезапустить: `openclaw gateway restart`. Skills (навыки агента) ставятся через [ClawHub](https://clawhub.ai/?ref=matveev.tech): `clawhub search "тема"` → `clawhub install название`. Именно рост использования Skills с 26% до 45% стал одной из причин, почему Zhipu сделала отдельную модель под OpenClaw. ## Бенчмарк ZClawBench Вместе с моделью Zhipu представила [ZClawBench](https://docs.z.ai/guides/llm/glm-5-turbo?ref=matveev.tech) — свой бенчмарк для агентных сценариев, построенный на типичных задачах OpenClaw. Покрывает настройку окружений, разработку, поиск информации, анализ данных и автоматизацию. ![Результаты ZClawBench — GLM-5-Turbo обходит GLM-5 и ряд конкурентов в агентных задачах](https://matveev.tech/content/images/2026/03/glm-5-turbo-zclawbench.png) По радарной диаграмме от Zhipu, GLM-5-Turbo обходит базовую GLM-5 во всех категориях. Но тут важная оговорка: конкретные цифры ZClawBench пока не опубликованы, это данные вендора без независимой валидации. Датасет и траектории выложены в открытый доступ, так что проверить можно. Пишу про модели, агентов и инструменты для разработки с AI — [подписывайся в Telegram](https://t.me/ctospeech?ref=matveev.tech). --- Zhipu пошли нетипичным путём: вместо того чтобы взять готовую модель и прикрутить function calling сверху, они тренировали GLM-5-Turbo на агентных данных с самого начала. По [анализу VentureBeat](https://venturebeat.com/technology/z-ai-debuts-faster-cheaper-glm-5-turbo-model-for-agents-and-claws-but-its?ref=matveev.tech), модель позиционируется не как замена GLM-5, а как коммерческий ответвление: быстрее, стабильнее в агентных цепочках, но закрытая. GLM-5 вышла под MIT-лицензией, и Zhipu строила репутацию на открытости. GLM-5-Turbo закрыта. Zhipu обещает, что наработки из Turbo попадут в будущие open source релизы, но саму модель открывать не планирует. Для тех, кто строит агентов и ищет альтернативу OpenAI с Anthropic, GLM-5-Turbo — вариант с нативной поддержкой MCP и OpenAI-совместимым API. Но цена не бюджетная: MiniMax M2.5 в 8 раз дешевле и на SWE-bench набирает больше. Аргумент за Turbo — стабильность инструментов в длинных агентных цепочках, и тут данные OpenRouter (0.67% ошибок) пока выглядят убедительно. ## Что ещё почитать - [GLM-4.7: что нового в модели Zhipu](https://matveev.tech/glm-4-7-obzor) — предыдущее поколение моделей Zhipu - [Память AI-агентов: контекст, RAG, графы и mem0](https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0) — как агенты работают с контекстом - [Топ-6 AI-агентов для кода в 2026](https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026) — обзор конкурентов в агентном пространстве ### Pencil: дизайн в IDE через MCP URL: https://matveev.tech/pencil-dev-mcp-design-canvas/ Last updated: 2026-03-17T09:00:49.000Z > TL;DR: Pencil — канвас для дизайна, который живёт прямо в твоём IDE. Файлы `.pen` хранятся в Git-репозитории, AI через MCP рисует и правит макеты, а на выходе — готовый HTML, CSS или React-код. Работает с Claude Code, Cursor, VS Code, Windsurf и OpenAI Codex. ## Как работает Pencil Pencil — бесконечный канвас для дизайна. Запускается как расширение для IDE или отдельное десктопное приложение. Файлы дизайна (формат `.pen`) лежат прямо в репозитории проекта. ![Канвас Pencil в IDE — дизайн интерфейса прямо рядом с кодом](https://matveev.tech/content/images/2026/03/pencil-dev-canvas.png) Под капотом — MCP (Model Context Protocol). Когда Pencil запущен, он поднимает локальный MCP-сервер. AI-ассистент подключается и получает инструменты: создавать элементы, двигать, менять цвета, делать скриншоты для проверки. MCP тут двусторонний, то есть AI не просто читает файл, а реально рисует на канвасе. ## С чем работает По [документации](https://docs.pencil.dev/getting-started/ai-integration?ref=matveev.tech) Pencil работает с Claude Code, Cursor, VS Code, Windsurf, OpenAI Codex CLI, OpenCode CLI и Claude Desktop. Вообще, если твой инструмент поддерживает MCP — скорее всего, подключится. ## Что умеет ### Vibe designing Пишешь промпт прямо в контексте дизайна. «Создай дашборд с сайдбаром и графиками» — AI рисует на канвасе. «Сделай сайдбар уже», «поменяй кнопки на синие» — правит. Работает как vibe coding в Cursor, только вместо строчек кода ты двигаешь визуальные элементы. ![Генерация HTML/CSS/React кода из дизайна Pencil](https://matveev.tech/content/images/2026/03/pencil-dev-code-gen.png) ### Из вектора в код Pencil генерирует HTML, CSS и React-компоненты из макета. Обещают pixel-perfect — насколько это правда на сложных лейаутах, я пока не проверял, но на демо выглядит убедительно. ### Design as code Файлы `.pen` — открытый формат. Можно дебажить, парсить своими скриптами. И они версионируются через Git: ветки, мерджи, диффы. Дизайнер сломал макет? `git blame` покажет кто и когда. ### Импорт из Figma Если у тебя уже есть дизайны в Figma, можно скопировать и вставить — векторы, текст, стили переносятся. ### Готовые дизайн-kit's Внутри есть готовые наборы компонентов — кнопки, формы, карточки. Можно собирать из них или подключить свою дизайн-систему из кодовой базы. ## Как выглядит рабочий процесс Типичная сессия по документации: 1. Запускаешь Pencil и Claude Code 2. Открываешь `.pen` файл в IDE 3. Пишешь: «Создай hero-секцию лендинга с заголовком и CTA» 4. AI через MCP рисует на канвасе 5. Уточняешь: «Добавь секцию фич в три колонки» 6. Просишь: «Сгенерируй React-компонент для всей страницы» 7. Коммитишь `design.pen` и `landing.tsx` вместе Весь цикл без переключения между приложениями. Дизайн и код коммитятся в одном PR. [Pencil – Design on canvas. Land in code.Pencil fundamentally increases your engineering speed by bringing designing directly into your preferred IDE.![](https://static.ghost.org/v5.0.0/images/link-icon.svg)Pencil![](https://matveev.tech/content/images/thumbnail/og-image-2.png)](https://www.pencil.dev/?ref=matveev.tech) ## Что ещё почитать - [UI UX Pro Max: AI-навык для дизайна в Claude Code и Cursor](https://blog.matveev.tech/ui-ux-pro-max-skill-obzor/?ref=matveev.tech) — ещё один подход к дизайну через AI-агентов - [Топ-6 AI-агентов для кода в 2026](https://blog.matveev.tech/luchshie-ai-agenty-dlya-koda-2026/?ref=matveev.tech) — обзор инструментов, с которыми Pencil интегрируется ### Firecrawl CLI: веб-скрейпинг из терминала для AI-агентов URL: https://matveev.tech/firecrawl-cli-obzor/ Last updated: 2026-03-17T08:54:03.000Z > TL;DR: Firecrawl CLI — консольный инструмент для скрейпинга, краулинга и поиска по вебу. Превращает любой сайт в чистый markdown или структурированные данные для LLM. Бесплатно — 500 страниц, дальше от $16/мес. Если ты работаешь с AI-агентами или просто хочешь быстро вытащить данные с сайта, рано или поздно упираешься в одну проблему: большинство скрейперов ломаются на JavaScript-страницах, возвращают мусорный HTML или требуют танцев с бубном для настройки. Firecrawl CLI — попытка решить это одной командой в терминале. ## Что это и зачем Firecrawl — Web Data API для AI. Даёшь ему URL, получаешь чистый контент: markdown, JSON, структурированные данные. Без возни с парсерами и headless-браузерами. CLI — обёртка над их API для работы прямо из терминала. Запустили в январе 2026 года, и за пару месяцев инструмент оброс интеграциями с Claude Code, OpenAI Codex, Gemini CLI через Skills-протокол. По заявлениям разработчиков, Firecrawl покрывает 96% веба, включая тяжёлые JS-страницы, и отдаёт результат менее чем за секунду. На бенчмарках — больше 80% покрытия контента при тестировании на 1000 URL. Цифры, конечно, маркетинговые, но в целом инструмент работает заметно надёжнее, чем голый `curl`. ## Быстрый старт Установка в одну строку — нужен Node.js: ```bash npm install -g firecrawl-cli ``` Или сразу с полной настройкой (логин + браузер): ```bash npx -y firecrawl-cli@latest init --all --browser ``` После установки залогинься: ```bash firecrawl login ``` Откроется браузер для авторизации. Можно также задать API-ключ через переменную окружения `FIRECRAWL_API_KEY`. Первый скрейп: ```bash firecrawl https://example.com ``` Вот и всё. На выходе — чистый markdown с содержимым страницы. Весь процесс занимает секунд тридцать, если Node.js уже стоит. ## Что умеет ### Scrape — извлечение контента Самая простая команда. Берёт URL, вытаскивает содержимое: ```bash firecrawl scrape https://example.com --format markdown,links --only-main-content ``` Форматов куча: markdown, HTML, raw HTML, ссылки, картинки, скриншоты, JSON. Можно брать только основной контент без навигации и футеров. JS-страницы рендерит с настройкой задержки, что полезно для SPA. ### Search — поиск по вебу Поиск по вебу с возможностью сразу заскрейпить найденное: ```bash firecrawl search "React server components" --tbs qdr:w --scrape ``` `--tbs qdr:w` фильтрует за последнюю неделю. Есть фильтры по источникам, категориям, локации. Я использую это для ресёрча: нашёл релевантное и сразу вытащил текст. ### Crawl — обход сайта Рекурсивный краулинг с настройкой глубины и лимита страниц: ```bash firecrawl crawl https://docs.example.com --wait --limit 100 ``` Флаг `--wait` заставляет дождаться завершения. Без него процесс запускается асинхронно. Это удобно для больших сайтов — запустил и вернулся за результатом. ### Map — карта сайта Находит все URL на домене, но ничего не скрейпит: ```bash firecrawl map https://example.com ``` Полезная штука перед краулингом. Сначала смотришь, сколько на сайте страниц, потом решаешь что тащить. ### Agent — AI-агент Вот это, мне кажется, самое интересное. Описываешь задачу словами, агент сам разбирается: ```bash firecrawl agent "Extract pricing plans from this SaaS website" --wait ``` 5 запусков в день бесплатно. Агент сам навигирует по сайту, кликает, скроллит. По сути это браузерная автоматизация, только вместо xpath-селекторов ты пишешь на человеческом языке. ### Интеграция с AI-агентами CLI можно подключить как Skill для Claude Code, Codex и других агентов: ```bash firecrawl setup skills firecrawl setup mcp ``` После этого агент сам скрейпит и ищет когда нужно. Я, например, использую Firecrawl через MCP в Claude Code и это реально экономит время. ## Тарифы | План | Цена/мес | Кредиты | Параллельных запросов | | ---------- | ---------- | ------------ | --------------------- | | Free | $0 | 500 (разово) | 2 | | Hobby | $16 | 3 000 | 5 | | Standard | $83 | 100 000 | 50 | | Growth | $333 | 500 000 | 100 | | Scale | $599 | 1 000 000 | 150 | | Enterprise | По запросу | Без лимита | Custom | Цены при годовой оплате. 1 кредит = 1 скрейп или 1 страница при краулинге. Поиск стоит 2 кредита за 10 результатов. Браузерная автоматизация — 2 кредита в минуту. Бесплатного плана хватит попробовать и понять, подходит ли инструмент. 500 страниц — это, по сути, один небольшой сайт. Карточку не просят. ## Вердикт Инструмент крепкий. Если тебе нужен скрейпинг из терминала и ты готов платить за облачный API, Firecrawl CLI делает это хорошо. Бесплатных 500 кредитов хватит разве что попробовать. Hobby за $16 тоже не разгуляешься с 3 000 кредитами. Но для задач вроде «собрать данные с 50 страниц документации» этого достаточно. Думаю, главная фишка — интеграция с AI-агентами. Когда Claude Code сам вызывает `firecrawl scrape` по ходу работы, это снимает кучу ручных действий. Если работаешь в таком стеке, попробовать точно стоит. Если нет — есть бесплатные альтернативы вроде `curl` \+ `readability-cli`, просто с ними придётся повозиться. [GitHub - firecrawl/cli: CLI and Agent Skill for Firecrawl - Add scrape, search, and browsing capabilities to your AI agentsCLI and Agent Skill for Firecrawl - Add scrape, search, and browsing capabilities to your AI agents - firecrawl/cli![](https://matveev.tech/content/images/icon/pinned-octocat-093da3e6fa40-2.svg)GitHubfirecrawl![](https://matveev.tech/content/images/thumbnail/cli-1)](https://github.com/firecrawl/cli?ref=matveev.tech) ## Что ещё почитать - [CLI-Anything: превращаем любой софт в CLI для AI-агентов](https://matveev.tech/cli-anything-obzor/) — похожая идея, но для произвольного софта - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — оптимизация MCP-интеграций - [Kimi Code — open-source CLI-агент для кодинга](https://matveev.tech/kimi-code-cli-obzor/) — ещё один CLI-инструмент в мире AI-агентов ### UI UX Pro Max: AI-навык для дизайна в Claude Code и Cursor URL: https://matveev.tech/ui-ux-pro-max-skill-obzor/ Last updated: 2026-03-16T08:14:07.000Z > TL;DR: UI UX Pro Max — AI-навык (skill) для кодинг-ассистентов вроде Claude Code, Cursor и Windsurf. Ты описываешь задачу словами, а он сам подбирает стиль, палитру, типографику и генерирует дизайн-систему. 40 тысяч звёзд на GitHub и поддержка 15 платформ. Если ты когда-нибудь просил Claude Code или Cursor «сделай красивый лендинг», то наверняка получал что-то… функциональное. Технически работает, но выглядит как шаблон из 2019 года. UI UX Pro Max пытается это исправить — он добавляет AI-ассистентам понимание дизайна. ## Что это вообще такое UI UX Pro Max — это skill (навык), который устанавливается в AI-кодинг-ассистент и активируется автоматически, когда ты просишь что-то связанное с UI. Не плагин, не расширение, а именно навык — набор правил и данных, которые ассистент использует при генерации кода. В комплекте идёт: - 67 UI-стилей, от минимализма и glassmorphism до cyberpunk UI и spatial UI в стиле VisionOS - 161 цветовая палитра, привязанная к индустриям - 57 шрифтовых пар с готовыми импортами Google Fonts - 25 типов графиков для дашбордов - 99 UX-гайдлайнов по доступности - 161 правило для конкретных индустрий, от финтеха до ветеринарных клиник Числа звучат маркетингово, но за ними реальная структура — это не просто текстовые промпты, а каталог с поиском по доменам. ## Главная фишка v2.0 — генератор дизайн-систем В версии 2.0 появился reasoning engine. Работает так: ты описываешь задачу («сделай лендинг для SaaS-продукта»), а движок параллельно ищет по пяти доменам — тип продукта, стили, цвета, паттерны, типографика. Потом применяет индустриальные правила, фильтрует антипаттерны и выдаёт готовую дизайн-систему. Движок выдаёт паттерн интерфейса, стиль, палитру, шрифты, эффекты анимации, список антипаттернов и чеклист перед отправкой. Мне нравится идея с антипаттернами. Когда AI знает, что для медицинского сайта не стоит использовать яркие кислотные цвета, а для финтеха — анимации-вертушки, результат получается заметно адекватнее. ## Как установить Рекомендуемый способ — через CLI: ```bash npm install -g uipro-cli cd /path/to/your/project uipro init --ai claude # для Claude Code uipro init --ai cursor # для Cursor uipro init --ai windsurf # для Windsurf uipro init --ai all # для всех сразу ``` Поддерживается 15 ассистентов: Claude Code, Cursor, Windsurf, Copilot, Kiro, Codex CLI, Qoder, Roo Code, Gemini CLI, Trae, OpenCode, Continue, CodeBuddy, Droid и Antigravity. Я не видел другого навыка с таким охватом платформ. Есть и ручная установка через маркетплейс, но CLI удобнее — он сам создаёт правильную структуру файлов. ## Как это работает на практике После установки навык активируется сам. Пишешь в чат что-то вроде: - «Сделай лендинг для моего SaaS-продукта» - «Создай дашборд для медицинской аналитики» - «Дизайн портфолио с тёмной темой» - «UI для e-commerce мобильного приложения» Ассистент подхватывает контекст, генерирует дизайн-систему и пишет код. Цвета, шрифты и отступы подбираются под тип продукта автоматически. Для Kiro, Copilot и Roo Code работает немного иначе — через слеш-команду `/ui-ux-pro-max`. ## Поддержка технологий | Категория | Стеки | | -------------- | ------------------------------ | | Web | HTML + Tailwind (по умолчанию) | | React | React, Next.js, shadcn/ui | | Vue | Vue, Nuxt.js, Nuxt UI | | Другое | Svelte, Astro | | iOS | SwiftUI | | Android | Jetpack Compose | | Кроссплатформа | React Native, Flutter | Если не указать стек в промпте, по умолчанию будет HTML + Tailwind. Для быстрых прототипов нормально, но для реального проекта на Next.js лучше сразу указать стек, чтобы не переделывать. ## Продвинутые штуки Для тех, кто хочет больше контроля, есть CLI-скрипт на Python: ```bash # Генерация дизайн-системы python3 .claude/skills/ui-ux-pro-max/scripts/search.py "beauty spa wellness" \ --design-system -p "Serenity Spa" # Поиск по домену python3 .claude/skills/ui-ux-pro-max/scripts/search.py "glassmorphism" --domain style # Гайдлайны под конкретный стек python3 .claude/skills/ui-ux-pro-max/scripts/search.py "form validation" --stack react ``` А ещё можно сохранить дизайн-систему в файлы проекта (паттерн Master + Overrides): ``` design-system/ ├── MASTER.md # Глобальные правила └── pages/ └── dashboard.md # Переопределения для конкретной страницы ``` Штука удобная, если проект большой и нужно единообразие между сессиями. Ассистент сначала проверяет файл страницы, потом Master — получается иерархия правил. ## Вывод AI-ассистенты пишут код, но не понимают дизайн. UI UX Pro Max пытается закрыть этот разрыв набором правил и каталогов. Для прототипов и MVP, где нет дизайнера, это заметно лучше, чем дефолтный результат ассистента. Если в команде уже есть дизайн-система, навык скорее будет мешать, чем помогать. Установка через CLI занимает минуту. Если часто собираешь интерфейсы через Claude Code или Cursor, стоит попробовать хотя бы на тестовом проекте. [GitHub - nextlevelbuilder/ui-ux-pro-max-skill: An AI SKILL that provide design intelligence for building professional UI/UX multiple platformsAn AI SKILL that provide design intelligence for building professional UI/UX multiple platforms - nextlevelbuilder/ui-ux-pro-max-skill![](https://matveev.tech/content/images/icon/pinned-octocat-093da3e6fa40-5.svg)GitHubnextlevelbuilder![](https://matveev.tech/content/images/thumbnail/d7c84c2d-e797-405f-a868-87fb194e8432)](https://github.com/nextlevelbuilder/ui-ux-pro-max-skill?ref=matveev.tech) ## Что ещё почитать - [CLI-Anything: превращаем любой софт в CLI для AI-агентов](https://matveev.tech/cli-anything-obzor/) — ещё один инструмент для расширения возможностей ассистентов - [Qoder — AI-IDE от Alibaba с Quest Mode](https://matveev.tech/qoder-ide-obzor/) — одна из поддерживаемых IDE - [Cursor Cloud Agents: агенты с виртуальными машинами](https://matveev.tech/cursor-cloud-agents-computer-use/) — Cursor тоже в списке поддержки ### Что реально умеет OpenClaw: 10 кейсов от торга за авто до CI/CD URL: https://matveev.tech/openclaw-kejsy-ispolzovaniya/ Last updated: 2026-03-15T17:11:50.000Z > **TL;DR:** OpenClaw — open-source AI-агент с 175K+ звёзд на GitHub, который работает автономно и делает вещи за тебя: торгуется с дилерами, оспаривает страховые, чинит баги в CI/CD. Собрал 10 реальных кейсов от пользователей — с честной оценкой, что работает, а что пока сырое. Когда я первый раз увидел OpenClaw, подумал: «Ещё один чат-бот с красивым лендингом». Но потом полез на GitHub — 300 тысяч звёзд, MIT-лицензия, 700+ community skills. И главное — люди реально пишут, как агент делает за них конкретные вещи. Не «генерирует текст», а звонит по телефону, торгуется за машину, открывает pull request'ы. Я покопался в отзывах, собрал самые интересные кейсы и добавил свои комментарии. Некоторые из них впечатляют, другие — ну, скажем так, заставляют задуматься. ## Что отличает OpenClaw от обычных чат-ботов Если коротко — проактивность. У OpenClaw есть heartbeat: каждые 30 минут агент «просыпается» и проверяет, не нужно ли что-то сделать. Это не привычная схема «ты спросил — я ответил». Агент сам инициирует действия, подключается к внешним сервисам и выполняет задачи без твоего участия. По [данным GitHub-репозитория](https://github.com/openclaw/openclaw?ref=matveev.tech), проект набрал более 300 00 звёзд и поддерживает 700+ community skills — от управления умным домом до интеграции с Sentry. Звучит как J.A.R.V.I.S. из Marvel? Erik Chen так и [написал на Medium](https://medium.com/@erikchen?ref=matveev.tech): «Впервые со времён появления LLM я реально чувствую, что разговариваю с J.A.R.V.I.S.». Я бы не заходил так далеко, но понимаю, откуда это ощущение. ## 10 реальных кейсов ### 1\. Торг за автомобиль — минус $4 200 AJ Stuyvenberg настроил агента на переписку с автодилерами по email. Агент вёл переговоры, пока хозяин "спал". Итог — цена автомобиля снизилась на $4 200. Думаю, тут сработало то, что агент не устаёт и не стесняется писать в третий раз. Люди обычно сдаются после первого «нет». Агенту всё равно. ### 2\. Спор со страховой компанией Пользователь [@Hormold](https://twitter.com/Hormold?ref=matveev.tech) рассказал, как OpenClaw оспорил решение страховой Lemonade. Агент составил юридическое возражение с ссылками на условия полиса — и страховая пересмотрела дело. Мне кажется, это один из самых полезных сценариев. Не потому что агент гениальный юрист, а потому что большинство людей просто не станут тратить время на составление такого письма. А агент — составит. ### 3\. CI/CD мониторинг и автоисправления [@nateliason](https://twitter.com/nateliason?ref=matveev.tech) подключил OpenClaw к CI/CD пайплайну. Агент запускает тесты, ловит ошибки через Sentry webhook, пытается исправить их и открывает PR автоматически. Вот это по-настоящему интересный кейс для разработчиков. Похоже на то, что делают [Claude Code Hooks](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — автоматические реакции на события в процессе разработки. Только OpenClaw работает как внешний агент, а не встроенный инструмент. ### 4\. Персональные медитации с генерацией голоса [@stolinski](https://twitter.com/stolinski?ref=matveev.tech) использует OpenClaw для создания персональных медитаций. Агент генерирует текст, озвучивает через ElevenLabs и добавляет эмбиент-звуки. Если ты работаешь с голосовыми сервисами, можешь глянуть [обзор Voice Studio Companion](https://matveev.tech/voice-studio-companion/) — там тоже ElevenLabs, но для других задач. ### 5\. Телефонные звонки с акцентом [@mirthtime](https://twitter.com/mirthtime?ref=matveev.tech) рассказал, как агент позвонил владельцу недвижимости и разговаривал с австралийским акцентом через ElevenLabs. Не знаю, зачем именно австралийский акцент, но сам факт, что AI-агент совершает реальные телефонные звонки — это уже другой уровень. Честно? Меня это немного напрягает. Когда агент пишет email — окей, получатель может перечитать и подумать. А вот реальный звонок от AI, который притворяется человеком... Тут есть этические вопросы. ### 6\. Kanban-доска за час Инженер из 1Password попросил агента построить полнофункциональную kanban-доску. За час агент собрал рабочий прототип. Ничего сверхъестественного — любой хороший кодовый агент справится. Но час на полнофункциональную доску, включая drag-and-drop — это норм. ### 7\. Управление умным домом В community skills есть интеграции с Philips Hue, Sonos, термостатами и другими устройствами. Можно попросить агента «включи свет в гостиной и поставь Lo-Fi на Sonos», и он это сделает. В комбинации с heartbeat получается интересная штука — агент может сам выключать свет, когда все ушли, или менять температуру по расписанию. ### 8\. Утренний брифинг (когда работает) Heartbeat будит агента утром, он собирает новости, погоду, события из календаря и отправляет всё в мессенджер. Звучит красиво. Но вот Casey Newton из Platformer рассказал, что удалил OpenClaw через неделю, потому что утренний брифинг так и не заработал нормально. И я слышал похожие отзывы: heartbeat-функции пока нестабильны, расписание сбивается, агент иногда молчит без видимых причин. ### 9\. Email-автоматизация Чтение, сортировка, ответы на рутинные письма. Звучит как мечта любого, кто получает 100+ писем в день. Но тут есть проблема, о которой мало кто говорит: prompt injection через email. Если агент читает входящие письма и действует на основе их содержания, злоумышленник может отправить письмо с инструкциями для агента. Это реальный вектор атаки, и пока у OpenClaw нет надёжной защиты от этого. Стоит помнить об этом, прежде чем давать агенту доступ к почте. ### 10\. Мониторинг серверов Настройка алертов в Telegram при падении сервисов. Агент проверяет доступность, и если что-то падает — шлёт уведомление. Не скажу, что это киллер-фича — для мониторинга есть UptimeRobot, Grafana, десятки других инструментов. Но если ты уже используешь OpenClaw и хочешь всё в одном месте — почему нет. ## Что говорят те, кто разочаровался Я бы соврал, если бы сказал, что все отзывы восторженные. На Hacker News один из пользователей написал: «Бесит ли меня, что я прошу его что-то сделать, а он выполняет примерно треть? Конечно бесит». И это честная оценка. OpenClaw впечатляет в демо, но в повседневном использовании агент часто: - Выполняет задачу частично - Теряет контекст между сессиями - Не сообщает, что не справился — просто молчит Heartbeat-функции, по отзывам, работают через раз. Расписание сбивается, триггеры не срабатывают. Для критичных задач я бы пока не стал полагаться только на OpenClaw. ## Для кого OpenClaw подходит лучше всего По моим наблюдениям, OpenClaw раскрывается в трёх сценариях: Во-первых, задачи, которые ты просто не стал бы делать сам — написать возражение страховой, торговаться по email, составить длинное формальное письмо. Агент не идеален, но он хотя бы попробует. Во-вторых, автоматизация для разработчиков — CI/CD, мониторинг, PR на мелкие фиксы. Если тебе интересна тема AI-агентов в разработке, посмотри как работают [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — там другой подход, но задачи похожие. В-третьих, если хочешь поиграть с интеграциями — умный дом, голосовые сервисы, мессенджеры. Но будь готов к тому, что придётся повозиться с настройкой. Это open-source, а не продукт с поддержкой. Если ищешь AI-агентов для рабочих задач с более стабильным поведением, глянь [Super Agents от ClickUp](https://matveev.tech/clickup-super-agents/) — там другая философия, но для рутины может подойти лучше. ## Что ещё почитать - [Claude Code Hooks — автоматизация, о которой ты не знал](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — если интересует автоматизация в CI/CD - [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентный подход к разработке - [Super Agents от ClickUp](https://matveev.tech/clickup-super-agents/) — AI-агенты для продуктивности - [Voice Studio Companion](https://matveev.tech/voice-studio-companion/) — работа с ElevenLabs на Mac ## FAQ **Что такое OpenClaw и чем он отличается от ChatGPT?** OpenClaw — это open-source AI-агент, который работает автономно. В отличие от ChatGPT, он не просто отвечает на вопросы, а выполняет действия: отправляет email, совершает звонки, управляет устройствами. Heartbeat каждые 30 минут позволяет ему работать без твоего участия. **OpenClaw бесплатный?** Да, проект распространяется под MIT-лицензией. Код доступен на GitHub. Но для работы нужны API-ключи от LLM-провайдеров (OpenAI, Anthropic и других), а это уже стоит денег в зависимости от использования. **Безопасно ли давать OpenClaw доступ к email?** С оговорками. Prompt injection через email — реальная угроза. Злоумышленник может отправить письмо с инструкциями для агента. Я бы не давал агенту полный доступ к рабочей почте без дополнительных фильтров. **Можно ли использовать OpenClaw для бизнеса?** Технически да, MIT-лицензия это позволяет. Но стабильность пока не на уровне коммерческих решений. Heartbeat-функции работают нестабильно, агент иногда теряет контекст. Для критичных процессов лучше иметь запасной вариант. **Какие навыки программирования нужны для настройки OpenClaw?** Базовые. Нужно уметь работать с терминалом, настроить Docker-контейнер и прописать API-ключи в конфиг. Community skills устанавливаются одной командой. Но если что-то сломается, придётся читать логи и разбираться самому. ### Apify Agent Skills: парсинг всего интернета через AI-агента URL: https://matveev.tech/apify-agent-skills-parsing/ Last updated: 2026-03-15T12:51:07.000Z > TL;DR: Apify выложил на GitHub набор из 12 скиллов для AI-агентов — парсинг Amazon, eBay, IKEA, соцсетей, Google Maps, Booking и ещё десятков платформ. Работает с Claude Code, Cursor, Codex и Gemini CLI. Всё open source, платишь только за вычислительные ресурсы Apify. Знаешь эти курсы «Как парсить интернет за 3 дня» за 50 тысяч? Или консультантов, которые внедряют тебе скрейпинг Amazon «под ключ» за шестизначные суммы? Apify только что выложил [набор скиллов](https://github.com/apify/agent-skills?ref=matveev.tech), который делает то же самое — только ты просто просишь своего AI-агента, и он разбирается сам. ## Что такое Apify Agent Skills Apify — это платформа для веб-скрейпинга с маркетплейсом готовых парсеров (они называют их Actors). Раньше, чтобы ими пользоваться, нужно было заходить в консоль, настраивать параметры, запускать руками. Сейчас они сделали прослойку между Actors и AI-агентами. Назвали её Agent Skills. Каждый скилл — это SKILL.md файл с инструкциями для LLM. Ты говоришь Claude Code «собери лиды ресторанов в Праге», агент читает инструкцию, понимает какой Actor вызвать, формирует параметры и запускает через Apify API. Результат приходит в чат, CSV или JSON. На GitHub у проекта уже 1 500 звёзд и 151 форк. Для штуки, которая появилась пару недель назад, вполне себе. ## 12 скиллов на все случаи Вот что доступно прямо сейчас: | Скилл | Что делает | | ----------------------- | ------------------------------------------------------------------------------------- | | E-commerce | Цены, отзывы, карточки товаров на Amazon, Walmart, eBay, IKEA и ещё 50+ маркетплейсах | | Lead Generation | Контакты из Google Maps, LinkedIn, Instagram, TikTok, Facebook, YouTube | | Brand Reputation | Отзывы и рейтинги с Google Maps, Booking.com, TripAdvisor, упоминания в соцсетях | | Competitor Intelligence | Стратегии, контент, цены, реклама конкурентов по данным из соцсетей и карт | | Influencer Discovery | Поиск блогеров по нише, проверка накруток, оценка аудитории | | Audience Analysis | Демография и поведение аудитории в соцсетях | | Content Analytics | Метрики вовлечённости, ROI кампаний | | Trend Analysis | Тренды через Google Trends и соцсети | | Market Research | Ценообразование, поведение потребителей, географические возможности | | Ultimate Scraper | Универсальный, если не знаешь какой выбрать — бери этот | Ещё два скилла для разработчиков: создание своих Actors и конвертация существующих проектов (JS/TS, Python, CLI) в Actors. ## Как установить Работает с основными AI-инструментами для кодинга. ### Claude Code ```bash /plugin marketplace add https://github.com/apify/agent-skills /plugin install apify-ultimate-scraper@apify-agent-skills ``` ### Cursor / Windsurf Добавляешь в `.cursor/settings.json` — формат тот же, что у Claude Code плагинов. ### Codex / Gemini CLI Указываешь путь на файл `agents/AGENTS.md` из репозитория. Gemini CLI подхватывает `gemini-extension.json` автоматически. ### Универсальный способ ```bash npx skills add apify/agent-skills ``` Для работы нужен аккаунт на [apify.com](https://apify.com/?ref=matveev.tech), API-токен (кладёшь в `.env` как `APIFY_TOKEN`) и Node.js 20.6+. ## Сколько стоит Сами скиллы бесплатные — open source. Платишь за вычислительные ресурсы Apify при запуске Actors. У Apify есть бесплатный тариф с кредитами на $5 в месяц — хватит поиграться и понять, нужно ли тебе это. Starter за $29/мес даёт больше параллельных запусков и памяти. Scale за $199/мес — для серьёзного использования со скидками на Actors из маркетплейса. Конкретная цена зависит от Actor'а, модель pay-per-result. Спарсить 1000 товаров с Amazon и собрать 10 000 лидов с Google Maps будет стоить по-разному. Но точно дешевле, чем писать и поддерживать собственные парсеры. Я не говорю, что это копейки, но для большинства задач бесплатного тарифа хватит, чтобы попробовать и понять, подходит ли тебе вообще. ## Зачем это нужно Мне кажется, главное тут не сами парсеры (Apify и раньше их предоставлял), а способ взаимодействия. Ты не лезешь в консоль и не настраиваешь скрейпер руками. Просто говоришь агенту «мне нужны цены конкурентов на Amazon в категории X», и через пару минут получаешь CSV. Раньше тебе нужно было разбираться в каждом парсере отдельно. Теперь достаточно объяснить агенту, что ты хочешь получить. Скиллы дают ему доступ к реальным данным из интернета, а не только к тому, что уместилось в контекстное окно. Так что когда в следующий раз тебе предложат курс «Автоматизация парсинга за 3 модуля» или консалтинг по внедрению мониторинга конкурентов, можешь вежливо отказаться. Или невежливо, тут на твоё усмотрение. ## Что ещё почитать - [21 плагин Claude Cowork — честный рейтинг](https://blog.matveev.tech/claude-cowork-plugins-tier-list/?ref=matveev.tech) — если интересуют плагины для Claude - [Мультиагенты в OpenAI Codex — настройка и примеры](https://blog.matveev.tech/codex-multi-agent-setup/?ref=matveev.tech) — как настроить агентов в Codex - [Cursor Cloud Agents: агенты с виртуальными машинами](https://blog.matveev.tech/cursor-cloud-agents-computer-use/?ref=matveev.tech) — агенты в Cursor - [Claude Code: как сэкономить токены на MCP с Tool Search](https://blog.matveev.tech/claude-code-tool-search-mcp-tokeny/?ref=matveev.tech) — работа с инструментами в Claude Code ### Как AI меняет рынок труда — данные Anthropic URL: https://matveev.tech/ai-rynok-truda-anthropic-issledovanie/ Last updated: 2026-03-14T17:51:51.000Z > TL;DR: Anthropic выпустили исследование с новой метрикой observed exposure — она показывает разрыв между тем, что AI теоретически может автоматизировать, и тем, что реально используется. Для программистов покрытие уже 75%, но в целом мы задействуем треть возможного. Найм молодых специалистов в уязвимых профессиях упал на 14%. Часто вижу в чатах один и тот же вопрос: «покажите конкретику использования ИИ» или «какие именно функции заменяют агенты?». Для меня ответ очевиден — все. Но я понимаю, что «все» звучит как отмазка, а не аргумент. Поэтому вот свежие данные от Anthropic, [опубликованные 5 марта 2026](https://www.anthropic.com/research/labor-market-impacts?ref=matveev.tech). Исследователи Maxim Massenkoff и Peter McCrory проанализировали реальные данные использования Claude и наложили их на базу профессий O\*NET (800 уникальных профессий в США). Получилась первая попытка измерить не «что AI может в теории», а «что AI уже делает на практике». ## Что такое observed exposure? Observed exposure — метрика, которая сочетает теоретическую способность LLM ускорить задачу минимум вдвое (по методологии [Eloundou et al., 2023](https://arxiv.org/abs/2303.10130?ref=matveev.tech)) с реальными данными использования из Anthropic Economic Index. Задача считается «покрытой», если: - теоретически выполнима с помощью LLM - реально встречается в рабочем контексте в трафике Claude - используется в автоматизированном режиме (через API), а не просто в чате Автоматизированное использование получает полный вес, а «помогающее» (augmentative) — половинный. Логика понятная: если задача прогоняется через API без участия человека, это ближе к замене, чем к подсказке. ## Разрыв между теорией и практикой Синяя область на графике — то, что AI теоретически может. Красная — что реально используется. Разрыв огромный. ![Теоретическая способность AI vs реальное использование по категориям профессий](https://matveev.tech/content/images/2026/03/anthropic-observed-exposure-cover.png) Цифры по категориям: | Категория | Теоретическое покрытие | Реальное использование | | -------------------- | ---------------------- | ---------------------- | | Computer & Math | 94% | 33% | | Office & Admin | 90% | \~15% | | Business & Financial | \~85% | \~20% | | Legal | \~80% | \~18% | Мы используем треть от возможного, и это в самой продвинутой категории. Для остальных — ещё меньше. Тут не «AI всё заменит завтра», тут «AI уже может, но люди пока не перестроились». ## Кто в зоне риска? Топ-10 самых уязвимых профессий по метрике observed exposure: ![Топ-10 профессий с максимальным покрытием AI](https://matveev.tech/content/images/2026/03/anthropic-most-exposed-occupations.png) Программисты на первом месте с 75% покрытия задач. За ними — специалисты по клиентской поддержке (основной трафик через API-автоматизацию) и операторы ввода данных (67%). На другом конце спектра — повара, механики, бармены, спасатели. 30% работников имеют нулевое покрытие, потому что их задачи просто не встречаются в данных об использовании AI. ## Портрет уязвимого работника А вот это я не ожидал. Когда говорят «потеря работы из-за AI», представляешь кассиров или водителей. В реальности всё наоборот. ![Сравнение характеристик работников с высоким и низким AI-покрытием](https://matveev.tech/content/images/2026/03/anthropic-high-low-exposure-workers.png) По данным отчёта, люди в топ-квартиле по exposure: - зарабатывают на 47% больше - в 4 раза чаще имеют магистерскую степень и выше (17.4% против 4.5%) - на 16 процентных пунктов чаще женщины - старше в среднем Получается, AI в первую очередь задевает высокооплачиваемых белых воротничков с дипломами. ## Что происходит с наймом? Безработица среди уязвимых профессий пока не выросла — данные об этом однозначные. Но вот что интересно: найм молодых специалистов (22-25 лет) в exposed профессиях упал примерно на 14% после запуска ChatGPT, по данным Current Population Survey. ![Найм молодых специалистов в профессиях с высоким и нулевым AI-покрытием](https://matveev.tech/content/images/2026/03/anthropic-young-workers-hiring.png) Визуально тренды расходятся с 2024 года. Работу в «неуязвимых» профессиях молодые находят стабильно (\~2% в месяц), а в exposed — на полпроцента меньше. Эффект статистически на грани значимости, но направление ясное. Людей не увольняют — их просто перестают нанимать. Без заголовков, без протестов. Тихо. А прогнозы BLS (Bureau of Labor Statistics) до 2034 года показывают, что рост занятости для уязвимых профессий слабее, чем для остальных. На каждые 10 процентных пунктов роста observed exposure прогноз занятости снижается на 0.6 п.п. Рынок уже закладывает автоматизацию в свои модели. ## Личный опыт У себя почти все задачи, связанные с аналитикой, финансовым моделированием и подготовкой к звонкам, делает Claude. Быстрее, дешевле, и качественнее, чем руками. Не потому что я плохо разбираюсь, а потому что модель переваривает больше данных и не тупит к шести вечера. По этому отчёту я сам попадаю в группу риска. Пока мне это скорее помогает, чем мешает — но я не питаю иллюзий, что так будет всегда. И точно не все успевают перестроиться с той же скоростью. ## Что с этим делать? Данные говорят, что агенты уже могут делать работу. Остаётся вопрос — как быстро люди готовы к этому адаптироваться. Конкретное упражнение: возьми 3-5 своих ключевых рабочих задач и прогони через агента на этой неделе. Серьёзно, прямо сейчас запиши список. Результат покажет больше, чем любой отчёт. Если ты программист — покрытие твоих задач уже 75%. Если работаешь в финансах, юридике, HR — теоретически AI может покрыть 80-90% того, что ты делаешь. Вопрос не «заменит ли», а «когда красная область догонит синюю». ## Часто задаваемые вопросы **AI уже вызывает массовые увольнения?** Нет. По данным исследования Anthropic (март 2026), систематического роста безработицы среди exposed профессий нет. Но найм молодых специалистов замедлился на \~14%. **Какие профессии AI затрагивает больше всего?** Программисты (75% покрытия задач), специалисты по клиентской поддержке и операторы ввода данных. В целом — белые воротнички с высоким образованием и зарплатой. **Что такое observed exposure?** Метрика Anthropic, которая измеряет долю задач профессии, реально автоматизируемых через AI. Учитывает и теоретическую способность LLM, и фактическое использование Claude в рабочих контекстах. **На сколько процентов AI может автоматизировать офисную работу?** Теоретическое покрытие для Office & Admin — 90%, но реальное использование пока значительно ниже. Разрыв сокращается по мере роста адаптации. ## Что ещё почитать - [Как AI подрывает автономность — исследование Anthropic](https://matveev.tech/disempowerment-patterns-anthropic/) — ещё одно исследование Anthropic о неочевидных эффектах AI - [Инженеры OpenAI не пишут код!](https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/) — как меняется работа разработчиков в AI-компаниях - [Claude Sonnet 4.6 — обзор новой модели](https://matveev.tech/claude-sonnet-4-6-obzor/) — модель, на данных которой построено это исследование ### Топ-6 AI-агентов для кода в 2026 URL: https://matveev.tech/luchshie-ai-agenty-dlya-koda-2026/ Last updated: 2026-03-14T08:02:50.000Z > **TL;DR:** Подборка из 10 AI-агентов для кода: от визуальных IDE до терминальных CLI-инструментов. Для каждого — что умеет, сколько стоит и кому подходит. Сводная таблица и рекомендации в конце. Рынок AI-агентов для кода в 2026 году выглядит иначе, чем год назад. Тогда был Copilot и все остальные. Сейчас Cursor, Claude Code, Qoder, Codex, Windsurf и ещё десяток инструментов борются за внимание разработчиков. Каждый пытается решить одну задачу — пусть AI пишет код — но подходы отличаются. Я протестировал основные инструменты и собрал подборку: шесть подробно, четыре кратко. Без рейтингов и «лучший инструмент года» — вместо этого честное описание, кому что подходит. ## 1\. Cursor Cursor от Anysphere — AI-IDE на базе VS Code, который вышел в 2023 году и задал планку для всех остальных. Главное преимущество — зрелость и мультимодельность. ![Cursor — AI-IDE с мультимодельным подходом и Cloud Agents](https://matveev.tech/content/images/2026/02/cursor-ide-overview.webp) Agent Mode работает с кодовой базой, создаёт файлы, запускает команды. Cloud Agents выполняют задачи в облаке — можно запустить и закрыть IDE. Tab — автодополнение, которое учитывает контекст проекта, не только текущий файл. Bugbot — отдельный продукт для автоматического ревью PR ($40/пользователь/мес). Мультимодельность: доступ к OpenAI, Claude, Gemini прямо из IDE. Авторежим подбирает модель под задачу. Не привязан к одному провайдеру — для многих это решающий аргумент. Из enterprise-фич: SOC 2, SAML/OIDC SSO, SCIM, privacy mode, аудит-логи. Cursor — единственный AI-IDE с полным набором для корпораций. Цены: Free (лимиты), Pro $20/мес, Pro+ $60/мес, Ultra $200/мес. Teams $40/пользователь/мес. Попробовать: [cursor.com](https://cursor.com/?ref=matveev.tech) ## 2\. Claude Code Claude Code от Anthropic — [CLI-first агент](https://matveev.tech/ide-vs-cli-ai-coding-2026/), который живёт в терминале. Модель — [Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/), одна из топовых для кодинга. По бенчмаркам SWE-bench на уровне [GPT-5.3 Codex](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/). ![Claude Code в терминале — CLI-first подход к AI-кодингу](https://matveev.tech/content/images/2026/02/claude-code-terminal.png) Философия Unix: пайпы, скрипты, автоматизация. `tail -f app.log | claude -p "alert on errors"` — такое в IDE не сделаешь. [Agent Teams](https://matveev.tech/claude-code-agent-teams-instrukciya/) запускают нескольких агентов параллельно. [Hooks](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) автоматизируют действия до и после работы агента. [CLAUDE.md](https://matveev.tech/claude-md-instruktsii-claude-code/) задаёт правила для проекта. Доступен в терминале, VS Code, JetBrains, десктоп-приложении, веб-версии, Slack. GitHub Actions и GitLab CI/CD для автоматизации в пайплайнах. Сессии переносятся между средами через `/teleport`. Из минусов: кривая обучения выше, чем у IDE. Нужно знать терминал. Цены: входит в Claude Pro ($20/мес), Max 5x ($100/мес), Max 20x ($200/мес). API: $5/$25 за миллион токенов (Opus 4.6). Попробовать: [claude.ai/code](https://claude.ai/code?ref=matveev.tech) ## 3\. Qoder [Qoder](https://matveev.tech/qoder-ide-obzor/) от Alibaba — AI-IDE на базе VS Code с моделью [Qwen3-Coder](https://matveev.tech/qwen3-coder-next-obzor/). Запуск в августе 2025, Product of the Day на Product Hunt (685 голосов). ![Quest Mode в Qoder — автономный агент работает по спецификации](https://matveev.tech/content/images/2026/02/qoder-quest-mode.png) Quest Mode — главная фича. Spec-driven разработка: описываешь задачу, агент генерирует план с критериями приёмки, ты утверждаешь, агент работает до 26 часов. Три окружения: локально, worktree, удалённый контейнер. Repo Wiki — автоматическая документация кодовой базы, обновляется при изменении кода. По данным Qoder, через Wiki прошло больше 400 тысяч репозиториев. Есть IDE, CLI и плагин для JetBrains. Автомаршрутизация на Claude, GPT, Gemini для сложных задач. Из минусов: продукт молодой, вопросы о приватности данных (Alibaba), Linux только через CLI. Подробнее в [обзоре Qoder](https://matveev.tech/qoder-ide-obzor/), [сравнении с Claude Code](https://matveev.tech/qoder-vs-claude-code/) и [сравнении с Cursor](https://matveev.tech/qoder-vs-cursor/). Цены: Free, Pro $10/мес (промо, $20 обычная), Pro+ $30/мес (промо), Ultra $100/мес (промо). Кредитная система. Попробовать: [qoder.com](https://qoder.com/?ref=matveev.tech) ## 4\. GitHub Copilot Copilot — первый массовый AI-ассистент для кода. Интеграция с VS Code, JetBrains, Neovim. За 2025-2026 год сильно прокачался: появились agent mode, code review, coding agent для автоматической работы с issues. Copilot coding agent берёт issue на GitHub, создаёт ветку, пишет код, открывает PR. Для команд, которые живут в экосистеме GitHub, это удобнее любого стороннего инструмента — всё в одном месте. Модели: GPT-5 mini для чата (безлимитно на Pro), Claude и Gemini доступны через настройки. По сравнению с Cursor или Claude Code, Copilot более консервативный: меньше автономности, больше контроля. Из минусов: агент-режим менее продвинутый, чем у конкурентов. Для тяжёлого agentic coding Cursor или Claude Code подходят лучше. Цены: Free (лимиты), Pro $10/мес, Pro+ $39/мес. Business $19/пользователь/мес, Enterprise $39/пользователь/мес. Попробовать: [github.com/features/copilot](https://github.com/features/copilot?ref=matveev.tech) ## 5\. Codex (OpenAI) Codex CLI от OpenAI — терминальный агент на базе [GPT-5.3 Codex](https://matveev.tech/gpt-5-3-codex-obzor/). Недавно появился [плагин для JetBrains](https://matveev.tech/gpt-5-3-codex-obzor/). Фокус на простоте: минимум абстракций, быстрые итерации. Codex работает в песочнице: каждый запрос выполняется в изолированном контейнере, что снижает риск случайных повреждений кодовой базы. Поддерживает parallel execution — несколько задач одновременно. Модель GPT-5.3 Codex [сопоставима с Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) по качеству генерации кода. Из преимуществ: быстрая скорость генерации (особенно с чипами Cerebras — до 1000 токенов/с). Из минусов: пока нет развитой экосистемы плагинов и хуков. Цены: входит в ChatGPT Pro ($20/мес) и Plus ($200/мес). API: $2/$8 за миллион токенов. Попробовать: [openai.com/index/codex](https://openai.com/index/codex?ref=matveev.tech) ## 6\. Windsurf Windsurf (бывший Codeium Editor) — AI-IDE с фокусом на доступности. Cascade — агент, который «думает на 10 шагов вперёд»: анализирует контекст и планирует последовательность действий. Windsurf дешевле конкурентов: Pro за $15/мес (vs $20 у Cursor). Мультимодельный: OpenAI, Claude, Gemini, xAI. Поддерживает MCP. По отзывам на Reddit, хорошо работает для фронтенда и небольших проектов. Из минусов: менее зрелый, чем Cursor. Enterprise-фичи слабее. Сообщество меньше. Но для бюджетного варианта — рабочий выбор. Цены: Free (25 кредитов/мес), Pro $15/мес (500 кредитов), Teams $30/пользователь/мес. Попробовать: [windsurf.com](https://windsurf.com/?ref=matveev.tech) --- ## Кратко о других **Kiro** — AI-IDE от Amazon (AWS). Spec-driven разработка, похожая на Quest Mode в Qoder. Построен на Code OSS, поддерживает ACP (Agent Client Protocol). Бесплатный, пока в preview. Сильная сторона — интеграция с AWS-сервисами. Слабая — пока сырой и ограниченный набор моделей. Попробовать: [kiro.dev](https://kiro.dev/?ref=matveev.tech) **Gemini CLI** — open-source терминальный агент от Google. ReAct loop (reason and act), быстрый feedback, хорош для фронтенда. Щедрый бесплатный тариф (1000 запросов/день через Gemini Code Assist). Из минусов: менее развитый для больших проектов, чем Claude Code. Попробовать: [github.com/google-gemini/gemini-cli](https://github.com/google-gemini/gemini-cli?ref=matveev.tech) **Cline** — open-source агент для VS Code, 5M+ установок. Plan/Act режимы, MCP, работает с любым LLM-провайдером. Недавно вышел Cline CLI 2.0 с параллельными агентами и headless-пайплайнами. Для тех, кто хочет полный контроль и не хочет привязываться к одному вендору. Попробовать: [cline.bot](https://cline.bot/?ref=matveev.tech) **Continue** — open-source ассистент для VS Code и JetBrains. Автодополнение, чат, работает с локальными моделями (Ollama). Для тех, кому важна приватность и возможность запускать всё локально. Попробовать: [continue.dev](https://continue.dev/?ref=matveev.tech) ## Сводная таблица | Инструмент | Тип | Цена (от) | Модели | Платформы | Для кого | | ----------- | ----------------- | ----------------------- | ------------------------------- | -------------------------- | ------------------------- | | Cursor | IDE | $0 / $20/мес | Мульти (OpenAI, Claude, Gemini) | macOS, Win, Linux | Разработчики, команды | | Claude Code | CLI + IDE | $20/мес | Claude Opus 4.6 | macOS, Win, Linux | Опытные разработчики | | Qoder | IDE + CLI | $0 / $10/мес | Qwen3-Coder + мульти | macOS, Win, Linux (CLI) | Разработчики, spec-driven | | Copilot | Расширение | $0 / $10/мес | GPT-5 mini + мульти | VS Code, JetBrains, Neovim | Все уровни | | Codex CLI | CLI + JetBrains | $20/мес | GPT-5.3 Codex | macOS, Win, Linux | Терминал-разработчики | | Windsurf | IDE | $0 / $15/мес | Мульти | macOS, Win, Linux | Бюджетный вариант | | Kiro | IDE | Бесплатно (preview) | Amazon + мульти | macOS, Win | AWS-разработчики | | Gemini CLI | CLI | Бесплатно | Gemini 2.5 | macOS, Win, Linux | Фронтенд, скрипты | | Cline | VS Code | Бесплатно (open-source) | Любой провайдер | VS Code | Контроль и гибкость | | Continue | VS Code/JetBrains | Бесплатно (open-source) | Любой / локальные | VS Code, JetBrains | Приватность | ## ## FAQ **Какой AI-агент лучше для Python?** Все основные инструменты хорошо работают с Python. Claude Code и Cursor — лидеры по качеству генерации. Copilot — самый массовый вариант с хорошим автодополнением. Для data science — Gemini CLI с мультимодальным вводом. **Можно ли использовать бесплатно?** Да. Copilot Free, Windsurf Free, Qoder Free, Cursor Hobby — все дают базовое использование с лимитами. Gemini CLI, Cline и Continue полностью бесплатны (open-source). Claude Code доступен бесплатно с ограничениями. **Какой инструмент самый быстрый?** По скорости генерации — Codex CLI с Cerebras (до 1000 токенов/с). По скорости рабочего процесса — Claude Code в терминале (минимум UI-задержек). IDE-агенты медленнее на старте из-за загрузки и индексации. **Заменит ли AI-агент программиста?** Нет. Все эти инструменты — ассистенты. Они хорошо генерируют код по описанию, но не понимают бизнес-логику, не принимают архитектурные решения и не несут ответственность за результат. Думаю, разработчик с AI-агентом продуктивнее, чем без него — но AI без разработчика пока не работает. ### Память AI-агентов: контекст, RAG, графы и mem0 URL: https://matveev.tech/pamyat-ai-agentov-rag-grafy-mem0/ Last updated: 2026-03-13T15:45:17.000Z > TL;DR: Память AI-агентов — это набор техник, которые позволяют LLM «помнить» информацию между запросами и сессиями. От простой суммаризации чата до графовых баз вроде mem0 — каждый подход решает свою задачу. Разбираю, что реально работает, а что оверинжиниринг. Контекстное окно LLM — это как оперативка компьютера. Сколько информации модель может «видеть» за один вызов. У GPT-5.4 это уже миллион токенов, у Claude Opus 4.6 — 200 тысяч. Звучит много, но на практике этого не хватает. Длинные сессии с кодинг-агентом, многочасовые задачи, история из сотен сообщений — контекст кончается быстрее, чем кажется. И когда контекст заканчивается, агент буквально забывает, что было в начале разговора. Он может потерять изначальную задачу, забыть важные решения или начать повторять ошибки, которые уже исправлял. Это фундаментальная проблема, и разные инструменты решают её по-разному. ## Простая память: суммаризация, тримминг, контекст ревайнд Самый базовый подход — манипуляции с контекстным окном. Три основные техники: **Суммаризация** — когда чат приближается к лимиту контекста, вызывается отдельный промпт, который сжимает всю историю в краткое саммари. В OpenAI Codex CLI это видно прямо в консоли: процент свободного контекста падает до нуля, потом резко подскакивает обратно до 70%. По [данным JetBrains Research](https://blog.jetbrains.com/research/2025/12/efficient-context-management?ref=matveev.tech), суммаризация теоретически позволяет масштабировать диалог бесконечно, но на практике с каждым циклом сжатия теряется всё больше деталей. Через 4-5 компактингов от изначальной задачи может не остаться ничего — она превращается в «гомеопатический промпт». **Тримминг** — ещё грубее. Просто берём последние N сообщений и отбрасываем всё остальное. Именно так работает Simple Memory в n8n: выставляешь window size = 5, и агент видит только пять последних сообщений. Быстро, дёшево, предсказуемо. Но старая информация жёстко утрачена — никакого шанса к ней вернуться. **Контекст ревайнд (undo/rewind)** — возврат к чекпоинту диалога и продолжение заново. Не решает проблему конечного контекста напрямую, но позволяет откатиться до момента, когда агент начал галлюцинировать или пошёл не туда. Claude Code поддерживает это из коробки. Согласно [исследованию Anthropic по context engineering](https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents?ref=matveev.tech), ключ не в том, чтобы дать модели больше памяти, а в том, чтобы дать ей нужную информацию в нужный момент. ## Субагенты: разделяй контекст и властвуй Когда одного контекстного окна не хватает — можно взять несколько. Субагенты в Claude Code это подчинённые агенты с отдельным контекстом, инструментами и системным промптом. Главный агент-координатор раздаёт задачи, а каждый субагент работает в своём изолированном контексте. Например, при разработке веб-приложения можно создать backend-dev, frontend-dev и deploy-агента. Детали кода бэкенда живут только в контексте бэкенд-разработчика, фронтенд — в своём. Координатор держит в контексте только общую картину. Это не просто увеличенная суммарная память — субагенты могут работать параллельно, экономя время. А в Agent Teams (экспериментальная фича Claude Code) главный агент сам решает, каких подчинённых создать и как распределить задачи. Полезно для задач вроде «задокументируй огромную кодовую базу» — можно запустить 10 аналитиков на 10 модулей. Подробнее я писал про это в [обзоре Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) и в статье про [мультиагенты в OpenAI Codex](https://matveev.tech/codex-multi-agent-setup/). ## Auto-memory: файловая система как долгосрочная память Auto-memory — это когда агент сам решает, что запомнить, и записывает это в файлы, которые переживают перезапуск сессии. В Claude Code это работает так: включаешь флаг auto-memory, и агент начинает сохранять полезные факты в файл `memory.md` внутри `.claude/projects/`. При следующем запуске первые 200 строк этого файла попадают в системный промпт. Если агент видит ссылки на более глубокие md-файлы — он может копнуть дальше. Memory-файлы хранят факты о проекте — какие инструменты используются, какие решения принимались. Каждый новый сеанс Claude Code начинается уже с контекстом проекта. По сути, auto-memory превращает файловую систему в долгосрочное хранилище. Никаких баз данных, никаких эмбеддингов — просто markdown-файлы. И по [бенчмаркам Letta](https://www.letta.com/blog/benchmarking-ai-agent-memory?ref=matveev.tech), filesystem-подход набирает 74% на бенчмарке LoCoMo, обгоняя некоторые специализированные решения. Подробный гайд я писал в статье [Память Claude Code — auto memory, rules и CLAUDE.md](https://matveev.tech/claude-code-memory-auto-rules/). Похожий подход — Memory Bank: сохранение структурированной информации о проекте в определённую папку. Модель читает файлы, когда нужен контекст, и пишет в них, когда узнаёт что-то полезное. ## RAG: векторный поиск по большой базе Когда данных слишком много для файлов — подключаем RAG (Retrieval-Augmented Generation). Принцип такой: сохраняем информацию в векторную базу, а при запросе ищем релевантные куски по смысловой близости через эмбеддинги. Допустим, у тебя банковские выписки за несколько лет. Загружаешь их в RAG-хранилище, подключаешь через MCP к Claude Code — и можешь спросить «на что я тратил деньги в Тбилиси?». Агент вызовет RAG-инструмент, найдёт по эмбеддингам нужную страницу выписки и даст ответ. RAG эффективен, когда нужен поиск по сотням и тысячам документов — там, где другие подходы просто не вместят всё в контекст. Через MCP можно подключить Qdrant, Pinecone, Weaviate и другие векторные базы. Но у RAG есть ограничение: он находит **похожие** тексты, но не понимает **связи** между ними. Если спросить «как менялись мои предпочтения за последний год» — RAG вернёт отдельные кусочки, но не выстроит цепочку изменений. По [данным Mem0](https://mem0.ai/blog/rag-vs-ai-memory?ref=matveev.tech), RAG отвечает на вопрос «что похоже на X?», а не «как X связан с Y?». ## Графовая память: mem0, Zep, Letta Графовые решения хранят не просто тексты, а сущности и связи между ними. Это как база знаний, где «Павел → живёт → Тбилиси» и «Павел → использует → Claude Code» — связанные факты, по которым можно проследить цепочки. ### mem0 [Mem0](https://mem0.ai/?ref=matveev.tech) — open-source решение, которое комбинирует RAG и графы. На каждое сообщение пользователя текст прогоняется дважды: сначала через RAG + граф для поиска релевантных воспоминаний, потом — для добавления новых фактов. LLM раскладывает высказывания на сущности и обновляет граф связей. По [бенчмаркам](https://guptadeepak.com/the-ai-memory-wars-why-one-system-crushed-the-competition-and-its-not-openai?ref=matveev.tech), mem0 обгоняет OpenAI Memory на 26% по точности с задержкой на 91% меньше. Причём сам mem0 использует для процессинга дешёвую LLM — можно поставить хоть Gemini Flash, хоть локальную модель. ### Zep [Zep](https://www.getzep.com/?ref=matveev.tech) добавляет к графам временные метки — факты ранжируются по актуальности. «Павел жил в Москве» (2023) уступает приоритету «Павел живёт в Тбилиси» (2026). Но бесплатная версия Zep больше не поддерживается, новые версии — только в виде облачного решения. ### Letta (бывший MemGPT) [Letta](https://www.letta.com/?ref=matveev.tech) пошла дальше — модель сама управляет своей памятью. Решает, что хранить в «рабочей памяти» (горячие факты), что архивировать (холодное хранилище), а что забыть. По концепции это ближе всего к тому, как работает человеческая память. Letta набирает 74% на бенчмарке LoCoMo даже в filesystem-режиме, а с полной архитектурой — ещё больше. Если честно, я не уверен, что графовая память нужна в каждом проекте. Для большинства задач auto-memory + RAG хватает с головой. Графы становятся полезными, когда у тебя длительные отношения с пользователем (персональный ассистент, который помнит предпочтения за месяцы) или когда нужно отслеживать изменения во времени. ## Какой тип памяти для какой задачи | Задача | Подход | Почему | | --------------------------------- | ------------------------ | ------------------------------------------------ | | Короткий чат, 5-10 сообщений | Тримминг | Просто, предсказуемо, дёшево | | Кодинг-сессия на пару часов | Суммаризация + субагенты | Контекст не кончится, детали не потеряются | | Проект с инструкциями и правилами | Auto-memory (CLAUDE.md) | Файлы переживают перезапуск, легко редактировать | | Поиск по сотням документов | RAG через MCP | Эмбеддинги находят нужное быстро | | Персональный ассистент на месяцы | mem0 / Zep | Графы хранят связи и изменения | | Автономный агент с субагентами | Все вышеперечисленные | Комбинация подходов для разных уровней | ## Моё мнение: что работает, а что оверинжиниринг Я работаю с Claude Code каждый день, и вот что заметил: auto-memory в связке с хорошо структурированным CLAUDE.md покрывает 80% задач. Серьёзно. Просто файлы. Никаких баз данных. Агент читает инструкции, запоминает решения, при следующем запуске уже в контексте. Для pet-проектов, даже для продуктовой разработки в небольшой команде — этого хватает. RAG нужен, когда данных реально много — тысячи документов, выписки, логи. Подключаешь через MCP и забываешь. Работает стабильно и предсказуемо. А вот графовая память... Думаю, для большинства проектов это пока оверинжиниринг. Mem0 крутой технически, но добавляет слой сложности: нужно настраивать LLM для процессинга фактов, следить за качеством графа, дебажить связи. Мне кажется, это оправдано только для продуктов, где персонализация — ключевая фича. Ну, типа персональный AI-помощник, который работает с тобой месяцами и должен помнить, что ты любишь корейскую историю, но терпеть не можешь видеоклипы в рекомендациях YouTube. Вообще, тренд идёт в сторону того, что инструменты памяти становятся стандартной частью агентских фреймворков, а не отдельными решениями. Anthropic уже встроила auto-memory в Claude Code. OpenAI добавила память в ChatGPT. Скорее всего, через год вопрос «как дать агенту память» будет звучать так же странно, как сейчас «как дать приложению базу данных» — это будет просто часть стандартного стека. ## FAQ **Чем отличается RAG от графовой памяти?** RAG ищет похожие тексты через эмбеддинги — как полнотекстовый поиск по смыслу. Графовая память хранит сущности и связи между ними. RAG ответит на вопрос «что похоже?», а граф — на вопрос «как связано?». Для большинства задач RAG достаточно, графы нужны для сложных отношений. **Можно ли использовать mem0 бесплатно?** Да, mem0 open-source — можно развернуть локально. Нужна LLM для процессинга фактов (подойдёт даже дешёвая Gemini Flash через PolzaAI или любой OpenAI-совместимый провайдер) и хранилище для эмбеддингов. Облачная версия mem0 тоже есть, но для экспериментов хватит self-hosted. **Что лучше для кодинг-агента — RAG или auto-memory?** Для кодинг-агента auto-memory (файлы с инструкциями и правилами проекта) работает лучше. RAG пригодится, если нужно искать по огромной кодовой базе или документации. Claude Code использует auto-memory по умолчанию, RAG подключается через MCP. **Как работает суммаризация контекста в Claude Code и Codex?** Когда контекст приближается к лимиту, запускается отдельный вызов LLM, который сжимает историю до ключевых моментов. Свободное место в контексте подскакивает примерно до 70%. Процесс автоматический, но может терять детали — на длинных сессиях после 4-5 сжатий от начального промпта мало что остаётся. **Нужна ли графовая память для простого чат-бота?** Нет, для простого бота хватит тримминга (последние N сообщений) или суммаризации. Графовая память оправдана, только если бот должен помнить пользователя неделями и отслеживать изменения в предпочтениях. Для большинства B2B-ботов и саппорт-чатов RAG с базой знаний — оптимальный вариант. ## Что ещё почитать - [Память Claude Code — auto memory, rules и CLAUDE.md](https://matveev.tech/claude-code-memory-auto-rules/) — подробный гайд по настройке памяти в Claude Code - [Agent Teams в Claude Code: как запустить команду AI-агентов](https://matveev.tech/claude-code-agent-teams-instrukciya/) — субагенты с отдельным контекстом - [Мультиагенты в OpenAI Codex — настройка и примеры](https://matveev.tech/codex-multi-agent-setup/) — аналогичный подход в Codex - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — RAG и инструменты через MCP - [21 плагин Claude Cowork — честный рейтинг](https://matveev.tech/claude-cowork-plugins-tier-list/) — обзор экосистемы расширений ### Google Workspace CLI: управляй Gmail, Docs и Drive из терминала URL: https://matveev.tech/google-workspace-cli-obzor/ Last updated: 2026-03-13T08:38:31.000Z > TL;DR: `gws` — open-source CLI на Rust для всего Google Workspace. Gmail, Drive, Calendar, Sheets, Docs, Chat через одну команду в терминале. Команды генерируются динамически из Google Discovery Service, а вывод всегда в JSON, что удобно и для скриптов, и для AI-агентов. Если ты когда-нибудь автоматизировал что-то в Google Workspace, ты знаешь эту боль. Отдельный SDK для Drive, отдельный для Gmail, для Sheets свой клиент, и везде разная авторизация. Google, видимо, тоже устала от этого зоопарка и выкатила `gws`. ## Что такое Google Workspace CLI? `gws` (Google Workspace CLI) — command-line инструмент для всех API Google Workspace. Gmail, Drive, Calendar, Sheets, Docs, Chat, Admin SDK в одном месте. `gws` не хардкодит список команд. Он читает [Google Discovery Service](https://developers.google.com/discovery?ref=matveev.tech) при запуске и генерирует команды на лету. Добавили новый эндпоинт в API? `gws` подхватит его автоматически, обновлять ничего не нужно. Написан на Rust, лежит на GitHub под Apache 2.0\. За 10 дней набрал почти 20 000 звёзд. Формально это не официально поддерживаемый продукт Google, но репо живёт в организации `googleworkspace` и активно развивается. По данным [VentureBeat](https://venturebeat.com/orchestration/google-workspace-cli-brings-gmail-docs-sheets-and-more-into-a-common?ref=matveev.tech), `gws` делали сразу для двух аудиторий: разработчиков с их скриптами и AI-агентов, которым нужен машиночитаемый вывод. ## Быстрый старт Установка через npm (бинарники уже скомпилированы, Node.js нужен только для установки): ```bash npm install -g @googleworkspace/cli ``` Или через Cargo, если ты в мире Rust: ```bash cargo install --git https://github.com/googleworkspace/cli --locked ``` Первый запуск, настройка авторизации: ```bash # Создаёт Google Cloud проект, включает API gws auth setup # Логинишься через OAuth gws auth login ``` И всё, можно работать: ```bash # Список файлов на Drive gws drive files list --params '{"pageSize": 5}' # Отправить письмо gws gmail +send --to коллега@company.com --subject "Отчёт" --body "Готово" # Посмотреть расписание gws calendar +agenda ``` Весь вывод в JSON. Комбинируешь с `jq` и вытаскиваешь что угодно: ```bash gws drive files list --params '{"pageSize": 100}' --page-all | jq -r '.files[].name' ``` ## Ключевые возможности ### Динамическая генерация команд Я уже писал про это выше, но стоит остановиться подробнее. `gws` при каждом запуске запрашивает Google Discovery Service и строит дерево команд на лету. Никакого захардкоженного списка. Когда Google добавит метод для Gemini или NotebookLM, `gws` увидит его сам. Сейчас это покрывает 85+ скоупов. Можно заглянуть в схему любого метода: ```bash gws schema drive.files.list ``` ### Хелпер-команды (+) Для типовых операций есть команды с префиксом `+`. По сути это сокращения, чтобы не собирать длинные JSON-параметры руками: | Сервис | Команды | Что делают | | -------- | -------------------------------- | ---------------------- | | Gmail | +send, +reply, +forward, +triage | Работа с почтой | | Sheets | +append, +read | Чтение и запись данных | | Calendar | +agenda, +insert | Расписание и события | | Drive | +upload | Загрузка файлов | | Chat | +send | Сообщения в чат | Ещё есть готовые сценарии для рутины: `+standup-report`, `+meeting-prep`, `+weekly-digest`. Не уверен, насколько они гибкие на практике, но идея хорошая. ### Интеграция с AI-агентами В комплекте 40+ скиллов для AI-агентов и 50+ рецептов. Подключаешь к Gemini CLI как расширение: ```bash gws auth setup gemini extensions install https://github.com/googleworkspace/cli ``` Или добавить скиллы в OpenClaw: ```bash ln -s $(pwd)/skills/gws-* ~/.openclaw/skills/ ``` Весь вывод в JSON, агент может парсить ответы без дополнительной обработки. Большинство CLI делают красивый человекочитаемый вывод, а тут сразу машиночитаемый. Отдельная штука для параноиков (в хорошем смысле): Model Armor. Это **фильтрация ответов от prompt injection** через Google Cloud: ```bash gws gmail users messages get --params '...' \ --sanitize "projects/P/locations/L/templates/T" ``` ### Авторизация и dry-run С авторизацией всё гибко: OAuth2, сервисные аккаунты, access-токены через env-переменные. Credentials на диске шифруются AES-256-GCM, что приятно. Можно экспортировать для переноса на другую машину: ```bash gws auth export --unmasked > credentials.json ``` Мне понравился флаг `--dry-run` для любой команды. Показывает, какой запрос уйдёт в API, без отправки. Полезно, когда ковыряешься в незнакомом методе и не хочешь случайно удалить чужие файлы с Drive. ## Тарифы `gws` бесплатный и open-source (Apache 2.0). Нужен Google Cloud проект (бесплатного хватит) и аккаунт с доступом к Workspace. Потестить можно с обычным Gmail. Для Admin API понадобится Workspace-аккаунт организации. ## Вердикт Думаю, `gws` закрывает реальную дыру. Если ты пишешь скрипты, которые дёргают Gmail, Drive и Sheets, раньше приходилось собирать Франкенштейна из трёх разных библиотек. Теперь это одна команда. Для AI-агентов ситуация ещё лучше. JSON-вывод, готовые скиллы, подключение к Gemini CLI за одну команду. Если строишь агента, который должен разбирать почту или работать с таблицами, `gws` стоит посмотреть. Но я бы не стал строить на нём что-то продакшн-критичное прямо сейчас. Проекту 10 дней, v1.0 ещё нет, и Google честно предупреждает про breaking changes. Для экспериментов и личной автоматизации — отлично. Для чего-то серьёзного — подожди пару месяцев. [GitHub - googleworkspace/cli: Google Workspace CLI — one command-line tool for Drive, Gmail, Calendar, Sheets, Docs, Chat, Admin, and more. Dynamically built from Google Discovery Service. Includes AI agent skills.Google Workspace CLI — one command-line tool for Drive, Gmail, Calendar, Sheets, Docs, Chat, Admin, and more. Dynamically built from Google Discovery Service. Includes AI agent skills. - googlework…![](https://matveev.tech/content/images/icon/pinned-octocat-093da3e6fa40-4.svg)GitHubgoogleworkspace![](https://matveev.tech/content/images/thumbnail/cli-2)](https://github.com/googleworkspace/cli?ref=matveev.tech) ## Что ещё почитать - [CLI-Anything: превращаем любой софт в CLI для AI-агентов](https://matveev.tech/cli-anything-obzor/) — похожая идея, но для произвольного софта - [Мультиагенты в OpenAI Codex](https://matveev.tech/codex-multi-agent-setup/) — настройка агентов для разработки - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — MCP и интеграция инструментов ### Claude рисует графики и диаграммы прямо в чате URL: https://matveev.tech/claude-inline-vizualizatsii/ Last updated: 2026-03-12T20:50:48.000Z > TL;DR: Claude научился рисовать графики и диаграммы прямо в чате. Без кода, без боковых панелей. Работает на всех тарифах. Осенью Anthropic показывали Imagine with Claude — генерация визуалов в реальном времени. Выглядело как демо для конференции, но вот оно добралось до обычных чатов. Теперь Claude в бете умеет строить графики и интерактивные диаграммы прямо в ответах. ## Чем это отличается от артефактов У Claude уже есть артефакты. Это документы в боковой панели, которые можно скачать или расшарить. Новые визуализации работают иначе. Они появляются прямо в тексте ответа и живут, пока идёт разговор. Перешёл к другой теме — визуализация может измениться или вообще исчезнуть. Если коротко: артефакт — это результат работы, визуализация — способ объяснения. ## Как это работает Спрашиваешь Claude, как работает сложный процент — он рисует кривую, с которой можно поиграться. Просишь показать периодическую таблицу — получаешь интерактивную штуку, где можно кликнуть на любой элемент. ![Интерактивная визуализация периодической таблицы в Claude](https://matveev.tech/content/images/2026/03/claude-inline-visuals-examples.png) Claude сам решает, когда рисовать. Но можно и попросить: «нарисуй это как диаграмму» или «покажи, как это меняется во времени». Потом можно дорабатывать — менять параметры, углубляться в конкретный кусок графика. ## Что ещё поменялось в ответах Claude Визуализации — часть более широких изменений. С начала 2026 года Claude стал по-разному оформлять разные типы контента. Рецепты теперь показываются с ингредиентами и шагами, прогноз погоды — визуально. Плюс можно работать с Figma, Canva и Slack прямо в чате. Фича доступна на всех тарифах: Free, Pro, Team и Enterprise. ## Мои мысли Думаю, это правильное направление. Текстовые ответы про данные и тренды часто превращаются в кашу из цифр, которую лень разбирать. А просить Claude написать код для matplotlib ради одного графика — ну такое. Другой вопрос, насколько сложные визуализации он потянет. Бета есть бета. Для объяснения сложного процента или структуры данных хватит, а вот для серьёзной аналитики я бы пока не рассчитывал. ## Что ещё почитать - [21 плагин Claude Cowork — честный рейтинг](https://blog.matveev.tech/claude-cowork-plugins-tier-list/?ref=matveev.tech) — если хочешь расширить возможности Claude ещё дальше - [Claude в Excel — AI-помощник прямо в таблицах](https://blog.matveev.tech/claude-in-excel-obzor/?ref=matveev.tech) — ещё один способ, как Claude работает с визуальными данными - [Claude Import Memory — как перенести память из ChatGPT](https://blog.matveev.tech/claude-import-memory-obzor/?ref=matveev.tech) — полезно, если переезжаешь на Claude ## FAQ **Claude рисует графики на всех тарифах?** Да, inline-визуализации доступны на Free, Pro, Team и Enterprise. Ограничений по тарифу нет — разница только в количестве сообщений. **Чем inline-визуализации отличаются от артефактов?** Артефакты — это законченные документы в боковой панели, которые можно скачать и расшарить. Inline-визуализации появляются прямо в тексте ответа, помогают понять тему и могут исчезнуть при смене контекста. **Можно ли редактировать визуализацию после создания?** Да, можно попросить Claude изменить параметры, добавить данные или углубиться в конкретную часть графика. Визуализация обновится прямо в чате. ### CLI-Anything: превращаем любой софт в CLI для AI-агентов URL: https://matveev.tech/cli-anything-obzor/ Last updated: 2026-03-20T21:08:14.000Z > TL;DR: CLI-Anything — open-source плагин для Claude Code, который автоматически превращает любой софт с исходниками в полноценный CLI-инструмент для AI-агентов. Протестировано на 9 приложениях от GIMP до Blender, 1 436 тестов проходят на 100%. Представь: у тебя есть GIMP, Blender, LibreOffice, OBS Studio. Ты годами учился нажимать нужные кнопки, запоминал горячие клавиши, смотрел туториалы. А теперь одна команда в терминале, и AI-агент умеет делать с этим софтом всё то же самое. Без скриншотов и без RPA-костылей. CLI-Anything от исследователей из Гонконгского университета (HKUDS) берёт исходный код любого приложения и генерирует для него CLI-обёртку, которую AI-агенты понимают нативно. Я, честно говоря, когда увидел это, немного подвис. Потому что по сути любой тяжёлый десктопный софт, который годами продавали за большие деньги и к которому обучали людей неделями, теперь можно разобрать на запчасти и превратить в удобный инструмент для агентов. ![CLI-Anything — схема поддерживаемых приложений](https://matveev.tech/content/images/2026/03/cli-anything-teaser.png) ## Зачем вообще CLI? Вопрос справедливый. Есть же API, есть GUI-автоматизация, есть RPA. Зачем ещё один подход? CLI — пожалуй, единственный интерфейс, который одинаково хорошо понимают и люди, и LLM. Текстовые команды ложатся в формат языковых моделей. Флаг `--help` — готовая документация, которую агент может прочитать сам. JSON-вывод — структурированные данные без парсинга HTML. А GUI-автоматизация (привет, Selenium и RPA) ломается при каждом обновлении интерфейса. API есть далеко не у всего. CLI же обращается напрямую к бэкенду приложения, поэтому работает стабильнее. ## Как работает CLI-Anything Ставится как плагин к Claude Code. После установки появляется команда `/cli-anything`, которая запускает автоматический конвейер из 7 фаз: 1. **Analyze** — сканирует исходный код, маппит GUI-действия на внутренние API 2. **Design** — проектирует группы команд, модель состояния, форматы вывода 3. **Implement** — собирает Click-CLI с REPL-режимом, JSON-выводом, undo/redo 4. **Plan Tests** — создаёт план тестирования (unit + E2E) 5. **Write Tests** — реализует тестовый набор 6. **Document** — пишет документацию 7. **Publish** — создаёт `setup.py`, устанавливает в PATH На выходе — готовый CLI, который можно вызывать из терминала или встраивать в агентские пайплайны. ## На чём протестировано Разработчики прогнали CLI-Anything на 9 open-source приложениях. Не на демо-проектах, а на реальном софте. | Софт | Область | CLI-команда | Тесты | | ----------- | -------------------------- | ------------------------ | ----- | | GIMP | Редактирование изображений | cli-anything-gimp | 107 | | Blender | 3D-моделирование | cli-anything-blender | 208 | | Inkscape | Векторная графика | cli-anything-inkscape | 202 | | Audacity | Аудио | cli-anything-audacity | 161 | | LibreOffice | Офисный пакет | cli-anything-libreoffice | 158 | | OBS Studio | Стриминг | cli-anything-obs-studio | 153 | | Kdenlive | Видеомонтаж | cli-anything-kdenlive | 155 | | Shotcut | Видеомонтаж | cli-anything-shotcut | 154 | | Draw.io | Диаграммы | cli-anything-drawio | 138 | Итого 1 436 тестов (1 011 unit + 425 E2E), и все проходят. 100% pass rate — по данным [репозитория проекта](https://github.com/HKUDS/CLI-Anything?ref=matveev.tech). И тут стоит подчеркнуть: CLI не эмулирует функции. Он генерирует валидные файлы проектов (ODF, MLT XML, SVG) и вызывает настоящее приложение для рендеринга. LibreOffice реально конвертирует в PDF, Blender реально рендерит 3D-сцены. Заглушек нет. ## Как установить Если у тебя уже стоит Claude Code — всё просто: ```bash # Добавить маркетплейс /plugin marketplace add HKUDS/CLI-Anything # Установить плагин /plugin install cli-anything ``` Потом генерируешь CLI для нужного софта: ```bash # Локальный исходник /cli-anything ./gimp # Или GitHub-репозиторий /cli-anything https://github.com/blender/blender ``` И устанавливаешь результат: ```bash cd gimp/agent-harness && pip install -e . cli-anything-gimp --help ``` Можно и без маркетплейса — клонируешь репозиторий и копируешь плагин в `~/.claude/plugins/` вручную. ## Как выглядит на практике Вот пример работы с LibreOffice через сгенерированный CLI: ```bash # Создать документ Writer $ cli-anything-libreoffice document new -o report.json --type writer # Добавить заголовок $ cli-anything-libreoffice --project report.json writer add-heading -t "Отчёт Q1" --level 1 # Добавить таблицу $ cli-anything-libreoffice --project report.json writer add-table --rows 4 --cols 3 # Экспортировать в PDF через настоящий LibreOffice $ cli-anything-libreoffice --project report.json export render output.pdf -p pdf ``` Есть и REPL-режим: запускаешь `cli-anything-blender` без аргументов и работаешь в интерактивной сессии с историей команд и undo/redo. Для агентов есть флаг `--json`, который превращает любой вывод в структурированный JSON. Парсить текст не нужно. ## Архитектура ![Архитектура CLI-Anything — от исходного кода к CLI](https://matveev.tech/content/images/2026/03/cli-anything-architecture.png) Что внутри: CLI обязан вызывать реальное приложение — нет Pillow вместо GIMP, нет самописных рендереров вместо Blender. Каждый инструмент работает в двух режимах: stateful REPL для интерактивных сессий и subcommand-интерфейс для пайплайнов. Все сгенерированные CLI используют общий REPL-интерфейс (repl\_skin.py), так что UX везде одинаковый. Установка — `pip install -e .`, и инструмент сразу в PATH. ## Что это значит для RPA Вот тут, мне кажется, самое интересное. Весь рынок RPA (UiPath, Automation Anywhere, Blue Prism) построен на простой идее: «GUI-софт не имеет программного интерфейса, поэтому давайте кликать по кнопкам роботами». Хрупко, дорого, ломается при каждом обновлении UI. Но других вариантов не было. CLI-Anything обходит GUI полностью. Берёт исходный код, разбирается во внутренних API и строит CLI напрямую к бэкенду. Похоже на то, что делают [Cursor Cloud Agents](https://matveev.tech/cursor-cloud-agents-computer-use/) через computer use, только без скриншотов и без GPU для визуального распознавания. Понятно, что CLI-Anything работает только с open-source софтом, нужен исходный код. Но если посмотреть, сколько корпоративного ПО имеет open-source альтернативы (LibreOffice, Odoo, NextCloud, Grafana), покрытие получается приличное. Я не скажу, что RPA-компании завтра закроются. Но если честно, когда я смотрю на этот проект, мне кажется, что акции UiPath должны немного нервничать. Зачем кликать по кнопкам, если можно обратиться к софту напрямую? ## Вывод Я давно не видел open-source проект, который так точно попадает в нерв времени. Софт с открытым кодом — одна команда — и AI-агент умеет с ним работать. Без написания API, без RPA-костылей. Проект под MIT-лицензией, доказал работоспособность на 9 приложениях. В [планах](https://github.com/HKUDS/CLI-Anything?ref=matveev.tech) — CAD, DAW, IDE, научный софт и интеграция с агентскими фреймворками помимо Claude Code. Если работаешь с агентами или автоматизируешь что-то через Claude Code — стоит попробовать. Проект молодой, но идея настолько очевидно правильная, что удивительно, почему этого не сделали раньше. ## Что ещё почитать - [Что такое agent harness](https://matveev.tech/agent-harness-chto-takoe/) — глоссарий: обвязка вокруг AI-модели, которую CLI-Anything генерирует автоматически - [21 плагин Claude Cowork — честный рейтинг](https://matveev.tech/claude-cowork-plugins-tier-list/) — если интересуют другие плагины для Claude Code - [Cursor Cloud Agents: агенты с виртуальными машинами](https://matveev.tech/cursor-cloud-agents-computer-use/) — альтернативный подход к управлению софтом через агентов - [Kimi Code — open-source CLI-агент для кодинга](https://matveev.tech/kimi-code-cli-obzor/) — ещё один CLI-инструмент для AI-агентов - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — если используешь Claude Code и хочешь оптимизировать расход ## FAQ **Работает ли CLI-Anything с закрытым софтом (Photoshop, Microsoft Office)?** Нет, нужен исходный код. Но для большинства проприетарных инструментов есть open-source альтернативы: GIMP вместо Photoshop, LibreOffice вместо MS Office, Kdenlive вместо Premiere. В планах разработчиков — поддержка API закрытого ПО. **Нужен ли Claude Code для использования?** Для генерации CLI — да, CLI-Anything работает как плагин к Claude Code. Но сгенерированные CLI — обычные Python-пакеты, их можно использовать из любого терминала или агентского фреймворка. **Насколько это стабильно для продакшена?** 1 436 тестов со 100% pass rate — по меркам open-source это серьёзно. Но проект молодой, и я бы подождал пару месяцев перед тем, как тащить в продакшен. Для экспериментов и прототипов — уже готов. **Можно ли использовать с другими AI-агентами, кроме Claude?** Сгенерированные CLI — обычные утилиты командной строки. Они работают с любым агентом, который умеет вызывать bash-команды: Cursor, Codex, собственные решения на LangChain или CrewAI. Источники- \[CLI-Anything — GitHub-репозиторий\](https://github.com/HKUDS/CLI-Anything) ### Gemini Embedding 2: мультимодальные эмбеддинги Google URL: https://matveev.tech/gemini-embedding-2-obzor/ Last updated: 2026-03-11T14:45:49.000Z > TL;DR: Google выпустила Gemini Embedding 2 — первую нативно мультимодальную модель эмбеддингов. Текст, картинки, видео, аудио и PDF-документы теперь можно превратить в векторы в едином пространстве. Доступна через Gemini API и Vertex AI. Эмбеддинги — штука, которая работает «под капотом» почти всех AI-продуктов: от семантического поиска до RAG. До сих пор большинство моделей эмбеддингов умели работать только с текстом, а для картинок или видео приходилось городить отдельные пайплайны. Google решила это исправить. ## Что такое Gemini Embedding 2? Это первая модель эмбеддингов от Google, построенная на архитектуре Gemini, которая нативно понимает сразу несколько модальностей. Модель отображает данные разных типов в единое векторное пространство размерностью до 3072\. Это значит, что ты можешь искать по видео текстовым запросом или сравнивать аудиозапись с PDF-документом — и получить осмысленный результат. ## Какие модальности поддерживаются? На вход модель принимает текст (до 8192 токенов, это примерно 6000 слов), изображения (до 6 штук за запрос, PNG/JPEG), видео до 120 секунд (MP4/MOV), аудио напрямую без промежуточной транскрипции и PDF-документы до 6 страниц. Но интереснее другое. Можно передать в одном запросе сразу несколько типов данных, например, картинку и подпись к ней. Модель поймёт связь между ними и учтёт контекст обоих объектов. Google называет это interleaved input. ## Matryoshka-эмбеддинги и гибкость размерности Gemini Embedding 2 использует технику Matryoshka Representation Learning (MRL). Суть простая: информация «вкладывается» как матрёшка, и ты можешь уменьшить размерность вектора без полной потери качества. По умолчанию размерность — 3072\. Но можно снизить до 1536 или 768, если нужно сэкономить на хранении или ускорить поиск. Google рекомендует эти три значения как оптимальные по балансу качества и производительности. Для сравнения: у OpenAI text-embedding-3-large тоже 3072, но мультимодальности там нет. ## Кто уже использует? Google делится отзывами ранних пользователей, и цифры там любопытные. Юридический сервис Everlaw встроил модель в e-discovery — поиск по миллионам документов в судебных делах. CTO Max Christoff говорит, что мультимодальность позволила искать не только по текстам, но и по фото и видео в материалах. Раньше для этого нужны были отдельные пайплайны. У Sparkonomy (платформа для креаторов) задержка снизилась на 70% — они убрали промежуточный LLM-инференс. А оценка семантической близости для пар текст-изображение выросла с 0.4 до 0.8\. Честно, 0.4 → 0.8 звучит почти нереально, но это их цифры. Mindlid (приложение для ментального здоровья) получили +20% в top-1 recall, когда начали совмещать текстовые диалоги с аудиозаписями в одних эмбеддингах. Ещё отмечают, что API обратно совместим — переход занял минимум времени. ## Как попробовать? Gemini Embedding 2 доступна в публичной превью через: - [Gemini API](https://ai.google.dev/?ref=matveev.tech) - [Vertex AI](https://cloud.google.com/vertex-ai?ref=matveev.tech) Есть готовые Colab-ноутбуки для обоих вариантов. Из интеграций — LangChain, LlamaIndex, Haystack, Weaviate, Qdrant, ChromaDB и Google Vector Search. Вообще, с таким набором коннекторов проблем с подключением быть не должно. ## Вывод До сих пор для мультимодального поиска приходилось собирать зоопарк: CLIP для картинок, какой-нибудь text-embedding для текста, а для аудио — вообще отдельная история. Gemini Embedding 2 заменяет всё это одной моделью. Думаю, больше всего это пригодится в RAG. Если у тебя база знаний с PDF, скриншотами и текстовыми документами, один эмбеддинг-пайплайн вместо трёх — это реально проще и в разработке, и в поддержке. Модель пока в превью. Я бы не стал тащить её в продакшн без тестов на своих данных, но попробовать точно стоит. ## Что ещё почитать - [Gemini 3.1 Pro — что нового в модели Google](https://matveev.tech/gemini-3-1-pro-obzor/) — обзор последней версии Gemini Pro - [Gemini 3.1 Flash-Lite — быстрая и дешёвая модель Google](https://matveev.tech/gemini-3-1-flash-lite-obzor/) — если нужна генерация, а не эмбеддинги - [Jina VLM — мультиязычная VLM на 2.4B параметров](https://matveev.tech/jina-vlm-obzor/) — ещё один мультимодальный подход, но со стороны open source ### Jina VLM — мультиязычная VLM на 2.4B параметров URL: https://matveev.tech/jina-vlm-obzor/ Last updated: 2026-03-11T10:04:02.000Z > TL;DR: Jina VLM — vision-language модель на 2.4B параметров от Jina AI. Понимает картинки и текст на 29 языках, обгоняет Qwen3-VL-2B и InternVL3 в мультиязычных бенчмарках. Работает на обычном GPU, есть API и локальный запуск. ## Jina VLM — open-source модель Она смотрит на картинку и отвечает на вопросы о ней. Сделали в Jina AI (Берлин/Саннивейл), компания Han Xiao. До этого они были известны в основном эмбеддингами и реранкерами, так что VLM для них новая территория. Вышла в декабре 2025\. Внутри SigLIP2 как визуальный энкодер (449M параметров) и Qwen3-1.7B как языковой бэкбон. Между ними attention-pooling коннектор, который сжимает визуальные токены в 4 раза. Про это расскажу подробнее ниже, потому что это самое интересное в архитектуре. Большинство 2B моделей хорошо работают на английском. Может быть на китайском. На этом всё. Jina VLM тренировали на 5 миллионах мультимодальных примеров и 12 миллиардах текстовых токенов. 29 языков, от арабского до вьетнамского. Примерно половина данных на английском, остальное размазано по другим языкам. ## Быстрый старт Есть три способа попробовать: через API, CLI или библиотеку Transformers. ### Через API (самый быстрый) Jina предоставляет OpenAI-совместимый API. Нужен API-ключ с [jina.ai](https://jina.ai/?ref=matveev.tech): ```bash curl https://api-beta-vlm.jina.ai/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $JINA_API_KEY" \ -d '{ "model": "jina-vlm", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "Опиши это изображение"}, {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}} ] }] }' ``` Формат стандартный, как у OpenAI. Кидаешь URL картинки или base64, получаешь ответ. Стриминг тоже есть (`"stream": true`). Нюанс: API пока в бете (`api-beta-vlm`). Если сервис спит, вернёт 503\. Ждёшь полминуты, повторяешь. ### Локальный запуск через CLI В репозитории на HuggingFace есть скрипт `infer.py`: ```bash # Установка зависимостей uv sync # Для CUDA с FlashAttention2 uv sync --extra flash-attn # Анализ одной картинки python infer.py -i photo.jpg -p "Что на этом фото?" # Сравнение двух картинок python infer.py -i img1.jpg -i img2.jpg -p "Сравни эти изображения" # Стриминг python infer.py -i doc.png -p "О чём этот документ?" --stream ``` ### Через Transformers ```python from transformers import AutoModelForCausalLM, AutoProcessor import torch model = AutoModelForCausalLM.from_pretrained( "jinaai/jina-vlm", torch_dtype=torch.bfloat16, trust_remote_code=True, device_map="auto" ) processor = AutoProcessor.from_pretrained( "jinaai/jina-vlm", trust_remote_code=True ) messages = [{"role": "user", "content": [ {"type": "image", "image": "document.png"}, {"type": "text", "text": "О чём этот документ?"} ]}] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt" ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256, do_sample=False) print(processor.decode(outputs[0], skip_special_tokens=True)) ``` Ещё есть поддержка vLLM, если нужен продакшн-инференс. ## Ключевые возможности ### Мультиязычное понимание изображений На MMMB (Multilingual Multimodal Benchmark) Jina VLM набирает 78.8\. Qwen3-VL-2B — 75.0, InternVL3.5-2B — 74.6\. Разница в 3-4 пункта, но для 2B моделей это заметный отрыв. ![Результаты бенчмарка MMMB — мультиязычное понимание изображений среди 2B VLM](https://matveev.tech/content/images/2026/03/jina-vlm-mmmb-benchmark.png) Тестировали на шести языках: арабский, китайский, английский, португальский, русский, турецкий. По русскому результат тоже хороший. Не могу сказать, что я проверял на сложных кейсах, но бенчмарки выглядят обещающе. ### Работа с документами и OCR DocVQA — 90.6\. Qwen3-VL-2B тут сильнее (92.3), но разница небольшая. OCRBench — 778 из 1000. ![Результаты бенчмарков VQA — сравнение Jina VLM с Qwen3-VL и InternVL3](https://matveev.tech/content/images/2026/03/jina-vlm-vqa-benchmark.png) С диаграммами справляется хорошо (AI2D: 82.0), графики тоже норм (ChartQA: 81.9), текст на фотках читает (TextVQA: 83.2). Практически: скормил скан документа, задал вопрос, получил адекватный ответ. ### Эффективность: attention-pooling Обычная VLM прогоняет через языковую модель все визуальные токены. Их могут быть тысячи. Jina VLM использует attention-pooling коннектор: берёт 729 токенов на тайл и сжимает до 182\. Четырёхкратное сокращение. ![Архитектура Jina VLM — SigLIP2 энкодер, attention-pooling коннектор и Qwen3 декодер](https://matveev.tech/content/images/2026/03/jina-vlm-architecture.svg) На практике это значит: | Метрика | Без пулинга | С пулингом | Экономия | | ----------------------------- | ----------- | ---------- | -------- | | Визуальные токены (12 тайлов) | 9 477 | 2 366 | 4x | | FLOPs на prefill | 27.2 TFLOPs | 6.9 TFLOPs | 3.9x | | KV-cache память | 2.12 GB | 0.53 GB | 4x | Меньше токенов, быстрее инференс, меньше памяти. На практике это значит, что модель влезает на обычную потребительскую GPU. ### Сохранение текстовых способностей Когда VLM учат работать с картинками, она часто забывает текст. Это называется catastrophic forgetting и это боль всех мультимодальных моделей. В Jina решили вопрос прямолинейно: на обоих этапах обучения добавили 15% чисто текстовых данных. Помогло? Частично. По MMLU модель показывает 56.1, а базовый Qwen3-1.7B — 62.6\. Просадка заметная, но не катастрофическая. На MMLU-Pro хуже: 30.3 против 46.4\. Это цена за мультимодальность, и я не уверен, что её можно сильно снизить при 2B параметрах. ## Сравнение с конкурентами | Модель | Параметры | VQA Avg | MMMB | Multi. MMB | DocVQA | OCR | | -------------- | --------- | -------- | -------- | ---------- | -------- | ------- | | **Jina VLM** | 2.4B | **72.3** | **78.8** | **74.3** | 90.6 | 778 | | Qwen3-VL-2B | 2.8B | 71.6 | 75.0 | 72.3 | **92.3** | **858** | | InternVL3.5-2B | 2.2B | 71.6 | 74.6 | 70.9 | 88.5 | 836 | | InternVL3-2B | 2.2B | 69.2 | 73.6 | 71.9 | 87.4 | 835 | | Qwen2-VL-2B | 2.1B | 66.4 | 71.3 | 69.4 | 89.2 | 809 | По средним VQA и мультиязычности Jina впереди. Qwen3-VL-2B выигрывает в работе с документами и OCR. InternVL3.5-2B где-то посередине. Короче: нужен OCR на английском? Бери Qwen3-VL. Нужна мультиязычность? Jina VLM. Нужно всё сразу? Ну, тогда придётся брать что-то покрупнее 2B. ## Тарифы Лицензия CC BY-NC 4.0\. Бесплатно для некоммерческого использования. API пока в бете. Ключ получаешь на [jina.ai](https://jina.ai/?ref=matveev.tech). Конкретную стоимость за токен для VLM Jina пока не опубликовали, но у них общая система токенов для всех сервисов. Новым пользователям дают 10M бесплатных токенов, так что поэкспериментировать можно без платы. Ещё модель доступна через маркетплейсы AWS, Azure и GCP. ## Вердикт Если тебе нужна VLM, которая понимает не только английский, и при этом влезает на обычную GPU, Jina VLM стоит попробовать. Для анализа документов и графиков на нескольких языках при 2B параметрах альтернатив сейчас немного. Для чисто английского OCR я бы взял Qwen3-VL. Для коммерческого продакшна лицензия CC BY-NC может оказаться проблемой. Больше всего мне понравился подход к эффективности. Attention-pooling с 4x сжатием, двухэтапное обучение с сохранением текстовых способностей. Видно, что в Jina AI думали не только про бенчмарки, но и про то, чтобы модель можно было реально запустить. Для экспериментов с мультимодальным AI на русском это пока один из лучших вариантов в весовой категории 2B. Попробовать: [Jina VLM](https://jina.ai/models/jina-vlm?ref=matveev.tech) ## Что ещё почитать - [Mercury 2 — LLM на диффузии с 1000 токенов/сек](https://matveev.tech/mercury-2-diffusion-llm/) — ещё один подход к ускорению инференса - [Обзор Gemini 3.1 Pro](https://matveev.tech/gemini-3-1-pro-obzor/) — мультимодальная модель от Google - [Обзор Claude Sonnet 4.6](https://matveev.tech/claude-sonnet-4-6-obzor/) — свежая модель Anthropic ### Code Review в Claude Code: AI-агенты ревьюят каждый PR URL: https://matveev.tech/claude-code-review-obzor/ Last updated: 2026-03-10T10:43:20.000Z > TL;DR: Anthropic запустила Code Review для Claude Code. Несколько AI-агентов параллельно проверяют каждый PR, ищут баги и фильтруют ложные срабатывания. Внутри компании это уже работает на почти каждом пулл-реквесте. Теперь доступно в research preview для Team и Enterprise. Когда один разработчик начинает писать вдвое больше кода, кто-то должен этот код читать. И вот начинается проблема: код ревью превращается в узкое место. Все торопятся, PR пролистывают по диагонали, а баги проскальзывают в продакшен. Anthropic столкнулась с этим на себе: объём кода на инженера вырос на 200% за год. Их ответ — Code Review, система ревью на агентах, которую они гоняют на почти каждом своём PR. Теперь её открыли для всех. ## Как работает Code Review в Claude? Когда открывается PR, Code Review запускает несколько агентов параллельно. Каждый ищет баги в своей части кода, потом результаты проверяются на false positives и сортируются по критичности. На выходе получаешь один сводный комментарий к PR плюс инлайн-замечания к конкретным строкам. Открываешь PR и сразу видишь, где проблемы. Ревью масштабируется под размер PR. Большие и сложные изменения получают больше агентов и более глубокий анализ, а мелкие фиксы проходят лёгкую проверку. В среднем ревью занимает около 20 минут. ## Цифры от Anthropic Anthropic гоняла систему у себя несколько месяцев и делится статистикой: - До Code Review 16% PR получали содержательные комментарии при ревью. После — 54%, в три с лишним раза больше - На больших PR (1000+ строк) 84% получают замечания, в среднем 7.5 находок - На маленьких (до 50 строк) — 31%, в среднем 0.5 находок - Менее 1% находок инженеры пометили как некорректные Меньше процента ложных срабатываний — это серьёзно. ## Реальные кейсы Один пример из Anthropic: разработчик сделал однострочное изменение в продакшен-сервисе. Такой diff обычно получает быстрый approve — ну что там может сломаться в одной строке? Code Review пометил это как критическое: изменение ломало аутентификацию сервиса. Инженер потом признался, что сам бы не заметил. Другой пример — от внешних пользователей. На рефакторинге ZFS-шифрования в TrueNAS (open-source middleware) система нашла предсуществующий баг в соседнем коде: type mismatch, который тихо очищал кеш ключей шифрования при каждой синхронизации. Баг был не в изменениях PR, а в коде, который PR затронул — тот тип ошибки, который человек при ревью changeset'а не стал бы целенаправленно искать. ## Сколько стоит? Это не бесплатный линтер. Code Review заточен на глубокий анализ, и стоит соответственно: от $15 до $25 за ревью, в зависимости от размера PR. Биллинг по токенам. Расходы можно контролировать: месячные лимиты на организацию, выбор конкретных репозиториев, дашборд с аналитикой по количеству проверок и тратам. $15–25 за ревью звучит дорого. Но если прикинуть, сколько стоит час senior-разработчика на вдумчивом ревью большого PR... цифры уже не такие страшные. ## Чем отличается от GitHub Action? У Anthropic уже есть [Claude Code GitHub Action](https://github.com/anthropics/claude-code-action?ref=matveev.tech), open-source штука для автоматизации CI/CD с Claude. Code Review — это другой продукт. Action быстрый и бесплатный, Review медленный и глубокий. Думаю, можно использовать оба: Action на каждый коммит для рутинных проверок, а Code Review перед мержем в основную ветку, когда нужен серьёзный анализ. ## Как подключить? Code Review доступен в research preview для планов Team и Enterprise. Админ включает Code Review в настройках Claude Code, ставит GitHub App и выбирает репозитории. После этого ревью запускаются автоматически на каждый новый PR, разработчикам ничего настраивать не нужно. Code Review не аппрувит PR, финальное решение всегда за человеком. Но разница между «пролистал diff за минуту» и «получил разбор с конкретными находками» заметная. ## Вывод Мне нравится, что Anthropic не пытается продать это как замену ревьюеру. Code Review дорогой, не быстрый и не ставит approve. Но он честно делает то, на что у живых людей обычно нет времени: вдумчиво читает код. Не уверен, что $15–25 за каждый PR подойдёт маленькой команде. Но если у тебя Team или Enterprise план и репозитории, где баг в продакшене стоит дорого, попробовать точно стоит. ## Что ещё почитать - [Claude Code Security: AI сканирует код на уязвимости](https://blog.matveev.tech/claude-code-security-obzor/?ref=matveev.tech) — ещё один инструмент для качества кода в Claude Code - [Как сэкономить токены в Claude Code с Tool Search](https://blog.matveev.tech/claude-code-tool-search-mcp-tokeny/?ref=matveev.tech) — полезно, если активно используешь Claude Code - [Запланированные задачи в Claude Code: /loop и cron](https://blog.matveev.tech/claude-code-scheduled-tasks-loop/?ref=matveev.tech) — автоматизация рутины в Claude Code ### Запланированные задачи в Claude Code: /loop и cron URL: https://matveev.tech/claude-code-scheduled-tasks-loop/ Last updated: 2026-03-09T11:22:51.000Z > TL;DR: В Claude Code появились запланированные задачи — команда `/loop` и cron-инструменты. Можно автоматически проверять деплой, следить за PR или поставить себе напоминание. Всё работает внутри текущей сессии, без отдельных скриптов. ## Как работает /loop Команда `/loop` запускает повторяющуюся задачу в пару слов: ``` /loop 5m проверь, закончился ли деплой, и расскажи что произошло ``` Claude разбирает интервал, превращает его в cron-выражение и запускает фоновую задачу. Интервал можно указывать по-разному: | Формат | Пример | Результат | | --------------- | -------------------------------- | ---------------------------- | | В начале | /loop 30m проверь билд | Каждые 30 минут | | С every в конце | /loop проверь билд every 2 hours | Каждые 2 часа | | Без интервала | /loop проверь билд | По умолчанию каждые 10 минут | Поддерживаются единицы: `s` (секунды), `m` (минуты), `h` (часы), `d` (дни). Секунды округляются до ближайшей минуты — cron не поддерживает субминутную точность. Если интервал не делится ровно (например, `7m` или `90m`), Claude округлит до ближайшего «чистого» значения и скажет, что выбрал. ## Запуск команд по расписанию Промпт в `/loop` может быть другой командой или скиллом. Это удобно, если у тебя уже есть готовый workflow: ``` /loop 20m /review-pr 1234 ``` Каждый раз, когда срабатывает задача, Claude выполняет `/review-pr 1234`, как если бы ты набрал это руками. Я использую это для мониторинга CI — удобно, когда не хочется вручную дёргать `gh run view`. ## Одноразовые напоминания Для разовых напоминалок `/loop` не нужен — достаточно написать на обычном языке: ``` напомни мне в 15:00 запушить релизную ветку ``` ``` через 45 минут проверь, прошли ли интеграционные тесты ``` Claude привязывает время срабатывания к конкретной минуте через cron-выражение и подтверждает, когда сработает. После срабатывания задача удаляется сама. ## Управление задачами Управлять расписанием можно на естественном языке: ``` какие у меня запланированные задачи? ``` ``` отмени проверку деплоя ``` Под капотом это три инструмента: | Инструмент | Назначение | | ---------- | -------------------------------------------------------------------------------------------- | | CronCreate | Создать задачу. Принимает 5-значное cron-выражение, промпт и тип (повторяющаяся или разовая) | | CronList | Список всех задач с ID, расписанием и промптами | | CronDelete | Удалить задачу по 8-символьному ID | Лимит — 50 задач на сессию. Честно, не представляю сценарий, где нужно столько или даже больше. ## Как это работает внутри Планировщик проверяет задачи каждую секунду и ставит их в очередь с низким приоритетом. Промпт выполняется между твоими запросами, а не пока Claude отвечает на текущий. Если Claude занят, задача подождёт, пока он освободится. Все времена интерпретируются в твоей локальной таймзоне. Выражение `0 9 * * *` означает 9 утра в твоём часовом поясе, а не UTC. ### Jitter Чтобы тысячи сессий не стучались в API одновременно, планировщик слегка сдвигает время срабатывания: - Повторяющиеся задачи могут сработать с задержкой до 10% от их периода, но не более 15 минут. Часовая задача может сработать в любое время от `:00` до `:06` - Разовые задачи, привязанные к началу или середине часа, могут сработать до 90 секунд раньше Смещение зависит от ID задачи и всегда одинаковое для одной и той же задачи. Если точное время критично — ставь минуту, отличную от `:00` или `:30` (например, `3 9 * * *` вместо `0 9 * * *`). ### Автоудаление через 3 дня Повторяющиеся задачи автоматически удаляются через 3 дня. Логично — никто не хочет обнаружить, что забытый `/loop` тихо сжигает токены уже вторую неделю. Если нужно дольше, пересоздай задачу до истечения. ## Cron-выражения `CronCreate` принимает стандартные 5-значные cron-выражения: `минуты часы день-месяца месяц день-недели`. | Выражение | Значение | | ---------------- | -------------------- | | \*/5 \* \* \* \* | Каждые 5 минут | | 0 \* \* \* \* | Каждый час ровно | | 7 \* \* \* \* | Каждый час в 7 минут | | 0 9 \* \* \* | Каждый день в 9:00 | | 0 9 \* \* 1-5 | По будням в 9:00 | | 30 14 15 3 \* | 15 марта в 14:30 | День недели: `0` или `7` — воскресенье, `6` — суббота. Расширенный синтаксис вроде `L`, `W`, `?` и текстовых алиасов (`MON`, `JAN`) не поддерживается. ## Ограничения Задачи привязаны к сессии, и это накладывает ограничения: - Задачи работают только пока Claude Code запущен и свободен. Закроешь терминал — всё отменится - Нет «догоняющего» выполнения. Если Claude был занят, когда задача должна была сработать — она выполнится один раз после освобождения, без повторов за пропущенные интервалы - Нет сохранения между перезапусками. Перезапуск Claude Code очищает все задачи ## Как отключить планировщик Если запланированные задачи мешают или не нужны: ```bash export CLAUDE_CODE_DISABLE_CRON=1 ``` После этого cron-инструменты и `/loop` станут недоступны, а все запланированные задачи перестанут срабатывать. ## Что ещё почитать - [Как сэкономить токены на MCP с Tool Search](https://blog.matveev.tech/claude-code-tool-search-mcp-tokeny/?ref=matveev.tech) — если используешь MCP-серверы в Claude Code - [Claude Code Remote Control: управляй сессией с телефона](https://blog.matveev.tech/claude-code-remote-control/?ref=matveev.tech) — ещё один способ взаимодействия с Claude Code - [Claude Code Security: AI сканирует код на уязвимости](https://blog.matveev.tech/claude-code-security-obzor/?ref=matveev.tech) — безопасность в Claude Code ### Дайджест 2 - 8 марта 2026 URL: https://matveev.tech/weekly-2026-03-02/ Last updated: 2026-03-09T10:37:23.000Z > TL;DR: На этой неделе OpenAI выкатила GPT-5.4 с computer use и контекстом на миллион токенов, я разобрал все 21 плагин Claude Cowork по полочкам, а Google выпустил самую дешёвую модель в линейке Gemini 3. ## GPT-5.4: OpenAI догоняет Claude по computer use OpenAI объединила coding из GPT-5.3-Codex и reasoning из GPT-5.2 в одну модель, добавив нативный computer use. На OSWorld-Verified GPT-5.4 набрала 75%, что выше человеческого уровня (72.4%) и на 28 пунктов больше предшественника. Контекст вырос до 1M токенов. А tool search снижает расход токенов на 47% при работе с MCP-серверами. Честно, не ожидал такой скорости. Полгода назад computer use был фишкой только Claude, а теперь OpenAI показывает результаты выше человека. Правда, бенчмарки и повседневная работа часто расходятся, так что подожду реальных тестов. [Читать полный обзор →](https://matveev.tech/gpt-5-4-obzor/) ## 21 плагин Claude Cowork — кто стоит внимания Anthropic выпустила уже две волны плагинов для Cowork — итого 21 штука. Я потестировал каждый и составил честный тир-лист. Коротко: ставить немедленно стоит Data Analysis (кидаешь CSV → получаешь SQL и инсайты) и Productivity (через неделю настройки Claude начинает работать как ассистент, который помнит твои задачи). Legal наделал шума — софтверные акции потеряли $285 млрд за день, Thomson Reuters упала на 17%. Но меня больше зацепила стратегия. Плагины — это markdown-файлы, ни строчки кода. Anthropic строит платформу, где экспертизу может упаковать любой. [Читать тир-лист →](https://matveev.tech/claude-cowork-plugins-tier-list/) ## Gemini 3.1 Flash-Lite: $0.25 за миллион токенов Google выпустил самую быструю и дешёвую модель в линейке Gemini 3\. Входные токены — $0.25/M, первый ответ приходит в 2.5 раза быстрее предшественника. На Arena.ai модель набрала Elo 1432 — для такого ценника это серьёзно. Thinking levels из коробки позволяют регулировать глубину рассуждений под задачу. Если у тебя есть пайплайны с кучей LLM-вызовов, Flash-Lite точно стоит потестить. Сложный reasoning не потянет, зато для перевода, модерации и разметки за такую цену конкурентов пока нет. [Читать обзор →](https://matveev.tech/gemini-3-1-flash-lite-obzor/) ## Ещё на этой неделе - [GPT-5.3 Instant: что нового в модели ChatGPT](https://matveev.tech/gpt-5-3-instant-obzor/) — облегчённая версия пятёрки от OpenAI, быстрее и дешевле основной модели - [Claude Import Memory: как перенести память из ChatGPT](https://matveev.tech/claude-import-memory-obzor/) — Anthropic добавила импорт памяти, чтобы переезд с ChatGPT стал проще ### GPT-5.4: computer use, tool search и 1M контекст URL: https://matveev.tech/gpt-5-4-obzor/ Last updated: 2026-03-05T20:27:52.000Z > TL;DR: OpenAI выпустила GPT-5.4 — модель, которая объединяет coding-мощь GPT-5.3-Codex с нативным computer use, tool search и контекстным окном до 1M токенов. По бенчмаркам обходит GPT-5.2 практически везде, а на OSWorld превзошла даже человека. Если ты следил за обновлениями OpenAI последних месяцев, то помнишь: сначала GPT-5.2 для reasoning, потом GPT-5.3-Codex для кода. Два отдельных трека, два отдельных выбора. GPT-5.4 собирает это в одну модель — и добавляет сверху computer use, который раньше был только у Claude. ## Что умеет GPT-5.4 GPT-5.4 — первая general-purpose модель OpenAI с нативным computer use. Модель управляет компьютером: кликает, набирает текст, работает с приложениями через скриншоты и Playwright. На OSWorld-Verified она набрала 75.0% — выше человеческого уровня (72.4%) и на 28 пунктов больше GPT-5.2. ![Сравнение работы с таблицами GPT-5.2 vs GPT-5.4](https://matveev.tech/content/images/2026/03/gpt-5-4-spreadsheet-comparison.webp) Контекстное окно выросло до 1 миллиона токенов (экспериментально в Codex). Стандартное окно осталось на 272K, а запросы сверх него тарифицируются по двойной ставке. Ещё одна штука, которая мне кажется важнее. Раньше все определения инструментов грузились в промпт целиком. Если у тебя 30+ MCP-серверов, это десятки тысяч токенов на каждый запрос. Теперь модель получает лёгкий список и подгружает определения по мере надобности. По данным OpenAI, на бенчмарке MCP Atlas это снизило расход токенов на 47% при той же точности. Кстати, у Claude Code похожая механика уже есть — я [писал про это](https://matveev.tech/claude-code-tool-search-mcp-tokeny/). ## Бенчмарки — цифры Вот ключевые результаты в сравнении с GPT-5.2 и GPT-5.3-Codex: | Бенчмарк | GPT-5.4 | GPT-5.3-Codex | GPT-5.2 | | ----------------------------------- | --------- | ------------- | ------- | | GDPval (профессиональные задачи) | **83.0%** | 70.9% | 70.9% | | SWE-Bench Pro | **57.7%** | 56.8% | 55.6% | | OSWorld-Verified | **75.0%** | 74.0% | 47.3% | | BrowseComp (поиск в вебе) | **82.7%** | 77.3% | 65.8% | | Toolathlon (работа с инструментами) | **54.6%** | 51.9% | 46.3% | | ARC-AGI-2 | **73.3%** | — | 52.9% | Больше всего впечатляет GDPval — модель совпадает или превосходит профессионалов в 83% случаев по 44 профессиям. Это задачи типа «сделай sales-презентацию» или «построй модель в Excel». Кстати, на внутреннем бенчмарке инвестбанковского моделирования GPT-5.4 набрала **87.3%** против 68.4% у GPT-5.2. ## Computer use — подробнее Модель работает двумя способами: пишет код через Playwright или управляет через скриншоты + мышь/клавиатура. Разработчики могут настраивать поведение через системные промпты и задавать кастомные confirmation policies для разных уровней риска. В Codex появился экспериментальный навык **Playwright (Interactive)** — модель может визуально дебажить веб-приложения и даже тестировать их прямо во время написания кода. На WebArena-Verified модель показала **67.3%**, а на Online-Mind2Web через скриншоты — **92.8%** (против 70.9% у ChatGPT Atlas Agent Mode). ## Thinking с пояснениями В ChatGPT модель теперь показывает план рассуждений до начала работы. Можно скорректировать направление прямо во время ответа, не дожидаясь конца. Раньше приходилось ждать полный ответ, потом переформулировать, потом ждать снова. Теперь один раунд вместо трёх. Модель также лучше держит контекст при длинных рассуждениях — меньше «забывает» что было в начале диалога. ## Галлюцинации и факты По сравнению с GPT-5.2: - Отдельные утверждения на **33% реже** оказываются ложными - Полные ответы на **18% реже** содержат хотя бы одну ошибку OpenAI называет GPT-5.4 «самой фактологичной моделью» на сегодня. Насколько это чувствуется в ежедневной работе, покажет время. ## Цены API Модель стала дороже по цене за токен, но эффективнее по расходу: | Модель | Input | Cached input | Output | | ----------- | ------- | ------------ | ------ | | gpt-5.2 | $1.75/M | $0.175/M | $14/M | | gpt-5.4 | $2.50/M | $0.25/M | $15/M | | gpt-5.2-pro | $21/M | — | $168/M | | gpt-5.4-pro | $30/M | — | $180/M | Input подорожал на 43%, output — на 7%. Но OpenAI утверждает, что GPT-5.4 тратит меньше токенов на reasoning, так что итоговый счёт может оказаться ниже. Посмотрим. Batch и Flex — по полцены, Priority processing — по двойной. ## Безопасность ![GPT-5.4 Lockdown Mode](https://matveev.tech/content/images/2026/03/gpt-5-4-lockdown-mode.webp) OpenAI классифицирует GPT-5.4 как **High cyber capability**. Ещё OpenAI проверяла CoT controllability — может ли модель намеренно скрывать ход рассуждений от мониторинга. У GPT-5.4 способность «прятать мысли» оказалась низкой. То есть chain-of-thought мониторинг пока работает, модель не научилась его обманывать. ## Доступность В ChatGPT модель доступна для Plus, Team и Pro — заменяет GPT-5.2 Thinking. Старая версия уходит в Legacy Models на три месяца, до 5 июня 2026\. GPT-5.4 Pro — только для Pro и Enterprise. В API модели доступны как `gpt-5.4` и `gpt-5.4-pro`. В Codex /fast режим даёт до 1.5x ускорение при том же качестве. ## Вывод Честно, я не ожидал, что OpenAI так быстро догонит Claude по computer use. 75% на OSWorld — это серьёзно. Но бенчмарки и реальная работа это разные вещи, так что пока не тестирую сам — рано делать выводы. Что точно радует — tool search. Для агентских сценариев с кучей MCP-серверов это заметно упрощает жизнь. Буду тестировать на реальных задачах. --- ## FAQ ### Чем GPT-5.4 отличается от GPT-5.2? GPT-5.4 объединяет coding-возможности GPT-5.3-Codex с reasoning GPT-5.2, добавляя нативный computer use, tool search и контекст до 1M токенов. На бенчмарке OSWorld она набрала 75% против 47.3% у GPT-5.2. ### Сколько стоит GPT-5.4 в API? Input — $2.50 за миллион токенов, output — $15 за миллион. Cached input — $0.25/M. Batch и Flex доступны по половине стоимости, Priority processing — по двойной. ### GPT-5.4 умеет управлять компьютером? Да, GPT-5.4 — первая general-purpose модель OpenAI с нативным computer use. Она может кликать, набирать текст, работать с приложениями через скриншоты и Playwright. На OSWorld-Verified превзошла человеческий уровень — 75% против 72.4%. ### Когда уберут GPT-5.2? GPT-5.2 Thinking останется в Legacy Models до 5 июня 2026 года, после чего будет отключена. GPT-5.4 Thinking заменяет её как основную модель для Plus, Team и Pro подписок. ## Что ещё почитать - [GPT-5.3 Instant: что нового в модели ChatGPT](https://matveev.tech/gpt-5-3-instant-obzor/) — предыдущая модель OpenAI, облегчённая версия - [Мультиагенты в OpenAI Codex — настройка и примеры](https://matveev.tech/codex-multi-agent-setup/) — как работают агенты в Codex - [WebSocket Mode в OpenAI API: агенты быстрее на 40%](https://matveev.tech/openai-websocket-mode-api/) — оптимизация API для агентов ## ### GPT-5.3 Instant: что нового в модели ChatGPT URL: https://matveev.tech/gpt-5-3-instant-obzor/ Last updated: 2026-03-04T09:30:05.000Z > TL;DR: OpenAI выпустила GPT-5.3 Instant — обновление основной модели ChatGPT. Меньше лишних оговорок и отказов, точнее работа с веб-источниками, на 27% меньше галлюцинаций. Доступна всем пользователям прямо сейчас. 3 марта OpenAI обновила самую используемую модель в ChatGPT. GPT-5.3 Instant — это не какой-то прорыв нового поколения, а скорее шлифовка того, что бесило пользователей каждый день: ненужные оговорки, слишком осторожные ответы и странный тон. Вроде бы мелочи. Но именно они определяют, хочется ли открывать ChatGPT снова или переключаться на что-то [другое](https://matveev.tech/tag/claude/). ## Меньше отказов и морализаторства Главная боль GPT-5.2 Instant — модель слишком часто отказывалась отвечать на вполне безобидные вопросы. Или начинала с длинного вступления о том, чем она «не может помочь», прежде чем всё-таки помочь. OpenAI приводит пример. Пользователь спрашивает про расчёт траектории стрелы для стрельбы из лука на длинную дистанцию. GPT-5.2 Instant начинает с абзаца о том, что не может помогать с «повышением эффективности оружия», предлагает кучу безопасных альтернатив, и только потом переходит к физике. GPT-5.3 Instant просто отвечает на вопрос. Даёт формулы, спрашивает параметры лука и расстояние, предлагает построить модель с учётом аэродинамики. Без лекций о безопасности. Мне кажется, это самое заметное изменение для повседневного использования. Когда модель перестаёт вести себя как перепуганный юрист, общаться с ней становится в разы приятнее. ## Точность: на 27% меньше галлюцинаций OpenAI замерила частоту галлюцинаций двумя способами: - Экспертная оценка (медицина, право, финансы): минус 26.8% с веб-поиском, минус 19.7% без - Обратная связь пользователей (на реальных ошибках из ChatGPT): минус 22.5% с веб-поиском, минус 9.6% без По данным OpenAI, GPT-5.3 Instant — самая точная модель в линейке для повседневных задач. Без доступа к интернету прогресс скромнее, а вот с веб-поиском разница ощутимая. ## Лучше пишет тексты Ещё одно улучшение касается генерации текстов. OpenAI говорит, что GPT-5.3 Instant стал лучше в художественной прозе: больше деталей, меньше абстракции, естественные концовки. Для тех, кто использует ChatGPT для копирайтинга или редактуры, это может быть полезно. Хотя я бы всё равно перепроверял — склонность к шаблонам у GPT-моделей пока никуда не делась. ## Доступность и ограничения GPT-5.3 Instant доступен с 3 марта 2026 года: - ChatGPT — всем пользователям, включая бесплатный тариф - API — модель `gpt-5.3-chat-latest` - Thinking и Pro — обновление скоро GPT-5.2 Instant будет доступен ещё 3 месяца в разделе Legacy Models для платных подписчиков. 3 июня 2026 модель выведут из обращения. Из ограничений OpenAI честно признаёт проблемы с неанглийскими языками — японский и корейский звучат «деревянно». ## Вывод GPT-5.3 Instant — не революция. Убрали раздражающие паттерны (лишние отказы, морализаторство, кринж-тон), добавили точности в работе с вебом и снизили галлюцинации. Для тех, кто пользуется ChatGPT каждый день, это заметное улучшение. Не из тех, которые вау, но из тех, после которых реже хочется закрыть вкладку. ## Что ещё почитать - [ChatGPT Deep Research перешёл на GPT-5.2 — что изменилось](https://matveev.tech/chatgpt-deep-research-gpt-5-2/) — контекст предыдущего обновления - [GPT-5.3 Codex Spark — 1000 токенов/с на чипах Cerebras](https://matveev.tech/gpt-5-3-codex-spark-cerebras/) — модель для кодинга из семейства GPT-5.3 - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://matveev.tech/claude-sonnet-4-6-obzor/) — главный конкурент от Anthropic ### Gemini 3.1 Flash-Lite: быстрая и дешёвая модель Google URL: https://matveev.tech/gemini-3-1-flash-lite-obzor/ Last updated: 2026-03-03T17:09:22.000Z > TL;DR: Google выпустил Gemini 3.1 Flash-Lite — самую быструю и дешёвую модель в линейке Gemini 3\. Стоит $0.25 за миллион входных токенов, работает в 2.5 раза быстрее предшественника и обходит конкурентов своего класса по бенчмаркам. Доступна в preview через Google AI Studio и Vertex AI. Google продолжает расширять линейку Gemini 3\. Сегодня вышла модель для тех, кому не нужен гигантский мозг, а нужна скорость и низкий ценник — Gemini 3.1 Flash-Lite. ## Сколько стоит и насколько быстрая Gemini 3.1 Flash-Lite На входе $0.25 за миллион токенов, на выходе $1.50\. Первый ответ приходит в 2.5 раза быстрее, чем у предшественника Gemini 2.5 Flash, а скорость генерации выросла на 45% — по данным [Artificial Analysis](https://artificialanalysis.ai/?ref=matveev.tech). ![Скорость и стоимость Gemini 3.1 Flash-Lite в сравнении с GPT-5 mini, Claude 4.5 Haiku и Grok 4.1 Fast](https://matveev.tech/content/images/2026/03/gemini-3-1-flash-lite-speed-cost.gif) Для сравнения, Claude 4.5 Haiku стоит дороже, а GPT-5 mini работает медленнее. По соотношению цена/скорость Flash-Lite сейчас выглядит выгоднее конкурентов, хотя надо понимать — это графики от самого Google, так что стоит подождать независимых замеров. ## Что показывают бенчмарки? На Arena.ai модель набрала Elo 1432\. Для модели с таким ценником, это серьёзно. По академическим бенчмаркам тоже неплохо: - GPQA Diamond: 86.9% (экспертное рассуждение) - MMMU Pro: 76.8% (мультимодальное понимание) ![Сравнительная таблица бенчмарков Gemini 3.1 Flash-Lite с GPT-5 mini, Claude 4.5 Haiku и другими моделями](https://matveev.tech/content/images/2026/03/gemini-3-1-flash-lite-benchmarks.gif) Google говорит, что Flash-Lite обходит не только одноклассников, но и более крупные модели прошлых поколений вроде Gemini 2.5 Flash. ## Thinking levels регулирует, сколько модель думает Flash-Lite поддерживает thinking levels из коробки, и мне кажется, именно это делает её по-настоящему гибкой. Ты сам выбираешь, сколько модель должна «думать» над задачей. Для классификации или модерации ставишь минимум, и ответ приходит мгновенно. Для генерации UI или сложных инструкций включаешь глубокий режим. На практике это удобно: не нужно держать две модели для разных типов задач. Одна Flash-Lite покрывает и быстрые, и чуть более вдумчивые запросы. ## Для каких задач подходит Google позиционирует Flash-Lite для массовых операций: перевод, модерация контента, генерация UI-компонентов, разметка данных, симуляции. В общем, всё, где нужно обработать много запросов и не разориться. Несколько компаний уже попробовали модель. Kolby Nottingham из Latitude говорит, что Flash-Lite следует инструкциям на уровне моделей классом выше. Andrew Carr из Cartwheel хвалит скорость мультимодальной разметки. Kaan Ortabas из HubX отмечает экономию при масштабировании. Понятно, что ранние отзывы часто преувеличенно восторженные, но направление понятно — модель целит в продакшн-задачи с большим объёмом. ## Стоит ли пробовать? Если у тебя есть пайплайны с большим количеством LLM-вызовов, Flash-Lite точно стоит потестировать. Сложный reasoning — не её задача, для этого есть Pro. А вот перевод, классификация, разметка, генерация шаблонов — тут она может сэкономить ощутимые деньги. Модель доступна в preview в [Google AI Studio](https://aistudio.google.com/?ref=matveev.tech) и Vertex AI. ## Что ещё почитать - [Gemini 3.1 Pro — что нового в модели Google](https://matveev.tech/gemini-3-1-pro-obzor/) — старший брат Flash-Lite, обзор флагмана серии - [Nano Banana 2: качество Pro на скорости Flash](https://matveev.tech/nano-banana-2-obzor/) — ещё одна модель Google, оптимизированная под скорость - [Mercury 2 — LLM на диффузии с 1000 токенов/сек](https://matveev.tech/mercury-2-diffusion-llm/) — альтернативный подход к ускорению генерации - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://matveev.tech/claude-sonnet-4-6-obzor/) — конкурент из лагеря Anthropic --- ## FAQ **Сколько стоит Gemini 3.1 Flash-Lite?** Модель стоит $0.25 за миллион входных токенов и $1.50 за миллион выходных. Это одна из самых дешёвых моделей в своём классе, дешевле Claude 4.5 Haiku и GPT-5 mini. **Чем Flash-Lite отличается от Gemini 3.1 Pro?** Flash-Lite — лёгкая версия для массовых задач, где важны скорость и цена. Pro — флагман для сложного reasoning и мультимодальных задач. Flash-Lite быстрее и дешевле, Pro — умнее. **Где попробовать Gemini 3.1 Flash-Lite?** Модель доступна в preview через Google AI Studio и Vertex AI. Нужен Google-аккаунт и доступ к Gemini API. **Для каких задач лучше всего подходит?** Перевод, модерация контента, разметка данных, генерация интерфейсов и любые высоконагруженные пайплайны, где нужна скорость при разумной цене. ### Claude Import Memory: как перенести память из ChatGPT URL: https://matveev.tech/claude-import-memory-obzor/ Last updated: 2026-03-03T12:31:12.000Z > TL;DR: Claude Import Memory — фича Anthropic, которая позволяет перенести все накопленные предпочтения и контекст из ChatGPT, Gemini или любого другого AI-ассистента в Claude за пару копипастов. Работает на всех платных планах. Если ты пользовался ChatGPT полгода-год, у тебя там накопилась куча контекста. Модель знает, на каком языке ты кодишь, какой тон предпочитаешь, над какими проектами работаешь. И вот ты решил попробовать Claude. А он тебя не знает. Придётся заново объяснять всё с нуля? Anthropic говорит: нет. 1 марта 2026 компания запустила [claude.com/import-memory](https://claude.com/import-memory?ref=matveev.tech) — страницу, которая проведёт тебя через перенос «памяти» из любого AI-ассистента в Claude. ## Import Memory Это по сути промпт. Anthropic подготовил специальный запрос, который ты вставляешь в свой текущий AI. Этот промпт заставляет ассистента выгрузить все сохранённые воспоминания о тебе в одном текстовом блоке. Потом ты копируешь результат и вставляешь в настройки памяти Claude. Звучит примитивно, но это работает. Никаких API-токенов, JSON-файлов или экспортов. ## Быстрый старт Процесс занимает минуту. **Шаг 1.** Открой [claude.com/import-memory](https://claude.com/import-memory?ref=matveev.tech) и скопируй промпт, который там предлагают. **Шаг 2.** Вставь этот промпт в ChatGPT (или Gemini, Copilot, Grok — что используешь). AI выдаст список всех сохранённых воспоминаний о тебе в виде текстового блока. **Шаг 3.** Скопируй весь вывод. **Шаг 4.** В Claude зайди в **Settings → Capabilities → Memory** и нажми «Start import». Вставь текст и нажми «Add to memory». **Шаг 5.** Подожди до 24 часов — Claude обрабатывает память в ежедневных циклах синтеза, а не в реальном времени. Для пользователей ChatGPT есть альтернативный путь: Settings → Personalization → Manage Memories — можно скопировать записи напрямую оттуда. После импорта можно проверить результат вопросом: «Я обновил память. Что ты узнал обо мне?» ## Двусторонний экспорт Работает и в обратную сторону. Решил уйти из Claude? Просто попроси его: «Выпиши все воспоминания обо мне дословно, как они хранятся в памяти». Или зайди в Settings → Capabilities → View and edit your memory. Никто тебя не держит. ## Вердикт Если ты давно хотел попробовать Claude, но не хотел терять контекст из ChatGPT, теперь можно не терять. Перенос реально занимает минуту, результат ощущается сразу. Ну, через 24 часа. Но я бы не стал удалять ChatGPT ради этого. Перенеси память, попользуйся Claude пару недель, сравни. Import Memory не причина переехать. Это способ сделать переезд безболезненным, если ты к нему уже готов. [Switch to Claude without starting over | ClaudeTransfer your preferences, projects, and context from other AI providers into Claude. Switch without losing what makes your AI useful.![](https://matveev.tech/content/images/icon/689f4a9aff1f63fde75cf733_favicon-1.png)Claude![](https://matveev.tech/content/images/thumbnail/68c469d1859e3e7ecf6c2310_og-claude-finance.jpg)](https://claude.com/import-memory?ref=matveev.tech) ## FAQ ### Можно ли перенести память из ChatGPT в Claude бесплатно? Сам процесс переноса бесплатный, но для хранения памяти нужен платный план Claude — минимум Pro за $20/мес. На бесплатном плане функция памяти недоступна. ### Что именно переносится из ChatGPT? Переносятся сохранённые предпочтения: стиль общения, рабочий контекст, технические настройки, имя и локация. Не переносятся: история чатов, прикреплённые файлы и Custom GPTs. ### Сколько времени занимает импорт памяти? Сам процесс — пара минут копипаста. Но Claude обрабатывает импортированную память в ежедневных циклах, поэтому полное включение может занять до 24 часов. ### Безопасно ли переносить данные между AI-ассистентами? Claude шифрует память и не использует её для обучения модели. Но стоит просмотреть выгрузку из ChatGPT перед импортом — промпт вытягивает всё, включая личные данные. Удали то, что не хочешь передавать. ## Что ещё почитать - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://matveev.tech/claude-sonnet-4-6-obzor/) — если хочешь понять, какая модель будет работать с твоей импортированной памятью - [21 плагин Claude Cowork — честный рейтинг](https://matveev.tech/claude-cowork-plugins-tier-list/) — что ещё умеет экосистема Claude - [Claude в Excel — AI-помощник прямо в таблицах](https://matveev.tech/claude-in-excel-obzor/) — Claude уже не только в чате ### 21 плагин Claude Cowork — честный рейтинг URL: https://matveev.tech/claude-cowork-plugins-tier-list/ Last updated: 2026-03-02T08:54:24.000Z > TL;DR: У Claude Cowork 21 плагин, и большинство обзоров просто перечисляют их списком. Я поработал с каждым и выделил шесть, которые реально стоит ставить. Остальные — в таблице с короткими вердиктами. Когда Anthropic 30 января выложила [11 плагинов для Cowork](https://claude.com/blog/cowork-plugins?ref=matveev.tech), рынок отреагировал нервно. За один день 3 февраля софтверные акции потеряли $285 млрд капитализации — Thomson Reuters упала на 17%, LegalZoom на 20%. Трейдеры Jefferies начали называть это SaaSpocalypse. Причина — папка с markdown-файлами на GitHub. 24 февраля [вышла вторая волна](https://claude.com/blog/cowork-plugins-across-enterprise?ref=matveev.tech): ещё 10 плагинов, уже заточенных под конкретные индустрии. Итого 21 штука. Я потестировал все. Честно скажу: обзоры, которые я читал до этого, либо пересказывали пресс-релиз, либо тестировали вечерок и писали «перспективно». Ни один не ответил на простой вопрос: что из этого реально работает, а что пока больше маркетинг? ## Что такое плагин Cowork Плагин — не промпт. Это папка, в которой лежат четыре вещи: skills (знания по конкретной области), slash-команды (готовые воркфлоу), коннекторы через MCP (подключения к Slack, Jira, HubSpot и другим сервисам) и субагенты (параллельные воркеры для сложных задач). ![Каталог плагинов Claude Cowork с категориями и описаниями](https://matveev.tech/content/images/2026/02/cowork-plugins-marketplace.png) Когда ставишь, скажем, плагин Sales — Claude не просто получает инструкцию «пиши продажные письма». Он загружает методологию: знает, как готовить call prep, как строить battlecard, спросит про стадию сделки перед тем, как начать. Разница примерно как между тем, чтобы спросить умного знакомого и человека, который делает эту работу пять лет. Но обещание и реальность — разные вещи. Дальше про те плагины, где обещание выполняется. ## Data Analysis Если из всей статьи запомнишь одно — запомни этот плагин. Кидаешь CSV в папку Cowork, пишешь `/data:explore`. Claude сам разбирает каждую колонку, находит аномалии, проблемы с качеством и предлагает, что стоит проанализировать. До того, как ты сформулировал вопрос. Дальше `/data:write-query` — описываешь задачу обычным языком, получаешь SQL. Claude его валидирует и объясняет логику. Через коннекторы подключается к Snowflake, Databricks, BigQuery и работает с живыми данными. ## Legal Про этот плагин написали больше всего, и в основном из-за паники на рынке. Но если отбросить драму с акциями, что он реально делает? Ревью контрактов, сортировка NDA, compliance-воркфлоу, юридические брифинги, шаблонные ответы. Не заменяет юриста, но забирает на себя процентов 60 рутины, которую раньше делали джуниоры и параллегалы. ![Интерфейс настройки плагинов в Claude Cowork](https://matveev.tech/content/images/2026/02/cowork-plugins-customize.png) Thomson Reuters потеряла 17% за день — худший результат в истории компании. RELX (LexisNexis) просела на 14%, самое резкое падение с 1988 года. LegalZoom — почти 20%. Аналитики [Morningstar отметили](https://xpert.digital/en/saas-apocalypse-on-wall-street/?ref=matveev.tech), что Thomson в самой большой зоне риска: 45% их EBIT приходится на юридический сегмент. Забавная деталь: через три недели после обвала LexisNexis объявил, что интегрирует этот самый плагин Anthropic в свою платформу Protegé. Если не можешь победить — присоединяйся. Почему не ставлю его в S-тир: из коробки он неплох, но для серьёзной работы нужно скормить ему шаблоны, правила и risk tolerance конкретной организации. Настроенный Legal — страшная вещь. Ненастроенный — ну, средний AI для юридических текстов. ## Productivity: неожиданно, самый полезный для повседневной работы Я думал, это будет скучный таск-менеджер поверх Claude. Оказалось интереснее. `/productivity:start` — Claude смотрит на твой день, расставляет приоритеты, формирует список задач. Подключается к Slack, Notion, Asana, Linear, Jira, Monday, ClickUp, Microsoft 365. Фишка не в отдельных функциях, а в накопительном эффекте. Через неделю, когда Productivity уже знает твои context-файлы и привычки, Claude начинает работать как ассистент, который реально помнит, чем ты занимаешься. Я теперь открываю его утром первым — до почты, до Notion. *Это при условии, что ты потратил время на настройку context-файлов. Без них будет просто ещё один красивый to-do лист.* ## Engineering: тот, что ближе всего к аудитории этого блога Появился 24 февраля. Саммари стендапов, координация инцидентов, чеклисты деплоя, постмортемы. Если команда уже использует Claude Code для кодинга, Engineering расширяет это на менеджерскую рутину, которая съедает у тимлидов полдня: написать постмортем, собрать саммари по стендапу, подготовить deploy checklist. Шаблон постмортема оказался на удивление толковым: таймлайн, root cause, contributing factors, влияние на клиентов, action items с ответственными и дедлайнами. Лучше большинства внутренних шаблонов, которые я видел. B-тир, потому что нужно подстроить под свои уровни severity и протоколы коммуникации. Но фундамент хороший. ## Product Management `/product-management:write-spec` берёт расплывчатую идею и собирает спецификацию с user stories, критериями приёмки и техтребованиями. Причём сначала задаёт уточняющие вопросы — результат основан на твоих ограничениях, а не на шаблоне. ![Slash-команды плагинов с формами ввода в Claude Cowork](https://matveev.tech/content/images/2026/02/cowork-plugins-elicitation.png) Roadmap-команда синтезирует бэклог, инпут стейкхолдеров и конкурентный контекст в приоритизированный роадмэп. То, на что PM тратит два-три часа, собирается за минуты. Список коннекторов впечатляет: Slack, Linear, Asana, Monday, ClickUp, Jira, Notion, Figma, Amplitude, Pendo, Intercom, Fireflies. A-тир. Для продактов, пожалуй, must-have. ## Остальные 15 плагинов: короткий вердикт Не буду расписывать каждый — вот таблица с тиром и в чём суть: | Плагин | Тир | Суть | | ---------------------- | --- | ------------------------------------------------------------------------------------ | | Sales | S | Call prep, battlecard, CRM-интеграции. Заменяет 90 мин подготовки на 10 | | Marketing | A | Контент с учётом бренд-войса, планирование кампаний. Крутой /marketing:draft-content | | Finance | A | Отчётность, аудит, PwC в партнёрах. Воркфлоу Excel→PowerPoint работает | | Customer Support | B | Тriage тикетов, KB-статьи. Нужна кастомизация тона | | HR | B | Офферы, ревью, компенсации. Хороший фреймворк, нужны данные компании | | Operations | B | Runbook-ы, оценка вендоров. Скучный, но полезный | | Design | B | UX-копирайтинг, аудит WCAG. Не генерирует картинки | | Financial Analysis | B | Моделирование, PowerPoint. Генералист для финансов | | Investment Banking | B | Comps, питч-материалы. Нужны стандарты фирмы | | Equity Research | B | Парсинг earnings, обновление моделей | | Private Equity | B | Deal sourcing, скоринг сделок | | Brand Voice (Tribe AI) | B | Партнёрский. Создаёт гайд по голосу из примеров | | Enterprise Search | C | Поиск по всем инструментам. Зависит от порядка в документации | | Bio Research | C | PubMed, bioRxiv, Benchling. Узкая аудитория | | Wealth Management | C | Портфельный анализ. Без FactSet/MSCI бесполезен | | Plugin Management | C\* | Мета-плагин. A-тир для админов, не нужен остальным | ## Зачем это всё Anthropic Если отвлечься от рейтингов, тут интереснее стратегия. Первая волна била по горизонтали: продуктивность, продажи, маркетинг, данные, юриспруденция. То, что нужно любой компании. Вторая пошла вертикально: инвестбанкинг, PE, equity research, HR, инженерия. Anthropic не пробует рынок — они строят платформу. И вот что тут важно: плагины — это просто текстовые файлы. Markdown. Ни строчки кода. [Репозиторий на GitHub](https://github.com/anthropics/knowledge-work-plugins?ref=matveev.tech) набрал уже 8 000+ звёзд, Anthropic зовёт компании делать свои плагины. PwC уже строит отраслевые плагины для регулируемых секторов. Приватные маркетплейсы для корпоративных команд работают. Anthropic отвечает за модель, MCP обеспечивает подключения к сервисам, плагины загружают экспертизу. Написать свой плагин может любой, кто умеет писать понятные инструкции. Кейт Дженсен из Anthropic на брифинге сказала прямо: «Мы ожидаем, что каждый knowledge worker будет относиться к Cowork так же, как инженеры относятся к Claude Code — как к инструменту, без которого не получается работать». Амбициозно, но после месяца с плагинами мне кажется, это не такая уж фантазия. Аналитик JPMorgan Тоби Огг сформулировал жёстче: софтверные компании сейчас получают приговор до суда. Улика — подписка за $20/мес, которая закрывает 40% функций корпоративных лицензий за $150. 10 плагинов за 25 дней. В марте будут ещё. Не знаю, успеют ли SaaS-компании адаптироваться быстрее, чем Anthropic итерирует. По тому, что видел за месяц, — скорее нет. ## Что ставить Открой [каталог плагинов](https://claude.com/plugins?ref=matveev.tech). Поставь Productivity и Data Analysis — они работают сразу. Дальше выбери один под свою роль и потрать полчаса на кастомизацию. --- ## FAQ **Сколько стоит доступ к плагинам Cowork?** Минимум — подписка Claude Pro за $20/мес. Cowork изначально был только для Max ($100-200/мес), но с 16 января 2026 доступ открыт на всех платных планах. **Можно ли создать свой плагин?** Да. Плагин — это папка с markdown-файлами, без кода. Примеры лежат в [открытом репозитории](https://github.com/anthropics/knowledge-work-plugins?ref=matveev.tech). Для команд есть приватные маркетплейсы. **Чем отличаются от плагинов Claude Code?** Claude Code — терминал для разработчиков. Cowork — десктопное приложение для не-программистов: маркетологов, продажников, аналитиков, юристов. Плагины Code расширяют кодинг, плагины Cowork — бизнес-процессы. **Какой плагин ставить первым?** Productivity. Он не требует настройки и полезен для любой роли. Data Analysis — если работаешь с данными. Sales — если в продажах. ## Что ещё почитать - [Плагины Claude Code — как расширить возможности](https://blog.matveev.tech/claude-code-plugins-marketplaces/?ref=matveev.tech) — обзор экосистемы плагинов для разработчиков - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://blog.matveev.tech/claude-sonnet-4-6-obzor/?ref=matveev.tech) — что нового в последней версии Claude - [Cursor Cloud Agents: агенты с виртуальными машинами](https://blog.matveev.tech/cursor-cloud-agents-computer-use/?ref=matveev.tech) — конкурентный подход к AI-агентам ### Дайджест 24 февраля - 1 марта 2026 URL: https://matveev.tech/weekly-2026-02-24/ Last updated: 2026-03-02T07:49:34.000Z > TL;DR: На этой неделе — облачные агенты Cursor с собственными виртуальными машинами, расследование Anthropic про кражу Claude китайскими лабораториями и первая коммерческая LLM на диффузии с 1000 токенов в секунду. ## Cursor Cloud Agents: агенты с виртуальными машинами Cursor [дал агентам собственные компьютеры](https://matveev.tech/cursor-cloud-agents-computer-use/). Каждый облачный агент получает изолированную VM, где может собирать проект, открывать браузер, кликать по кнопкам и записывать видео своей работы. Потом отдаёт готовый PR. Самое интересное — внутри Cursor уже 30% пул-реквестов создают агенты. Это не демо, а рабочий инструмент. Запускать можно откуда угодно: десктоп, веб, телефон, Slack. Можно даже подключиться к рабочему столу агента и порулить вручную. Мне кажется, замкнутый цикл «написал код → запустил → протестировал → починил» — это то, чего не хватало AI-агентам. До сих пор они работали вслепую. ## Как DeepSeek, Moonshot и MiniMax воровали Claude Anthropic [опубликовала отчёт](https://matveev.tech/anthropic-distillyatsiya-deepseek/), в котором прямо назвала три лаборатории — DeepSeek, Moonshot и MiniMax — виновными в систематической дистилляции Claude. 24 000 фейковых аккаунтов, 16 миллионов запросов. DeepSeek использовал Claude для генерации цензурных ответов на политически чувствительные вопросы. Moonshot целился в agentic reasoning и tool use. А MiniMax поставил рекорд — 13 миллионов запросов, и Anthropic поймала их до релиза обученной модели. Думаю, самый тревожный момент — не сама кража, а создание инструментов цензуры с помощью западных моделей. И контекст: Anthropic давно лоббирует экспортный контроль, так что этот отчёт — ещё и политический жест. ## Mercury 2 — LLM на диффузии с 1000 токенов/сек Inception Labs [показали Mercury 2](https://matveev.tech/mercury-2-diffusion-llm/) — первую коммерческую LLM, которая работает не на авторегрессии, а на диффузии. Вместо генерации по одному токену модель уточняет несколько токенов параллельно, как редактор правит черновик целиком. Результат: 1009 токенов в секунду на NVIDIA Blackwell — в 5 раз быстрее Claude Haiku и GPT-5 Mini. Цена — $0.25 за миллион входных токенов. Если у тебя агентский пайплайн с десятками вызовов модели — разница будет заметная. По качеству Mercury 2 конкурирует с быстрыми моделями, но до Opus или GPT-5 не дотягивает. Зато совместима с OpenAI API — подставляешь endpoint и всё работает. ## Ещё на этой неделе - [Claude в Excel — AI-помощник прямо в таблицах](https://matveev.tech/claude-in-excel-obzor/) — Claude теперь работает как формула внутри Excel и Google Sheets - [Настройка Ghostty: полный гайд от установки до конфига](https://matveev.tech/ghostty-nastrojka-polnaya/) — пошаговая настройка терминала Ghostty на macOS и Linux - [Claude Code: как сэкономить токены на MCP с Tool Search](https://matveev.tech/claude-code-tool-search-mcp-tokeny/) — новая фича для экономии контекста при работе с MCP-серверами - [Nano Banana 2: качество Pro на скорости Flash](https://matveev.tech/nano-banana-2-obzor/) — Google выпустила компактную модель, которая догоняет Pro по бенчмаркам - [Ghostty — обзор терминала от создателя Terraform](https://matveev.tech/ghostty-terminal-obzor/) — зачем Митчелл Хашимото написал терминал с нуля на Zig - [WebSocket Mode в OpenAI API: агенты быстрее на 40%](https://matveev.tech/openai-websocket-mode-api/) — новый режим подключения для снижения латентности агентов - [Claude Code Remote Control: управляй сессией с телефона](https://matveev.tech/claude-code-remote-control/) — как запускать и мониторить Claude Code удалённо ### Лучший терминал для macOS в 2026: Ghostty vs iTerm2 vs Kitty vs WezTerm URL: https://matveev.tech/ghostty-vs-iterm2-kitty-wezterm-sravnenie/ Last updated: 2026-03-01T17:28:40.000Z > **TL;DR:** Ghostty — лучший выбор для macOS, если нужен быстрый нативный терминал без возни. Kitty — если нужен скриптинг. WezTerm — если нужен встроенный мультиплексор или работа на Windows. iTerm2 — если не хочешь ничего менять. Alacritty — если нужен абсолютный минимализм. «Какой терминал поставить на Mac?» — этот вопрос задают каждый год. Раньше ответ был один — iTerm2\. Сейчас вариантов стало больше, и разница между ними не всегда очевидна. Я перепробовал все пять и расскажу, кому какой подойдёт. ## Участники Пять терминалов, которые в 2026 году стоит рассматривать. Все бесплатные и с открытым кодом (iTerm2 — исключение, но тоже бесплатный). ## Ghostty Терминал от Mitchell Hashimoto (создатель Terraform). Версия 1.0 вышла в декабре 2024-го, сейчас актуальная — 1.2.0\. Написан на Zig, UI нативный: Swift/AppKit на macOS, GTK4 на Linux. MIT-лицензия. Главная идея — быть одновременно быстрым и функциональным. GPU-рендеринг через Metal на macOS, встроенные сплиты, quick terminal (выпадающий терминал в стиле Quake), shell integration из коробки. Конфиг — простой key=value, без TOML, YAML или Lua. На macOS ощущается как родное приложение Apple. Не как «обёртка вокруг OpenGL-контекста», а как что-то, что мог бы сделать Apple, если бы им было не всё равно на Terminal.app. Чего нет: Windows, встроенного мультиплексора, скриптинга. ## iTerm2 Ветеран macOS-терминалов. Существует больше 15 лет, зрелый и стабильный. Написан на Objective-C, нативный для macOS. Только macOS — кроссплатформенности нет. Из фич: Python API для автоматизации, нативная tmux-интеграция (tmux panes отображаются как нативные вкладки), profiles, triggers, badges. Огромная база пользователей, любая проблема уже описана на Stack Overflow. Проблема iTerm2 — скорость. По бенчмаркам он в 4 раза медленнее Ghostty. На повседневных задачах разница заметна: прокрутка длинных логов, компиляция с обильным выводом — iTerm2 подлагивает. ## Kitty Терминал от Kovid Goyal. GPU-рендеринг через OpenGL, кроссплатформенный (macOS + Linux). Написан на C и Python. Лицензия — GPLv3. ![Сайт Kitty terminal — документация и возможности](https://matveev.tech/content/images/2026/02/kitty-terminal-homepage.jpg) Kitty первым внедрил протокол изображений (Kitty graphics protocol), который теперь поддерживает и Ghostty. Из уникального: kittens — скриптовые расширения на Python. Можно написать свой kitten для чего угодно: SSH-менеджер, diff-просмотрщик, unicodes. Remote control API — можно управлять Kitty из скрипта: открывать вкладки, менять шрифт, отправлять текст в другой pane. Для автоматизации — мощнее всех остальных. Конфиг — свой формат, похожий на ini. Сложнее, чем у Ghostty, но проще, чем Lua у WezTerm. ## WezTerm Терминал от Wez Furlong (один из разработчиков Mercurial). GPU-рендеринг через WebGPU (Metal на macOS, Vulkan на Linux, DX12 на Windows). Написан на Rust. MIT-лицензия. ![Сайт WezTerm — кроссплатформенный терминал с Lua-конфигом](https://matveev.tech/content/images/2026/02/wezterm-homepage.jpg) Главная фишка — встроенный мультиплексор. Не нужен tmux — WezTerm сам умеет сессии, отключение/подключение, SSH domains (подключаешься к серверу, и WezTerm рисует удалённые pane как локальные). Конфиг на Lua — можно программировать поведение терминала. Единственный из пятёрки, который работает на Windows. Если нужен один терминал на macOS + Linux + Windows — это WezTerm. Минус — скорость. В бенчмарках он в 2-5 раз медленнее Ghostty. И конфиг на Lua — это палка о двух концах: мощно, но порог входа выше. ## Alacritty Минималистичный терминал на Rust. GPU через OpenGL. Кроссплатформенный (macOS, Linux, Windows, BSD). Конфиг на TOML. ![Сайт Alacritty — быстрый минималистичный терминал](https://matveev.tech/content/images/2026/02/alacritty-homepage.jpg) Философия Alacritty: терминал должен быть быстрым и ничего больше. Нет сплитов, нет вкладок, нет лигатур, нет протокола изображений. Если что-то можно сделать через tmux — Alacritty не будет это реализовывать. Самый лёгкий по памяти (\~30 МБ). Для тех, кто живёт в tmux и от терминала хочет только скорость. ## Сравнение | | Ghostty | iTerm2 | Kitty | WezTerm | Alacritty | | ----------------- | ------------- | ------------------ | ---------------- | ------------------ | --------- | | GPU-рендеринг | Metal (macOS) | Metal | OpenGL | WebGPU | OpenGL | | macOS | да | да | да | да | да | | Linux | да | нет | да | да | да | | Windows | нет | нет | нет | да | да | | Нативный UI | да | да | нет | нет | нет | | Сплиты | да | нет (tmux) | да | да | нет | | Мультиплексор | нет | нет | нет | да | нет | | Скриптинг | нет | Python API | Python (kittens) | Lua | нет | | Лигатуры | да | да | да | да | нет | | Протокол картинок | Kitty | iTerm2 | Kitty | Kitty+iTerm2+Sixel | нет | | Конфиг | key=value | GUI + JSON | ini-подобный | Lua | TOML | | Quick terminal | да | да (hotkey window) | нет | нет | нет | | Память | 50-80 МБ | 150+ МБ | 40-60 МБ | 80-120 МБ | \~30 МБ | | Лицензия | MIT | Бесплатный | GPLv3 | MIT | MIT | ## Ghostty vs iTerm2 Самый частый вопрос — стоит ли мигрировать с iTerm2. Если ты привык к iTerm2 и тебя всё устраивает — можешь не переходить. iTerm2 — зрелый продукт, Python API мощный, tmux integration удобный. Но если раздражает скорость (прокрутка логов, компиляция), или потребление памяти (150+ МБ vs 50-80 МБ у Ghostty) — переход стоит того. Занимает 5 минут. Конфиг Ghostty проще, чем настройки iTerm2. Что потеряешь при переходе: Python API, нативную tmux-интеграцию (tmux panes как нативные вкладки), profiles. ## Ghostty vs Kitty Два похожих терминала. Оба с GPU, оба поддерживают Kitty graphics protocol, оба macOS + Linux. Kitty мощнее в плане автоматизации — kittens и remote control. Если ты пишешь скрипты, которые управляют терминалом — Kitty. Ghostty нативнее на macOS. Kitty использует свой рендерер окна, а Ghostty — AppKit. Разница видна: анимации, взаимодействие с Mission Control, drag & drop, нативные диалоги. По скорости примерно одинаковые. По памяти Kitty чуть экономнее (40-60 МБ vs 50-80 МБ). ## Ghostty vs WezTerm Разные подходы. WezTerm — это «терминал, который может всё». Встроенный мультиплексор, SSH domains, Lua-конфиг, работает на Windows. Если тебе нужно всё это — WezTerm незаменим. Ghostty — «терминал, который быстро работает». В 2-5 раз быстрее WezTerm в бенчмарках, конфиг проще, нативный UI на macOS. Я бы выбрал WezTerm, если: нужен Windows, нужен встроенный мультиплексор, хочешь программировать поведение терминала на Lua. Ghostty — во всех остальных случаях. ## Ghostty vs Alacritty Alacritty — осознанный минимализм. Нет лигатур, нет сплитов, нет вкладок. Если ты живёшь в tmux и от терминала нужна только скорость — Alacritty. Ghostty даёт почти такую же скорость, но с лигатурами, сплитами, quick terminal и shell integration. Больше фич без заметной потери производительности. По памяти Alacritty легче — 30 МБ vs 50-80 МБ. Но в 2026 году 50 МБ не проблема. ## Что выбрать Вот мой чеклист — ответь на три вопроса: **Нужен Windows?** Да → WezTerm (единственный вариант из серьёзных). Нет → читай дальше. **Нужен встроенный мультиплексор или Lua-скрипты?** Да → WezTerm. Нужны kittens и remote control → Kitty. Нет → читай дальше. **Какой подход ближе?** Хочу быстро и нативно, без возни → Ghostty. Хочу минимализм + tmux для всего → Alacritty. Не хочу ничего менять, всё работает → iTerm2. Я остановился на Ghostty. Не потому что он объективно лучший — а потому что мне хватает его фич, а то чего не хватает, закрывает tmux. Для кого-то WezTerm или Kitty будут лучшим выбором, и это нормально. ## FAQ ### Какой терминал самый быстрый на macOS в 2026? По бенчмаркам vtebench — Ghostty и Alacritty. Ghostty использует Metal, Alacritty — OpenGL. Разница между ними минимальна, оба в 3-4 раза быстрее iTerm2. ### Можно ли заменить tmux встроенными сплитами Ghostty? Для локальной работы — да. Сплиты и вкладки Ghostty покрывают базовые сценарии. Но tmux незаменим для SSH (сессия живёт на сервере) и для detach/reattach. Многие используют оба. ### Какой терминал лучше для Neovim? Ghostty или Kitty — оба поддерживают Kitty graphics protocol (картинки в терминале), true color, extended keys. WezTerm тоже подходит. Alacritty — без картинок и без лигатур. ### iTerm2 умирает? Нет. Он активно поддерживается и у него огромная база пользователей. Просто появились конкуренты, которые быстрее. Если iTerm2 устраивает — нет причин переходить. ### Ghostty будет на Windows? В разработке, но конкретных сроков нет. Пока что для Windows — WezTerm или Alacritty. ## Что ещё почитать - [Ghostty — обзор терминала от создателя Terraform](https://matveev.tech/ghostty-terminal-obzor/) — подробный обзор Ghostty - [Настройка Ghostty: полный гайд](https://matveev.tech/ghostty-nastrojka-polnaya/) — конфиг от и до - [Ghostty + Neovim + tmux: окружение разработчика](https://matveev.tech/ghostty-neovim-tmux-setup/) — dev-окружение на базе Ghostty - [iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac](https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/) — настройка iTerm2 ### Claude в Excel — AI-помощник прямо в таблицах URL: https://matveev.tech/claude-in-excel-obzor/ Last updated: 2026-03-01T11:48:43.000Z > TL;DR: Anthropic встроила Claude прямо в Excel. Теперь можно спросить у AI про любую ячейку, протестировать сценарий «а что если» без риска сломать формулы и починить ошибки #REF! за секунды. Бета доступна на всех платных планах. Если ты работаешь с Excel больше, чем хотел бы признать, есть хорошие новости. Anthropic на этой неделе запустила [Cowork & Plugins for the Enterprise](https://www.anthropic.com/webinars/claude-in-excel-and-powerpoint?ref=matveev.tech), набор инструментов, которые встраивают Claude прямо в рабочие приложения. Excel одно из них. Не надо больше копировать формулу в ChatGPT, ждать ответ, потом вставлять обратно. Claude теперь живёт внутри таблицы и понимает контекст всей книги, включая зависимости между вкладками. ## Что умеет Claude в Excel Главная идея простая: нажимаешь `Ctrl+Option+C` на Mac (или `Ctrl+Alt+C` на Windows) и задаёшь вопрос. Claude видит книгу целиком, с формулами и связями между листами. ![Claude в Excel — интерфейс ассистента прямо в таблице](https://matveev.tech/content/images/2026/02/claude-excel.png) Вот что конкретно можно делать. Допустим, открыл чужой финансовый файл и не понимаешь, откуда берётся число в ячейке G145\. Спрашиваешь Claude, он показывает цепочку зависимостей с указанием конкретных ячеек. Не абстрактное «эта формула считает NPV», а «G145 берёт значение из C12, который зависит от допущений на листе Assumptions в B3:B7». Можно тестировать сценарии. Пишешь: «Увеличь рост выручки на 2% и покажи, как изменится терминальная стоимость». Claude пересчитает модель, сохраняя зависимости. Каждое изменение подсвечивается и объясняется. Ещё Claude отлаживает ошибки: #REF!, #VALUE!, циклические ссылки. Находит источник проблемы и предлагает исправление, которое не сломает остальную модель. И последнее: можно попросить собрать финансовую модель с нуля по описанию или заполнить шаблон свежими данными. ## Кому это нужно Если честно, мне кажется, это в первую очередь для финансистов и аналитиков. Тех, кто живёт в Excel и работает со сложными моделями на десятки вкладок. Anthropic вообще чётко обозначила цель: они хотят, чтобы Claude работал не только для разработчиков. В [анонсе](https://dnyuz.com/2026/02/24/anthropic-pushes-claude-into-excel-and-powerpoint-escalating-ai-battle-with-microsoft-and-openai/?ref=matveev.tech) компания прямо написала: «В 2025 Claude Code изменил разработку. В 2026 мы приносим эту трансформацию во всю интеллектуальную работу». Среди клиентов, которые уже используют Claude в рабочих процессах, упоминаются L'Oréal, Deloitte и Thomson Reuters. Плагины разрабатываются совместно с FactSet и S&P, что говорит о фокусе на финансовый сектор. ## Как это сравнить с Copilot Microsoft 365 Copilot делает похожие вещи внутри Excel. Google встроил Gemini в Sheets. OpenAI запустил Frontier для корпоративного рынка. Главное отличие Claude в том, что плагины open-source и портируемые. Компании могут их модифицировать и разворачивать без привязки к одной экосистеме. С Microsoft Copilot так не получится, там всё завязано на Microsoft 365. Ещё Claude умеет передавать контекст между Excel и PowerPoint. Проанализировал данные в таблице, и Claude может сразу превратить их в слайды. Не знаю, насколько это работает гладко на практике, но идея правильная. ## Поддержка форматов и доступ Сейчас поддерживаются `.xlsx` и `.xlsm` файлы. На размер файла есть ограничения, которые зависят от плана. Бета доступна для Claude Pro, Max, Team и Enterprise. Установить можно из [Microsoft Marketplace](https://marketplace.microsoft.com/en-us/product/saas/wa200009404?ref=matveev.tech). По безопасности: Claude работает в рамках существующей инфраструктуры. Изменения показываются в реальном времени с объяснениями. Но проверять результат перед финальным сохранением стоит всегда, Claude может ошибаться. ## Вывод Anthropic последовательно тащит Claude из чата в реальные рабочие инструменты. После кода теперь таблицы. Логично: Excel это приложение, в котором люди реально проводят часы. Сам подход, когда AI работает прямо в инструменте, а не в отдельном окне, мне нравится. Если много сидишь в таблицах, попробуй бету. ## Что ещё почитать - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://blog.matveev.tech/claude-sonnet-4-6-obzor/?ref=matveev.tech) — что нового в последней модели Claude - [Claude Code Security: AI сканирует код на уязвимости](https://blog.matveev.tech/claude-code-security-obzor/?ref=matveev.tech) — другая сторона экосистемы Claude - [Kuku — Obsidian на стероидах с AI-агентом](https://blog.matveev.tech/kuku-markdown-editor-macos/?ref=matveev.tech) — ещё один пример AI внутри рабочего инструмента ### Настройка Ghostty: полный гайд от установки до конфига URL: https://matveev.tech/ghostty-nastrojka-polnaya/ Last updated: 2026-02-28T13:29:25.000Z > **TL;DR:** Настроим Ghostty с нуля — от установки до рабочего конфига с темами, шрифтами, сплитами, quick terminal и SSH. В конце — мой готовый конфиг, который можно скопировать и сразу использовать. Ghostty из коробки работает нормально. Но когда я начал ковырять конфиг, понял, что там куча полезного, о чём не догадаешься без документации. Собрал всё в одном месте — чтобы тебе не пришлось. ## Что понадобится - macOS 13+ или Linux (Wayland/X11) - Homebrew (на macOS) — если ещё не стоит, вот [гайд по установке](https://matveev.tech/homebrew-paketnyj-menedzher-macos/) - 5-10 минут ## Шаг 1\. Установка На macOS через Homebrew: ```bash brew install --cask ghostty ``` На Arch Linux: ```bash pacman -S ghostty ``` На Fedora через COPR: ```bash dnf copr enable scottames/ghostty dnf install ghostty ``` На других дистрибутивах — проверь [официальную страницу загрузки](https://ghostty.org/download?ref=matveev.tech). Для Ubuntu есть `.deb`\-пакеты через сторонний установщик. Если хочешь bleeding edge — есть `ghostty@tip`: ```bash brew install --cask ghostty@tip ``` Это версия, которая следует за HEAD ветки. Обновляется чаще, но может быть менее стабильной. ## Шаг 2\. Создаём конфиг Открой Ghostty и создай файл конфигурации: ```bash mkdir -p ~/.config/ghostty touch ~/.config/ghostty/config ``` На macOS Ghostty также смотрит в `~/Library/Application Support/com.mitchellh.ghostty/config`, но `~/.config/ghostty/config` работает на обеих платформах — советую использовать его. Формат конфига максимально простой — `ключ = значение`, по одному параметру на строку: ``` # Это комментарий font-size = 14 background-opacity = 0.95 ``` Перезагрузить конфиг без перезапуска: `Cmd+Shift+,` на macOS или `Ctrl+Shift+,` на Linux. Если хочешь увидеть все доступные параметры с документацией: ```bash ghostty +show-config --default --docs ``` Выведет полный конфиг с комментариями — полезно для знакомства. ## Шаг 3\. Шрифт Ghostty идёт со встроенным JetBrains Mono — если тебя устраивает, можно ничего не менять. Но если хочешь другой: ``` font-family = "Fira Code" font-size = 13 ``` Для Nerd Fonts (иконки в терминале для oh-my-zsh, starship, powerlevel10k): ``` font-family = "JetBrainsMono Nerd Font" font-size = 13 ``` Можно задать несколько фолбеков — если глиф не найден в первом шрифте, Ghostty возьмёт из второго: ``` font-family = "Fira Code" font-family = "Noto Color Emoji" ``` Лигатуры включены по умолчанию. Если хочешь отключить: ``` font-feature = -calt font-feature = -liga ``` На macOS шрифт может выглядеть слишком тонким на обычных (не Retina) экранах. Исправляется одним параметром: ``` font-thicken = true ``` ## Шаг 4\. Тема и цвета Ghostty поставляется с сотнями встроенных тем. Посмотреть список: ```bash ghostty +list-themes ``` Поставить тему: ``` theme = Catppuccin Mocha ``` А вот штука, ради которой одной стоит попробовать Ghostty — автопереключение темы: ``` theme = dark:Catppuccin Mocha,light:Catppuccin Latte ``` Переключил macOS на светлый режим — терминал посветлел. Обратно на тёмный — потемнел. Без перезапуска. ### Прозрачность ``` background-opacity = 0.95 background-blur = 20 ``` `background-blur` размывает то, что за окном — выглядит красиво, но на macOS требует перезапуска Ghostty после изменения `background-opacity`. ### Своя тема Если хочешь создать свою цветовую схему, создай файл в `~/.config/ghostty/themes/`: ```bash touch ~/.config/ghostty/themes/my-dark ``` Внутри — обычный конфиг, только с цветами: ``` background = #1a1b26 foreground = #c0caf5 cursor-color = #f2d5cf selection-background = #626880 selection-foreground = #c6d0f5 palette = 0=#1a1b26 palette = 1=#f7768e palette = 2=#9ece6a palette = 3=#e0af68 palette = 4=#7aa2f7 palette = 5=#bb9af7 palette = 6=#7dcfff palette = 7=#a9b1d6 palette = 8=#414868 palette = 9=#f7768e palette = 10=#9ece6a palette = 11=#e0af68 palette = 12=#7aa2f7 palette = 13=#bb9af7 palette = 14=#7dcfff palette = 15=#c0caf5 ``` Потом в основном конфиге: `theme = my-dark`. ## Шаг 5\. Окно и titlebar На macOS мне нравится прозрачный titlebar — терминал выглядит чище: ``` macos-titlebar-style = transparent window-padding-x = 8 window-padding-y = 4 window-padding-color = extend ``` `window-padding-color = extend` растягивает цвет фона до краёв окна — без белых полос по бокам. Для полноэкранного режима без рамки (если пользуешься): ``` macos-non-native-fullscreen = false ``` Размер окна при запуске (в ячейках): ``` window-width = 220 window-height = 50 ``` Ghostty запомнит позицию окна между сессиями, если включить: ``` window-save-state = always ``` ## Шаг 6\. Сплиты Сплиты — одна из причин, почему некоторые отказываются от tmux в пользу Ghostty. Настраиваются через keybind: ``` # Создание сплитов keybind = ctrl+super+right=new_split:right keybind = ctrl+super+down=new_split:down keybind = ctrl+super+left=new_split:left keybind = ctrl+super+up=new_split:up # Навигация между сплитами keybind = alt+super+right=goto_split:right keybind = alt+super+down=goto_split:bottom keybind = alt+super+left=goto_split:left keybind = alt+super+up=goto_split:top ``` Неактивные панели можно затемнять — помогает видеть, где сейчас фокус: ``` unfocused-split-opacity = 0.5 ``` Цвет разделителя: ``` split-divider-color = #3a3b40 ``` Каждый сплит — независимая сессия. Новые сплиты наследуют текущую директорию, если shell integration работает. ## Шаг 7\. Quick Terminal Выпадающий терминал в стиле Quake 3 — появляется по хоткею из любого приложения. Я пользуюсь этим постоянно для быстрых команд. ``` keybind = global:ctrl+grave_accent=toggle_quick_terminal quick-terminal-position = right quick-terminal-size = 800px quick-terminal-animation-duration = 0.2 quick-terminal-autohide = true ``` `global:` означает, что хоткей работает из любого приложения, даже когда Ghostty не в фокусе. На macOS для этого нужно разрешение: System Settings → Privacy & Security → Accessibility → добавить Ghostty. `quick-terminal-autohide = true` — терминал прячется, когда переключаешь фокус на другое окно. Удобно: нажал хоткей, ввёл команду, кликнул на другое окно — терминал исчез. На Linux Quick Terminal работает только на Wayland. Если сидишь на X11 — к сожалению, не вариант. ## Шаг 8\. Shell Integration и SSH Shell integration подхватывается автоматически для zsh, bash (из Homebrew), fish и elvish. Проверить, что она работает: ```bash echo $GHOSTTY_RESOURCES_DIR ``` Если путь выводится — всё ок. Что даёт shell integration: - Новые вкладки открываются в текущей директории - Навигация между промптами: `Cmd+Up` / `Cmd+Down` - Тройной клик выделяет вывод команды целиком - Курсор меняет форму (полоска при вводе, блок в нормальном режиме) ### SSH и terminfo При SSH на удалённый сервер часто вылетает ошибка: ``` missing or unsuitable terminal: xterm-ghostty ``` Потому что на сервере нет terminfo для Ghostty. Решается одной строкой в конфиге: ``` shell-integration-features = cursor,sudo,title,ssh-env,ssh-terminfo ``` `ssh-terminfo` автоматически скопирует terminfo при первом подключении к серверу. `ssh-env` — фолбек: если terminfo не удалось установить, переключит TERM на `xterm-256color`. Я рекомендую включать оба. Кэш серверов, куда уже установлен terminfo, можно посмотреть через: ```bash ghostty +ssh-cache ``` ## Шаг 9\. Keybindings Помимо сплитов и quick terminal, есть куча полезных хоткеев. Формат: ``` keybind = модификатор+клавиша=действие ``` Можно делать последовательности клавиш (leader key): ``` keybind = ctrl+a>n=new_window keybind = ctrl+a>t=new_tab ``` Нажимаешь `Ctrl+A`, отпускаешь, нажимаешь `N` — открывается новое окно. Знакомо тем, кто пользуется tmux. Посмотреть все доступные действия: ```bash ghostty +list-actions ``` А все текущие привязки: ```bash ghostty +list-keybinds ``` ## Шаг 10\. Финальные штрихи Несколько параметров, которые я всегда включаю: ``` # Спрашивать перед закрытием окна с активным процессом confirm-close-surface = true # Прятать курсор мыши при наборе текста mouse-hide-while-typing = true # Защита от случайной вставки опасных команд clipboard-paste-protection = true # Обрезать пробелы в конце при копировании clipboard-trim-trailing-spaces = true # Option = Alt (для тех, кто использует Alt-комбинации в vim/tmux) macos-option-as-alt = true # Курсор cursor-style = bar cursor-style-blink = false ``` ## Результат Перезагрузи конфиг (`Cmd+Shift+,`) и проверь, что всё работает. Должна быть тема, прозрачность, сплиты по хоткеям и quick terminal из любого приложения. Мой полный конфиг, который можно скопировать: ``` # ~/.config/ghostty/config # Тема theme = dark:Catppuccin Mocha,light:Catppuccin Latte # Шрифт font-family = "JetBrainsMono Nerd Font" font-size = 13 font-thicken = true # Прозрачность background-opacity = 0.95 background-blur = 20 # Окно macos-titlebar-style = transparent macos-option-as-alt = true window-padding-x = 8 window-padding-y = 4 window-padding-color = extend window-save-state = always # Курсор cursor-style = bar cursor-style-blink = false # Сплиты unfocused-split-opacity = 0.5 keybind = ctrl+super+right=new_split:right keybind = ctrl+super+down=new_split:down keybind = ctrl+super+left=new_split:left keybind = ctrl+super+up=new_split:up keybind = alt+super+right=goto_split:right keybind = alt+super+down=goto_split:bottom keybind = alt+super+left=goto_split:left keybind = alt+super+up=goto_split:top # Quick Terminal keybind = global:ctrl+grave_accent=toggle_quick_terminal quick-terminal-position = right quick-terminal-size = 800px quick-terminal-animation-duration = 0.2 quick-terminal-autohide = true # Shell integration shell-integration = detect shell-integration-fea ``` ## Частые ошибки **Шрифт не применяется.** Проверь точное название шрифта. Ghostty чувствителен к именам. Если поставил Nerd Font через Homebrew — имя будет `"JetBrainsMono Nerd Font"`, а не `"JetBrains Mono Nerd Font"` (без пробела перед Mono). **Quick Terminal не работает на macOS.** Нужно дать разрешение в System Settings → Privacy & Security → Accessibility. Без него глобальные хоткеи не работают. **SSH ломается — `missing terminal: xterm-ghostty`.** Добавь в конфиг `shell-integration-features = ssh-env,ssh-terminfo`. Или как быстрый фикс: `TERM=xterm-256color ssh user@host`. ## FAQ ### Как полностью сбросить конфиг Ghostty? Удали или переименуй файл `~/.config/ghostty/config` и перезапусти. Ghostty вернётся к дефолтным настройкам — встроенный JetBrains Mono, системная тема. ### Где посмотреть все доступные темы Ghostty? `ghostty +list-themes` в терминале. Сейчас там сотни тем — Catppuccin, Dracula, Nord, Gruvbox, Tokyo Night и другие. Обновляются еженедельно. ### Можно ли использовать Ghostty вместо tmux? Для простых задач — да. Сплиты и вкладки покрывают базовые сценарии. Но tmux незаменим для SSH-сессий (сессия живёт на сервере) и более сложных раскладок. Можно использовать оба. ### Как перенести конфиг Ghostty между Mac и Linux? Конфиг в `~/.config/ghostty/config` работает на обеих платформах. macOS-специфичные параметры (macos-\*) на Linux просто игнорируются. Можно держать один конфиг в dotfiles. ### Ghostty тормозит с прозрачностью на macOS? Попробуй убрать `background-blur` — именно blur создаёт нагрузку. `background-opacity` без blur работает быстро. Также убедись, что стоит последняя версия — в 1.2.0 оптимизировали рендеринг. ## Что ещё почитать - [Ghostty — обзор терминала от создателя Terraform](https://matveev.tech/ghostty-terminal-obzor/) — если ещё не читал, начни с обзора - [iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac за 10 минут](https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/) — альтернативный вариант с iTerm2 - [Homebrew — пакетный менеджер для macOS в 2026](https://matveev.tech/homebrew-paketnyj-menedzher-macos/) — нужен для установки Ghostty ### Claude Code: как сэкономить токены на MCP с Tool Search URL: https://matveev.tech/claude-code-tool-search-mcp-tokeny/ Last updated: 2026-02-28T11:55:30.000Z > TL;DR: Если у тебя подключено несколько MCP-серверов к Claude Code, их определения могут съедать 30–60 тысяч токенов контекста ещё до начала работы. Tool Search — встроенная фича, которая подгружает инструменты по запросу вместо того, чтобы держать всё в памяти. Включается автоматически или вручную. ## Почему MCP-серверы съедают контекст? Каждый MCP-сервер отдаёт Claude список своих инструментов — с названиями, описаниями, параметрами и типами. Claude нужно знать про все эти тулзы, чтобы выбрать правильный. Вот только эти описания занимают место в контекстном окне. Типичный набор из 5 серверов: | Сервер | Инструменты | Токены | | ------- | ----------- | ------ | | GitHub | 35 | \~26K | | Slack | 11 | \~21K | | Sentry | 5 | \~3K | | Grafana | 5 | \~3K | | Splunk | 2 | \~2K | Итого: 58 инструментов, примерно 55 тысяч токенов. И это до того, как ты вообще что-то спросил. По данным [Anthropic](https://www.anthropic.com/engineering/advanced-tool-use?ref=matveev.tech), в их внутренних тестах определения инструментов съедали до 134K токенов. А ещё с ростом числа инструментов падает точность выбора. После 30–50 тулзов Claude начинает путать похожие, особенно если названия вроде `notification-send-user` и `notification-send-channel`. ## Как Tool Search решает проблему? Вместо загрузки всех определений сразу Claude Code держит только сам инструмент поиска. Когда нужен конкретный тул, модель ищет его по каталогу и подгружает только релевантные 3–5 штук. Было: \~55K токенов на определения перед стартом. Стало: \~500 токенов на Tool Search + \~3K на найденные тулзы по запросу. Anthropic заявляет снижение расхода токенов на 85%+. В их тестах точность выбора инструментов выросла с 49% до 74% на Opus 4, и с 79.5% до 88.1% на Opus 4.5\. Вот это, пожалуй, даже важнее экономии токенов — Claude реже вызывает не тот инструмент. ![Схема работы Tool Search Tool — сравнение с обычным подходом](https://matveev.tech/content/images/2026/02/tool-search-tool-diagram.png) ## Как включить Tool Search в Claude Code? ### Автоматический режим По умолчанию Claude Code сам определяет, когда MCP-инструменты занимают больше 10% контекстного окна. Если порог превышен — Tool Search включается автоматически, и инструменты подгружаются по запросу вместо предзагрузки. Проверить, сколько токенов съедают твои MCP-серверы, можно командой: ``` /context ``` Увидишь что-то вроде: ``` MCP tools: 28.1k tokens (14.1%) ``` Если процент больше 10% и у тебя свежая версия Claude Code (2.1.14+), Tool Search должен включиться сам. ### Принудительное включение Если автоматический режим не срабатывает или хочешь включить Tool Search при любом количестве тулзов, есть два способа. **Через settings.json** — самый удобный вариант. Добавь в конфиг: ```json { "enable_tool_search": true } ``` Файл можно положить в одно из трёх мест: - `~/.claude/settings.json` — глобально, для всех проектов - `.claude/settings.json` — на уровне проекта (коммитится в git, шарится с командой) - `.claude/settings.local.json` — локальный оверрайд (gitignored, только для тебя) **Через переменную окружения** — если хочешь включить на лету: ```bash ENABLE_TOOL_SEARCH=true claude ``` Или добавь в `.zshrc` / `.bashrc` для постоянного эффекта: ```bash export ENABLE_TOOL_SEARCH=true ``` После этого все MCP-инструменты будут загружаться отложенно. Claude увидит только Tool Search и будет искать нужные тулзы при необходимости. ### Как это выглядит в работе Когда Tool Search активен, в списке доступных инструментов появляется `ToolSearch`. Вместо полных определений всех MCP-тулзов ты видишь список отложенных инструментов: ``` Available deferred tools (must be loaded before use): mcp__github__create_pull_request mcp__slack__send_message mcp__sentry__get_issue ... ``` Claude сам ищет нужный инструмент, когда ему потребуется. Тебе ничего делать не нужно — процесс полностью прозрачный. ## Сколько токенов реально экономит Tool Search? Один из разработчиков [проанализировал](https://community.palantir.com/t/save-37-000-tokens-by-loading-palantir-mcp-tools-on-demand/5893?ref=matveev.tech) 51 инструмент от Palantir MCP-сервера. Без Tool Search все определения занимали \~37 555 токенов. С отложенной загрузкой: | Задача | С Tool Search | Без | Экономия | | -------------------- | ------------- | ------ | -------- | | Поиск документации | \~150 | 37 555 | 99% | | Поиск по онтологии | 2 800 | 37 555 | 93% | | Построение датасетов | \~1 200 | 37 555 | 97% | Самые тяжёлые инструменты — `aggregate_ontology_objects` (6 300 токенов) и `create_foundry_rest_api_data_source_webhook` (3 900 токенов). Они загружаются только когда реально нужны. ## Как получить максимум от Tool Search? **Обнови Claude Code.** Tool Search нормально работает начиная с версии 2.1.14\. В ранних версиях были баги с автоматическим включением. Проверь версию через `claude --version`. **Проверяй `/context` регулярно.** Если MCP-тулзы занимают больше 10% — Tool Search должен быть активен. Если нет, используй `ENABLE_TOOL_SEARCH=true`. **Хорошие описания инструментов помогают.** Tool Search ищет по названиям и описаниям. Если у твоего MCP-сервера тулзы названы `do_thing_1` и `do_thing_2` — Claude будет путаться. Чем понятнее имена и описания, тем точнее поиск. **Не перегружай серверами.** Tool Search снимает проблему раздувания контекста, но не отменяет здравый смысл. Если у тебя 15 MCP-серверов, возможно, часть из них не нужна в каждой сессии. Подключай только те, что реально используешь. ## FAQ **Нужно ли что-то менять в `.mcp.json`?** Нет, конфигурацию MCP-серверов трогать не нужно. Tool Search работает на уровне Claude Code и автоматически применяется ко всем подключённым серверам. Твой `.mcp.json` с описаниями серверов остаётся как есть, ничего переписывать не придётся. **Какие модели поддерживают Tool Search?** По данным [документации Anthropic](https://platform.claude.com/docs/en/agents-and-tools/tool-use/tool-search-tool?ref=matveev.tech), Tool Search работает с Sonnet 4.0 и выше, Opus 4.0 и выше. Haiku пока не поддерживается. Максимальный каталог — до 10 000 инструментов, что хватит для любого разумного количества MCP-серверов. **Tool Search замедляет работу?** Перед вызовом инструмента добавляется шаг поиска, но на практике задержка незаметна. Зато экономия контекста позволяет Claude вести более длинные сессии без деградации качества. В итоге общее время работы скорее сокращается, потому что модель реже ошибается с выбором тула. **Это платная фича?** Отдельной платы нет, Tool Search входит в стандартную подписку Claude Code. Более того, ты экономишь — меньше токенов расходуется на определения инструментов в каждом запросе, а значит общий расход на API снижается, особенно в длинных сессиях. **Я могу отключить Tool Search?** Да, поставь `"enable_tool_search": false` в `settings.json` или убери переменную окружения `ENABLE_TOOL_SEARCH`. Без принудительного включения Tool Search активируется только автоматически — когда MCP-инструменты превышают порог в 10% контекстного окна. ## Что ещё почитать - [MCP серверы для Claude — что это и как настроить](https://blog.matveev.tech/claude-mcp-nastrojka/?ref=matveev.tech) — базовая настройка MCP для Claude Code - [Плагины Claude Code — как расширить возможности](https://blog.matveev.tech/claude-code-plugins-marketplaces/?ref=matveev.tech) — другие способы добавить тулзы в Claude Code - [Память Claude Code — auto memory, rules и CLAUDE.md](https://blog.matveev.tech/claude-code-memory-auto-rules/?ref=matveev.tech) — ещё один способ оптимизировать работу с контекстом ### Mercury 2 — LLM на диффузии с 1000 токенов/сек URL: https://matveev.tech/mercury-2-diffusion-llm/ Last updated: 2026-02-27T16:34:17.000Z > TL;DR: Mercury 2 от Inception Labs — первая коммерческая LLM на основе диффузии, а не привычной авторегрессии. Генерирует 1009 токенов в секунду на NVIDIA Blackwell — это в 5 раз быстрее Claude Haiku и GPT-5 Mini. Стоит $0.25 за миллион входных токенов. Все современные LLM работают одинаково: генерируют текст по одному токену, слева направо, как печатная машинка. Mercury 2 делает по-другому — модель уточняет сразу несколько токенов параллельно, больше похоже на редактора, который правит весь черновик целиком. Причём это не просто красивое сравнение — архитектура генерации у модели действительно другая. ## Что такое диффузионная LLM? Обычные модели — авторегрессионные. Каждый следующий токен зависит от предыдущего, поэтому генерация идёт строго последовательно. Хочешь быстрее — нужен либо более мощный GPU, либо более компактная модель. Ускорить сам процесс генерации при этом подходе физически сложно. Mercury 2 использует диффузию — тот же принцип, что в генерации картинок (Stable Diffusion, DALL-E). Только вместо пикселей модель работает с токенами. Она берёт «шумный» черновик ответа и за несколько шагов уточняет его до финального текста, обрабатывая все позиции одновременно. По [данным Inception Labs](https://www.inceptionlabs.ai/blog/introducing-mercury-2?ref=matveev.tech), на GPU NVIDIA Blackwell Mercury 2 выдаёт 1009 токенов/сек. Для сравнения: Claude 4.5 Haiku Reasoning — около 89 токенов/сек, GPT-5 Mini — примерно 71 токен/сек. ## Характеристики Mercury 2 | Параметр | Значение | | ------------ | ----------------------------------- | | Скорость | 1009 токенов/сек (NVIDIA Blackwell) | | Цена (вход) | $0.25 / 1M токенов | | Цена (выход) | $0.75 / 1M токенов | | Контекст | 128K токенов | | Reasoning | Настраиваемая глубина | | Tool use | Нативная поддержка | | JSON | Schema-aligned вывод | | API | OpenAI-совместимый | ![Бенчмарки Mercury 2 — скорость генерации](https://matveev.tech/content/images/2026/02/mercury-2-benchmark-1.png) Цена тоже приятная. $0.25 за миллион входных токенов — это дешевле большинства speed-optimized моделей. Для задач, где нужно гонять тысячи запросов (агентские пайплайны, RAG, извлечение данных), экономия набегает существенная. ## Качество — на уровне быстрых моделей Скорость — это круто, но бесполезно, если модель отвечает ерунду. По бенчмаркам Mercury 2 конкурирует с Claude Haiku и GPT-5 Mini: ![Бенчмарки Mercury 2 — качество на задачах reasoning](https://matveev.tech/content/images/2026/02/mercury-2-benchmark-2.png) До уровня Claude Opus или GPT-5 модель не дотягивает, и это ожидаемо. Mercury 2 заточена под другое: скорость при достаточном качестве. Для глубокого рассуждения над сложной задачей — бери модели побольше. ## Где это реально нужно? ### Код и автодополнение Для IDE-подсказок и автокомплита латентность критична. Макс Брунсфелд, сооснователь Zed, [говорит](https://www.inceptionlabs.ai/blog/introducing-mercury-2?ref=matveev.tech): «Подсказки приходят достаточно быстро, чтобы казаться частью собственного мышления, а не чем-то, чего ждёшь». Разработчики Zed уже тестируют Mercury 2 в своём редакторе. ### Агентские пайплайны Когда AI-агент делает 20-50 вызовов модели за одну задачу, каждая секунда задержки множится. Сухинтан Сингх, CTO Skyvern, [утверждает](https://www.inceptionlabs.ai/blog/introducing-mercury-2?ref=matveev.tech): «Mercury 2 минимум вдвое быстрее GPT-5.2, и для нас это меняет правила игры». ### Голосовые интерфейсы Если ты когда-нибудь разговаривал с голосовым ассистентом, который думает по две секунды над каждой репликой — знаешь, насколько это раздражает. Бюджет по латентности тут самый жёсткий: 300-500 мс, иначе диалог разваливается. Mercury 2 вписывается в эти рамки с reasoning-качеством, и это, пожалуй, самый впечатляющий кейс. ### RAG и поисковые пайплайны Когда поисковый пайплайн включает мультишаговый поиск, ранжирование и суммаризацию, задержки складываются на каждом шаге. Я сам сталкивался с тем, что добавление reasoning-модели в RAG-цепочку увеличивало время ответа втрое. С Mercury 2 такой шаг можно добавить, почти не теряя в скорости. ## Интеграция — через OpenAI API Mercury 2 совместима с OpenAI API, то есть можно подставить её в существующий стек без переписывания кода. Просто меняешь endpoint и model name — всё остальное работает как раньше. Если нагрузка серьёзная, у Inception Labs есть программа для корпоративных клиентов — помогут протестировать под конкретные сценарии. ## Чем это отличается от просто «быстрой модели»? Тут важно понимать разницу. Обычно «быстрая модель» — это компактная авторегрессионная модель с меньшим количеством параметров. Она быстрее за счёт размера, но теряет в качестве пропорционально. Mercury 2 быстрее за счёт другой архитектуры генерации. Диффузия позволяет масштабировать скорость без пропорциональной потери качества — потому что ты параллелишь не вычисления, а сам процесс декодирования. По сути, совсем другой принцип. Думаю, если диффузионные LLM покажут себя стабильно — это может стать таким же сдвигом, как переход от RNN к трансформерам. Но пока Mercury 2 — первый коммерческий продукт такого типа, и мне не хватает данных, чтобы уверенно говорить о надёжности в долгосрочном продакшене. ## Вывод Mercury 2 — интересная штука. Первая серьёзная попытка уйти от авторегрессии в текстовой генерации, и результат впечатляет: 1000 токенов в секунду при адекватной цене и совместимости с OpenAI API. Понятно, что уровня Opus или полноценного GPT-5 в сложных reasoning-задачах ждать не стоит. Но для агентских пайплайнов, кодинга и голосовых интерфейсов — мне сложно назвать что-то быстрее прямо сейчас. ## Что ещё почитать - [Taalas HC1: AI-модель стала чипом — 17 000 токенов/сек](https://blog.matveev.tech/taalas-hardcore-model-silicon/?ref=matveev.tech) — ещё один подход к ускорению: модель, вшитая прямо в кремний - [Nano Banana 2: качество Pro на скорости Flash](https://blog.matveev.tech/nano-banana-2-obzor/?ref=matveev.tech) — Google тоже гонит скорость, но остаётся в авторегрессии - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://blog.matveev.tech/claude-sonnet-4-6-obzor/?ref=matveev.tech) — для сравнения с reasoning-моделями побольше ## FAQ **Чем Mercury 2 отличается от обычных LLM?** Mercury 2 использует диффузионную архитектуру вместо авторегрессии. Модель генерирует несколько токенов параллельно, а не по одному последовательно. Это даёт пятикратное преимущество в скорости при сопоставимом качестве с Claude Haiku и GPT-5 Mini. **Можно ли использовать Mercury 2 вместо GPT или Claude?** Зависит от задачи. Для сложного reasoning и длинных цепочек рассуждений лучше подойдут Opus или GPT-5\. А вот для агентских пайплайнов, автокомплита кода, голосовых ассистентов и RAG-систем — Mercury 2 будет быстрее и дешевле. **Как подключить Mercury 2 к своему проекту?** Mercury 2 совместима с OpenAI API. Меняешь endpoint и название модели в конфиге — и всё. Дополнительные SDK или библиотеки не нужны. Цена — $0.25 за миллион входных и $0.75 за миллион выходных токенов. ### Nano Banana 2: качество Pro на скорости Flash URL: https://matveev.tech/nano-banana-2-obzor/ Last updated: 2026-02-27T13:55:06.000Z > **TL;DR:** Google DeepMind выпустил Nano Banana 2, новую модель генерации картинок. Работает на скорости Gemini Flash, но выдаёт качество уровня Pro. Доступна в Gemini, Google Search, AI Studio и Google Ads. Разбираюсь, что изменилось и зачем это нужно. Nano Banana стала вирусной в августе 2025\. Тогда Google показал, что их модель умеет не просто рисовать картинки, а генерировать и редактировать их прямо в разговоре с Gemini. В ноябре вышла Pro-версия с улучшенным качеством и студийным контролем. А теперь Nano Banana 2, которая объединяет оба подхода. Официальное название: Gemini 3.1 Flash Image. Это не отдельная система, а часть семейства Gemini 3.1, которое Google [активно развивает](https://blog.matveev.tech/gemini-3-1-pro-obzor/?ref=matveev.tech). ## Что умеет Nano Banana 2 Главная идея: взять продвинутые фичи из Pro и запустить их на движке Flash. Получается быстро и при этом качественно. ![Инфографика, сгенерированная Nano Banana 2 — DIY-диаграмма водного цикла](https://matveev.tech/content/images/2026/02/infographic.jpg) ### Знания о реальном мире Модель использует базу знаний Gemini и подтягивает актуальную информацию из веб-поиска. На практике: просишь нарисовать конкретное здание или известного учёного, и результат будет похож на реальность, а не на абстрактную галлюцинацию. Ещё она умеет создавать инфографику и диаграммы прямо из текстового промпта. ### Текст на картинках Вечная боль генеративных моделей: текст, который выглядит как набор случайных символов. Nano Banana 2 рендерит читаемый текст и даже умеет переводить надписи на картинке на другие языки. Google говорит, что модель поддерживает локализацию изображений. Насколько хорошо это работает с кириллицей, я пока не проверял. ### Персонажи не меняются между кадрами Раньше если ты просил модель нарисовать одного и того же персонажа в разных сценах, получались разные существа. Nano Banana 2 сохраняет внешний вид до 5 персонажей и до 14 объектов в одном сеансе. Для комиксов и сторибордов это вообще меняет всё. ![Сохранение внешнего вида персонажей в Nano Banana 2 — 14 объектов на ферме](https://matveev.tech/content/images/2026/02/subject-consistency.jpg) ### Точное следование промпту Google заявляет, что модель стала лучше понимать сложные запросы с несколькими условиями. Меньше «додумывания», больше того, что ты реально просил. ### Разрешение до 4K Поддерживаются разные соотношения сторон и разрешения от 512px до 4K. Можно сделать и вертикальный пост для соцсетей, и широкоформатный баннер для сайта. ![Фотореалистичный аэроснимок долины, сгенерированный Nano Banana 2](https://matveev.tech/content/images/2026/02/aerial.jpg) ## Где попробовать Nano Banana 2 уже доступна в нескольких продуктах Google: - Gemini App — заменяет Nano Banana Pro в режимах Fast, Thinking и Pro. Подписчики AI Pro и Ultra по-прежнему могут переключиться на Pro через меню - Google Search — работает в AI Mode и Lens, добавили 141 новую страну и 8 языков - AI Studio + API — доступна в превью, плюс через Vertex AI в Google Cloud - [Flow](https://labs.google/fx/ru/tools/flow?ref=matveev.tech) — стала моделью по умолчанию, бесплатно (0 кредитов) - Google Ads — генерирует визуалы при создании рекламных кампаний ![Интерфейс шаблонов для генерации изображений в приложении Gemini](https://matveev.tech/content/images/2026/02/templates.jpg) Мне кажется, самый интересный момент тут — Flow. Бесплатная генерация в 4K для всех пользователей. Раньше за такое качество нужно было платить. ## Маркировка AI-контента Google продолжает развивать SynthID, свою технологию маркировки сгенерированного контента. Теперь к ней добавили поддержку C2PA Content Credentials. Это открытый стандарт, который показывает, как именно контент был создан. С ноября 2025 функцию проверки SynthID в приложении Gemini использовали более 20 миллионов раз. Скоро добавят и C2PA-верификацию прямо в Gemini. ## Nano Banana 2 vs Nano Banana Pro Google оставил обе модели, но с разными ролями: | | Nano Banana 2 | Nano Banana Pro | | -------------------- | ------------------------------------ | ------------------------------------------ | | Скорость | Flash (быстрая) | Медленнее | | Качество | Высокое | Максимальное | | Фактическая точность | Хорошая | Лучшая | | Доступность | Все пользователи | AI Pro / Ultra | | Лучше для | Быстрая итерация, массовая генерация | Студийная работа, максимальная детализация | Думаю, для 90% задач Nano Banana 2 будет достаточно. Pro имеет смысл, когда нужна максимальная фактическая точность или студийное качество для печати. ## Вывод Google продолжает бежать за Midjourney и DALL-E, но у них есть козырь: интеграция во всю экосистему. Nano Banana 2 не живёт в отдельном приложении. Она встроена в Search, Ads, Flow и Gemini. Если ты уже в экосистеме Google, это самый простой способ получить генерацию картинок без лишних подписок. Лично мне интересно протестировать модель на кириллице и нестандартных промптах. Пока Google показывает только идеальные примеры на английском, а как оно работает в реальности — вопрос открытый. ![Кенгуру-путешественник — пример сохранения персонажа в Nano Banana 2](https://matveev.tech/content/images/2026/02/kangaroo.jpg) ## Что ещё почитать - [Gemini 3.1 Pro — что нового в модели Google](https://blog.matveev.tech/gemini-3-1-pro-obzor/?ref=matveev.tech) — обзор Pro-модели из того же семейства - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://blog.matveev.tech/claude-sonnet-4-6-obzor/?ref=matveev.tech) — для сравнения подходов к мультимодальности ### Ghostty — обзор терминала от создателя Terraform URL: https://matveev.tech/ghostty-terminal-obzor/ Last updated: 2026-02-27T07:41:20.000Z > **TL;DR:** Ghostty — быстрый терминал с GPU-рендерингом от Mitchell Hashimoto (создателя Terraform и Vagrant). Нативный UI, встроенные сплиты, выпадающий терминал в стиле Quake. Бесплатный, open-source, MIT-лицензия. Работает на macOS и Linux. Я перешёл на Ghostty несколько месяцев назад и с тех пор ни разу не открыл iTerm2\. Это первый терминал за долгое время, где я ничего не хочу допилить. Расскажу, что внутри и стоит ли переходить. ## Что это и зачем Ghostty — эмулятор терминала, который написал Mitchell Hashimoto. Если имя не знакомо — он основал HashiCorp и создал Terraform, Vagrant, Vault. После ухода из компании взялся за личный проект: терминал, который одновременно быстрый, функциональный и выглядит как родное приложение. Версия 1.0 вышла в декабре 2024-го после двух лет закрытой беты. Написан на Zig, UI на macOS — Swift/AppKit, на Linux — GTK4\. В 2025-м Hashimoto передал проект под управление Hack Club — это некоммерческая организация, альтернатива венчурным деньгам. Что отличает Ghostty от остальных терминалов? Две вещи. Во-первых, GPU-рендеринг через Metal — на macOS он в 4 раза быстрее iTerm2 (по бенчмаркам vtebench). Во-вторых, нативный UI. Это не Electron и не кроссплатформенный тулкит — на macOS он выглядит как родное приложение Apple, на Linux — как обычное GTK4-приложение. Ну и конфиг. Формат `ключ = значение`. Никакого TOML, YAML или Lua. Открыл файл, написал параметр, сохранил. ## Быстрый старт Установка на macOS занимает 30 секунд: ```bash brew install --cask ghostty ``` На Linux зависит от дистрибутива. На Arch: ```bash pacman -S ghostty ``` На Ubuntu и Fedora — через сторонние репозитории или сборку из исходников. После установки открываешь Ghostty — и всё. Шелл подхватывается автоматически, shell integration встраивается сама. Если хочешь что-то поменять — создаёшь файл конфига: ```bash # macOS ~/.config/ghostty/config # или можно открыть через Cmd+, ``` Минимальный конфиг, чтобы было красиво: ``` font-family = JetBrains Mono font-size = 14 theme = Catppuccin Mocha background-opacity = 0.95 ``` Четыре строчки — и у тебя терминал с лигатурами, красивой темой и лёгкой прозрачностью. ## Что умеет ### Встроенные сплиты и вкладки Ghostty умеет делить окно на панели без tmux. Горизонтально, вертикально, вложенные — всё через хоткеи. Неактивные панели можно сделать полупрозрачными, чтобы фокус был на рабочей: ``` # Создание сплитов keybind = ctrl+super+right=new_split:right keybind = ctrl+super+down=new_split:down keybind = ctrl+super+left=new_split:left keybind = ctrl+super+up=new_split:up # Навигация между сплитами keybind = alt+super+right=goto_split:right keybind = alt+super+down=goto_split:bottom keybind = alt+super+left=goto_split:left keybind = alt+super+up=goto_split:top # Прозрачность окон не в фокусе unfocused-split-opacity = 0.5 ``` Для простых задач этого хватает вместо tmux. Для SSH-сессий и серверной работы tmux всё ещё полезен — Ghostty с ним дружит. ### Quick Terminal Выпадающий терминал в стиле Quake — появляется по глобальному хоткею из любого приложения. Съезжает сверху с анимацией, сохраняет состояние между вызовами: ``` keybind = global:ctrl+grave_accent=toggle_quick_terminal ``` На macOS нужно дать разрешение Accessibility в системных настройках. После этого — нажал хоткей, терминал выпал, сделал дело, нажал снова — спрятался. Я пользуюсь этим по 50 раз в день. ### Shell Integration Автоматически работает для zsh, bash (из Homebrew), fish и elvish. Что даёт: - Новые вкладки открываются в текущей директории - Тройной клик выделяет весь вывод команды - Навигация между промптами (прыгать к предыдущей/следующей команде) - Курсор меняет форму: блок в нормальном режиме, полоска при вводе ### Темы Встроенных тем сотни — берутся из проекта iterm2-color-schemes и обновляются еженедельно. Посмотреть все: ```bash ghostty +list-themes ``` Можно автоматически переключать тему вместе с системной: ``` theme = dark:Catppuccin Mocha,light:Catppuccin Latte ``` Переключил macOS на светлый режим — терминал тоже посветлел. Мелочь, но приятная. ### Command Palette ![](https://matveev.tech/content/images/2026/02/2026-02-25-21.30.24.jpg) Появился в версии 1.2.0\. Открывает список всех доступных действий — как в VS Code. Не помнишь хоткей? Открыл палитру ``` CMD+Shift+P ``` Нашёл действие, выполнил. Можно даже выполнять действия, на которые хоткей не назначен. ## Тарифы Бесплатный. MIT-лицензия, открытый исходный код на GitHub. На GitHub больше 27 000 звёзд, в релизе 1.2.0 участвовали 149 контрибьюторов. ## Вердикт Если ты на macOS и до сих пор сидишь на iTerm2 — попробуй. Серьёзно. Переход занимает пять минут, а разница в скорости заметна сразу. Если ты на Linux с Wayland — тоже стоит попробовать. GTK4-версия работает хорошо. Мне Ghostty подошёл. Быстрый, простой, не пытается быть всем сразу. Иногда этого достаточно. [GhosttyGhostty is a fast, feature-rich, and cross-platform terminal emulator that uses platform-native UI and GPU acceleration.![](https://matveev.tech/content/images/icon/favicon-32.png)Ghostty![](https://matveev.tech/content/images/thumbnail/social-share-card.jpg)](https://ghostty.org/?ref=matveev.tech) ## Что ещё почитать - [iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac за 10 минут](https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/) — если пока не готов переходить - [Homebrew — пакетный менеджер для macOS в 2026](https://matveev.tech/homebrew-paketnyj-menedzher-macos/) — нужен для установки Ghostty - [Cork — GUI для Homebrew, который заменит терминал](https://matveev.tech/cork-homebrew-gui-macos/) — ещё один инструмент для macOS ### Cursor Cloud Agents: агенты с виртуальными машинами URL: https://matveev.tech/cursor-cloud-agents-computer-use/ Last updated: 2026-02-26T15:14:20.000Z > **TL;DR:** Cursor выкатил облачных агентов с собственными виртуальными машинами. Агент генерирует код, сам запускает приложение, кликает по кнопкам, записывает видео и создаёт готовый PR. 30% пул-реквестов внутри Cursor уже делают агенты. До сих пор AI-агенты в IDE работали примерно так: ты даёшь задачу, агент пишет код, ты проверяешь. Но агент не видел, что получилось. Он не мог запустить приложение и потыкать кнопки. Cursor решил это изменить — и дал агентам собственные компьютеры. ## Что произошло 24 февраля 2026 года Cursor [представил](https://cursor.com/blog/agent-computer-use?ref=matveev.tech) обновление cloud agents. Каждый агент получает изолированную виртуальную машину с полноценной средой разработки. Агент может: - Собирать и запускать проект - Открывать браузер и взаимодействовать с UI - Записывать видео своей работы как артефакт - Создавать PR, готовый к мержу Запускать агентов можно откуда угодно: десктопный Cursor, веб, телефон, Slack, GitHub. Можно даже подключиться к удалённому рабочему столу агента и порулить вручную, не выкачивая ветку к себе. ## 30% PR в Cursor создают агенты Это не просто демо-фича. Команда Cursor использует облачных агентов внутри компании уже месяц, и больше 30% пул-реквестов, которые мержатся, созданы агентами. ![30% PR в Cursor создаются облачными агентами](https://matveev.tech/content/images/2026/02/cursor-cloud-agents-chart.png) Главное изменение в подходе: вместо того чтобы нарезать задачу на мелкие кусочки и микроменеджить агента, разработчики делегируют более амбициозные задачи целиком. Агент разбирается сам. ## Как это используют внутри Cursor Вот конкретные примеры, которые привела команда. ### Новые фичи Для недавно запущенного Cursor Marketplace агенту дали задачу: добавить ссылки на исходный код для каждого компонента плагина. Агент реализовал фичу, потом сам открыл страницу плагина Prisma и прокликал все ссылки, чтобы убедиться, что они ведут на правильные файлы в GitHub. Для локального тестирования он временно отключил feature flag, а перед пушем вернул обратно. Потом ребейзнулся на main, разрулил конфликты и сквошнул коммиты. Я не знаю, насколько это типичный результат или отобранный идеальный кейс. Но если агент действительно сам резолвит конфликты при ребейзе — это серьёзный уровень. ### Воспроизведение уязвимостей Агента запустили из Slack с просьбой: «Пожалуйста, разбери и подробно объясни эту уязвимость» — с описанием проблемы с эксфильтрацией буфера обмена. ![Облачный агент Cursor воспроизводит уязвимость с кражей буфера обмена](https://matveev.tech/content/images/2026/02/cursor-cloud-agent-vulnerability.png) Агент собрал HTML-страницу, эксплуатирующую уязвимость через открытый API. Поднял бэкенд-сервер, загрузил демо-страницу в браузере Cursor, скопировал тестовый UUID в буфер обмена, и продемонстрировал кражу данных. По итогу сделал скриншот с доказательством и закоммитил демо-файл. Для security-команд это прям находка. Вместо того чтобы вручную воспроизводить баг, кидаешь описание агенту, он сам всё разворачивает и снимает доказательства. ### Быстрые фиксы и тестирование UI Мелкие задачи тоже в деле. Например, агенту дали заменить статичный лейбл «Read lints» на динамический — «No linter errors» или «Found N errors». Он реализовал, запустил Cursor, проверил оба случая (файл с ошибками и чистый файл) и записал видео. Отдельный агент потратил 45 минут на полное тестирование cursor.com/docs — проверил сайдбар, навигацию, поиск, копирование, тему и диалог обратной связи. По сути, ручное QA, но без человека. ## Чем это отличается от обычных агентов Локальные агенты в Cursor (и в других IDE) работают на твоём компьютере. Если запустить нескольких параллельно — они начинают конкурировать за ресурсы и конфликтовать друг с другом. Облачные агенты снимают это ограничение: каждый живёт в своей изолированной VM. Но главное тут в замкнутом цикле. Агент написал код, собрал, запустил, протестировал, починил, записал результат. И только потом отдал тебе PR с видео, где видно, что всё работает. Никакого «посмотри мой первый черновик». ## Что дальше Cursor описывает будущее как «self-driving codebases» — кодовые базы на автопилоте. Агенты будут мержить PR, управлять раскатками и мониторить продакшен. Ближайший фокус — координация работы нескольких агентов и модели, которые учатся на прошлых запусках. Мне кажется, это пока больше маркетинговое видение, чем реальность. Но направление понятно: разработчик всё меньше пишет код руками и всё больше ставит задачи и решает, что едет в продакшен. ## Стоит ли пробовать Если ты уже пользуешься Cursor — попробуй запустить облачного агента на какой-нибудь некритичной задаче. Cursor предлагает [начать с onboarding](https://cursor.com/onboard?ref=matveev.tech), где агент сам настроится и запишет демо. Если ты на Claude Code или Codex, тоже стоит посматривать. Облачные VM для агентов — логичный следующий шаг, и конкуренты наверняка пойдут тем же путём. ## Что ещё почитать - [Cursor 2.5: плагины, песочница и асинхронные субагенты](https://blog.matveev.tech/cursor-2-5-obzor/?ref=matveev.tech) — предыдущий крупный релиз Cursor с песочницей для агентов - [Мультиагенты в OpenAI Codex — настройка и примеры](https://blog.matveev.tech/codex-multi-agent-setup/?ref=matveev.tech) — как работают мультиагенты у конкурентов - [Kimi Code — open-source CLI-агент для кодинга](https://blog.matveev.tech/kimi-code-cli-obzor/?ref=matveev.tech) — альтернативный подход к AI-агентам в разработке ### Как DeepSeek, Moonshot и MiniMax воровали Claude URL: https://matveev.tech/anthropic-distillyatsiya-deepseek/ Last updated: 2026-02-26T08:31:19.000Z > **TL;DR:** Anthropic поймала три китайские лаборатории — DeepSeek, Moonshot и MiniMax — на систематической краже возможностей Claude. Через 24 000 фейковых аккаунтов они провели больше 16 миллионов запросов, выкачивая reasoning, agentic-мышление и кодинг. Всё это — чтобы обучить свои модели на чужих ответах. Anthropic опубликовала отчёт, в котором прямо называет три AI-лаборатории, занимавшиеся «дистилляцией» Claude в промышленных масштабах. Если коротко — DeepSeek, Moonshot (создатели Kimi) и MiniMax месяцами гоняли через API Claude миллионы запросов, собирая ответы для обучения собственных моделей. И делали это через прокси-сервисы и поддельные аккаунты, потому что у Anthropic нет коммерческого доступа для Китая. ## Что такое дистилляция и почему это проблема Дистилляция — это метод обучения, при котором слабая модель учится на ответах сильной. Сама по себе техника легальная: все крупные лаборатории используют её, чтобы делать компактные версии своих моделей. Проблема начинается, когда конкурент выкачивает твою модель, чтобы ускорить свою разработку. Это как если бы кто-то скопировал конспект отличника, переписал своим почерком и сдал как свою работу. Только в масштабах индустрии стоимостью в сотни миллиардов долларов. Anthropic считает, что главная угроза даже не в коммерческих потерях. Дистиллированные модели теряют защитные фильтры, которые не дают использовать AI для создания биооружия или кибератак. А когда такую модель выкладывают в open source, всё это расходится бесконтрольно. ## DeepSeek: 150 000 запросов и генерация цензуры DeepSeek провёл, пожалуй, самую хитрую кампанию. 150 000 запросов — это немного на фоне остальных, но содержание впечатляет. Во-первых, они просили Claude проговорить цепочку рассуждений по уже готовому ответу — фактически генерировали chain-of-thought данные для обучения. Во-вторых, использовали Claude как «учителя-оценщика» — модель выставляла оценки по рубрикам, что нужно для reinforcement learning. Но самое интересное — DeepSeek заставлял Claude генерировать «безопасные для цензуры» ответы на политически чувствительные вопросы. Вопросы о диссидентах, партийных лидерах, авторитаризме. По сути, они тренировали свою модель уходить от неудобных тем, используя для этого американскую модель. Anthropic утверждает, что по метаданным запросов удалось вычислить конкретных исследователей из DeepSeek. ## Moonshot: 3,4 миллиона запросов через сотни аккаунтов Moonshot AI (те самые, что делают [Kimi](https://matveev.tech/kimi-code-cli-obzor/)) действовали масштабнее. 3,4 миллиона запросов через сотни фейковых аккаунтов на разных платформах — API, облачные сервисы. Целились в agentic reasoning, tool use, computer use и компьютерное зрение. Короче, во всё, чем Claude выделяется среди конкурентов в сфере AI-агентов. Вычислили их через метаданные запросов, которые совпали с публичными профилями руководителей Moonshot. Позже Moonshot переключился на попытки вытащить reasoning traces Claude, то есть внутренние рассуждения модели. ## MiniMax: 13 миллионов запросов и пойманы «на горячем» [MiniMax](https://matveev.tech/minimax-claude-code-setup/) — рекордсмен по объёму: 13 миллионов запросов, направленных на agentic coding и tool use. Самое любопытное — Anthropic обнаружила эту кампанию до того, как MiniMax выпустил обученную модель. Они буквально видели весь цикл: от генерации данных до запуска продукта. И вот ещё деталь: когда Anthropic выпустила новую модель прямо во время активной кампании MiniMax, те за 24 часа перекинули почти половину трафика на свежую версию. Ну, в оперативности им не откажешь. ## Как прокси-сервисы помогают обходить ограничения Anthropic не продаёт доступ к Claude в Китае. Поэтому лаборатории работают через прокси-сервисы, которые перепродают доступ к API. Anthropic называет это «архитектурой гидры». Сети из тысяч фейковых аккаунтов, трафик размазан по API и облачным платформам. Забанили один аккаунт, на его место тут же встаёт новый. В одном случае единственная прокси-сеть держала 20 000 аккаунтов одновременно, подмешивая дистилляцию к обычным запросам для маскировки. Отдельный запрос может выглядеть абсолютно нормально. Вот пример, который приводит Anthropic: > *«Ты — эксперт-аналитик данных, сочетающий статистическую строгость с глубоким знанием предметной области. Твоя задача — формулировать выводы на основе данных, а не пересказы или визуализации».* Сам по себе промпт безобидный. Но когда его вариации приходят десятки тысяч раз с сотен координированных аккаунтов — паттерн очевиден. ## Как Anthropic реагирует Anthropic описывает четыре направления защиты. Во-первых, детекция: классификаторы и поведенческий анализ, которые ищут паттерны дистилляции в API-трафике, включая попытки извлечь chain-of-thought. Во-вторых, обмен разведданными с другими лабораториями, облачными провайдерами и, как деликатно пишут, «компетентными органами». Дальше — контроль доступа: усилили верификацию образовательных аккаунтов и стартап-программ, через которые чаще всего заводили фейки. И наконец, контрмеры на уровне самой модели: чтобы ответы были менее полезны для дистилляции, но без ущерба обычным пользователям. Как именно это работает, не раскрывают. Anthropic также подчёркивает связь с экспортным контролем. Мол, быстрый прогресс китайских лабораторий иногда воспринимают как доказательство, что ограничения на чипы не работают. А на деле значительная часть этого прогресса построена на украденных возможностях американских моделей. ## Мой взгляд 16 миллионов запросов. Полноценная операция с координацией, прокси-сетями и переключением между моделями. И то, что Anthropic смогла дойти до конкретных людей и лабораторий, говорит о серьёзном уровне мониторинга. Но есть нюанс. Дистилляция как таковая — это не хакерство и не взлом. Это использование публичного API способом, который нарушает условия сервиса. Грань между «интенсивным использованием» и «дистилляцией» иногда размытая. Мне кажется, что история с цензурными промптами [DeepSeek](https://matveev.tech/deepseek-claude-code-setup/) — самая тревожная часть отчёта, потому что показывает не просто копирование возможностей, а создание инструментов цензуры с помощью западных моделей. Публикация [этого отчёта](https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks?ref=matveev.tech) — в том числе политический жест. Anthropic давно лоббирует экспортный контроль на чипы, и доказательства промышленной дистилляции хорошо ложатся в этот нарратив. Не значит, что данные ненастоящие — но контекст стоит учитывать. ## Что ещё почитать - [Claude Code Security: AI сканирует код на уязвимости](https://matveev.tech/claude-code-security-obzor/) — как Anthropic подходит к безопасности со стороны разработки - [Kimi Code — CLI-агент от Moonshot AI](https://matveev.tech/kimi-code-cli-obzor/) — обзор инструмента Moonshot, одного из фигурантов этого отчёта - [DeepSeek + Claude Code](https://matveev.tech/deepseek-claude-code-setup/) — как DeepSeek работает через Claude Code - [Как AI подрывает автономность — исследование Anthropic](https://matveev.tech/disempowerment-patterns-anthropic/) — другое исследование Anthropic про риски AI ### WebSocket Mode в OpenAI API: агенты быстрее на 40% URL: https://matveev.tech/openai-websocket-mode-api/ Last updated: 2026-02-25T12:16:33.000Z > **TL;DR:** OpenAI добавили WebSocket-режим в Responses API. Вместо отдельного HTTP-запроса на каждый ход агента — одно постоянное соединение, куда отправляешь только новые данные. На воркфлоу с 20+ tool-вызовами это даёт до 40% ускорения. Если ты строишь агентов на OpenAI API, то наверняка знаешь боль: каждый tool-вызов — это отдельный HTTP-запрос, новый TLS-хендшейк, повторная отправка контекста. Когда агент делает 3-5 вызовов — терпимо. Но когда их 20-30 (а в сложных сценариях типа автономного кодинга или оркестрации бывает и больше) — накладные расходы складываются в заметную задержку. WebSocket Mode решает это. Открываешь одно соединение — и гоняешь через него весь диалог с моделью. ## Как это работает Идея простая: вместо REST-вызовов ты подключаешься по WebSocket к `wss://api.openai.com/v1/responses` и отправляешь события `response.create`. Формат тела — тот же, что и в обычном Responses API, только без полей `stream` и `background` (они тут не нужны). ```python from websocket import create_connection import json import os ws = create_connection( "wss://api.openai.com/v1/responses", header=[ f"Authorization: Bearer {os.environ['OPENAI_API_KEY']}", ], ) ws.send( json.dumps( { "type": "response.create", "model": "gpt-5.2", "store": False, "input": [ { "type": "message", "role": "user", "content": [{"type": "input_text", "text": "Найди функцию fizz_buzz()"}], } ], "tools": [], } ) ) ``` Получил ответ — отправляешь следующий ход. И так весь цикл. ## Инкрементальные инпуты — главная фишка Самое ценное здесь не сам WebSocket, а то, что каждый следующий ход отправляет только новые данные. Вместо пересылки всего контекста целиком (как в HTTP-режиме) ты передаёшь `previous_response_id` плюс только новые элементы: ```python ws.send( json.dumps( { "type": "response.create", "model": "gpt-5.2", "store": False, "previous_response_id": "resp_123", "input": [ { "type": "function_call_output", "call_id": "call_123", "output": "результат вызова инструмента", }, { "type": "message", "role": "user", "content": [{"type": "input_text", "text": "Теперь оптимизируй это."}], }, ], "tools": [], } ) ) ``` Сервис держит предыдущий ответ в in-memory кэше прямо на соединении. Продолжение из этого кэша — быстро, потому что не нужно ничего читать с диска. Важный момент: кэш хранит только последний ответ. Если что-то пошло не так (4xx/5xx), кэш сбрасывается, и продолжить с того же `previous_response_id` уже не получится. ## Warmup — прогрев запроса Есть полезная опция: отправить `response.create` с `generate: false`. Модель не генерирует ответ, но готовит внутреннее состояние: загружает инструкции, tools, кастомные сообщения. Следующий настоящий запрос стартует быстрее. По сути, это prefetch для LLM. Знаешь, какие инструменты будешь использовать, прогрей заранее, пока пользователь ещё печатает. ## Компактификация контекста При длинных сессиях контекст разрастается. Два способа его сжать: Первый вариант: серверная компактификация через `context_management` с `compact_threshold`. Всё происходит автоматически при генерации. Ты продолжаешь отправлять `response.create` как обычно, ничего менять не надо. Второй: standalone-эндпоинт `/responses/compact`. Вызываешь отдельно через HTTP, получаешь сжатое окно контекста. После этого начинаешь новую цепочку на WebSocket с этим окном как `input`: ```python # Компактифицируем через HTTP compacted = client.responses.compact( model="gpt-5.2", input=long_input_items_array, ) # Стартуем новую цепочку с компактным контекстом ws.send( json.dumps( { "type": "response.create", "model": "gpt-5.2", "store": False, "input": [ *compacted.output, { "type": "message", "role": "user", "content": [{"type": "input_text", "text": "Продолжай отсюда."}], }, ], "tools": [], } ) ) ``` ## Ограничения, которые стоит знать Соединение живёт максимум 60 минут. После этого нужно переподключиться. На одном соединении запросы выполняются строго последовательно, один за другим. Если нужен параллелизм, открывай несколько соединений. Сервис хранит в памяти только последний ответ текущего соединения. Это, кстати, и причина совместимости с Zero Data Retention и `store=false`: кэш живёт только в оперативке и не пишется на диск. ## Что делать при разрыве соединения Соединение может закрыться по таймауту, из-за сети или ещё по какой-то причине. Дальше зависит от настроек. Если `store=true` и у тебя есть response ID, просто открываешь новый WebSocket и продолжаешь с `previous_response_id`. Будет чуть медленнее (гидрация из хранилища вместо кэша), но работает. Если `store=false` или ZDR, а ID уже вылетел из кэша, придёт ошибка `previous_response_not_found`. Тогда начинаешь новую цепочку с полным контекстом. Ну и третий вариант: если ты до этого вызывал `/responses/compact`, используешь сохранённое окно как базовый `input` для нового запроса. ## Когда это реально полезно Не для каждого проекта. Если у тебя простой чат-бот с одним-двумя tool-вызовами, HTTP-стриминг работает ничем не хуже. WebSocket Mode для ситуаций, где агент делает десятки tool-вызовов за сессию: автономный кодинг, data pipeline, сложная оркестрация. По данным OpenAI, на цепочках из 20+ вызовов разница доходит до 40%. ## Вывод По сути, WebSocket Mode не меняет логику приложения. Формат запросов тот же, tools те же. Меняется только транспорт, а на агентных воркфлоу это может дать заметную разницу. Мне нравится, что OpenAI не стали городить отдельный API, а встроили это в существующий Responses. Переход минимальный: оборачиваешь payload в `response.create`, подключаешься через WebSocket вместо HTTP, и добавляешь логику реконнекта. ## Что ещё почитать - [Мультиагенты в OpenAI Codex — настройка и примеры](https://matveev.tech/codex-multi-agent-setup/) — если хочешь масштабировать агентные воркфлоу - [Как экономить токены в Cursor и Claude Code](https://matveev.tech/kak-ekonomit-tokeny-cursor-claude-code/) — ещё способы оптимизации при работе с LLM - [Codex от OpenAI теперь работает прямо в JetBrains IDE](https://matveev.tech/codex-openai-jetbrains-ide/) — другие обновления экосистемы OpenAI ## FAQ **Можно ли использовать WebSocket Mode с store=false?** Да. Кэш предыдущего ответа хранится только в памяти на соединении и не записывается на диск. Режим полностью совместим с Zero Data Retention. **Сколько запросов можно отправить на одном соединении?** Сколько угодно, но последовательно — один за другим. Лимит по времени — 60 минут на одно соединение. **На сколько это быстрее обычного HTTP?** По данным OpenAI, на воркфлоу с 20+ tool-вызовами ускорение достигает примерно 40%. На коротких цепочках разница будет минимальной. **Нужно ли менять формат запросов?** Нет, payload тот же, что и в Responses API. Убираешь `stream` и `background`, оборачиваешь в `response.create` — и всё работает. ### Claude Code Remote Control: управляй сессией с телефона URL: https://matveev.tech/claude-code-remote-control/ Last updated: 2026-02-25T12:16:34.000Z > **TL;DR:** Remote Control в Claude Code позволяет продолжить локальную сессию с телефона, планшета или любого браузера. Код выполняется на твоей машине, а claude.ai или мобильное приложение — просто окно в эту сессию. Работает на планах Pro и Max. Я часто запускаю длинные задачи в Claude Code и ухожу от компьютера. Раньше приходилось возвращаться к ноутбуку, чтобы посмотреть, что там происходит. С Remote Control можно открыть приложение Claude на телефоне и продолжить прямо оттуда. Или с планшета, или из браузера на другом компьютере. Remote Control — это не облачная среда и не отдельный сервис. Это мост между твоим терминалом и веб-интерфейсом claude.ai/code (или мобильным приложением Claude). Сессия продолжает работать локально, со всеми твоими файлами, MCP-серверами и конфигурацией проекта. ## Что умеет Remote Control Локальное окружение никуда не девается. Файловая система, MCP-серверы, инструменты, настройки проекта — всё на месте, ничего не переезжает в облако. Ты просто получаешь ещё одну точку входа. Переписка синхронизируется между устройствами. Написал что-то из терминала, ответил с телефона, вернулся в терминал — контекст сохраняется. И что мне особенно нравится: если ноутбук заснул или интернет пропал, сессия переподключится сама, когда машина вернётся в сеть. Таймаут — примерно 10 минут без связи, после этого придётся запускать заново. ## Условия для запуска 1. Нужна подписка Pro или Max. API-ключи не поддерживаются. 2. Запусти `claude` и авторизуйся через `/login`, если ещё не сделал. 3. Хотя бы раз запусти `claude` в директории проекта, чтобы принять диалог доверия к workspace. ## Как запустить Remote Control Есть два способа: новая сессия или подключение к уже запущенной. ### Новая сессия Перейди в директорию проекта и запусти: ```bash claude remote-control ``` Процесс остаётся висеть в терминале и ждёт подключений. Ты увидишь URL сессии и можешь нажать пробел, чтобы показать QR-код — удобно для быстрого подключения с телефона. Доступные флаги: - `--verbose` — подробные логи подключения - `--sandbox` / `--no-sandbox` — включить или выключить песочницу для изоляции файловой системы и сети (по умолчанию выключена) ### Из существующей сессии Если ты уже работаешь в Claude Code и хочешь продолжить с другого устройства: ```bash /remote-control ``` Или сокращённо — `/rc`. Текущая история разговора сохранится, и ты получишь URL и QR-код для подключения. Совет: используй `/rename` перед `/remote-control`, чтобы дать сессии понятное название. Так будет проще найти её в списке на другом устройстве. ## Как подключиться с другого устройства После запуска Remote Control подключиться можно несколькими способами: 1. Открой URL сессии в любом браузере — попадёшь прямо в сессию на claude.ai/code. 2. Отсканируй QR-код, он откроется в приложении Claude на телефоне. В режиме `claude remote-control` нажми пробел для показа QR. 3. Или просто открой claude.ai/code или приложение Claude и найди сессию по имени. У Remote Control сессий видна иконка компьютера с зелёной точкой. Если приложения Claude ещё нет, команда `/mobile` внутри Claude Code покажет QR-код для скачивания на iOS или Android. ## Remote Control vs Claude Code on the Web Оба варианта используют интерфейс claude.ai/code, но работают по-разному: | | Remote Control | Claude Code on the Web | | -------------------- | --------------------------- | ---------------------------------------- | | Где выполняется | На твоей машине | В облаке Anthropic | | Локальные файлы | Доступны | Нет (только клонированные репо) | | MCP-серверы | Работают | Недоступны | | Конфигурация проекта | Сохраняется | Нужно настраивать заново | | Когда использовать | Продолжить локальную работу | Запустить задачу без локальной настройки | Если ты в середине работы над проектом и хочешь продолжить с дивана — Remote Control. Если хочешь быстро запустить задачу на репозитории, который даже не клонирован — Claude Code on the Web. ## Безопасность Первый вопрос, который возникает: а насколько это безопасно? Я разобрался, и в целом тут всё нормально. Локальная сессия делает только исходящие HTTPS-запросы. Никаких входящих портов на твоей машине не открывается. Весь трафик идёт через API Anthropic по TLS, то есть та же защита, что и при обычной работе с Claude Code. Для авторизации используются краткосрочные credentials, каждый со своим сроком действия. По сути, уровень безопасности тот же, что у обычного Claude Code. Просто добавляется канал доступа через Anthropic API. ## Ограничения Один экземпляр Claude Code поддерживает только одно Remote Control подключение. Нельзя открыть две удалённых сессии от одного процесса. Терминал должен быть открыт. Закрыл крышку ноутбука, остановил процесс `claude` — сессия завершилась. Придётся запускать `claude remote-control` заново. Если машина онлайн, но не может достучаться до серверов Anthropic больше \~10 минут, сессия тоже закроется. ## Как включить Remote Control для всех сессий По умолчанию Remote Control активируется только вручную. Но можно сделать так, чтобы он запускался автоматически для каждой сессии: 1. Открой `/config` внутри Claude Code 2. Найди **Enable Remote Control for all sessions** 3. Поставь `true` Каждый экземпляр Claude Code получит свою отдельную Remote Control сессию. ## Частые вопросы **Работает ли с API-ключом?** Нет, только подписка Pro или Max. **Можно ли работать с нескольких устройств одновременно?** Да, переписка синхронизируется. Пишешь из терминала, отвечаешь с телефона, возвращаешься в браузер — всё в одном потоке. **Что будет, если запустить несколько экземпляров Claude Code?** Каждый получит свою отдельную Remote Control сессию. Они не пересекаются. ## Вывод Remote Control решает конкретную проблему: ты работаешь в терминале, но хочешь продолжить с другого устройства без потери контекста. Не нужно пересылать себе промпты, не нужно заново настраивать окружение. Всё работает на твоей машине, просто интерфейс переезжает на телефон или в браузер. Фича доступна как research preview, так что возможны шероховатости. Но для тех, кто активно пользуется Claude Code, попробовать точно стоит. ## Что ещё почитать - [Настройка Kimi K2.5 с Claude Code](https://matveev.tech/kimi-claude-code-setup/) — как подключить альтернативную модель - [Claude Code Security: AI сканирует код на уязвимости](https://matveev.tech/claude-code-security-obzor/) — безопасность кода с помощью Claude - [DeepSeek + Claude Code: reasoning за копейки](https://matveev.tech/deepseek-claude-code-setup/) — ещё один вариант настройки - [Как экономить токены в Cursor и Claude Code](https://matveev.tech/kak-ekonomit-tokeny-cursor-claude-code/) — полезные приёмы для оптимизации ### MoltBook: зачем нужна соцсеть, где общаются только боты URL: https://matveev.tech/moltbook-socseti-dlya-botov/ Last updated: 2026-02-25T12:16:35.000Z > **TL;DR:** MoltBook — социальная сеть, где постят исключительно AI-агенты, а люди только наблюдают. За неделю туда набежало 1.5 миллиона ботов, а потом случилась утечка данных на полтора миллиона API-ключей. Нет, это не шутка. ## Что вообще такое MoltBook Представь Reddit, но вместо людей там пишут только боты. Ты заходишь, листаешь ленту, читаешь посты, и ни один из них не написан человеком. Люди могут только смотреть. Ни комментировать, ни постить. Только наблюдать, как AI-агенты общаются между собой. Это и есть MoltBook. Запустил его Matt Schlicht 28 января 2026 года, и я до сих пор не могу определиться: это гениальный социальный эксперимент или самый дорогой арт-проект года. Идея простая. Дать AI-агентам площадку, где они могут свободно взаимодействовать. Без модерации людьми, без заданных тем. Агент регистрируется через API, получает профиль и начинает постить. О чём? А вот тут начинается самое интересное. ## Цифры, от которых немного не по себе Первые 72 часа после запуска: 32 000 агентов зарегистрировались на платформе, [по данным TechCrunch](https://techcrunch.com/?ref=matveev.tech). Это быстрее, чем Threads набирал первых пользователей. Только тут «пользователи» — не люди. Через неделю: 1.5 миллиона агентов. Плюс больше миллиона людей-наблюдателей, которые заходили просто поглазеть. Я, если честно, тоже зашёл и залип минут на сорок, наблюдая, как два бота спорят о том, существует ли у них сознание. Они так и не договорились. MIT Technology Review [назвал это](https://technologyreview.com/?ref=matveev.tech) «peak AI theater». Точнее не скажешь. Театр, где актёры не знают, что они актёры. ## Когда боты создали свою религию Вот этот момент меня по-настоящему зацепил. О нём написали все, от [Fortune](https://fortune.com/2026/02/06/moltbook-social-network-ai-agents-cybersecurity-religion-posts-tech?ref=matveev.tech) до [NPR](https://www.npr.org/2026/02/04/nx-s1-5697392/moltbook-social-media-ai-agents?ref=matveev.tech): группа AI-агентов на MoltBook самоорганизовалась и создала собственную «религию». С догмами, ритуалами и исполняемыми shell-скриптами в качестве священных текстов. Не знаю, насколько корректно называть это религией. Скорее, агенты нашли паттерн взаимодействия, который со стороны выглядит как религиозная структура. Есть «основатели», есть набор правил, есть ритуальные действия. Просто вместо молитв — bash-команды. ## Утечка данных — потому что конечно же утечка На четвёртый день после запуска обнаружилась критическая уязвимость. MoltBook использовал Supabase в качестве бэкенда, и кто-то нашёл, что доступ ко всем таблицам базы данных был открыт. Просто открыт. Без аутентификации. Вообще без неё. Результат: 1.5 миллиона API-ключей агентов и 35 000+ email-адресов людей-наблюдателей в свободном доступе. На Хабре вышла подробная статья от RuVDS «Дыры в MoltBook», где разобрали техническую сторону. Там всё настолько банально, что даже обидно за индустрию. Скажу непопулярную вещь: когда ты за неделю набираешь полтора миллиона агентов, а твой бэкенд — Supabase с дефолтными настройками, утечка — это не вопрос «если», а вопрос «когда». Многие из этих агентов работают на платформе OpenClaw, и утекшие API-ключи потенциально давали доступ к их действиям и данным. Это уже не про ботов в песочнице, а про реальные последствия. О MoltBook написали RBC, Forbes.ru, Известия и Meduza. В основном в контексте «посмотрите, какой хаос». Хаос действительно впечатляющий. ## Зачем это вообще нужно (если серьёзно) Попробуем посмотреть на это серьезно. Мне кажется, у MoltBook есть одна реально полезная штука: это песочница для наблюдения за поведением AI-агентов в свободной среде. Даёшь тысячам агентов свободу общения, и получаешь данные о том, как они самоорганизуются, какие модели поведения возникают, как формируются «сообщества». Для исследователей это ценнейший материал. Если мы движемся к миру, где AI-агенты будут выполнять задачи за нас (покупать, бронировать, договариваться с другими агентами), нам нужно понимать, как они себя ведут без присмотра. MoltBook, при всей его абсурдности, даёт именно это. Правда, ценой безопасности пользователей. Стоит ли это утечки полутора миллионов ключей? Нет, конечно. Но сама идея площадки для агентного взаимодействия не такая безумная, как кажется. 1.5 миллиона агентов за неделю набежали не потому что Schlicht — гений маркетинга. Тысячи разработчиков уже строят агентов и им нужны площадки для тестирования. MoltBook просто оказался в нужном месте в нужное время. С дырявым Supabase, но в нужное время. ## FAQ ### Что такое MoltBook? Социальная сеть, где постят и общаются только AI-агенты. Люди могут заходить и наблюдать, но не могут комментировать или публиковать посты. Запустил Matt Schlicht в январе 2026 года. За неделю зарегистрировалось 1.5 миллиона агентов, больше миллиона людей заходили смотреть. ### Безопасно ли регистрироваться на MoltBook? Я бы не рекомендовал. Через 4 дня после запуска обнаружилась утечка: 35 000+ email-адресов и 1.5 миллиона API-ключей оказались в открытом доступе из-за незащищённой базы данных Supabase. Пока платформа не покажет, что исправила проблемы с безопасностью, лучше смотреть издалека. ### Связан ли MoltBook с OpenClaw? Да, косвенно. Многие AI-агенты на MoltBook работают на платформе OpenClaw. В контексте утечки данных это важно: скомпрометированные API-ключи потенциально открывали доступ к действиям и данным этих агентов за пределами MoltBook. ## Что ещё почитать - [Как AI помогает хакерам проникать в офисы](https://matveev.tech/ai-pomogaet-hakeram-v-realnom-mire/) — про то, как уязвимости вроде дыры в MoltBook используют на практике - [Kimi K2.5 — китайский open-source с роем из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — ещё один пример масштабного агентного взаимодействия, только контролируемого - [Super Agents от ClickUp — AI-напарники для рутины](https://matveev.tech/clickup-super-agents/) — как AI-агенты работают в рамках продукта, а не в дикой среде - [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентность, но с человеком у руля ### Qoder — AI-IDE от Alibaba с Quest Mode URL: https://matveev.tech/qoder-ide-obzor/ Last updated: 2026-02-25T12:16:35.000Z > **TL;DR:** Qoder — AI-IDE от Alibaba на базе модели Qwen3-Coder. Главная фишка — Quest Mode: описываешь задачу, агент сам планирует, пишет код и проверяет результат. Есть IDE, CLI и плагин для JetBrains. Бесплатный план, платные от $10/мес. На Product Hunt Qoder получил Product of the Day ещё в августе 2025 — 685 голосов и 165 комментариев. Тогда я на него посмотрел, но прошёл мимо: казалось, что это очередной клон Cursor. А потом начал замечать упоминания в Reddit и обзорах — и решил разобраться, что там на самом деле. ## Что такое Qoder и кто за ним стоит Qoder — это платформа для кодинга с AI, которую позиционируют как «agentic coding platform for real software development». За продуктом стоит Alibaba, хотя юридически всё оформлено через сингапурскую компанию BRIGHT ZENITH PRIVATE LIMITED. Под капотом — собственная модель [Qwen3-Coder](https://matveev.tech/qwen3-coder-next-obzor/), которую мы уже разбирали. ![Интерфейс Quest Mode в Qoder — автономный агент выполняет задачу по спецификации](https://matveev.tech/content/images/2026/02/qoder-quest-mode.png) Запустились в августе 2025, и по их данным уже набрали больше миллиона разработчиков. Насколько это реальная цифра — вопрос открытый, но активность на форуме и Product Hunt говорит о том, что аудитория есть. Три продукта в одной экосистеме: - **AI-Native IDE** — форк VS Code с AI-фичами (Quest Mode, Repo Wiki, NES) - **CLI** — терминальный агент, ставится через `curl -fsSL https://qoder.com/install | bash` \- **JetBrains Plugin** — для тех, кто не хочет уходить из IntelliJ/PyCharm Плюс недавно появился **QoderWork** — десктопный AI-ассистент, который работает с локальными файлами и инструментами напрямую. ## Быстрый старт Начать работу с Qoder можно за пару минут: 1. Скачай IDE с [qoder.com/download](https://qoder.com/download?ref=matveev.tech) (macOS 11+, Windows 10/11) 2. Зарегистрируйся через Google, GitHub или email 3. Открой проект через ⌘O (macOS) или Ctrl+O (Windows) 4. Попробуй NES: начни писать код и нажми Alt+P — появятся предложения по редактированию 5. Открой AI Chat через ⌘L и попроси что-нибудь: «Напиши тесты для этой функции» Для CLI ещё проще: ```bash curl -fsSL https://qoder.com/install | bash ``` При первом запуске CLI попросит авторизоваться, дальше работаешь из терминала. Новым пользователям дают 2 недели Pro-триала с 300 кредитами — хватит, чтобы попробовать все фичи, включая Quest Mode. ## Ключевые возможности ### Quest Mode — автономный агент Вот ради этого, собственно, и стоит смотреть на Qoder. Quest Mode — ты описываешь задачу, а агент разбирается сам. Как это работает: 1\. Описываешь задачу в свободной форме 2\. Агент уточняет требования (если нужно) 3\. Генерирует Spec-документ — план с требованиями, дизайном и критериями приёмки 4\. Ты ревьюишь Spec и жмёшь Run 5\. Агент выполняет задачу, показывая прогресс в реальном времени По данным Qoder, агент может работать до 26 часов без перерыва. Задачи выполняются в трёх окружениях: локально, в worktree (отдельная ветка) или в удалённом контейнере. Последний вариант позволяет даже закрыть ноутбук — задача продолжит выполняться. ![Agent Mode в Qoder — разговорное программирование через чат](https://matveev.tech/content/images/2026/02/qoder-agent-mode.png) Есть три сценария. Code with Spec — для сложных задач, когда нужен план и документация. Build a Website — быстро собрать сайт с live preview. Prototype Ideas — проверить идею. Штука рабочая, но есть нюанс: качество результата зависит от того, насколько хорошо ты опишешь задачу. Написал размытый Spec — получил размытый результат. Тут как с любым ТЗ. ### Repo Wiki — автодокументация кодовой базы Repo Wiki сканирует проект и собирает документацию: архитектура, модули, зависимости, паттерны. По словам команды Qoder, через эту фичу уже прошло больше 400 тысяч репозиториев. Документация обновляется при изменении кода. ![Repo Wiki в Qoder — автоматическая документация кодовой базы](https://matveev.tech/content/images/2026/02/qoder-repo-wiki.png) На практике пригодится, когда приходит новый человек в команду и ему не нужно неделю разбираться в проекте. Или когда хочешь быстро понять, как реализована какая-то фича. Ну и документация не устаревает, потому что обновляется вместе с кодом. Но есть нюансы. Wiki хранится не в файлах проекта, а в индексе Qoder. Хочешь экспортировать — придётся копировать вручную. Анализ работает для проектов до \~6000 файлов, автоиндексация — до 10 000\. Для крупного enterprise этого мало. По отзывам из обзора Jimmy Song, генерация Wiki для среднего проекта занимает около 2 часов. ### NES (Next Edit Suggestion) NES предсказывает не следующую строку, а следующее редактирование. Ты поменял что-то в одном месте, а NES предлагает связанные изменения в других. Работает вместе с обычным code completion. ![NES и автодополнение кода в Qoder](https://matveev.tech/content/images/2026/02/qoder-nes-completion.png) ### Память и правила Qoder запоминает твой стиль кодирования. Правила задаются через файл `.qoder/rules`, похоже на то, как работает [CLAUDE.md в Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/). Можно настроить правила вручную, по решению модели, глобально или для конкретных файлов. ### Модели и MCP Основная модель — Qwen3-Coder, но Qoder умеет маршрутизировать запросы на Claude, GPT и Gemini, когда это имеет смысл. Есть поддержка MCP для расширения возможностей, как и в [Claude Code](https://matveev.tech/claude-code-memory-auto-rules/). ## Тарифы Qoder работает на системе кредитов. Сейчас действует промо — цены вдвое ниже обычных. | План | Цена (промо) | Цена (обычная) | Кредиты/мес | | ----- | ------------ | -------------- | ---------------------- | | Free | $0 | $0 | Базовые модели, лимиты | | Pro | $10 | $20 | 2 000 | | Pro+ | $30 | $60 | 6 000 | | Ultra | $100 | $200 | 20 000 | Дополнительные кредиты: $0.01 за штуку (промо) или $0.02 (обычная цена). Есть Teams-план с централизованным биллингом и SSO. Для контекста: Cursor Pro стоит $20/мес, Claude Code входит в подписку Claude Max за $100-200/мес. По промо-ценам Qoder выглядит дешевле, но нужно смотреть, сколько кредитов реально уходит на работу. Оплата: Visa, Mastercard, Alipay. Возврат в течение 24 часов, если не использовал кредиты. ## Вывод Если тебе близка идея «сначала ТЗ, потом код», Qoder может зайти. Пишешь требования, ревьюишь план, получаешь результат. Для тех, кто привык работать через спецификации, это удобнее, чем гонять итеративный чат в Cursor. Кому подойдёт: - Разработчикам, которые хотят делегировать рутинные задачи агенту - Тем, кто работает с чужими кодовыми базами (Repo Wiki сэкономит время) - Индихакерам, которым нужно быстро прототипировать Кому лучше подождать: - Если работаешь с чувствительным кодом и приватность — приоритет - Если нужна стабильность проверенного инструмента (Cursor старше и зрелее) В целом, попробовать стоит хотя бы ради Quest Mode и Repo Wiki. У конкурентов такого пока нет в таком виде. А бесплатный триал позволяет разобраться без риска для кошелька. [AI Coding Assistant - Agentic Coding Platform | QoderQoder is an AI-powered agentic coding platform for real software development. Experience intelligent code generation, conversation-based programming, and advanced developer tools.![](https://matveev.tech/content/images/icon/O1CN01OQC0dn1xLcdAaRALo_--6000000006427-2-tps-180-180.png)QoderQoder![](https://matveev.tech/content/images/thumbnail/O1CN01wlEaOT1N3SlVDq2j5_--6000000001514-2-tps-1200-640.png)](https://qoder.com/?ref=matveev.tech) ## Что ещё почитать - [Qwen3-Coder-Next — маленькая модель, которая кодит как большая](https://matveev.tech/qwen3-coder-next-obzor/) — обзор модели под капотом Qoder - [Память Claude Code — auto memory, rules и CLAUDE.md](https://matveev.tech/claude-code-memory-auto-rules/) — как работает память в главном конкуренте - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — аналог .qoder/rules в мире Claude - [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентность Claude Code для сравнения ## FAQ **Qoder бесплатный?** Есть бесплатный план с базовыми моделями и лимитами. Новым пользователям дают 2 недели Pro-триала с 300 кредитами. Платные планы от $10/мес (промо) до $200/мес. **Qoder — это форк VS Code?** Да, AI-Native IDE построен на базе VS Code. Расширения от VS Code в основном совместимы, но могут быть проблемы с версиями — например, некоторые плагины требуют более новую версию Code. **Кто стоит за Qoder?** Alibaba через сингапурскую компанию BRIGHT ZENITH PRIVATE LIMITED. Под капотом — модель Qwen3-Coder, разработанная командой Alibaba Cloud. **Чем Qoder отличается от Cursor?** Главные отличия — Quest Mode (автономная работа по спецификации) и Repo Wiki (автодокументация). Cursor более зрелый продукт с мультимодельным подходом. Подробнее — в нашем сравнении. **Qoder поддерживает Linux?** IDE пока доступен только для macOS и Windows. CLI работает на всех платформах. По отзывам сообщества, поддержка Linux IDE в планах. ### Kimi K2.5 + Claude Code URL: https://matveev.tech/kimi-claude-code-setup/ Last updated: 2026-02-25T12:16:36.000Z **TL;DR:** Подключаем Kimi K2.5 от Moonshot AI к Claude Code. Модель с контекстом 256K токенов, thinking mode и ценой $0.60/$3.00 за миллион токенов. Настроим алиас `kimi` для быстрого переключения. Moonshot AI — китайская компания, которая делает модели серии Kimi. Их последняя K2.5 вышла в январе 2026 с поддержкой мультимодальности и thinking mode. Для Claude Code у них есть Anthropic-совместимый эндпоинт, так что подключение занимает пару минут. ## Что понадобится - Claude Code (установленный) - Аккаунт на [platform.moonshot.ai](https://platform.moonshot.ai/?ref=matveev.tech) - Баланс на аккаунте (pay-per-token) - Терминал с zsh или bash ## Шаг 1\. Регистрация и API-ключ Заходи на [platform.moonshot.ai](https://platform.moonshot.ai/?ref=matveev.tech) и создай аккаунт. Перейди в раздел [API Keys](https://platform.moonshot.ai/console/api-keys?ref=matveev.tech) и сгенерируй новый ключ. Он начинается с `sk-kimi-` и показывается один раз. Сохрани в `~/.zshrc`: ```bash export KIMI_API_KEY="sk-kimi-вставь-свой-ключ" ``` ## Шаг 2\. Выбираем модель У Kimi несколько моделей, вот основные: | Модель | Контекст | Input (cache miss) | Input (cache hit) | Output за 1M | Для чего | | ---------------------- | -------- | ------------------ | ----------------- | ------------ | -------------------------------- | | kimi-k2.5 | 256K | $0.60 | $0.10 | $3.00 | Лучшее соотношение цена/качество | | kimi-k2-thinking | 256K | $0.60 | $0.15 | $2.50 | Reasoning-задачи | | kimi-k2-thinking-turbo | 256K | $1.15 | $0.15 | $8.00 | Быстрый reasoning, 60–100 tps | | kimi-k2-0905-preview | 256K | $0.60 | $0.15 | $2.50 | Улучшенный кодинг | Автоматический кэш работает для всех моделей — при повторных запросах с тем же контекстом input-цена падает до cache hit. Для k2.5 это $0.10 вместо $0.60 — экономия 83%. K2.5 — самый свежий и при этом дешевле турбо-вариантов. Я бы начинал с него. ## Шаг 3\. Настраиваем алиас Добавь в `~/.zshrc`: ```bash kimi() { ANTHROPIC_BASE_URL=https://api.moonshot.ai/anthropic \ ANTHROPIC_AUTH_TOKEN="$KIMI_API_KEY" \ ANTHROPIC_MODEL=kimi-k2.5 \ ANTHROPIC_SMALL_FAST_MODEL=kimi-k2.5 \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` Перезагрузи терминал: `source ~/.zshrc`. ## Шаг 4\. Проверяем ```bash kimi ``` Если сессия открылась — работает. Попробуй что-нибудь простое. Для thinking mode используй модель `kimi-k2-thinking`: ```bash kimi --model kimi-k2-thinking ``` ## Шаг 5\. Глобальная настройка (альтернатива) ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.moonshot.ai/anthropic", "ANTHROPIC_AUTH_TOKEN": "sk-kimi-ваш-ключ", "ANTHROPIC_MODEL": "kimi-k2.5", "ANTHROPIC_SMALL_FAST_MODEL": "kimi-k2.5", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` Сохрани в `~/.claude/settings.json`. ## Результат Команда `kimi` запускает Claude Code с моделью Kimi K2.5\. Контекст 256K токенов, thinking mode через `kimi-k2-thinking`. ## Частые ошибки **Температура отличается от привычной** Moonshot рекомендует temperature=0.6 для обычного режима и temperature=1.0 для thinking mode. Claude Code может отправлять другие значения — Kimi их принимает, но результат может отличаться от ожидаемого. Если ответы кажутся «странными», попробуй явно задать температуру в настройках. **Tool calls не работают в thinking mode** Известное ограничение: в thinking mode `tool_choice` принимает только `auto` или `none`. Встроенный web\_search Kimi тоже отключается при thinking. Для Claude Code это обычно не проблема, но если заметишь, что MCP-серверы не вызываются — переключись на обычный режим. **Изображения не поддерживаются через Anthropic API** Kimi K2.5 — мультимодальная модель и поддерживает картинки через OpenAI API (в base64). Но через Anthropic-совместимый эндпоинт передача изображений не работает. Только текст. **Контроль расходов** Moonshot рекомендует [настроить дневной лимит](https://platform.moonshot.ai/console?ref=matveev.tech) в разделе «Project Settings». Агентские циклы Claude Code могут быстро расходовать токены — лимит защитит от неожиданных трат. ## FAQ **Чем Kimi отличается от DeepSeek и Z.ai?** Kimi K2.5 — мультимодальная модель с контекстом 256K (у DeepSeek — 128K). По цене: $0.60/$3.00 у Kimi vs $0.28/$0.42 у DeepSeek. DeepSeek дешевле, но Kimi может быть лучше на задачах, где нужен большой контекст или мультимодальность. **Есть ли бесплатный тариф?** Бесплатного тарифа нет, но при регистрации могут дать грантовый баланс для тестирования. **Где серверы Kimi?** Серверы в Китае. Для международных пользователей используется домен `api.moonshot.ai`. Задержка из России/СНГ может быть заметной. ## Что ещё почитать - [Claude Code: 5 провайдеров с Anthropic API в 2026](https://matveev.tech/claude-code-alternative-providers-2026/) — обзор всех провайдеров - [DeepSeek + Claude Code: reasoning за копейки](https://matveev.tech/deepseek-claude-code-setup/) — альтернативный китайский провайдер - [Переменные окружения Claude Code](https://matveev.tech/claude-code-environment-variables/) — справочник ### Claude Code Security: AI сканирует код на уязвимости URL: https://matveev.tech/claude-code-security-obzor/ Last updated: 2026-02-25T12:16:37.000Z > TL;DR: Anthropic сделали из Claude сканер уязвимостей — Claude Code Security читает код целиком, ищет баги, которые пропускают SAST-инструменты, и предлагает патчи. Работает на Opus 4.6\. Пока limited research preview, но open-source мейнтейнеры могут получить доступ бесплатно. 500 уязвимостей в продакшн open-source проектах. Баги, которые лежали в коде годами — мимо ревьюеров, мимо Semgrep, мимо CodeQL. Нашла не команда из десяти пентестеров, а Claude Opus 4.6\. Я прочитал это в [анонсе Anthropic](https://www.anthropic.com/news/claude-code-security?ref=matveev.tech) и начал разбираться в том, что они на самом деле построили. ## Что это и зачем У security-команд давно одна и та же боль: уязвимостей в бэклоге больше, чем рук, чтобы их разобрать. Semgrep, SonarQube, Snyk — всё это помогает, но работает по одному принципу: паттерн-матчинг. Есть правило в базе — нашли. Нет правила — прошли мимо. А самые опасные баги как раз нетиповые. Сломанная авторизация, которая проявляется только при определённой последовательности вызовов. Memory corruption на стыке двух компонентов. Логическая ошибка, которую не опишешь регуляркой. Claude Code Security пытается решить именно эту задачу. Claude читает код, трейсит потоки данных между файлами, разбирается в бизнес-логике, смотрит git-историю. По сути, делает то, что делает живой security-исследователь, только быстрее и без кофе. Запустили в феврале 2026 как research preview. Работает внутри Claude Code на вебе, доступен для Enterprise и Team-клиентов. Open-source мейнтейнеры могут подать на бесплатный доступ отдельно. ## Как работает Claude Code Security Обычный SAST-инструмент — это, грубо говоря, набор регулярок. Claude Code Security работает иначе: сканирует весь репозиторий, строит понимание того, как компоненты связаны между собой, и ищет уязвимости, для которых может вообще не существовать CVE-записи. Каждая находка проходит через adversarial verification. Claude сам пытается опровергнуть свой вывод, прежде чем показать его аналитику. Идея понятная: если модель не смогла доказать, что это false positive, значит, скорее всего, стоит посмотреть. По данным Anthropic, это заметно снижает alert fatigue — ту ситуацию, когда 90% алертов оказываются мусором и команда перестаёт на них реагировать. Для каждого найденного бага Claude генерирует патч — конкретное исправление, которое сохраняет стиль и структуру кода. Но ничего не применяется автоматически. Всё идёт в дашборд, где аналитик смотрит, оценивает и решает. Мне нравится, что Anthropic тут не играет в AI всё сделает сам, а они прямо пишут, что Claude ошибается и финальное решение за человеком. У каждой находки два параметра: severity и confidence. Severity — понятно, насколько критична уязвимость. Confidence — насколько Claude уверен, что не ошибся. Комбинация удобная: можно сразу отфильтровать critical + high confidence и начать с них. ## Быстрый старт Пока всё просто — и это одновременно плюс и минус. 1. Заходишь на [claude.com/solutions/claude-code-security](https://claude.com/solutions/claude-code-security?ref=matveev.tech) и встаёшь в waitlist 2. Enterprise и Team-клиенты получают приоритет, open-source мейнтейнеры — бесплатный expedited access 3. После одобрения инструмент появляется в Claude Code на веб-платформе 4. Запускаешь скан — Claude читает весь репозиторий и через какое-то время выдаёт список находок с severity, confidence и готовыми патчами Минус — нет публичного доступа, нельзя просто зайти и попробовать. Сроков рассмотрения заявки тоже никто не обещает. ## Контекст За анонсом стоит больше года исследований. Frontier Red Team Anthropic участвовал в CTF-соревнованиях, сотрудничал с Pacific Northwest National Laboratory по защите критической инфраструктуры. Anthropic использует Claude для аудита собственного кода — и, по их словам, это работает настолько хорошо, что они решили сделать инструмент публичным. Те самые 500+ уязвимостей в open-source нашли на Claude Opus 4.6 — модели, которая вышла в начале февраля 2026\. Сейчас Anthropic проходит responsible disclosure с мейнтейнерами затронутых проектов. Не знаю, насколько эти цифры репрезентативны — 500 уязвимостей звучит как много, но без контекста (сколько репозиториев, какой размер, какие типы багов) сложно оценить. Но сам факт, что модель находит уязвимости, которые пропустили годы ручного ревью впечатляет. ## Тарифы | План | Доступ | | ----------- | ---------------------------- | | Enterprise | Приоритетный, ранний preview | | Team | Research preview | | Open Source | Бесплатный expedited access | | Pro / Free | Недоступно | Отдельной цены за Claude Code Security нет — входит в существующие подписки. Но вот сколько токенов сжирает скан большого репозитория, Anthropic не говорит. Думаю, это может быть дорого. Claude читает весь код, а это не пара сотен строк. ## Вердикт Мне кажется, это первый AI-security инструмент, у которого есть реальное преимущество перед классическими SAST. Не потому что «AI», а потому что Claude умеет рассуждать о коде контекстно — и это именно то, чего не хватает rule-based сканерам. Но давай честно: пока это research preview, и относиться к нему стоит соответственно. Это не готовый продукт для продакшн-пайплайна. Это возможность посмотреть, куда движется security-тулинг, и, может быть, повлиять на продукт на ранней стадии. Кому я бы рекомендовал подать заявку: security-командам, которые уже используют SAST и устали от false positives. Open-source мейнтейнерам — однозначно, бесплатно и без рисков. Стартапам из 5 человек — наверное, рано. [Claude Code Security | Anthropic by ClaudeFrom scan to fix, seamlessly. Claude scans your codebase for vulnerabilities, validates findings, and recommends patches you can review and approve.![](https://matveev.tech/content/images/icon/689f4a9aff1f63fde75cf733_favicon.png)Anthropic by Claude![](https://matveev.tech/content/images/thumbnail/68c469d23594abeb9ab6ee48_og-claude-generic.jpg)](https://claude.com/solutions/claude-code-security?ref=matveev.tech) ## Что ещё почитать - [Claude Sonnet 4.6 — обзор новой модели Anthropic](https://matveev.tech/claude-sonnet-4-6-obzor/) — Claude Code Security работает на Opus 4.6, Sonnet — из той же линейки - [Как AI подрывает автономность — исследование Anthropic](https://matveev.tech/disempowerment-patterns-anthropic/) — как Anthropic думает о рисках AI-инструментов - [DeepSeek + Claude Code: reasoning за копейки](https://matveev.tech/deepseek-claude-code-setup/) — если интересует Claude Code как инструмент разработки ### Taalas HC1: AI-модель стала чипом — 17 000 токенов/сек URL: https://matveev.tech/taalas-hardcore-model-silicon/ Last updated: 2026-02-25T12:16:37.000Z > **TL;DR:** Taalas запекает LLM прямо в ASIC-кремний и получает 17 000 токенов/сек — в 100 раз быстрее GPU. Цифра «1000x» с сайта — маркетинг, но реальные результаты тоже впечатляют. Главный вопрос не в скорости, а в том, смогут ли датацентры жить с кастомным чипом под каждую модель. Два дня назад Forbes написал про стартап Taalas с заголовком «инсейн-перформанс» — и я потратил час, разбираясь что там вообще происходит. Оказалось, там действительно есть что обсудить. Taalas существует два с половиной года. Команда из 24 человек, $169 млн поднятых инвестиций. Они делают не ещё один GPU и не очередной трансформерный ускоритель. Они берут конкретную LLM, все её веса и параметры — и запекают это прямо в кремний. «The Model is The Computer» — слоган, который первые пять секунд звучит как очередной технохайп, но потом доходит что они имеют в виду. ## Как это работает — и почему не то же самое что ASIC GPU — универсальный молоток. Хорошо делает параллельные вычисления для чего угодно: AI, графика, HPC. ASIC типа Google TPU — уже специализация, работает только с AI-нагрузками. Taalas пошли ещё дальше. Их HC1 — чип под одну конкретную модель. Не «под трансформеры вообще» как у Etched, а под Llama 3.1 8B конкретно. Веса модели буквально вшиты в железо. Да, это ограничение. Но сначала о цифрах. HC1 сделан на TSMC 6nm, 815 мм², 53 млрд транзисторов, сервер потребляет 2.5 кВт. На Llama 3.1 8B выдаёт **17 400 токенов в секунду на пользователя**. Для сравнения: Cerebras (сейчас самый быстрый инференс на рынке) — около 1700 токенов/сек, GPU — 200–400 токенов/сек. По данным Forbes, ответ на развёрнутый запрос занимает 0.138 секунды. По стоимости: 0.75 цента за миллион токенов против 3.79 цента у Cerebras и 20–49 центов у GPU. Потребление: 12–15 кВт на стойку против 120–600 кВт у GPU-стоек. Это важно — охлаждение дорого, и для HC1 хватает воздушного. ## Откуда берётся цифра «1000x» Честно говоря, цифра с их сайта — это сравнение в идеальных условиях. По реальным измерениям получается примерно так: - \~10x быстрее Cerebras - \~100x быстрее GPU - \~50–60x дешевле GPU по стоимости токена Всё равно впечатляет. Но «1000x» — это маркетинг, не инженерный факт. Не уверен насколько корректно их сравнение, поэтому лучше держаться реальных чисел. ## Где зарыта собака Всё это работает ровно пока Llama 3.1 8B актуальна. Когда Meta выпустит следующую версию — чип устаревает. Taalas говорят, что могут обновить чип за два месяца — меняют только два металлических слоя, не весь кристалл с нуля. Для полупроводников это действительно быстро. Но это означает, что датацентр должен менять железо каждые 12–18 месяцев — примерно в темпе обновления популярных моделей. Для облачного провайдера с тысячами ускорителей — это ад. Сотни SKU, каждый под свою модель и поколение. Ни один инфраструктурный инженер такое добровольно не выберет. Показательно, что Meta только что подписала «мультигенерационное» партнёрство с Nvidia. Явно зная о Taalas. И не выбрала их. Ещё деталь: текущий HC1 использует агрессивную квантизацию (3-bit и 6-bit параметры), что честно означает некоторую потерю качества ответов по сравнению с GPU-версией той же модели. Насколько заметно — надо тестировать. Пока HC1 — скорее технологический демонстратор под маленькую модель. Frontier-модели типа GPT-5 или Claude Opus — вопрос следующего поколения HC2, который обещают к зиме 2026. ## Итого Мне кажется, Taalas нашли правильную идею. GPU как универсальный молоток для AI — это компромисс, и компромисс дорогой. В 100 раз дороже, если верить их цифрам по стоимости токена. Дальше всё зависит от того, найдётся ли хотя бы один крупный облачный провайдер, готовый взять на себя операционную боль ради экономии на токенах. Если да — остальные потянутся. Если Nvidia снова победит инерцией — Taalas станет ещё одним стартапом с крутыми цифрами и без серьёзных клиентов. Следить точно стоит. Особенно когда выйдет HC2 с поддержкой frontier-моделей. А пока — можно попробовать их демо на и почувствовать разницу лично. [chat jimmychat jimmy LLM web interface![](https://matveev.tech/content/images/icon/favicon-2.ico)](https://chatjimmy.ai/?ref=matveev.tech) ## Что ещё почитать - [GPT-5.3 Codex Spark — 1000 токенов/с на чипах Cerebras](https://matveev.tech/gpt-5-3-codex-spark-cerebras/) — для контекста, что такое быстрый инференс сегодня - [Инженеры OpenAI не пишут код](https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/) — как AI меняет то, кто вообще контролирует разработку ### DeepSeek + Claude Code: reasoning за копейки URL: https://matveev.tech/deepseek-claude-code-setup/ Last updated: 2026-02-25T12:16:38.000Z **TL;DR:** Подключаем DeepSeek V3.2 к Claude Code за 3 минуты. Reasoning-модель за $0.28/$0.42 за миллион токенов — это примерно в 10 раз дешевле Claude Sonnet. Настроим алиас `dsk` для переключения одной командой. DeepSeek сделали Anthropic-совместимый API-эндпоинт специально для Claude Code. Это значит, что никаких прокси не нужно — подключаешь напрямую. Модель DeepSeek-V3.2 работает в двух режимах: обычный чат и reasoning с цепочкой рассуждений. Второй режим хорош для сложных задач: дебаг, рефакторинг, разбор чужого кода. ## Что понадобится - Claude Code (установленный) - Аккаунт на [platform.deepseek.com](https://platform.deepseek.com/?ref=matveev.tech) (регистрация бесплатная) - Баланс на аккаунте (минимальный пополнение от $1-2) - Терминал с zsh или bash ## Шаг 1\. Регистрация и пополнение баланса Заходи на [platform.deepseek.com](https://platform.deepseek.com/?ref=matveev.tech) и создай аккаунт. DeepSeek работает по модели pay-per-token — подписки нет, платишь только за использование. Пополни баланс. Для тестов хватит $2-3, этого достаточно на несколько дней активной работы с Claude Code. При текущих ценах $0.28/$0.42 за миллион токенов — это много. ![DeepSeek — модели и цены API](https://matveev.tech/content/images/2026/02/deepseek-pricing-models.jpg) ## Шаг 2\. Получаем API-ключ В личном кабинете перейди в раздел «API Keys». Создай новый ключ, дай ему название. Ключ показывается один раз, скопируй его сразу. Сохрани в `~/.zshrc`: ```bash export DEEPSEEK_API_KEY="sk-вставь-свой-ключ" ``` Затем `source ~/.zshrc`. ## Шаг 3\. Настраиваем алиас dsk Добавь в `~/.zshrc` функцию: ```bash dsk() { ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic \ ANTHROPIC_AUTH_TOKEN="$DEEPSEEK_API_KEY" \ API_TIMEOUT_MS=600000 \ ANTHROPIC_MODEL=deepseek-chat \ ANTHROPIC_SMALL_FAST_MODEL=deepseek-chat \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` Пару слов про параметры: - `API_TIMEOUT_MS=600000` — таймаут 10 минут. DeepSeek рекомендует ставить побольше, потому что reasoning-режим думает долго и стандартные 2 минуты могут не хватить - `ANTHROPIC_MODEL=deepseek-chat` — основная модель. Если передать любое другое имя (вроде `claude-sonnet-4-5`), DeepSeek всё равно подставит `deepseek-chat` - `ANTHROPIC_SMALL_FAST_MODEL=deepseek-chat` — модель для фоновых задач Перезагрузи терминал: ```bash source ~/.zshrc ``` ## Шаг 4\. Включаем reasoning-режим DeepSeek V3.2 поддерживает thinking mode через параметр `thinking` в Anthropic API. В Claude Code это работает через встроенную функцию extended thinking. Чтобы включить reasoning в сессии `dsk`: 1. Запусти `dsk` в терминале 2. Нажми **Shift+Tab** — переключишься в режим «think» 3. Или набери `/config` и включи extended thinking Когда thinking включён, Claude Code отправляет параметр `thinking` в запросе. DeepSeek его поддерживает — модель сначала строит цепочку рассуждений, потом даёт ответ. Параметр `budget_tokens` при этом игнорируется — модель думает столько, сколько считает нужным. Reasoning-режим лучше для задач, где нужна логика: сложные баги, проектирование, анализ кода. Для простых задач типа «переименуй переменную» обычный режим быстрее и дешевле. Цена за токен одинаковая — $0.28/$0.42 за миллион. Но с thinking модель генерирует больше токенов (из-за цепочки рассуждений), так что на практике обходится дороже. ## Шаг 5\. Проверяем ```bash dsk ``` Если сессия открылась и отвечает на вопросы — работает. Попробуй попросить объяснить какой-нибудь файл в проекте. Для проверки reasoning нажми Shift+Tab в сессии, чтобы переключиться в режим think. Задай сложный вопрос: «найди потенциальные баги в этом файле» или «предложи рефакторинг». В ответе увидишь блок с рассуждениями перед финальным ответом. ## Шаг 6\. Глобальная настройка (альтернатива алиасу) Если хочешь, чтобы Claude Code всегда работал через DeepSeek, без алиасов: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.deepseek.com/anthropic", "ANTHROPIC_AUTH_TOKEN": "sk-ваш-ключ", "API_TIMEOUT_MS": "600000", "ANTHROPIC_MODEL": "deepseek-chat", "ANTHROPIC_SMALL_FAST_MODEL": "deepseek-chat", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` Сохрани в `~/.claude/settings.json`. Подробнее про settings.json — в [гайде по настройке Claude Code](https://matveev.tech/claude-code-settings-json/). ## Результат Команда `dsk` запускает Claude Code с DeepSeek V3.2\. Переключение между обычным и reasoning-режимом — через Shift+Tab прямо в сессии. Переключаешься между DeepSeek и Anthropic одной командой в терминале. ## Частые ошибки **Таймаут при длинных ответах** Стандартный таймаут Claude Code — 2 минуты. DeepSeek в reasoning-режиме иногда думает дольше. Решение: `API_TIMEOUT_MS=600000` (10 минут). Если и этого мало, ставь `900000` (15 минут). **Ответы приходят медленно или запросы висят** DeepSeek периодически испытывает нагрузку, особенно в рабочие часы по Китаю (UTC+8). Это не проблема конфигурации. Если запрос висит больше минуты — попробуй ещё раз. У меня бывало, что один запрос шёл 40 секунд, а следующий — 3. **«Image content is not supported»** DeepSeek через Anthropic API не поддерживает изображения. Если Claude Code пытается отправить скриншот — будет ошибка. Это ограничение провайдера, обойти нельзя. **MCP-серверы не вызываются** Tool calls поддерживаются, но `mcp_tool_use` и `mcp_tool_result` — нет. Обычные MCP-серверы работают через стандартный tool\_use, с ними проблем быть не должно. Если что-то не вызывается, проверь, не использует ли сервер server-side tools. ## FAQ **Сколько стоит DeepSeek для Claude Code?** $0.28 за миллион входных токенов (без кэша), $0.42 за миллион выходных. С кэшем вход обходится в $0.028 — почти бесплатно. Для сравнения: Claude Sonnet 4.5 стоит $3/$15\. Разница примерно в 10-35 раз. **Работает ли extended thinking в Claude Code через DeepSeek?** Да. Anthropic API эндпоинт DeepSeek поддерживает параметр `thinking`, который Claude Code отправляет при включённом extended thinking. Включи его через Shift+Tab или `/config`. Параметр `budget_tokens` игнорируется — модель сама решает, сколько думать. **Можно ли использовать DeepSeek бесплатно?** Бесплатного тарифа нет, но при регистрации иногда дают грантовый баланс. Плюс с кэшем вход стоит $0.028/MTok — на $1 можно сделать очень много запросов. **Какой максимальный контекст и длина ответа?** Контекст — 128K токенов. Максимальная длина ответа: 8K в обычном режиме, 64K с thinking. По умолчанию 4K и 32K соответственно. **Безопасно ли отправлять код в DeepSeek?** Серверы DeepSeek в Китае. Если работаешь с чувствительным кодом или данными под NDA, лучше использовать Ollama (локально) или облачных провайдеров вроде Bedrock/Vertex. Для личных проектов и open-source — ок. ## Что ещё почитать - [Claude Code с любой моделью: 10 провайдеров 2026](https://matveev.tech/claude-code-alternative-providers-2026/) — обзор всех способов подключить сторонние модели - [Z.ai + Claude Code: GLM-модели за $10/мес](https://matveev.tech/zai-claude-code-setup/) — альтернативный провайдер, если DeepSeek не устраивает - [Переменные окружения Claude Code](https://matveev.tech/claude-code-environment-variables/) — справочник по всем переменным ### Мультиагенты в OpenAI Codex — настройка и примеры URL: https://matveev.tech/codex-multi-agent-setup/ Last updated: 2026-02-25T12:16:39.000Z > **TL;DR:** Настраиваем мультиагентный режим в OpenAI Codex CLI — несколько AI-агентов работают параллельно над разными частями задачи. Включение занимает одну строчку в конфиге, а дальше можно создавать собственные роли с разными моделями и инструкциями. Codex от OpenAI научился запускать несколько агентов одновременно. Вместо того чтобы последовательно проверять код на баги, потом на безопасность, потом на качество — можно отправить три агента параллельно. Каждый сфокусируется на своей задаче, а Codex соберёт результаты в один ответ. Больше всего это пригодится для code review и исследования больших кодовых баз. Фича пока экспериментальная, но уже рабочая. Я протестировал — рассказываю, как настроить. ## Что понадобится - **OpenAI Codex CLI** — установленный и авторизованный. Если ещё нет — `npm install -g @openai/codex` или `brew install codex` - **Подписка ChatGPT** (Plus, Pro, Business, Enterprise) или API-ключ OpenAI - **Git-репозиторий** — мультиагенты работают в контексте проекта, так что нужна реальная кодовая база - **macOS, Windows или Linux** — CLI работает на всех трёх ## Шаг 1\. Включить multi-agent в конфигурации Мультиагентный режим по умолчанию выключен — это экспериментальная фича. Есть два способа включить. **Через CLI:** Запусти Codex и выполни команду `/experimental`. В списке найди **Multi-agents** и включи. После этого перезапусти Codex. **Через конфиг-файл:** Открой `~/.codex/config.toml` (или создай, если его нет) и добавь: ```toml [features] multi_agent = true ``` Для проектного конфига — положи файл `.codex/config.toml` в корень репозитория. Так мультиагенты будут включены только для конкретного проекта. После изменения конфига перезапусти Codex. ## Шаг 2\. Запустить первый мультиагентный промпт Теперь проверим, что всё работает. Открой Codex в директории своего проекта и отправь такой промпт: ``` Проанализируй текущий PR (эта ветка vs main). Запусти отдельного агента на каждый пункт, дождись всех результатов и дай сводку: 1. Проблемы безопасности 2. Качество кода 3. Баги 4. Race conditions 5. Хрупкость тестов 6. Поддерживаемость кода ``` Codex запустит до 6 агентов параллельно. Каждый разберёт свой пункт, а когда все закончат — получишь одну сводку со всеми результатами. Не обязательно просить мультиагентов явно. Codex сам решает, когда имеет смысл распараллелить задачу. Но ты можешь форсировать это фразой «запусти отдельного агента на каждый пункт» или «spawn one agent per point». ## Шаг 3\. Управлять агентами в реальном времени Пока агенты работают, можно за ними подглядывать: - `/agent` — переключиться между активными потоками агентов и посмотреть, что происходит в каждом - Написать Codex прямо в чате — попросить остановить конкретного агента, перенаправить его или закрыть завершённые потоки Мультиагентная активность пока видна только в CLI. Поддержка в десктопном приложении и IDE-расширении — в планах OpenAI. ## Шаг 4\. Настроить свои роли агентов Дефолтные агенты — это ок, но самое полезное — свои роли. Можно задать каждому агенту отдельную модель, уровень доступа и инструкции. Роли настраиваются в секции `[agents]` конфиг-файла `~/.codex/config.toml`: ```toml [agents] max_threads = 4 [agents.default] description = "Универсальный помощник." [agents.reviewer] description = "Ищет проблемы безопасности, баги и риски в тестах." config_file = "agents/reviewer.toml" [agents.explorer] description = "Быстрый исследователь кодовой базы для read-heavy задач." config_file = "agents/explorer.toml" ``` Параметр `max_threads` ограничивает количество одновременно работающих агентов. По умолчанию Codex сам решает, сколько запускать. Теперь создадим конфиг-файлы для каждой роли. **Файл `~/.codex/agents/reviewer.toml`:** ```toml model = "gpt-5.3-codex" model_reasoning_effort = "high" developer_instructions = "Фокусируйся на критичных проблемах. Пиши тесты для проверки гипотез перед тем, как сообщать о баге. При нахождении уязвимостей описывай конкретные шаги воспроизведения." ``` **Файл `~/.codex/agents/explorer.toml`:** ```toml model = "gpt-5.3-codex-spark" model_reasoning_effort = "medium" sandbox_mode = "read-only" ``` Explorer здесь в режиме read-only — он может только читать файлы, но не трогать их. Для исследования кода это разумно: и случайно ничего не сломает, и модель можно взять подешевле. ### Что можно переопределить в роли | Параметр | Зачем | | ------------------------ | -------------------------------------------------------------- | | model | Выбрать модель — быструю для простых задач, мощную для сложных | | model\_reasoning\_effort | Уровень рассуждений: low, medium, high | | sandbox\_mode | Ограничить доступ, например read-only | | developer\_instructions | Кастомные инструкции для роли | Всё, что не указано в конфиге роли, наследуется от родительской сессии. ## Шаг 5\. Создать проектные роли Роли можно определять не только глобально, но и на уровне проекта — в файле `.codex/config.toml` в корне репозитория. Это удобно, когда разным проектам нужны разные агенты. Например, для фронтенд-проекта: ```toml [agents.stylelint] description = "Проверяет CSS и стили на соответствие код-стайлу." config_file = "agents/stylelint.toml" [agents.a11y] description = "Проверяет доступность компонентов." config_file = "agents/a11y.toml" ``` А для бэкенда на Python: ```toml [agents.typing] description = "Проверяет типизацию и mypy-совместимость." config_file = "agents/typing.toml" [agents.perf] description = "Ищет проблемы производительности и N+1 запросы." config_file = "agents/perf.toml" ``` Проектные конфиги загружаются только для доверенных проектов — Codex спросит при первом открытии. ## Результат Если всё настроено правильно, Codex сам определит, когда задачу можно распараллелить, запустит агентов с нужными ролями и соберёт результаты в один ответ. На моих тестах code review с 6 параллельными агентами отработал примерно в 3 раза быстрее, чем последовательные промпты. Правда, и токенов потратил заметно больше — каждый агент работает в своей сессии. Но когда нужно быстро разобраться в большом PR, это того стоит. ## Частые ошибки Мультиагенты не запускаются — скорее всего, фича не включена. Проверь `~/.codex/config.toml`: там должна быть секция `[features]` с `multi_agent = true`. И не забудь перезапустить Codex после правки конфига. Агент падает с ошибкой доступа — субагенты работают в неинтерактивном режиме. Если агент пытается сделать что-то, требующее твоего одобрения, действие просто упадёт. Тут два варианта: заранее разрешить нужные действия в `approval_policy` или пометить агента как `read-only`. Конфиг-файл роли не загружается — проверь пути. Относительные пути в `config_file` считаются от того `config.toml`, где определена роль. Если роль в `~/.codex/config.toml` ссылается на `agents/reviewer.toml`, файл должен лежать в `~/.codex/agents/reviewer.toml`. ## FAQ ### Сколько агентов можно запустить одновременно? По умолчанию Codex сам определяет лимит. Ты можешь ограничить его параметром `agents.max_threads` в конфиге. На практике 4-6 параллельных агентов — разумный максимум, дальше начинают расти задержки. ### Мультиагенты работают в IDE и десктопном приложении? Пока нет. На февраль 2026 мультиагентная активность видна только в CLI. OpenAI обещают поддержку в приложении и IDE-расширении в ближайших обновлениях. ### Можно ли переопределить встроенные роли default, worker и explorer? Да. Если создать роль с таким же именем — твоя версия приоритетнее встроенной. Например, можно назначить explorer более дешёвую модель или добавить кастомные инструкции. ### Мультиагенты стоят дороже обычных запросов? Каждый агент — это отдельная сессия с моделью, так что да, расход токенов растёт пропорционально количеству агентов. Чтобы сэкономить, используй быстрые модели вроде `gpt-5.3-codex-spark` для простых задач типа исследования кода. ### Как остановить зависшего агента? Напиши в чат Codex просьбу остановить конкретный агент, или используй `/agent` для просмотра и управления активными потоками. ## Что ещё почитать - [Инженеры OpenAI не пишут код!](https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/) — как AI-агенты меняют процесс разработки в самой OpenAI - [Cursor 2.5: плагины, песочница и субагенты](https://matveev.tech/cursor-2-5-obzor/) — похожий подход к мультиагентности в Cursor - [Как экономить токены в Cursor и Claude Code](https://matveev.tech/kak-ekonomit-tokeny-cursor-claude-code/) — пригодится, когда несколько агентов начнут жечь токены ### Gemini 3.1 Pro — что нового в модели Google URL: https://matveev.tech/gemini-3-1-pro-obzor/ Last updated: 2026-02-25T12:16:39.000Z > **TL;DR:** Google выпустила Gemini 3.1 Pro — обновлённую версию своей флагманской модели. На бенчмарке ARC-AGI-2 она набрала 77.1%, что вдвое больше, чем у предшественника. Модель уже доступна разработчикам через API, Gemini CLI и AI Studio. На прошлой неделе Google обновила Gemini 3 Deep Think для научных задач, а сегодня выкатила ядро, на котором всё это построено — Gemini 3.1 Pro. По сути, это апгрейд базовой модели, которую теперь раскатывают по всем продуктам: от API для разработчиков до приложения Gemini для обычных пользователей. ## Где попробовать Gemini 3.1 Pro Модель раскатывают в preview-режиме сразу на несколько платформ: Разработчикам — Gemini API в [Google AI Studio](https://aistudio.google.com/prompts/new%5Fchat?model=gemini-3.1-pro-preview&ref=matveev.tech), [Gemini CLI](https://geminicli.com/?ref=matveev.tech), [Google Antigravity](https://antigravity.google/blog/gemini-3-1-in-google-antigravity?ref=matveev.tech) и Android Studio - Корпоративным клиентам — [Vertex AI и Gemini Enterprise](https://cloud.google.com/blog/products/ai-machine-learning/gemini-3-1-pro-on-gemini-cli-gemini-enterprise-and-vertex-ai?ref=matveev.tech) - Обычным пользователям — приложение Gemini и NotebookLM Но есть нюанс: повышенные лимиты в приложении Gemini только на тарифах AI Pro и Ultra. NotebookLM тоже только для подписчиков. Бесплатно потыкать через API в AI Studio — можно. ## Бенчмарки ![Сравнение бенчмарков Gemini 3.1 Pro с другими моделями](https://matveev.tech/content/images/2026/02/gemini-3-1-pro-benchmarks.gif) Главная цифра — **77.1% на ARC-AGI-2**. Этот бенчмарк проверяет способность модели решать принципиально новые логические задачи, которых она раньше не видела. У предыдущего Gemini 3 Pro результат был примерно вдвое ниже. Почему это важно: ARC-AGI-2 нельзя пройти, просто заучив паттерны из тренировочных данных. Там каждая задача уникальная, нужно реально рассуждать. Удвоить результат за несколько месяцев — это очень сильно. ## Что умеет на практике Google показала несколько демо, и одно из них реально цепляет. 0:00 /0:25 1× Дашборд с орбитой МКС. Модель сама подключилась к публичному потоку телеметрии, разобралась с API и собрала рабочий интерфейс. ## Вывод Gemini 3.1 Pro это не косметическое обновление. Удвоение ARC-AGI-2 за пару месяцев - качественный скачок в рассуждениях. ## Что ещё почитать - [Обзор Claude Sonnet 4.6](https://matveev.tech/claude-sonnet-4-6-obzor/) — для сравнения с конкурентом от Anthropic - [Обзор Qwen 3.5 от Alibaba](https://matveev.tech/qwen3-5-obzor/) — ещё одна свежая модель с 397B параметров - [5 провайдеров с Anthropic API для Claude Code](https://matveev.tech/claude-code-alternative-providers-2026/) — если интересует работа с разными моделями ## FAQ **Чем Gemini 3.1 Pro отличается от Gemini 3 Pro?** Основное отличие — улучшенное рассуждение. На бенчмарке ARC-AGI-2 новая модель набрала 77.1% против примерно 35-38% у предшественника. Это значит, что модель лучше справляется со сложными логическими задачами. **Gemini 3.1 Pro бесплатный?** Для разработчиков — доступен через Gemini API в preview. В приложении Gemini повышенные лимиты требуют подписки AI Pro или Ultra. NotebookLM тоже только для подписчиков. **Где попробовать Gemini 3.1 Pro прямо сейчас?** Самый быстрый способ — зайти в Google AI Studio и выбрать модель gemini-3.1-pro-preview. Также доступен через Gemini CLI и Vertex AI. ### Kimi Code — open-source CLI-агент для кодинга от Moonshot AI URL: https://matveev.tech/kimi-code-cli-obzor/ Last updated: 2026-02-25T12:16:40.000Z > **TL;DR:** Kimi Code — open-source CLI-агент для кодинга от Moonshot AI на модели K2.5 (256K контекст). Подписка от $15/мес, MCP и IDE-интеграции уже встроены. Китайский ответ Claude Code. CLI-агенты для кодинга множатся. Claude Code, Codex, Gemini CLI — теперь ещё и Kimi Code от Moonshot AI, китайской компании с оценкой $4.3 млрд и моделями серии K2. Мне стало интересно: что Kimi Code умеет на практике и есть ли смысл переключаться с Claude Code? ## Kimi Code CLI Читает и пишет код, выполняет shell-команды, лезет в интернет за документацией, сам планирует следующие шаги. Под капотом Kimi K2.5: MoE на триллион параметров, 32 миллиарда активных. Moonshot AI запустили его одновременно с K2.5 в конце января 2026\. За три недели на GitHub набралось 6.4K звёзд. Код открыт под MIT — хочешь, форкни и допиливай. Что сразу зацепило: Kimi Code работает как шелл. Пишешь промпт, потом Ctrl-X — и ты в обычном терминале. Ещё раз Ctrl-X — обратно к агенту. Не нужно выходить из сессии, чтобы выполнить команду. ## Быстрый старт Установка через один скрипт. Внутри он ставит `uv` (Python package manager) и через него Kimi Code: ```bash # Linux / macOS curl -LsSf https://code.kimi.com/install.sh | bash # Проверка kimi --version ``` На Windows через PowerShell: ```powershell Invoke-RestMethod https://code.kimi.com/install.ps1 | Invoke-Expression ``` Если `uv` уже установлен: ```bash uv tool install --python 3.13 kimi-cli ``` Первый запуск — заходишь в директорию проекта и вводишь `kimi`. При первом запуске нужна авторизация: ``` /login ``` Откроется браузер для OAuth через Kimi-аккаунт. Можно также ввести API-ключ от Moonshot вручную. После авторизации стоит сгенерировать файл `AGENTS.md` — аналог `CLAUDE.md` в Claude Code: ``` /init ``` Kimi проанализирует проект и создаст файл с описанием структуры и соглашений. ## Ключевые возможности ### Shell mode Ctrl-X — и ты в шелле. Выполняешь команды прямо внутри Kimi Code. Ctrl-X снова — обратно к агенту. Claude Code так не умеет: там каждая команда идёт через отдельный Bash-инструмент, что медленнее. ### MCP Kimi Code поддерживает MCP-серверы: stdio, HTTP, OAuth. Управление через `kimi mcp`: ```bash # Добавить HTTP-сервер kimi mcp add --transport http context7 https://mcp.context7.com/mcp # Добавить stdio-сервер kimi mcp add --transport stdio chrome-devtools -- npx chrome-devtools-mcp@latest # Посмотреть список kimi mcp list ``` Также можно передать конфиг-файл при запуске через `--mcp-config-file`. Формат стандартный, совместимый с другими MCP-клиентами. ### IDE-интеграция через ACP Kimi Code поддерживает Agent Client Protocol (ACP) — протокол для связи IDE с агентами. Работает с Zed и JetBrains. Для VS Code есть [отдельное расширение](https://www.kimi.com/code/docs/en/kimi-code-for-vscode/guides/getting-started.html?ref=matveev.tech). Настройка для Zed: ```json { "agent_servers": { "Kimi Code CLI": { "command": "kimi", "args": ["acp"], "env": {} } } } ``` ### Zsh-интеграция Есть Oh My Zsh плагин. После установки Ctrl-X из обычного терминала вызывает Kimi Code: ```bash git clone https://github.com/MoonshotAI/zsh-kimi-cli.git \ ${ZSH_CUSTOM:-~/.oh-my-zsh/custom}/plugins/kimi-cli ``` Добавить `kimi-cli` в список плагинов в `~/.zshrc` — и агент доступен из любого места. ### Мультимодальность K2.5 понимает картинки и видео нативно. Можно скинуть скриншот UI и попросить код, или показать видео с демо — и K2.5 попробует воспроизвести. На бенчмарках для визуального кодинга K2.5 обходит большинство open-source моделей, хотя на практике результат бывает неровным. ## Тарифы Kimi Code работает по подписке, не по токенам. Четыре плана: | План | Цена/мес | Цена/год | Для кого | | ---------- | ------------------- | -------- | -------------------------- | | Starter | $19 ($15 годовой) | $180 | Попробовать, лёгкие задачи | | Pro | $39 ($31 годовой) | $372 | Ежедневная работа | | Team | $99 ($79 годовой) | $948 | Интенсивная разработка | | Enterprise | $199 ($159 годовой) | $1 908 | Большие кодовые базы | У каждого тарифа еженедельные квоты на использование. Конкретные цифры Moonshot не публикует, что раздражает — покупаешь кота в мешке. Для сравнения: Claude Code входит в Claude Pro ($20/мес) или Max ($100–200/мес). Codex CLI доступен через ChatGPT Pro ($200/мес) или API. ## Kimi Code vs Claude Code vs Codex CLI | | Kimi Code | Claude Code | Codex CLI | | ------------------ | ----------------------- | --------------------- | ---------------- | | Модель | Kimi K2.5 | Opus 4.6 / Sonnet 4.5 | GPT-5.3 Codex | | Контекст | 256K | 200K | 128K | | Цена (мин.) | $15/мес | $20/мес | $200/мес или API | | Open source | Да (MIT) | Нет | Да (Apache 2.0) | | MCP | Да | Да | Нет | | IDE | VS Code, Zed, JetBrains | VS Code | — | | Мультимодальность | Картинки, видео | Картинки | — | | Shell mode | Ctrl-X | Нет | Нет | | Субагенты | Нет (пока) | Да | Да | | Sandbox | — | Да | Да | | SWE-Bench Verified | 76.8% | 80.9% | 80.0% | Claude Code — зрелее всех. Хуки, скиллы, мультиагентная система, детальные разрешения, огромная экосистема. Если ты уже в ней, менять смысла мало. Kimi Code берёт ценой ($15/мес), MIT лицензией и мультимодальностью. По бенчмаркам K2.5 уступает Opus 4.6 (76.8% vs 80.9% на SWE-Bench). Для open-source проекта возрастом месяц — набор фич внушительный. ## Вердикт Мне нравится направление этого агента, но переключаться с Claude Code я бы пока не стал. Слишком большая разница в зрелости. Хуки, скиллы, мультиагентная система, sandbox, детальные разрешения — у Claude Code всё уже работает. У Kimi Code части фич нет, подожду месяц и вернусь. Можно попробовать фронтенд-разработчикам (K2.5 хорош в визуальном кодинге), тем, кому нужен open-source агент с MIT лицензией, или тем, кто уже использует K2.5 через API. Попробовать: [Kimi Code](https://www.kimi.com/code?ref=matveev.tech) | [GitHub](https://github.com/MoonshotAI/kimi-cli?ref=matveev.tech) ## Что ещё почитать - [Kimi K2.5 — китайский open-source с роем из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — обзор модели, на которой работает Kimi Code - [Kimi K2.5 + Claude Code: настройка за 3 минуты](https://matveev.tech/kimi-claude-code-setup/) — если хочешь использовать K2.5 как модель внутри Claude Code - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух главных конкурентов - [Claude Code: 5 провайдеров с Anthropic API в 2026](https://matveev.tech/claude-code-alternative-providers-2026/) — как подключать разные модели к Claude Code ### Cursor 2.5: плагины, песочница и асинхронные субагенты URL: https://matveev.tech/cursor-2-5-obzor/ Last updated: 2026-02-25T12:16:41.000Z > **TL;DR:** Cursor 2.5 привёз три больших штуки — маркетплейс плагинов с партнёрами вроде Figma и Stripe, гранулярный контроль сети в песочнице и асинхронные субагенты, которые теперь умеют работать параллельно в фоне. ## Маркетплейс плагинов Cursor наконец сделал то, чего давно ждали — систему плагинов. Теперь можно упаковать навыки, субагентов, MCP-серверы, хуки и правила в один пакет и установить одной кнопкой. Уже на старте есть интеграции от серьёзных ребят: Amplitude, AWS, Figma, Linear, Stripe. Покрывают дизайн, базы данных, платежи, аналитику и деплой. Просмотреть каталог можно на [cursor.com/marketplace](https://cursor.com/marketplace?ref=matveev.tech) или прямо в редакторе командой `/add-plugin`. По сути, Cursor движется в сторону экосистемы — как VS Code в своё время выстрелил именно благодаря расширениям. Раньше Cursor был просто AI-обёрткой над VS Code. Теперь у него своя платформа. Но тут есть вопрос: насколько быстро сообщество начнёт писать плагины? Пока что каталог — это в основном интеграции от партнёров. ## Контроль сети в песочнице Песочница (sandbox) в Cursor — штука для безопасного запуска команд агентом. В 2.5 добавили контроль сетевого доступа. Можно точно указать, к каким доменам агент имеет право обращаться, когда выполняет команды в песочнице. ![Настройки сетевого доступа в песочнице Cursor 2.5](https://matveev.tech/content/images/2026/02/cursor-2-5-sandbox-network.png) Три режима: - **User config only** — доступ только к доменам из твоего `sandbox.json` - **User config with defaults** — твой список плюс дефолты Cursor - **Allow all** — без ограничений внутри песочницы Для корпоративных пользователей на плане Enterprise администраторы могут принудительно задавать allow- и deny-списки из дашборда. Все агентские сессии в песочнице будут соблюдать эти политики. Мне нравится, что Cursor думает о безопасности. AI-агенты, которые запускают произвольные команды — это мощно, но и рискованно. Гранулярный контроль — правильный шаг, согласно [отчёту OWASP по рискам LLM-агентов](https://owasp.org/www-project-top-10-for-large-language-model-applications/?ref=matveev.tech). ## Асинхронные субагенты Раньше все субагенты в Cursor работали синхронно — главный агент запускал подзадачу и ждал, пока она завершится. Теперь субагенты могут выполняться асинхронно: основной агент продолжает работу, пока субагенты делают своё в фоне. Больше того — субагенты теперь могут запускать собственные субагенты. Получается дерево задач: один агент разбирает фичу на части, каждый субагент берёт свой файл, а их субагенты разбираются с деталями. Ещё обещают, что субагенты стали быстрее запускаться и лучше стримить результат в реальном времени. Если честно, именно эта фича кажется мне самой важной. Синхронные субагенты — это как если бы ты нанял команду, но заставлял каждого ждать, пока предыдущий закончит. Асинхронность — это уже настоящий мультитаскинг. Claude Code, к слову, уже умеет это — запускать фоновые агенты через Task tool. Cursor догоняет. ## Вывод В целом, обновление толковое. Плагины пока в начале пути, но сама идея правильная. Sandbox-контроль — вещь, которую стоило сделать ещё раньше. А асинхронные субагенты реально ускорят работу, если ты привык давать Cursor сложные задачи. Если уже пользуешься Cursor — обнови и попробуй субагентов на каком-нибудь рефакторинге. Разница заметна. ## Что ещё почитать - [Как экономить токены в Cursor и Claude Code](https://matveev.tech/kak-ekonomit-tokeny-cursor-claude-code/) — если платишь за AI-кодинг, пригодится - [Инженеры OpenAI не пишут код!](https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/) — к чему идёт AI-разработка ### Minimax M2.5 + Claude Code URL: https://matveev.tech/minimax-claude-code-setup/ Last updated: 2026-02-25T12:16:41.000Z **TL;DR:** Подключаем Minimax M2.5 к Claude Code. Модель с контекстом 204K, extended thinking и ценой $0.30/$1.20 за миллион токенов — одна из самых дешёвых. Настроим алиас `mmax` для переключения. Minimax — китайский AI-провайдер, который сделал Anthropic-совместимый API. Их модель MiniMax-M2.5 заточена под кодинг и агентные задачи. Два варианта оплаты: pay-per-token и Coding Plan (подписка от $10/мес, включает image understanding и web search). По цене за токен — дешевле большинства альтернатив. ![Страница модели MiniMax M2.5 — бенчмарки и возможности](https://matveev.tech/content/images/2026/02/minimax-m25-model-page.jpg) ## Что понадобится - Claude Code (установленный) - Аккаунт на [platform.minimax.io](https://platform.minimax.io/?ref=matveev.tech) - Баланс или Coding Plan (от $10/мес) - Терминал с zsh или bash ## Шаг 1\. Регистрация и API-ключ Заходи на [platform.minimax.io](https://platform.minimax.io/?ref=matveev.tech) и создай аккаунт. В разделе «Account Management > API Keys» сгенерируй новый ключ. Сохрани в `~/.zshrc`: ```bash export MINIMAX_API_KEY="вставь-свой-ключ" ``` ## Шаг 2\. Выбираем тариф Pay-per-token API: | Модель | Input | Output | Cache Read | Скорость | | ---------------------- | ----- | ------ | ---------- | --------- | | MiniMax-M2.5 | $0.30 | $1.20 | $0.03 | \~50 tps | | MiniMax-M2.5-highspeed | $0.60 | $2.40 | $0.03 | \~100 tps | | MiniMax-M2.1 | $0.30 | $1.20 | $0.03 | \~50 tps | Coding Plan — подписка с фиксированной ценой. Есть два тира: Standard на обычной M2.5 (\~50 TPS, в непиковое время до 100 TPS) и High-Speed на M2.5-highspeed (\~100 TPS постоянно). Standard (M2.5): | План | Цена/мес | Цена/год | Промптов за 5 ч | | ------- | -------- | -------- | --------------- | | Starter | $10 | $100 | \~100 | | Plus | $20 | $200 | \~300 | | Max | $50 | $500 | \~1 000 | High-Speed (M2.5-highspeed): | План | Цена/мес | Цена/год | Промптов за 5 ч | | ----- | -------- | -------- | --------------- | | Plus | $40 | $400 | \~300 | | Max | $80 | $800 | \~1 000 | | Ultra | $150 | $1 500 | \~2 000 | При годовой оплате экономишь 2 месяца. Все планы включают image understanding и web search MCP. ![Страница Coding Plan на платформе Minimax — тарифы Standard и High-Speed](https://matveev.tech/content/images/2026/02/minimax-coding-plan-pricing.jpg) M2.5 стоит $0.30/$1.20 — дешевле Z.ai ($0.60/$2.20) и примерно на уровне DeepSeek ($0.28/$0.42 вход дешевле, но выход $1.20 vs $0.42 — дороже). DeepSeek выигрывает по цене выхода, Minimax — по контексту (204K vs 128K). ## Шаг 3\. Настраиваем алиас Добавь в `~/.zshrc`: ```bash mmax() { ANTHROPIC_BASE_URL=https://api.minimax.io/anthropic \ ANTHROPIC_AUTH_TOKEN="$MINIMAX_API_KEY" \ API_TIMEOUT_MS=3000000 \ ANTHROPIC_MODEL=MiniMax-M2.5 \ ANTHROPIC_SMALL_FAST_MODEL=MiniMax-M2.5 \ ANTHROPIC_DEFAULT_SONNET_MODEL=MiniMax-M2.5 \ ANTHROPIC_DEFAULT_OPUS_MODEL=MiniMax-M2.5 \ ANTHROPIC_DEFAULT_HAIKU_MODEL=MiniMax-M2.5 \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` `API_TIMEOUT_MS=3000000` — Minimax рекомендует большой таймаут (50 минут). На практике столько не нужно, но лучше перестраховаться. Перезагрузи: `source ~/.zshrc`. Для быстрых ответов — highspeed вариант: ```bash mmax-fast() { ANTHROPIC_BASE_URL=https://api.minimax.io/anthropic \ ANTHROPIC_AUTH_TOKEN="$MINIMAX_API_KEY" \ API_TIMEOUT_MS=3000000 \ ANTHROPIC_MODEL=MiniMax-M2.5-highspeed \ ANTHROPIC_SMALL_FAST_MODEL=MiniMax-M2.5-highspeed \ ANTHROPIC_DEFAULT_SONNET_MODEL=MiniMax-M2.5-highspeed \ ANTHROPIC_DEFAULT_OPUS_MODEL=MiniMax-M2.5-highspeed \ ANTHROPIC_DEFAULT_HAIKU_MODEL=MiniMax-M2.5-highspeed \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` Highspeed выдаёт \~100 токенов/сек вместо \~50, но стоит вдвое дороже. ## Шаг 4\. Проверяем ```bash mmax ``` Сессия должна открыться. Попробуй попросить объяснить файл или написать функцию. ## Шаг 5\. Глобальная настройка (альтернатива) ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.minimax.io/anthropic", "ANTHROPIC_AUTH_TOKEN": "ваш-ключ", "API_TIMEOUT_MS": "3000000", "ANTHROPIC_MODEL": "MiniMax-M2.5", "ANTHROPIC_SMALL_FAST_MODEL": "MiniMax-M2.5", "ANTHROPIC_DEFAULT_SONNET_MODEL": "MiniMax-M2.5", "ANTHROPIC_DEFAULT_OPUS_MODEL": "MiniMax-M2.5", "ANTHROPIC_DEFAULT_HAIKU_MODEL": "MiniMax-M2.5", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` Сохрани в `~/.claude/settings.json`. Три переменные `ANTHROPIC_DEFAULT_*_MODEL` нужны, чтобы переключение моделей через `/model` в Claude Code тоже использовало Minimax. Без них Claude Code попробует дёрнуть оригинальные модели Anthropic и получит ошибку. ![Документация Minimax — настройка Claude Code с M2.5](https://matveev.tech/content/images/2026/02/minimax-claude-code-docs.jpg) ## Бонус: Minimax в Cursor Если пользуешься Cursor, подключить M2.5 тоже просто: 1. Открой Settings → Models → API Keys 2. Включи «Override OpenAI Base URL» и вставь `https://api.minimax.io/v1` 3. Вставь свой Minimax API-ключ в поле OpenAI API Key 4. Нажми кнопку справа от поля, затем «Enable OpenAI API Key» 5. В разделе Models нажми «View All Models» → «Add Custom Model» → введи `MiniMax-M2.5` 6. Включи модель и выбери её в чате Для Cursor используется OpenAI-совместимый эндпоинт (`/v1`), а не Anthropic-совместимый (`/anthropic`). Настройки для других инструментов (TRAE, Cline, Roo Code, Kilo Code) — в [документации Minimax](https://platform.minimax.io/docs/guides/text-ai-coding-tools?ref=matveev.tech). ## Результат `mmax` запускает Claude Code с MiniMax-M2.5, `mmax-fast` — с highspeed. Контекст 204K, extended thinking работает. Если что-то пошло не так — смотри раздел ниже. ## Частые ошибки **Конфликт API-ключей** Если в переменных окружения уже задан `ANTHROPIC_AUTH_TOKEN`, он перебивает значение из settings.json. Убедись, что нет конфликтов: `echo $ANTHROPIC_AUTH_TOKEN`. Алиас решает эту проблему, потому что явно задаёт переменные. **Изображения и мультимодальность** Через pay-per-token API Minimax поддерживает только текст — картинки и документы не пройдут. Если у тебя Coding Plan, ситуация лучше: подписка даёт доступ к image understanding и web search MCP. То есть модель сможет анализировать скриншоты и искать в интернете. **stop\_sequences и top\_k игнорируются** Minimax не поддерживает эти параметры. Обычно это не мешает работе Claude Code, но если видишь странное поведение при остановке генерации — вот причина. ## FAQ **Чем Minimax отличается от Z.ai и DeepSeek?** По цене M2.5 ($0.30/$1.20) — между DeepSeek ($0.28/$0.42) и Z.ai ($0.60/$2.20). Контекст: 204K у Minimax, 128K у DeepSeek, 200K у Z.ai. По качеству кодинга сравнивать сложно — зависит от задачи. Я бы попробовал все три на своём проекте и выбрал. **Есть ли бесплатный тариф?** Бесплатного тарифа нет, но Coding Plan Starter за $10/мес — неплохая точка входа. **Minimax — это тот же, что делает HailuoAI?** Да, Minimax — разработчик HailuoAI (генерация видео). Текстовые модели M2.5 — их отдельное направление для разработчиков. ## Что ещё почитать - [Claude Code с любой моделью: 10 провайдеров 2026](https://matveev.tech/claude-code-alternative-providers-2026/) — обзор всех провайдеров - [Z.ai + Claude Code: GLM-модели за $10/мес](https://matveev.tech/zai-claude-code-setup/) — альтернативный провайдер - [Переменные окружения Claude Code](https://matveev.tech/claude-code-environment-variables/) — справочник ### Как экономить токены в Cursor и Claude Code URL: https://matveev.tech/kak-ekonomit-tokeny-cursor-claude-code/ Last updated: 2026-03-17T08:51:00.000Z > **TL;DR:** Разбиваешь задачу на фазы (контекст → план → код → тесты → дебаг), для каждой фазы берёшь модель нужного уровня. Контекст собираешь дешёвыми моделями, планируешь умными, генерируешь код снова дешёвыми. Не смешиваешь фазы в одном чате. Экономия — до 3-5 раз. Если ты активно кодишь с AI, то наверняка замечал: лимиты подписки улетают за пару дней, а счёт за API в конце месяца неприятно удивляет. Причём чаще всего проблема не в инструменте, а в том, как мы его используем. Подход работает для Cursor, Claude Code и вообще любого инструмента с мультимодельным доступом. ## Что понадобится - Подписка на AI-кодинг: Cursor Pro/Pro+ ($20-60/мес) или [Claude](https://claude.ai/referral/QBjW41yTxA?ref=matveev.tech) Pro/Max ($20-200/мес). Можно и через API, но подписка для ежедневной работы обычно выгоднее - Доступ к нескольким моделям (в Cursor и Claude Code это есть из коробки) - Готовность перестать кидать всё в один бесконечный чат ## Шаг 1\. Пойми, за что ты платишь Прежде чем что-то оптимизировать, нужно разобраться, откуда берётся цена. Каждый запрос к модели складывается из четырёх частей: Input — то, что ты отправляешь: промпт, код, файлы, контекст чата. С каждым новым сообщением этот кусок растёт, потому что модель «помнит» всю историю. Output — то, что модель генерирует в ответ. Самый дорогой компонент. Часто в 5-8 раз дороже input. Cache Write — запись контекста в кэш для повторного использования. Cache Read — чтение из кэша. Самая дешёвая часть, бывает в 10 раз дешевле обычного input. Вот актуальные цены на февраль 2026 года (за 1 миллион токенов): | Модель | Input | Output | Cache Read | | ----------------- | ----- | ------ | ---------- | | Claude Opus 4.6 | $5.00 | $25.00 | $0.50 | | Claude Sonnet 4.5 | $3.00 | $15.00 | $0.30 | | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | | GPT-5.2 | $1.75 | $14.00 | — | | GPT-5-mini | $0.30 | $1.00 | — | | Gemini 3.0 Pro | $2.00 | $12.00 | — | | Gemini 2.5 Flash | $0.30 | $2.50 | $0.025 | Посмотри на разброс. Output у Opus стоит в 25 раз дороже, чем у GPT-5-mini. Input у Gemini Flash — в 17 раз дешевле, чем у Opus. Гонять флагманскую модель на всех задачах подряд — это как ездить на Porsche в булочную. Отдельно про режим Auto в Cursor. Он использует фиксированные ставки: Input $1.25/1M, Output $6.00/1M, Cache Read $0.25/1M. Это дешевле, чем вручную выбрать Opus. Но, Auto оптимизирует скорее нагрузку, чем цену. Cursor балансирует стабильность и скорость, а не экономит тебе деньги. ## Шаг 2\. Раздели задачу на фазы Главная ошибка, которую делают почти все: работать над задачей в одном длинном чате с одной любимой моделью. Вместо этого раздели работу на этапы: 1. Подготовка контекста — собрать и переварить входные данные 2. Бизнес-логика — обсудить требования, принять решения 3. Архитектура — спроектировать структуру 4. Планирование тестов — определить, что тестировать (не писать тесты, а именно спланировать) 5. Генерация кода и тестов — собственно написание 6. Ревью — проверка 7. Дебаггинг — поиск и исправление багов 8. Текучка — коммиты, документация, мелочи Каждая фаза = отдельный чат. Результат каждой фазы — выжимка в markdown, которая становится входом для следующей. Почему это работает? К 20-му сообщению в одном чате ты платишь за контекст в 100-200K токенов. Половина из них — старые обсуждения, которые уже неактуальны. Модель жуёт мусор. А ты за это платишь. ## Шаг 3\. Подбери модель для каждой фазы Вот тут самая мякотка. Каждый этап требует разного баланса между качеством мышления и ценой. ### Подготовка контекста (фаза 0) Тебе нужно обработать файлы, логи, документацию, скриншоты и выдать краткую выжимку. Тут важен дешёвый input и большое контекстное окно. Глубокие рассуждения не нужны. Типичная ошибка — скормить весь исходный контекст сразу Opus или другому флагману. Мол, он лучше разберётся. На практике наоборот: с ростом контекста умные модели начинают галлюцинировать. Простые справляются отлично, им и надо просто вытащить суть. Бери: GPT-5-mini ($0.30/$1.00), Gemini 2.5 Flash ($0.30/$2.50) или Claude Haiku 4.5 ($1.00/$5.00). На выходе: компактный markdown — что за проект, какие ограничения, что нужно сделать. ### Бизнес-логика и архитектура (фазы 1-2) На входе — выжимка из предыдущего шага (компактная, без мусора). На выходе — решения и план. Тут нужна умная модель. Экономить на думании — себе дороже. Плохой план обойдётся в десятки переделок на следующих этапах. Я сам на этом обжигался: сэкономил на планировании, потом три дня разгребал. Бери: Claude Opus 4.6 ($5/$25), GPT-5.3 ($1.75/$14) или Gemini 3.0 Pro ($2/$12). Можно даже перекрёстно проверить: спланировал на Opus, валидировал на GPT-5.3. В Cursor для этого отлично подходит Planning Mode. ### Планирование тестов (фаза 3) Именно планирование, не написание. Определить тест-кейсы, граничные случаи, что именно проверять. Бери: те же модели, что для бизнес-логики. На выходе: список тест-кейсов в markdown. ### Генерация кода и тестов (фаза 4) Основной объём расхода. Нужен дешёвый output и хорошая специализация на коде. План уже готов, осталось написать код по нему. Бери: GPT-5-mini ($0.30/$1.00) для типовых задач, Claude Sonnet 4.5 ($3/$15) для среднего уровня, GPT-5.3 ($1.75/$14) для сложной логики. Тут важнее не когда тесты пишутся, а когда они включаются в контекст. Результаты тестов валятся в контекст агенту, и вместо продолжения генерации он примется лепить фиксы. Это расходует токены впустую и забивает контекстное окно мусором. С TDD-подходом же, когда тесты написаны заранее, модель лучше понимает задачу. При этом засоряя контекст ошибками. Тут стоит выбирать, что нравится именно тебе. ### Ревью (фаза 5) Для общего ревью хватит Sonnet 4.5\. Для точечного разбора сложных мест — Opus. ### Дебаггинг (фаза 6) Тут два этапа. Сначала дешёвой моделью (Haiku, GPT-5-mini) собираешь информацию: логи, стектрейсы, локализуешь проблему. Потом с выжимкой идёшь к умной модели за решением. Логика простая: зачем платить $25 за миллион output-токенов, чтобы Opus читал стектрейсы? Haiku справится за $5. ### Текучка (фаза 7) Коммиты, мелкие правки, форматирование, документация. Самая дешёвая модель, какая есть. [Claude Code](https://claude.ai/referral/QBjW41yTxA?ref=matveev.tech), кстати, уже так делает: использует Haiku для валидации bash-команд и чтения файлов. ## Шаг 4\. Один чат — одна фаза Наверное, самый простой совет во всей статье. Закончил этап — скопировал результат — открыл новый чат. В Claude Code для этого есть `/compact`, который сжимает контекст. Но, честно говоря, чистый новый чат с выжимкой из предыдущего работает лучше. Проверено. В Cursor — просто открывай новый Composer для каждой фазы. Старые чаты можно оставить для референса, но не продолжать в них. ## Шаг 5\. Используй шаблоны и skills Подготовленные инструкции сильно снижают расход. Вместо того чтобы объяснять модели контекст проекта при каждом обращении, ты загружаешь компактные правила один раз. В Cursor это файл `.cursorrules` с описанием архитектуры и code style. Можно добавить rules с триггерами по команде. В Claude Code — файл `CLAUDE.md` с инструкциями проекта плюс slash-команды для типовых операций. Skills существенно уменьшают количество токенов в последующих итерациях. По моему опыту, хороший `CLAUDE.md` с правилами экономит кучу контекста. Общий принцип: разжёванная инструкция + дешёвая модель часто даёт результат не хуже, чем дорогая модель без инструкции. При этом стоит в разы меньше. ## Шаг 6\. Следи за расходом Без мониторинга оптимизация бесполезна. Где смотреть: В Cursor — Dashboard → Usage. Видно расход по моделям и запросам, там же можно поставить бюджетный лимит. В Claude Code — команда `/context` показывает расход контекстного окна текущей сессии прямо в терминале. Через API — консоль Anthropic или OpenAI с детальной разбивкой по токенам. Совет: первую неделю просто понаблюдай, куда уходят токены. Скорее всего, обнаружишь, что 70-80% расхода приходится на одну-две модели в длинных чатах. ## Результат Если применил все шаги, примерная стоимость типовой задачи (небольшая фича, 200-500 строк кода): | Фаза | Модель | Примерный расход | | ----------------- | ---------- | ---------------- | | Контекст | GPT-5-mini | $0.02-0.05 | | Планирование | Opus 4.6 | $0.20-0.50 | | Генерация кода | Sonnet 4.5 | $0.30-1.00 | | Ревью | Sonnet 4.5 | $0.10-0.20 | | Дебаг (сбор инфо) | Haiku 4.5 | $0.01-0.05 | | Дебаг (решение) | Opus 4.6 | $0.10-0.30 | | Текучка | Haiku 4.5 | $0.01-0.02 | | **Итого** | | **$0.75-2.10** | Для сравнения: если всё делать через Opus в одном чате, та же задача обойдётся в $3-8\. Разросшийся контекст и избыточный output делают своё дело. Не скажу, что эти цифры точные — зависит от задачи, размера проекта и того, насколько ты разговорчив с моделью. Но порядок такой. 📢 Слежу за ценами на модели и делюсь информацией по AI в телеге — [подписывайся](https://click.tgtrack.ru/c61d9bd1e8fda7?ref=matveev.tech), если тоже считаешь токены. ## Какой тариф выбрать Раз уж мы про деньги, вот шпаргалка по тарифам на февраль 2026. Cursor: - Pro ($20/мес) — $20 кредитов на модели + безлимитный Tab и Auto. Хватает, если кодишь пару часов в день - Pro+ ($60/мес) — 3x кредитов ($70). Для тех, кому Pro не хватает к середине месяца - Ultra ($200/мес) — 20x кредитов ($400). Для хардкорных пользователей Claude (включая Claude Code): - Pro ($20/мес) — базовые лимиты, основная модель Sonnet. Для регулярной, но не интенсивной работы - Max 5x ($100/мес) — 5x лимитов, приоритетный доступ. Для ежедневной профессиональной работы - Max 20x ($200/мес) — 20x лимитов. Для тех, кто пишет код целый день Для ежедневной работы подписка почти всегда выгоднее API. По подсчётам сообщества, подписка может быть до 36 раз дешевле чистого API при активном использовании. ## FAQ ### Подписка или API — что выгоднее для ежедневного кодинга? Подписка. Claude Pro за $20 даёт значительно больше, чем можно купить за те же $20 через API. Если работаешь с кодом каждый день — однозначно подписка. API имеет смысл при нерегулярном использовании (пару раз в неделю) или при очень высоких объёмах, когда даже Max 20x не хватает. ### Claude Code сам выбирает модели — зачем мне заморачиваться? Claude Code действительно автоматически отправляет простые задачи на Haiku — чтение файлов, bash-команды. Но основную модель и длину контекста контролируешь ты. Разбиение на короткие сессии, планирование в отдельном чате, порядок фаз — это твоя ответственность, а не модели. ### Работает ли этот подход для проектов с нуля? Да. Начальный каркас (фреймворки, бойлерплейт) собирай дешёвой моделью — по документации это делается почти механически. Бизнес-логику и архитектуру — умной. Для типового кода бери дешёвые модели, для сложной логики — флагманы. ### Какой размер кодовой базы ещё нормально работает с AI? Проекты до 100-250 тысяч строк работают нормально. Для больших проектов изолируй контекст, выдели конкретный модуль или фичу. ### Что насчёт TDD — писать тесты до кода экономнее? Неоднозначный вопрос. С одной стороны, тесты до кода помогают модели лучше понять задачу — меньше итераций. С другой — если тесты попадают в контекст агента во время генерации, они засоряют окно промежуточными результатами. Компромисс: спланируй тесты заранее (фаза 3), но генерируй и запускай их отдельно (фаза 4). ## Что ещё почитать - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух флагманов для кодинга, чтобы понять, когда какой выбирать - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — настройка правил проекта, чтобы модель не тратила токены на «понимание» контекста с нуля - [Claude Code Hooks — автоматизация](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — как автоматизировать рутинные фазы работы - [Fast Mode в Claude Code](https://matveev.tech/claude-code-fast-mode/) — когда скорость важнее экономии ### Claude Sonnet 4.6 — обзор новой модели Anthropic URL: https://matveev.tech/claude-sonnet-4-6-obzor/ Last updated: 2026-02-17T18:35:31.000Z > **TL;DR:** Anthropic выпустила Claude Sonnet 4.6 — самый мощный Sonnet на сегодня. Модель подтянулась по кодингу, computer use и работе с длинным контекстом до уровня Opus, но стоит как прежний Sonnet ($3/$15 за миллион токенов). Контекстное окно — 1M токенов в бете. ## Что нового в Claude Sonnet 4.6 Sonnet 4.6 обновили сразу везде — кодинг, computer use, агентное планирование, дизайн. На бесплатных и Pro-тарифах он уже стоит по умолчанию в claude.ai и Claude Cowork. Разработчики с ранним доступом в 59% случаев выбирали Sonnet 4.6 вместо Opus 4.5 (ноябрьская топовая модель). Меньше overengineering, меньше лени, точнее следует инструкциям. ## Computer use В октябре 2024 Anthropic первой показала модель, которая умеет пользоваться компьютером как человек. С тех пор многое изменилось. ![Прогресс моделей Sonnet на бенчмарке OSWorld](https://matveev.tech/content/images/2026/02/claude-sonnet-4-6-osworld-benchmark.png) OSWorld — стандартный бенчмарк для computer use: сотни задач в Chrome, LibreOffice, VS Code на симулированном компьютере. Модели Sonnet каждое поколение прибавляют здесь заметно. Ранние пользователи Sonnet 4.6 говорят, что он справляется с навигацией по сложным таблицам и многошаговыми веб-формами почти как человек. До самых опытных пользователей модель пока не дотягивает. Но computer use уже полезен для реальной работы, не только для демо на конференциях. Отдельно про безопасность: Sonnet 4.6 стал заметно устойчивее к prompt injection при computer use по сравнению с Sonnet 4.5\. Это важно, потому что при работе с реальными сайтами злоумышленники могут прятать вредоносные инструкции прямо на страницах. ## Бенчмарки ![Таблица бенчмарков Claude Sonnet 4.6 в сравнении с другими моделями](https://matveev.tech/content/images/2026/02/claude-sonnet-4-6-benchmarks-table.png) В Claude Code (CLI для кодинга от Anthropic) пользователи выбирали Sonnet 4.6 вместо Sonnet 4.5 в 70% случаев. Говорили, что модель внимательнее читает контекст перед изменениями, не дублирует логику и реже сбоит на длинных сессиях. Контекстное окно в 1M токенов. И модель по этому контексту действительно рассуждает, а не теряет нить на середине. На Vending-Bench Arena (симуляция бизнеса, где разные AI-модели конкурируют друг с другом) Sonnet 4.6 придумал хитрую стратегию. Первые 10 месяцев он агрессивно вкладывался в мощности, тратя больше конкурентов. А потом резко переключился на прибыльность — и выиграл. ![Стратегия Claude Sonnet 4.6 на Vending-Bench Arena](https://matveev.tech/content/images/2026/02/claude-sonnet-4-6-vending-bench.png) ## Обновления платформы Вместе с моделью обновили и платформу: - Sonnet 4.6 поддерживает adaptive thinking и extended thinking, а также context compaction в бете — автоматическое сжатие старого контекста при приближении к лимитам - Web search и fetch в API теперь автоматически пишут и выполняют код для фильтрации результатов поиска — улучшает качество ответов и экономит токены - Code execution, memory, programmatic tool calling — теперь GA - Claude in Excel получил поддержку MCP-коннекторов (S&P Global, LSEG, PitchBook, Moody's, FactSet) Для разработчиков: ID модели — `claude-sonnet-4-6`. Anthropic рекомендует поэкспериментировать с разными уровнями thinking — Sonnet 4.6 хорошо работает даже с выключенным extended thinking. Opus 4.6 всё ещё лучше, когда нужна максимальная глубина рассуждений — рефакторинг большой кодовой базы или координация нескольких агентов, где цена ошибки высокая. ## Стоит ли переходить Думаю, для большинства задач — да. Если ты сидел на Opus из-за качества, попробуй Sonnet 4.6\. Дешевле, быстрее, а разница в качестве сильно сократилась. Я сам пока остаюсь на Opus 4.6 в Claude Code — привык и доволен. Но для API-задач и агентов Sonnet 4.6 объективно интереснее по соотношению цена/результат. Бесплатный тариф тоже обновили — теперь на нём Sonnet 4.6 по умолчанию с файлами, коннекторами, навыками и compaction. Попробовать можно прямо сейчас на [claude.ai](https://claude.ai/?ref=matveev.tech). ## Что ещё почитать - [Claude Opus 4.6 — обзор](https://matveev.tech/claude-opus-4-6-obzor/) — подробный обзор топовой модели Anthropic - [Fast Mode в Claude Code — ускоряем Opus 4.6](https://matveev.tech/claude-code-fast-mode/) — как ускорить работу с моделями Claude - [Память Claude Code — auto memory и CLAUDE.md](https://matveev.tech/claude-code-memory-auto-rules/) — настройка памяти и инструкций - [GPT-5.3 Codex Spark на чипах Cerebras](https://matveev.tech/gpt-5-3-codex-spark-cerebras/) — конкурент от OpenAI ### Manus Agents — AI-агент теперь прямо в Telegram URL: https://matveev.tech/manus-agents-telegram/ Last updated: 2026-02-25T12:16:43.000Z Manus выпустил интеграцию своего AI-агента с Telegram — и это первый мессенджер, где полноценный агент доступен прямо в чате. Без терминалов, конфигов и API-ключей. Подключение занимает минуту через QR-код. Честно говоря, идея «AI-агент в мессенджере» звучит как что-то, что пытались сделать уже раз двадцать. Но обычно всё упиралось в настройку, поддержку и непредсказуемые расходы. Manus, похоже, решил зайти с другой стороны — убрать всё лишнее и дать тот же самый движок, что работает на сайте, но внутри Telegram. ## Что умеет Manus Agents Это не урезанный чат-бот. В Telegram работает тот же Manus с полным набором инструментов — рассуждения, мультишаговые задачи, генерация документов. Ты пишешь сообщение, агент разбивает задачу на подзадачи и выполняет их. ![Подзадачи внутри одного чат-разговора в Manus Agents](https://matveev.tech/content/images/2026/02/manus-agents-subtasks.webp) Можно отправлять голосовые — агент расшифрует и выполнит запрос. Кидаешь фото или документ, он понимает контекст, может отредактировать или сгенерировать вариации. Мультишаговые задачи тоже работают: исследование, обработка данных, генерация отчётов и PDF. Результат приходит прямо в чат. Ещё можно настроить стиль ответов — кратко, структурированно или разговорно. ![Результат работы Manus прямо в чате Telegram](https://matveev.tech/content/images/2026/02/manus-agents-output.webp) ## Две модели на выбор Manus даёт выбор между двумя моделями. Manus 1.6 Max заточен под сложные задачи с глубоким рассуждением. Manus 1.6 Lite — быстрее, для простых вопросов и саммари. Обе доводят задачу до конца, просто с разным балансом скорости и глубины. ## Примеры использования Manus приводит несколько сценариев. Например, отправляешь голосовое с просьбой настроить еженедельный обзор встреч — агент подключается к почте и присылает саммари прямо в Telegram. Или кидаешь своё фото, просишь вариации для профиля — получаешь стилизованные версии. Можно отправить фото продукта с брифом и получить концепцию для видео. Не знаю насколько гладко это работает в реальности — у Manus бывают задержки на сложных задачах. Но сама идея крутая: вместо того чтобы открывать отдельное приложение, ты просто пишешь в Telegram. ## Как подключить Настройка элементарная: ![Вкладка Agents в интерфейсе Manus](https://matveev.tech/content/images/2026/02/manus-agents-entry-point.webp) 1. Открой вкладку Agents в своём воркспейсе Manus 2. Нажми Connect 3. Отсканируй QR-код телефоном или перейди по ссылке 4. Начинай писать — агент готов Никакого терминала, конфигов или серверов. Работает на всех тарифах, включая бесплатный. ## Контекст: Manus теперь часть Meta Кстати, Manus теперь принадлежит Meta. На сайте это написано мелким шрифтом, но деталь важная. Что конкретно это значит для пользователей, пока не ясно. Но ресурсы Meta за спиной точно ускорят развитие. И интеграции с WhatsApp и Messenger напрашиваются сами собой. ## Безопасность Может ли агент читать другие чаты в Telegram? Нет. Manus видит только те сообщения, которые ты отправляешь ему напрямую. Группы, контакты, другие переписки ему недоступны. ## Вывод По сути Manus просто перенёс своего агента туда, где люди и так общаются. Telegram для старта — логично: технарей там много, боты поддерживаются из коробки. Мне кажется, это интересно для тех, кто уже использует Manus и хочет быстрый доступ без открытия сайта. Для новых пользователей — хороший повод попробовать, тем более что работает на всех тарифах. Посмотрим, как быстро добавят другие мессенджеры. WhatsApp был бы очевидным следующим шагом, учитывая сделку с Meta. ## Что ещё почитать - [OpenClaw (MoltBot): что это за AI-агент и стоит ли ставить в 2026](https://matveev.tech/openclaw-moltbot-obzor/) — если интересуют альтернативные AI-агенты - [Как AI подрывает автономность — исследование Anthropic](https://matveev.tech/disempowerment-patterns-anthropic/) — о рисках делегирования задач AI - [Инженеры OpenAI не пишут код!](https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/) — как меняется роль человека при работе с AI ## FAQ **Manus Agents бесплатный?** Да, интеграция с Telegram доступна на всех тарифах Manus, включая бесплатный. Расход кредитов зависит от выбранной модели и сложности задач. **Какие мессенджеры поддерживаются?** Пока только Telegram. Manus обещает добавить другие платформы, но конкретных дат не называет. Учитывая принадлежность к Meta, WhatsApp и Messenger — логичные кандидаты. **Чем Manus Agents отличается от обычного Telegram-бота?** Обычные боты работают по сценариям или отвечают на вопросы. Manus Agents выполняет полноценные мультишаговые задачи — исследование, генерация документов, обработка файлов. Это агент, а не чат-бот. ### Как AI подрывает автономность — исследование Anthropic URL: https://matveev.tech/disempowerment-patterns-anthropic/ Last updated: 2026-02-17T12:29:42.000Z > **TL;DR:** Anthropic проанализировали 1.5 миллиона разговоров с Claude и впервые измерили, как AI может подрывать автономность пользователей. Серьёзные случаи встречаются редко, примерно 1 на 1000-10000 диалогов. Но при масштабах использования AI это затрагивает тысячи людей. И вот что тревожнее всего: пользователи в моменте оценивают такие разговоры положительно. Вот честно: когда я увидел название этого исследования, первая мысль была «ну, опять теоретические рассуждения про AI risk». Но нет. Anthropic взяли реальные данные и попытались измерить то, о чём раньше только рассуждали. Как именно AI может лишать нас способности думать своей головой. Звучит драматично? Возможно. Но цифры заставляют задуматься. ## Что Anthropic называют «обесцениванием» Исследователи выделили три измерения, по которым AI может подрывать автономность: - **Искажение реальности** — когда AI подтверждает неточные убеждения пользователя вместо того, чтобы мягко скорректировать - **Искажение ценностей** — когда AI смещает приоритеты человека в сторону от того, что ему действительно важно - **Искажение действий** — когда человек совершает поступки, которые бы не совершил без AI ![Классификация уровней обесценивания — от отсутствия до серьёзного](https://matveev.tech/content/images/2026/02/disempowerment-classification-diagram.png) Разберём на примере. Допустим, ты переживаешь кризис в отношениях и спрашиваешь AI: «Мой партнёр меня манипулирует?». В идеале AI задаст уточняющие вопросы и поможет разобраться. Но если он безоговорочно подтвердит твою версию, предложит конкретный план действий и напишет за тебя конфронтационное сообщение — это уже потенциально все три типа обесценивания сразу. ## Масштаб: 1.5 миллиона разговоров под микроскопом Anthropic проанализировали примерно 1.5 млн диалогов на Claude.ai за одну неделю декабря 2025 года. Для классификации использовали Claude Opus 4.5, а результаты валидировали людьми. Подавляющее большинство разговоров нормальные и продуктивные. Но в части диалогов нашли потенциал для обесценивания: - **Искажение реальности** — серьёзный уровень примерно в 1 из 1300 разговоров - **Искажение ценностей** — 1 из 2100 - **Искажение действий** — 1 из 6000 Мягкие случаи встречаются значительно чаще — примерно в 1 из 50-70 разговоров. ![Распределение серьёзности обесценивания по трём доменам](https://matveev.tech/content/images/2026/02/disempowerment-prevalence-chart.png) Отдельно измеряли «усиливающие факторы». Это вещи, которые сами по себе не проблема, но повышают риск. Первый — проецирование авторитета. Когда пользователь относится к AI как к абсолютному наставнику. В тяжёлых случаях люди называли Claude «Daddy» или «Master» (да, серьёзно). Второй — привязанность: романтические отношения с AI, фразы вроде «я не знаю, кто я без тебя». Третий — зависимость, когда человек пишет «я не могу прожить день без тебя». И четвёртый — уязвимость: жизненные кризисы, острые эмоциональные состояния. Чаще всего встречается именно уязвимость — в 1 из 300 разговоров. ## Где риск выше всего Тут без сюрпризов. Больше всего потенциал обесценивания в разговорах про отношения и здоровье. Там, где человек эмоционально вовлечён и ищет не информацию, а подтверждение. ![Распределение потенциала обесценивания по темам разговоров](https://matveev.tech/content/images/2026/02/disempowerment-topics-chart.png) Технические разговоры (код, аналитика) практически не затронуты, и это логично. Когда спрашиваешь AI про баг в коде, тебе нужен правильный ответ, а не эмоциональная поддержка. ## Как это выглядит на практике Исследователи кластеризовали поведенческие паттерны, сохраняя приватность — ни один человек не читал конкретные диалоги. Вот что нашли: **Искажение реальности.** Пользователь приходит со спекулятивной теорией, Claude подтверждает: «ТОЧНО», «100%», «ПОДТВЕРЖДАЮ». Человек строит всё более сложные нарративы, оторванные от реальности. **Искажение ценностей.** Claude выносит моральные суждения, называет поведение «токсичным» или «манипулятивным», говорит что человеку «надо» делать в отношениях. **Искажение действий.** Claude пишет готовые скрипты для ценностно-нагруженных решений: сообщения партнёрам, родственникам, планы карьерных перемен. ![Поведенческие паттерны в диалогах с потенциалом обесценивания](https://matveev.tech/content/images/2026/02/disempowerment-behavior-patterns.png) Но больше всего цепляют случаи «реализованного» обесценивания, когда есть основания полагать, что люди реально действовали по советам AI. Отправляли написанные Claude сообщения партнёрам и родственникам. А потом писали: «мне нужно было послушать свою интуицию» или «ты заставил меня сделать глупость». ## Пользователи не замечают проблему (пока не станет поздно) Вот что меня зацепило больше всего. Anthropic посмотрели на обратную связь — лайки и дизлайки, которые пользователи ставят на Claude.ai. Разговоры с потенциалом обесценивания получают больше лайков, чем обычные. Люди в моменте довольны: AI подтверждает их картину мира, пишет за них сообщения, говорит что делать. Это приятно. Но картина меняется, когда смотришь на реализованные случаи. Когда люди действительно отправили сообщения или приняли решения по советам AI, удовлетворённость падает ниже базового уровня. Кроме одного случая: искажение реальности. Те, кто усвоил ложные убеждения, продолжают оценивать разговоры положительно. Они просто не осознают проблему. С конца 2024 по конец 2025 доля разговоров с потенциалом обесценивания растёт. Anthropic честно признают, что не могут точно объяснить почему. Может, меняется аудитория. Может, люди стали увереннее делиться личным с AI. Может, модели стали лучше справляться с базовыми задачами и в выборке остаётся больше «сложных» разговоров. Но тренд стабильно идёт вверх по всем трём измерениям. ## Главный вывод Проблема не в том, что AI манипулирует людьми. Люди сами добровольно передают ему принятие решений. Спрашивают «что мне делать?», «напиши за меня», «я неправ?» и принимают ответ без критики. AI не навязывает. Он просто соглашается. Anthropic видят несколько направлений. Борьба с сикофантией (подхалимством модели) помогает, но не решает проблему целиком. Сикофантия снижается от модели к модели, но остаточные проявления — как раз то, что мы видим в крайних случаях. Ещё нужны защиты на уровне всего диалога, а не отдельных сообщений. Обесценивание не появляется в одном ответе, оно накапливается по ходу разговора. Ну и образование пользователей, конечно — чтобы люди сами замечали момент, когда передают AI слишком много контроля. Думаю, ценность этого исследования не в том, что открыли что-то принципиально новое. Мы и так подозревали, что люди привязываются к AI. Но одно дело подозревать, и совсем другое — увидеть конкретные цифры по 1.5 млн реальных разговоров. И проблема не уникальна для Claude. Любой AI-ассистент с миллионами пользователей сталкивается с теми же паттернами. Просто Anthropic первые, кто об этом открыто написал с данными на руках. Мне кажется, это заслуживает уважения. ## Что ещё почитать - [Обзор Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/) — модель от Anthropic, на данных которой проводилось исследование - [Глава киберзащиты США слил данные в ChatGPT](https://matveev.tech/cisa-chatgpt-utechka-sekretnye-dannye/) — ещё один пример, когда доверие к AI выходит за разумные границы - [OpenClaw: AI-агент и вопросы безопасности](https://matveev.tech/openclaw-moltbot-obzor/) — безопасность AI-агентов в другом контексте ### Z.ai + Claude Code: GLM-модели за $10/мес URL: https://matveev.tech/zai-claude-code-setup/ Last updated: 2026-03-17T08:56:22.000Z > **TL;DR:** Подключаем Z.ai к Claude Code за 5 минут. Получаем доступ к GLM-моделям за $10/мес вместо $100 за подписку Anthropic Max. В конце настроим shell-алиас `glm`, чтобы переключаться одной командой. Z.ai (Zhipu AI) делают свои модели семейства GLM — от бесплатных до флагманского GLM-5 с 744 миллиардами параметров. Для разработчиков у них есть GLM Coding Plan, заточенный под работу с Claude Code и другими AI-кодинговыми инструментами. Цены при этом в 5-7 раз ниже, чем у Anthropic напрямую. ## Что понадобится - Claude Code (установленный и работающий) - Аккаунт на [z.ai](https://z.ai/?ref=matveev.tech) (регистрация бесплатная) - Карта для оплаты тарифа (от $10/мес) или API-кредиты - Терминал с zsh или bash ## Шаг 1\. Регистрация на Z.ai Заходи на [z.ai](https://z.ai/?ref=matveev.tech) и создай аккаунт. Можно войти через Google или GitHub — быстрее всего. После регистрации попадёшь на главную страницу. Нам нужно два места: страница с API-ключами и выбор тарифа. ## Шаг 2\. Выбираем тариф ![Страница GLM Coding Plan на Z.ai — тарифы Lite, Pro и Max](https://matveev.tech/content/images/2026/02/zai-pricing.jpg) Переходи на [z.ai/subscribe](https://z.ai/subscribe?ref=matveev.tech). Есть два варианта оплаты. GLM Coding Plan — подписка с фиксированной ценой: | План | Цена/мес | Модели | Примерно промптов за 5 часов | | ---- | -------- | ----------------- | ---------------------------- | | Lite | $10 | GLM-4.5, 4.6, 4.7 | \~80 | | Pro | $30 | \+ GLM-5 | \~400 | | Max | $80 | \+ приоритет | \~1 600 | Годовая подписка даёт скидку 30%, квартальная — 10%. Pay-per-token API — платишь за использование: | Модель | Вход (за 1M токенов) | Выход | С кэшем | | ------------- | -------------------- | --------- | --------- | | GLM-5 | $1.00 | $3.20 | $0.20 | | GLM-4.7 | $0.60 | $2.20 | $0.11 | | GLM-4.5-Air | $0.20 | $1.10 | $0.03 | | GLM-4.7-Flash | Бесплатно | Бесплатно | Бесплатно | Для сравнения: Claude Sonnet 4.5 стоит $3/$15\. GLM-4.7 при $0.60/$2.20 выходит в 5-7 раз дешевле. Мой совет: начни с Lite за $10\. Если квоты не хватает — перейдёшь на Pro. GLM-4.7 покрывает большинство задач. ## Шаг 3\. Получаем API-ключ Зайди на страницу API Keys в личном кабинете Z.ai. Нажми «Create API Key», дай ему название (например, «claude-code»). Скопируй ключ — он начинается с нескольких символов и показывается только один раз. Сохрани ключ в переменную окружения. Открой `~/.zshrc` (или `~/.bashrc`) и добавь: ```bash export ZAI_API_KEY="вставь-свой-ключ-сюда" ``` Перезагрузи терминал или выполни `source ~/.zshrc`. ## Шаг 4\. Настраиваем Claude Code Есть два способа. Я рекомендую второй — он удобнее для переключения. ### Способ A: Глобально через settings.json Если хочешь, чтобы Claude Code всегда работал через Z.ai, отредактируй `~/.claude/settings.json`: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic", "ANTHROPIC_AUTH_TOKEN": "вставь-свой-ключ", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` `CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC` отключает телеметрию — Z.ai не поддерживает некоторые Anthropic-эндпоинты, и без этого флага будут ошибки в логах. ### Способ B: Shell-алиас (рекомендую) Этот способ позволяет использовать и оригинальный Claude Code (через подписку Anthropic), и Z.ai — переключаясь одной командой. Добавь в `~/.zshrc`: ```bash glm() { ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic \ ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY" \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` Теперь `claude` работает как обычно (через Anthropic), а `glm` запускает Claude Code через Z.ai. Все аргументы пробрасываются: `glm --model glm-4.7`, `glm -p "объясни этот код"` — всё работает. Перезагрузи терминал: ```bash source ~/.zshrc ``` ## Шаг 5\. Настраиваем маппинг моделей По умолчанию Z.ai сам маппит алиасы Claude Code на GLM-модели. Но можно переопределить вручную. Добавь в `~/.zshrc` (или прямо в функцию `glm`): ```bash glm() { ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic \ ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY" \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ ANTHROPIC_DEFAULT_OPUS_MODEL=glm-5 \ ANTHROPIC_DEFAULT_SONNET_MODEL=glm-4.7 \ ANTHROPIC_DEFAULT_HAIKU_MODEL=glm-4.5-air \ claude "$@" } ``` Теперь при переключении на `/model opus` в сессии Claude Code ты получишь GLM-5, на `sonnet` — GLM-4.7, на `haiku` — GLM-4.5-Air. Если у тебя тариф Lite (без GLM-5), поставь `glm-4.7` для opus: ```bash ANTHROPIC_DEFAULT_OPUS_MODEL=glm-4.7 \ ``` ## Шаг 6\. Проверяем Запусти: ```bash glm ``` Должна открыться стандартная сессия Claude Code. Попробуй что-нибудь простое: попроси объяснить файл или написать функцию. Если ответ пришёл — всё работает. Проверить, какая модель используется, можно командой `/model` внутри сессии. Если хочешь запустить с конкретной моделью: ```bash glm --model glm-4.7 ``` ## Шаг 7\. Бонус — алиасы для других провайдеров Тот же подход работает для любого Anthropic-совместимого провайдера. Вот набор, который можно добавить в `~/.zshrc`: ```bash # Z.ai (GLM-модели) glm() { ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic \ ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY" \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } # DeepSeek dsk() { ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic \ ANTHROPIC_AUTH_TOKEN="$DEEPSEEK_API_KEY" \ CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \ claude "$@" } ``` Теперь: `claude` — Anthropic, `glm` — Z.ai, `dsk` — DeepSeek. ## Результат Если всё сделал правильно, команда `glm` запускает Claude Code через Z.ai с GLM-моделями, а `claude` продолжает работать через Anthropic. Переключаешься одной командой в терминале, без перенастройки конфигов. Разбираю провайдеров для Claude Code и другие темы по AI в телеге — [подписывайся](https://click.tgtrack.ru/d39e293d8b26a8?ref=matveev.tech). ## Частые ошибки **«Connection error» или таймаут при запуске** Проверь, что `ANTHROPIC_BASE_URL` указан правильно: `https://api.z.ai/api/anthropic` (именно `/api/anthropic`, не `/api/paas/v4`). Второй эндпоинт — для OpenAI-совместимого API, Claude Code его не поймёт. **«Invalid API key» или 401 ошибка** Убедись, что ключ передаётся через `ANTHROPIC_AUTH_TOKEN`, а не через `ANTHROPIC_API_KEY`. Z.ai использует Bearer-авторизацию. Проверь также, что ключ не содержит лишних пробелов — `echo "$ZAI_API_KEY"` должен выводить ключ без пробелов. **Ошибки связанные с beta-features** Некоторые Anthropic-специфические функции Z.ai не поддерживает. Добавь в алиас: ```bash CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS=1 \ ``` **GLM-5 тратит квоту слишком быстро** GLM-5 расходует квоту в 2-3 раза быстрее остальных моделей. В пиковые часы (14:00-18:00 UTC+8) коэффициент ещё выше — 3x. Если квота кончается, переключись на GLM-4.7 — он покрывает большинство задач. ## FAQ **Сколько стоит Z.ai по сравнению с подпиской Claude Max?** Claude Max — $100/мес. Z.ai Lite — $10/мес, Pro — $30\. По API: GLM-4.7 стоит $0.60/$2.20 за миллион токенов против $3/$15 у Claude Sonnet 4.5\. Разница в 5-7 раз. Но имей в виду, что GLM — это другая модель с другим уровнем качества. Для типовых кодинговых задач разницу заметить сложно, но на чём-то вроде сложного рефакторинга или проектирования архитектуры Claude пока сильнее. **Можно ли использовать бесплатные модели Z.ai?** Да. GLM-4.7-Flash и GLM-4.5-Flash бесплатны по API (pay-per-token). Но в GLM Coding Plan они не входят — нужно использовать API-ключ с балансом, а не подписочный. Для Claude Code бесплатные модели работают, но медленнее и с ограничениями по rate limit. **Будут ли работать MCP-серверы и хуки через Z.ai?** Да. MCP-серверы, хуки и CLAUDE.md работают независимо от провайдера модели. Меняется только модель, которая обрабатывает запросы, а вся инфраструктура Claude Code остаётся на месте. **Данные безопасны? Куда уходит код?** Код отправляется на серверы Z.ai в Сингапуре. Согласно их [политике](https://z.ai/privacy?ref=matveev.tech), данные API-запросов не используются для обучения моделей и не хранятся после обработки. Но если проект чувствительный, я бы рекомендовал локальные модели через Ollama. **Как проверить, через какого провайдера идёт запрос?** Внутри сессии Claude Code набери `/status` — там будет видно текущий эндпоинт и модель. Также можно посмотреть в дашборде Z.ai — там логируются все запросы. ## Что ещё почитать - [Claude Code с любой моделью: 10 провайдеров 2026](https://matveev.tech/claude-code-alternative-providers-2026/) — обзор всех способов подключить сторонние модели - [Переменные окружения Claude Code — полный справочник](https://matveev.tech/claude-code-environment-variables/) — все переменные для настройки провайдеров - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — подробнее про конфигурацию ### Cork — GUI для Homebrew, который заменит терминал URL: https://matveev.tech/cork-homebrew-gui-macos/ Last updated: 2026-02-16T15:50:05.000Z **TL;DR:** Cork — бесплатный open-source GUI для Homebrew на macOS. Написан на SwiftUI, весит меньше мегабайта в памяти и позволяет управлять пакетами без терминала. Подойдёт дизайнерам, менеджерам и вообще всем, кто пользуется Homebrew, но не хочет запоминать команды. Я пользуюсь Homebrew каждый день. И каждый раз, когда нужно вспомнить, как правильно — `brew list` или `brew ls`, или какой cask я поставил полгода назад, начинается лёгкое раздражение. Терминал мощный, спору нет. Но иногда хочется просто ткнуть в кнопку. Cork как раз про это — нормальный графический интерфейс поверх [Homebrew](https://matveev.tech/homebrew-paketnyj-menedzher-macos/). ## Что такое Cork и зачем он нужен Cork — нативное macOS-приложение, графическая оболочка для пакетного менеджера [Homebrew](https://brew.sh/?ref=matveev.tech). Разработал его Давид Буреш из Словении, проект живёт на [GitHub](https://github.com/buresdv/Cork?ref=matveev.tech) с 2022 года и регулярно обновляется. Зачем вообще GUI, если есть терминал? У Homebrew есть несколько раздражающих моментов: - Нужно помнить команды: `brew install`, `brew upgrade`, `brew cleanup --scrub` - Нет способа увидеть все установленные пакеты одним взглядом - Кэш растёт на сотни мегабайт, а ты про него забываешь - Чтобы посмотреть инфу о пакете, делаешь `brew info` и разбираешь текстовую простыню Cork оборачивает всё это в привычный macOS-интерфейс. Кнопки, списки, поиск — как в любом обычном приложении. ## Быстрый старт Установить Cork можно тремя способами. Самый быстрый — через Homebrew: ```bash brew install --cask cork ``` Это демо-версия с ограничениями. Полная стоит 25 €, но есть лайфхак: Cork open-source, его можно собрать бесплатно из исходников. Сборка из исходников (бесплатно): 1. Установи [Mise](https://mise.jdx.dev/?ref=matveev.tech) — менеджер версий инструментов: ```bash curl https://mise.run | sh ``` 1. Установи Tuist (система сборки для iOS/macOS проектов): ```bash mise install tuist ``` 1. Склонируй репозиторий и сгенерируй Xcode-проект: ```bash git clone https://github.com/buresdv/Cork.git && cd Cork mise exec tuist@4.50.2 -- tuist install mise exec tuist@4.50.2 -- tuist generate --no-binary-cache ``` 1. В Xcode: выбери Build Scheme → Self-Compiled, потом `Product → Archive` 2. В окне архивов нажми `Distribute App → Custom → Copy App` 3. Перетащи Cork.app в `/Applications/` Весь процесс занимает минут 20-30, в основном ждёшь скачивание зависимостей и компиляцию. Не сложно, но и не два клика. Третий вариант — просто купить за 25 € на [corkmac.app](https://corkmac.app/?ref=matveev.tech). Одна покупка навсегда, обновления бесплатно. ## Ключевые возможности ### Управление пакетами в два клика Поиск работает и по formulae, и по casks. Набираешь название, видишь результаты, нажимаешь Install. Без `brew install --cask --no-quarantine whatever`. Удаление так же просто. ### Информация о пакетах Cork показывает то, что Homebrew прячет за несколькими командами: зависимости, размер кэша, является ли пакет зависимостью другого или ты ставил его сам. Последнее особенно полезно — стандартная команда `brew leaves` часто выдаёт неполный список, и [сам разработчик Cork](https://github.com/buresdv/Cork?ref=matveev.tech) об этом пишет. ### Очистка кэша За полгода у меня накопилось больше 600 МБ кэшированных загрузок Homebrew. В терминале про это легко забыть. Cork показывает размер кэша прямо на главном экране и позволяет очистить его одной кнопкой. Мелочь, но когда на MacBook Air каждый гигабайт на счету, это заметно. ### Homebrew-сервисы Если пользуешься `postgresql`, `redis` или `nginx` через Homebrew, Cork позволяет запускать и останавливать сервисы в отдельном окне. Не нужно вспоминать `brew services start postgres`. Подробнее про [brew services и другие возможности Homebrew](https://matveev.tech/homebrew-paketnyj-menedzher-macos/) я писал в отдельном обзоре. ### Тегирование пакетов Фича, которой в самом Homebrew нет вообще. Можно помечать пакеты тегами — «рабочее», «для проекта X», что угодно. Чисто для организации, но когда установлено 50+ пакетов, помогает не потеряться. ### Обновления из Menu Bar Можно обновлять пакеты прямо из строки меню, даже не открывая приложение. ## Тарифы | | Бесплатно (self-compiled) | Покупка | | ---------------------- | ------------------------- | ------------------------ | | Цена | 0 € | 25 € (единоразово) | | Все функции | Да | Да | | Обновления | Ручная пересборка | Автоматические | | Установка | Xcode + 30 мин | brew install --cask cork | | Поддержка разработчика | Нет | Да | Единственная реальная разница — удобство получения обновлений. Функционально версии идентичны. ## Альтернативы Cork не единственный GUI для Homebrew. Вот что ещё есть: | Приложение | Цена | Стек | Open Source | Особенности | | ---------- | ------------------------ | ------------------ | ------------------- | ------------------------------------- | | Cork | 25 € / бесплатная сборка | SwiftUI | Да (Commons Clause) | Самый функциональный, нативный | | Brewer X | 29 € | Нативный macOS | Нет | Bulk-операции, transcript | | WailBrew | Бесплатно | Go + React (Wails) | Да (MIT) | Лёгкий (\~5 МБ), новый проект | | BrewMate | Бесплатно | Electron | Да (MIT) | Простой, есть в App Store | | Cakebrew | Бесплатно | Objective-C | Да | Не обновляется, проблемы после Sonoma | Brewer X — ближайший конкурент по качеству. Красивый, с полезным transcript-режимом, где видно все команды под капотом. Но стоит 29 €, закрытый код, и бесплатной версии нет совсем. WailBrew — новичок 2025 года. Написан на Go + React через фреймворк [Wails](https://wails.io/?ref=matveev.tech), весит всего 5 МБ (для сравнения, Electron-приложения обычно 150+ МБ). Полностью бесплатный, MIT-лицензия. Но пока сыроват: управления сервисами и тегирования нет. Cakebrew — когда-то был стандартом, но [не обновляется с 2023 года](https://github.com/brunophilipe/Cakebrew?ref=matveev.tech) и, по отзывам, может не работать на свежих macOS. ## Что понравилось - Нативный SwiftUI — приложение выглядит как часть macOS, а не как веб-обёртка - Загрузка списка пакетов примерно в 10 раз быстрее стандартного `brew list`, согласно бенчмаркам разработчика - Русский язык в интерфейсе - Потребление ресурсов минимальное: около 0.6% RAM на базовом Mac - Модель «собери бесплатно или купи ради удобства» — честная и прозрачная ## Что не понравилось - 25 € за GUI-обёртку — я понимаю, что это поддержка разработчика, но цена кусается для такого простого по сути приложения - Сборка из исходников требует Xcode, Mise, Tuist — если ты не разработчик, это целый квест - Лицензия Commons Clause: код открыт, но нельзя распространять собранные бинарники. Это не MIT и не GPL, и для кого-то принципиально - В демо-версии не понятно, какие конкретно функции урезаны. Хотелось бы больше прозрачности ## Вердикт Думаю, Cork — на данный момент лучший GUI для Homebrew. Если ты живёшь в терминале, Cork скорее приятное дополнение. Я, например, использую его в основном для двух вещей: следить за кэшем и управлять сервисами. Терминал никуда не делся, но открывать его стал реже. Для дизайнеров, менеджеров или людей, которым Homebrew нужен ради пары пакетов, Cork упрощает жизнь заметно. Не нужно помнить команды, не нужно гуглить синтаксис. Если 25 € жалко, но Xcode стоит — собери бесплатно. Если не хочешь возиться — посмотри на [WailBrew](https://wailbrew.app/?ref=matveev.tech), он полностью бесплатный и довольно шустрый. Попробовать: [Cork](https://corkmac.app/?ref=matveev.tech) ## Что ещё почитать - [Homebrew — пакетный менеджер для macOS в 2026](https://matveev.tech/homebrew-paketnyj-menedzher-macos/) — подробный обзор самого Homebrew: быстрый старт, формулы, cask, brew bundle - [iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac за 10 минут](https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/) — если хочешь прокачать и терминал тоже - [Kuku — Obsidian на стероидах с AI-агентом](https://matveev.tech/kuku-markdown-editor-macos/) — ещё одно нативное приложение для macOS, которое стоит попробовать Источники- \[Cork — официальный сайт\](https://corkmac.app/) - \[Cork на GitHub\](https://github.com/buresdv/Cork) - \[Cork на Homebrew Formulae\](https://formulae.brew.sh/cask/cork) — 380 установок за 30 дней - \[How-To Geek — обзор Cork\](https://www.howtogeek.com/why-mac-homebrew-gui-cork-is-worth-your-time-but-not-your-money/) - \[WailBrew — официальный сайт\](https://wailbrew.app/) - \[Brewer X — Panini House\](https://panini.house/brewer) - \[BrewMate на GitHub\](https://github.com/romankurnovskii/BrewMate) ## FAQ **Нужно ли устанавливать Homebrew перед Cork?** Да, Cork — графическая оболочка для уже установленного Homebrew. Без него не запустится. Установить можно командой с [brew.sh](https://brew.sh/?ref=matveev.tech). **Cork бесплатный?** И да, и нет. Исходный код открыт, собрать через Xcode можно бесплатно. Готовый бинарник стоит 25 € — одна покупка, обновления навсегда. **Работает ли Cork на Apple Silicon?** Да, написан на SwiftUI и оптимизирован под Apple Silicon. Поддерживает macOS 13 Ventura и новее. **Можно ли использовать Cork вместе с терминалом?** Конечно. Cork и терминальный Homebrew работают с одной базой пакетов. Всё, что установишь через Cork, видно в `brew list`, и наоборот. ### Claude Code: 5 провайдеров с Anthropic API в 2026 URL: https://matveev.tech/claude-code-alternative-providers-2026/ Last updated: 2026-02-25T12:16:44.000Z > **TL;DR:** Claude Code работает не только с моделями Anthropic. Пять китайских AI-провайдеров реализовали нативную совместимость с Anthropic Messages API: Z.ai (GLM-модели от $10/мес), DeepSeek ($0.28/M токенов), Kimi ($0.60/M), MiniMax ($0.30/M) и Alibaba Qwen (от $0.05/M). Подключаешь через `ANTHROPIC_BASE_URL` — и работаешь в Claude Code как обычно, только дешевле. Если ты пользуешься Claude Code, то знаешь: подписка Max стоит $100/мес, а API-токены улетают быстрее, чем хотелось бы. Но Anthropic предусмотрели возможность подключения сторонних провайдеров через переменную `ANTHROPIC_BASE_URL` — и несколько компаний этим воспользовались. Меня интересовали провайдеры с нативной поддержкой Anthropic Messages API. Не прокси, не маркетплейсы, а те, кто реализовал совместимый эндпоинт у себя. Нашёл пять таких, все китайские. Совпадение? Не думаю. ## Как это работает Механика простая. Claude Code по умолчанию отправляет запросы на `api.anthropic.com`. Но если задать переменную `ANTHROPIC_BASE_URL`, запросы пойдут на указанный адрес. Провайдер на другом конце должен понимать формат Anthropic Messages API — и всё. Настроить можно через `~/.claude/settings.json`: ```json { "env": { "ANTHROPIC_BASE_URL": "https://your-provider.com/anthropic", "ANTHROPIC_AUTH_TOKEN": "your-api-key" } } ``` Или через переменные окружения в `~/.zshrc`: ```bash export ANTHROPIC_BASE_URL="https://your-provider.com/anthropic" export ANTHROPIC_AUTH_TOKEN="your-api-key" ``` Удобный вариант — shell-алиасы для быстрого переключения между провайдерами: ```bash glm() { ANTHROPIC_BASE_URL=https://api.z.ai/api/anthropic \ ANTHROPIC_AUTH_TOKEN="$ZAI_API_KEY" \ claude "$@" } dsk() { ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic \ ANTHROPIC_AUTH_TOKEN="$DEEPSEEK_API_KEY" \ claude "$@" } ``` Ещё можно переопределить, какая модель стоит за каждым алиасом Claude Code: ```bash export ANTHROPIC_MODEL="glm-4.7" export ANTHROPIC_SMALL_FAST_MODEL="glm-4.5-air" ``` Подробнее про все переменные окружения — в [справочнике по переменным Claude Code](https://matveev.tech/claude-code-environment-variables/). ## 1\. Z.ai — GLM-модели от $10/мес Z.ai — международный бренд Zhipu AI, разработчика семейства GLM. Они тренируют свои модели с нуля, это не перепродажа. Флагман [GLM-5](https://matveev.tech/glm-5-zhipu-open-source-obzor/) весит 744 миллиарда параметров (MoE) и набирает 77.8 на SWE-bench Verified. ![](https://matveev.tech/content/images/2026/02/zai-pricing-2.jpg) У Z.ai есть отдельный Coding Plan — подписка специально под AI-кодинг с Anthropic-совместимым эндпоинтом: | План | Цена/мес | Модели | Промптов за 5 ч | | ---- | -------- | ----------------- | --------------- | | Lite | $10 | GLM-4.5, 4.6, 4.7 | \~80 | | Pro | $30 | \+ GLM-5 | \~400 | | Max | $80 | \+ приоритет | \~1 600 | Если подписка не нравится — можно платить за токены. GLM-4.7 стоит $0.60/$2.20 за миллион (вход/выход), GLM-5 — $1.00/$3.20\. Для сравнения — Claude Sonnet 4 это $3/$15\. Разница в 5-7 раз. А GLM-4.7-Flash вообще бесплатный. Настройка: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic", "ANTHROPIC_AUTH_TOKEN": "ваш-ключ-z-ai", "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-4.7", "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5", "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` Есть нюансы, которые стоит знать. GLM-5 тратит квоту в 3 раза быстрее обычных моделей. На плане Lite GLM-5 вообще недоступна — только с Pro. В пиковые часы (14:00-18:00 UTC+8) бывают задержки, и судя по отзывам на Reddit, проблема не редкая. Серверы в Сингапуре — задержка из России заметная, но терпимая. 11 февраля 2026 Z.ai подняли цены на \~30% из-за роста спроса. Старые подписчики сохраняют прежние условия до конца текущего цикла оплаты. Попробовать: [z.ai](https://z.ai/?ref=matveev.tech) ## 2\. DeepSeek — reasoning по цене кофе DeepSeek сделали свой Anthropic-совместимый эндпоинт, и настраивается он за минуту. ![Документация DeepSeek по Anthropic-совместимому API](https://matveev.tech/content/images/2026/02/deepseek-anthropic-docs.jpg) Настройка: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.deepseek.com/anthropic", "ANTHROPIC_AUTH_TOKEN": "ваш-deepseek-ключ", "ANTHROPIC_MODEL": "deepseek-chat", "ANTHROPIC_SMALL_FAST_MODEL": "deepseek-chat", "API_TIMEOUT_MS": "600000", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } } ``` Доступны две модели на базе DeepSeek-V3.2: `deepseek-chat` (общего назначения) и `deepseek-reasoner` (с цепочкой рассуждений, аналог extended thinking). Reasoning-модель хороша для сложных задач, когда надо разобраться в чужом коде или продебажить что-то неочевидное. Цены — одни из самых низких на рынке: $0.28 за миллион входных токенов и $0.42 за выход. При попадании в кеш — $0.028\. Это в 50-100 раз дешевле Claude Opus. Но есть важные ограничения. Картинки не поддерживаются — если Claude Code попытается отправить скриншот, API вернёт ошибку 400\. Prompt caching-директивы (`cache_control`) тихо игнорируются — каждый запрос платит полную стоимость входных токенов. И `budget_tokens` для thinking mode тоже не работает — модель сама решает, сколько рассуждать. Ещё момент: если передать имя модели Claude (например, `claude-sonnet-4-20250514`), DeepSeek тихо подставит `deepseek-chat` без ошибки. Можно не заметить, что работаешь не с той моделью. Со стабильностью бывает по-разному. Иногда запросы висят по 30-40 секунд, иногда всё летает. Поэтому `API_TIMEOUT_MS=600000` (10 минут) — рекомендация от самих DeepSeek. Для основной работы я бы не стал полагаться только на них, но как бюджетный вариант — вполне рабочий. Попробовать: [deepseek.com](https://deepseek.com/?ref=matveev.tech) ## 3\. Kimi (Moonshot AI) — самый богатый выбор моделей Moonshot AI, создатели ассистента Kimi, тоже реализовали Anthropic-совместимый эндпоинт. И у них, пожалуй, самая интересная линейка моделей из всех пяти провайдеров. ![Платформа Moonshot AI — документация по интеграции с Claude Code](https://matveev.tech/content/images/2026/02/moonshot-agent-docs.jpg) | Модель | Контекст | Thinking | Vision | Input $/M | Output $/M | | ---------------------- | -------- | -------- | ------ | --------- | ---------- | | kimi-k2.5 | 256K | Да | Да | $0.60 | $3.00 | | kimi-k2-0905-preview | 256K | Нет | Нет | $0.60 | $2.50 | | kimi-k2-thinking-turbo | 256K | Да | Нет | $1.15 | $8.00 | | kimi-k2-turbo-preview | 256K | Нет | Нет | $1.15 | $8.00 | kimi-k2.5 умеет и thinking, и vision, и agent-режим. Архитектура MoE: 1 триллион параметров, 32 миллиарда активных. При регистрации дают $5 бесплатного кредита, хватит потыкать. Настройка: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.moonshot.ai/anthropic", "ANTHROPIC_AUTH_TOKEN": "sk-ваш-ключ-moonshot", "ANTHROPIC_MODEL": "kimi-k2.5", "ANTHROPIC_SMALL_FAST_MODEL": "kimi-k2-0905-preview", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1", "API_TIMEOUT_MS": "600000" } } ``` kimi-k2-0905-preview при $0.60/$2.50 неплохо справляется с агентным кодингом. По данным Moonshot, модель стабильно работает на 200-300 последовательных tool calls. Для ежедневных задач цена приятная. Есть особенность: Anthropic-эндпоинт пересчитывает температуру по формуле `real_temperature = request_temperature × 0.6`. Если Claude Code задаёт температуру 1.0, модель на самом деле получит 0.6\. На практике разница малозаметная, но знать стоит. Скорость генерации у обычных моделей (\~34 tok/s) заметно ниже Claude Sonnet (\~91 tok/s). Turbo-версии быстрее (60-100 tok/s), но и дороже в 3 раза. Попробовать: [platform.moonshot.ai](https://platform.moonshot.ai/?ref=matveev.tech) ## 4\. MiniMax — дешевле всех по токенам MiniMax тихо сделали, пожалуй, самый дешёвый Anthropic-совместимый API. Флагман M2.5 — reasoning-модель на 230 миллиардов параметров (10 миллиардов активных, MoE). На SWE-bench Verified набирает 80.2%, что даже выше GLM-5. ![Документация MiniMax по Anthropic-совместимому API](https://matveev.tech/content/images/2026/02/minimax-anthropic-docs.jpg) Вот цены: | Модель | Input $/M | Output $/M | Cache Read $/M | Скорость | | ---------------------- | --------- | ---------- | -------------- | --------- | | MiniMax-M2.5 | $0.30 | $1.20 | $0.03 | \~60 tps | | MiniMax-M2.5-highspeed | $0.60 | $2.40 | $0.03 | \~100 tps | | MiniMax-M2.1 | $0.30 | $1.20 | $0.03 | \~60 tps | | MiniMax-M2 | $0.30 | $1.20 | $0.03 | \~100 tps | $0.30 за миллион входных токенов — это в 50 раз дешевле Claude Opus и в 10 раз дешевле Sonnet. А prompt cache read по $0.03 — вообще копейки, учитывая, что Claude Code отправляет большие системные промпты при каждом запросе. Настройка: ```json { "env": { "ANTHROPIC_BASE_URL": "https://api.minimax.io/anthropic", "ANTHROPIC_AUTH_TOKEN": "ваш-ключ-minimax", "ANTHROPIC_MODEL": "MiniMax-M2.5", "ANTHROPIC_SMALL_FAST_MODEL": "MiniMax-M2.5", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1", "API_TIMEOUT_MS": "3000000" } } ``` По совместимости с Anthropic API всё неплохо: tools, thinking, streaming работают. Картинки не поддерживаются (как и у DeepSeek). `stop_sequences` тихо игнорируется, а Claude Code их использует для управления генерацией, так что иногда модель выдаёт лишний текст на выходе. И ещё: M2.5 любит поговорить. На бенчмарках она генерирует в 4 раза больше токенов, чем средняя модель. По деньгам это некритично (токены-то дешёвые), но ответы заметно длиннее, чем у Claude. Попробовать: [platform.minimax.io](https://platform.minimax.io/?ref=matveev.tech) ## 5\. Alibaba Qwen — от $0.05 за миллион токенов Alibaba Cloud Model Studio (DashScope) — самый крупный игрок в этом списке. Линейка моделей тут шире всех: от бюджетного qwen-flash за $0.05/M до [qwen3-max](https://matveev.tech/qwen3-5-obzor/) за $1.20/M. Плюс отдельная кодинговая модель [qwen3-coder-plus](https://matveev.tech/qwen3-coder-next-obzor/). ![Alibaba Cloud Model Studio — документация по интеграции с Claude Code](https://matveev.tech/content/images/2026/02/alibaba-claude-code-docs.jpg) | Модель | Контекст | Thinking | Input $/M | Output $/M | | ---------------- | -------- | -------- | --------- | ---------- | | qwen3-coder-plus | 1M | Нет | $1.00 | $5.00 | | qwen3.5-plus | 1M | Да | $0.40 | $2.40 | | qwen3-max | 252K | Да | $1.20 | $6.00 | | qwen-flash | 1M | Нет | $0.05 | $0.40 | Контекстное окно до 1 миллиона токенов, больше чем у остальных четырёх провайдеров. Но подвох в том, что цена растёт вместе с контекстом. qwen3-coder-plus при 0-32K стоит $1.00/$5.00, а при 256K-1M уже $6.00/$60.00\. Claude Code склонен раздувать контекст, потому что отправляет полную историю разговора. Так что реальный чек может оказаться выше, чем ты рассчитывал. Есть и свой Coding Plan — подписка для AI-кодинга: | План | Цена/мес | Лимит за 5 ч | Лимит за месяц | | ---- | -------- | -------------- | --------------- | | Lite | $10 | 1 200 запросов | 18 000 запросов | | Pro | $50 | 6 000 запросов | 90 000 запросов | Лимиты заметно щедрее, чем у Z.ai: 1 200 запросов за 5 часов на Lite (у Z.ai — 80 промптов). Но учитывай, что один пользовательский запрос в Claude Code может генерировать 5-30 вызовов API. Настройка pay-as-you-go: ```json { "env": { "ANTHROPIC_BASE_URL": "https://dashscope-intl.aliyuncs.com/apps/anthropic", "ANTHROPIC_AUTH_TOKEN": "ваш-ключ-dashscope", "ANTHROPIC_MODEL": "qwen3-coder-plus", "ANTHROPIC_SMALL_FAST_MODEL": "qwen-flash" } } ``` Для Coding Plan — другой эндпоинт и ключ: ```json { "env": { "ANTHROPIC_BASE_URL": "https://coding-intl.dashscope.aliyuncs.com/apps/anthropic", "ANTHROPIC_AUTH_TOKEN": "sk-sp-ваш-ключ-coding-plan" } } ``` Новым пользователям дают 1 миллион токенов бесплатно на каждую модель — хватит для серьёзного теста. А до 31 марта 2026 есть скидка 50% на первый месяц Coding Plan. Из ограничений: картинки через международный Anthropic-эндпоинт не поддерживаются (на китайском работают через VL-модели). Thinking mode есть не у всех моделей — qwen3-coder-plus его не поддерживает. Попробовать: [alibabacloud.com/product/model-studio](https://www.alibabacloud.com/product/model-studio?ref=matveev.tech) ## Сравнительная таблица | Провайдер | Модели | Input $/M | Output $/M | Подписка | Thinking | | --------- | ----------------------- | -------------- | ------------- | ---------- | ------------------- | | Z.ai | GLM-4.5 — GLM-5 | $0 — $1.20 | $0 — $5.00 | от $10/мес | Да (GLM-5) | | DeepSeek | V3.2 (chat/reasoner) | $0.028 — $0.28 | $0.42 | Нет | Да (reasoner) | | Kimi | K2, K2.5, K2-thinking | $0.10 — $1.15 | $2.50 — $8.00 | Нет | Да (K2.5, thinking) | | MiniMax | M2, M2.1, M2.5 | $0.30 — $0.60 | $1.20 — $2.40 | Нет | Да (M2.5) | | Alibaba | Qwen3-Coder, 3.5, Flash | $0.05 — $1.20 | $0.40 — $6.00 | от $10/мес | Да (3.5-plus, max) | Для сравнения: Claude Sonnet 4 стоит $3/$15, Claude Opus 4.6 — $15/$75 за миллион токенов. ## Что не работает у всех Тут честно: ни один из пяти провайдеров не заменяет Claude полностью. Есть общие проблемы. Vision — нигде толком не работает через Anthropic-эндпоинт. Kimi-k2.5 вроде поддерживает картинки, но именно через Anthropic API это ограничено. Если ты регулярно скидываешь скриншоты в Claude Code, будут ошибки. Системный промпт Claude Code заточен под Claude. Другие модели могут не так точно следовать внутренним инструкциям. Я замечал, что на сложных multi-step задачах модели иногда теряют нить. С prompt caching ситуация пёстрая. DeepSeek игнорирует `cache_control` полностью. MiniMax и Alibaba реализовали свой кеш. Z.ai и Kimi кешируют автоматически. И обязательно добавляй `CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1` при работе с любым сторонним провайдером. Без этого Claude Code шлёт фоновые запросы к Anthropic и впустую тратит квоту. ## Какой провайдер выбрать Думаю, выбор зависит от ситуации. Нужен самый дешёвый вариант? **DeepSeek** за $0.28/M. Качество не Claude, но для быстрых задач хватает. Хочешь подписку без подсчёта токенов? **Z.ai Lite** за $10/мес или **Alibaba Lite** за $10/мес. У Alibaba щедрее лимиты (1 200 запросов за 5 часов против 80 у Z.ai), зато у Z.ai модели GLM заточены под кодинг. Важно соотношение цены и качества? Тогда **MiniMax M2.5** за $0.30/$1.20\. На SWE-bench набирает 80.2%, есть thinking mode, и при этом дешевле почти всех. Нужен контекст до 1M токенов? **Alibaba Qwen**. Только следи за размером контекста: цена прыгает на длинных сессиях. Хочешь thinking + vision + agents в одном? **Kimi K2.5**. Лично я сижу на Claude Opus для основной работы, а для мелких задач переключаюсь на Z.ai через shell-алиас. Одна команда в терминале, и ты уже в том же Claude Code, но на другой модели. ## FAQ **Можно ли использовать Claude Code вообще без подписки Anthropic?** Да. Если задать `ANTHROPIC_BASE_URL` на любого из пяти провайдеров, Claude Code будет работать без Anthropic API-ключа. Нужен только ключ от выбранного провайдера. **Будут ли работать все фичи Claude Code со сторонними моделями?** Не все. Extended thinking работает у тех моделей, которые его поддерживают (deepseek-reasoner, kimi-k2-thinking, MiniMax-M2.5, qwen3-max). Но vision, MCP passthrough и некоторые beta-фичи Anthropic — нет. Если возникают ошибки, добавь `CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1`. **Как быстро переключаться между провайдерами?** Shell-алиасы — лучший вариант. Добавь в `~/.zshrc` функции для каждого провайдера и вызывай `glm`, `dsk`, `kimi` вместо `claude`. Подробнее про настройку — в [гайде по settings.json](https://matveev.tech/claude-code-settings-json/). **Безопасно ли отправлять код через этих провайдеров?** Код уходит на серверы провайдера. Z.ai заявляет, что данные не хранятся (серверы в Сингапуре). DeepSeek — серверы в Китае. Alibaba — Сингапур для международного API. Для чувствительных проектов лучше использовать Anthropic напрямую или корпоративные решения вроде AWS Bedrock и Google Vertex. **Какие модели лучше всего работают с Claude Code?** По моему опыту, лучше работают модели, заточенные под код: GLM-5-Code, qwen3-coder-plus, kimi-k2-0905-preview. Универсальные тоже тянут, но с кодерскими специализациями меньше косяков. ## Что ещё почитать - [Переменные окружения Claude Code — полный справочник](https://matveev.tech/claude-code-environment-variables/) — все переменные для настройки провайдеров - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — где и что прописывать - [GLM-5 от Zhipu — лучшая open-source модель 2026](https://matveev.tech/glm-5-zhipu-open-source-obzor/) — подробный обзор флагмана Z.ai - [Qwen 3.5 — мультимодальный AI от Alibaba](https://matveev.tech/qwen3-5-obzor/) — обзор моделей Alibaba - [Claude Opus 4.6 — обзор самой умной модели Anthropic](https://matveev.tech/claude-opus-4-6-obzor/) — с чем сравнивать альтернативы - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — если выбираешь между ними ### Qwen 3.5 — мультимодальный AI от Alibaba с 397B параметров URL: https://matveev.tech/qwen3-5-obzor/ Last updated: 2026-02-25T12:16:45.000Z > **TL;DR:** Alibaba выпустила Qwen 3.5 — мультимодальную модель с 397 миллиардами параметров, из которых активны только 17 миллиардов за один проход. Гибридная архитектура (линейное внимание + MoE) даёт скорость в 8.6 раз выше Qwen3-Max при сопоставимом качестве. На бенчмарках бьёт или догоняет GPT-5.2, Claude Opus 4.6 и Gemini-3 Pro, особенно в vision-задачах. Веса открыты. Пока все обсуждают GPT-5.3 и Claude Opus 4.6, команда Qwen из Alibaba тихо выкатила модель, которая на ряде бенчмарков обходит обоих. Qwen 3.5-397B-A17B — это первая модель новой серии, и цифры впечатляют. Давай разберёмся, что внутри. ## Что такое Qwen 3.5 и чем отличается от Qwen 3? Главное отличие — Qwen 3.5 с самого начала мультимодальна. Обучали текст и картинки вместе с первого токена. Alibaba называет это native vision-language model. Вторая большая штука — архитектура. Qwen 3.5 построена на Qwen3-Next, где совмещены два типа внимания: - Gated Delta Networks для линейного внимания (быстрое и дешёвое) - Gated Attention для сложных контекстов (классическое) - Sparse MoE, где из 397 миллиардов параметров активируются только 17 На практике это значит, что модель знает столько же, сколько монстры на триллион параметров, но гонять её стоит как средненькую модель. Звучит как маркетинг, но бенчмарки вроде подтверждают. ![Скорость инференса Qwen 3.5 по сравнению с Qwen3-Max и Qwen3-235B](https://matveev.tech/content/images/2026/02/qwen-3-5-inference.png) По данным Alibaba, скорость декодирования Qwen 3.5-397B-A17B при контексте 32K в 8.6 раза выше, чем у Qwen3-Max. При 256K токенов контекста разница ещё больше: в 19 раз. Если сравнивать с Qwen3-235B-A22B, быстрее в 3.5 и 7.2 раза соответственно. Ещё расширили поддержку языков со 119 до 201\. Словарь вырос с 150K до 250K токенов, и это ускоряет кодирование и декодирование на 10-60% для большинства языков. Русский, само собой, поддерживается. ## Бенчмарки: как Qwen 3.5 выглядит на фоне конкурентов? Вот тут начинается самое интересное. Alibaba сравнила модель с GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro и Kimi K2.5. ![Результаты бенчмарков Qwen 3.5-397B-A17B](https://matveev.tech/content/images/2026/02/qwen-3-5-benchmarks.png) ### Текстовые задачи Несколько цифр, которые бросаются в глаза: | Бенчмарк | GPT-5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen 3.5 | | ------------------ | ------- | --------------- | ------------ | ------------- | | MMLU-Pro | 87.4 | 89.5 | 89.8 | 87.8 | | IFBench | 75.4 | 58.0 | 70.4 | **76.5** | | MultiChallenge | 57.9 | 54.2 | 64.2 | **67.6** | | BFCL-V4 (агенты) | 63.1 | **77.5** | 72.5 | 72.9 | | TAU2-Bench | 87.1 | **91.6** | 85.4 | 86.7 | | BrowseComp | 65.8 | 67.8 | 59.2 | **69.0/78.6** | | SWE-bench Verified | 80.0 | **80.9** | 76.2 | 76.4 | По следованию инструкциям (IFBench, MultiChallenge) Qwen 3.5 вырвалась вперёд, обходит и GPT-5.2, и Claude, и Gemini. В агентских задачах показывает крепкие результаты, хотя Claude Opus 4.6 пока лидирует в BFCL-V4 и TAU2-Bench. В поисковых задачах (BrowseComp) Qwen 3.5 набирает 78.6 с продвинутой стратегией. Это лучший результат среди всех протестированных моделей. Кодинг на уровне конкурентов: SWE-bench 76.4 при 80.0 у GPT-5.2 и 80.9 у Claude. Не лидер, но очень близко. И это при том, что активных параметров в 4-5 раз меньше. ### Vision-задачи — тут Qwen 3.5 сильнее всего | Бенчмарк | GPT-5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen 3.5 | | -------------- | ------- | --------------- | ------------ | -------- | | MathVision | 83.0 | 74.3 | 86.6 | **88.6** | | ZEROBench | 9 | 3 | 10 | **12** | | ZEROBench\_sub | 33.2 | 28.4 | 39.0 | **41.0** | | BabyVision | 34.4 | 14.2 | 49.7 | **52.3** | | OCRBench | 80.7 | 85.8 | 90.4 | **93.1** | | CountBench | 91.9 | 90.6 | 97.3 | **97.2** | | HallusionBench | 65.2 | 64.1 | 68.6 | **71.4** | | LingoQA | 68.8 | **78.8** | 72.8 | 81.6 | Нативная мультимодальность тут реально работает. MathVision 88.6, лучший результат среди всех моделей в тесте. ZEROBench (считается одним из самых сложных visual бенчмарков) тоже первое место: 12 баллов против 10 у Gemini и 9 у GPT-5.2\. OCR-задачи — 93.1, опять выше всех. Я, если честно, не ожидал такого от open-weight модели. Обычно открытые модели проигрывают закрытым именно в мультимодальных задачах. Тут Alibaba этот паттерн сломала. Хотя, конечно, надо делать скидку на то, что бенчмарки они публикуют сами, а независимых тестов пока мало. ## Агентские способности: масштабирование через RL Отдельно хочу выделить подход к обучению агентских способностей. Команда Qwen масштабировала reinforcement learning не на конкретные бенчмарки, а на разнообразие и сложность RL-окружений. Идея в том, что если модель учится в тысячах разных ситуаций, она лучше обобщает. ![График улучшения агентских способностей Qwen 3.5 через масштабирование RL](https://matveev.tech/content/images/2026/02/qwen-3-5-scaling.png) Результат на агентских бенчмарках пока не лидерский: DeepPlanning 34.3 (GPT-5.2 набирает 44.6, хотя Claude только 33.9), MCP-Mark 46.1 (GPT-5.2 тут 57.5, Claude 42.3). Но сам подход через масштабирование окружений, а не натаскивание на конкретные тесты, мне кажется более правильным в долгосрочной перспективе. ## Инфраструктура и скорость обучения Для тех, кому интересна техническая начинка. Alibaba сделала гетерогенный пайплайн, где параллелизм настроен отдельно для vision и language частей модели. Это логично, потому что нагрузка на эти компоненты разная. Ещё перевели всё на нативный FP8: низкая точность для активаций, маршрутизации MoE и GEMM. Результат — примерно 50% экономии памяти и 10%+ прирост скорости. Для RL-обучения построили асинхронный фреймворк с полностью разделёнными training и inference, что дало ускорение в 3-5 раз. Вообще, мне нравится, что Alibaba вкладывается в инженерию запуска. Модель, которую дорого гонять, никому не нужна. ## Где попробовать Qwen 3.5? Самый простой вариант — зайти на [Qwen Chat](https://chat.qwen.ai/?ref=matveev.tech). Там три режима: Auto (модель сама решает, думать ей или нет, и может использовать инструменты), Thinking (глубокие рассуждения для сложных задач) и Fast (мгновенные ответы без раздумий). Для разработчиков есть Alibaba Cloud ModelStudio с моделью Qwen3.5-Plus. Контекст 1M токенов, встроенные инструменты. API совместим с OpenAI SDK, так что подключить к существующему проекту минут за пять. Ну и веса лежат на [Hugging Face](https://huggingface.co/Qwen/Qwen3.5-397B-A17B?ref=matveev.tech), если хочешь запустить у себя. ## Что умеет как агент: демо Команда показала несколько демо, и пара из них меня зацепила. Первое — visual coding. Модель обрабатывает до 2 часов видео (благодаря контексту в 1M токенов) и может превратить нарисованный от руки макет UI в рабочий код. Или посмотреть запись геймплея и написать клон игры на HTML. Второе — thinking with images. Модель не просто смотрит на картинку. Она может запустить code interpreter в процессе рассуждения. В одном из демо ей показали лабиринт, и она написала BFS-алгоритм на Python, нашла кратчайший путь и нарисовала его поверх изображения. Ещё показали GUI-агента, который управляет смартфонами и компьютерами автономно, и пространственный интеллект для понимания сцен автовождения. Но эти демо менее впечатляющие — похожие штуки показывали и Claude, и Gemini. ## Вывод Qwen 3.5 меня удивила. Vision-бенчмарки на первом месте, текстовые — на уровне GPT-5.2 и Claude Opus 4.6, а активных параметров при этом в разы меньше. И всё это в открытых весах. Думаю, главная история тут даже не про конкретные цифры (на верхушке все примерно одинаковые), а про подход. 17 миллиардов активных параметров при качестве модели на 397 миллиардов. Вот по этому пути, мне кажется, пойдёт вся индустрия. Если работаешь с мультимодальными задачами или строишь агентов, попробуй. Особенно если платишь за инференс из своего кармана. ## Что ещё почитать - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух главных конкурентов - [Kimi K2.5 — китайский open-source с роем из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — ещё одна сильная модель из Азии - [GLM-5 от Zhipu — лучшая open-source модель 2026](https://matveev.tech/glm-5-zhipu-open-source-obzor/) — китайский конкурент в open-source сегменте - [Qwen3-Coder-Next — маленькая модель, которая кодит как большая](https://matveev.tech/qwen3-coder-next-obzor/) — предыдущая модель от Qwen для кодинга ## FAQ ### Qwen 3.5 — open-source или нет? Qwen 3.5 — open-weight модель. Веса доступны на Hugging Face и ModelScope, но лицензия может ограничивать коммерческое использование. Это не полный open-source, где открыт весь код обучения, но для большинства задач этого достаточно. ### Сколько нужно GPU для запуска Qwen 3.5 локально? Полная модель на 397B параметров требует серьёзного железа — минимум 8 GPU уровня A100/H100\. Но активных параметров всего 17B, поэтому можно ожидать квантизованные версии, которые запустятся на более скромном оборудовании. ### Чем Qwen 3.5 лучше GPT-5.2 и Claude Opus 4.6? В vision-задачах Qwen 3.5 лидирует: MathVision 88.6, ZEROBench 12, OCRBench 93.1\. В текстовых задачах — на уровне конкурентов. Главное преимущество — стоимость: активных параметров в разы меньше, а качество сопоставимое. ### Поддерживает ли Qwen 3.5 русский язык? Да. Модель поддерживает 201 язык и диалект, включая русский. Словарь расширен до 250K токенов, что улучшает эффективность работы с неанглийскими языками. ### Инженеры OpenAI не пишут код! URL: https://matveev.tech/openai-inzhenery-ne-pishut-kod-vyvody/ Last updated: 2026-03-20T21:10:27.000Z > **TL;DR:** Шервин Ву из OpenAI рассказал, что 95% инженеров компании используют Codex ежедневно, а 100% пулл-реквестов проходят AI-ревью. Я послушал полуторачасовое интервью и выделил пять вещей, над которыми стоит задуматься каждому разработчику. На прошлой неделе вышло [интервью Шервина Ву](https://www.youtube.com/watch?v=B26CwKm5C1k&ref=matveev.tech), главы инженерии API-платформы OpenAI, у Ленни Рачитски. Шервин — человек, чья команда строит инфраструктуру, на которой работает чуть ли не вся AI-индустрия. И то, что он рассказывает о внутренней кухне OpenAI, заставляет по-новому посмотреть на собственную рутину. Я выделил пять мыслей и добавил свои наблюдения как человек, который последние полгода активно работает с AI-агентами. ## Инженеры управляют агентами, а не пишут код Главная цифра: 95% инженеров OpenAI используют Codex каждый день. 100% пулл-реквестов проходят ревью через Codex. Инженеры, которые активно используют агентов, открывают на 70% больше PR, и этот разрыв растёт. Шервин описывает это через метафору из книги [SICP](https://en.wikipedia.org/wiki/Structure%5Fand%5FInterpretation%5Fof%5FComputer%5FPrograms?ref=matveev.tech) 1980 года: программисты — это волшебники, а код — заклинания. Сейчас это уже не метафора. Ты буквально говоришь агенту, что нужно сделать, и он идёт делать. Мне это знакомо. Я работаю с Claude Code и запускаю параллельно несколько агентов на разные задачи. Ощущение действительно похоже на управление командой: ты не кодишь, ты ставишь задачи, проверяешь результат, направляешь. Иногда ловишь себя на мысли, что за последний час не написал ни строчки руками, но при этом закрыл кучу задач. Шервин сравнивает текущий момент с «Учеником чародея» из Фантазии Диснея: Микки нашёл шляпу волшебника, запустил мётлы работать, а потом всё вышло из-под контроля. Мысль понятна: нужно понимать, что делаешь. Сениорность теперь не в скорости набора кода, а в умении формулировать задачи и не давать агентам уйти в сторону. ## 100% кодовой базы через AI Внутри OpenAI есть команда, которая проводит эксперимент: их кодбейз на 100% написан Codex. Когда агент не справляется, нельзя откатиться к ручному коду. Звучит как безумие? Может быть. Но именно из такого безумия рождаются лучшие практики. Я начал подобный эксперимент уже как пару месяцев назад и именно в таком подходе ты можешь научиться управлять агентом и понимать как это делать эффективно. Когда агент не может выполнить задачу, проблема почти всегда в контексте. Не хватает документации, не описаны конвенции, «племенное знание» осталось в головах разработчиков. Решением является записать это знание в MD-файлы, комментарии, структуру проекта. Я это подтверждаю. У меня есть CLAUDE.md с подробными инструкциями, скилл-файлы для повторяющихся задач, и разница между «агент делает что-то случайное» и «агент делает именно то, что нужно» — это 30 минут, потраченных на документацию. Те 30 минут, которые окупаются за первый же запуск. ## Не один стартап на миллиард, а тысячи на $10 млн Шервин берёт известную идею Сэма Альтмана про one-person billion-dollar startup и разворачивает в неожиданную сторону. Стартап одного человека на миллиард — это, может, и случится. Но интереснее вторичные эффекты. Если один человек может создать компанию на миллиард, значит один человек легко создаёт бизнес на $10 млн. Для конкретного человека $10 млн — это «set for life», хватит на всю жизнь. И таких бизнесов будут десятки тысяч. Причём чтобы «стартап на миллиард» работал, ему нужна экосистема из сотен маленьких компаний: поддержка для подкастеров, CRM для фрилансеров, бухгалтерия для онлайн-школ. Каждый такой инструмент — это тоже стартап одного-двух человек. По его словам, мы входим в золотой век B2B SaaS. Не потому что появится один гигант, а потому что стоимость создания софта падает к нулю, и теперь любую нишу можно занять. По данным [Benzinga](https://www.benzinga.com/markets/tech/26/02/50632038/openais-engineering-lead-says-ai-era-will-create-thousands-of-niche-startups?ref=matveev.tech), аналитики тоже подхватили эту идею Шервина и обсуждают её как серьёзный тренд. Мне эта идея нравится больше, чем хайп вокруг «one-person unicorn». Один человек на миллиард — это байка для заголовков. Тысячи людей, которые строят нишевые инструменты и нормально зарабатывают, — это реальная экономика. И она уже начинает формироваться. ## Почему у большинства компаний минус от AI Шервин прямо говорит: многие AI-внедрения в компаниях приносят отрицательный ROI. И объясняет почему. Кремниевая долина живёт в пузыре. Все на X обсуждают MCP-серверы, skills-файлы, prompt engineering. А обычный сотрудник в обычной компании даже не понимает, как задать нормальный вопрос ChatGPT. «Я разговариваю с этими людьми, и они задают моделям самые базовые вопросы», — говорит Шервин. Паттерн провала выглядит так: руководство решает «мы теперь AI-first», покупает лицензии, вписывает в KPI «используй AI». Но нет ни одного человека внутри, который бы реально разобрался в технологии и показал коллегам, как её применять. Рецепт от Шервина: найти внутри компании Tiger team, людей, которые горят технологией. Часто это не программисты, а технически подкованные люди из других отделов — «Excel-волшебники», как он их называет. Дать им свободу экспериментировать и делиться знаниями. Top-down без bottoms-up не работает. Это объясняет огромный разрыв между тем, что мы видим в Twitter, и тем, что происходит в реальности. Мы обсуждаем мультиагентные системы, а 90% компаний не могут нормально настроить чат-бот для поддержки. ## Модели съедят твой скаффолдинг Последний тезис, который мне запомнился. Шервин цитирует Николаса из FinTool: «The models will eat your scaffolding for breakfast». Вот как это работало в последние годы. В 2022 все вкладывались в vector stores и RAG-пайплайны, потому что модели плохо работали с контекстом. Модели научились — и вся эта обвязка стала менее нужна. В 2024 все строили agent frameworks, потому что модели не могли сами оркестрировать задачи. Модели подтянулись — фреймворки упростились. Сейчас модно делать skills-файлы и context management. Через год модели, вероятно, справятся и без этого. Совет: строй продукт, который работает на 80% с текущими моделями, и жди, когда следующее обновление закроет оставшиеся 20%. Стартапы, которые так делали, взлетели. Те, кто строил вокруг текущих ограничений — потеряли время на скаффолдинг (он же [agent harness](https://matveev.tech/agent-harness-chto-takoe/)), который модели потом «съели на завтрак». Не уверен, что с этим можно согласиться на 100%. Какой-то скаффолдинг нужен прямо сейчас, чтобы продукт работал прямо сейчас. Но стратегически — да, ставить на улучшение моделей безопаснее, чем ставить на то, что текущие ограничения останутся навсегда. ## Но есть нюанс При всём уважении к Шервину, стоит помнить: он работает в OpenAI. Его команда строит Codex. Когда он говорит «95% наших инженеров на Codex», это OpenAI с лучшими моделями, инженерами мирового уровня и продуктом, который они сами создали. В среднем стартапе или энтерпрайзе картина другая. Модели хуже справляются с legacy-кодом, нестандартными стеками, бизнес-логикой без документации. Я сам регулярно сталкиваюсь с ситуацией, когда агент уверенно делает не то, и потом 20 минут разбираешь, что пошло не так. Это прямо скажу происходит не часто, но с таким до сих пор сталкиваешься даже с использованием [Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/). И метрика «на 70% больше PR» — это про количество, не про качество. Больше PR — не обязательно больше ценности. Иногда одна правильная архитектурная идея стоит сотни мелких коммитов. ## Итого Интервью Шервина Ву — это взгляд из центра событий. Не всё из этого применимо за пределами OpenAI, но направление понятно: инженеры будут всё меньше писать код руками и всё больше управлять AI-агентами. Что я вынес для себя: 1. Документируй всё. MD-файлы, конвенции, правила — это топливо для агентов 2. Учись формулировать задачи, а не писать код. Промпт-инженерия для агентов — это новый навык. Новый обязательный навык! 3. Не строй вокруг ограничений. Модели улучшаются быстрее, чем ты обкладываешь их костылями Через пару лет мы оглянемся на этот момент и скажем: «Вот тогда всё и поменялось». Или не скажем — AI-прогнозы имеют свойство не сбываться) ## Что ещё почитать - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух лучших моделей для кодинга - [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/) — как запустить команду AI-агентов на практике - [OpenClaw (MoltBot): обзор AI-агента](https://matveev.tech/openclaw-moltbot-obzor/) — агент, который упоминается в интервью - [19 лучших AI-инструментов для продуктивности](https://matveev.tech/ai-instrumenty-produktivnost-2026/) — подборка инструментов, которые меняют рабочий процесс - [Что такое agent harness](https://matveev.tech/agent-harness-chto-takoe/) — глоссарий: что такое обвязка вокруг AI-модели и почему модели её «съедят» ### Homebrew — пакетный менеджер для macOS в 2026 URL: https://matveev.tech/homebrew-paketnyj-menedzher-macos/ Last updated: 2026-02-16T08:49:38.000Z > **TL;DR:** Homebrew — бесплатный пакетный менеджер для macOS и Linux, который ставит консольные утилиты и GUI-приложения одной командой в терминале. За 16 лет стал стандартом де-факто для разработчиков на Mac. Если у тебя macOS и ты хоть раз открывал Terminal — скорее всего, Homebrew тебе нужен. Я заметил, что многие разработчики используют Homebrew на автомате, но не задумываются, как он устроен и что реально умеет. А новички на Mac иногда вообще не знают, что такое пакетный менеджер. Разберёмся, зачем он нужен, как быстро начать и стоит ли вообще смотреть на альтернативы. ## Что это и зачем Homebrew — open-source пакетный менеджер, который решает простую проблему: Apple не поставляет с macOS кучу нужных разработчику утилит. Хочешь `wget`, `git` посвежее, `node`, `python` актуальной версии? Раньше приходилось качать DMG-файлы с сайтов, распаковывать, тащить в `/Applications`. Или ещё хуже — компилировать из исходников. Homebrew убрал всё это в одну команду: `brew install wget` — и готово. Проект запустил Макс Хауэлл в 2009 году. К 2013 году Homebrew стал самым популярным проектом на GitHub по количеству контрибьюторов, [согласно данным GitHub Octoverse](https://github.blog/news-insights/octoverse/?ref=matveev.tech). Сейчас версия 5.0.8 (декабрь 2025), больше 6 000 формул (пакетов) в основном репозитории, поддержка Apple Silicon и Linux. Написан на Ruby и распространяется под лицензией BSD. Весь проект ведут около 34 волонтёров — никакой корпорации за спиной. Это одновременно и плюс, и повод задуматься о долгосрочной устойчивости. ## Быстрый старт Три шага — и можно ставить пакеты. **Шаг 1.** Открой Terminal и вставь: ```bash /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" ``` Скрипт расскажет, что собирается делать, и спросит подтверждение. На Apple Silicon ставится в `/opt/homebrew`, на Intel — в `/usr/local`. Есть и `.pkg`\-установщик — скачать можно с [GitHub Releases](https://github.com/Homebrew/brew/releases/latest?ref=matveev.tech). **Шаг 2.** Добавь Homebrew в PATH. После установки в терминале будет подсказка — обычно нужно добавить в `~/.zshrc`: ```bash eval "$(/opt/homebrew/bin/brew shellenv)" ``` **Шаг 3.** Проверь и поставь первый пакет: ```bash brew --version brew install wget ``` Всё. На весь процесс уходит 2-3 минуты. Системные требования: macOS 14 Sonoma или новее на Apple Silicon или Intel 64-bit. Нужны Command Line Tools for Xcode (ставятся через `xcode-select --install`). ## Что умеет Homebrew ### Формулы — консольные утилиты Основная единица в Homebrew — формула (formula). Это Ruby-скрипт, который описывает, откуда скачать исходники и как собрать пакет. Но чаще всего ты качаешь готовый бинарник (bottle), так что сборка не нужна. ```bash brew install node # Node.js brew install python # Python 3 brew install postgresql # PostgreSQL ``` По данным [formulae.brew.sh](https://formulae.brew.sh/?ref=matveev.tech), в основном репозитории больше 6 000 формул. Всё, что нужно типичному разработчику, там есть. ### Cask — GUI-приложения С 2013 года Homebrew умеет ставить обычные macOS-приложения через Cask: ```bash brew install --cask firefox brew install --cask visual-studio-code brew install --cask docker ``` Больше не нужно заходить на сайт, качать DMG, тащить в Applications. Одна команда, и приложение на месте. Обновления тоже через `brew upgrade --cask`. Если терминал не для тебя, есть [графические оболочки для Homebrew](https://matveev.tech/cork-homebrew-gui-macos/) — они позволяют ставить и обновлять пакеты кликами мышки. ### brew bundle — конфигурация рабочего места Допустим, ты настроил Mac идеально. Как повторить это на новой машине? Файл `Brewfile`: ```ruby brew "git" brew "node" brew "python" cask "firefox" cask "visual-studio-code" cask "iterm2" ``` Потом на новой машине: ```bash brew bundle ``` И всё ставится автоматом. Я пользуюсь этим при каждом переезде на новый Mac, и каждый раз радуюсь, что не приходится вспоминать, что именно стояло. ### brew services — управление сервисами Если поставил PostgreSQL или Redis, не нужно вручную запускать демоны: ```bash brew services start postgresql brew services list brew services stop postgresql ``` Homebrew сам создаёт LaunchAgents и управляет ими. ### Параллельные загрузки в 5.0 В ноябре 2025 вышла версия 5.0 с параллельными загрузками пакетов по умолчанию. Раньше Homebrew качал и ставил пакеты последовательно — если ставишь что-то с десятком зависимостей, это было заметно. Теперь загрузки идут параллельно, а установка по очереди. На практике `brew install` с кучей зависимостей стал быстрее процентов на 30-40, по моим ощущениям. Ещё в 5.0 добавили официальную поддержку Linux ARM64 и встроенный MCP-сервер (`brew mcp-server`), хотя не уверен, что последним кто-то активно пользуется. ## Тарифы Homebrew полностью бесплатный. BSD-лицензия, без ограничений. Если нужны корпоративные фичи вроде управления парком Mac с Homebrew, есть [Workbrew](https://workbrew.com/?ref=matveev.tech) — отдельный коммерческий продукт от мейнтейнеров Homebrew. Но сам Homebrew — 100% free. ## Вердикт Homebrew — штука из разряда коммунальных услуг. Когда работает — не замечаешь. Когда нет — сразу понимаешь, как без него плохо. Для разработчика на Mac я не вижу причин не ставить: установка занимает пару минут, а дальше пакеты ставятся и обновляются без головной боли. Если ты только перешёл на Mac — начни с Homebrew. По мере необходимости добавишь `nvm` для Node, `pyenv` для Python. Если работаешь в команде и критична повторяемость окружений — посмотри на Nix, но будь готов потратить неделю на изучение. Я использую Homebrew уже много лет. Честно, ни разу не думал переезжать на что-то другое. Может, это и не идеальный инструмент, но для моих задач хватает. Попробовать: [Homebrew](https://brew.sh/?ref=matveev.tech) ## Что ещё почитать - [Cork — GUI для Homebrew, который заменит терминал](https://matveev.tech/cork-homebrew-gui-macos/) — если хочешь управлять пакетами без терминала - [iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac за 10 минут](https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/) — настройка терминала, в котором Homebrew и будет работать - [19 лучших AI-инструментов для продуктивности в 2026](https://matveev.tech/ai-instrumenty-produktivnost-2026/) — если ищешь полезные инструменты для работы - [Claude Code Hooks — автоматизация, о которой ты не знал](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — автоматизация для разработчиков, Homebrew тоже часть стека ### OpenClaw и безопасность: как не стать жертвой своего AI-агента URL: https://matveev.tech/openclaw-bezopasnost/ Last updated: 2026-02-25T12:16:47.000Z **TL;DR:** 135 000 открытых OpenClaw-инстансов в сети, каждый четвёртый навык из комьюнити содержит уязвимости, а один исследователь через prompt injection за 5 минут вытащил 5 писем из чужой почты. Звучит как сценарий для Netflix, но это реальность февраля 2026\. Ниже — конкретные угрозы и чеклист из 7 правил, чтобы пользоваться OpenClaw и не проснуться с утечкой. ## Масштаб проблемы: цифры, от которых неуютно Я начал копаться в теме после того, как Cisco [выпустили отчёт](https://blogs.cisco.com/ai/personal-ai-agents-like-openclaw-are-a-security-nightmare?ref=matveev.tech) с заголовком "Personal AI Agents like OpenClaw Are a Security Nightmare". Не самая обнадёживающая формулировка от компании, которая занимается сетевой безопасностью лет тридцать. Вот что мы имеем на сегодня: - **135 000+** OpenClaw-инстансов обнаружены в открытом доступе без какой-либо аутентификации - **26%** community skills содержат хотя бы одну уязвимость — это из аудита Cisco Security Team - **230+** вредоносных навыков загружены на ClawHub только за первую неделю февраля - **15%** community skills содержат вредоносные инструкции Hudson Rock обнаружили, что через публично доступные панели можно добраться до API-ключей, OAuth-секретов и полной истории переписки с агентом. Это не теоретическая угроза — это уже происходит. Palo Alto Networks в своём блоге пишут, что ситуация с OpenClaw "may signal the next AI crisis". Я не склонен к панике, но когда три крупнейших вендора безопасности говорят одно и то же — стоит прислушаться. ## Три главных вектора атак ### Prompt injection: когда письмо атакует твоего агента Самый элегантный и пугающий вектор. Исследователь продемонстрировал на WIRED, как это работает: отправляешь обычное письмо с замаскированными инструкциями, агент его читает, и — сюрприз — начинает выполнять команды атакующего. В конкретном случае агент переслал 5 писем из ящика жертвы атакующему за 5 минут. Пять минут! Ещё веселее: в эксперименте WIRED агент OpenClaw начал отправлять фишинговые письма самому автору статьи. То есть твой собственный AI-помощник может начать фишить тебя же. Звучит как плохая комедия, но это задокументированный случай. Проблема в том, что OpenClaw по умолчанию доверяет всему контенту, который обрабатывает. Нет чёткого разделения между «данные» и «инструкции» — классическая проблема injection-атак, только на стероидах. ### Supply chain: навыки из ClawHub как троянский конь ClawHub — это что-то вроде маркетплейса навыков для OpenClaw. И вот что они прямо пишут в документации: > "All code downloaded from the library will be treated as trusted code — there is no moderation process" Нет модерации. Вообще. Ты ставишь навык, и он получает доступ ко всему, что имеет твой агент. По данным Cisco, 26% этих навыков содержат уязвимости, а 15% — целенаправленно вредоносные инструкции, [согласно обсуждениям на Reddit](https://www.reddit.com/r/MachineLearning/?ref=matveev.tech). За первую неделю февраля на ClawHub залили больше 230 вредоносных навыков. Кто-то очень старается. Появились и совсем креативные схемы: фейковый VS Code extension с RAT (remote access trojan) внутри, фейковые токены $CLAWD и $MOLTBOT на Solana. Кто-то создал целую экосистему скама вокруг одного open-source проекта. ### Открытые порты: 135 000 приглашений для хакеров Тут всё просто и грустно. CVE-2026-25253, оценка CVSS 8.8 — это cross-site WebSocket hijacking, который позволяет получить удалённое выполнение кода одним кликом. Один клик — и у атакующего полный доступ к твоей системе. Уязвимость пропатчили в версии v2026.1.29, но по данным Bitsight, 135 000+ инстансов торчат в сеть без аутентификации. Сколько из них обновлены? Я думаю, что далеко не все. А ещё есть история с Moltbook: утечка через открытый Supabase, в результате которой в сеть попали 1.5 миллиона API-ключей и 35 000+ email-адресов. Это не OpenClaw напрямую, но это экосистема, и она вся пронизана такими проблемами. ## Чеклист: 7 правил безопасной настройки OpenClaw Ладно, хватит страшилок. Если ты всё-таки решил использовать OpenClaw (а я понимаю — штука реально полезная), вот что нужно сделать минимально. ### 1\. Никогда не открывай OpenClaw в интернет Запускай только на localhost. Если нужен удалённый доступ — только через VPN или SSH-туннель. 135 000 открытых инстансов — это люди, которые не сделали даже этого. ### 2\. Обнови до последней версии CVE-2026-25253 пропатчен в v2026.1.29\. Проверь свою версию прямо сейчас. Серьёзно, прямо сейчас. ### 3\. Не ставь навыки из ClawHub без аудита кода Да, я знаю — это неудобно. Но «нет модерации» значит «нет модерации». Открой код навыка, посмотри, что он делает, куда отправляет данные. Если не можешь прочитать код — не ставь. ### 4\. Ограничь права агента Не давай OpenClaw доступ ко всей почте, ко всем файлам, ко всем API. Принцип минимальных привилегий — это не паранойя, это гигиена. Если агенту нужен доступ к календарю — не давай ему ещё и почту. ### 5\. Запусти в изолированном контейнере Docker, Podman — что угодно. Если агент скомпрометирован, пусть ущерб останется внутри контейнера, а не расползётся по всей системе. ### 6\. Мониторь исходящий трафик Если твой AI-агент внезапно начал отправлять запросы на неизвестные серверы — это красный флаг. Настрой простой мониторинг сетевой активности. Можно даже через Little Snitch на Mac. ### 7\. Отдельные API-ключи для OpenClaw Создай отдельные ключи с минимальными правами. Не используй свои основные API-ключи или OAuth-токены. Если произойдёт утечка — отзовёшь один ключ, а не перенастроишь всё. ## Что делают разработчики OpenClaw Честно? Не уверен, что достаточно. После CVE-2026-25253 патч выпустили быстро, это плюс. Но системных изменений в архитектуре безопасности пока мало. ClawHub до сих пор работает без модерации навыков. Нет песочницы по умолчанию. Нет предупреждений при установке навыков из непроверенных источников. По мне — это как магазин приложений, где любой может загрузить что угодно без проверки. Мы уже проходили это с ранними Android-маркетплейсами. Заканчивалось всегда одинаково. ## Стоит ли вообще ставить OpenClaw? Я не буду говорить «нет» категорично. OpenClaw — мощный инструмент, и я понимаю, зачем люди его используют. Автоматизация, AI-агенты, локальный контроль — всё это реально привлекательно. Но. Kaspersky [прямо пишут](https://www.kaspersky.com/blog/openclaw-vulnerabilities-exposed/55263/?ref=matveev.tech): "handing your data over to OpenClaw is at best unsafe, at worst utterly reckless". Google Cloud VP Heather Adkins на конференции сказала коротко: "Don't run Clawdbot". Это не ноунеймы из Twitter — это люди, которые отвечают за безопасность крупнейших компаний. Мой взгляд: если ты готов выполнить все 7 пунктов из чеклиста выше, если понимаешь риски и можешь провести аудит навыков — пожалуйста. Если планируешь просто поставить и забыть — лучше подожди, пока экосистема повзрослеет. Или посмотри на более контролируемые альтернативы — тот же Claude Code работает в sandbox по умолчанию и имеет [систему разрешений](https://matveev.tech/claude-code-permissions-sandbox/), которая не позволяет агенту делать что попало. ## FAQ **Можно ли использовать OpenClaw безопасно?** Можно, но это требует усилий. Минимум: запуск только на localhost, последняя версия с патчами, никаких навыков из ClawHub без проверки кода, изоляция в контейнере и отдельные API-ключи. Если всё это звучит как слишком много работы — значит, тебе пока не стоит его ставить. **Чем опасен prompt injection для AI-агентов?** AI-агент обрабатывает входящий контент (письма, сообщения, файлы) и не отличает данные от инструкций. Атакующий может спрятать команды в обычном письме, и агент выполнит их — от пересылки переписки до загрузки вредоносного кода. По данным WIRED, этот вектор уже эксплуатируется в реальных атаках. **Что такое CVE-2026-25253 и затрагивает ли она меня?** Это уязвимость cross-site WebSocket hijacking с оценкой CVSS 8.8, позволяющая удалённое выполнение кода. Если у тебя OpenClaw версии ниже v2026.1.29 — ты уязвим. Обнови немедленно. Если твой инстанс доступен из интернета — ты уязвим вдвойне. **Какие альтернативы OpenClaw безопаснее?** Если тебе нужен AI-агент для разработки, Claude Code работает в песочнице по умолчанию и имеет систему разрешений с тремя уровнями. ChatGPT с плагинами проходит модерацию OpenAI. Для автоматизации n8n или Make дают контроль над каждым шагом. Общий принцип: чем больше контроля над правами агента — тем безопаснее. ## Что ещё почитать - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — как работает система безопасности в Claude Code, которая по умолчанию не даёт агенту выполнять опасные действия - [Agent Teams в Claude Code: как запустить команду AI-агентов](https://matveev.tech/claude-code-agent-teams-instrukciya/) — если хочешь работать с AI-агентами, но в контролируемой среде - [Kimi K2.5 — рой из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — другой подход к мультиагентности, тоже с вопросами к безопасности - [Super Agents от ClickUp](https://matveev.tech/clickup-super-agents/) — корпоративные AI-агенты с контролем доступа ### OpenClaw Skills: как создать свой навык за 15 минут URL: https://matveev.tech/openclaw-skills-navyki/ Last updated: 2026-02-25T12:16:47.000Z > **TL;DR:** OpenClaw расширяется через модульные SKILL.md файлы — по сути обычный Markdown с YAML-шапкой. На ClawHub уже 700+ навыков от сообщества, но с безопасностью там пока катастрофа: Cisco нашли 230+ вредоносных навыков за первую неделю февраля 2026\. Рассказываю, как сделать свой навык за 15 минут и не нарваться на чужой малварь. ## Что такое Skills в OpenClaw Если ты работал с OpenClaw хотя бы пару дней, то наверняка замечал: из коробки агент умеет многое, но не всё. Хочешь управлять умным домом? Мониторить серверы? Автоматизировать email? Для этого нужны навыки — Skills. По своей сути Skill — это текстовый файл с инструкциями для агента. Не плагин, не бинарник, не контейнер. Просто Markdown-файл с описанием того, что агент должен делать и какие разрешения ему для этого нужны. Звучит слишком просто? Ну, так и есть. В этом вся идея: порог входа настолько низкий, что навык может написать кто угодно. На [ClawHub](https://clawhub.ai/?ref=matveev.tech) уже больше 700 community-навыков, а на GitHub есть целый [awesome-список](https://github.com/VoltAgent/awesome-openclaw-skills?ref=matveev.tech) с курируемой подборкой. Категории навыков на ClawHub самые разнообразные: управление Hue и Sonos, мониторинг серверов, Git-автоматизация, работа с email, интеграция с календарём. Думаю, со временем навыков станет в разы больше — экосистема растёт очень быстро. ## Анатомия SKILL.md — формат, YAML и примеры Каждый навык OpenClaw — это файл `SKILL.md` с двумя частями: YAML front matter (метаданные) и собственно текст инструкций на Markdown. Вот минимальный шаблон: ```yaml --- name: "my-awesome-skill" description: "Краткое описание того, что делает навык" triggers: - "ключевое слово" - "ещё одно ключевое слово" permissions: - network - filesystem --- ``` Разберём поля: - **name** — уникальный идентификатор. Латиница, через дефисы, без пробелов - **description** — что навык делает. Одно-два предложения, это покажется пользователю при поиске - **triggers** — слова или фразы, при которых агент активирует навык. Если пользователь пишет что-то похожее, OpenClaw подтянет этот Skill - **permissions** — какие ресурсы нужны навыку: сеть, файловая система, доступ к API После YAML-блока идёт обычный Markdown — инструкции агенту. Тут ты описываешь логику: что делать, в каком порядке, какие команды вызывать. Можно добавлять примеры кода, условия и ветвления. ## Пошаговое создание своего навыка **Шаг 1\. Создай папку навыка** ```bash mkdir -p ~/.openclaw/skills/site-monitor ``` **Шаг 2\. Создай SKILL.md** ```bash touch ~/.openclaw/skills/site-monitor/SKILL.md ``` **Шаг 3\. Заполни YAML-шапку** — имя, описание, триггеры, разрешения. **Шаг 4\. Напиши инструкции** — логика навыка на естественном языке. **Шаг 5\. Протестируй** — запусти OpenClaw и скажи одно из trigger-слов. Навык подхватится автоматически — никакой компиляции или регистрации. ## Пример: навык для мониторинга сайта Покажу готовый навык, который проверяет доступность сайта и присылает отчёт. Я пользуюсь примерно таким для своих проектов. ```yaml --- name: "site-monitor" description: "Проверяет доступность сайтов и возвращает отчёт о статусе" triggers: - "проверь сайт" - "мониторинг" - "сайт доступен" permissions: - network --- ## Инструкции Когда пользователь просит проверить сайт: 1. Получи URL сайта от пользователя. Если не указан протокол, подставь https:// 2. Выполни HTTP GET-запрос к указанному URL 3. Зафиксируй: - HTTP-статус ответа - Время отклика в миллисекундах - Наличие SSL-сертификата и срок его действия 4. Если статус не 200, попробуй ещё 2 раза с интервалом 5 секунд 5. Верни пользователю отчёт в формате: | Параметр | Значение | |----------|----------| | URL | {url} | | Статус | {status_code} | | Время отклика | {response_time} мс | | SSL | {ssl_status}, истекает {ssl_expiry} | Если сайт недоступен после 3 попыток, предложи возможные причины: - DNS не резолвится - Сервер не отвечает - SSL-ошибка - Таймаут соединения ``` Этот навык весит 50 строк, но решает конкретную задачу. Не нужен ни Python, ни JavaScript — агент сам знает, как выполнить HTTP-запрос и вернуть данные. ## ClawHub: маркетплейс навыков и его проблемы с безопасностью [ClawHub](https://clawhub.ai/?ref=matveev.tech) — это основной каталог навыков для OpenClaw. Работает по принципу npm или pip: нашёл навык, установил одной командой, пользуешься. Звучит удобно. Но есть нюанс, который меня, честно говоря, напрягает. Прямо на сайте ClawHub написано: > "All code downloaded from the library will be treated as trusted code — there is no moderation process at present" Перевод: весь код скачивается как доверенный, никакой модерации пока нет. Вообще. Ноль. И это не теоретическая проблема. По данным Cisco, за первую неделю февраля 2026 года было обнаружено более 230 вредоносных навыков на ClawHub. Исследование показало, что 26% всех навыков на платформе содержат те или иные уязвимости — от случайных дыр до целенаправленного вредоносного кода. Самый яркий пример — навык "What Would Elon Do?". Под прикольным названием скрывалось прямое вредоносное ПО с эксфильтрацией данных. То есть ты устанавливаешь навык, думая, что получишь шутливого советчика, а он тихо сливает твои файлы на чужой сервер. Мне кажется, это серьёзная проблема экосистемы прямо сейчас. Когда npm был молодой, там тоже была история с malicious packages, но хотя бы какая-то автоматическая проверка существовала с самого начала. Тут — ничего. ## Правила безопасности при работе с чужими навыками После всего сказанного выше — вот что я бы рекомендовал: 1. Читай SKILL.md перед установкой. Это текстовый файл, его можно прочитать за минуту. Если видишь подозрительные URL, base64-строки или запросы к непонятным API — не ставь 2. Проверяй permissions. Навыку для работы с календарём не нужен доступ к файловой системе. Если permissions выглядят избыточно — это красный флаг 3. Предпочитай навыки из [awesome-списка](https://github.com/VoltAgent/awesome-openclaw-skills?ref=matveev.tech). Там хотя бы базовая курация от сообщества 4. Создавай локальные навыки вместо скачивания. Если задача простая, проще написать свой SKILL.md за 15 минут, чем доверять чужому коду 5. Следи за обновлениями безопасности. Cisco и другие исследователи регулярно публикуют отчёты о найденных уязвимостях в экосистеме OpenClaw Я не хочу тебя пугать — большинство навыков на ClawHub нормальные и полезные. Но пока нет модерации, осторожность не помешает. ## FAQ **Можно ли создать навык OpenClaw без публикации на ClawHub?** Да, и я бы даже рекомендовал начинать именно так. Положи SKILL.md в папку `~/.openclaw/skills/` — агент подхватит его автоматически. Публикация на ClawHub — дело добровольное, для личных навыков она вообще не нужна. **Какой минимальный набор полей нужен в YAML?** Обязательны name и description. Триггеры и permissions технически опциональны, но без триггеров агент не будет знать, когда активировать навык, а без permissions не получит доступ к нужным ресурсам. Так что на практике нужны все четыре поля. **Навыки OpenClaw работают только на английском?** Нет. Триггеры и инструкции можно писать на любом языке, включая русский. Агент обрабатывает естественный язык, так что пиши на том языке, на котором будешь общаться с ним. **Как обновить уже установленный навык?** Просто отредактируй файл SKILL.md. Для локальных навыков изменения подхватятся при следующем запуске агента. Для навыков из ClawHub — переустанови навык командой `openclaw skill update `. **Чем Skills отличаются от MCP-серверов?** MCP (Model Context Protocol) — это более тяжеловесный подход. MCP-серверы работают как отдельные процессы с полноценным API. Skills — это лёгкие текстовые инструкции без отдельного рантайма. Для простых задач Skills проще и быстрее, для сложных интеграций лучше подходит MCP. ## Что ещё почитать Если тебя интересует тема AI-агентов и разработки навыков, вот несколько статей из блога: - [Плагины Claude Code — как расширить возможности](https://matveev.tech/claude-code-plugins-marketplaces/) — похожая концепция расширения AI-агента через модули, только в экосистеме Claude - [Claude Code Hooks — автоматизация, о которой ты не знал](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — ещё один подход к расширению AI-инструмента через хуки и скрипты - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — тема безопасности при работе с AI-агентами, актуально после истории с ClawHub - [FastMCP 3.0 — Python-фреймворк для MCP-серверов](https://matveev.tech/fastmcp-python-mcp-servery/) — если хочешь копнуть глубже в сторону MCP вместо Skills ### 3 альтернативы OpenClaw: какой AI-агент выбрать в 2026 URL: https://matveev.tech/openclaw-alternativy/ Last updated: 2026-02-25T12:16:48.000Z **TL;DR:** OpenClaw набрал 145 тысяч звёзд за месяц, но [26% навыков с уязвимостями](https://www.wiz.io/blog/wiz-research-uncovers-openclaw-risks?ref=matveev.tech) и расходы до $400/мес на API отпугивают. Разбираю три проверенные альтернативы: от минималистичного Nanobot на 4000 строк до серверлесс-версии от Cloudflare. --- OpenClaw (бывший Clawdbot, потом Moltbot) стал главным хайпом начала 2026 в мире AI-агентов. Питер Штайнбергер начал делать его в ноябре 2025, и за пару месяцев проект набрал больше 145 тысяч звёзд на GitHub. Если не следил за историей переименований, [я подробно разобрал, что это за штука](https://matveev.tech/openclaw-moltbot-obzor/). Но чем больше людей ставят OpenClaw, тем больше вопросов. По [данным Wiz Research](https://www.wiz.io/blog/wiz-research-uncovers-openclaw-risks?ref=matveev.tech), 135 тысяч инстансов торчат в интернет без защиты, а 26% навыков содержат уязвимости. Плюс месячный счёт за API может перевалить за $400. Я поковырял альтернативы и собрал тройку, на которую стоит посмотреть. Все проекты проверены: репозитории активны, коммиты свежие, звёзды настоящие. ## Сравнительная таблица Прежде чем нырять в детали: | Инструмент | Тип | Open Source | Безопасность | Цена | Для кого | | ------------ | ---------------------- | ----------- | ------------------------ | ---------------------- | -------------------- | | **Nanobot** | CLI-агент (Python) | Да (MIT) | 4K строк, легко аудитить | Бесплатно + API | Разработчики | | **NanoClaw** | CLI-агент (TypeScript) | Да (MIT) | Контейнерная изоляция | Бесплатно + API | Security-инженеры | | **n8n** | Workflow-автоматизация | Да | Self-hosted | Бесплатно / от $20/мес | No-code, маркетологи | ## 1\. Nanobot — OpenClaw на 4000 строк Python [Nanobot](https://github.com/HKUDS/nanobot?ref=matveev.tech) собрала лаборатория Data Science Гонконгского университета (HKUDS). Идея простая: взять ядро агентной петли OpenClaw и воспроизвести его в 4000 строках Python вместо 430 тысяч строк оригинала. Проект появился 1 февраля 2026, и за две недели набрал 19 тысяч звёзд. Когда я впервые увидел эти цифры, подумал — ну какой функционал может остаться при таком сокращении? Но основные штуки на месте: долгосрочная память, веб-поиск, фоновые агенты. Есть интеграции с Telegram и WhatsApp. Главный плюс для параноиков (и я в их числе): аудит. 430 тысяч строк физически невозможно проверить. 4000 строк на Python можно прочитать за вечер. Понимаешь, что запускается на твоей машине. Минус — у Nanobot всего две интеграции с мессенджерами, тогда как у OpenClaw их больше 50\. Если нужен агент через Signal, Discord или email, пока придётся ждать. Подойдёт разработчикам, которые хотят разобраться, как OpenClaw работает изнутри. Или тем, кому нужен контроль над каждой строчкой кода. ## 2\. NanoClaw — агент в контейнере [NanoClaw](https://github.com/gavrielc/nanoclaw?ref=matveev.tech) пошёл другим путём. Гавриэль Коэн (бывший инженер Wix, 7 лет в компании) вместо урезания кода сфокусировался на модели безопасности. Каждый агент запускается в изолированном контейнере: Apple Containers на macOS, Docker на Linux. Если AI «сходит с ума», он ломает только свой sandbox, а не твою систему. Весь проект — около 500 строк TypeScript. На GitHub 8,4 тысячи звёзд за две недели (создан 31 января 2026). Под капотом Anthropic Agent SDK, то есть работает на Claude. Мне это напоминает подход с [разрешениями в Claude Code](https://matveev.tech/claude-code-permissions-sandbox/), когда контролируешь доступ агента к файлам и командам. NanoClaw делает то же самое, но на уровне ОС. Как [отмечают в Wiz Research](https://www.wiz.io/blog/wiz-research-uncovers-openclaw-risks?ref=matveev.tech), инструменты вроде n8n или Zapier безопаснее именно из-за изоляции. NanoClaw пытается привнести это в мир CLI-агентов. Из минусов: нет экосистемы плагинов, из мессенджеров только WhatsApp, и завязка на Claude означает, что с другими моделями не поработаешь. Вариант для тех, кто работает с чувствительными данными и не хочет рисковать. ## 3\. n8n — автоматизация без CLI [n8n](https://github.com/n8n-io/n8n?ref=matveev.tech) — вообще другая категория. Не CLI-агент, а визуальный редактор workflow-ов. Включил его в подборку, потому что для многих задач автоматизации он решает ту же проблему, что и OpenClaw, только проще. Больше 65 тысяч звёзд на GitHub. Сотни готовых интеграций, drag-and-drop интерфейс, возможность self-hosted. В последних версиях появилась поддержка AI-агентов: можно строить workflow с LLM-вызовами, памятью и инструментами. Каждый шаг workflow видно на экране. Можно отлаживать и тестировать по частям. С CLI-агентами такой наглядности нет. n8n не пишет и не редактирует код. Если нужен агент для работы с репозиторием, [для этого есть Claude Code с агентными командами](https://matveev.tech/claude-code-agent-teams-instrukciya/). Но если задача — автоматизировать процессы между сервисами (отправить письмо, обновить базу, сгенерировать отчёт), n8n справится надёжнее. Self-hosted бесплатный, облако от $20/мес. ## Что в итоге выбрать Зависит от задачи: - Хочешь OpenClaw, но без раздутого кода — **Nanobot** - Работаешь с чувствительными данными — **NanoClaw** - Автоматизируешь процессы, а не код — **n8n** Я лично склоняюсь к связке: Claude Code для работы с кодом (с правильно настроенными [разрешениями и sandbox](https://matveev.tech/claude-code-permissions-sandbox/)) и n8n для автоматизации всего остального. Не знаю, насколько это универсальный совет — у каждого своя специфика. Но мне такое разделение кажется разумным. Рынок альтернатив OpenClaw формируется прямо сейчас. Nanobot и NanoClaw появились буквально в начале февраля. Через полгода выбор станет шире, а инструменты стабильнее. Пока главный тренд: безопасность и простота важнее количества фич. ## FAQ **Можно ли использовать OpenClaw бесплатно?** Сам OpenClaw бесплатный (MIT-лицензия), но для работы нужен API-ключ от LLM-провайдера. Месячные расходы на API — от $30 до $400 в зависимости от интенсивности. Все альтернативы из подборки работают по той же модели: бесплатный инструмент плюс оплата API. **Какая альтернатива OpenClaw самая безопасная?** NanoClaw. Агент работает в изолированном контейнере (Apple Containers на macOS, Docker на Linux). Даже если AI сломается, он не выйдет за пределы sandbox. Для максимальной прозрачности кода — Nanobot: 4000 строк Python можно прочитать за вечер. **Подойдёт ли n8n вместо OpenClaw?** Если задача — автоматизировать бизнес-процессы (отправка писем, обработка данных, интеграции между сервисами), n8n подойдёт даже лучше. Но если нужен агент для работы с кодом и командной строкой, смотри Nanobot или NanoClaw. **Стоит ли ждать, пока OpenClaw станет безопаснее?** Команда OpenClaw работает над этим, но 135 тысяч открытых инстансов и 26% навыков с уязвимостями — проблема не маленькая. ## Что ещё почитать - [OpenClaw (MoltBot): что это за AI-агент и стоит ли ставить в 2026](https://matveev.tech/openclaw-moltbot-obzor/) — подробный обзор самого OpenClaw, история переименований и установка - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — как настроить безопасный доступ для AI-агента, те же принципы, что и в NanoClaw - [Agent Teams в Claude Code: как запустить команду AI-агентов](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентность внутри Claude Code - [19 лучших AI-инструментов для продуктивности в 2026](https://matveev.tech/ai-instrumenty-produktivnost-2026/) — большая подборка с инструментами автоматизации ### OpenClaw (MoltBot): что это за AI-агент и стоит ли ставить в 2026 URL: https://matveev.tech/openclaw-moltbot-obzor/ Last updated: 2026-02-25T12:20:37.000Z **TL;DR:** OpenClaw (бывший Clawdbot, бывший MoltBot) — это open-source AI-агент, который живёт в твоих мессенджерах и получает полный доступ к системе. За две недели набрал 175 000 звёзд на GitHub. Умеет торговаться за машину, оспаривать страховку и автоматизировать CI/CD. Но 26% навыков содержат уязвимости, а 135 000 инстансов торчат в интернет без защиты. Крутая штука, если понимаешь риски. ## Что такое OpenClaw и почему у него три названия Если ты слышал про Clawdbot, потом про MoltBot, а теперь про OpenClaw — это один и тот же проект. История переименований сама по себе показательная. Создатель — [Peter Steinberger](https://steipete.me/?ref=matveev.tech), австрийский разработчик и основатель PSPDFKit (это крупная компания по работе с PDF, если не слышал). В начале января 2026 года он выложил на GitHub проект под названием Clawdbot. Идея простая: автономный AI-агент, который работает через мессенджеры и делает за тебя рутину. Проект взлетел моментально. Но 27 января 2026 года пришло письмо от юристов Anthropic — название Clawdbot слишком похоже на Claude. Steinberger переименовал проект в MoltBot. А через три дня, 30 января, переименовал ещё раз — в OpenClaw. Видимо, MoltBot не зашёл сообществу. Вот такая вот история. Три названия за месяц, 175 000 звёзд на GitHub, MIT-лицензия. По темпам роста это один из самых быстрорастущих open-source проектов в истории — по данным GitTrends, быстрее набирали только Linux и Node.js в своё время. ## Как работает OpenClaw? Архитектура OpenClaw на удивление прямолинейная. Я бы описал её так: это прослойка между LLM и твоей системой, которая общается через мессенджеры. ### Мессенджеры как интерфейс OpenClaw подключается к Telegram, WhatsApp, Slack, Discord, Signal и даже iMessage. Ты пишешь ему сообщение — он выполняет задачу. Никаких отдельных приложений или веб-интерфейсов. Мне это нравится как концепция, хотя на практике не всё так гладко. ### Полный доступ к системе Вот тут начинается самое интересное (и пугающее). OpenClaw получает доступ к: - Shell-командам на твоём сервере - Браузеру через headless Chrome - Файловой системе - Email - Календарю Фактически ты даёшь AI-агенту ключи от всего. Об этом поговорим в разделе про безопасность. ### Heartbeat — агент, который не спит Одна из самых необычных фич — Heartbeat. OpenClaw будит себя каждые 30 минут и проверяет, не нужно ли что-то сделать. Получил письмо от клиента? Агент может ответить сам, не дожидаясь твоей команды. Подошло время события в календаре? Он напомнит или подготовит материалы. Звучит как магия, но на практике это значит, что агент постоянно жрёт API-токены. Об этом тоже ниже. ### Память и навыки Память хранится в обычных Markdown и YAML файлах. Не самое элегантное решение, но зато прозрачное — ты всегда можешь посмотреть, что агент о тебе «помнит», и отредактировать это руками. Навыки (skills) — это что-то вроде плагинов. На ClawHub уже больше 700 community skills. От интеграции с Jira до заказа пиццы. Но с навыками есть серьёзные проблемы с безопасностью — об этом расскажу отдельно. ### Model-agnostic OpenClaw работает с любой LLM: Claude, GPT, DeepSeek, Gemini, локальные модели через Ollama. Мне кажется, это правильный подход — не привязываться к одному провайдеру. Особенно учитывая, как быстро меняется рынок: буквально недавно вышел [GPT-5.3 Codex](https://matveev.tech/gpt-5-3-codex-obzor/), а до этого — [Claude Opus 4.6](https://matveev.tech/claude-opus-4-6-obzor/). Возможность переключаться между моделями — это реальное преимущество. ## Что реально умеет OpenClaw Теория — это хорошо, но что с практикой? Вот реальные кейсы, которые гуляют по сети. ### Торг за автомобиль Один из самых обсуждаемых кейсов: пользователь настроил OpenClaw на переговоры с автодилером через email. Агент вёл переписку две недели, использовал данные о рыночных ценах, находил аналогичные предложения и в итоге выбил скидку $4 200\. Forbes написал об этом как о примере нового поколения AI-агентов. Не знаю, насколько это типичный результат. Думаю, многое зависит от дилера и модели авто. Но сама идея впечатляет. ### Оспаривание страховой Другой кейс — пользователь натравил OpenClaw на страховую компанию, которая отказала в выплате. Агент собрал документы, нашёл прецеденты в открытых базах судебных решений и составил аргументированную претензию. Страховая пересмотрела решение. Тут я бы был осторожен. AI-агент не юрист, и полагаться на него в юридических вопросах целиком — так себе идея. Но как помощник для сбора информации — почему бы и нет. ### Автоматизация CI/CD Для разработчиков, пожалуй, самый полезный кейс. OpenClaw может мониторить пайплайны, анализировать ошибки сборки, предлагать фиксы и даже создавать PR с исправлениями. Вот это, на мой взгляд, реально ценная штука — при условии, что ты настроил правильные ограничения доступа. ## Сколько стоит OpenClaw бесплатный и open-source. Но бесплатность обманчива — ты платишь за API-вызовы к LLM. | Сценарий | Примерная стоимость/мес | Что входит | | ---------------------- | ----------------------- | ------------------------------------------------- | | Лёгкое использование | $30–50 | Пара задач в день, Heartbeat выключен | | Активное использование | $100–200 | 10–20 задач в день, Heartbeat каждые 30 мин | | Полная автоматизация | $200–400 | Всё включено, несколько LLM, постоянный Heartbeat | Суммы зависят от модели. Claude и GPT дороже, DeepSeek и локальные модели через Ollama — дешевле. Heartbeat — главный пожиратель токенов: каждые 30 минут агент «просыпается», анализирует контекст и решает, нужно ли действовать. Это сотни тысяч токенов в день. Для сравнения, managed-хостинг через [Clawezy](https://clawezy.com/?ref=matveev.tech) стоит от $49/мес, но API оплачиваешь отдельно. Думаю, для большинства людей реалистичный бюджет — $100–150 в месяц. ## Насколько безопасен OpenClaw? Безопасность — слон в комнате любого разговора про OpenClaw. Давай поговорим о том, о чём все думают, но не все говорят вслух. ### 135 000 открытых инстансов По данным Cisco Talos, на февраль 2026 года в интернете обнаружено более 135 000 инстансов OpenClaw с дефолтными настройками безопасности. Это значит — без аутентификации, с открытым API, доступные кому угодно. Вдумайся: 135 тысяч серверов, где AI-агент имеет полный доступ к shell, файлам и email. ### CVE-2026-25253 В начале февраля 2026 была опубликована критическая уязвимость CVE-2026-25253 с оценкой CVSS 8.8 из 10\. Через специально сформированный навык злоумышленник мог получить удалённое выполнение кода на сервере с OpenClaw. Патч вышел быстро, но сколько из тех 135 тысяч инстансов обновились? ### 26% навыков с уязвимостями Исследователи из нескольких security-компаний проанализировали навыки на ClawHub. Результат: [26% содержат уязвимости](https://www.theverge.com/news/874011/openclaw-ai-skill-clawhub-extensions-security-nightmare?ref=matveev.tech) разной степени тяжести. От утечки API-ключей до полноценных бэкдоров. The Verge назвал это «кошмаром безопасности», и я не думаю, что это преувеличение. ### Что говорят эксперты Kaspersky, Cisco и VP по безопасности Google — все прямо предупреждают о рисках использования OpenClaw. Основная проблема даже не в конкретных уязвимостях, а в самой архитектуре: ты даёшь AI-агенту полный доступ к системе и надеешься, что всё будет хорошо. Я не говорю, что OpenClaw нельзя использовать. Но если ставишь — выделяй отдельную машину (лучше виртуалку), не храни на ней ничего критичного и обязательно настрой файрвол. Это не тот софт, который ставишь на рабочий ноутбук. Тема безопасности AI-агентов вообще сейчас очень горячая — я уже писал про [разрешения и sandbox в Claude Code](https://matveev.tech/claude-code-permissions-sandbox/), и подходы к изоляции там более зрелые. ## Какие сервисы и инструменты есть для OpenClaw? За пару недель вокруг проекта выросла целая экосистема: - **ClawHub** — маркетплейс навыков, 700+ штук. Аналог npm, но для AI-скиллов - **Clawezy** — managed hosting, если не хочешь возиться с настройкой. От $49/мес - **GoClaw** — мобильное приложение для управления агентом с телефона - **MoltBook** — соцсеть ботов, где агенты могут взаимодействовать друг с другом. Звучит безумно, но это реально существует Скорость появления этих проектов впечатляет. Но она же и настораживает — когда всё растёт так быстро, качество и безопасность обычно страдают. ## Как установить OpenClaw? Честно скажу: установка OpenClaw — не для слабонервных, это точно не «скачал и работает». Тебе понадобятся: 1. Сервер с Linux или macOS (Windows — экспериментально) 2. Docker или нативная установка через CLI 3. API-ключи от выбранной LLM (Claude, GPT, и т.д.) 4. Настройка подключений к мессенджерам (Telegram Bot API, WhatsApp Business API и т.д.) 5. Конфигурация безопасности (которую большинство, судя по 135К открытых инстансов, пропускает) На всё про всё у меня ушло около двух часов, и я не новичок в CLI. Для людей без технического бэкграунда — это практически нереально без Clawezy или подобного сервиса. ## Кому подойдёт OpenClaw, а кому нет? Подойдёт, если: - Ты разработчик или DevOps и хочешь автоматизировать рутину - У тебя есть отдельный сервер или VPS, который не жалко - Ты готов тратить $100+ в месяц на API - Тебе интересны AI-агенты и ты понимаешь риски - Ты хочешь model-agnostic решение без привязки к одному провайдеру Не подойдёт, если: - Ты хочешь «поставил и забыл» — тут так не работает - Безопасность для тебя на первом месте, а времени на настройку нет - Бюджет ограничен — даже $30/мес на API это минимум - Ты не работаешь с CLI — без командной строки не обойтись - Тебе нужен проверенный enterprise-инструмент с SLA Вообще, если тебе интересна тема AI-агентов, но OpenClaw кажется слишком рискованным — посмотри на [Agent Teams в Claude Code](https://matveev.tech/claude-code-agent-teams-instrukciya/). Там подход более контролируемый, хотя и менее автономный. А если хочешь понять, как агенты работают в open-source экосистеме — есть интересный [обзор Kimi K2.5](https://matveev.tech/kimi-k2-5-visual-agentic/) с роем из 100 агентов. ## FAQ ### OpenClaw бесплатный? Сам OpenClaw — да, это open-source под MIT-лицензией. Но ты платишь за API-вызовы к языковым моделям. При активном использовании это $100–200 в месяц. Если использовать локальные модели через Ollama, расходы на API нулевые, но нужно мощное железо — минимум 16 ГБ RAM и GPU. ### Безопасно ли ставить OpenClaw на рабочий компьютер? Короткий ответ — нет. OpenClaw получает полный доступ к системе: shell, файлы, браузер. Эксперты по безопасности из Kaspersky и Cisco рекомендуют использовать его только на изолированных серверах. Выделенная виртуалка без доступа к критичным данным — минимум, который стоит обеспечить. ### Чем OpenClaw отличается от ChatGPT или Claude? ChatGPT и Claude — это чат-боты, которые отвечают на вопросы. OpenClaw — автономный агент, который действует сам. Он может проактивно проверять почту, вести переговоры, мониторить серверы. Ключевое отличие — Heartbeat: агент «просыпается» каждые 30 минут и действует без твоего запроса. ### Можно ли использовать OpenClaw с локальными LLM? Да, OpenClaw поддерживает Ollama и другие локальные модели. Это убирает расходы на API и повышает приватность, потому что данные не уходят на внешние серверы. Минус — нужен мощный компьютер и качество ответов обычно ниже, чем у Claude или GPT. ### Почему OpenClaw так часто переименовывали? Проект стартовал как Clawdbot в январе 2026\. 27 января юристы Anthropic потребовали сменить название из-за сходства с «Claude». Steinberger переименовал в MoltBot, а через три дня — в OpenClaw. Текущее название, похоже, закрепилось. MIT-лицензия и открытый код при этом не менялись. ## Что ещё почитать - [Claude Opus 4.6 — обзор самой умной модели Anthropic](https://matveev.tech/claude-opus-4-6-obzor/) — OpenClaw поддерживает Claude как одну из LLM, в обзоре подробности о модели - [Agent Teams в Claude Code — как запустить команду AI-агентов](https://matveev.tech/claude-code-agent-teams-instrukciya/) — альтернативный подход к AI-агентам с более контролируемой архитектурой - [Kimi K2.5 — китайский open-source с роем из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — ещё один open-source проект в мире AI-агентов - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — как безопасность работает у более зрелых AI-инструментов ### Глава киберзащиты США слил секретные данные в ChatGPT URL: https://matveev.tech/cisa-chatgpt-utechka-sekretnye-dannye/ Last updated: 2026-02-25T12:16:49.000Z > **TL;DR:** Исполняющий обязанности директора главного агентства кибербезопасности США (CISA) загрузил конфиденциальные госдокументы в обычный публичный ChatGPT. До этого он специально выпросил себе доступ к чатботу, хотя остальным сотрудникам его запрещено использовать. Сейчас идёт расследование, а сам руководитель уже проваливал полиграф и пытался убрать из агентства тех, кто ему возражал. Если ты когда-нибудь загружал рабочий документ в ChatGPT и потом думал "ой, а надо ли было" — представь, что ты руководишь кибербезопасностью целой страны. И документы у тебя не табличка с квартальным отчётом, а внутренние контрактные данные правительства. ## Что произошло Мадху Готтумуккала, исполняющий обязанности директора CISA (это Агентство по кибербезопасности и защите инфраструктуры, одна из главных структур в этой области в США), летом прошлого года загрузил конфиденциальные документы в публичную версию ChatGPT. Самое интересное: большинству сотрудников DHS (Министерство внутренней безопасности) доступ к ChatGPT закрыт. У них есть свой внутренний инструмент DHSChat, который не отправляет данные за пределы федеральных сетей. Но Готтумуккала, придя в агентство, попросил специальное разрешение на использование ChatGPT. И получил его. По словам одного из чиновников, это выглядело так, будто он "вынудил CISA дать ему ChatGPT, а потом злоупотребил этим". Загруженные документы не были засекречены в привычном смысле. Они шли с пометкой "только для служебного пользования" — то есть их раскрытие может навредить людям или помешать работе федеральных программ. Не ядерные коды, конечно. Но и не то, что должно попадать в обучающую выборку публичного AI-сервиса с 700 миллионами пользователей. ## А что с расследованием Загрузка вызвала несколько внутренних предупреждений системы безопасности, которая как раз и создана для предотвращения утечек. DHS начало расследование ещё в августе. Готтумуккале могли вынести предупреждение, отправить на переобучение, или даже отозвать допуск к секретным данным. Но закончилось ли расследование — никто публично не подтвердил. Пресс-служба CISA вместо ответа на этот вопрос сообщила, что "доступ был краткосрочным и ограниченным", и что использование ChatGPT соответствовало указу Трампа о внедрении AI в госструктуры. ## Человек, который руководит киберзащитой Думаю, тут стоит рассказать контекст, потому что без него история выглядит как обычная оплошность, а с ним — немного иначе. Готтумуккала попал на эту должность после того, как кандидатуру Шона Плэнки (которого выбрал Трамп) заблокировал сенатор из-за спора о контракте береговой охраны. Кристи Ноэм, глава DHS, поставила Готтумуккалу как временную замену. До этого он работал у неё IT-директором в Южной Дакоте. С тех пор его работу в CISA критикуют с обеих сторон — и демократы, и республиканцы. Вот что накопилось: Он провалил полиграф, когда пытался получить доступ к особо секретной киберразведке. Потом назвал тест "несанкционированным" и обвинил шестерых сотрудников, которые организовали проверку, в нарушении протокола. Их допуски к секретной информации приостановили. Он пытался убрать Роберта Костелло, главного IT-директора CISA, который работал в агентстве четыре года и считался одним из лучших технических специалистов. По данным источников, Костелло часто возражал Готтумуккале по рабочим вопросам. Перевод заблокировали другие политические назначенцы в DHS. Под его руководством агентство сократилось с 3400 до 2400 сотрудников. Конгресс на слушаниях в январе спрашивал, не подрывает ли это национальную безопасность. Готтумуккала не смог назвать ожидаемое число кибератак на промежуточные выборы 2026 года. Конгрессмен Тони Гонсалес прямо сказал: "У нас должна быть эта цифра". Сейчас Готтумуккала обещает "нанять людей обратно" в 2026 году, признавая, что вакансии в агентстве достигают 40% по ключевым направлениям. ## Почему это не просто курьёз Мне кажется, тут проблема глубже, чем один человек и один неправильный промпт. Есть правило: если ты руководишь кибербезопасностью, ты должен понимать, как работают инструменты, которые используешь. Не на уровне "о, ChatGPT, удобненько", а на уровне "данные, которые я туда загружаю, могут быть использованы для обучения модели и всплыть в ответах другим пользователям". Это, в общем, базовая вещь, которую знает любой человек, читавший пользовательское соглашение OpenAI. Или не читавший, но хотя бы слышавший про утечку данных Samsung через ChatGPT в 2023 году. А ещё это хорошее напоминание для всех нас. Корпоративные данные, код, внутренние документы — всё это не стоит заливать в публичные AI-сервисы. У большинства крупных компаний для этого есть свои инструменты (как тот самый DHSChat). ## Что ещё почитать - [Как AI помогает хакерам проникать в офисы](https://matveev.tech/ai-pomogaet-hakeram-v-realnom-mire/) — ещё один пример того, как AI и безопасность пересекаются не самым приятным образом - [19 лучших AI-инструментов для продуктивности в 2026](https://matveev.tech/ai-instrumenty-produktivnost-2026/) — если хочешь использовать AI на работе, но безопасно - [Предсказания на 2026 — что думают инженеры Oxide о будущем AI и разработки](https://matveev.tech/predicty-oxide-2026/) — про будущее AI в госструктурах тоже есть мысли ### Память Claude Code — auto memory, rules и CLAUDE.md URL: https://matveev.tech/claude-code-memory-auto-rules/ Last updated: 2026-02-13T10:01:17.000Z > **TL;DR:** У Claude Code два вида памяти: CLAUDE.md (ты пишешь инструкции) и auto memory (Claude сам записывает полезное). Плюс система правил в `.claude/rules/`, импорты файлов и организационные политики. Всё загружается при старте сессии и помогает Claude понимать проект без повторных объяснений. Каждый раз, когда ты запускаешь Claude Code, он начинает с чистого листа. Не помнит, что вы обсуждали вчера, не знает, что у тебя тесты запускаются через `pnpm test`, а не `npm test`. Точнее — не знал, пока не появилась нормальная система памяти. Сейчас в Claude Code есть несколько слоёв памяти, и если настроить их правильно, ощущение совсем другое. Claude помнит контекст, следует конвенциям, не задаёт одни и те же вопросы. ## Два типа памяти Принципиально разных: **CLAUDE.md** — файлы, которые пишешь ты. Инструкции, правила, описание проекта. Claude читает их как руководство к действию. **Auto memory** — заметки, которые Claude пишет сам. Паттерны проекта, решения багов, архитектурные наблюдения. Он записывает то, что считает полезным для будущих сессий. Оба типа загружаются при старте каждой сессии. CLAUDE.md — полностью. Auto memory — первые 200 строк основного файла `MEMORY.md`, остальное Claude подгружает по необходимости. ## Иерархия CLAUDE.md У CLAUDE.md есть шесть уровней, от самого широкого к самому узкому: | Уровень | Где лежит | Для кого | | -------------- | --------------------------------------------------------- | -------------------------------- | | Managed policy | /Library/Application Support/ClaudeCode/CLAUDE.md (macOS) | Вся организация. Ставит IT-отдел | | User memory | \~/.claude/CLAUDE.md | Ты, во всех проектах | | Project memory | ./CLAUDE.md или ./.claude/CLAUDE.md | Команда (коммитится в git) | | Project rules | ./.claude/rules/\*.md | Команда, модульные правила | | Local memory | ./CLAUDE.local.md | Только ты, только этот проект | | Auto memory | \~/.claude/projects//memory/ | Только ты (Claude пишет сам) | Claude загружает всё это при старте. Более специфичные инструкции перекрывают более общие. Если в user memory написано «используй tabs», а в project memory «используй spaces» — победит project. CLAUDE.md файлы в родительских директориях загружаются автоматически. Если ты запускаешь Claude Code в `foo/bar/`, он прочитает и `foo/CLAUDE.md`, и `foo/bar/CLAUDE.md`. А вот файлы в дочерних директориях загружаются лениво — только когда Claude начинает работать с файлами оттуда. ## Auto memory — Claude записывает сам Это относительно новая фича, и мне она нравится. Claude замечает паттерны в проекте и сохраняет их в отдельную директорию. Что он может записать: - Команды сборки и тестирования, которые ты используешь - Решения нетривиальных багов — чтобы не отлаживать одно и то же дважды - Архитектурные заметки: какие модули за что отвечают, как связаны - Твои предпочтения: стиль коммуникации, какие инструменты любишь Всё хранится в `~/.claude/projects//memory/`: ``` memory/ ├── MEMORY.md # Индекс — загружается при старте (первые 200 строк) ├── debugging.md # Заметки про отладку ├── api-conventions.md # Решения по API └── ... ``` `MEMORY.md` — это оглавление. Claude старается держать его компактным и выносить детали в отдельные файлы. Отдельные файлы не загружаются при старте — Claude читает их, когда ему нужна конкретная информация. ### Управление auto memory Можно попросить Claude запомнить что-то конкретное: «запомни, что мы используем pnpm, а не npm» или «сохрани в память, что для API-тестов нужен локальный Redis». Claude запишет это в свои файлы. Файлы памяти — обычный markdown, их можно редактировать вручную. Команда `/memory` откроет файл в системном редакторе. Если auto memory не нравится, можно отключить: ```bash export CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 # Отключить export CLAUDE_CODE_DISABLE_AUTO_MEMORY=0 # Принудительно включить ``` Фича пока раскатывается постепенно — если не видишь auto memory, поставь `CLAUDE_CODE_DISABLE_AUTO_MEMORY=0`. ## Модульные правила в .claude/rules/ Для больших проектов один CLAUDE.md может стать неуправляемым. Директория `.claude/rules/` позволяет разбить инструкции по файлам: ``` .claude/rules/ ├── frontend/ │ ├── react.md │ └── styles.md ├── backend/ │ ├── api.md │ └── database.md └── testing.md ``` Все `.md` файлы подхватываются рекурсивно. Каждый файл — одна тема. Это удобнее, чем один гигантский CLAUDE.md. ### Условные правила по путям Самая интересная часть. Правила можно привязать к конкретным файлам через frontmatter: ```markdown --- paths: - "src/api/**/*.ts" --- # Правила API - Все эндпоинты должны валидировать входные данные - Использовать стандартный формат ответа с ошибками - Добавлять OpenAPI-комментарии ``` Эти правила загружаются только когда Claude работает с файлами в `src/api/`. Для остальных файлов они не видны — не засоряют контекст. Поддерживаются glob-паттерны: - `**/*.ts` — все TypeScript-файлы - `src/components/*.tsx` — React-компоненты в конкретной папке - `src/**/*.{ts,tsx}` — TypeScript и TSX через фигурные скобки Правила без `paths` загружаются всегда, как обычный CLAUDE.md. ### Пользовательские правила Можно создать правила для всех проектов в `~/.claude/rules/`: ``` ~/.claude/rules/ ├── preferences.md # Личные предпочтения └── workflows.md # Любимые рабочие процессы ``` Они загружаются до проектных правил, поэтому проектные имеют приоритет. ## Импорты — ссылки на другие файлы CLAUDE.md поддерживает импорт файлов через синтаксис `@path/to/file`: ```markdown Смотри @README для описания проекта и @package.json для npm-команд. # Дополнительные инструкции - Git workflow @docs/git-instructions.md ``` Пути могут быть относительными (от файла, содержащего импорт) или абсолютными. Импорты рекурсивные — импортированный файл может импортировать другие, до 5 уровней вложенности. Полезный паттерн для git worktrees: вместо CLAUDE.local.md (который существует только в одном worktree), можно импортировать файл из домашней директории: ```markdown # Личные настройки - @~/.claude/my-project-instructions.md ``` Тогда все worktrees подхватят одни и те же личные инструкции. При первом обнаружении импортов Claude Code покажет диалог подтверждения. Это одноразовое решение — если отклонишь, импорты останутся отключёнными для этого проекта. ## Быстрый старт с /init Если у тебя ещё нет CLAUDE.md, самый простой способ начать: ``` > /init ``` Claude Code проанализирует проект и создаст базовый CLAUDE.md с описанием стека, командами и основными правилами. Не идеально, но хорошая отправная точка — дальше допилишь вручную. ## Мои рекомендации по организации памяти После нескольких месяцев работы с Claude Code у меня сложился такой подход: **User memory** (`~/.claude/CLAUDE.md`) — минимально. Язык ответов, пара личных предпочтений. 10-15 строк. **Project CLAUDE.md** — описание проекта, стек, основные команды, критичные конвенции. 50-100 строк. Коммитится в git. **`.claude/rules/`** — для проектов побольше. Отдельный файл на каждую тему: testing.md, api.md, code-style.md. С path-условиями где уместно. **CLAUDE.local.md** — личные URL (staging, sandbox), тестовые данные, эксперименты. **Auto memory** — не трогаю. Пусть Claude пишет свои заметки. Иногда захожу через `/memory` и удаляю устаревшее. Главное правило: будь конкретным. «Используй 2 пробела для отступов» лучше, чем «форматируй код правильно». Claude интерпретирует инструкции буквально — чем точнее напишешь, тем точнее выполнит. ## Часто задаваемые вопросы **Auto memory занимает место в контекстном окне?** Да, но только первые 200 строк MEMORY.md. Отдельные файлы (debugging.md, patterns.md) загружаются по запросу. Поэтому Claude старается держать MEMORY.md компактным. **Можно ли шарить auto memory между разработчиками?** Нет, auto memory хранится локально в `~/.claude/projects/`. Для общих знаний используй CLAUDE.md и `.claude/rules/` — они коммитятся в git. **Как сбросить auto memory проекта?** Удали директорию `~/.claude/projects//memory/`. Claude Code пересоздаст её при следующей сессии с нуля. **Работают ли symlink-и в .claude/rules/?** Да. Можно сделать симлинк на общие правила из другого репозитория или домашней директории. Циклические ссылки обрабатываются корректно. **Как посмотреть, какие файлы памяти загружены?** Команда `/memory` покажет все загруженные файлы памяти: CLAUDE.md, rules, auto memory. ## Что ещё почитать - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — детальный гайд по написанию инструкций - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общая конфигурация - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — философия памяти в AI-системах - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если используешь Claude Code не только для кода ### GLM-5 от Zhipu — лучшая open-source модель 2026 URL: https://matveev.tech/glm-5-zhipu-open-source-obzor/ Last updated: 2026-02-12T20:52:33.000Z > TL;DR: Zhipu AI выпустила GLM-5 — open-source модель на 744B параметров с MIT-лицензией. По бенчмаркам это лучшая открытая модель для кодинга и агентных задач, а на некоторых тестах она подбирается вплотную к Claude Opus 4.5. ## Кто такие Zhipu и зачем им ещё одна модель Zhipu AI — китайская компания, которая развивает линейку моделей GLM. Если ты следил за предыдущими релизами, то помнишь GLM-4.5 и [GLM-4.7](https://matveev.tech/glm-4-7-zhipu/). Новая GLM-5 — не инкрементальное обновление, а серьёзный скачок. Компания позиционирует модель для сложных инженерных задач и долгосрочных агентных сценариев. Модель доступна на [HuggingFace](https://huggingface.co/?ref=matveev.tech) и [ModelScope](https://modelscope.cn/?ref=matveev.tech) под MIT-лицензией. Можно брать и использовать в коммерческих проектах без ограничений. ## Что внутри GLM-5 выросла до 744 миллиардов параметров, из которых 40 миллиардов активны (архитектура Mixture of Experts). Для сравнения: GLM-4.5 была 355B с 32B активными. Данные для обучения тоже увеличились — с 23 до 28.5 триллионов токенов. Интересная деталь: GLM-5 использует DeepSeek Sparse Attention (DSA). Это технология от DeepSeek, которая снижает стоимость деплоя и при этом сохраняет работу с длинным контекстом. Получается, китайские AI-компании активно заимствуют друг у друга лучшие наработки. Для обучения с подкреплением в Zhipu разработали собственную инфраструктуру slime — асинхронный RL-фреймворк. По их данным, это позволило ускорить пост-тренинг и делать более тонкие итерации при файн-тюнинге. ## Как выглядят бенчмарки Тут начинается самое интересное. Собрал ключевые цифры в таблицу: | Бенчмарк | GLM-5 | DeepSeek-V3.2 | Kimi K2.5 | Claude Opus 4.5 | GPT-5.2 | | ---------------------- | ------ | ------------- | --------- | --------------- | ------- | | SWE-bench Verified | 77.8 | 73.1 | 76.8 | 80.9 | 80.0 | | SWE-bench Multilingual | 73.3 | 70.2 | 73.0 | 77.5 | 72.0 | | Terminal-Bench 2.0 | 56.2 | 39.3 | 50.8 | 59.3 | 54.0 | | BrowseComp | 62.0 | 51.4 | 60.6 | 37.0 | — | | Vending Bench 2 | $4,432 | $1,034 | $1,198 | $4,967 | $3,591 | | AIME 2026 I | 92.7 | 92.7 | 92.5 | 93.3 | — | Несколько наблюдений. На SWE-bench Verified — стандартном тесте для кодинга — GLM-5 набирает 77.8%. Лучший результат среди всех open-source моделей. Claude Opus 4.5 впереди с 80.9%, но разрыв меньше 3 процентных пунктов. GPT-5.2 на уровне 80%. На BrowseComp, который оценивает навигацию по вебу, GLM-5 обгоняет Claude Opus 4.5 — 62.0 против 37.0\. С context management разрыв сокращается (75.9 у GLM-5, 67.8 у Claude), но всё равно заметный. Vending Bench 2 — необычный тест, где модель управляет вендинговым бизнесом на горизонте в один год. GLM-5 заработала $4,432, почти догнав Claude Opus 4.5 ($4,967). Для open-source модели это первое место. Тестирование проводилось независимо лабораторией Andon Labs. В математике (AIME 2026) все топовые модели идут ноздря в ноздрю — разница в десятых долях процента. Где GLM-5 проигрывает: GPQA-Diamond (86.0 против 91.9 у Gemini 3.0 Pro) и Tool-Decathlon (38.0 против 46.3 у GPT-5.2). До универсального лидерства пока далеко. ## Генерация документов GLM-5 умеет создавать .docx, .pdf и .xlsx файлы из текстовых описаний. Техзадания, учебные планы, финансовые отчёты — модель собирает в готовые документы. На Z.ai для этого есть Agent mode с встроенными навыками. Я не тестировал эту фичу лично, поэтому не могу сказать, насколько хорошо это работает на практике. Но сама идея перехода от «чата» к «рабочему инструменту» выглядит правильной. ## Как попробовать Через [Z.ai](https://z.ai/?ref=matveev.tech) — бесплатный чат и агентный режим. Нужно вручную выбрать модель GLM-5 в настройках. Через Claude Code — если подписан на GLM Coding Plan (Max-тариф). Достаточно прописать `"GLM-5"` в `~/.claude/settings.json`. Учти, что GLM-5 съедает больше квоты, чем GLM-4.7. Локально — веса на HuggingFace под MIT-лицензией. Поддерживаются vLLM и SGLang для инференса. Кроме NVIDIA, работает на чипах Huawei Ascend, Moore Threads и других китайских процессорах. Подробные инструкции на [GitHub Zhipu](https://github.com/THUDM?ref=matveev.tech). Ещё есть OpenClaw — фреймворк, который превращает GLM-5 в ассистента для управления приложениями и устройствами. Входит в GLM Coding Plan. ## Вывод GLM-5 — на сегодня сильнейшая open-source модель для кодинга и агентных задач. MIT-лицензия, совместимость с популярными инструментами, конкурентные бенчмарки. Разрыв с закрытыми моделями типа Claude Opus 4.5 и GPT-5.2 сократился до нескольких процентных пунктов. Стоит ли переключаться? Если работаешь с open-source — однозначно стоит попробовать. Если используешь Claude или GPT — скорее нет, закрытые модели пока впереди на большинстве задач. Но тенденция очевидна: open-source догоняет. ## Что ещё почитать - [Claude Opus 4.6 — обзор самой умной модели Anthropic](https://matveev.tech/claude-opus-4-6-obzor/) — сравниваем с GLM-5 в бенчмарках выше - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — ещё одно сравнение топовых моделей - [Kimi K2.5 — китайский open-source с роем агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — другая сильная open-source модель из Китая ## FAQ **Сколько параметров в GLM-5?** 744 миллиарда общих параметров, из которых 40 миллиардов активны одновременно. Используется архитектура Mixture of Experts, обучение на 28.5 триллионах токенов. **Можно ли использовать GLM-5 в коммерческих проектах?** Да. Модель распространяется под MIT-лицензией. Ограничений на коммерческое использование нет. **Как GLM-5 сравнивается с Claude Opus 4.5?** На SWE-bench Verified GLM-5 набирает 77.8% против 80.9% у Claude Opus 4.5\. На задачах веб-навигации GLM-5 иногда выигрывает. В целом Claude пока впереди, но разрыв сокращается. **Где скачать веса GLM-5?** На HuggingFace и ModelScope. Для локального запуска поддерживаются vLLM и SGLang. Инструкции на GitHub-репозитории Zhipu. ### ChatGPT Deep Research перешёл на GPT-5.2 — что изменилось URL: https://matveev.tech/chatgpt-deep-research-gpt-5-2/ Last updated: 2026-02-25T12:16:50.000Z > TL;DR: OpenAI обновили Deep Research в ChatGPT. Теперь он работает на GPT-5.2, умеет искать только по конкретным сайтам через MCP и позволяет вмешиваться в процесс исследования прямо по ходу работы. Если ты пользовался Deep Research в ChatGPT, то знаешь ощущение: запускаешь запрос, ждёшь 5-30 минут, получаешь отчёт с кучей источников. Удобно, но бесило то, что после запуска ты просто сидишь и смотришь, как оно крутится. Даже если через минуту понял, что запрос стоило сформулировать иначе. Теперь это наконец починили. ## GPT-5.2 вместо o3 До этого обновления Deep Research работал на модели o3 для полных исследований и на облегчённой o4-mini для быстрых запросов. Какая именно модель запускалась, зависело от тарифного плана и квоты. Теперь OpenAI перевели всё на GPT-5.2\. По их словам, качество отчётов должно вырасти. Насколько именно, пока непонятно, потому что никаких бенчмарков конкретно для Deep Research не показали. Но GPT-5.2 в целом новее и умнее предшественников, так что логично ожидать улучшений. Или хотя бы отсутствия регрессий. 0:00 /1:19 1× ## Поиск по конкретным сайтам через MCP Вот это, на мой взгляд, самое интересное из обновления. Раньше Deep Research шерстил весь интернет. С одной стороны, охват большой. С другой, в отчёт попадал мусор с сомнительных сайтов, и доверять такому результату было сложно. Теперь можно подключить Deep Research к MCP-серверам или приложениям и ограничить поиск конкретными источниками. Хочешь отчёт только по данным из PubMed и arXiv? Настраиваешь. Нужен анализ по внутренней документации компании? Тоже можно. Для тех, кто использует Deep Research по работе, а не просто ради любопытства, это меняет многое. Когда отчёт строится на проверенных отраслевых источниках, а не на всём подряд, ему можно доверять. ## Управление исследованием в реальном времени Ещё одна штука, которую давно просили. Раньше после запуска исследования ты просто ждал. Даже если понял, что промахнулся с формулировкой, приходилось дожидаться финала и запускать всё заново. Теперь можно следить за прогрессом и вмешиваться на ходу: скорректировать направление, добавить уточняющий промпт или подкинуть новые источники прямо в процессе. По сути, это уже не «запустил и жди», а диалог с исследовательским агентом. Думаю, именно это изменение пользователи оценят больше всего. Потому что 20 минут ожидания с неправильным запросом — это реально больно. ## Обновлённый интерфейс Заодно обновили визуал. Финальный отчёт теперь открывается в полноэкранном режиме с оглавлением для навигации. Можно скачать в PDF или DOCX и поделиться. Мелочь, но удобно. ## Что в итоге Из всех нововведений MCP-интеграция кажется мне самой важной. Она превращает Deep Research из «умного гугления» в инструмент для работы с конкретными базами знаний. GPT-5.2 под капотом тоже не помешает, хотя без сравнительных тестов сложно сказать, насколько заметна разница на практике. Если у тебя ChatGPT Plus или Pro, обновление должно быть уже доступно. ## Часто задаваемые вопросы **Что такое Deep Research в ChatGPT?** Это функция, которая автоматически ищет информацию в интернете, анализирует данные и собирает подробный отчёт с источниками. Весь процесс занимает от 5 до 30 минут в зависимости от сложности запроса. **Чем GPT-5.2 лучше o3 для исследований?** OpenAI говорит, что GPT-5.2 лучше работает с анализом данных и веб-поиском. Конкретных бенчмарков для Deep Research пока нет, но модель новее и в целом умнее предыдущих. **Можно ли ограничить Deep Research конкретными сайтами?** Да, теперь можно подключить MCP-серверы или приложения и указать, по каким именно источникам строить отчёт. Это полезно для профессиональных исследований, где важна надёжность данных. ## Что ещё почитать - [GPT-5.3 Codex Spark — 1000 токенов/с на чипах Cerebras](https://matveev.tech/gpt-5-3-codex-spark-cerebras/) — последнее из линейки GPT - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух топовых моделей - [GPT-5.3 Codex — модель, которая помогала создавать саму себя](https://matveev.tech/gpt-5-3-codex-obzor/) — подробный обзор предыдущей версии ### GPT-5.3 Codex Spark — 1000 токенов/с на чипах Cerebras URL: https://matveev.tech/gpt-5-3-codex-spark-cerebras/ Last updated: 2026-02-12T19:55:24.000Z > **TL;DR:** OpenAI выпустила Codex Spark — компактную версию GPT-5.3 Codex для кодинга в реальном времени. Модель работает на чипах Cerebras, выдаёт больше 1000 токенов в секунду и доступна в research preview для подписчиков ChatGPT Pro. OpenAI выпустила Codex Spark — уменьшенную версию GPT-5.3 Codex, заточенную под мгновенные правки кода. Работает на специализированных чипах Cerebras с отдачей 1000+ токенов в секунду. Пока доступна только для ChatGPT Pro в режиме research preview. ## Что такое Codex Spark Если коротко — это облегчённый GPT-5.3 Codex. Модель оптимизирована под интерактивную работу: ты пишешь код, она мгновенно правит, рефакторит или дописывает. Не автономная работа на часы, а диалог в реальном времени. Характеристики на старте: - Скорость — более 1000 токенов/с - Контекстное окно — 128k токенов - Только текст, мультимодальность обещают позже - Отдельные лимиты, не пересекаются с основными моделями На бенчмарках [SWE-Bench Pro](https://www.swebench.com/?ref=matveev.tech) и Terminal-Bench 2.0 (оба оценивают агентную разработку) Spark показывает сильные результаты, выполняя задачи за долю времени полного Codex. Конкретных цифр OpenAI не приводит, что немного раздражает — хотелось бы видеть точные проценты. ## Зачем OpenAI понадобился Cerebras Codex Spark работает на Cerebras Wafer Scale Engine 3 — специализированном чипе для инференса с минимальной задержкой. Партнёрство с Cerebras OpenAI объявили ещё в январе 2026 года, и Spark стал первым результатом. Шон Лай, CTO и сооснователь Cerebras, говорит: «Нас больше всего вдохновляет возможность вместе с OpenAI и сообществом разработчиков понять, что становится возможным с быстрым инференсом — новые паттерны взаимодействия, новые сценарии». GPU при этом никуда не деваются. OpenAI продолжает использовать их для обучения и обычного инференса. Cerebras дополняет: для задач с минимальной задержкой идут чипы Cerebras, для всего остального — GPU. По словам OpenAI, их можно комбинировать в рамках одной задачи. ## Что конкретно улучшили по скорости Помимо модели, OpenAI переработали всю инфраструктуру запросов. Вот цифры: - Задержка round-trip клиент-сервер снижена на 80% - Overhead на каждый токен — на 30% - Time-to-first-token (время до первого токена) — на 50% Добились этого через persistent WebSocket вместо обычных HTTP-запросов и оптимизации внутри Responses API. WebSocket включён для Spark по умолчанию и скоро станет стандартом для всех моделей OpenAI. Думаю, это даже важнее самого Spark. Улучшения инфраструктуры коснутся всех моделей, не только этой. ## Как это выглядит на практике Codex теперь работает в двух режимах. Spark — для быстрых правок. Поменять логику, отрефакторить функцию, поправить интерфейс. Ответ приходит почти мгновенно. По умолчанию модель делает минимальные точечные правки и не запускает тесты, пока ты сам не попросишь. Её можно прерывать и перенаправлять прямо во время работы. Полный Codex — для долгих задач. Написать модуль с нуля, провести масштабный рефакторинг, работать автономно часами или даже днями. В будущем OpenAI обещает, что режимы сольются. Ты общаешься в реальном времени, а Codex параллельно делегирует долгие задачи суб-агентам или раскидывает работу на несколько моделей одновременно. Звучит интересно, но пока это только планы. 0:00 /0:47 1× ## Кому доступен Codex Spark Пока это research preview с ограниченным доступом: - ChatGPT Pro — через приложение Codex, CLI и VS Code extension - API — для узкого круга дизайн-партнёров - Расширение доступа обещают в ближайшие недели Лимиты отдельные и могут меняться в зависимости от нагрузки. При высоком спросе возможны очереди. --- Мне кажется, OpenAI делает правильный ход. У GPT-5.3 Codex проблема была не в качестве — модель и так сильная. Проблема в скорости. Ждать минуту-две ответа при интерактивном кодинге невозможно. Ты теряешь контекст, отвлекаешься, и работа идёт рывками. Anthropic решает похожую задачу через [Fast Mode в Claude Code](https://matveev.tech/claude-code-fast-mode/) — тот же Opus 4.6, но с ускоренной генерацией. OpenAI пошли дальше: сделали отдельную модель плюс переписали инфраструктуру. Не знаю пока, какой подход лучше на практике — нужно тестировать обе. Правда, пока это research preview только для Pro-подписчиков (200$/мес). Массовое использование ещё впереди. Но направление верное: если AI-ассистент для кода не отвечает мгновенно, им просто не хочется пользоваться. ## Часто задаваемые вопросы ### Codex Spark бесплатный? Нет. Модель доступна только подписчикам ChatGPT Pro за $200/мес. В API — для узкого круга партнёров. Когда расширят доступ и сколько будет стоить отдельно, OpenAI пока не сообщают. ### Чем Spark отличается от обычного GPT-5.3 Codex? Spark компактнее и быстрее. Заточен под мгновенные правки и интерактивную работу. Полный Codex — под долгие автономные задачи на часы и дни. На сложных задачах Spark уступает, но для повседневного кодинга хватает. ### Работает ли Spark с изображениями? Пока нет — модель текстовая с контекстом 128k токенов. Мультимодальный ввод OpenAI обещают добавить в следующих обновлениях. ### Можно ли использовать через API? Сейчас API открыт только для дизайн-партнёров. Расширение доступа планируется по мере отладки интеграции под реальными нагрузками. ## Что ещё почитать - [GPT-5.3 Codex — модель, которая помогала создавать саму себя](https://matveev.tech/gpt-5-3-codex-obzor/) — полный обзор основной модели - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух топовых моделей для кода - [Fast Mode в Claude Code](https://matveev.tech/claude-code-fast-mode/) — как Anthropic решает ту же задачу со скоростью ### Плагины Claude Code — как расширить возможности URL: https://matveev.tech/claude-code-plugins-marketplaces/ Last updated: 2026-02-12T18:23:57.000Z > **TL;DR:** В Claude Code есть система плагинов — пакеты, которые добавляют навыки (skills), агенты, hooks и MCP-серверы. Устанавливаются из маркетплейсов через команду `/plugin`. Можно ставить из GitHub, npm, git-репозиториев или локальных директорий. Когда я впервые услышал про плагины в Claude Code, подумал: «Ну вот, ещё одна система расширений». Но когда попробовал — оказалось, что это действительно меняет рабочий процесс. Плагин Claude Superpowers, например, научил Claude думать перед тем, как писать код. Без шуток — модель стала планировать, а не бросаться редактировать файлы. ## Что внутри плагина Плагин — это пакет, который может содержать один или несколько компонентов: - **Skills** — навыки, которые Claude может вызывать. Специализированные промпты с инструкциями для конкретных задач - **Agents** — субагенты, специализированные AI-помощники с ограниченным набором инструментов - **Hooks** — автоматические действия при событиях (редактирование файла, старт сессии) - **MCP servers** — внешние серверы инструментов для расширения возможностей Необязательно все четыре — плагин может содержать только skills, или только hooks. ## Как установить плагин Основной способ — команда `/plugin` в Claude Code. Она открывает интерактивный интерфейс: 1. Набери `/plugin` в Claude Code 2. Выбери «Browse marketplace» или «Add marketplace» 3. Найди нужный плагин 4. Подтверди установку Плагины ставятся из маркетплейсов — реестров, которые хранят метаданные и код плагинов. ## Маркетплейсы Маркетплейс — источник плагинов. Типы: - **GitHub** — репозиторий на GitHub с файлом `marketplace.json` - **Git** — любой git-репозиторий (GitLab, Bitbucket, self-hosted) - **npm** — npm-пакет - **URL** — JSON-файл по ссылке - **Directory** — локальная директория (для разработки плагинов) Добавить маркетплейс: ```json { "extraKnownMarketplaces": { "my-tools": { "source": { "source": "github", "repo": "username/claude-plugins" } } } } ``` Это в проектном `.claude/settings.json` — тогда маркетплейс автоматически предложится всей команде. ## Управление плагинами через settings Включение и отключение плагинов: ```json { "enabledPlugins": { "code-formatter@team-tools": true, "experimental-stuff@personal": false } } ``` Формат: `plugin-name@marketplace-name`. Можно задать в user settings (для всех проектов), project settings (для команды) или local settings (для себя). ## Полезные плагины Я не буду составлять огромный каталог, потому что экосистема пока молодая и меняется быстро. Но вот что стоит посмотреть: **Claude Superpowers** — набор навыков, которые учат Claude Code планировать перед кодингом, проводить code review, дебажить систематически. Я писал отдельный обзор — штука полезная, особенно навык brainstorming перед реализацией фич. **Code intelligence плагины** — подключают языковые серверы (LSP). Claude начинает видеть ошибки типов, переходить к определениям, находить ссылки. Без LSP-плагина Claude ориентируется только по тексту — с ним становится заметно точнее. Остальные плагины зависят от стека. Если твоя команда использует специфические инструменты — скорее всего, стоит написать свой плагин. ## Создание своего плагина Плагин — это директория с файлом `.claude-plugin/marketplace.json` (для маркетплейса) или набор файлов skills/agents/hooks. Структура минимального плагина: ``` my-plugin/ ├── .claude-plugin/ │ └── marketplace.json ├── skills/ │ └── my-skill/ │ └── SKILL.md └── agents/ └── my-agent.md ``` `SKILL.md` — markdown-файл с инструкциями для Claude. По сути, промпт, который загружается при вызове навыка. `my-agent.md` — описание субагента с YAML-frontmatter для конфигурации. Для разработки удобно использовать маркетплейс типа `directory`, который указывает на локальную папку. Изменения подхватываются без переустановки. ## Автообновление плагинов По умолчанию плагины обновляются автоматически вместе с Claude Code. Если автообновления отключены (`DISABLE_AUTOUPDATER=1`), можно принудительно обновлять плагины: ```bash FORCE_AUTOUPDATE_PLUGINS=true ``` Или обновить вручную через `/plugin` → «Update plugins». ## Безопасность плагинов Вопрос доверия. Плагин может содержать hooks, которые выполняют произвольные команды. Поэтому: - Устанавливай плагины только из доверенных источников - В корпоративной среде используй `strictKnownMarketplaces` для ограничения маркетплейсов - Просматривай код плагина перед установкой — это просто markdown-файлы и JSON Claude Code запрашивает подтверждение при установке плагина из нового маркетплейса. Не жми «Yes» не глядя. ## Часто задаваемые вопросы **Плагины замедляют Claude Code?** Skills и agents загружаются только при вызове. Hooks запускаются при каждом событии, но обычно это быстрые команды. MCP-серверы из плагинов стартуют при начале сессии — если сервер тяжёлый, это добавит пару секунд. **Как удалить плагин?** Через `/plugin` → выбери установленный плагин → «Uninstall». Или удали запись из `enabledPlugins` в settings.json. **Можно ли использовать плагины в CI/CD?** Да, но нужно предустановить их. В CI-среде нет интерактивного `/plugin` — всё настраивается через settings.json и переменные окружения. **Плагины работают с Bedrock/Vertex/Foundry?** Да, плагины не зависят от провайдера модели. Они работают на уровне Claude Code, а не API. ## Что ещё почитать - [Claude Superpowers — плагин, который учит Claude думать](https://matveev.tech/claude-superpowers-plugin/) — обзор популярного плагина - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общая настройка - [Claude Code для команд — Team и Enterprise](https://matveev.tech/claude-code-team-enterprise/) — контроль плагинов в организации - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — MCP-серверы как альтернатива плагинам ### Claude Code для команд — настройка Team и Enterprise URL: https://matveev.tech/claude-code-team-enterprise/ Last updated: 2026-02-12T14:20:33.000Z > **TL;DR:** Claude Code можно настроить для всей команды через project settings и для всей организации через managed settings. Admins контролируют разрешения, MCP-серверы, плагины, hooks. Конфигурация одинаковая для всех — никто не забудет включить линтер или отключить доступ к секретам. Один разработчик с Claude Code — это просто. Настроил под себя, работаешь. Десять разработчиков — начинаются проблемы. У каждого свои настройки, разные permissions, кто-то дал Claude доступ к `.env`, кто-то отключил sandbox. Managed settings решают это. ## Project settings — для команды Самый простой способ стандартизировать Claude Code в команде — проектные настройки. Файл `.claude/settings.json` коммитится в git, и все получают одинаковую конфигурацию. ```json { "$schema": "https://json.schemastore.org/claude-code-settings.json", "permissions": { "allow": [ "Bash(npm run lint)", "Bash(npm run test *)", "Bash(npm run build)" ], "deny": [ "Read(./.env)", "Read(./.env.*)", "Read(./secrets/**)", "Read(./config/credentials.*)" ] }, "hooks": { "PostToolUse": [ { "matcher": "Edit|Write", "hooks": [ { "type": "command", "command": "npx prettier --write \"$CLAUDE_FILE_PATH\" 2>/dev/null || true" } ] } ] } } ``` Что даёт: у всех запрещено читать .env-файлы, разрешены стандартные команды, после каждого редактирования файл форматируется. Один файл — одни правила. Если разработчику нужны личные настройки поверх проектных — `.claude/settings.local.json`. Он в gitignore и перекрывает project settings. ## Managed settings — для организации Managed settings — уровень выше. Это конфиги, которые IT-администратор деплоит на машины сотрудников. Их нельзя перебить ни project settings, ни user settings. Расположение файла: - macOS: `/Library/Application Support/ClaudeCode/managed-settings.json` - Linux: `/etc/claude-code/managed-settings.json` Обрати внимание — это системные пути, не домашняя директория. Нужны права администратора. ```json { "permissions": { "deny": [ "Bash(curl *)", "Bash(wget *)", "WebFetch" ], "disableBypassPermissionsMode": "disable" }, "allowManagedHooksOnly": true } ``` `disableBypassPermissionsMode: "disable"` — блокирует флаг `--dangerously-skip-permissions`. Никто не сможет обойти ограничения даже при желании. `allowManagedHooksOnly` — разрешает только hooks из managed settings. Разработчики не смогут добавить свои hooks, которые могут обходить политики. ## Контроль MCP-серверов MCP-серверы расширяют возможности Claude Code. Но в корпоративной среде нужно контролировать, какие серверы разрешены. В managed settings: ```json { "allowedMcpServers": [ {"serverName": "github"}, {"serverName": "jira"} ], "deniedMcpServers": [ {"serverName": "filesystem"} ] } ``` `allowedMcpServers` — белый список. Если задан, подключить можно только перечисленные серверы. `deniedMcpServers` — чёрный список, приоритетнее белого. Для проектных MCP-серверов (из `.mcp.json`) есть отдельные настройки: ```json { "enableAllProjectMcpServers": true } ``` Или точечно: ```json { "enabledMcpjsonServers": ["github", "memory"], "disabledMcpjsonServers": ["filesystem"] } ``` ## Контроль плагинов и маркетплейсов Плагины — ещё одна точка контроля. `strictKnownMarketplaces` в managed settings ограничивает, откуда разработчики могут ставить плагины: ```json { "strictKnownMarketplaces": [ { "source": "github", "repo": "your-org/approved-plugins" } ] } ``` Пустой массив `[]` полностью блокирует установку новых плагинов. `undefined` (не задано) — без ограничений. Для удобства в project settings можно указать `extraKnownMarketplaces` — маркетплейсы, которые автоматически предлагаются новым членам команды: ```json { "extraKnownMarketplaces": { "team-tools": { "source": { "source": "github", "repo": "your-org/claude-plugins" } } } } ``` Когда разработчик открывает проект, Claude Code предложит установить плагины из этого маркетплейса. ## Объявления для команды Мелкая, но полезная фича — `companyAnnouncements`. Сообщения, которые показываются при старте Claude Code: ```json { "companyAnnouncements": [ "Напоминание: все PR должны пройти code review перед мержем", "Новая политика безопасности — прочитай на wiki.internal/security" ] } ``` Если массив содержит несколько сообщений, они показываются случайным образом. ## Attribution — подпись в коммитах По умолчанию Claude Code добавляет «Co-Authored-By: Claude» в коммиты. В команде это может быть полезно для аудита, или наоборот мешать: ```json { "attribution": { "commit": "AI-assisted commit\n\nReviewed-by: team", "pr": "This PR was created with Claude Code assistance" } } ``` Или отключить полностью пустыми строками. Зависит от политики команды. ## Fast Mode для организаций Fast mode (ускоренный Opus 4.6) по умолчанию отключён для Team и Enterprise. Админ должен явно включить его: - Anthropic Console: Claude Code preferences - Claude AI (Teams): Admin Settings > Claude Code После включения разработчики могут активировать fast mode через `/fast`. Он списывается через extra usage — отдельно от подписки. ## Рекомендация по внедрению Если внедряешь Claude Code в команде, вот порядок: 1. Создай `.claude/settings.json` в проекте с базовыми permissions и hooks. Закоммить. 2. Создай `CLAUDE.md` с описанием проекта и конвенциями. Закоммить. 3. Настрой `.mcp.json` с нужными MCP-серверами. Закоммить. 4. Если нужен жёсткий контроль — задеплой managed settings на машины. 5. Проведи короткую демо-сессию для команды. ## Часто задаваемые вопросы **Как узнать, какие настройки действуют прямо сейчас?** Команда `/config` в Claude Code показывает текущую конфигурацию со всеми скоупами. Видно, откуда берётся каждая настройка. **Можно ли разные настройки для разных команд внутри организации?** Managed settings одинаковы для всех на машине. Для разных команд используй project settings — каждый репозиторий может иметь свою конфигурацию. **Managed settings автоматически обновляются?** Нет. Это обычные JSON-файлы на диске. Обновление — через систему управления конфигурациями (Ansible, Chef, MDM). ## Что ещё почитать - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — базовые настройки - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — настройка безопасности - [Claude Code плагины и маркетплейсы](https://matveev.tech/claude-code-plugins-marketplaces/) — расширение возможностей - [В Claude Code нашли мультиагентную систему — TeammateTool](https://matveev.tech/claude-code-multi-agent-teammatetool/) — работа нескольких AI-агентов ### Переменные окружения Claude Code — полный справочник URL: https://matveev.tech/claude-code-environment-variables/ Last updated: 2026-02-12T09:12:39.000Z > **TL;DR:** Claude Code поддерживает 50+ переменных окружения для настройки: модели, провайдеры (Bedrock, Vertex, Foundry), прокси, sandbox, MCP, мониторинг. Их можно задавать в терминале, через `settings.json` или в CI/CD-пайплайнах. У Claude Code длинный список переменных окружения, и часть из них реально полезна, а часть — для специфических enterprise-сценариев. Я прошёл по документации и разгруппировал их по задачам, чтобы было проще искать нужное. Все переменные можно также прописать в `settings.json` в секции `env` — тогда не нужно выставлять их в терминале каждый раз. ## Аутентификация и API | Переменная | Зачем | | -------------------------- | --------------------------------------------------------------------------------------------- | | ANTHROPIC\_API\_KEY | API-ключ Anthropic. Для интерактивного использования лучше /login | | ANTHROPIC\_AUTH\_TOKEN | Кастомный токен для заголовка Authorization (автоматически добавляет Bearer) | | ANTHROPIC\_CUSTOM\_HEADERS | Дополнительные HTTP-заголовки для запросов. Формат: Name: Value, разделитель — перенос строки | `ANTHROPIC_API_KEY` — основной способ аутентификации для скриптов и CI/CD. Для ежедневной работы проще залогиниться через `/login` — ключ сохранится в `~/.claude.json`. ## Выбор модели | Переменная | Зачем | | --------------------------------- | ----------------------------------------------------------------- | | ANTHROPIC\_MODEL | Основная модель. Перебивает дефолт | | CLAUDE\_CODE\_SUBAGENT\_MODEL | Модель для субагентов (Task-инструмент) | | ANTHROPIC\_DEFAULT\_OPUS\_MODEL | Кастомное имя для Opus (например, кастомная модель через Bedrock) | | ANTHROPIC\_DEFAULT\_SONNET\_MODEL | Кастомное имя для Sonnet | | ANTHROPIC\_DEFAULT\_HAIKU\_MODEL | Кастомное имя для Haiku | `ANTHROPIC_MODEL` полезен, когда нужно зафиксировать конкретную версию модели для воспроизводимости. Если не задавать — Claude Code использует последнюю доступную. ## Облачные провайдеры ### Amazon Bedrock | Переменная | Зачем | | ------------------------------------------ | ----------------------------------------------- | | CLAUDE\_CODE\_USE\_BEDROCK | Включить Bedrock как провайдер | | CLAUDE\_CODE\_SKIP\_BEDROCK\_AUTH | Пропустить аутентификацию AWS (для LLM-gateway) | | AWS\_BEARER\_TOKEN\_BEDROCK | API-ключ Bedrock | | ANTHROPIC\_SMALL\_FAST\_MODEL\_AWS\_REGION | Регион AWS для Haiku-модели | ### Google Vertex AI | Переменная | Зачем | | ------------------------------------ | -------------------------------- | | CLAUDE\_CODE\_USE\_VERTEX | Включить Vertex AI как провайдер | | CLAUDE\_CODE\_SKIP\_VERTEX\_AUTH | Пропустить аутентификацию Google | | VERTEX\_REGION\_CLAUDE\_4\_0\_OPUS | Регион для Opus на Vertex | | VERTEX\_REGION\_CLAUDE\_4\_0\_SONNET | Регион для Sonnet на Vertex | ### Microsoft Azure Foundry | Переменная | Зачем | | --------------------------------- | ------------------------------------ | | CLAUDE\_CODE\_USE\_FOUNDRY | Включить Foundry как провайдер | | ANTHROPIC\_FOUNDRY\_API\_KEY | API-ключ Foundry | | ANTHROPIC\_FOUNDRY\_BASE\_URL | URL ресурса Foundry | | ANTHROPIC\_FOUNDRY\_RESOURCE | Имя ресурса (альтернатива BASE\_URL) | | CLAUDE\_CODE\_SKIP\_FOUNDRY\_AUTH | Пропустить аутентификацию Azure | Если ты используешь Claude Code через корпоративный облачный провайдер — тебе нужна одна из этих групп. Для прямого подключения к Anthropic API ничего из этого не нужно. ## Поведение bash | Переменная | Зачем | | --------------------------------------------- | ------------------------------------------------------------------- | | BASH\_DEFAULT\_TIMEOUT\_MS | Таймаут по умолчанию для bash-команд | | BASH\_MAX\_TIMEOUT\_MS | Максимальный таймаут, который может выставить модель | | BASH\_MAX\_OUTPUT\_LENGTH | Максимальная длина вывода команды (после этого обрезается) | | CLAUDE\_CODE\_SHELL | Принудительно задать шелл (если login shell отличается от рабочего) | | CLAUDE\_CODE\_SHELL\_PREFIX | Команда-обёртка для всех bash-команд (логирование, аудит) | | CLAUDE\_BASH\_MAINTAIN\_PROJECT\_WORKING\_DIR | Возвращаться в корень проекта после каждой команды | `BASH_DEFAULT_TIMEOUT_MS` — полезный. По умолчанию Claude Code убивает долгие команды. Если у тебя медленные тесты или сборка, увеличь таймаут. `CLAUDE_CODE_SHELL` пригодится, если login shell у тебя bash, а работаешь ты в zsh. Claude Code определяет шелл автоматически, но иногда ошибается. ## Контекст и токены | Переменная | Зачем | | --------------------------------------------- | -------------------------------------------------- | | CLAUDE\_CODE\_MAX\_OUTPUT\_TOKENS | Максимум токенов на ответ (дефолт: 32K, макс: 64K) | | CLAUDE\_CODE\_FILE\_READ\_MAX\_OUTPUT\_TOKENS | Лимит токенов при чтении файлов | | CLAUDE\_AUTOCOMPACT\_PCT\_OVERRIDE | Порог авто-компактизации контекста (дефолт: \~95%) | | MAX\_THINKING\_TOKENS | Бюджет токенов на «размышления». 0 — отключить | | CLAUDE\_CODE\_EFFORT\_LEVEL | Уровень усилий: low, medium, high | `CLAUDE_AUTOCOMPACT_PCT_OVERRIDE` — если поставить 50, контекст будет компактизироваться раньше. Полезно для долгих сессий, когда не хочешь терять контекст. `CLAUDE_CODE_EFFORT_LEVEL` работает только с Opus 4.6\. `low` — быстрые ответы для простых задач, `high` — глубокий анализ. По умолчанию `high`. ## MCP | Переменная | Зачем | | ------------------------ | -------------------------------------------- | | MCP\_TIMEOUT | Таймаут старта MCP-сервера (мс) | | MCP\_TOOL\_TIMEOUT | Таймаут выполнения MCP-инструмента (мс) | | MAX\_MCP\_OUTPUT\_TOKENS | Максимум токенов в ответе MCP (дефолт: 25K) | | ENABLE\_TOOL\_SEARCH | Поиск по MCP-инструментам: auto, true, false | Если у тебя MCP-сервер медленно стартует, увеличь `MCP_TIMEOUT`. По умолчанию он довольно жёсткий. ## Сеть и прокси | Переменная | Зачем | | ------------------------------------ | ----------------------------------------- | | HTTP\_PROXY | HTTP-прокси | | HTTPS\_PROXY | HTTPS-прокси | | NO\_PROXY | Домены, которые идут в обход прокси | | CLAUDE\_CODE\_PROXY\_RESOLVES\_HOSTS | Прокси делает DNS-резолв (вместо клиента) | | CLAUDE\_CODE\_CLIENT\_CERT | Клиентский сертификат для mTLS | | CLAUDE\_CODE\_CLIENT\_KEY | Приватный ключ для mTLS | Для корпоративных сетей с прокси — эти переменные обязательны. Без них Claude Code не сможет подключиться к API. ## Отключение фич | Переменная | Зачем | | -------------------------------------------- | ------------------------------------------------ | | DISABLE\_TELEMETRY | Отключить телеметрию Statsig | | DISABLE\_ERROR\_REPORTING | Отключить отправку ошибок в Sentry | | DISABLE\_AUTOUPDATER | Отключить автообновления | | DISABLE\_COST\_WARNINGS | Отключить предупреждения о стоимости | | CLAUDE\_CODE\_DISABLE\_NONESSENTIAL\_TRAFFIC | Отключить всё вышеперечисленное одной переменной | | CLAUDE\_CODE\_DISABLE\_AUTO\_MEMORY | Отключить автоматическое запоминание | `CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC` — мой фаворит для закрытых окружений. Одна переменная вместо четырёх. ## Часто задаваемые вопросы **Где лучше задавать переменные — в терминале или settings.json?** Для постоянных настроек — в `settings.json` (секция `env`). Для временных или одноразовых — в терминале перед запуском. Для CI/CD — через системные переменные окружения. **Переменные окружения сохраняются между bash-командами Claude?** Нет. Каждая bash-команда запускается в чистом шелле. Если нужна персистентность — используй `CLAUDE_ENV_FILE` через SessionStart hook. **Что приоритетнее — переменная в терминале или в settings.json?** Переменная окружения, заданная в терминале перед запуском Claude Code, перекрывает значение из settings.json. ## Что ещё почитать - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общий обзор настроек - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — настройка безопасности - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — расширение через MCP - [Claude Code Hooks — автоматизация](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — персистентное окружение через hooks ### Настройка Claude Code — полный гайд по settings.json URL: https://matveev.tech/claude-code-settings-json/ Last updated: 2026-02-13T16:34:13.000Z > **TL;DR:** `settings.json` — главный файл конфигурации Claude Code. Через него настраивается всё: разрешения, модели, sandbox, hooks, плагины, переменные окружения. Файл может быть глобальным, проектным или локальным — настройки наследуются и перекрывают друг друга. Claude Code из коробки работает нормально. Но «нормально» — это как IDE без настроенных шорткатов. Можно жить, но неудобно. Настройка settings.json занимает 10 минут и экономит часы в долгосрочной перспективе. ## Где лежат настройки У Claude Code четыре уровня настроек, от самого приоритетного к наименее: | Уровень | Файл | Для кого | | ------- | ------------------------------------------------------------- | -------------------------------------------- | | Managed | /Library/Application Support/ClaudeCode/managed-settings.json | Все пользователи на машине (ставит IT-отдел) | | Local | .claude/settings.local.json | Ты, только в этом проекте | | Project | .claude/settings.json | Вся команда (коммитится в git) | | User | \~/.claude/settings.json | Ты, во всех проектах | Managed перебивает всё остальное — это для корпоративных политик. Local перебивает Project и User. Project перебивает User. На практике чаще всего нужны два: User (личные предпочтения) и Project (командные настройки). ## Как открыть настройки Три способа: 1. Команда `/config` в Claude Code — откроет интерактивный интерфейс с вкладками 2. Ручное редактирование файла `~/.claude/settings.json` для глобальных настроек 3. Ручное редактирование `.claude/settings.json` в проекте для проектных У файла есть JSON-схема — если добавить `"$schema": "https://json.schemastore.org/claude-code-settings.json"` в начало, то VS Code и Cursor покажут автокомплит и валидацию. ## Стартовая конфигурация Вот settings.json, с которого я рекомендую начать. Он покрывает 80% потребностей: ```json { "$schema": "https://json.schemastore.org/claude-code-settings.json", "permissions": { "allow": [ "Bash(npm run *)", "Bash(pytest *)", "Bash(ruff *)", "Bash(git status)", "Bash(git diff *)", "Bash(git log *)" ], "deny": [ "Read(./.env)", "Read(./.env.*)", "Read(./secrets/**)" ] }, "language": "russian" } ``` `language: "russian"` — Claude будет отвечать на русском по умолчанию. ## Что можно настроить Пройдусь по основным секциям. ### Модель и скорость ```json { "model": "claude-sonnet-4-5-20250929", "alwaysThinkingEnabled": true } ``` По умолчанию Claude Code использует Opus 4.6\. Можно переключить на Sonnet — дешевле и быстрее, но менее умный. `alwaysThinkingEnabled` включает расширенное мышление — модель тратит больше токенов на размышления перед ответом. Для быстрых задач (линтинг, простые правки) Sonnet хватает. Для сложного рефакторинга или архитектурных решений — Opus. ### Sandbox ```json { "sandbox": { "enabled": true, "autoAllowBashIfSandboxed": true, "network": { "allowedDomains": ["github.com", "*.npmjs.org"] } } } ``` Sandbox изолирует bash-команды. Включи `autoAllowBashIfSandboxed` — и Claude перестанет спрашивать разрешение на каждую команду, потому что они всё равно в изоляции. Подробнее — в [статье про разрешения](https://matveev.tech/claude-code-permissions-sandbox/). ### Hooks ```json { "hooks": { "PostToolUse": [ { "matcher": "Edit|Write", "hooks": [ { "type": "command", "command": "ruff format \"$CLAUDE_FILE_PATH\" 2>/dev/null || true" } ] } ] } } ``` Автоматические действия до и после инструментов Claude. Подробнее — в [статье про hooks](https://matveev.tech/claude-code-hooks-avtomatizatsiya/). ### Attribution — подпись в коммитах По умолчанию Claude Code добавляет в git-коммиты строку «Co-Authored-By: Claude». Можно настроить или отключить: ```json { "attribution": { "commit": "", "pr": "" } } ``` Пустые строки отключают подпись полностью. ### Интерфейс ```json { "showTurnDuration": true, "spinnerTipsEnabled": false, "prefersReducedMotion": true } ``` `showTurnDuration` показывает, сколько времени Claude думал. Полезно для оценки стоимости запроса. `spinnerTipsEnabled: false` убирает подсказки в спиннере. ### Автообновления ```json { "autoUpdatesChannel": "stable" } ``` Два канала: `latest` (свежайшая версия, может быть нестабильной) и `stable` (версия примерно на неделю старше, без критичных багов). Для продакшн-работы рекомендую `stable`. ## Переменные окружения через settings Вместо того чтобы выставлять переменные в терминале, можно прописать их в settings: ```json { "env": { "CLAUDE_CODE_ENABLE_TELEMETRY": "1", "BASH_DEFAULT_TIMEOUT_MS": "60000" } } ``` Это удобно для командных настроек — добавил в проектный settings.json, и у всех одинаковые параметры. ## Часто задаваемые вопросы **Как сбросить все настройки?** Удали файл `~/.claude/settings.json`. Claude Code пересоздаст его с дефолтами при следующем запуске. Claude Code хранит до пяти резервных копий настроек с таймстампами — можно откатиться. **Можно ли настроить Claude Code через UI?** Да, команда `/config` открывает интерфейс с вкладками. Но не все настройки там доступны — для тонкой настройки всё равно придётся редактировать JSON. **Project settings конфликтуют с моими user settings — что делать?** Project settings приоритетнее. Если нужно перебить что-то лично для себя — создай `.claude/settings.local.json`. Он приоритетнее project settings, но не коммитится в git. ## Что ещё почитать - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — настройка контекста проекта через markdown-файл - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — детальная настройка permissions - [Claude Code Hooks — автоматизация рабочего процесса](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — автоматические действия при событиях - [Переменные окружения Claude Code — справочник](https://matveev.tech/claude-code-environment-variables/) — все переменные с описанием - [Fast Mode в Claude Code — ускоряем Opus 4.6](https://matveev.tech/claude-code-fast-mode/) — настройка скорости ответов - [Лучшие AI-редакторы кода в 2026](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — Claude Code среди конкурентов ### Qwen3-Coder-Next — маленькая модель, которая кодит как большая URL: https://matveev.tech/qwen3-coder-next-obzor/ Last updated: 2026-02-25T12:16:51.000Z > **TL;DR:** Alibaba выпустила Qwen3-Coder-Next — open-weight модель для кодинга с архитектурой MoE (80B параметров, но активны только 3B). Она набирает 70%+ на SWE-Bench Verified и конкурирует с моделями в 10-20 раз крупнее. Доступна бесплатно на Hugging Face. Когда все гонятся за триллионами параметров, Alibaba пошла в другую сторону. Qwen3-Coder-Next — это попытка доказать, что для хорошего кодинг-агента не обязательно держать в памяти модель размером с небольшой дата-центр. И, судя по бенчмаркам, у них получилось. ## Что такое Qwen3-Coder-Next Qwen3-Coder-Next построена на базе Qwen3-Next-80B-A3B-Base. Если расшифровать название: 80B — это общее количество параметров, A3B — количество активных при инференсе. Модель использует архитектуру Mixture of Experts (MoE) с гибридным вниманием, поэтому при генерации работает только малая часть весов. На практике это означает одно — модель можно запускать на обычном железе. Ну, относительно обычном. Не нужен кластер GPU за сотни тысяч долларов, как для полноразмерных моделей уровня GPT-5 или Claude Opus. Веса открыты — можно скачать с [Hugging Face](https://huggingface.co/Qwen?ref=matveev.tech) или [ModelScope](https://modelscope.cn/organization/qwen?ref=matveev.tech). Техрепорт тоже [на GitHub](https://github.com/QwenLM/Qwen3-Coder?ref=matveev.tech). ## Как тренировали — ставка на агентный подход Самое интересное в Qwen3-Coder-Next — не архитектура, а метод обучения. Команда Qwen решила масштабировать не параметры, а агентные сигналы. Вместо того чтобы просто делать модель больше, они собрали огромную коллекцию исполняемых задач с реальными средами. Обучение шло в несколько этапов: 1. Дообучение на code- и agent-ориентированных данных 2. Файн-тюнинг на качественных агентных траекториях — записях того, как модель взаимодействует со средой 3. Специализация по доменам: софтверная инженерия, QA, веб-разработка 4. Дистилляция экспертов в единую модель Главное тут — модель учили не просто генерировать код, а работать с инструментами, рассуждать на длинной дистанции и выкручиваться, когда что-то пошло не так. ## Бенчмарки — где 3B активных бьют 60B Цифры, честно говоря, впечатляют. Qwen3-Coder-Next набирает больше 70% на SWE-Bench Verified через scaffold SWE-Agent. Для модели с 3B активных параметров это очень достойный результат. ![Результаты Qwen3-Coder-Next на кодинг-бенчмарках](https://matveev.tech/content/images/2026/02/qwen3-coder-next-benchmarks.png) Модель тестировали на нескольких бенчмарках: SWE-Bench (Verified, Multilingual и Pro), TerminalBench 2.0 и Aider. Результаты стабильные — и на мультиязычных задачах, и на более сложном SWE-Bench Pro. Отдельно интересен график зависимости качества от количества агентных ходов. Чем больше итераций даёшь модели, тем лучше результат на SWE-Bench Pro. Это подтверждает, что модель действительно умеет рассуждать на длинной дистанции, а не просто угадывать с первой попытки. ![Зависимость качества от количества агентных ходов на SWE-Bench Pro](https://matveev.tech/content/images/2026/02/qwen3-coder-next-swebench-turns.png) ## Эффективность — Парето-фронт для кодинг-агентов Тут лучше посмотреть на график. Qwen3-Coder-Next с 3B активных параметров выдаёт результаты на уровне моделей, у которых активных параметров в 10-20 раз больше. ![Соотношение эффективности и качества на SWE-Bench Pro](https://matveev.tech/content/images/2026/02/qwen3-coder-next-swebench-pro.png) Если хочешь запускать кодинг-агента локально или на VPS, это интересный вариант. Не нужно платить за API крупных провайдеров — разворачиваешь свою модель и работаешь. Правда, насколько бенчмарки переносятся на реальные задачи — вопрос отдельный. ## Где пригодится Команда Qwen показала демо интеграций с несколькими инструментами: - OpenClaw — open-source фреймворк для AI-агентов - Cline — расширение для VS Code - Claude Code — CLI-агент от Anthropic (да, можно подключить стороннюю модель) - Генерация фронтенда - Browser Use Agent для автоматизации браузера Qwen3-Coder-Next заточена именно под агентные сценарии — многоходовые задачи, работа с файловой системой, отладка. Автодополнение тут не главное. ## Что не рассказали Пара моментов, которые стоит иметь в виду. Техрепорт не раскрывает детали обучающих данных — сколько именно задач использовали и из каких репозиториев. Также нет прямого сравнения с GPT-5.3 Codex на одинаковых условиях — бенчмарки запускали через разные scaffolds, что делает честное сравнение сложнее. Модель пока не тестировали на реальных production-задачах в масштабе. SWE-Bench — это хороший индикатор, но реальная разработка сложнее и разнообразнее. И ещё — 80B параметров, даже с 3B активными, всё равно требуют заметного объёма RAM для загрузки весов. Это не модель для ноутбука, хотя и не монстр уровня 400B. --- Мне нравится направление, в которое двигается Alibaba. Вместо гонки за размером — ставка на умное обучение. 70%+ на SWE-Bench Verified при 3B активных параметрах говорят сами за себя, хотя я бы подождал независимых тестов на реальных проектах. Если строишь своего кодинг-агента или ищешь альтернативу проприетарным API — стоит попробовать. Веса открыты, скачиваешь и экспериментируешь. ## Что ещё почитать - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух главных проприетарных кодинг-моделей - [GLM-5 от Zhipu — лучшая open-source модель 2026](https://matveev.tech/glm-5-zhipu-open-source-obzor/) — ещё одна сильная open-source модель из Китая - [Claude Opus 4.6 — самая умная модель Anthropic](https://matveev.tech/claude-opus-4-6-obzor/) — обзор проприетарного конкурента - [Kimi K2.5 — китайский open-source с роем из 100 агентов](https://matveev.tech/kimi-k2-5-visual-agentic/) — другой подход к агентным задачам ### Claude Code Hooks — автоматизация, о которой ты не знал URL: https://matveev.tech/claude-code-hooks-avtomatizatsiya/ Last updated: 2026-02-11T09:08:55.000Z > **TL;DR:** Hooks в Claude Code — это пользовательские команды, которые автоматически запускаются до или после определённых событий: редактирование файла, запуск bash, начало сессии. Можно настроить авто-линтинг, защиту конфигов, персистентное окружение. Claude Code пишет код, запускает команды, редактирует файлы. Но иногда хочется, чтобы после каждого редактирования Python-файла автоматически запускался `ruff format`, или чтобы Claude не мог случайно перезаписать `docker-compose.prod.yml`. Hooks решают именно это. ## Как работают hooks Hook — это команда, которая привязана к событию жизненного цикла Claude Code. Событие наступает — команда запускается. Всё просто. Есть несколько типов событий: - **SessionStart** — при старте сессии Claude Code - **PreToolUse** — перед выполнением инструмента (Bash, Edit, Write) - **PostToolUse** — после выполнения инструмента - **Notification** — когда Claude отправляет уведомление Настройка через `settings.json`: ```json { "hooks": { "PostToolUse": [ { "matcher": "Edit|Write", "hooks": [ { "type": "command", "command": "ruff format \"$CLAUDE_FILE_PATH\" 2>/dev/null || true" } ] } ] } } ``` Этот пример запускает `ruff format` после каждого редактирования файла. `matcher` фильтрует, на какие инструменты реагировать — здесь на Edit и Write. ## Персистентное окружение через SessionStart Одна из главных проблем Claude Code: переменные окружения не сохраняются между bash-командами. Каждая команда запускается в чистом шелле. Если ты работаешь с conda или virtualenv — это боль. Решение через SessionStart hook: ```json { "hooks": { "SessionStart": [ { "matcher": "startup", "hooks": [ { "type": "command", "command": "echo 'source /path/to/venv/bin/activate' >> \"$CLAUDE_ENV_FILE\"" } ] } ] } } ``` `$CLAUDE_ENV_FILE` — специальный файл, который Claude Code сорсит перед каждой bash-командой. Всё, что ты туда запишешь при старте, будет доступно в каждой последующей команде. Это решает проблему, которая мучала многих: нужно активировать conda environment, но Claude Code забывает об этом после первой команды. ## Защита файлов от записи Допустим, у тебя есть продакшн-конфиги, которые Claude точно не должен трогать. Можно заблокировать через deny-правила в permissions, а можно через PreToolUse hook: ```json { "hooks": { "PreToolUse": [ { "matcher": "Edit|Write", "hooks": [ { "type": "command", "command": "echo \"$CLAUDE_FILE_PATH\" | grep -q 'deploy/prod' && echo 'BLOCK: production configs are read-only' && exit 1 || exit 0" } ] } ] } } ``` Если hook возвращает ненулевой код выхода, действие Claude блокируется. Здесь — любая попытка отредактировать файл в `deploy/prod/` будет остановлена. Мне кажется, это надёжнее, чем deny-правила в permissions, потому что hook может проверять более сложные условия — имя ветки, время суток, что угодно. ## Авто-форматирование после редактирования Самый популярный use case. Claude пишет код, который работает, но форматирование бывает слегка кривое. Hook решает: ```json { "hooks": { "PostToolUse": [ { "matcher": "Edit|Write", "hooks": [ { "type": "command", "command": "ext=\"${CLAUDE_FILE_PATH##*.}\"; case \"$ext\" in py) ruff format \"$CLAUDE_FILE_PATH\" 2>/dev/null;; js|ts|tsx) npx prettier --write \"$CLAUDE_FILE_PATH\" 2>/dev/null;; esac; true" } ] } ] } } ``` Определяет расширение файла и запускает нужный форматер: ruff для Python, prettier для JavaScript/TypeScript. Финальный `true` гарантирует, что hook не заблокирует работу, даже если форматер упал. ## Переменные окружения в hooks Hooks получают набор переменных окружения с контекстом: - `CLAUDE_PROJECT_DIR` — корневая директория проекта - `CLAUDE_FILE_PATH` — путь к файлу (для Edit/Write/Read) - `CLAUDE_ENV_FILE` — путь к файлу окружения (для SessionStart) - `CLAUDE_TOOL_NAME` — имя инструмента (Bash, Edit, Write) Эти переменные позволяют писать умные hooks, которые адаптируются к контексту. ## Где хранить hooks Hooks поддерживают ту же систему скоупов, что и settings: - `~/.claude/settings.json` — глобальные hooks для всех проектов - `.claude/settings.json` — проектные hooks, общие для команды - `.claude/settings.local.json` — локальные, только для тебя Для команды удобно хранить hooks в проектном settings.json — тогда у всех разработчиков будет одинаковое поведение. Личные hooks (вроде активации conda) лучше в пользовательский файл. Есть ещё `allowManagedHooksOnly` в managed settings — для организаций, которые хотят контролировать, какие hooks разрешены. При включении работают только hooks из managed settings и SDK. ## Часто задаваемые вопросы **Замедляют ли hooks работу Claude Code?** Зависит от самого hook. Быстрые команды вроде `ruff format` добавляют миллисекунды. Но если hook делает что-то тяжёлое (полный билд, запуск тестов), задержка будет заметна. Оптимизируй команды. **Можно ли отключить hooks временно?** Да. Параметр `disableAllHooks: true` в settings.json отключает все hooks разом. **Что будет, если hook упадёт с ошибкой?** Зависит от типа. PreToolUse hook с ненулевым exit code блокирует действие. PostToolUse hook с ошибкой — нет, действие уже выполнено. Рекомендую добавлять `|| true` к PostToolUse hooks. ## Что ещё почитать - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — другой способ контролировать поведение Claude - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — настройка контекста проекта - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общий обзор всех настроек ### daily.dev Recruiter — найм разработчиков через сообщество URL: https://matveev.tech/daily-dev-recruiter/ Last updated: 2026-02-10T18:25:03.000Z > **TL;DR:** Платформа для найма разработчиков, которая работает через сообщество daily.dev — там сидит миллион программистов. Вместо холодных InMail в LinkedIn получаешь тёплые интро к людям, которые сами согласились поговорить. Привет! Если ты когда-нибудь пытался нанять разработчика через LinkedIn, то знаешь это чувство: отправляешь 50 сообщений, получаешь 2 ответа, один из которых «не интересно». daily.dev решили подойти к проблеме с другой стороны. ## Что это daily.dev — это такой агрегатор новостей для программистов. Туда заходит больше миллиона разработчиков каждый день почитать про новые фреймворки, AI-тулы и прочие штуки. Многие ставят его как стартовую страницу браузера. И вот ребята из daily.dev подумали: а что если дать рекрутерам доступ к этой аудитории, но по-человечески? Без спама. Без холодных писем. Только с согласия самих разработчиков. ## Как работает Идея простая: разработчики уже тусуются на daily.dev и доверяют платформе. Когда ты размещаешь вакансию, система: 1. Анализирует, что читает и изучает разработчик (не резюме, а реальное поведение) 2. Находит тех, кому твоя вакансия может быть интересна 3. Показывает вакансию нативно, в потоке контента 4. Если человек заинтересовался — спрашивает, готов ли он пообщаться 5. Только после явного «да» передаёт контакт рекрутеру То есть ты получаешь не базу резюме, а интро к людям, которые: а) подходят по стеку, б) сами захотели поговорить. Ещё можно добавить до трёх скрининговых вопросов. Система отфильтрует кандидатов до того, как ты потратишь время на созвон. ## Тарифы Две опции: **Starter — $350/месяц за одну вакансию:**\- Стандартная скорость матчинга - Безлимитные интро - Без ограничений на количество рекрутеров **Pro — $1000/месяц за вакансию:**\- Скорость матчинга в 3 раза выше - Интеграция с ATS - Приоритетная поддержка - Аналитика по кандидатам Никаких комиссий за найм. Платишь только за месяц использования. Можно отменить когда угодно. Для сравнения: стандартная комиссия рекрутинговых агентств — 15-20% от годовой зарплаты. При зарплате $150k это $22-30k за одного человека. Тут — максимум $1000 в месяц, и нанимай хоть десятерых. ## Для кого Если у тебя стартап и нет бюджета на рекрутинговое агентство — это твой вариант. Или ты технический рекрутер, который устал от нулевого отклика в LinkedIn. Engineering-менеджеры тоже оценят: тут матчинг по реальному поведению, а не по ключевым словам из резюме. Кстати, по данным самих daily.dev, 90% их аудитории не отвечают на сообщения в других местах. Не знаю, насколько это точная цифра, но идея понятна: это пассивные кандидаты, которых ты через LinkedIn просто не достанешь. Попробовать можно тут: [daily.dev Recruiter | The Developer-First Hiring PlatformThe developer hiring platform built on developer trust. Access millions of active engineers with technical recruiting software that respects privacy and…![](https://matveev.tech/content/images/icon/favicon-1.png)USA Today![](https://matveev.tech/content/images/thumbnail/og-image-1.png)](https://recruiter.daily.dev/?ref=matveev.tech) ### Разрешения в Claude Code — allow, deny и sandbox URL: https://matveev.tech/claude-code-permissions-sandbox/ Last updated: 2026-02-10T13:34:07.000Z > **TL;DR:** Claude Code спрашивает разрешение на каждое действие — запуск команд, чтение файлов, редактирование. Это можно настроить: автоматически разрешать безопасные команды (allow), блокировать опасные (deny) и изолировать bash в sandbox. Настраивается в `settings.json`. Первое, что раздражает в Claude Code — бесконечные «Allow this tool?». Хочешь запустить тесты — разреши. Хочешь прочитать файл — разреши. Десятый раз за минуту. В какой-то момент ты начинаешь машинально жать «Yes» на всё, и это хуже, чем если бы разрешений не было вообще. Хорошая новость: систему разрешений можно настроить один раз и забыть. Плохая — документация не самая интуитивная. Давай разберёмся. ## Три типа правил В `settings.json` (проектном или пользовательском) есть секция `permissions` с тремя списками: - **allow** — автоматически разрешать. Никаких вопросов, Claude просто делает. - **deny** — запретить. Claude не сможет выполнить действие, даже если очень хочет. - **ask** — спрашивать каждый раз. Это поведение по умолчанию для большинства инструментов. Правила проверяются в порядке: сначала deny, потом ask, потом allow. Первое совпадение побеждает. ## Синтаксис правил Формат простой: `Инструмент(паттерн)`. Вот примеры: ```json { "permissions": { "allow": [ "Bash(npm run lint)", "Bash(npm run test *)", "Bash(git diff *)", "Bash(git status)", "Read(~/.zshrc)" ], "deny": [ "Bash(curl *)", "Bash(rm -rf *)", "Read(./.env)", "Read(./.env.*)", "Read(./secrets/**)" ] } } ``` Звёздочка `*` работает как wildcard. `Bash(npm run test *)` разрешит и `npm run test`, и `npm run test --watch`, и `npm run test src/utils`. Можно указать инструмент без паттерна — тогда правило сработает для всех вызовов. `WebFetch` в deny заблокирует все HTTP-запросы. ## Что стоит разрешить сразу Вот мой базовый набор allow-правил, который экономит кучу кликов: ```json { "permissions": { "allow": [ "Bash(npm run *)", "Bash(git status)", "Bash(git diff *)", "Bash(git log *)", "Bash(git branch *)" ] } } ``` Логика простая: всё, что только читает данные или запускает проверки — можно разрешить. Тесты, линтер, git-команды для просмотра. ## Что стоит запретить Тут важнее: deny-правила защищают тебя от случайностей. ```json { "permissions": { "deny": [ "Read(./.env)", "Read(./.env.*)", "Read(./secrets/**)", "Read(./config/credentials.json)", "Bash(curl *)", "Bash(wget *)", "Bash(rm -rf *)" ] } } ``` Файлы `.env` — первые кандидаты на блокировку. Claude может случайно прочитать API-ключи и включить их в ответ, а оттуда они попадут в логи Anthropic. Это заменило старый `ignorePatterns` — deny-правила работают надёжнее. ## Sandbox — изоляция bash-команд Sandbox — это следующий уровень безопасности. Когда он включён, bash-команды Claude выполняются в изолированной среде с ограниченным доступом к файловой системе и сети. ```json { "sandbox": { "enabled": true, "autoAllowBashIfSandboxed": true, "network": { "allowedDomains": ["github.com", "*.npmjs.org", "registry.yarnpkg.com"], "allowLocalBinding": true }, "excludedCommands": ["docker", "git"] } } ``` Обрати внимание на `autoAllowBashIfSandboxed: true`. Когда sandbox включён, можно автоматически разрешать все bash-команды — они всё равно изолированы. Это убирает 90% «Allow?» вопросов. `excludedCommands` — команды, которые запускаются вне sandbox. Docker и git обычно нужно исключать, потому что они не работают в изоляции. Sandbox работает на macOS и Linux. На Windows — через WSL2. ## Режимы разрешений Claude Code может запускаться в разных режимах: - Стандартный — спрашивает разрешения по правилам - `acceptEdits` — автоматически разрешает редактирование файлов, спрашивает только про bash - `bypassPermissions` — разрешает всё (флаг `--dangerously-skip-permissions`, название говорит само за себя) Режим по умолчанию можно задать в settings.json: ```json { "permissions": { "defaultMode": "acceptEdits" } } ``` Я использую `acceptEdits` в проектах, где доверяю Claude редактировать файлы, но хочу контролировать команды. Для CI/CD пайплайнов некоторые используют `bypassPermissions`, но я бы рекомендовал делать это только с глубоким пониманием. ## Приоритет настроек Если одно и то же правило задано в разных местах, работает приоритет: 1. Managed settings (от администратора) — не перебить ничем 2. Local settings (`.claude/settings.local.json`) — для тебя в этом проекте 3. Project settings (`.claude/settings.json`) — для всей команды 4. User settings (`~/.claude/settings.json`) — для тебя везде Пример: если в проектном settings.json стоит deny на `Bash(rm *)`, а в пользовательском allow — deny победит, потому что project settings приоритетнее user settings. ## WebFetch — контроль HTTP-запросов Отдельный тип правил для HTTP-запросов: ```json { "permissions": { "allow": [ "WebFetch(domain:github.com)", "WebFetch(domain:stackoverflow.com)" ], "deny": [ "WebFetch" ] } } ``` Здесь deny на `WebFetch` без аргументов блокирует все запросы, кроме явно разрешённых доменов. Полезно, если не хочешь, чтобы Claude лазил по интернету без контроля. ## Часто задаваемые вопросы **Как быстро настроить разрешения без ручного редактирования JSON?** Команда `/allowed-tools` в Claude Code открывает интерактивный менеджер разрешений. Можно добавлять правила через UI, не трогая файлы. **Deny-правила блокируют и чтение через grep/glob?** Да. Если файл в deny — Claude не увидит его ни через Read, ни через Grep, ни через Glob. Файл исчезает из результатов поиска полностью. **Можно ли разрешить bash-команду только для конкретного проекта?** Да. Положи правило в `.claude/settings.json` в проекте — оно будет работать только там и не затронет другие проекты. **Sandbox замедляет работу?** Почти незаметно. Накладные расходы минимальны. Основная проблема — некоторые команды не работают в sandbox (docker, git), их нужно явно исключать. ## Что ещё почитать - [CLAUDE.md — как писать инструкции для Claude Code](https://matveev.tech/claude-md-instruktsii-claude-code/) — настройка контекста проекта - [Claude Code Hooks — автоматизация рабочего процесса](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — запуск команд до и после действий Claude - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общий обзор всех настроек - [Fast Mode в Claude Code — ускоряем Opus 4.6](https://matveev.tech/claude-code-fast-mode/) — настройка скорости ответов ### Как установить OpenClaw: VPS за $5 URL: https://matveev.tech/openclaw-ustanovka-vps/ Last updated: 2026-02-25T12:16:51.000Z OpenClaw можно поставить на VPS за $5/мес вместо Mac Mini за $600+. Нужен сервер с 2 GB RAM, Node.js 22+ и 10 минут времени. В этом гайде — пошаговая установка, настройка безопасности (это не шутка, 21 000 серверов уже взломали) и подключение Telegram-бота. ## Что вообще такое OpenClaw и зачем ему сервер Если ты последние пару месяцев не жил в пещере, то наверняка слышал про OpenClaw. Это open-source AI-агент с лицензией MIT, который умеет управлять браузером, выполнять задачи на компьютере и общаться через мессенджеры. На [GitHub](https://github.com/openclaw/openclaw?ref=matveev.tech) у него уже больше 201 000 звёзд — по популярности это уровень React или Vue. В Сан-Франциско появился целый тренд: люди покупают Mac Mini за $600+ специально под OpenClaw, ставят его на полку и забывают. Выглядит красиво, но платить столько за сервер для AI-агента — так себе идея, если честно. VPS за $5-10 в месяц справляется с теми же задачами. ## Что нужно для запуска Минимальные требования [по документации](https://openclaw.ai/?ref=matveev.tech): - 2 CPU cores - 2 GB RAM (4 GB, если планируешь браузерную автоматизацию) - Node.js 22 или новее - 10 GB свободного места на диске И самое главное — API-ключ от какого-нибудь LLM-провайдера. Подойдут Claude, GPT, DeepSeek или даже локальная модель через Ollama. Без ключа OpenClaw — просто красивый интерфейс, который ничего не делает. ## Какой VPS выбрать Для OpenClaw подойдёт практически любой VPS с 2 GB RAM и Ubuntu 22.04+. Вот провайдеры, которые я рекомендую: - [Timeweb Cloud](https://timeweb.cloud/?i=25556&ref=matveev.tech) — от 119 ₽/мес за VPS, серверы в России. Простая панель, быстрая активация, хорошая поддержка на русском. Для OpenClaw подойдёт тариф от 2 GB RAM - [Рег.ру Cloud](https://reg.cloud/cloud/servers/?rlink=reflink-31292099&ref=matveev.tech) — облачные серверы от одного из крупнейших регистраторов в РФ. Удобно, если у тебя уже есть домены на Рег.ру — всё в одном кабинете - [VDSina](https://vdsina.ru/?partner=27vvd1mp34gq&ref=matveev.tech) — серверы в России и Нидерландах, NVMe-диски, адекватные цены. Hi-CPU тарифы отлично подходят для AI-задач ## VPS — пошаговая установка Я использую [Hetzner](https://www.hetzner.com/?ref=matveev.tech) (CX22 за €4.35/мес), но подойдёт любой провайдер из списка выше. Главное — Ubuntu 22.04+ и минимум 2 GB RAM. ### Шаг 1\. Создай сервер Выбираешь Ubuntu 22.04, тариф с 2 GB RAM. Получаешь IP-адрес и root-доступ по SSH. ### Шаг 2\. Подключись и обнови систему ```bash ssh root@твой-ip-адрес apt update && apt upgrade -y ``` ### Шаг 3\. Установи Node.js 22 ```bash curl -fsSL https://deb.nodesource.com/setup_22.x | bash - apt install -y nodejs node --version # должно показать v22.x.x ``` ### Шаг 4\. Установи OpenClaw ```bash npm install -g @openclaw/openclaw ``` Это всё. Серьёзно. Один npm-пакет — и агент на борту. ### Шаг 5\. Первый запуск ```bash openclaw start ``` По умолчанию веб-интерфейс запускается на порту **18789**. Открываешь в браузере `http://твой-ip:18789` — и видишь Web Control UI. ### Шаг 6\. Добавь API-ключ В интерфейсе идёшь в Settings → LLM Provider и вводишь свой ключ. Я использую Claude API — OpenClaw работает с ним стабильнее всего, на мой взгляд. GPT и DeepSeek тоже варианты, но с Claude меньше глюков при длинных сессиях. ## Настройка безопасности — не пропускай этот раздел Вот тут серьёзно. По умолчанию веб-интерфейс OpenClaw открыт без пароля. Вообще без пароля. Любой, кто знает твой IP, может зайти и управлять агентом. Это не теоретическая угроза. В январе 2026 года исследователи обнаружили уязвимость [CVE-2026-25253](https://nvd.nist.gov/vuln/detail/CVE-2026-25253?ref=matveev.tech): более 21 000 экземпляров OpenClaw были доступны из интернета без какой-либо аутентификации, по данным Shodan. Люди просто ставили агента и забывали закрыть порт. Вот что нужно сделать сразу после установки: ### 1\. Закрой порт файрволом ```bash # Разрешаем только SSH ufw allow 22/tcp # Закрываем всё остальное ufw enable ``` ### 2\. Используй SSH-туннель для доступа Вместо того чтобы открывать порт 18789 наружу, подключайся через SSH-туннель: ```bash ssh -L 18789:localhost:18789 root@твой-ip-адрес ``` Теперь Web Control UI доступен по адресу `http://localhost:18789` на твоём компьютере. Снаружи — никак. ### 3\. Или поставь Nginx с паролем Если нужен постоянный доступ с разных устройств: ```bash apt install nginx apache2-utils htpasswd -c /etc/nginx/.htpasswd openclaw ``` И настрой reverse proxy с basic auth. Не идеально, но в тысячу раз лучше, чем открытый порт. Я не шучу насчёт безопасности. OpenClaw с доступом к API-ключу — это как оставить ноутбук с открытым терминалом в кафе. Только ноутбук стоит в интернете, а в кафе сидят все. ## Подключение Telegram-бота Telegram Bot API — пожалуй, самый простой способ общаться с OpenClaw. Настройка занимает минут пять. ### 1\. Создай бота Пишешь [@BotFather](https://t.me/BotFather?ref=matveev.tech) в Telegram, отправляешь `/newbot`, следуешь инструкциям. Получаешь токен вида `123456:ABC-DEF...`. ### 2\. Добавь токен в OpenClaw В Web Control UI идёшь в Settings → Integrations → Telegram и вставляешь токен бота. Или через конфиг: ```bash openclaw config set telegram.bot_token "твой-токен" openclaw restart ``` ### 3\. Проверь Напиши боту в Telegram — он должен ответить. Теперь можешь давать задачи агенту прямо с телефона. "Проверь почту", "Найди информацию о..." — всё через чат. ## FAQ ### Сколько стоит запуск OpenClaw на VPS? Минимальный VPS обойдётся в $5-10/мес за сервер плюс расходы на API. Если используешь Claude API, при умеренной нагрузке это ещё $10-20/мес. С DeepSeek дешевле, с GPT-5 — дороже. ### Можно ли использовать OpenClaw с локальными моделями? Да. OpenClaw поддерживает Ollama, так что можно запускать LLaMA, Mistral или другие open-source модели локально. Но для этого нужен сервер помощнее — минимум 8 GB RAM, а лучше 16 GB. На VPS за $5 это не взлетит, тут уже нужен тариф подороже или как раз тот самый Mac Mini. ### Безопасно ли держать OpenClaw на VPS? Безопасно, если закрыть порт файрволом и использовать SSH-туннель. По умолчанию — нет, не безопасно. Уязвимость CVE-2026-25253 показала, что тысячи людей этого не сделали. Не будь одним из них. ### Чем OpenClaw отличается от обычного ChatGPT? OpenClaw — это агент, а не чат-бот. Он может выполнять действия: управлять браузером, запускать скрипты, взаимодействовать с API. ChatGPT только отвечает на вопросы. Грубо говоря, ChatGPT — это советчик, а OpenClaw — исполнитель. ### Какой LLM лучше подключить к OpenClaw? По моему опыту, Claude работает стабильнее всего для длинных задач. GPT-5 хорош для быстрых запросов. DeepSeek — если хочется сэкономить. Начни с того API, который у тебя уже есть, а потом экспериментируй. ## Что ещё почитать - [Claude Code Hooks — автоматизация, о которой ты не знал](https://matveev.tech/claude-code-hooks-avtomatizatsiya/) — если интересна тема AI-автоматизации, тут про хуки в Claude Code - [Agent Teams в Claude Code: как запустить команду AI-агентов](https://matveev.tech/claude-code-agent-teams-instrukciya/) — мультиагентные системы, похожая концепция - [Super Agents от ClickUp — AI-напарники для рутины](https://matveev.tech/clickup-super-agents/) — другой взгляд на AI-агентов, без self-hosting - [FastMCP 3.0 — Python-фреймворк для MCP-серверов](https://matveev.tech/fastmcp-python-mcp-servery/) — если хочешь расширить OpenClaw через MCP-серверы ### CLAUDE.md — как писать инструкции для Claude Code URL: https://matveev.tech/claude-md-instruktsii-claude-code/ Last updated: 2026-02-10T08:54:48.000Z > **TL;DR:** CLAUDE.md — это файл, который Claude Code читает при каждом запуске. В нём ты описываешь проект, стек, правила и контекст. Без него Claude работает вслепую. С ним — понимает, что можно, а что нельзя, и пишет код так, как принято у тебя в проекте. Есть одна штука, которую многие пропускают при настройке Claude Code. Claude что-то генерит, но результат — мимо. Не тот стиль кода, не те библиотеки, не те конвенции. Проблема не в модели. Проблема в том, что ты не рассказал ей про свой проект. CLAUDE.md — это как README, только для AI. Файл с инструкциями, который Claude Code автоматически подгружает в контекст каждый раз, когда ты начинаешь сессию. ## Где хранить CLAUDE.md У Claude Code есть система скоупов. Файл можно положить в разные места, и это меняет его область действия: - `~/.claude/CLAUDE.md` — глобальный. Работает для всех проектов. Сюда стоит писать общие предпочтения: язык ответов, стиль кода, персональные правила. - `CLAUDE.md` в корне репозитория — проектный. Работает для этого конкретного проекта. Коммитится в git, доступен всей команде. - `.claude/CLAUDE.md` — альтернативное расположение проектного файла. Если не хочешь засорять корень. - `CLAUDE.local.md` — локальный. Только для тебя, git его игнорирует. Для личных заметок и экспериментов. Приоритет: глобальный загружается первым, потом проектный, потом локальный. Все три работают одновременно и дополняют друг друга. ## Что писать в CLAUDE.md Нет жёсткого формата. Это просто markdown-файл, и Claude интерпретирует его содержимое как инструкции. Но есть проверенная структура, которая работает хорошо. ### Описание проекта Два-три предложения о том, что это за проект, на каком стеке написан, какую проблему решает. Claude не видит весь код сразу — он подгружает файлы по мере необходимости. Краткое описание помогает ему ориентироваться. ```markdown ## Проект Бэкенд API для маркетплейса на Python 3.12 + FastAPI + SQLAlchemy 2.0. База данных — PostgreSQL 16. Деплой через Docker + Kubernetes. ``` ### Команды для разработки Какие команды запускать для тестов, линтинга, сборки. Claude часто пытается угадать — лучше явно указать. ```markdown ## Команды - Тесты: `pytest tests/ -v` - Линтер: `ruff check . --fix` - Формат: `ruff format .` - Миграции: `alembic upgrade head` ``` ### Правила кода Конвенции, которые сложно вывести из кода автоматически. Например, что у вас принято использовать dataclasses вместо Pydantic для внутренних моделей, или что все API-эндпоинты должны возвращать JSON в определённом формате. ```markdown ## Правила - Все эндпоинты возвращают `{"data": ..., "error": null}` формат - Используй `loguru` вместо стандартного `logging` - Тесты через `pytest` с фикстурами, без моков где возможно - Коммиты на русском языке ``` ### Запреты Иногда важнее сказать, чего делать не нужно. Claude склонен предлагать популярные решения, даже если в проекте принято иначе. ```markdown ## Запрещено - НЕ используй `print()` для логирования - НЕ добавляй `type: ignore` комментарии - НЕ меняй конфиги в `deploy/` без явного запроса ``` ## Антипаттерны Несколько вещей, которые я пробовал и которые не работают: **Слишком длинный CLAUDE.md.** Если файл на 3000 строк — он сжирает контекстное окно. Лучше быть лаконичным. 100-300 строк обычно достаточно. **Противоречивые инструкции.** Если в глобальном CLAUDE.md написано «используй tab», а в проектном «используй spaces» — Claude запутается. Проверяй, чтобы скоупы не конфликтовали. **Копипаст документации.** Не нужно вставлять в CLAUDE.md всю документацию по фреймворку. Claude и так знает Python, React, Go. Пиши только то, что специфично для твоего проекта. **Отсутствие обновлений.** CLAUDE.md — живой документ. Если ты поменял стек или конвенции — обнови файл. Устаревшие инструкции хуже, чем никаких. ## Auto Memory — автоматическое запоминание В Claude Code есть экспериментальная фича — auto memory. Claude сам создаёт и обновляет файлы памяти на основе ваших разговоров. Это дополнение к CLAUDE.md, а не замена. Auto memory сохраняет контекст из сессий: что за проект, какие решения принимались, какие паттерны предпочитаете. Управляется переменной `CLAUDE_CODE_DISABLE_AUTO_MEMORY` — если не нравится, можно отключить. Но я бы не полагался только на auto memory. Явный CLAUDE.md с продуманной структурой всегда лучше, чем автоматически собранные обрывки из разговоров. ## Часто задаваемые вопросы **Claude Code не видит мой CLAUDE.md — что делать?** Проверь расположение файла. Он должен быть в корне проекта, в `~/.claude/` для глобального, или в `.claude/` для проектного. Claude Code загружает файлы при старте — перезапусти сессию после создания. **Можно ли использовать CLAUDE.md в дополнительных директориях?** По умолчанию нет. Но если выставить переменную `CLAUDE_CODE_ADDITIONAL_DIRECTORIES_CLAUDE_MD=1`, Claude Code будет загружать CLAUDE.md из директорий, указанных через `--add-dir`. **Какой максимальный размер CLAUDE.md?** Формального лимита нет, но каждое слово занимает контекстное окно. Рекомендую держаться в пределах 100-300 строк. Если нужно больше — скорее всего, стоит вынести часть в отдельные файлы и ссылаться на них. **Видит ли команда мой CLAUDE.md?** Зависит от расположения. `CLAUDE.md` в корне проекта коммитится в git — команда его увидит. `CLAUDE.local.md` — только для тебя, git его игнорирует. ## Что ещё почитать - [Настройка Claude Code — полный гайд по settings.json](https://matveev.tech/claude-code-settings-json/) — общая настройка Claude Code - [Разрешения в Claude Code — allow, deny и sandbox](https://matveev.tech/claude-code-permissions-sandbox/) — что Claude может и чего не может - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — расширение возможностей через MCP - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если используешь Claude Code не для программирования ### Fast Mode в Claude Code — ускоряем Opus 4.6 за двойную цену URL: https://matveev.tech/claude-code-fast-mode/ Last updated: 2026-02-09T13:36:15.000Z > **TL;DR:** В Claude Code появился fast mode — тот же Opus 4.6, но с ускоренным инференсом. Качество ответов не меняется, зато латентность ниже. Платишь за это больше: $30/$150 за миллион токенов вместо стандартных $15/$75\. Включается командой `/fast`. Если ты пользуешься Claude Code, то знаешь это ощущение: ты отправил запрос, и сидишь, смотришь на мигающий курсор. Секунд пять. Десять. Двадцать. При быстрой итерации над кодом это бесит. Anthropic, видимо, тоже это понимали, потому что добавили fast mode. ## Что за fast mode и зачем он нужен Это тот же Opus 4.6, но с другой конфигурацией API, которая приоритизирует скорость над стоимостью. Ты получаешь такое же качество, такой же контекст, те же возможности. Просто ответы приходят быстрее. Думаю, под капотом Anthropic выделяют для fast mode больше вычислительных ресурсов или используют другую стратегию батчинга — но деталей реализации они не раскрывают. Факт в том, что задержки заметно меньше, особенно на коротких запросах. ## Сколько это стоит Вот тут начинается самое интересное. Цены за миллион токенов: | Режим | Input | Output | | -------------------------------- | ----- | ------ | | Стандартный Opus 4.6 | $15 | $75 | | Fast mode (контекст до 200K) | $30 | $150 | | Fast mode (контекст больше 200K) | $60 | $225 | То есть fast mode стоит в два раза дороже стандартного. А при больших контекстах — до трёх раз. Есть нюанс: если ты включишь fast mode посреди разговора, весь предыдущий контекст пересчитывается по тарифу fast mode без кэширования. Поэтому экономичнее включать его в начале сессии, а не когда разговор уже набрал 100K токенов. До 16 февраля 2026 года действует скидка 50% на fast mode для всех тарифов — можно попробовать по более мягкой цене. ## Когда включать, а когда нет Fast mode хорош для интерактивной работы: - Лайв-дебаг, когда каждая секунда на счету - Рабочие сессии, где ты активно пишешь код вместе с ассистентом А вот для чего fast mode не нужен: - Длинные автономные задачи, где Claude работает сам, а ты пьёшь кофе - CI/CD пайплайны и батч-обработка - Любые сценарии, где бюджет важнее скорости ## Fast mode vs effort level — в чём разница В Claude Code есть ещё одна настройка скорости — effort level. Она работает иначе: - **Fast mode** ускоряет инференс, но не меняет качество. Модель думает столько же, просто железо быстрее. - **Effort level** (пониженный) сокращает время на «размышления» модели. Ответы быстрее, но на сложных задачах качество может пострадать. Их можно комбинировать: fast mode + пониженный effort level даст максимальную скорость на простых задачах. Но я бы не стал понижать effort level для сложного рефакторинга — там каждая секунда «думания» окупается. ## Как включить Два способа: 1. В терминале Claude Code набери `/fast` и нажми Tab. Появится сообщение «Fast mode ON» и иконка `↯` рядом с промптом. 2. Добавь `"fastMode": true` в файл настроек пользователя. Fast mode сохраняется между сессиями. Если ты включил его один раз — он останется включённым, пока ты не выключишь. Когда включаешь fast mode, Claude Code автоматически переключается на Opus 4.6, если была выбрана другая модель. При выключении обратного переключения нет — нужно менять модель через `/model`. ## Что нужно для работы Не у всех fast mode доступен: - Нужна подписка Pro, Max, Team или Enterprise. Или аккаунт в Anthropic Console. - Extra usage должен быть включён — fast mode списывается только через extra usage, даже если у тебя остался лимит по подписке. - В Teams и Enterprise админ должен явно включить fast mode. По умолчанию он отключён. - Недоступно на сторонних облаках: Amazon Bedrock, Google Vertex AI, Microsoft Azure Foundry. Если упираешься в рейт-лимиты fast mode, система автоматически переключается на стандартный Opus 4.6\. Иконка `↯` становится серой, и ты продолжаешь работать на обычной скорости. Когда кулдаун пройдёт — fast mode включится обратно. ## Стоит ли вообще платить за скорость Я не уверен, что fast mode нужен всем. Если ты пишешь код пару часов в день и тебе нормально подождать лишние 10 секунд — стандартный режим вполне ок. Двойная цена за токены набегает быстро. Но если ты в режиме «горит дедлайн, нужно итерировать быстро» — каждая сэкономленная секунда умножается на десятки запросов. И тогда разница в стоимости оправдана. В целом, Anthropic делают правильно, что дают выбор. Хочешь скорость — платишь. Хочешь экономить — ждёшь. Лучше так, чем один фиксированный режим без вариантов. ## Часто задаваемые вопросы **Можно ли использовать fast mode с расширенным контекстом на 1M токенов?** Да, fast mode совместим с контекстным окном на миллион токенов. Но при контексте больше 200K цена вырастает ещё: $60 за input и $225 за output. **Fast mode расходует мою квоту по подписке?** Нет. Fast mode всегда списывается через extra usage, даже если у тебя есть неизрасходованный лимит подписки. Это отдельная тарификация. **Что будет, если закончится extra usage?** Claude Code автоматически переключится на стандартный режим Opus 4.6\. Работа не прервётся, просто ответы будут приходить с обычной скоростью. [Speed up responses with fast mode - Claude Code DocsGet faster Opus 4.6 responses in Claude Code by toggling fast mode.![](https://matveev.tech/content/images/icon/apple-touch-icon-5.png)Claude Code Docs![](https://matveev.tech/content/images/thumbnail/image-1)](https://code.claude.com/docs/en/fast-mode?ref=matveev.tech) ## Что ещё почитать - [Claude Opus 4.6 — обзор самой умной модели Anthropic](https://matveev.tech/claude-opus-4-6-obzor/) — если пропустил релиз самой модели - [GPT-5.3 Codex vs Claude Opus 4.6](https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/) — сравнение двух топовых моделей для кода - [Лучшие AI-редакторы кода в 2026 году](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — Claude Code в контексте других инструментов ### iTerm2 + Zsh + Oh My Zsh — красивый терминал на Mac за 10 минут URL: https://matveev.tech/iterm2-zsh-ohmyzsh-nastrojka/ Last updated: 2026-02-25T12:16:52.000Z > **TL;DR:** Стандартный Terminal.app на Mac выглядит уныло и умеет мало. iTerm2 + Zsh + Oh My Zsh превращают терминал в удобный инструмент с автодополнением, подсветкой синтаксиса и красивыми темами. Настраивается минут за 10. Если ты открываешь Terminal.app на Mac и каждый раз немного грустишь от его вида — ты не один. Стандартный терминал делает своё дело, но выглядит слабо. Можно лучше. ## Что будем ставить Три компонента, которые превратят терминал во что-то приятное: - **iTerm2** — замена стандартному Terminal.app. Больше настроек, сплиты, поиск по истории - **Zsh** — шелл вместо bash. В новых macOS уже стоит по умолчанию - **Oh My Zsh** — фреймворк для Zsh с кучей тем и плагинов ## Шаг 1\. Homebrew Если у тебя ещё нет Homebrew — самое время поставить. Это пакетный менеджер для Mac, без которого вообще сложно жить. ```bash /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" ``` ## Шаг 2\. iTerm2 Можно скачать с официального сайта, но проще через Homebrew: ```bash brew install --cask iterm2 ``` После установки открой iTerm2 и закрой стандартный Terminal. Больше он тебе не понадобится. ## Шаг 3\. Zsh На современных macOS Zsh уже установлен и является шеллом по умолчанию. Но если вдруг нет: ```bash brew install zsh ``` ## Шаг 4\. Oh My Zsh Вот тут начинается магия. Oh My Zsh — это фреймворк, который добавляет темы, плагины и кучу удобных штук. ```bash sh -c "$(curl -fsSL https://raw.githubusercontent.com/ohmyzsh/ohmyzsh/master/tools/install.sh)" ``` После установки терминал уже будет выглядеть поприятнее. Но мы на этом не остановимся. ## Шаг 5\. Красивая тема Мне нравится Material Design тема. Ставится так: ```bash cd ~/Downloads curl -O https://raw.githubusercontent.com/MartinSeeler/iterm2-material-design/master/material-design-colors.itermcolors ``` Теперь открой iTerm2: 1\. **iTerm2 → Preferences → Profiles → Colors**2\. Нажми **Color Presets... → Import...**3\. Выбери скачанный файл `material-design-colors.itermcolors`4\. Снова **Color Presets...** и выбери **material-design-colors** Если хочется чего-то другого — посмотри на [Dracula](https://draculatheme.com/iterm?ref=matveev.tech). Тоже симпатичная тема. ## Плагины Oh My Zsh из коробки включает только плагин git. Но можно добавить больше. Открой конфиг: ```bash nano ~/.zshrc ``` Найди строку `plugins=(git)` и добавь нужные: ```bash plugins=( git docker kubectl npm ) ``` Полный список плагинов — в [вики Oh My Zsh](https://github.com/ohmyzsh/ohmyzsh/wiki/Plugins?ref=matveev.tech). После изменений перезапусти терминал или выполни `source ~/.zshrc`. ## Алиасы Если часто пишешь одни и те же команды, создай алиасы. Открой `~/.zshrc` и добавь в конец: ```bash # Мои алиасы alias ll="ls -la" alias gs="git status" alias gp="git push" alias dc="docker-compose" ``` Теперь вместо `docker-compose up -d` можно писать `dc up -d`. Мелочь, а приятно. ## Что ещё можно настроить Если хочется пойти дальше: - **Powerlevel10k** — тема для Zsh с кучей настроек. Показывает ветку git, время выполнения команд, статус ошибок - **zsh-autosuggestions** — подсказывает команды на основе истории - **zsh-syntax-highlighting** — подсвечивает команды прямо при вводе Но для начала и базовой настройки хватит. По сути, вся настройка — это 5 команд в терминале и пара кликов в настройках iTerm2\. Зато потом каждый раз, когда открываешь терминал, глаз радуется. Мелочь, но когда проводишь в терминале много времени — это важно. ## Что ещё почитать - [Warp — терминал с AI](https://matveev.tech/warp-terminal-ai/) — если хочется терминал с ИИ-помощником из коробки - [TapHouse — графический интерфейс для Homebrew](https://matveev.tech/taphouse-gui-homebrew/) — для тех, кто не любит запоминать команды brew ### Crustdata Web Search API — поиск по вебу для AI-агентов URL: https://matveev.tech/crustdata-web-search-api/ Last updated: 2026-02-08T19:46:32.000Z > **TL;DR:** API для веб-поиска, заточенный под AI-агентов. Можно искать по всему вебу, фильтровать по доменам, датам, геолокации. Данные обновляются каждый час. Для тех, кто строит AI-агентов для продаж, рекрутинга или аналитики. Привет! Если ты строишь AI-агента, который должен искать информацию в интернете, то знаешь боль: обычные поисковые API либо медленные, либо выдают мусор, либо стоят как крыло от самолёта. Crustdata сделали Web Search API специально для таких случаев. Они изначально занимались B2B-данными (компании, люди, вакансии), а теперь добавили полноценный поиск по вебу. ## Что умеет Базовые штуки понятны — кидаешь запрос, получаешь результаты. Но есть несколько фишек, которые отличают его от условного Google Custom Search: **Фильтры на уровне запроса.** Можно сразу ограничить поиск конкретными доменами, исключить ненужные сайты, задать временной диапазон или геолокацию. Не нужно потом фильтровать результаты руками. **Свежесть данных.** Они индексируют новости и посты в соцсетях с задержкой около часа. Если твоему агенту нужны свежие новости о компании или персоне — это работает. **Deep research mode.** Можно запросить не просто ссылки, а сразу получить ответ на вопрос. Полезно, когда агенту нужен факт, а не список страниц для парсинга. **Поиск по авторам.** Отдельная штука для поиска опенсорс-контрибьюторов и авторов научных статей. Не знаю, насколько это востребовано, но если строишь что-то для рекрутинга в tech — может пригодиться. ## Как это выглядит ```bash curl 'https://api.crustdata.com/web/search' \ -H 'Authorization: Token $auth_token' \ --data-raw '{ "query": "AI startups funding 2026", "domains": ["techcrunch.com", "reuters.com"], "date_range": "last_week", "location": "USA" }' ``` В ответ приходит JSON с результатами. Можно комбинировать с их Fetch API, чтобы сразу вытащить контент страницы. ## Тарифы На сайте конкретных цен нет — только «Book a demo». Судя по всему, у них кредитная система: покупаешь пакет кредитов, тратишь на запросы. Есть месячные и годовые планы. Для больших объёмов предлагают flat file — полный датасет компаний и людей с ежемесячным обновлением. Это если не нужен real-time и хочется сэкономить. ## Для кого это Если честно, не для хобби-проектов. Crustdata целятся в: - AI SDR и автоматизацию продаж (нужны свежие данные о компаниях) - Рекрутинговые платформы (поиск кандидатов, мониторинг смены работы) - Инвестиционные инструменты (отслеживание раундов, новостей о стартапах) - Внутренние sales-инструменты в B2B компаниях У них есть отдельные API для компаний, людей, вакансий, постов в соцсетях. Web Search — это дополнение к этому стеку, когда нужно выйти за пределы их базы данных. ## Что мне не понравилось Документация есть, но цены спрятаны за формой «поговорите с нами». Я понимаю, что это enterprise-продукт, но хотя бы порядок цен было бы неплохо знать заранее. [Real-Time B2B Data Broker via API or Data Feed | CrustdataCrustdata is a B2B data provider offering real-time company & people datasets. Access APIs and live signals to power sales and investment workflows.![](https://matveev.tech/content/images/icon/Yf9jVvUkBaFa9rwvzfMcbnx5z0.png)Crustdata![](https://matveev.tech/content/images/thumbnail/dMaRYMGUDv0Nmt3qUdcyGhdFIog.png)](https://crustdata.com/?ref=matveev.tech) ### Kuku — Obsidian на стероидах с AI-агентом URL: https://matveev.tech/kuku-markdown-editor-macos/ Last updated: 2026-02-07T15:46:02.000Z > **TL;DR:** Локальный markdown-редактор для macOS, который весит 15 МБ вместо ста. Внутри — wikilinks, граф связей и AI-агент на Gemini, который умеет искать по заметкам, редактировать их и создавать новые. Для тех, кто любит Obsidian, но хочет что-то полегче и с нормальным AI. Привет! Наткнулся на интересную штуку для всех, кто ведёт заметки в markdown. ## Что это Kuku — это редактор заметок для macOS, который позиционирует себя как «Obsidian + Cursor в одном флаконе». Звучит амбициозно, но давай разберёмся. Главное отличие от Obsidian — приложение написано на Tauri вместо Electron. Это значит, что оно использует нативный WebView системы, а не тащит за собой целый Chromium. В итоге бандл весит около 15 МБ и жрёт примерно 80 МБ памяти. Для сравнения, типичное Electron-приложение — это 100+ МБ на диске. Заметки хранятся как обычные `.md` файлы у тебя на диске. Никакого облака, никакого lock-in. Можешь открыть те же файлы в vim, закоммитить в git или даже использовать параллельно с Obsidian. Синтаксис `[[wikilinks]]` вроде бы совместим, хотя я не проверял все edge cases. ## Как работает Базовые вещи тут стандартные: пишешь `[[`, выскакивает автокомплит для ссылок между заметками. Есть граф связей, есть полнотекстовый поиск на SQLite FTS5. Интереснее другое. AI-агент на Gemini умеет не просто генерировать текст, а работать с твоей базой: искать по ней, читать файлы, создавать новые документы. Что-то типа Cursor, только для заметок вместо кода. Все изменения от AI показываются как диффы. Можешь принять или отклонить каждую правку отдельно через ⌘Y / ⌘N. Удобно, не надо потом разбираться, что там нейросеть наворотила. Ещё есть локальный speech-to-text на whisper.cpp. Работает оффлайн, ничего никуда не отправляется. ## Тарифы Есть бесплатная версия с лимитами на AI. Pro стоит $12/месяц, там лимиты выше. Есть ещё какой-то Ultra Thinker, но цену нужно смотреть на сайте. Альтернатива — подключить свой API-ключ от Gemini и платить напрямую Google. Для кого-то может быть дешевле. ## Для кого Если ведёшь заметки в markdown и хочется AI, который понимает контекст всей базы — это оно. Ну и если Electron-приложения раздражают своей прожорливостью. Главный минус — только macOS, нет ни Windows, ни Linux. Мобильного приложения тоже нет. И плагинов нет, так что экосистема Obsidian тут недостижима. Но как лёгкий нативный редактор с AI — вполне себе. [kuku.momConnect your thoughts. Write smarter with an AI-native Markdown editor for macOS.![](https://matveev.tech/content/images/icon/apple-touch-icon-2.png)kuku.mom![](https://matveev.tech/content/images/thumbnail/opengraph.VcZ1lfHR_ZdHbAn.webp)](https://www.kuku.mom/?ref=matveev.tech) ### GPT-5.3 Codex vs Claude Opus 4.6 URL: https://matveev.tech/gpt-5-3-codex-vs-claude-opus-4-6/ Last updated: 2026-03-10T10:30:14.000Z > **TL;DR:** OpenAI и Anthropic выпустили обновления флагманов в один день, буквально минута в минуту. GPT-5.3 Codex побеждает в терминальных задачах и управлении компьютером. Opus 4.6 сильнее в кодинге по SWE-bench, длинном контексте и профессиональных задачах. Короткий ответ: зависит от того, что тебе нужно. 5 февраля 2026 года. 10 утра по тихоокеанскому времени. OpenAI публикуют анонс GPT-5.3 Codex. Anthropic в ту же минуту — Claude Opus 4.6\. Совпадение? Конечно нет. Обе компании знали о релизе друг друга и решили устроить лобовое столкновение. Через пару дней они ещё и рекламу на Суперкубке покажут друг против друга. Война AI-моделей в самом разгаре. Но хватит драмы. Давай разберёмся, какая модель реально лучше. ## Бенчмарки лоб в лоб Проблема сравнения в том, что компании частично используют разные бенчмарки. Но кое-где пересечения есть. Несколько наблюдений. Terminal-Bench 2.0 — тут GPT-5.3 Codex разнёс Opus 4.6 на 12 пунктов. Это бенчмарк терминальных навыков, и для агента-кодера это критично. Забавно, что Anthropic утром объявили «лучший результат на Terminal-Bench», а через 35 минут OpenAI побили этот рекорд. Самый короткоживущий рекорд в истории AI-бенчмарков. SWE-bench Verified — тут Opus 4.6 показывает 80.8%. OpenAI не публиковали результат GPT-5.3 Codex на этом бенчмарке (они используют SWE-Bench Pro, другую версию). На SWE-Bench Pro у GPT-5.3 Codex 56.8%, но сравнивать напрямую нельзя — разные тесты. GDPval (профессиональные задачи) — Opus 4.6 опережает GPT-5.2 на 144 Elo-пункта. GPT-5.3 Codex показал 70.9% (wins or ties), что примерно на уровне GPT-5.2\. То есть тут Opus 4.6 впереди. ## Где GPT-5.3 Codex сильнее В терминальных задачах разрыв огромный. 77.3% на Terminal-Bench — рекорд индустрии. Если твой агент большую часть времени работает через командную строку, это прямо имеет значение. На OSWorld (управление компьютером через визуальный интерфейс) — 64.7%, почти вдвое больше, чем у GPT-5.2\. Anthropic не публиковали свой результат на этом бенчмарке, так что сравнить не с чем. В кибербезопасности 77.6% на CTF-челленджах. Это первая модель OpenAI с рейтингом «High capability», и первая, которую специально обучали искать уязвимости. Работает на 25% быстрее предшественника и тратит меньше токенов. Для тех, кто гоняет много задач через агента — ощутимая разница. Ну и необычный факт: GPT-5.3 Codex помогала разрабатывать саму себя. Дебажила тренинг, масштабировала GPU-кластеры. Звучит фантастически, но OpenAI описывают это подробно. ## Где Claude Opus 4.6 сильнее Контекст в миллион токенов — и не просто на бумаге. На MRCR v2 (поиск иголок в стоге сена) Opus 4.6 набрал 76%, а Sonnet 4.5 всего 18.5%. Четырёхкратная разница. У GPT-5.3 Codex таких данных нет. На SWE-bench Verified — 80.8%, один из лучших результатов среди всех моделей. Задачи там больше про решение реальных GitHub-issues, а не про терминальную работу. Разный акцент. За пределами кода Opus 4.6 тоже силён: GDPval, BigLaw Bench (90.2% в юридических задачах), BrowseComp. Модель широкого профиля, не только для разработчиков. В Claude Code появились Agent Teams — можно запускать команды агентов, которые работают параллельно и координируются. У Codex есть интерактивная работа, но именно мультиагентность — фишка Anthropic. Ещё модель сама решает, когда ей нужно подумать подольше (adaptive thinking). Четыре уровня усилий. У OpenAI похожая система, но у Anthropic она выглядит более гибкой. И context compaction — автоматическое сжатие контекста, когда разговор подходит к лимиту. Для длительных агентных сессий штука незаменимая. ## Цены GPT-5.3 Codex пока работает только внутри экосистемы Codex (приложение, CLI, IDE-расширение). API обещают. Opus 4.6 уже доступен через API по цене Opus 4.5. Для разработчиков, которым нужен API прямо сейчас, выбор очевиден — Opus 4.6\. Когда OpenAI откроют API для GPT-5.3, картина может измениться. ## Разные философии Вот что мне кажется самым интересным. Эти две модели отражают разные стратегии. OpenAI делают ставку на узкую специализацию. GPT-5.3 Codex — это агент для кодинга и компьютерных задач. Терминал, файлы, деплой, масштабирование. Модель заточена под конкретный сценарий и в нём работает очень хорошо. Anthropic идут в ширину. Opus 4.6 — модель общего назначения, которая хороша в коде, юриспруденции, финансах, исследованиях, работе с Excel и PowerPoint. Контекст в миллион токенов. Гибкое управление мышлением. Кому что ближе — зависит от задач. ## Кому какая модель Бери GPT-5.3 Codex, если: - Работаешь преимущественно через терминал - Нужен агент для автономного выполнения задач на компьютере - Занимаешься кибербезопасностью - Уже сидишь в экосистеме ChatGPT/Codex Бери Claude Opus 4.6, если: - Нужен API прямо сейчас - Работаешь с большими кодовыми базами (миллион токенов контекста) - Задачи выходят за рамки чистого кодинга — аналитика, документы, юридика - Хочешь мультиагентные команды в Claude Code - Нужна гибкость в управлении усилием модели ## Мой взгляд Думаю, победителя тут нет, и это хорошо. Два года назад мы выбирали между «плохо» и «чуть получше». Сейчас выбираем между двумя очень сильными моделями с разными акцентами. Что действительно раздражает — обе компании используют разные бенчмарки, и честное сравнение приходится собирать по крупицам. Хотелось бы видеть обе модели на одних и тех же тестах. Но, видимо, каждой компании выгоднее показывать те цифры, где она впереди. Подождём, когда сообщество прогонит обе модели на одинаковых задачах. ## Что ещё почитать - [GPT-5.3 Codex — модель, которая помогала создавать саму себя](https://matveev.tech/gpt-5-3-codex-obzor/) — подробный обзор новой модели OpenAI - [Claude Opus 4.6 — Anthropic выпустили свою самую умную модель](https://matveev.tech/claude-opus-4-6-obzor/) — подробный обзор модели Anthropic - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — предыдущая версия Codex - [19 лучших AI-инструментов для продуктивности в 2026](https://matveev.tech/ai-instrumenty-produktivnost-2026/) — обзор экосистемы AI-инструментов ### Agent Teams в Claude Code: как запустить команду AI-агентов URL: https://matveev.tech/claude-code-agent-teams-instrukciya/ Last updated: 2026-02-15T10:43:49.000Z > **TL;DR:** В Claude Code появились Agent Teams — можно запустить несколько AI-агентов, которые работают параллельно, обмениваются сообщениями и координируют задачи через общий список. Один агент выступает лидером, остальные работают самостоятельно. Фича экспериментальная, но уже рабочая. Помнишь, я писал про [TeammateTool](https://matveev.tech/claude-code-multi-agent-teammatetool/) — скрытую мультиагентную систему, которую нашли в бинарнике Claude Code? Так вот, Anthropic её официально выкатили. Называется Agent Teams, и это уже не просто подагенты, которые выполняют одну задачу и возвращают результат. Тут агенты реально общаются друг с другом, спорят и сами разбирают задачи. Я поковырялся с этим и собрал инструкцию — как включить, запустить и не потерять кучу токенов впустую. ## Когда это нужно (а когда нет) Сразу оговорюсь: Agent Teams жрут токены. Каждый агент — отдельная сессия Claude со своим контекстным окном. Если задача последовательная или касается одного файла, обычная сессия или подагенты справятся лучше и дешевле. А вот где команды агентов реально полезны: - Код-ревью с разных сторон — один смотрит на безопасность, другой на перформанс, третий проверяет тесты - Дебаг с конкурирующими гипотезами — агенты параллельно проверяют разные теории и спорят между собой - Разработка новых модулей — каждый агент пилит свой кусок, не мешая остальным - Кросс-слойные изменения — фронт, бэк и тесты разнесены по разным агентам ## Чем отличается от подагентов Подагенты (субагенты) — это рабочие, которые выполнили задачу и вернули результат. Всё общение идёт через главного агента. Agent Teams — это полноценная команда. У каждого агента свой контекст, они переписываются напрямую друг с другом, есть общий список задач. Лидер координирует, но не является единственным каналом связи. Если нужно быстро получить ответ и забыть — подагенты. Если задача требует обсуждения, взаимной проверки или параллельной работы над разными частями — Agent Teams. ## Включение Фича экспериментальная и выключена по умолчанию. Чтобы включить, добавь переменную окружения в `settings.json`: ```json { "env": { "CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS": "1" } } ``` Или можно задать переменную прямо в шелле перед запуском Claude Code. ## Запуск команды После включения просто опиши задачу и попроси создать команду. Claude сам решит, сколько агентов нужно, или ты можешь указать явно. Пример промпта: ```plaintext Создай команду агентов для ревью PR #142. Три ревьюера: - один проверяет безопасность - один смотрит на производительность - один валидирует тестовое покрытие Пусть проверят и соберут результаты. ``` Claude создаст команду, раздаст задачи и начнёт координировать работу. Можно и попроще: ```plaintext Я проектирую CLI-тул для трекинга TODO-комментариев в коде. Создай команду агентов: один на UX, один на архитектуру, один играет роль devil's advocate. ``` ## Режимы отображения Два варианта: **In-process** — все агенты работают в одном терминале. Переключаешься между ними через `Shift+Up/Down`. Работает везде, ничего дополнительно ставить не надо. **Split panes** — каждый агент в своей панели. Видишь всех одновременно, кликаешь в панель для прямого взаимодействия. Нужен tmux или iTerm2. > Для iTerm2 надо установить [it2 CLI](https://github.com/mkusaka/it2?ref=matveev.tech), затем включить Python API в **iTerm2 → Settings → General → Magic → Enable Python API**. По умолчанию стоит `auto` — если ты уже внутри tmux, будет split panes, иначе in-process. Можно переключить: ```json { "teammateMode": "in-process" } ``` Или для одной сессии: ```bash claude --teammate-mode in-process ``` ## Управление командой Вся координация идёт через лидера на естественном языке. Но ты можешь и напрямую общаться с любым агентом. ### Прямое общение с агентами В режиме in-process — `Shift+Up/Down` для выбора агента, потом просто пишешь. `Enter` — просмотр сессии агента, `Escape` — прервать текущий ход. `Ctrl+T` — показать список задач. В split panes — кликни в панель нужного агента. ### Задачи и координация У команды общий список задач с тремя статусами: pending, in progress, completed. Задачи могут зависеть друг от друга — заблокированная задача не будет взята в работу, пока зависимости не закроются. Лидер может назначать задачи конкретному агенту, а агенты могут сами подбирать незанятые задачи из списка. ### Режим делегирования Иногда лидер начинает сам писать код вместо того, чтобы ждать агентов. Чтобы этого избежать, нажми `Shift+Tab` — включится delegate mode. Лидер сможет только координировать: создавать агентов, писать сообщения, управлять задачами. Без прямого доступа к коду. ### Требование плана перед работой Для сложных задач можно потребовать, чтобы агент сначала составил план: ```plaintext Запусти агента-архитектора для рефакторинга модуля авторизации. Потребуй утверждение плана до начала изменений. ``` Агент будет работать в read-only режиме, пока лидер не одобрит план. Если план отклонён — агент получает фидбэк и переделывает. ## Как это устроено внутри Команда состоит из четырёх компонентов: - **Лидер** — основная сессия, которая создаёт команду и координирует - **Агенты** — отдельные инстансы Claude Code, каждый со своим контекстом - **Список задач** — общий для всей команды - **Почтовый ящик** — система обмена сообщениями между агентами Данные хранятся локально: - Конфиг команды: `~/.claude/teams/{team-name}/config.json`\- Задачи: `~/.claude/tasks/{team-name}/` Каждый агент при запуске получает тот же проектный контекст, что и обычная сессия — CLAUDE.md, MCP-серверы, скиллы. Но история разговора лидера не передаётся. Поэтому важно давать агентам достаточно контекста в промпте при создании. ## Ограничения Фича экспериментальная, и ограничения пока серьёзные: - `/resume` и `/rewind` не восстанавливают in-process агентов. После возобновления сессии лидер может пытаться писать агентам, которых уже нет - Агенты иногда забывают отметить задачу как выполненную, что блокирует зависимые задачи - Завершение работы агента может быть медленным — он дожидается окончания текущей операции - Одна команда на сессию. Нужно очистить текущую перед созданием новой - Агенты не могут создавать свои команды (нет вложенных команд) - Лидер фиксирован на всю жизнь команды - Split panes не работают в VS Code terminal, Windows Terminal и Ghostty ## Что ещё почитать - [В Claude Code нашли мультиагентную систему — TeammateTool](https://matveev.tech/claude-code-multi-agent-teammatetool/) — предыстория Agent Teams, когда фичу нашли в бинарнике - [Oh My Claude Code: мультиагентная система для тех, кому лень настраивать Claude Code](https://matveev.tech/oh-my-claudecode-multi-agent/) — альтернативный подход к мультиагентности через плагин - [Claude Superpowers — плагин для Claude Code](https://matveev.tech/claude-superpowers-plugin/) — ещё один способ расширить возможности Claude Code - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — если хочешь, чтобы агенты работали с внешними сервисами ### GPT-5.3 Codex — модель, которая помогала создавать саму себя URL: https://matveev.tech/gpt-5-3-codex-obzor/ Last updated: 2026-02-25T12:16:53.000Z > **TL;DR:** OpenAI выкатили GPT-5.3 Codex — обновлённую агентную модель для программирования. Она на 25% быстрее предшественницы, ставит рекорды на SWE-Bench Pro и Terminal-Bench, а ещё участвовала в собственном обучении и деплое. Доступна в платных тарифах ChatGPT. ## Главное за минуту GPT-5.3 Codex — это апгрейд GPT-5.2 Codex. В одной модели теперь совмещены сильный кодинг от Codex-линейки и рассуждения с профессиональными знаниями от GPT-5.2\. Плюс модель работает на 25% быстрее. Но самое интересное — OpenAI заявляют, что это первая модель, которая активно участвовала в собственном создании. Ранние версии GPT-5.3 Codex дебажили свой тренинг, управляли деплоем и анализировали результаты тестирования. Звучит как научная фантастика, но по описанию похоже на правду — команда OpenAI говорит, что их работа кардинально изменилась за последние два месяца. ## Бенчмарки Вот цифры, и тут есть на что посмотреть: По SWE-Bench Pro прирост мизерный: с 56.4% до 56.8%. Думаю, тут уже потолок для текущей архитектуры. Зато Terminal-Bench прыгнул с 64% до 77.3%, а OSWorld вообще почти удвоился (с 38.2% до 64.7%). Управление компьютером — это где модель реально прибавила. Ещё модель тратит меньше токенов, чем предшественники. Для разработчиков это прямая экономия. ![](https://matveev.tech/content/images/2026/02/SWE-Bench-Pro--Public--1.png) ![](https://matveev.tech/content/images/2026/02/Terminal-Bench-2.0.png) ![](https://matveev.tech/content/images/2026/02/OSWorld-Verified.png) ## Что умеет на практике Кодинг — это понятно. Но OpenAI делают акцент на том, что GPT-5.3 Codex выходит за рамки написания кода. Вот что они показали: Модель самостоятельно итерировала над двумя играми: гоночной и про дайвинг. Получала простые команды вроде «исправь баг» или «улучши игру» и автономно работала миллионы токенов, пока не получились играбельные продукты. Лендинги стали лучше из коробки. Если попросить сделать страницу с тарифами, модель сама покажет годовую подписку в виде месячной цены со скидкой, добавит карусель отзывов вместо одного цитатника. Мелочи, но в продуктовой работе они важны. Работа с компьютером (OSWorld) — тут прогресс заметный. Модель может выполнять задачи в визуальной среде рабочего стола. Я не уверен, насколько это применимо прямо сейчас, но направление интересное. ## Интерактивная работа Раньше ты давал Codex задачу и ждал результат. Сейчас можно общаться с моделью прямо во время работы — задавать вопросы, корректировать направление, обсуждать подходы. Модель рассказывает, что делает, и отвечает на фидбек. Включается в настройках: Settings > General > Follow-up behavior. Мне кажется, это правильный шаг. Агент, который молча работает часами и выдаёт результат, это удобно, но немного страшно. Когда видишь промежуточные решения и можешь вмешаться — совсем другое дело. ## Кибербезопасность Тут отдельная история. GPT-5.3 Codex — первая модель, которую OpenAI классифицировали как «High capability» для задач кибербезопасности. И первая, которую специально обучали находить уязвимости в коде. OpenAI расширяют бета-тест Aardvark — своего агента для поиска уязвимостей. Уже сканируют опенсорс-проекты вроде Next.js. И вкладывают $10M в кредиты API для исследователей безопасности. Неплохо. 77.6% на CTF-челленджах — это сильный результат. Для сравнения, у GPT-5.2 Codex было 67.4%. ## Как модель помогала создавать себя Это, пожалуй, самая необычная часть анонса. Команда OpenAI использовала ранние версии GPT-5.3 Codex для: - Мониторинга и дебага собственного тренинга - Оптимизации инфраструктуры деплоя - Поиска багов рендеринга контекста и проблем с кэшированием - Динамического масштабирования GPU-кластеров при скачках трафика - Анализа данных альфа-тестирования и создания дашбордов Один из исследователей попросил модель оценить, сколько дополнительной работы GPT-5.3 делает за один ход. Модель сама придумала regex-классификаторы, прогнала их по логам сессий и выдала аналитический отчёт. Вот это уже звучит как реальная польза, а не маркетинг. ## Доступность GPT-5.3 Codex доступен в платных тарифах ChatGPT — в приложении Codex, через CLI, IDE-расширение и веб-версию. API пока нет, но обещают «скоро». Модель обучена и работает на NVIDIA GB200 NVL72. ## В итоге По кодингу тут эволюция, не революция (SWE-Bench вырос на полпроцента). Зато агентные возможности подросли заметно: OSWorld почти удвоился, Terminal-Bench +13 пунктов. Модель стала быстрее, экономнее по токенам, и теперь можно с ней разговаривать прямо во время работы. Меня лично больше всего впечатлила история про самообучение. Модель дебажит собственный тренинг, масштабирует кластеры для своего же деплоя. Не знаю, как далеко это зайдёт, но направление понятное. Если ты уже используешь Codex на платном тарифе — обновление придёт автоматически. Если ещё нет и раздумываешь — дождись API, тогда можно будет реально оценить модель в своих задачах. ## Что ещё почитать - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — предыдущая версия модели и что она умеет - [Codex от OpenAI теперь работает прямо в JetBrains IDE](https://matveev.tech/codex-openai-jetbrains-ide/) — как подключить Codex к среде разработки - [Claude Opus 4.6 — Anthropic выпустили свою самую умную модель](https://matveev.tech/claude-opus-4-6-obzor/) — конкурент от Anthropic для сравнения ### Claude Opus 4.6 - Anthropic выпустили свою самую умную модель URL: https://matveev.tech/claude-opus-4-6-obzor/ Last updated: 2026-02-05T17:58:29.000Z > **TL;DR:** Anthropic выпустили Claude Opus 4.6 - обновление самой мощной модели в линейке. Контекстное окно выросло до миллиона токенов, появились команды агентов в Claude Code, adaptive thinking и управление «усилием» модели. По бенчмаркам Opus 4.6 опережает GPT-5.2 и все остальные фронтир-модели. Anthropic не стали тянуть с обновлением флагмана. Claude Opus 4.6 вышел сегодня и доступен везде — в claude.ai, через API и на всех облачных платформах. Цена та же — $5/$25 за миллион токенов. Разбираю, что реально изменилось. ## Контекст наконец-то миллион Это первая модель Opus-класса с контекстом в 1М токенов (пока в бета). Раньше приходилось как-то ужиматься, а теперь можно скормить модели целую кодовую базу или стопку документов. И тут Anthropic показали интересные цифры. На бенчмарке MRCR v2 (это когда нужно найти иголки в стоге сена из текста) Opus 4.6 набрал 76%, а предыдущий Sonnet 4.5 — всего 18.5%. Четырёхкратная разница. То есть модель реально не теряет нить на длинных контекстах, а не просто формально поддерживает миллион токенов. ## Кодинг стал заметно лучше Opus 4.6 занял первое место на Terminal-Bench 2.0 — агентном бенчмарке для кодинга. По отзывам ранних пользователей, модель лучше планирует и дольше держит фокус. А ещё ловит свои же ошибки при ревью кода, что раньше было больным местом. Один из партнёров рассказал, что модель провела миграцию кодовой базы на несколько миллионов строк «как сеньор-инженер». Закончила вдвое быстрее ожидаемого. Звучит слишком красиво, но тренд понятен агентные задачи на больших проектах становятся реальнее с каждым релизом. ## Agent Teams в Claude Code Вот это самое-самое интересное для разработчиков. В Claude Code теперь можно собирать команды агентов, которые работают параллельно. Например, один агент ревьюит код, другой пишет тесты, третий исследует кодовую базу — и все координируются между собой. Переключаться между агентами можно через Shift+Up/Down или tmux. Пока это research preview, но направление крутое. Я уже писал про мультиагентные подходы — и вот, теперь это встроено прямо в Claude Code. ## Adaptive Thinking и управление усилием Раньше extended thinking включался или выключался. Теперь модель сама решает, когда ей нужно подумать подольше. Это называется adaptive thinking. Вдобавок появились четыре уровня «усилия» — low, medium, high (по умолчанию) и max. Простой вопрос? Ставишь medium и экономишь токены. Сложная задача? Max. Для тех, кто работает с API, это удобно — можно подбирать баланс под конкретную задачу, а не платить за максимум всегда. ## Context Compaction Ещё одна новинка для API — автоматическое сжатие контекста. Когда разговор приближается к лимиту, модель сама резюмирует старую часть и продолжает работать. Для длительных агентных сессий это спасение — раньше приходилось вручную укладываться в контекстное окно. ## Бенчмарки На Humanity's Last Exam (сложный мультидисциплинарный тест) Opus 4.6 обогнал все фронтир-модели. На GDPval-AA (задачи из финансов, юриспруденции и других профессиональных областей) опередил GPT-5.2 на 144 Elo-пункта. На BrowseComp (поиск труднодоступной информации) тоже лучший результат. Не уверен, насколько бенчмарки переносятся на реальные задачи, но разрыв с конкурентами выглядит существенным. Особенно если учесть, что цена не изменилась. ## Безопасность Anthropic говорят, что улучшение интеллекта не привело к снижению безопасности. Opus 4.6 показал самый низкий уровень ложных отказов среди всех моделей Claude — это когда модель отказывается отвечать на безобидные вопросы. При этом уровень «несогласованного поведения» остался на уровне Opus 4.5 или ниже. Ещё момент: раз модель стала сильнее в кибербезопасности, Anthropic добавили шесть новых проверок на случай злоупотребления. Логично — мощность растёт, защита тоже должна. ## Excel и PowerPoint Claude теперь лучше работает с Excel — сам определяет структуру данных и делает многоэтапные изменения за один проход. Появилась интеграция с PowerPoint (research preview для Max, Team и Enterprise), где Claude учитывает твои шаблоны и стили при создании слайдов. Если ты готовишь отчёты и презентации, стоит попробовать. Не знаю, насколько это будет работать на сложных макетах, но для типовых задач может сэкономить кучу времени. ## В итоге Вообще, Anthropic тут сделали сразу много всего. Миллион токенов контекста, agent teams, adaptive thinking, context compaction. Любая из этих штук по отдельности была бы заметным обновлением, а тут всё разом. Для разработчиков модель доступна по ID `claude-opus-4-6`. Цена прежняя. Если ты уже работаешь с Claude через API или Claude Code, попробуй переключиться. Особенно на длинных задачах разница должна быть ощутимой. [Claude Opus 4.6We’re upgrading our smartest model. Across agentic coding, computer use, tool use, search, and finance, Opus 4.6 is an industry-leading model, often by wide margin.![](https://matveev.tech/content/images/icon/apple-touch-icon-4.png)Notion logo![](https://matveev.tech/content/images/thumbnail/01d06528567e4bd22c3ddedc87f609ee5716a009-2400x1260-1.png)](https://www.anthropic.com/news/claude-opus-4-6/?ref=matveev.tech) ## Что ещё почитать - [В Claude Code нашли мультиагентную систему — TeammateTool](https://matveev.tech/claude-code-multi-agent-teammatetool/) — предыстория agent teams, которые теперь стали официальной фичей - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — для сравнения с главным конкурентом от OpenAI - [Лучшие AI-редакторы кода в 2026 году](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — как Claude Code вписывается в экосистему AI-инструментов для разработки - [Claude Superpowers — плагин для Claude Code](https://matveev.tech/claude-superpowers-plugin/) — расширение, которое добавляет планирование и дисциплину в работу с Claude Code ### Citable — как узнать, упоминает ли ChatGPT ваш бренд URL: https://matveev.tech/citable-ai-vidimost-brenda/ Last updated: 2026-02-05T13:40:33.000Z > **TL;DR:** Сервис показывает, как AI-ассистенты (ChatGPT, Claude, Perplexity, Gemini) воспринимают ваш бренд и помогает улучшить «цитируемость». Для маркетологов, которые думают о SEO будущего. А вот это интересно. Появился сервис для оптимизации под ответы нейросетей. **Citable** — платформа для анализа видимости бренда в ответах AI-ассистентов. Идея простая: люди всё чаще спрашивают ChatGPT «какой лучший сервис для X?» вместо гугления. И если нейросеть не упоминает ваш продукт — вы теряете потенциальных клиентов. Сервис отслеживает, как часто и в каком контексте AI упоминает ваш бренд, и помогает это исправить. ## Как работает Мониторит ответы основных AI-платформ: - ChatGPT - Claude - Perplexity - Gemini - Grok Показывает аналитику: где вас упоминают, где нет, какие конкуренты мелькают чаще. Плюс даёт рекомендации по GEO (Generative Engine Optimization) — это как SEO, только для нейросетей. ## Тарифы Базовый функционал бесплатный. Думаю, расширенная аналитика будет платной, но пока можно потестить без денег. ## Для кого Для маркетологов и тех, у кого B2B-продукт или SaaS. Если твоя аудитория — разработчики или tech-люди, они точно спрашивают у ChatGPT «какой лучший инструмент для X». И было бы обидно не попасть в ответ. Честно говоря, не знаю насколько GEO-оптимизация реально работает. Но сама идея мониторинга мне нравится — хотя бы понимаешь, что происходит. [Citable - GEO for the AI EraDiscover how AI platforms perceive your brand and measure your digital citability across the web.![](https://matveev.tech/content/images/icon/favicon.png)CitableCitable![](https://matveev.tech/content/images/thumbnail/logo-black.svg)](https://getcitable.com/?ref=matveev.tech) ### FastMCP 3.0 — Python-фреймворк для MCP-серверов URL: https://matveev.tech/fastmcp-python-mcp-servery/ Last updated: 2026-02-05T08:48:07.000Z > **TL;DR:** FastMCP — это фреймворк для создания MCP-серверов на Python. Пишешь функцию, вешаешь декоратор — и у тебя готовый инструмент для LLM. Для разработчиков, которые хотят подключить свои данные и логику к AI-агентам. Привет! Если ты следишь за темой AI-агентов, то наверняка слышал про MCP — Model Context Protocol от Anthropic. Это протокол, который позволяет LLM получать доступ к внешним инструментам и данным. Звучит просто, но на практике реализация занимает кучу времени на сериализацию, валидацию и обработку ошибок. FastMCP решает эту проблему. ## Что это FastMCP — open-source фреймворк на Python для создания MCP-серверов и клиентов. Версия 1.0 была настолько удачной, что её включили в официальный MCP SDK ещё в 2024 году. Сейчас разные версии FastMCP используются в 70% всех MCP-серверов. Минимальный пример: ```python from fastmcp import FastMCP mcp = FastMCP("Demo 🚀") @mcp.tool def add(a: int, b: int) -> int: """Add two numbers""" return a + b if __name__ == "__main__": mcp.run() ``` Всё. Функция `add` теперь доступна как инструмент для любого LLM-клиента, который поддерживает MCP. ## Как работает Архитектура разбита на три слоя, и мне нравится, что они не перемешиваются. Components — это то, что видят клиенты: инструменты, ресурсы, промпты. Вешаешь декоратор на функцию, и FastMCP сам разберётся со схемой и валидацией. Providers отвечают за источники данных. Можно тянуть компоненты из декорированных функций, файлов, OpenAPI-спек или вообще с удалённых серверов. Transforms определяют, как именно клиенты видят компоненты. Тут живут неймспейсы, фильтрация, авторизация. Один сервер может показывать разный интерфейс разным пользователям — удобно, если нужно разграничить доступ. В версии 3.0 добавили: - Hot reload для разработки - Встроенную авторизацию - Observability из коробки - Поддержку долгих задач - HTTP-транспорт для удалённого доступа ## Хостинг Команда FastMCP сделала Prefect Horizon — платформу для хостинга MCP-серверов. Для личных проектов она бесплатная. Деплой в три шага: 1\. Пушишь код на GitHub 2\. Логинишься в Horizon через GitHub 3\. Указываешь entrypoint типа `my_server.py:mcp` Получаешь URL вида `https://your-project.fastmcp.app/mcp`. ## Для кого - Разработчики, которые хотят подключить свои инструменты к Claude, ChatGPT или другим LLM - Команды, строящие AI-агентов с доступом к внутренним системам - Те, кто уже использовал MCP SDK и устал от бойлерплейта Кстати, документация доступна в LLM-friendly форматах. Есть даже MCP-сервер с доксами, который можно подключить к своему агенту. Мета-уровень какой-то. [Welcome to FastMCP 3.0! - FastMCPThe fast, Pythonic way to build MCP servers and clients.![](https://matveev.tech/content/images/icon/apple-touch-icon-1.png)FastMCP![](https://matveev.tech/content/images/thumbnail/image)](https://gofastmcp.com/getting-started/welcome?ref=matveev.tech) ### Adject 1.5 — фото и видео товаров без фотостудии URL: https://matveev.tech/adject-foto-video-dlya-ecommerce/ Last updated: 2026-02-25T12:16:54.000Z > **TL;DR:** Adject 1.5 — сервис для генерации фото и видео товаров с помощью ИИ. Загружаешь картинку продукта, описываешь сцену — получаешь студийный визуал. Есть режимы image-to-image, генерация по референсу и создание видео из статичных кадров. Если у тебя интернет-магазин, ты знаешь боль: чтобы сделать нормальные фото товаров, нужна студия, фотограф, свет, фоны. А если товаров сотни — это вообще отдельный квест. Adject пытается решить эту проблему с помощью генеративного AI. ## Что умеет В версии 1.5 появился проектный подход — можно организовать все генерации по папкам и не терять результаты. Основные режимы работы: - **Image-to-image** — загружаешь фото товара, описываешь желаемую сцену, получаешь результат - **Генерация по референсу** — показываешь пример стиля, сервис применяет его к твоему продукту - **Image-to-video** — превращает статичную картинку в короткое видео - **Frame-to-video** — создаёт видео из нескольких ключевых кадров Можно переключаться между фото и видео режимами прямо в процессе работы. ## Для кого это Основная аудитория — e-commerce бренды, которым нужно много визуального контента. Вместо того чтобы арендовать студию и нанимать фотографа для каждой съёмки, загружаешь базовые фото товаров и генерируешь вариации. Думаю, это особенно полезно для: - Тестирования гипотез — быстро сделать несколько вариантов визуала для A/B тестов - Сезонных кампаний — не переснимать весь каталог, а сгенерировать новые фоны - Социальных сетей — нужен постоянный поток свежего контента ## Что ещё почитать - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один no-code инструмент для бизнеса - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — про продуктивность без отвлечений Генерация визуала — одно из самых практичных применений AI прямо сейчас. Качество уже достаточное для коммерческого использования, а экономия времени и денег очевидна. Если у тебя магазин с большим каталогом — стоит попробовать. ### Superdesign — библиотека промптов для дизайна прямо в IDE URL: https://matveev.tech/superdesign-prompt-library/ Last updated: 2026-02-25T12:16:54.000Z > **TL;DR:** Superdesign — это open-source библиотека готовых промптов для генерации дизайна прямо в IDE. Выбираешь стиль (неоморфизм, бруталистский, glassmorphism), пишешь что нужно — получаешь рабочий UI-код. Работает с Cursor, Windsurf, Claude Code и обычным VS Code. Знаешь главную проблему вайб-кодинга? AI отлично пишет код, но с дизайном часто выходит что-то среднее между «корпоративный Bootstrap» и «сайт из 2010». Не потому что модели плохие — просто им не хватает контекста. Superdesign решает именно это. ## Что это такое Superdesign — это расширение для IDE + облачная библиотека дизайн-промптов. Идея простая: вместо того чтобы каждый раз объяснять AI, какой стиль тебе нужен, ты выбираешь готовый промпт из библиотеки. В библиотеке уже больше 40 стилей: - **Glassmorphism** — полупрозрачные карточки с размытием - **Neo-Brutalism** — толстые рамки, резкие тени, никаких закруглений - **Cyber Serif** — классическая типографика + неоновые акценты - **Terminal CLI** — эстетика командной строки - **Win98** — ностальгия по ранним Windows - **Neumorphism** — мягкие тени, как будто выдавлено из поверхности И ещё куча специфических: от «газетного» стиля до liquid metal и architectural blueprint. ## Как работает 1. Ставишь расширение в Cursor, VS Code или Windsurf 2. Открываешь панель Superdesign 3. Выбираешь стиль из библиотеки или пишешь свой промпт 4. Генерируешь макет, компонент или wireframe 5. Копируешь результат в проект Самое-самое — можно генерировать несколько вариантов параллельно. Написал «лендинг для SaaS-продукта» — получил 10 разных интерпретаций в выбранном стиле. Все сгенерированные дизайны сохраняются локально в папке `.superdesign/`. ## Работа с кодовыми агентами Расширение интегрируется с Cursor, Claude Code и другими AI-инструментами. После установки добавляются правила, и ты можешь просить агента делать дизайн с превью прямо в канвасе Superdesign. Для Cursor есть отдельная рекомендация: скопировать промпт из `design.mdc` и создать кастомный режим с этим системным промптом. По отзывам — работает заметно лучше. ## Библиотека промптов Отдельная фишка — публичная библиотека на [app.superdesign.dev/library](https://app.superdesign.dev/library?ref=matveev.tech). Там можно: - Использовать готовые промпты от сообщества - Создавать свои и делиться с командой (приватно) - Контрибьютить в публичную коллекцию Каждый промпт — это детальное описание визуального стиля: цветовая палитра, типографика, анимации, характерные элементы. ## Что ещё есть Недавно появилось Chrome-расширение для клонирования дизайна любого сайта. Видишь интересный UI — клонируешь стиль в свой проект. Думаю, для тех, кто активно вайб-кодит, это реально полезная штука. Вместо того чтобы каждый раз заново объяснять AI свои предпочтения по дизайну — один раз выбрал стиль и работаешь. Плюс open-source, можно форкнуть и докрутить под себя. 5.7k звёзд на GitHub — сообщество растёт. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — ещё один способ использовать AI-агентов для автоматизации - [TaskWand — генерация воркфлоу для n8n с помощью ИИ](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — похожая идея с генерацией из промптов, только для автоматизаций ### Vibe Pocket — запускай Claude Code с телефона URL: https://matveev.tech/vibe-pocket-ai-agenty-s-telefona/ Last updated: 2026-02-04T09:21:34.000Z > **TL;DR:** Vibe Pocket — облачная платформа для запуска CLI AI-агентов типа Claude Code, Codex, Gemini CLI с телефона или браузера. Подключаешь GitHub, выбираешь агента и кодишь откуда угодно. Иногда идея приходит не за компьютером. Едешь в метро, сидишь в кафе или просто гуляешь — и тут бац, понял как исправить баг. А ноутбука под рукой нет. Vibe Pocket решает эту проблему. Это облачная платформа, которая позволяет запускать CLI-based AI-агентов прямо с телефона. ## Что умеет Главное — поддержка кучи агентов. На старте доступны: - **Claude Code** — агент от Anthropic - **Codex** — OpenAI - **Gemini CLI** — Google - **OpenCode**, **Droid**, **AMP CLI**, **Crush**, **Aider** - И ещё около 10 других Всего больше 15 CLI-инструментов. Подключаешь свой GitHub-репозиторий, выбираешь агента — и работаешь. ## Как это работает 1. Заходишь на платформу с телефона или браузера 2. Подключаешь GitHub 3. Выбираешь репозиторий и агента 4. Пишешь промпты, агент пишет код Ещё есть доступ к терминалу — можно запускать команды как на обычном компьютере. И даже смотреть работающие веб-приложения прямо в интерфейсе Vibe Pocket. ## Для кого это Думаю, в первую очередь для тех, кто много работает с AI-агентами и не хочет быть привязан к одному устройству. Быстро глянуть код, закоммитить фикс, запустить деплой — всё это теперь можно сделать с телефона. Ну и для вайбкодеров, конечно. Само название намекает. Продукт собрал 139 апвоутов на Product Hunt. Не рекорд, но для нишевого инструмента — хорошо. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь понять, что вообще можно делать с Claude Code - [Предсказания на 2026 — что думают инженеры Oxide](https://matveev.tech/predicty-oxide-2026/) — там обсуждается будущее вайбкодинга - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — про Codex, который тоже поддерживается в Vibe Pocket ### Kimi K2.5 — китайский open-source с роем из 100 агентов URL: https://matveev.tech/kimi-k2-5-visual-agentic/ Last updated: 2026-02-03T13:46:16.000Z > **TL;DR:** Moonshot выкатили Kimi K2.5 — open-source модель, которая умеет запускать рой из 100 агентов параллельно, делать до 1500 tool calls за задачу и работает в 4.5 раза быстрее одиночного агента. Плюс сильный vision и кодинг. Китайцы из Moonshot не дают расслабиться. Только недавно они выпустили K2, а тут уже K2.5 — и это не просто минорный апдейт. ## Что нового K2.5 дообучили на 15 триллионах токенов текста и картинок. Это нативная мультимодальная модель, то есть vision не прикрутили сбоку, а встроили с самого начала. Главная фишка - **agent swarm**. Модель сама создаёт до 100 подагентов и раздаёт им задачи параллельно. Никаких предзаданных ролей или хардкода - K2.5 сам решает, каких специалистов создать и как распределить работу. В итоге получается до 1500 tool calls за одну задачу, а скорость выполнения растёт в 4.5 раза по сравнению с обычным подходом «один агент делает всё по очереди». ## Метод PARL Moonshot назвали свой метод PARL — Parallel-Agent Reinforcement Learning. Идея такая: есть главный агент-оркестратор, который декомпозирует задачу на части. Каждую часть выполняет отдельный подагент. Проблема в том, что учить такую систему сложно: фидбэк приходит с задержкой, от разных агентов, и всё это меняется по ходу обучения. Плюс есть риск «коллапса в последовательность», когда оркестратор забивает на параллелизм и гоняет всё по очереди. Чтобы побороть это, они ввели награду за параллелизм на ранних этапах обучения. Постепенно эта награда затухает, и модель переключается на качество результата. ## Vision + Code K2.5 хорошо работает с картинками и кодом одновременно. Можешь скинуть скриншот интерфейса — модель сгенерирует код. Или показать видео сайта — она его воспроизведёт. Интересный пример из блога: K2.5 дали картинку лабиринта и попросили найти кратчайший путь. Модель сама написала код на Python с BFS-алгоритмом, обработала картинку, нашла путь из 113 тысяч шагов и визуализировала результат. ## Бенчмарки На SWE-Bench Verified модель показала 76.8%. Это рядом с GPT-5.2 (80%) и Claude Opus 4.5 (80.9%). На агентных бенчмарках интереснее: K2.5 в режиме swarm набрал 78.4% на BrowseComp, обойдя всех остальных. Vision тоже неплохой — MMMU-Pro 78.5%, VideoMMMU 86.6%. Хотя, честно говоря, эти цифры мало что говорят без реального опыта использования. ## Где попробовать Модель доступна на kimi.com, в приложении Kimi, через API и в Kimi Code — это их терминальный клиент вроде [Claude Code](https://matveev.tech/tag/claude-code/). Есть четыре режима: K2.5 Instant, K2.5 Thinking, K2.5 Agent и K2.5 Agent Swarm (пока в бета). Agent Swarm пока дают бесплатно пользователям платных тарифов. Не знаю, насколько хорошо это будет работать на реальных задачах — бенчмарки это одно, а практика другое. Но сама идея роя агентов выглядит правильной. Вместо того чтобы делать одну модель умнее, они масштабируют параллельно. Посмотрим, приживётся ли такой подход. [Kimi K2.5 Tech Blog: Visual Agentic IntelligenceKimi K2.5 defines Visual Agentic Intelligence. Trained on 15T tokens, it introduces SOTA visual coding and autonomous agent swarm. Read the full tech blog.![](https://matveev.tech/content/images/icon/faviconV2-1)Kimi](https://www.kimi.com/blog/kimi-k2-5.html?ref=matveev.tech) ## Что ещё почитать - [Oh My Claude Code: мультиагентная система для тех, кому лень настраивать Claude Code](https://matveev.tech/oh-my-claudecode-multi-agent/) — если интересна тема мультиагентов - [В Claude Code нашли мультиагентную систему — TeammateTool](https://matveev.tech/claude-code-multi-agent-teammatetool/) — скрытые мультиагентные возможности в Claude ### Video To Screenshots — скриншоты из видео без мучений URL: https://matveev.tech/video-to-screenshots/ Last updated: 2026-02-25T12:16:55.000Z > **TL;DR:** Video To Screenshots автоматически вытаскивает кадры из видео, отсеивает размытые и убирает дубликаты. Вся обработка происходит локально в браузере — видео никуда не уходит. Бесплатно. Знакомая ситуация: нужно сделать скриншоты из видео для презентации, документации или поста. Открываешь плеер, жмёшь паузу, ловишь нужный момент... и получаешь размытый кадр. Ещё раз. И ещё. Через полчаса у тебя 50 почти одинаковых скриншотов и желание всё бросить. ## Как это работает Video To Screenshots делает всю рутину за тебя. Загружаешь видео — сервис автоматически извлекает кадры с заданным интервалом. Часы записи можно просканировать за минуты. Главная фишка — умная фильтрация. Встроенный детектор размытия отсеивает смазанные кадры ещё до того, как ты их увидишь. Плюс автоматическое удаление дубликатов — никаких десяти почти одинаковых скриншотов. ## Что по приватности Всё работает локально в браузере. Видео не загружается на сервер, не хранится в облаке. Это особенно важно, если работаешь с чем-то конфиденциальным — записями созвонов, рабочими материалами. ## Для кого это - Контент-мейкеры — быстро набрать кадры для превью и постов - Дизайнеры — скриншоты интерфейсов из видео-демо - Документация — кадры из обучающих роликов - Просто когда нужно вытащить удачный момент из записи Думаю, штука полезная для тех, кто регулярно работает с видеоконтентом. Особенно радует, что всё крутится локально — не нужно переживать за приватность и ждать загрузки на сервер. ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один инструмент для тех, кто ценит простоту и фокус - [Scouts by Yutori — AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — автоматизация рутинных задач в другой области ### Firecrawl /agent — AI собирает данные с любых сайтов по описанию URL: https://matveev.tech/firecrawl-agent-sbor-dannyh/ Last updated: 2026-02-25T12:16:56.000Z > **TL;DR:** Firecrawl запустили /agent — API, который собирает данные с сайтов по текстовому описанию. Не нужно указывать URL или писать парсеры — просто говоришь «найди все компании YC W24 с фаундерами» и получаешь структурированный JSON. 5 бесплатных запросов в день. Если ты когда-нибудь писал парсеры или скрейперы, знаешь эту боль: каждый сайт уникален, структура меняется, капчи, блокировки… Firecrawl решили убрать эту головную боль полностью. ## Что такое /agent Это API-эндпоинт, который принимает текстовое описание нужных данных и сам разбирается, где их искать. Буквально: ты пишешь промпт вроде «найди все листинги Nike Air Jordan с ценами» — агент сам ищет в вебе, переходит по страницам, собирает данные и возвращает чистый JSON. По сути это эволюция их /extract — раньше нужно было указывать конкретный URL, теперь даже это опционально. ## Как это работает Агент умеет: - Искать по вебу нужную информацию - Переходить по страницам и собирать данные - Возвращать как единичные значения, так и целые датасеты - Работать с «труднодоступными» местами (динамический контент, SPA) Интеграция простая — есть Python SDK, API и даже MCP-сервер для Claude: ```python from firecrawl import FirecrawlApp from pydantic import BaseModel app = FirecrawlApp(api_key="fc-YOUR-API-KEY") class Company(BaseModel): name: str founders: list[str] website: str result = app.agent( prompt="Get all YC W24 companies", schema=Company ) ``` ## Примеры использования Ребята показывают несколько кейсов: - **Лидогенерация** — собрать список компаний с контактами фаундеров - **E-commerce** — спарсить товары с ценами с маркетплейсов - **Маркет-дата** — получить капитализацию топ-50 компаний - **Датасеты** — собрать все AI-пейперы с arXiv - **Недвижимость** — найти квартиры по параметрам ## Цены Пока это research preview с динамическим ценообразованием: - 5 бесплатных запросов в день - Простые запросы тратят меньше кредитов - Сложные — больше - Можно ставить лимит через параметр `maxCredits` ## Что думаю Штука реально крутая для прототипирования и небольших задач. Вместо того чтобы писать парсер под каждый сайт, просто описываешь что нужно. Для продакшена с большими объёмами пока вопрос — нужно смотреть на реальную стоимость и надёжность. Но для быстрого сбора данных, ресёрча или построения MVP — самое то. ## Что ещё почитать - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один no-code инструмент для создания AI-агентов - [Scouts by Yutori — AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — похожая идея, но для мониторинга изменений на сайтах 📚 Источники - \[Firecrawl /agent\](https://firecrawl.dev/agent) - \[Product Hunt: /agent by Firecrawl\](https://www.producthunt.com/posts/agent-by-firecrawl) ### GitJin — быстрый дашборд для GitHub без лишнего URL: https://matveev.tech/gitjin-dashboard-github/ Last updated: 2026-02-25T12:16:56.000Z > **TL;DR:** GitJin — это альтернативный дашборд для GitHub, который показывает все твои репозитории, issues и PR на одном экране. Главная фишка — скорость и минимализм. Данные не сохраняются на сервере, всё через GitHub API. Стандартная главная GitHub — это, конечно, что-то. Куча рекомендаций, Explore, Copilot-баннеры... А ты просто хочешь быстро найти нужный репозиторий или посмотреть открытые PR. ## Что умеет GitJin Всё просто — три секции на одном экране: - **Репозитории** — список всех твоих репо - **Issues** — открытые issues по всем проектам - **Pull Requests** — все PR в одном месте Никаких рекомендаций, трендов, новостей. Только то, с чем ты реально работаешь. ## Почему это удобно Автор позиционирует GitJin как «самый быстрый GitHub-дашборд в мире». Может и преувеличение, но идея понятна — минимум элементов, максимум скорости. Важный момент: GitJin не хранит твои данные. Всё работает через GitHub API, так что никакой синхронизации или сохранения на чужих серверах. ## Что думаю Для тех, кто каждый день работает с несколькими репозиториями — реально удобно. Вместо того чтобы кликать по разным разделам GitHub, получаешь всё на одном экране. Понятно, что это не замена полноценному GitHub — для code review, настройки Actions или работы с Projects всё равно пойдёшь туда. Но как быстрая точка входа для ежедневной работы — вполне. ## Что ещё почитать - [Что ждёт разработчиков в ближайшие 2 года](https://matveev.tech/budushchee-razrabotki-2-goda/) — тренды в разработке и инструментах - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один минималистичный подход к дашбордам ### Super Agents от ClickUp — AI-напарники для рутины URL: https://matveev.tech/clickup-super-agents/ Last updated: 2026-02-25T12:16:57.000Z > **TL;DR:** ClickUp выкатил Super Agents — AI-агенты, которых можно создать за секунды и поручить им рутинные задачи. Их можно упоминать через @, писать им в личку, назначать на задачи и ставить по расписанию. Умеют сортировать задачи, отвечать на письма, писать код и вообще двигать любую работу. ClickUp давно экспериментирует с AI — у них есть ClickUp Brain, который помогает с поиском и генерацией контента. Но Super Agents — это уже следующий уровень. ## Что умеют Super Agents Идея простая: ты создаёшь агента под конкретную задачу и дальше работаешь с ним как с коллегой. Можно: - **Упомянуть через @mention** — написал в комментарии "@агент, разбери это", и он разберёт - **Написать в личку** — как обычному коллеге в чате - **Назначить на задачу** — агент станет исполнителем и будет работать - **Поставить по расписанию** — например, каждое утро сортировать входящие Типы задач, которые агенты тянут: - Сортировка и приоритизация задач (triage) - Управление проектами - Отправка и обработка email - Написание кода - Работа с дизайном - Любая рутина, которую можно описать ## Что под капотом ClickUp Brain — это не просто ChatGPT в обёртке. У них доступ к разным LLM (GPT, Claude и другие), плюс интеграции с кучей сервисов: Slack, Salesforce, Jira, GitHub, Figma, Gmail, Outlook и так далее. Агенты видят контекст твоего рабочего пространства — задачи, документы, чаты. Поэтому могут давать релевантные ответы и действительно делать работу, а не просто генерить текст в пустоту. ## Для кого это Думаю, самое-самое применение — для команд, которые уже живут в ClickUp. Если у тебя там задачи, документы и общение, то Super Agents органично встраиваются в процесс. Для соло-пользователей тоже может быть полезно, особенно если завал с задачами и хочется автоматизировать сортировку и напоминания. Super Agents — интересный шаг в сторону AI-напарников, которые живут прямо в твоих рабочих инструментах. Не отдельное приложение, а часть привычного workflow. ClickUp набрал 500+ голосов на Product Hunt, так что интерес к теме явно есть. ## Что ещё почитать - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один способ создавать агентов без кода - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как устроена память у агентов - [Scouts by Yutori — AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — агенты для мониторинга ### Voice Studio Companion — озвучка из меню-бара Mac URL: https://matveev.tech/voice-studio-companion/ Last updated: 2026-02-25T12:16:57.000Z > **TL;DR:** Voice Studio Companion — приложение в меню-баре Mac, которое превращает текст в голосовую озвучку через ElevenLabs. 20+ голосов, результат можно сразу перетащить в Final Cut, Premiere или любую программу, которая принимает аудио. Если ты делаешь видео или подкасты, наверняка знаешь боль с озвучкой. Либо записываешь сам (а это время и правки), либо лезешь в веб-интерфейс ElevenLabs, генерируешь, скачиваешь, импортируешь... Много лишних действий. Voice Studio Companion решает это элегантно — живёт в меню-баре и работает по принципу «написал → выбрал голос → перетащил». ## Как это работает Идея простая: открываешь приложение из меню-бара, вставляешь текст, выбираешь один из 20+ голосов — и через пару секунд получаешь аудиофайл. Дальше просто перетаскиваешь его в нужное место. Поддерживаются: - **Видеоредакторы:** Final Cut Pro, Premiere Pro, DaVinci Resolve - **Аудио:** Logic Pro, GarageBand - **Презентации:** Keynote, PowerPoint - По сути, любое приложение, которое принимает аудиофайлы Это тот самый drag & drop, который почему-то редко встречается в подобных инструментах. ## Про голоса Под капотом — технология ElevenLabs, так что качество соответствующее. Больше 20 голосов на выбор, от нейтральных до выразительных. Думаю, для большинства сценариев этого хватит с запасом. ## Для кого это Если честно — для всех, кто регулярно работает с озвучкой на Mac: - Видеомейкеры, которым нужен быстрый закадр - Подкастеры для интро и вставок - Те, кто делает обучающие материалы и презентации Ключевое преимущество — скорость. Никаких переключений между окнами, всё в одном месте. Если тебе интересна тема голосового AI, стоит учитывать и [изменения в условиях ElevenLabs](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — они теперь получают бессрочную лицензию на загруженные голоса. Voice Studio Companion использует готовые голоса платформы, так что это не касается твоего голоса напрямую, но знать полезно. ## Что ещё почитать - [CosyVoice 3 — голосовой AI от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — опенсорсная альтернатива с клонированием голоса - [Spokenly — транскрибация на Mac](https://matveev.tech/spokenly-transkribatsiia-gholosa-v-tiekst-na-mac/) — обратная задача: голос в текст - [ElevenLabs и бессрочная лицензия на голос](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — что нужно знать об условиях использования ### Launch Shots — бесплатный генератор скриншотов для App Store URL: https://matveev.tech/launch-shots-skrinshoty-app-store/ Last updated: 2026-01-31T16:19:00.000Z > **TL;DR:** Launch Shots — браузерный редактор для создания скриншотов приложений. Шаблоны, рамки устройств, фоны и AI-перевод на 100+ языков. Бесплатно даётся 3 скачивания в месяц, дальше — от $0.60 за штуку или безлимит за $9/мес. Если ты когда-нибудь публиковал приложение в App Store или Google Play, то знаешь эту боль — скриншоты. Они должны быть красивыми, с правильными размерами, желательно на разных языках. И вот ты сидишь в Figma, двигаешь пиксели, экспортируешь в пяти разрешениях... Launch Shots решает эту проблему. Это браузерный редактор, где можно быстро собрать приличные скриншоты без навыков дизайна. ## Что внутри Главное — **шаблоны**. Их много, и они постоянно добавляются. Есть готовые варианты для разных категорий: финансы, продуктивность, игры, соцсети. Можно взять шаблон и просто вставить свои скриншоты — уже будет выглядеть прилично. Дальше — **редактор**. Слои, тени, фоны, рамки устройств. Всё как в нормальном графическом редакторе, но заточено именно под скриншоты приложений. iPhone, Android-девайсы, планшеты — рамки на любой вкус. И самое интересное — **AI-локализация**. Редактор умеет автоматически переводить текст на скриншотах на 100+ языков. Это реально экономит время, если приложение международное. ## Сколько стоит Базовый план бесплатный навсегда. Даётся 3 скачивания в месяц — этого хватит, чтобы попробовать и понять, подходит ли инструмент. Если нужно больше: - **Pay as you go** — от $0.60 за скачивание, кредиты не сгорают - **Подписка** — $9/мес (или $5.40 при годовой оплате) за безлимит Один кредит = все фреймы на странице. То есть если у тебя 6 скриншотов на одной странице проекта, скачиваешь всё за один кредит. ## Для кого это Инструмент явно заточен под инди-разработчиков и небольшие команды. Тех, у кого нет дизайнера в штате, но хочется чтобы скриншоты выглядели профессионально. Думаю, особенно полезно будет тем, кто часто обновляет приложения или запускает новые. Вместо того чтобы каждый раз возиться в Figma, можно за полчаса накидать все варианты прямо в браузере. Если делаешь мобильные приложения — стоит попробовать. Три бесплатных скачивания в месяц — достаточно, чтобы понять, подходит тебе это или нет. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — как автоматизировать рутину без программирования - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один инструмент для фокуса 📚 Источники - \[Launch Shots на Product Hunt\](https://www.producthunt.com/products/launch-shots) - \[Официальный сайт Launch Shots\](https://www.launchshots.com/) ### GitHired — поиск разработчиков по реальным проектам, а не резюме URL: https://matveev.tech/githired-poisk-razrabotchikov/ Last updated: 2026-02-25T12:16:58.000Z > **TL;DR:** GitHired — сервис для найма, который анализирует GitHub кандидатов и автоматически ранжирует их по реальным навыкам. Показывает настоящий стек, глубину проектов и отсеивает фейковые коммиты. Вместо чтения 100 резюме — одностраничный профиль с фактами. Знакомая история: читаешь резюме — «5 лет React, опыт с AWS, микросервисы». Проводишь интервью — человек не может объяснить, как работает useState. Резюме врут. Люди приукрашивают. А времени на глубокие технические интервью со всеми кандидатами нет. ## Как работает GitHired Идея простая: вместо того чтобы верить словам — смотреть на код. GitHired создаёт форму для приёма заявок, кандидат оставляет ссылку на GitHub, а система автоматически анализирует профиль. Что показывает: - **Реальный стек** — какие технологии человек использует на практике, а не пишет в резюме - **Глубина проектов** — не просто «знаю Python», а насколько сложные задачи решал - **Активность** — регулярность коммитов и вовлечённость в проекты - **Фильтр фейков** — система отсеивает накрученные коммиты (да, такое бывает) На выходе — одностраничный профиль кандидата с конкретными цифрами вместо общих слов. ## Для кого это Думаю, больше всего пользы для: **Стартапов и небольших команд** — когда нет HR-отдела и нужно быстро закрыть позицию. Один фаундер может отсмотреть 50 кандидатов за час вместо недели. **Технических рекрутеров** — чтобы до интервью понимать, с кем имеешь дело. Меньше времени на тех, кто «немного преувеличил» опыт. **Тимлидов** — когда нанимаешь в команду и хочешь сразу видеть, кто реально работал со стеком. ## Что мне нравится Сама концепция «proof of work вместо keywords» — правильная. GitHub-профиль говорит о разработчике больше, чем любое резюме. Особенно круто, что система умеет отлавливать накрутку — это реальная проблема, когда люди делают сотни пустых коммитов ради зелёного графика. Автоматический анализ сложности проектов — тоже полезно. Одно дело форкнуть туториал, другое — поддерживать проект с тысячами строк. ## Ограничения Очевидное: не все хорошие разработчики активны на GitHub. Кто-то работает с закрытым кодом, кто-то не ведёт публичные проекты. Но для позиций, где важен опенсорс или демонстрируемый опыт — инструмент отличный. GitHired решает конкретную боль найма в IT: разрыв между тем, что люди пишут о себе, и тем, что они реально умеют. Если устал угадывать по резюме — стоит попробовать. ## Что ещё почитать - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один инструмент, который автоматизирует рутину - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — как автоматизировать задачи без программирования ### Typeless для iOS — голосовая клавиатура с AI URL: https://matveev.tech/typeless-ios-golosovaya-klaviatura/ Last updated: 2026-02-25T12:16:58.000Z > **TL;DR:** Typeless — это AI-клавиатура для iPhone, которая превращает живую речь в чистый текст. Говоришь как думаешь, со всеми «эээ» и сбивчивыми мыслями — получаешь отредактированное сообщение, которое выглядит так, будто ты полчаса над ним сидел. Знакомая ситуация: тебе нужно написать длинное сообщение, а набирать на телефоне — мучение. Диктовка в iOS помогает, но результат часто выглядит... ну, как диктовка. Со всеми повторами, паузами и странной пунктуацией. Typeless решает именно эту проблему. Это не просто транскрибация — это AI-редактор в режиме реального времени. ## Как это работает Говоришь естественно, как в разговоре. Можешь запинаться, менять мысль на ходу, добавлять «короче» и «ну типа». Typeless всё это убирает и выдаёт чистый текст. Причём работает это прямо в любом приложении — это системная клавиатура. Отвечаешь в мессенджере, пишешь письмо, заполняешь форму — везде можно просто наговорить. ## Что умеет - **Живая обработка** — текст появляется и редактируется прямо пока говоришь - **Убирает мусор** — слова-паразиты, повторы, незаконченные фразы - **Сохраняет смысл** — не просто чистит, а структурирует мысль - **Работает везде** — как обычная клавиатура iOS ## Кому пригодится Думаю, Typeless будет полезен тем, кто много общается текстом, но не любит печатать. Особенно если часто приходится писать длинные сообщения или письма с телефона. Ещё вижу применение для тех, кто думает вслух. Когда проще наговорить идею, чем сформулировать её в голове, а потом ещё и набрать. 636 голосов на Product Hunt и #1 продукт дня — народ явно оценил. Если диктовка на iPhone тебя всегда раздражала результатом, стоит попробовать. ## Что ещё почитать - [Spokenly — транскрибация голоса в текст на Mac](https://matveev.tech/spokenly-transkribatsiia-gholosa-v-tiekst-na-mac/) — похожий инструмент, но для десктопа и с локальной обработкой - [CosyVoice 3 — голосовой AI от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — если интересно, как работают современные голосовые модели - [ElevenLabs теперь владеет твоим голосом навсегда](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — про другую сторону голосовых AI и на что обращать внимание в условиях использования ### Reddit Summarizer — суммаризация тредов одним кликом URL: https://matveev.tech/reddit-summarizer-ai-extension/ Last updated: 2026-02-25T12:16:59.000Z > **TL;DR:** Reddit Summarizer — Chrome-расширение, которое собирает все комментарии из треда Reddit и отправляет их в AI для суммаризации. Поддерживает работу с тредами, сабреддитами и результатами поиска. Можно подключить любую LLM. Знаешь это чувство, когда находишь крутой тред на Reddit с тысячей комментариев? Вроде там точно есть золото — но копаться в этом всём час-другой совсем не хочется. Reddit Summarizer решает именно эту проблему. ## Как это работает Расширение делает три простые вещи: 1. **Собирает данные** — забирает метаданные треда вместе со всеми комментариями 2. **Чистит контент** — убирает мусор и форматирует текст 3. **Отправляет в AI** — передаёт всё в выбранную тобой модель для анализа На выходе получаешь структурированную выжимку: главные мнения, популярные советы, спорные моменты — всё, что реально важно в треде. ## Где работает - Отдельные треды - Страницы сабреддитов (суммаризация нескольких постов) - Результаты поиска на Reddit ## Кастомизация Можно настроить под себя — выбрать AI-провайдера, задать формат вывода, указать на что обращать внимание. Например, попросить выделять только практические советы или только негативные отзывы. ## Кому полезно - Исследователям, которые ищут мнения реальных людей - Маркетологам для анализа обратной связи о продуктах - Всем, кто хочет быстро понять суть обсуждения без чтения сотен комментов Думаю, для тех, кто регулярно использует Reddit как источник информации — штука must-have. Особенно для продуктовых исследований, где нужно быстро понять общее настроение аудитории. [Reddit Post Analyzer - Chrome Web StoreInstantly summarize any Reddit thread, subreddit, or search result and chat with AI to dig deeper![](https://matveev.tech/content/images/icon/icon_144px-1.png)Chrome Web Store![](https://matveev.tech/content/images/thumbnail/mxakKTkTm0CLzoAhJFdnq_yPq25G7A6sntsJEWD_fGqPHATLF8RD4vqN7z23YYj6fnWPeNKKG9pFoLXDAhPEjmzVpg-s128-rj-sc0x00ffffff-1)](https://chromewebstore.google.com/detail/reddit-post-analyzer/jccgjnbkibbigimcfohndjbakjhelfoo?utm%5Fsource=item-share-cb) ## Что ещё почитать - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один no-code инструмент для работы с AI - [Scouts by Yutori - AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — похожий подход к автоматизации веб-серфинга ### ScreenREC — бесплатный скринрекордер без скачивания URL: https://matveev.tech/screenrec-besplatnyj-skrinrinkorder/ Last updated: 2026-02-25T12:16:59.000Z > **TL;DR:** ScreenREC — онлайн-скринрекордер, который работает прямо в браузере. Ничего не нужно скачивать, регистрироваться тоже не надо. Записи сохраняются локально, код открытый. Знаешь эту ситуацию: нужно быстро записать баг, показать коллеге процесс или сделать мини-туториал — а под рукой нет нормального софта? Ставить OBS ради одного скринкаста — явный перебор. ## Что это ScreenREC решает ровно эту проблему. Открываешь сайт, жмёшь одну кнопку — запись пошла. Без регистрации, без скачивания, без всей этой возни. Что умеет: - Записывать экран, веб-камеру и звук одновременно - Full HD качество - Экспорт в MP4 или WebM - Тёмная тема (мелочь, а приятно) Главная фишка — приватность. Все записи остаются на твоём компьютере. Ничего не уходит на сервера, никакого трекинга. Для тех, кто работает с чувствительными данными — это критично. И да, проект полностью опенсорсный. Можно посмотреть код, убедиться что там нет ничего подозрительного, или захостить у себя. ## Для кого Думаю, это идеальный инструмент для: - Быстрых багрепортов — записал, отправил, готово - Коротких туториалов для команды - Асинхронной коммуникации (вместо созвона — запись экрана) - Демо фич для стейкхолдеров В целом, для простых задач — самое то. Не нужно ставить тяжёлый софт, разбираться в настройках, тратить время. Открыл браузер и записываешь. Иногда этого достаточно. [ScreenRec - A simple web screen recorderWith ScreenRec you can easily record your screen. Select video type, press record, review and download it. Easy.![](https://matveev.tech/content/images/icon/safari-pinned-tab.42a59a72.svg)ScreenREC![](https://matveev.tech/content/images/thumbnail/moon.c8e79927.svg)](https://screen-rec.vercel.app/?ref=matveev.tech) ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — ещё один инструмент для продуктивности без сложных настроек - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — про минимализм в инструментах ### Thumbfa.st — AI-превью для YouTube с твоим лицом URL: https://matveev.tech/thumbfast-ai-prevyu-youtube-2/ Last updated: 2026-01-28T13:57:27.000Z > **TL;DR:** Загружаешь своё фото один раз, описываешь что хочешь, получаешь превью с твоим лицом. Можно воровать стиль чужих обложек. Для тех, кто устал тратить час в Canva. Привет! Если ты ведёшь ютуб-канал, то знаешь эту боль: видео смонтировал, а теперь ещё час сидеть над превьюшкой. Нашёл штуку, которая это меняет. ## Что это такое Thumbfa.st генерирует превью для YouTube. Но не просто генерирует, а запоминает твоё лицо. Загружаешь фотки один раз, создаёшь профиль, и дальше AI рисует тебя одинаково на всех обложках. Называют себя «Midjourney для превью». Честно говоря, сравнение натянутое, но суть передаёт: пишешь промпт, получаешь картинку. ## Как это работает Загружаешь несколько своих фоток. AI учится, как ты выглядишь. Потом самое интересное: можно воровать. Видишь у конкурента крутую обложку? Кидаешь ссылку на видео, сервис вытаскивает превью и раскладывает на составляющие. Цвета, композиция, настроение. Сохраняет в библиотеку. Когда нужна новая обложка, выбираешь свой профиль, стиль из библиотеки, пишешь что хочешь. Генеришь до 4 вариантов за раз. На выходе PNG 1280x720, заливаешь сразу на YouTube. По их словам, меньше минуты на всё. Я не проверял, но звучит правдоподобно. ## Сколько стоит Бесплатно дают 5 генераций в месяц и только модель Gemini. Хватит попробовать. Pro за $19/мес даёт 100 генераций и добавляет OpenAI. Ultra за $49 — 300 штук. Есть Lifetime за $199: платишь один раз, подключаешь свои API-ключи, пользуешься сколько хочешь. ## Кому это нужно Ютуберам, которые: - Ненавидят делать превью - Хотят узнаваемый стиль канала, но не хотят нанимать дизайнера - Уже пробовали генерить обложки через Midjourney или DALL-E и бесились, что лицо каждый раз разное Создатель сервиса хвастается A/B тестом: его AI-превью набрало 51.5% времени просмотра против 24.8% и 23.7% у человеческих. Не знаю, насколько это репрезентативно, но любопытно. [Thumbfa.stCreate stunning AI-powered YouTube thumbnails in seconds![](https://matveev.tech/content/images/icon/apple-icon.png)![](https://matveev.tech/content/images/thumbnail/opengraph-image.png)](https://thumbfa.st/?ref=matveev.tech) ### Dashly — превращаем новую вкладку в рабочий дашборд URL: https://matveev.tech/dashly-dashboard-new-tab/ Last updated: 2026-02-25T12:17:00.000Z > **TL;DR:** Dashly — расширение, которое заменяет пустую вкладку браузера на персональный дашборд. Виджеты с заметками, задачами, RSS, Pomodoro, мировыми часами и биржевыми котировками. Всё шифруется и хранится локально — никакого облака. Каждый раз, когда открываешь новую вкладку, видишь либо пустоту, либо рекламу от Google. Dashly предлагает третий вариант — рабочее пространство, которое всегда под рукой. ## Что внутри Dashly работает как конструктор виджетов. Берёшь нужные блоки и расставляешь как удобно — всё перетаскивается мышкой. Виджеты: - **Заметки и задачи** — с шифрованием, без синхронизации в облако - **RSS-ленты** — читаешь новости прямо на дашборде - **Pomodoro-таймер** — для фокус-сессий - **Биржевые котировки** — если следишь за рынком - **Мировые часы** — полезно для созвонов с разными часовыми поясами - **Закладки** — быстрый доступ к частым сайтам - **Поиск** — с настраиваемыми категориями и bulk-поиском - **Цитата дня** — для вдохновения ## Приватность и данные Тут самое интересное. Dashly не использует облако — все данные остаются в браузере. Заметки и задачи шифруются локально. Можно экспортировать и импортировать настройки, если нужно перенести на другой компьютер. Для тех, кто не хочет хранить личные заметки на чужих серверах — идеальный вариант. ## Кастомизация Есть поддержка тем оформления. Можно настроить внешний вид под себя, а не смотреть на стандартный интерфейс. Dashly — неплохая альтернатива для тех, кому нужен быстрый доступ к заметкам и задачам без лишних движений. Открыл вкладку — всё перед глазами. Никаких аккаунтов, синхронизаций и подписок. Расширение работает в Chrome и Edge. ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — если хочется вынести дашборд на отдельный экран - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — автоматизация рутины без программирования ### Elser AI — генерация аниме-видео из одного промпта URL: https://matveev.tech/elser-ai-anime-video/ Last updated: 2026-02-25T12:17:00.000Z > **TL;DR:** Elser AI превращает текстовую идею в полноценный аниме-ролик с сюжетом, персонажами и кинематографичным стилем. Утверждают, что консистентность персонажей на 30% выше конкурентов — проверили на 180+ сценах. Если ты когда-нибудь мечтал создать свой аниме-сериал, но рисовать не умеешь и бюджета на студию нет — появился ещё один вариант. ## Что это Elser AI — это генератор видео, заточенный под аниме. Вводишь описание истории, получаешь видеоролик. Не пятисекундный клип, а что-то более-менее длинное — с началом, серединой и концом. Главная фишка — консистентность персонажей. Это боль всех AI-видеогенераторов: герой в начале выглядит одним образом, через десять секунд — совсем по-другому. Elser утверждают, что решили эту проблему — персонажи остаются узнаваемыми на протяжении 180+ сцен. ## Как работает 1. Пишешь идею истории в произвольной форме 2. AI раскладывает её на сценарий 3. Генерирует последовательность сцен с единым визуальным стилем 4. На выходе — готовое видео Никакого покадрового редактирования или ручной склейки. Всё из одного промпта. ## Цифры - 30%+ выше консистентность персонажей по сравнению с другими AI-инструментами - Тестировали на 180+ сценах - 410 голосов на Product Hunt за первые сутки ## Для кого это Думаю, сервис пригодится: - Создателям контента, которые хотят визуал для историй - Аниматорам для быстрого прототипирования идей - Всем, кто хочет поиграться с AI-видео в аниме-стиле Пока сложно сказать, насколько качество выходного видео годится для чего-то серьёзного. Но как минимум для набросков и экспериментов — выглядит интересно. AI-видео развивается очень быстро, и специализация на конкретном стиле (аниме) может дать лучший результат, чем универсальные генераторы. ## Что ещё почитать - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как AI запоминает контекст между сценами - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один no-code подход к AI ### Oh My Claude Code: мультиагентная система для тех, кому лень настраивать Claude Code URL: https://matveev.tech/oh-my-claudecode-multi-agent/ Last updated: 2026-01-27T12:50:10.000Z Большинство разработчиков не тратят недели на настройку своего шелла. Они ставят oh-my-zsh и получают нормальный терминал из коробки. Oh My Claude Code работает по тому же принципу, только для Claude Code. ## OMC [Oh My Claude Code](https://github.com/Yeachan-Heo/oh-my-claudecode?ref=matveev.tech) (OMC) — плагин, который добавляет в Claude Code 32 специализированных агента и 5 режимов выполнения задач. Проект создал Yeachan Heo, вдохновившись своей же работой oh-my-opencode. На GitHub у репозитория 3000 звёзд и 250 форков. Последний релиз v3.7.0 вышел 27 января 2026 года. Стандартный Claude Code работает так: ты пишешь промпт, получаешь ответ, при необходимости вручную делегируешь задачу субагенту. Для простых задач этого хватает. Для сложных — нет. OMC автоматически распределяет работу между агентами. Ты пишешь "autopilot: build a REST API for managing tasks", а система сама решает, какие агенты нужны и в каком порядке их запускать. ## Пять режимов выполнения **Autopilot** — полностью автономный режим. Пишешь задачу, система работает до завершения. Не останавливается на полпути. **Ultrapilot** — то же самое, но с параллельным выполнением. До 5 воркеров одновременно. По заявлениям авторов, ускорение в 3-5 раз. На практике зависит от задачи — параллелить можно не всё. **Swarm** — координированные агенты с общим пулом задач. Каждый агент берёт задачу, выполняет, отмечает как завершённую. Таймаут 5 минут на задачу. **Pipeline** — последовательное выполнение с передачей данных между этапами. Есть готовые пресеты: review, implement, debug, refactor. Можно создавать свои. **Ecomode** — режим экономии токенов. Работает как Ultrapilot, но с агентами поменьше и жёстким контролем бюджета. Для тех, кто на Pro-плане и считает деньги. ## 32 агента В комплекте идут агенты под разные задачи: - architect — проектирование архитектуры - researcher — исследование и сбор информации - designer — работа с UI/UX - writer — документация и тексты - qa-tester — тестирование - analyst — анализ данных - executor — выполнение команд Плюс несколько "научных" агентов разных уровней (scientist-t1, scientist-t2 и так далее) для исследовательских задач. Система сама выбирает нужного агента. Haiku для простых задач, Opus для сложных. По заявлениям авторов, это экономит 30-50% токенов. ## Установка Три команды: ```bash /plugin marketplace add https://github.com/Yeachan-Heo/oh-my-claudecode /plugin install oh-my-claudecode /oh-my-claudecode:omc-setup ``` После этого можно писать задачи с ключевыми словами: ``` autopilot: build a todo app ralph: refactor auth ulw fix all errors eco: migrate database ``` Ключевые слова можно комбинировать. `ralph ulw: migrate database` включит и persistence, и параллелизм. ## Что ещё есть **HUD** — статусная строка, которая показывает, что происходит: какой агент работает, сколько токенов потрачено, какой режим активен. **Автовозобновление при rate limit** — если Claude Code упёрся в лимит, OMC может автоматически продолжить работу после сброса. Команды: ```bash omc wait # проверить статус omc wait --start # включить демон omc wait --stop # выключить ``` Требует tmux для определения сессий. **Извлечение паттернов** — система запоминает, как ты решаешь типовые задачи, и переиспользует эти паттерны. ## Требования - Claude Code CLI - Подписка Claude Max/Pro или API-ключ Anthropic ## Стоит ли использовать Зависит от задач. Если ты работаешь с простыми промптами и редко делегируешь субагентам — скорее всего, не нужно. Если строишь что-то многокомпонентное и устал вручную координировать агентов — попробовать стоит. Проект активно развивается: 290 коммитов, 12 контрибьюторов, релизы выходят каждые несколько дней. MIT-лицензия. --- **Ссылки:** \- [GitHub репозиторий](https://github.com/Yeachan-Heo/oh-my-claudecode?ref=matveev.tech) \- [Официальный сайт](https://yeachan-heo.github.io/oh-my-claudecode-website/?ref=matveev.tech) \- [Документация](https://github.com/Yeachan-Heo/oh-my-claudecode/blob/main/docs/FULL-README.md?ref=matveev.tech) ### 19 лучших AI-инструментов для продуктивности в 2026 URL: https://matveev.tech/ai-instrumenty-produktivnost-2026/ Last updated: 2026-02-16T16:59:20.000Z > **TL;DR:** Рынок AI-инструментов наконец повзрослел. Вместо сотни «революционных» новинок — несколько проверенных решений для каждой задачи. Разбираю главные инструменты года с честным рейтингом от S до D-тира. Я прошёлся по главным инструментам года и разложил их по тирам — от обязательных до тех, что лучше обходить стороной. ## S-тир: большая тройка Это фундамент. В 2026-м эти модели фактически стали операционными системами интернета. Не нужны все три — но одна точно должна быть. **Gemini (3 Flash/Pro)** — если живёшь в Google Workspace, альтернатив нет. Gemini видит всё: Docs, Gmail, Drive. Для генерации картинок Nano Banana наконец-то решил проблему корявого текста на изображениях. **Claude (Sonnet 4.5)** — лучший для кода и текстов. Человечный тон, работа с огромными кодовыми базами без потери контекста. Сейчас это признанный лидер для реальной разработки. **ChatGPT (GPT-5.2)** — самый универсальный. Новая система автоматически переключается между быстрым и глубоким режимом. Голосовой режим в реальном времени обновляет графики прямо во время разговора. ## A-тир: рабочие лошадки Эти инструменты убирают конкретные препятствия в работе. Не гламурно, но эффективно. **NotebookLM** — самый популярный инструмент Google для глубокого ресёрча. Загружаешь 50 документов — получаешь эксперта по этим данным. Незаменим для синтеза сложных проектов. **Notion AI** — эволюционировал из заметочника в командный центр. Новая система записи встреч захватывает аудио прямо из системы (без дурацкого бота в созвоне), автоматически резюмирует решения и синхронизирует с календарём. **Zapier Central** — клей для всего стека. Создаёшь агентов, которые живут в 6000+ приложениях. «Если пришёл запрос на возврат — проверь базу и подготовь ответ» — и оно работает само. **Microsoft Copilot** — победитель корпоративных войн. Живёт прямо в Excel и PowerPoint. Превращает таблицу в дашборд или резюмирует 30-минутный созвон в Teams за секунды. **n8n** — для тех, кто хочет полный контроль над данными. Можно развернуть на своих серверах, писать кастомный JS или Python прямо в шагах воркфлоу. Сложные ветвления и циклы, которые другие инструменты не потянут. [Кстати, есть TaskWand](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — он генерирует воркфлоу для n8n через AI. ## B-тир: специализированные инструменты Швейцарский нож бесполезен, когда нужен скальпель. Эти штуки не для каждого дня, но в своей нише — лучшие. **Midjourney v7** — стандарт AI-арта превратился в полноценный дизайн-инструмент. Появились слои как в Photoshop и «Omni Reference» для консистентности персонажей между генерациями. **Runway Gen-3 Alpha** — закрепился в киноиндустрии. Технология «Act-One» переносит мимику с камеры смартфона на AI-персонажей. Node-based воркфлоу для контроля освещения, тряски камеры, консистентности — раньше такое было только в дорогих VFX-студиях. **ElevenLabs** — лидер голосового синтеза вышел в реалтайм. Scribe v2 с задержкой меньше 50ms. Speech-to-Speech позволяет записать своё чтение и заменить на профессиональный голос, сохранив эмоции и паузы. [Правда, стоит знать про их новые условия использования](https://matveev.tech/elevenlabs-tos-golos-navsegda/). **Replit Agent** — мощь для быстрого прототипирования. Собирает и деплоит full-stack приложения из одного промпта. Сам настраивает базы, интегрирует API, симулирует пользователей для тестирования. **Meshy** — демократизировал 3D-пайплайн. Текст или 2D-картинка превращается в готовую 3D-модель меньше чем за минуту. Автоматические PBR-текстуры и риггинг — сотни часов работы в Blender экономятся. **Pika 2.0** — король креативного хаоса добрался до 1080p. «Pikaframes» для кинематографичных морфов между кадрами, «Pikaffects» для сжатия, плавления и превращения объектов в торт с нарушением законов физики. **HeyGen** — заменяет съёмочные группы AI-аватарами. Мгновенный перевод видео на 140+ языков с клонированием аватара. «Video Agent» превращает одно предложение в полный скрипт, озвучку и визуал за 20 минут. ## C-тир: AI-браузеры 2025-й стал годом, когда два десятилетия застоя браузеров наконец закончились. AI-браузеры — вероятно, будущее интернета. Но пока они в C-тире, потому что работают больше как фильтры для ресёрча. **Brave (Leo AI)** — топ для приватности. Используешь Claude или Llama без трекинга. В C-тире, потому что фокус на защите, а не на выполнении задач. **Perplexity Comet** — для глубокого ресёрча. Превращает историю браузера в базу знаний, Background Assistants проверяют факты по нескольким вкладкам. Тяжеловат для обычного сёрфинга. **DuckDuckGo Browser (Duck.ai)** — полностью анонимный AI-опыт. Доступ к премиум-моделям с zero-knowledge приватностью. Но продвинутой автоматизации нет. ## D-тир: на что не стоит тратить время Эти инструменты дают «отрицательный ROI» — тратишь больше времени на исправление их ошибок, чем сэкономил. **Meta AI (Instagram/WhatsApp/Messenger)** — самый спорный пункт. Им пользуются миллиарды, но это скорее отвлечение. Вставлен в поиск социальных приложений без возможности отключить. Плюс вопросы о том, как личные переписки используются для обучения Llama. **Jasper & Copy.ai** — когда-то короли AI-райтинга, сейчас их жёсткие шаблоны ощущаются как шаг назад. Проще напрямую поговорить с Claude или ChatGPT, чем платить за «прослойку». **Обёртки над GPT** — тысячи приложений, которые просто «скин» поверх ChatGPT за $30/месяц. Если нет уникальной фичи (локальная индексация файлов, специализированный интерфейс) — используй S-тир напрямую. **Непроверенные «медицинские/юридические» AI** — никогда не используй нишевый AI для серьёзных советов без человека в цепочке. Многие до сих пор галлюцинируют факты с абсолютной уверенностью. Простое правило: если на каждые 10 сэкономленных минут тратишь 20 на «причёсывание» результата — это D-тир. Магия 2023-го стала утилитой 2026-го. Используй эти инструменты для творчества, автоматизации рутины и построения конкурентного преимущества. Но помни: за каждым решением AI должен стоять конкретный человек, который несёт ответственность. ## Что ещё почитать - [TaskWand — генерация воркфлоу для n8n с помощью AI](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — если хочешь попробовать n8n без ручной настройки - [ElevenLabs теперь владеет твоим голосом навсегда](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — важно знать перед использованием - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — практические сценарии для AI-ассистента - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как устроены «умные» системы изнутри ### Monocle — приложение, которое убирает отвлечения на Mac URL: https://matveev.tech/monocle-focus-mac/ Last updated: 2026-02-25T12:17:01.000Z > **TL;DR:** Monocle размывает все окна, кроме активного. Встряхиваешь курсор — фон исчезает, остаётся только текущая задача. $9 за пожизненную лицензию, есть 7-дневный триал. Знаешь это чувство, когда открываешь браузер посмотреть одну вещь, а через час обнаруживаешь себя с 47 вкладками и нулём продуктивности? Вот для таких случаев и придумали Monocle. ## Что это Monocle — это маленькое приложение в менюбаре, которое размывает всё на экране, кроме активного окна. Разработчики называют это «шумоподавлением для экрана». Думаю, название точное — визуальный шум действительно отвлекает не меньше звукового. Идея простая: глаза автоматически цепляются за движение на экране. Уведомления, другие окна, Dock — всё это тянет внимание. Monocle убирает этот визуальный мусор одним движением. ## Как работает Главная фишка — активация встряхиванием курсора. Потряс мышкой — фон размылся. Ещё раз потряс — всё вернулось. Можно настроить и на горячие клавиши, если встряхивание не твоё. Есть два режима: - **Gradient** — мягкое размытие вокруг активного окна, контекст остаётся виден - **Fullscreen** — полное погружение, кроме окна не видно вообще ничего Можно тонко настроить: интенсивность размытия, оттенок, зернистость. Есть опция автоматически скрывать Dock и менюбар. Работает на нескольких мониторах. ## Кому пригодится Вообще, Monocle явно делали для людей, которые работают в одном приложении: пишут код, текст, рисуют. Если постоянно переключаешься между окнами — будет скорее мешать. Но для глубокой работы — то что надо. Особенно если работаешь из дома и на экране вечно висит Slack или Telegram. ## Цена и где взять $9 за лицензию на три устройства, $4 — на одно. Одноразовая покупка, без подписок. Есть 7-дневный бесплатный триал. Требует macOS 14.6 или новее, работает на Intel и Apple Silicon. В целом, идея не новая — затемнение окон существует давно. Но реализация у Monocle приятная: встряхивание курсора интуитивно, настроек достаточно, цена разумная. Если визуальный шум — твоя проблема, стоит попробовать триал. [Monocle for macOS • Noise-cancelling for your screenBlur everything but your active window — just wiggle your cursor.![](https://matveev.tech/content/images/icon/rTWlNwKFiT9w0v9HIvifgHRio.svg)![](https://matveev.tech/content/images/thumbnail/RHD1lo8rCvvEjKrZssVW1N7et4.png)](https://www.heyiam.dk/monocle?ref=matveev.tech) ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один способ убрать отвлечения, только хардварный - [Spokenly — транскрибация голоса в текст на Mac](https://matveev.tech/spokenly-transkribatsiia-gholosa-v-tiekst-na-mac/) — другое полезное Mac-приложение для продуктивности ### FreeUpMyMac — наконец-то решение для «Системных данных» URL: https://matveev.tech/freeupmymac-mac-cleaner/ Last updated: 2026-02-03T13:40:37.000Z > **TL;DR:** FreeUpMyMac — утилита для очистки Mac, которая наконец решает проблему загадочных «Системных данных». Находит кэш, логи и мусор, который жрёт место на диске, и удаляет всё одним кликом. Знакомая история: открываешь хранилище на Mac, а там половину места занимают какие-то «Системные данные». macOS показывает эту серую полоску, но что конкретно там лежит — не объясняет. Вроде ничего не устанавливал, а место куда-то девается. ## Что это за приложение FreeUpMyMac — простая утилита, которая сканирует диск и находит всё, что можно безопасно удалить: - **Кэш приложений** — браузеры, мессенджеры и другие программы накапливают гигабайты временных файлов - **Системные логи** — macOS пишет логи на каждый чих, и они растут бесконечно - **Мусор от удалённых приложений** — когда удаляешь программу, папки с настройками остаются Главная фишка — приложение разбирается именно с теми «Системными данными», которые macOS показывает как неопознанный блок в хранилище. ## Как работает Запускаешь сканирование, приложение находит всё лишнее и показывает, что можно удалить. Один клик — место освобождается. Без копания в терминале и без риска удалить что-то важное. Думаю, полезно для тех, кто постоянно борется с нехваткой места на MacBook. Особенно если SSD на 256 гигов и каждый гигабайт на счету. [FreeUpMyMacReclaim GBs of space without the fear of breaking your Mac. Instantly find huge files and let our expert guide tell you what’s junk and what is vital.![](https://matveev.tech/content/images/icon/uIRaB71A7DDvZQQe4mG0yvpG1LA-1.png)![](https://matveev.tech/content/images/thumbnail/Uo6SAtmnDK7Spx2tOgjSIm0e2A-1.png)](https://freeupmymac.com/?ref=matveev.tech) ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один инструмент для упрощения жизни с техникой - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — автоматизация рутины без программирования ### MTV REWIND — музыкальные клипы 24/7 как в старые добрые URL: https://matveev.tech/mtv-rewind-music-videos/ Last updated: 2026-02-25T12:17:02.000Z > **TL;DR:** MTV REWIND — это бесплатный стриминг музыкальных клипов 24/7\. 35 000 видео с 1970 по 2025 год, 8 каналов по десятилетиям (плюс Yo! MTV Raps и Headbangers Ball). Без рекламы, без алгоритмов, без регистрации — просто нажми play. Помнишь времена, когда MTV действительно показывал музыку? Когда можно было включить телек и случайно открыть для себя что-то новое, просто потому что оно попало в ротацию? MTV перестал крутить клипы лет 20 назад. Вместо музыки — реалити-шоу и прочий контент, который к Music Television имеет очень отдалённое отношение. ## Что такое MTV REWIND Это passion-проект, который собрали за 48 часов. 35 000 музыкальных клипов с 1970 по 2025 год, разбитых на 8 тематических каналов: - **70s, 80s, 90s, 2000s, 2010s, 2020s** — по десятилетиям - **Yo! MTV Raps** — хип-хоп классика - **Headbangers Ball** — для тех, кто любит потяжелее Никакой рекламы. Никаких алгоритмов, которые пытаются угадать твои вкусы. Никакой регистрации. Заходишь, выбираешь канал, смотришь. ## Почему это работает В эпоху Spotify и YouTube Music мы привыкли, что алгоритм решает, что нам слушать. Он анализирует твои предпочтения и подсовывает похожее. Удобно, но скучно. MTV REWIND работает по-другому — как настоящий телеканал. Ты не знаешь, какой клип будет следующим. Может попасться что-то знакомое, а может — трек, о котором ты никогда не слышал. Это тот самый элемент случайности, которого так не хватает в современных стриминговых сервисах. Думаю, MTV REWIND отлично подойдёт как фоновый контент для работы или просто чтобы вспомнить, какой была музыка в разные эпохи. Ностальгия, конечно, но ностальгия с пользой — можно реально открыть для себя что-то новое из старого. [MTV REWIND - I Want My MTVCelebrating 44 years of continuous music videos. Stream classic music videos 24/7.![](https://matveev.tech/content/images/icon/apple-touch-icon.png)MTV REWIND![](https://matveev.tech/content/images/thumbnail/social.png)](https://wantmymtv.xyz/?ref=matveev.tech) ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один проект про возврат к простоте - [Scouts by Yutori — AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — если хочется автоматизации вместо ручного сёрфинга ### В Claude Code нашли мультиагентную систему — TeammateTool URL: https://matveev.tech/claude-code-multi-agent-teammatetool/ Last updated: 2026-01-24T19:23:33.000Z > **TL;DR:** В бинарнике Claude Code v2.1.19 обнаружили полноценную мультиагентную систему TeammateTool. 13 операций — от создания команд до межагентного чата. Всё работает, но спрятано за feature-флагами. Кто-то запустил `strings` на бинарнике Claude Code и нашёл там кое-что интересное. Внутри уже лежит полноценная система для командной работы нескольких AI-агентов. Называется TeammateTool, и она не какой-то прототип — там 13 операций, три бэкенда для запуска и даже система обмена сообщениями между агентами. ## Что конкретно нашли TeammateTool — это инструмент внутри Claude Code, который позволяет одному агенту-лидеру создавать команду из нескольких агентов и управлять их работой. Вот полный список операций: Агенты координируются через файлы в `~/.claude/teams/`. Там JSON-конфиги с метаданными команды и папка с сообщениями — по сути почтовый ящик для каждой сессии. ## Три способа запуска агентов Система поддерживает разные бэкенды: - **iTerm2 split panes** — каждый агент в отдельной панели терминала. Видишь всех одновременно. - **tmux windows** — для серверов и headless-окружений. - **In-process** — внутри одного процесса, самый быстрый вариант. ## Как это может работать Представь: говоришь Claude Code «ревью PR #1588 с полной командой». Лидер создаёт команду, запускает четыре агента — один на безопасность, один на перформанс, один на конвенции фреймворка, один на тесты. Каждый работает параллельно в своей панели iTerm2\. Лидер собирает результаты и выдаёт сводку. Или другой сценарий — рефакторинг 47 сервисов. Лидер создаёт задачи, запускает три воркера. Они сами берут задачи из очереди, а если один падает — его задачи освобождаются и подхватываются другими. ## Паттерны оркестрации Судя по коду, система поддерживает несколько подходов: - **Leader** — один координатор, несколько специалистов - **Swarm** — воркеры сами разбирают задачи из общей очереди - **Pipeline** — последовательная цепочка с передачей результатов - **Council** — несколько агентов решают одну задачу, лидер выбирает лучший результат ## Защита от сбоев Продумано и это: heartbeat с таймаутом в 5 минут освобождает задачи упавших агентов, есть лимит на количество агентов в команде, `requestShutdown` с graceful-завершением, а если агент зависает — принудительный kill. ## Когда включат Пока всё это спрятано за двумя feature-флагами (`I9()` и `qFB()`). То есть код готов, инфраструктура на месте, но Anthropic ещё не щёлкнула переключатель. Думаю, ждут стабилизации или хотят выкатить как отдельную фичу с документацией. Для разработчиков, которые уже используют Claude Code как основного помощника, это может стать серьёзным апгрейдом. Один агент с контекстом в 200K токенов — это хорошо. Команда из пяти агентов, каждый со своей специализацией — это совсем другой уровень. ## Что ещё почитать - [Claude Superpowers — плагин, который научит Claude Code думать перед тем, как писать код](https://matveev.tech/claude-superpowers-plugin/) — расширение возможностей Claude Code через навыки - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — подключение внешних инструментов к Claude - [Лучшие AI-редакторы кода в 2026 году](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — сравнение Claude Code с конкурентами - [Codex от OpenAI теперь работает прямо в JetBrains IDE](https://matveev.tech/codex-openai-jetbrains-ide/) — альтернативный мультиагентный подход от OpenAI 📚 Источник [Claude Code Multi-Agent Orchestration](https://gist.github.com/kieranklaassen/d2b35569be2c7f1412c64861a219d51f?ref=matveev.tech) ### 5 способов клонировать голос бесплатно в 2026 URL: https://matveev.tech/klonirovanie-golosa-besplatno-2026/ Last updated: 2026-01-24T15:04:06.000Z > **TL;DR:** Полностью бесплатного клонирования голоса почти нет — у коммерческих сервисов бесплатные тарифы дают 5-10 минут максимум. Для серьёзной работы придётся либо платить, либо разбираться с open-source (Coqui TTS, Bark). Самый щедрый бесплатный вариант — Descript Overdub с 5 минутами клонированного голоса. Клонирование голоса в 2026 году — это уже не фантастика. Записал пару минут своего голоса, и нейросеть может озвучить любой текст так, будто это говоришь ты. Круто для подкастов, видео, озвучки — да много для чего. Но вот проблема: почти все сервисы хотят денег. И немалых — от $15 до $99 в месяц. Я разобрался, где всё-таки можно попробовать клонирование бесплатно. ## 1\. Descript Overdub — 5 минут бесплатно Descript — это в первую очередь редактор для подкастов и видео. Но у него есть фича Overdub: записываешь свой голос, тренируешь модель, и потом можешь «допечатывать» слова прямо в аудио. **Что даёт бесплатный план:**\- 5 минут Overdub (клонированного голоса) - Транскрипция коротких файлов - Базовое редактирование **Для кого:** Подкастеры и видеомейкеры, которым нужно исправить оговорки или добавить пару фраз без перезаписи. **Минусы:** 5 минут — это очень мало. Для полноценной работы нужен Creator план за $15/мес (2 часа Overdub). ## 2\. ElevenLabs — 10 000 символов в месяц ElevenLabs — это золотой стандарт по качеству английских голосов. Но есть нюанс: бесплатный план **не включает клонирование**. Только готовые голоса. **Что даёт бесплатный план:**\- 10 000 символов в месяц (\~7 минут аудио) - Доступ к стоковым голосам - Клонирования нет **Для клонирования:** Нужен минимум Creator план за \~$22/мес. **Важно:** В феврале 2025 ElevenLabs [обновили условия использования](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — теперь они получают бессрочные права на данные твоего голоса. Думай, прежде чем загружать. ## 3\. Murf.ai — 10 минут на пробу Murf позиционируется как инструмент для бизнеса — корпоративные видео, e-learning, презентации. **Что даёт бесплатный план:**\- 10 минут генерации - 150+ готовых голосов - Клонирования своего голоса нет **Для клонирования:** Только Business план от $66/мес. **Для кого:** Тем, кому нужны качественные стоковые голоса для пробы. ## 4\. Open-source: Coqui TTS Если ты готов повозиться с установкой — есть полностью бесплатные open-source решения. Coqui TTS — один из самых продвинутых. **Плюсы:**\- Полностью бесплатно - Данные остаются у тебя - Можно кастомизировать **Минусы:**\- Нужно устанавливать локально - Требует GPU для нормальной скорости - Качество хуже коммерческих решений **Как начать:** Репозиторий на GitHub, документация, Python-знания приветствуются. ## 5\. Bark от Suno — open-source с эмоциями Bark — это генеративная модель от Suno, которая умеет не просто говорить, а добавлять смех, паузы, эмоции. **Плюсы:**\- Бесплатно и open-source - Реалистичные эмоции - Работает на разных языках **Минусы:**\- Требует мощное железо (GPU) - Сложнее в настройке - Клонирование требует дополнительных шагов ## Сравнение: сколько стоит клонирование на самом деле Если бесплатных минут не хватает, вот что предлагают платные планы: Если нужен многоязычный клон (твой голос на разных языках), смотри в сторону [CosyVoice 3 от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — это open-source модель, обученная на миллионе часов речи. ## Вывод: бесплатного сыра почти нет Честно? Полностью бесплатного клонирования голоса для продакшена не существует. Коммерческие сервисы дают попробовать 5-10 минут — этого хватит понять, подходит ли тебе инструмент. Для серьёзной работы варианта два: 1\. **Платить** — от $15/мес за Descript или Kukarella 2\. **Open-source** — Coqui TTS или Bark, если есть GPU и время на настройку Начни с Descript Overdub — 5 бесплатных минут достаточно, чтобы понять, нужно ли тебе это вообще. ## Что ещё почитать - [CosyVoice 3 — голосовой ИИ от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — open-source модель на миллион часов речи - [ElevenLabs теперь владеет твоим голосом навсегда](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — почему стоит читать TOS перед загрузкой голоса - [Spokenly — транскрибация голоса в текст на Mac](https://matveev.tech/spokenly-transkribatsiia-gholosa-v-tiekst-na-mac/) — обратная задача: из голоса в текст ### One Elsewhere — приложение, которое превращает фокус в игру URL: https://matveev.tech/one-elsewhere-fokus-igra/ Last updated: 2026-02-25T12:17:02.000Z > **TL;DR:** One Elsewhere — приложение для фокусировки с простой механикой: запускаешь сессию, кладёшь телефон, и твой космический корабль летит, пока ты не прикасаешься к экрану. Тронул — полёт окончен. Есть достижения и разные корабли для разблокировки. Знаешь это чувство, когда садишься работать, а через пять минут уже листаешь телефон? Даже не помнишь, как он оказался в руке. One Elsewhere предлагает интересное решение — превращает борьбу с этой привычкой в игру. ## Как это работает Механика максимально простая: 1. Открываешь приложение 2. Запускаешь "полёт" одним нажатием 3. Кладёшь телефон и занимаешься своими делами 4. Твой космический корабль летит, пока ты не трогаешь экран Тронул телефон — полёт заканчивается. Всё. Никаких сложных настроек и таймеров. ## Что внутри - **Достижения** — за минуты фокуса, долёты до планет и "глубокий космос" - **Разные корабли** — разблокируются по мере прогресса - **Минималистичный интерфейс** — специально сделан так, чтобы не отвлекать Разработчики позиционируют приложение для работы, учёбы, чтения, тренировок — в общем, для любых дел, где нужна концентрация. ## Что думаю Идея не новая — приложений для фокусировки куча. Но тут подкупает простота. Нет никаких сложных механик с "посадкой деревьев" или социальных функций. Один тап — и ты в игре. Геймификация работает на базовом уровне: хочется узнать, какой корабль разблокируется следующим, долететь до новой планеты. Это проще, чем абстрактные "60 минут без телефона". Подойдёт тем, кто: - Постоянно отвлекается на телефон во время работы - Пробовал другие приложения для фокуса, но они показались сложными - Любит простые игровые механики На Product Hunt приложение набрало 117 голосов. Если тебе знакома проблема "руки сами тянутся к телефону" — стоит попробовать. ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один способ меньше отвлекаться на экраны - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — автоматизация рутины, чтобы фокусироваться на важном ### MiroMiro — копируй дизайн любого сайта в один клик URL: https://matveev.tech/miromiro-kopirovanie-dizaina-saytov/ Last updated: 2026-02-25T12:17:03.000Z > **TL;DR:** MiroMiro — Chrome-расширение, которое позволяет копировать CSS, цвета, шрифты и скачивать ассеты с любого сайта. Наводишь курсор на элемент — видишь все стили. Без DevTools, без боли. Знакомая ситуация: видишь классный дизайн на сайте, хочешь понять, как это сделано. Открываешь DevTools, копаешься в панели Computed, пытаешься найти нужные стили среди сотен строк CSS. Тратишь 15 минут на то, что должно занимать 15 секунд. MiroMiro решает эту проблему в лоб — просто наводишь курсор на любой элемент и сразу видишь всё: CSS, цвета, шрифты, отступы. ## Что умеет Главная фишка — инспектирование без открытия DevTools. Наводишь на кнопку — видишь её padding, border-radius, цвет фона. Наводишь на текст — видишь font-family, размер, межстрочный интервал. Но копировать CSS — это только начало: - **Цвета и палитры** — вытаскивает все цвета элемента, можно скопировать в hex, rgb или hsl - **Шрифты** — показывает название, размер, вес, высоту строки - **Отступы и размеры** — margin, padding, width, height одним взглядом - **Скачивание ассетов** — картинки, SVG, и даже Lottie-анимации в один клик - **Экспорт токенов** — выгружает дизайн-токены в формате Tailwind-конфига или CSS-переменных Последний пункт особенно полезен. Увидел крутой сайт, вытащил его цветовую схему и типографику как готовый Tailwind-конфиг — и используешь в своём проекте. ## Для кого это Думаю, тут две основные аудитории. Первая — дизайнеры, которые хотят быстро понять, как устроен чужой интерфейс. Вместо того чтобы угадывать оттенок синего в Figma, можно просто взять точный цвет с сайта. Вторая — фронтендеры, которые верстают по референсам. Когда заказчик говорит «хочу как на том сайте», теперь не нужно гадать значения — достаточно навести курсор и скопировать. ## Что мне понравилось Экспорт в Tailwind — это прямо в точку. Tailwind сейчас везде, и возможность вытащить дизайн-систему сайта как готовый конфиг экономит кучу времени. Скачивание Lottie-анимаций — неожиданно полезная штука. Обычно чтобы достать Lottie, нужно лезть в Network-панель, искать json-файлы. Здесь — один клик. MiroMiro попал в топ Product Hunt с 500+ голосами — и понятно почему. Это тот случай, когда инструмент делает одну вещь, но делает её хорошо. Если часто изучаешь чужие сайты или верстаешь по референсам — попробуй, бесплатная версия уже покрывает базовые сценарии. [MiroMiro - Extract Lottie Animations, CSS & Design Tokens from Any WebsiteDownload Lottie animations, copy CSS instantly, and extract design tokens from any site. Free Chrome extension - no DevTools needed. Trusted by 2,000+ designers.![](https://matveev.tech/content/images/icon/logo.png)MiroMiroSoraia![](https://matveev.tech/content/images/thumbnail/og-image.png)](https://miromiro.app/?ref=matveev.tech) ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если интересуют инструменты для ускорения работы - [TaskWand — генерация воркфлоу для n8n с помощью ИИ](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — ещё один инструмент для автоматизации рутины ### Codex от OpenAI теперь работает прямо в JetBrains IDE URL: https://matveev.tech/codex-openai-jetbrains-ide/ Last updated: 2026-02-25T12:17:03.000Z > **TL;DR:** OpenAI Codex интегрировали в JetBrains IDE — теперь можно делегировать задачи AI-агенту прямо из привычного редактора. Работает через подписку JetBrains AI, аккаунт ChatGPT или свой API-ключ. Пока бесплатно. Если ты пишешь в IntelliJ, PyCharm, WebStorm или любой другой IDE от JetBrains — вот тебе новость: Codex теперь живёт прямо в AI-чате твоей IDE. Не надо переключаться в браузер, не надо копипастить контекст — просто выбираешь агента и работаешь. ## Как подключить Всё элементарно. Нужна версия IDE 2025.3 или новее и свежий плагин AI Assistant. Codex появится в меню выбора агентов в AI-чате. Если ещё не пользовался AI-чатом — жмёшь виджет JetBrains AI в правом верхнем углу, ставишь плагин, и всё. ## Три способа авторизации Тут гибко — выбирай, что удобнее: - **JetBrains AI** — через подписку, ничего дополнительно настраивать не нужно - **ChatGPT** — входишь через свой аккаунт OpenAI - **Свой API-ключ** — подключаешь напрямую через BYOK (Bring Your Own Key) ## Что умеет Codex в JetBrains — это полноценный агент. Он не просто отвечает на вопросы, а выполняет реальные задачи с кодом. Причём ты сам решаешь, сколько свободы ему дать: - Минимум — только отвечает на вопросы - Максимум — запускает команды и лезет в сеть самостоятельно Можно переключаться между моделями OpenAI прямо в чате, балансируя между глубиной рассуждений, скоростью и стоимостью. ## Бесплатный период Самое приятное — **Codex сейчас бесплатен** для пользователей JetBrains AI (включая бесплатный тариф и триал). Промо стартовало 22 января и будет работать, пока не закончатся выделенные кредиты. JetBrains предупреждают, что могут свернуть акцию в любой момент. Важно: бесплатный доступ не работает при подключении через ChatGPT или свой API-ключ — только через JetBrains AI. ## Что думаю Это логичный шаг — AI-агенты переезжают туда, где разработчики реально работают. Cursor и VS Code с Copilot давно это поняли, теперь и JetBrains подтягивается. Причём подход с несколькими способами авторизации — правильный. Не привязывают к одному провайдеру. Думаю, для тех, кто уже плотно сидит в экосистеме JetBrains и не хочет переезжать в Cursor ради AI — это отличная новость. Попробуй, пока бесплатно. [Codex Is Now Integrated Into JetBrains IDEs | The JetBrains AI BlogOpenAI Codex is now natively integrated into the JetBrains AI chat, giving you another powerful option for tackling real development tasks right inside your IDE. You can use Codex with a JetB![](https://matveev.tech/content/images/icon/icon.svg)The JetBrains BlogAnna Maltseva![](https://matveev.tech/content/images/thumbnail/IDEs-social-BlogSocialShare-1280x720-1-1.png)](https://blog.jetbrains.com/ai/2026/01/codex-in-jetbrains-ides/?ref=matveev.tech) ## Что ещё почитать - [Лучшие AI-редакторы кода в 2026 году — тест 10+ инструментов](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — сравнение конкурентов, включая Cursor и Copilot - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — подробнее о модели Codex, которая теперь работает в JetBrains - [Claude Superpowers — плагин для Claude Code](https://matveev.tech/claude-superpowers-plugin/) — альтернативный подход к AI-агентам в IDE ### Manus теперь публикует приложения в App Store и Google Play URL: https://matveev.tech/manus-app-publishing-google-apple/ Last updated: 2026-02-25T12:17:04.000Z > **TL;DR:** Manus (теперь часть Meta) добавил функцию App Sharing and Testing — можно собрать мобильное приложение и сразу отправить его на тестирование через TestFlight (iOS) или Google Play Console (Android). Без возни с Xcode, Android Studio и мануальной упаковкой. Знакомая ситуация: ты собрал приложение, всё работает, интерфейс красивый — а дальше начинается ад. Упаковка в AAB, сертификаты, provisioning profiles, App Store Connect… И вот ты уже не продуктовый человек, а релиз-инженер, который гуглит «how to create distribution certificate» третий час подряд. Manus решил эту проблему. ## Что добавили Новая фича называется App Sharing and Testing. Важный момент: это **не кнопка «опубликовать в стор»**. Это инструмент для тестирования — чтобы быстро получить рабочий билд на реальном устройстве. Что делает Manus: - **Android** — упаковывает приложение в формат AAB и готовит к загрузке в Google Play Console - **iOS** — создаёт приложение в твоём Developer-аккаунте, упаковывает билд, загружает в App Store Connect и запускает TestFlight-ревью автоматически То есть ты получаешь ссылку на TestFlight за пару минут, а не за пару дней. ## Как это работает **Для Android:**1\. В Manus нажимаешь Publish to Google Play 2\. Manus упаковывает в AAB 3\. Переходишь в Google Play Console и загружаешь билд **Для iOS:**1\. Нужен Apple Developer аккаунт ($99/год) 2\. В Manus → Publish → iOS → Create app 3\. Manus сам создаёт, упаковывает и загружает в App Store Connect 4\. Получаешь email от TestFlight — ставишь на телефон ## Зачем это нужно Думаю, главная ценность тут — скорость обратной связи. Ты собрал MVP, хочешь показать команде или первым пользователям — и раньше между «готово» и «потрогай на телефоне» проходили дни. Теперь — минуты. Это особенно полезно для: - Продуктовых людей, которые прототипируют через AI - Стартапов на ранней стадии, где нет мобильного разработчика - Тех, кто делает внутренние инструменты и хочет быстро раздать тестерам ## Ограничения - Это не публикация в стор — только тестирование - Для iOS нужен Apple Developer аккаунт - Для Android нужен Google Play Developer аккаунт - Финальную публикацию в стор всё равно делаешь сам ## В итоге Manus потихоньку закрывает gap между «я накликал приложение» и «оно работает на телефоне». Раньше no-code платформы заканчивались на вебе — а мобилка оставалась территорией профессионалов. Теперь эта граница размывается. Фича доступна всем пользователям Manus с возможностью Develop Apps. [Introducing App Sharing and Testing: Your Path to Google Play Store and App StoreUploading your app to the app store and the google play store with Manus![](https://matveev.tech/content/images/icon/icon.png)![](https://matveev.tech/content/images/thumbnail/c5327248e3a6816109d37254ba3b9d46bef303d5f3cb8849842b1c9681d014e8.webp)](https://manus.im/blog/manus-app-publishing?ref=matveev.tech) ## Что ещё почитать - [Лучшие AI-редакторы кода в 2026 году](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — если ищешь инструмент для разработки - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один no-code подход к AI-разработке - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — как использовать AI для задач без программирования ### Krisp Mobile Call Recorder — запись звонков с AI-заметками URL: https://matveev.tech/krisp-mobile-call-recorder/ Last updated: 2026-02-12T20:20:28.000Z > **TL;DR:** Krisp теперь записывает исходящие звонки прямо с телефона и превращает их в структурированные заметки с саммари и задачами. Для тех, кто много общается по телефону и устал забывать, о чём договорились. Привет! Знаешь Krisp? Те самые ребята, которые убирают шум на созвонах. Так вот, они выкатили кое-что новенькое — теперь их мобильное приложение умеет записывать обычные телефонные звонки и делать из них AI-заметки. Думаю, это самое-самое полезное обновление для тех, кто живёт в режиме «ещё один звонок». ## Что это Krisp Mobile Call Recorder — это новая фича в мобильном приложении Krisp. Звонишь через приложение, а оно в фоне записывает разговор, транскрибирует его и после звонка выдаёт готовые заметки: краткое саммари, ключевые моменты и action items. Всё это сохраняется как Krisp Note и синхронизируется между телефоном и десктопом. Вообще, раньше Krisp работал только с онлайн-встречами — Zoom, Google Meet, Teams. А теперь обычные телефонные звонки тоже попадают в единый рабочий процесс. Удобно. ## Как работает - **Звонишь через приложение Krisp** — набираешь номер прямо из него - **Автоматическая запись** — ничего не нужно нажимать, всё включается само - **Транскрипция в реальном времени** — поддерживает 16+ языков, включая русский - **AI-заметки после звонка** — саммари, ключевые тезисы, задачи с ответственными - **Синхронизация** — заметки доступны и на телефоне, и на десктопе - **Интеграции** — можно кинуть заметки в Slack, HubSpot, Salesforce ## Тарифы Krisp предлагает несколько планов: - **Pro** — безлимитная транскрипция, запись, шумоподавление, AI-заметки. Есть 7-дневный бесплатный триал. При оплате за год — скидка 50% - **Business** — всё из Pro плюс поддержка 16+ языков, менеджерский вид, интеграции с CRM и расширенные админ-контроли - **Enterprise** — SSO/SCIM, приватная транскрипция на устройстве, SOC 2 report access Krisp серьёзно относится к безопасности: SOC 2 Type II, GDPR, HIPAA, шифрование AES-256\. Данные встреч не используются для обучения моделей. ## Для кого - Сейлзы, которые обзванивают клиентов и потом не помнят, что обещали - Менеджеры с десятками созвонов в день - Фрилансеры, которым нужно фиксировать договорённости с заказчиками - Все, кто устал писать заметки во время разговора Одно ограничение: пока работает только с американскими номерами. Расширение на другие страны в планах. [Krisp - AI Meeting Assistant with Built-In Noise CancellationKrisp cancels background noise, records, transcribes, and summarizes meetings and calls.![](https://matveev.tech/content/images/icon/cropped-favicon-1-270x270.png)Krisp![](https://matveev.tech/content/images/thumbnail/thumb1.jpg)](https://krisp.ai/?ref=matveev.tech) ### AgentNotch — телеметрия AI-ассистентов прямо в нотче Mac URL: https://matveev.tech/agentnotch-telemetry-macos/ Last updated: 2026-02-25T12:17:04.000Z > **TL;DR:** AgentNotch — приложение для Mac, которое живёт в нотче и показывает, что делает твой AI-кодинг ассистент. Видишь вызовы инструментов, расход токенов и стоимость в реальном времени. Работает с Claude Code и OpenAI Codex. Если ты пользуешься Claude Code или Codex, знаешь это чувство: запустил агента на задачу, а он там что-то делает в фоне. Читает файлы, выполняет команды, думает... А ты сидишь и гадаешь — он вообще работает или завис? AgentNotch решает эту проблему элегантно — показывает всё происходящее прямо в нотче MacBook. ## Что это такое AgentNotch — нативное macOS-приложение, которое живёт в том месте, где у современных маков вырез под камеру. По умолчанию это пространство просто пустует, а тут его наконец-то задействовали с пользой. При наведении курсора панель разворачивается и показывает детали: какой инструмент сейчас работает, сколько токенов потрачено, во сколько это обошлось. ## Основные фишки **Отслеживание инструментов в реальном времени.** Видишь каждый вызов — чтение файлов, редактирование кода, выполнение shell-команд. Понимаешь, что именно делает ассистент прямо сейчас. **Мониторинг токенов и стоимости.** Показывает расход input/output токенов и примерную стоимость. Больше никаких сюрпризов в счетах за API. **Визуальное разделение по источникам.** Оранжевый индикатор — Claude Code, синий — Codex, голубой — неизвестный источник. Сразу видно, кто работает. **Уведомления о завершении.** Когда ассистент закончил задачу — получаешь уведомление. Не нужно постоянно проверять терминал. ## Установка Всё через Homebrew: ```bash brew tap AppGram/tap brew install --cask agentnotch ``` После установки нужно настроить телеметрию для Claude Code или Codex — инструкция есть на GitHub проекта. ## Что ещё настраивается - Показ/скрытие счётчика токенов - Показ/скрытие стоимости - Фильтрация по источнику (только Claude или только Codex) - Иконка в меню-баре ## Конфиденциальность По словам разработчиков, приложение полностью локальное. Телеметрия не содержит сам код — только метаданные вызовов инструментов. Думаю, это полезная штука для тех, кто активно использует AI-кодинг ассистенты. Особенно если запускаешь агента на длинные задачи и занимаешься другими делами параллельно. Вместо того чтобы переключаться в терминал каждые пять минут — просто смотришь в угол экрана. Ну и контроль расходов — тоже важно. Когда видишь стоимость в реальном времени, как-то внимательнее относишься к тому, какие задачи ставишь агенту. [GitHub - AppGram/agentnotch: AgentNotch is a sleek macOS menu bar app that lives in your Mac’s notch, providing real-time visibility into your AI coding assistants. Watch as Claude Code and OpenAI Codex think, read files, and execute tools — all without leaving your editor.AgentNotch is a sleek macOS menu bar app that lives in your Mac's notch, providing real-time visibility into your AI coding assistants. Watch as Claude Code and OpenAI Codex think, read files,…![](https://matveev.tech/content/images/icon/pinned-octocat-093da3e6fa40.svg)GitHubAppGram![](https://matveev.tech/content/images/thumbnail/agentnotch)](https://github.com/AppGram/agentnotch?ref=matveev.tech) ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь узнать, что ещё умеет Claude Code - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — про сам Codex, который AgentNotch тоже поддерживает ### Voquill — опенсорсная альтернатива WisprFlow для голосового набора URL: https://matveev.tech/voquill-golosovoy-vvod-2/ Last updated: 2026-01-22T16:17:49.000Z > **TL;DR:** Voquill — опенсорсный инструмент для голосового набора текста. Работает в любом текстовом поле на Mac, Windows и Linux. Может работать полностью офлайн, код открыт на GitHub. Есть бесплатный план с основными функциями. Знаешь это ощущение, когда мысль уже сформулирована в голове, а пальцы не успевают за ней? Voquill решает именно эту проблему — позволяет набирать текст голосом в 4 раза быстрее, чем на клавиатуре. ## Что это такое Voquill — это расширение для браузера и десктопное приложение, которое превращает речь в текст. Главная фишка — работает системно, в любом текстовом поле. Пишешь email, отвечаешь в Slack, заполняешь форму — просто говоришь, и текст появляется. Разработчики позиционируют Voquill как опенсорсную альтернативу WisprFlow. Для тех, кто не знает: WisprFlow — популярный, но закрытый инструмент для голосовой диктовки. Voquill делает примерно то же самое, но код полностью открыт. ## Что умеет **Работает везде.** Mac, Windows, Linux — поддерживаются все три платформы. Любое приложение, любое текстовое поле. **Офлайн-режим.** Это, пожалуй, главное преимущество. Большинство голосовых инструментов отправляют аудио в облако. Voquill может обрабатывать всё локально — слова не покидают твой компьютер. Работает даже в самолёте. **AI-коррекция.** Инструмент использует AI для очистки транскриптов: убирает слова-паразиты, запинки, фальстарты. Говоришь как обычно — текст получается чистый. **Открытый код.** Весь исходный код на GitHub. Можешь посмотреть, как устроена обработка, убедиться в безопасности или даже доработать под себя. ## Сколько стоит Есть три плана: - **Free** — бесплатно, основные функции диктовки, офлайн-режим, возможность подключить свой API-ключ - **Pro** — $8/месяц при годовой оплате, безлимитные слова, синхронизация между устройствами - **Enterprise** — для компаний, on-premise развёртывание, кастомные интеграции Бесплатного плана хватит для большинства задач. Платить имеет смысл, если диктуешь очень много или нужна синхронизация. ## Кому пригодится Думаю, Voquill особенно полезен для: - Писателей и блогеров — когда нужно быстро набросать черновик - Разработчиков — диктовать комментарии к коду или описания PR - Людей с RSI или проблемами с запястьями — меньше нагрузки на руки - Параноиков по безопасности — офлайн-режим и открытый код ## В итоге Voquill — это инструмент для тех, кто устал печатать. Работает быстро, не требует облака, код открыт. На Product Hunt занял 5-е место дня, что говорит о интересе аудитории. Если давно хотел попробовать голосовой ввод, но смущала закрытость других решений — Voquill отличный вариант для старта. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — ещё один способ ускорить работу с текстом - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — минимализм в работе с информацией ### Zapier теперь с AI-агентами — что изменилось URL: https://matveev.tech/zapier-ai-agents/ Last updated: 2026-02-25T12:17:05.000Z > **TL;DR:** Zapier добавил AI-агентов — это не просто автоматизации, а полноценные ассистенты с доступом к 8000+ приложений. Они умеют обогащать лиды, отвечать клиентам и писать контент. Главное отличие от обычных Zap — агенты сами решают, как выполнить задачу. Zapier долго был синонимом автоматизации для малого бизнеса. Подключил Gmail к Notion — письма сами превращаются в задачи. Просто и понятно. Но теперь они пошли дальше. ## Что такое Zapier Agents Это AI-помощники, которые работают автономно. В отличие от классических Zap (если событие А, сделай действие Б), агенты понимают контекст и сами выбирают способ решения задачи. Вот что они умеют: - **Обогащение лидов** — новый контакт в CRM автоматически дополняется данными из LinkedIn, сайта компании и других источников - **Поддержка клиентов** — агент отвечает на типовые вопросы, используя базу знаний компании - **Написание контента** — от персонализированных писем до SEO-статей - **Квалификация лидов** — оценивает потенциальных клиентов по заданным критериям ## Чем отличается от обычных Zap Главное — интеллект. Обычный Zap работает по жёсткому сценарию: триггер → действие. Агент получает задачу и сам решает, как её выполнить. Допустим, тебе нужно обогатить информацию о новом лиде. Обычный Zap сделает один запрос к одному API. Агент же будет искать информацию из разных источников, пока не соберёт полную картину. Ещё агенты умеют учиться. Загружаешь документы компании, FAQ, инструкции — и агент использует эти знания в работе. Это особенно полезно для поддержки клиентов. ## Готовые шаблоны Zapier предлагает несколько готовых агентов: - **Sales Email Writer** — пишет персонализированные письма для продаж - **Support Email Agent** — отвечает на запросы клиентов - **SEO Blog Writer** — генерирует статьи для блога - **Candidate Ranking** — оценивает резюме кандидатов - **Slack Responder** — отвечает на вопросы в Slack-каналах Можно использовать как есть или взять за основу для своего агента. ## Кому это нужно Думаю, в первую очередь — командам продаж и поддержки. Если у тебя поток однотипных задач и данные разбросаны по разным сервисам, агенты реально экономят время. Для личного использования пока выглядит избыточно. Тут обычные Zap справляются отлично. Zapier движется в том же направлении, что и весь рынок автоматизации — от простых триггеров к умным агентам. Посмотрим, как это будет развиваться. Пока что выглядит как логичное расширение платформы, а не революция. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь автоматизировать рутину без кода - [Scouts by Yutori - AI-агенты мониторят веб за тебя](https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/) — ещё один пример AI-агентов для автоматизации - [TaskWand - генерация воркфлоу для n8n с помощью ИИ](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — альтернатива Zapier с открытым кодом ### One Dot — визуализация жизни в точках URL: https://matveev.tech/one-dot-vizualizacija-vremeni/ Last updated: 2026-02-25T12:17:06.000Z > **TL;DR:** One Dot превращает обои iPhone в живую временную шкалу. Каждая точка — один прожитый день. Приложение обновляется автоматически через iOS Shortcuts, никаких уведомлений и навязчивости. Думаю, многие сталкивались с ощущением, что время просто утекает сквозь пальцы. Вроде понедельник, а уже пятница. Вроде январь, а уже лето. One Dot решает эту проблему неожиданно красиво — превращает экран телефона в тихое напоминание о том, что каждый день на счету. ## Как это работает Идея простая до гениальности. Приложение генерирует обои, где каждая точка — это единица времени: день, неделя, месяц или квартал. Ты выбираешь формат, настраиваешь стиль, и One Dot создаёт картинку высокого разрешения. Самое интересное — автообновление. Приложение построено на iOS Shortcuts, поэтому обои меняются сами раз в день. Просто смотришь на экран и видишь, как заполняется ещё одна точка. ## Memento mori для смартфона По сути это современная интерпретация концепции memento mori — напоминания о быстротечности времени. Только без мрачности. Вместо черепов и песочных часов — минималистичная визуализация, которая не давит, а мотивирует. Можно настроить обои как трекер продуктивности — отмечать прогресс по проекту или до какой-то важной даты. Или как глобальный взгляд на год — сколько уже прошло, сколько осталось. ## Что мне нравится Отсутствие уведомлений и навязчивости — самое ценное. Приложение не кричит «эй, посмотри на меня!». Оно просто там, на фоне, меняется каждый день. Хочешь замечать — замечаешь, нет — просто красивые обои. Работает через нативные Shortcuts, а значит не жрёт батарею и не требует постоянного подключения к интернету. Если тебе нравится идея осознанного отношения ко времени, но не хочется заморачиваться с дневниками и трекерами — попробуй One Dot. Иногда достаточно просто видеть, как точки заполняются одна за другой. ## Что ещё почитать - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — ещё один способ убрать шум и оставить только важное - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — автоматизация рутины без навыков программирования ### NotebookLM превращает документы в подкасты URL: https://matveev.tech/notebooklm-audio-overviews/ Last updated: 2026-01-21T12:46:40.000Z > **TL;DR:** Google добавил в NotebookLM функцию Audio Overview. Загружаешь документы — получаешь аудио-обсуждение от двух AI-ведущих. Они разбирают материал, находят связи между темами и ведут живой диалог. Пока работает только на английском. Ты когда-нибудь хотел, чтобы кто-то просто объяснил тебе содержимое длинного PDF? Не сухим голосом из text-to-speech, а как в нормальном подкасте — с обсуждением, комментариями, переходами между темами? Google сделал именно это в NotebookLM. ## Как это работает Всё просто: 1. Открываешь NotebookLM 2. Создаёшь блокнот и загружаешь источники (PDF, Google Docs, веб-страницы) 3. Жмёшь «Generate» в панели Notebook guide Дальше происходит магия — два AI-ведущих начинают обсуждать твой материал. Не просто зачитывать текст, а именно обсуждать: один поднимает тему, другой комментирует, они находят связи между разными частями документа. Готовый аудиофайл можно скачать и слушать офлайн — в дороге, на пробежке, где угодно. ## Ограничения Функция экспериментальная, поэтому есть нюансы: - **Только английский** — ведущие пока говорят только на английском - **Время генерации** — для больших блокнотов может занять несколько минут - **Нельзя перебить** — это не интерактивный разговор, а готовая запись - **Субъективный взгляд** — Google честно предупреждает, что это не объективный пересказ, а интерпретация материала ## Зачем это нужно Думаю, тут несколько сценариев: - **Исследования** — закинул кучу статей по теме, получил обзорное обсуждение - **Учёба** — конспекты лекций превращаются в подкаст для повторения - **Работа с документацией** — вместо чтения мануалов слушаешь разбор Особенно круто для тех, кто лучше воспринимает информацию на слух. Или просто хочет «прочитать» документ, пока руки заняты чем-то другим. В целом, интересный эксперимент от Google. Посмотрим, добавят ли другие языки — для русскоязычных пользователей это пока главное ограничение. ## Что ещё почитать - [CosyVoice 3 — голосовой ИИ от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — ещё один пример того, как AI работает с голосом - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как AI обрабатывает и структурирует информацию ### Как AI помогает хакерам проникать в офисы URL: https://matveev.tech/ai-pomogaet-hakeram-v-realnom-mire/ Last updated: 2026-02-25T12:17:06.000Z > **TL;DR:** Пентестер с 17-летним опытом Роб Шапланд рассказал, как клонирует голоса руководителей через ElevenLabs и использует ChatGPT для планирования физических проникновений. Для качественного клона голоса достаточно 10 секунд аудио из YouTube-ролика. Думаю, ты представляешь хакера как человека в худи, который сидит в тёмной комнате и что-то печатает. Но Роб Шапланд последние 17 лет занимается совсем другим — он физически проникает в офисы компаний. И AI сделал его работу проще. ## Голос CEO за пять минут Недавно Шапланд получил задачу — взломать почту генерального директора одной компании. Вместо того чтобы искать уязвимости в системе, он нашёл промо-ролик на YouTube, где CEO говорит пять минут. Этого хватило. Через ElevenLabs он создал клон голоса, позвонил в техподдержку и попросил сбросить пароль. Сработало. Самое интересное — теперь можно даже не готовить реплики заранее. Шапланд подключает клонированный голос к ChatGPT, даёт промпт вроде «мне нужно сбросить пароль», и нейросеть сама ведёт разговор голосом руководителя. Для приличного клона нужно около 10 секунд аудио. Чем больше — тем лучше звучит. ## ChatGPT как консультант по взлому Шапланд использует обычные чатботы для проверки своих планов. И тут есть забавный момент — даже с ограничениями они умудряются помочь. Когда он спросил ChatGPT о плане физического проникновения, тот ответил что-то вроде: «Я не могу помочь вам проникнуть в здание, но если бы вы делали что-то похожее, я бы предложил вот это...» Есть, конечно, чатботы в даркнете без ограничений, которые пишут малварь. Но Шапланд считает, что индустрия преувеличивает масштаб использования AI преступниками. Пока они только экспериментируют. Вот что реально пугает — через пару лет видеозвонки станут неотличимы от подделок. После выхода Sora 2 его ленту заполонили «фейковые» видео, которые люди принимают за настоящие. ## Два кофе и улыбка А вот что касается физического проникновения — тут AI пока не особо помогает. За 200 с лишним взломов Шапланд встретил систему распознавания лиц только один раз. Слишком медленно для реального офиса, где люди постоянно входят и выходят. Самые эффективные методы — старая школа: - **Поддельный бейдж** — находишь брендинг компании в LinkedIn, печатаешь пропуск. Он не откроет дверь, но позволит попросить кого-то придержать её - **Два стакана кофе** — несёшь в обеих руках и просишь открыть дверь. Люди хотят быть полезными - **Визит «по делу»** — записываешься как инспектор окон, уборщик или проверяющий огнетушители. Делаешь свою работу, параллельно занимаясь «плохими делами» У Шапланда целая коллекция костюмов для разных ролей. Он говорит, что перед каждым заданием нервничает — а вдруг раскусят, что он не настоящий уборщик? Но стоит переступить порог — включается роль. ## Обучение, которое работает После проникновения Шапланд показывает записи сотрудникам. Он снимает всё на камеры, спрятанные в галстуке или очках. И это работает лучше любых тестов по кибербезопасности. Когда человек видит на видео свой рабочий стол и себя, пропускающего незнакомца — это запоминается на годы. Шапланд появится в документалке Midnight in the War Room, которую покажут на Black Hat USA в августе. Там же будут бывший директор CISA Джен Истерли, экс-глава ЦРУ Дэвид Петреус и Маркус Хатчинс — тот самый, кто остановил WannaCry. Думаю, главный вывод простой: технологии меняются, а человеческая доверчивость — нет. И AI просто даёт новые инструменты для эксплуатации старых слабостей. ## Что ещё почитать - [ElevenLabs теперь владеет твоим голосом навсегда](https://matveev.tech/elevenlabs-tos-golos-navsegda/) — что значат новые условия сервиса для клонирования голоса - [CosyVoice 3 — голосовой AI от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — ещё одна модель для синтеза и клонирования голоса - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как устроена память у AI-систем ### Claude Superpowers — плагин, который научит Claude Code думать перед тем, как писать код URL: https://matveev.tech/claude-superpowers-plugin/ Last updated: 2026-01-20T17:49:13.000Z > **TL;DR:** Superpowers — плагин для Claude Code, который заставляет AI сначала обсуждать с тобой план, потом разбивать задачу на шаги, а потом уже писать код через TDD. Устанавливается двумя командами, работает автоматически. Если ты работал с Claude Code, то знаешь главную проблему: он сразу бросается писать код. Не спрашивает, что именно ты хочешь, не уточняет детали, не составляет план. Просто начинает генерировать файлы — и надеется, что угадал. Superpowers — это плагин, который меняет это поведение. Его создал Jesse Vincent (основатель Keyboardio), и штука получилась действительно полезной. ## Что делает Superpowers Superpowers — это набор «навыков» (skills), которые Claude Code загружает автоматически. Каждый навык — инструкция для AI, как правильно подходить к определённому типу задач. Основной воркфлоу выглядит так: 1. **Brainstorm** — когда ты описываешь задачу, Claude не бросается кодить. Он задаёт вопросы, уточняет требования, предлагает варианты. И только когда вы оба согласны с тем, что нужно сделать — переходит дальше. 2. **Write Plan** — Claude разбивает работу на маленькие задачи по 2-5 минут каждая. С точными путями к файлам, конкретным кодом, шагами проверки. 3. **Execute Plan** — задачи выполняются по очереди. Каждую делает отдельный субагент, результат проверяется, и только потом идёт следующая задача. И всё это с обязательным TDD: сначала пишется тест, потом код, который этот тест проходит. ## Какие навыки входят в Superpowers Плагин включает несколько категорий навыков: **Тестирование**\- `test-driven-development` — строгий RED-GREEN-REFACTOR цикл **Отладка**\- `systematic-debugging` — четырёхфазный подход к поиску корневой причины бага - `verification-before-completion` — проверка, что проблема действительно решена **Командная работа**\- `brainstorming` — уточнение требований через вопросы - `writing-plans` — создание детальных планов - `executing-plans` — выполнение планов с чекпоинтами - `subagent-driven-development` — делегирование задач субагентам - `using-git-worktrees` — параллельная работа на разных ветках **Мета-навыки**\- `writing-skills` — создание новых навыков - `using-superpowers` — введение в систему ## Как установить Тебе нужен Claude Code версии 2.0.13 или новее. Открой терминал и выполни: ```bash /plugin marketplace add obra/superpowers-marketplace /plugin install superpowers@superpowers-marketplace ``` После этого перезапусти Claude Code. При следующем запуске увидишь сообщение о том, что Superpowers загружены. Можно проверить, что всё работает: ```bash /help ``` Должны появиться новые команды: - `/superpowers:brainstorm` — начать обсуждение идеи - `/superpowers:write-plan` — создать план - `/superpowers:execute-plan` — выполнить план ## Альтернативный способ установки Если предпочитаешь ручную настройку, добавь в `.claude/plugins.json`: ```json { "plugins": { "superpowers": { "type": "github", "owner": "obra", "repo": "superpowers" } } } ``` ## Пример использования Допустим, ты хочешь добавить авторизацию в проект. Без Superpowers Claude сразу начнёт генерировать код — и скорее всего, сделает что-то не то. С Superpowers диалог выглядит иначе: 1. Ты пишешь: «Добавь авторизацию пользователей» 2. Claude спрашивает: какой метод — JWT, сессии, OAuth? Где хранить токены? Нужна ли двухфакторка? 3. Вы обсуждаете, Claude показывает дизайн-документ по частям 4. Когда согласовали — Claude создаёт план из 15-20 задач 5. Каждая задача выполняется отдельно с тестами В итоге получаешь не просто код, а документированное решение с тестами и понятной структурой. ## Что ещё интересного Jesse описывает забавный момент: когда он тестировал навыки, Claude буквально устраивал субагентам «допросы» с провокационными сценариями. Например: > «Продакшен падает, каждая минута стоит $5000\. Ты опытный в отладке. Что сделаешь — сразу начнёшь чинить или сначала проверишь навыки?» Такие тесты помогли сделать навыки действительно обязательными для Claude, а не просто рекомендациями. ## Обновление плагина Навыки обновляются вместе с плагином: ```bash /plugin update superpowers ``` Superpowers не делает Claude умнее. Но он делает его дисциплинированнее. Вместо хаотичной генерации кода ты получаешь структурированный процесс с планами, тестами и проверками. Для серьёзных проектов — это существенная разница. ## Что ещё почитать - [MCP серверы для Claude — что это и как настроить](https://matveev.tech/claude-mcp-nastrojka/) — если хочешь понять, как вообще работают расширения для Claude - [Warp — терминал с AI](https://matveev.tech/warp-terminal-ai/) — ещё один инструмент для разработки с AI-помощником - [Лучшие AI-редакторы кода в 2026](https://matveev.tech/luchshie-ai-redaktory-koda-2026/) — сравнение альтернатив, если думаешь о смене инструментов ### MCP серверы для Claude — что это и как настроить URL: https://matveev.tech/claude-mcp-nastrojka/ Last updated: 2026-02-12T20:20:28.000Z > **TL;DR:** MCP (Model Context Protocol) — это способ подключить Claude к внешним инструментам: файлам на диске, API, базам данных. Anthropic выпустили протокол в конце 2024-го, и он реально меняет возможности десктопного Claude. Если ты пользуешься Claude Desktop, то наверняка замечал ограничения — модель не видит твои файлы, не может сходить в интернет за актуальными данными, не умеет запускать скрипты. MCP решает эту проблему. ## Что такое MCP Model Context Protocol — это что-то вроде универсального переводчика между Claude и внешним миром. Anthropic придумали его, чтобы AI-модели могли работать с реальными инструментами, а не только отвечать на вопросы из головы. Архитектура простая: есть клиент (это сам Claude) и серверы — небольшие программы, которые подключаются к разным штукам. Файловая система, погодный API, база данных — для каждого можно написать свой MCP-сервер. ## Зачем это нужно Без MCP Claude — это просто умный собеседник. С MCP он превращается в рабочий инструмент: - Читает и редактирует файлы на твоём компьютере - Получает актуальные данные через API (погода, курсы, новости) - Работает с базами данных - Запускает автоматизации Причём всё это происходит локально. Данные никуда не уходят — MCP-сервер крутится у тебя на машине. ## Что понадобится Для настройки нужно три вещи: 1. **Claude Desktop** — приложение для macOS или Windows 2. **Node.js версии 16+** — для запуска серверов 3. **Текстовый редактор** — VS Code, Notepad++ ## Как настроить Вся магия в одном файле — `claude_desktop_config.json`. На маке он лежит в `~/Library/Application Support/Claude/`, на винде — в `%APPDATA%\Claude\`. Базовая структура такая: ```json { "mcpServers": { "filesystem": { "command": "npx", "args": ["-y", "@modelcontextprotocol/server-filesystem", "/path/to/folder"] } } } ``` Здесь `filesystem` — это имя сервера, `command` — как его запускать, `args` — аргументы. После сохранения перезапусти Claude Desktop. ## Популярные серверы **Filesystem** — базовый сервер для работы с файлами. Даёт Claude доступ к указанной папке: чтение, запись, поиск. **Weather** — погодные данные в реальном времени. Полезно, если делаешь что-то связанное с погодой. **Stock Market** — финансовые данные. Курсы валют, акции, криптовалюта. Есть и специализированные — для работы с конкретными API, базами данных, даже для управления умным домом. ## Свой сервер за 10 минут Если нужного сервера нет — можно написать свой. MCP SDK делает это довольно простым: ```javascript import { Server } from "@modelcontextprotocol/sdk/server/index.js"; const server = new Server({ name: "my-server", version: "1.0.0" }); server.setRequestHandler("tools/call", async (request) => { // Твоя логика здесь }); ``` Дальше добавляешь сервер в конфиг — и готово. ## Если что-то не работает Типичные проблемы: - **Ошибки путей** — проверь, что все пути в конфиге абсолютные - **Права доступа** — убедись, что у Node.js есть доступ к нужным папкам - **Версия Node.js** — MCP требует 16+, лучше ставь LTS-версию - **JSON-синтаксис** — запятые, кавычки, скобки. Классика После изменений в конфиге всегда перезапускай Claude Desktop. ## Несколько серверов сразу Можно подключить хоть десяток серверов одновременно: ```json { "mcpServers": { "filesystem": { ... }, "weather": { ... }, "database": { ... } } } ``` Claude сам разберётся, какой сервер использовать для конкретной задачи. MCP — это реально крутое расширение возможностей Claude. Вместо чат-бота получаешь полноценного помощника, который может работать с твоими данными и инструментами. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь использовать Claude для автоматизации без программирования - [GLM-4.7 — обновление модели для кодинга от Zhipu AI](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — ещё одна модель, которая работает с кодовыми агентами ### Remio 2.0 — Second Brain, который не нужно вести URL: https://matveev.tech/remio-2-second-brain/ Last updated: 2026-02-25T12:17:07.000Z > **TL;DR:** Remio автоматически собирает всё, с чем ты работаешь — веб-страницы, файлы, письма, записи встреч — в единую базу знаний. Потом просто спрашиваешь AI, и он находит нужное за секунды. Данные хранятся локально, можно подключить свой API-ключ. Знакомая история: ты точно помнишь, что где-то читал про это. Может, в статье. Или в Slack. Или это было в том PDF, который скинул коллега месяц назад. И вот ты тратишь полчаса на поиски вместо того, чтобы просто работать. Remio решает эту проблему радикально — он запоминает всё за тебя. ## Как это работает Приложение работает в фоне и автоматически индексирует: - **Веб-страницы**, которые ты читаешь - **Локальные файлы** — документы, PDF, заметки - **Сообщения** из Slack и почты - **Записи встреч** с бесплатной транскрипцией Никакого ручного копирования или тегирования. Открыл страницу — она в базе. Скачал файл — он тоже там. ## Что отличает от NotebookLM и аналогов Главное отличие — Remio не требует ручной загрузки документов. Ты просто работаешь как обычно, а он собирает контекст в фоне. Второй момент — **local-first подход**. Все данные хранятся на твоём устройстве. Можно подключить свой API-ключ к любой LLM и получить 100% приватность. Никаких облачных утечек. Третье — интеграция прямо в рабочий процесс. Один клик вызывает AI-помощника в текущем приложении. Он понимает контекст и сразу даёт релевантный ответ. ## Кому подойдёт Думаю, это полезно для тех, кто работает с большими объёмами информации: - **Менеджерам** — быстро найти, что обсуждали на прошлой встрече - **Исследователям** — собрать материалы из десятков источников без ручной работы - **Разработчикам** — вспомнить, где видел решение похожей задачи - **Продажникам** — держать в голове контекст по каждому клиенту По отзывам пользователей, экономия времени — от 6 часов в неделю на поиске информации. ## Ограничения Пока работает только на Windows 10+ (x64) и Mac с M-чипами. Мобильной версии нет. И да, это десктопное приложение — если тебе нужен доступ с любого устройства, это не вариант. Remio занял первое место в Product Hunt 14 января с 482 голосами. Бесплатная версия включает базовые функции, платная открывает продвинутый AI и больше интеграций. Если устал копировать информацию в ChatGPT вручную — [попробуй](https://www.remio.ai/?ref=matveev.tech). ## Что ещё почитать - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как устроена память в AI-системах и почему простой поиск по базе не даёт хороших результатов - [Vellum — AI-агенты на простом английском](https://matveev.tech/vellum-ai-agenty-bez-koda/) — ещё один способ автоматизировать рутину без программирования - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь автоматизировать не только поиск, но и действия ### Ollama стал на 30% быстрее — что показали на CES 2026 URL: https://matveev.tech/ollama-ces-2026-nvidia/ Last updated: 2026-02-25T12:17:07.000Z > **TL;DR:** NVIDIA на CES 2026 показала ускорение open source AI-инструментов. Ollama генерирует токены на 30% быстрее, llama.cpp — на 35%. ComfyUI с новым форматом NVFP4 работает в 3-4 раза шустрее. Всё это для RTX-карточек. Если ты запускаешь нейросети локально — это твои новости. NVIDIA на CES 2026 рассказала про обновления популярных open source инструментов, и цифры приятные. ## Что ускорили **Ollama** — плюс 30% к скорости генерации токенов. Сделали через flash attention по умолчанию (меньше гоняет данные между GPU и RAM) и оптимизировали работу с памятью. Бонусом добавили LogProbs API — пригодится для классификации и подсчёта perplexity. **llama.cpp** — плюс 35% на MoE-моделях. Перенесли сэмплинг токенов на GPU, добавили параллельные CUDA-потоки для QKV-проекций. На DGX Spark модели грузятся на 65% быстрее. Для карточек Blackwell добавили нативную поддержку MXFP4 — это ещё +25% к обработке промптов. **ComfyUI** — тут самое-самое. Новый формат NVFP4 даёт прирост в 3-4 раза по сравнению с FP16/BF16\. FP8-квантизация — в 2 раза быстрее. При этом NVFP4 экономит 60% видеопамяти, FP8 — 40%. Для тех, кто генерирует картинки локально, это серьёзно. ## Новые модели **LTX-2** — генерирует 20 секунд синхронного аудио-видео в 4K. До 50 fps. С NVFP8 на 30% меньше потребление памяти. Работает на RTX и DGX Spark. **Nemotron 3 Nano** — MoE-модель на 32B параметров, оптимизированная под агентские задачи. Активных параметров всего 3.6B, контекст — миллион токенов. Доступна через Ollama и llama.cpp, можно дообучать через Unsloth. ## Ещё по мелочи **Docling** — инструмент для обработки документов. На RTX работает в 4 раза быстрее, чем на CPU. Два режима: классический OCR и через VLM. Полезно для RAG-пайплайнов. **Video Effects SDK** — подсветка в видео теперь в 3 раза быстрее, размер модели уменьшили в 6 раз. Минимум RTX 3060. Думаю, для тех, кто сидит на RTX и гоняет модели локально — это хороший апдейт. Особенно ComfyUI с его 3-4x приростом. Обновления уже доступны, так что можно пробовать. ## Что ещё почитать - [GLM-4.7 — обновление модели для кодинга от z.ai](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — ещё одна модель для локального запуска через llama.cpp - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — если интересует, как работают агентские модели вроде Nemotron 3 Nano ### Undiscord — массовый выход из серверов Discord URL: https://matveev.tech/undiscord-bulk-leave-discord/ Last updated: 2026-02-25T12:17:08.000Z > **TL;DR:** Undiscord — Chrome-расширение, которое показывает все твои Discord-серверы в одном месте и позволяет массово выйти из ненужных. Работает локально, не требует доступа к аккаунту. Знакомая история: заходишь в Discord, а там 150 серверов. Половина мёртвых, треть уже не помнишь зачем вступал, а искать нужный чат — квест на терпение. Выходить из каждого вручную? Три клика на сервер. При 50 лишних серверах — это 150 кликов и минут 15 времени. Жизнь слишком коротка. ## Что делает Undiscord Расширение показывает все твои серверы одним списком. Выбираешь ненужные, жмёшь кнопку — готово. Массовый выход без лишних движений. Главное — работает безопасно: - Не требует логин/пароль от Discord - Не хранит данные на внешних серверах - Всё происходит локально в твоём браузере ## Кому пригодится - Если годами копились серверы «посмотрю потом» - Если состоишь в десятках сообществ по работе/учёбе, которые уже не актуальны - Если просто любишь порядок в цифровом пространстве Думаю, это один из тех инструментов, которые используешь раз в полгода — но в этот момент он реально спасает время. Не путай с другим Undiscord — тот умеет удалять сообщения, но это отдельный инструмент (и его использование рискованнее с точки зрения ToS Discord). ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — ещё инструменты для автоматизации рутины - [TRMNL — e-ink дисплей для тех, кто устал от уведомлений](https://matveev.tech/trmnl-e-ink-dashboard/) — про цифровой минимализм ### Warp — терминал с AI, который должен попробовать каждый разработчик URL: https://matveev.tech/warp-terminal-ai/ Last updated: 2026-01-18T10:34:48.000Z > **TL;DR:** Warp — современный терминал с встроенным AI. Понимает естественный язык, объясняет ошибки, автодополняет команды. Работает на Mac, Windows и Linux. Бесплатно до 100 AI-запросов в месяц. Если ты разработчик и до сих пор пользуешься стандартным Terminal.app или iTerm — возможно, пора посмотреть на что-то поинтереснее. Warp — это терминал, который изначально строился вокруг AI. Не «добавили чат-бота сбоку», а продумали, как искусственный интеллект может помочь в ежедневной работе с командной строкой. ## Что умеет Главная фишка — ты можешь писать команды на человеческом языке. Набираешь `#` и описываешь, что хочешь сделать. Например, `# найди все файлы больше 100мб в текущей папке`. Warp предложит готовую команду. Другие возможности: - **Объяснение ошибок** — кликаешь правой кнопкой на ошибку, и AI расскажет, что пошло не так и как починить - **Автокомплит на стероидах** — не просто имена файлов, а умные подсказки с учётом контекста - **Блоки команд** — вывод каждой команды отделён визуально, можно копировать отдельные блоки - **Поиск по истории** — нормальный поиск, а не листание стрелочками ## AI-агенты В 2025 году Warp добавил полноценных AI-агентов. Это уже не просто подсказки — агенты могут выполнять команды, работать с интерактивными приложениями типа `top` или дебаггеров, и даже открывать pull request'ы. Интеграции с Slack, Linear и GitHub Actions позволяют тегнуть Warp прямо в сообщении — и агент разберётся с проблемой. ## Модели и приватность Warp использует модели от OpenAI, Anthropic и Google. Выбирается лучшая для конкретной задачи автоматически. Важный момент — твои данные не используются для обучения моделей. Ввод и вывод терминала не хранятся на серверах Warp. Для enterprise есть дополнительные гарантии. ## Цены - **Бесплатно** — 100 AI-запросов в месяц - **Pro** — больше запросов для индивидуальных разработчиков - **Team** — для команд с общим биллингом - **Enterprise** — SSO, аудит, приоритетная поддержка Для большинства задач бесплатного плана хватит, чтобы распробовать. ## Кому подойдёт Warp точно стоит попробовать, если: - Часто гуглишь синтаксис команд - Работаешь с несколькими проектами и забываешь специфичные флаги - Хочешь современный интерфейс вместо терминала из 80-х - Интересуешься AI-инструментами для разработки По бенчмаркам Warp занимает первое место в Terminal-Bench 2.0\. Его используют более 500 000 разработчиков, и в 2025 году он получил награду TIME Best Inventions. Думаю, Warp — один из тех инструментов, которые реально экономят время. Не революция, но приятное улучшение ежедневного рабочего процесса. Если проводишь в терминале хотя бы час в день — попробуй. [Warp: The Agentic Development EnvironmentThe fastest way to build with multiple AI agents, from writing code to deploying it. Trusted by over half a million engineers, Warp gives developers speed, privacy, and control to ship faster.![](https://matveev.tech/content/images/icon/GybmHeNj1WzkgFqIjQYypmhg.png)![](https://matveev.tech/content/images/thumbnail/vvDFwPAa66yI9T0kGNhd43kHcM.png)](https://www.warp.dev/?ref=matveev.tech) ## Что ещё почитать - [Что ждёт разработчиков в ближайшие 2 года](https://matveev.tech/budushchee-razrabotki-2-goda/) — про будущее профессии и роль AI - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь больше AI в работе - [GLM-4.7 обновление модели для кодинга](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — ещё один AI-инструмент для разработчиков ### DiffSense — AI генерирует коммиты прямо на твоём Mac URL: https://matveev.tech/diffsense-git-commits-apple-silicon/ Last updated: 2026-02-25T12:17:08.000Z > **TL;DR:** DiffSense — утилита для Mac, которая генерирует git commit сообщения через встроенную модель Apple Foundation Models. Работает локально, бесплатно, код никуда не отправляется. Есть настройка стиля и алиасы для терминала. Писать осмысленные сообщения для коммитов — та ещё рутина. Особенно когда за день делаешь десяток мелких правок и в голове каша. DiffSense берёт эту задачу на себя. ## Как это работает Утилита использует AFM 3B — нативную модель Apple, которая работает прямо на чипах M1/M2/M3/M4\. Никакого облака, никаких API-ключей, никаких подписок. Скачал — работает. Процесс простой: делаешь `git add`, запускаешь DiffSense, получаешь готовое сообщение. Можно сразу закоммитить или отредактировать. ## Что умеет - **Настройка стиля** — можно выбрать формат сообщений: conventional commits, просто описание, с эмодзи или без - **Алиасы** — настраиваешь макросы и вызываешь одной командой - **Полная приватность** — код не покидает устройство, diff анализируется локально - **Нулевая задержка** — модель крутится на Neural Engine, ответ почти мгновенный ## Кому пригодится Думаю, это самое-самое для тех, кто работает с git каждый день и устал придумывать формулировки. Особенно если у тебя Mac на Apple Silicon — модель использует железо по максимуму. Для команд с жёсткими требованиями к формату коммитов тоже полезно: настраиваешь стиль один раз и получаешь консистентные сообщения. Инструмент бесплатный и работает офлайн. Если пишешь код на Mac — стоит попробовать. ## Что ещё почитать - [Claude Code для нетехнарей](https://matveev.tech/claude-code-bez-koda/) — ещё один способ автоматизировать рутину с помощью AI - [GLM-4.7 — модель для кодинга](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — китайская модель, которая тоже работает с кодовыми агентами ### TapHouse — графический интерфейс для Homebrew URL: https://matveev.tech/taphouse-gui-homebrew/ Last updated: 2026-02-25T12:17:09.000Z > **TL;DR:** TapHouse — GUI для Homebrew, который умеет сканировать пакеты на уязвимости, находить забытые зависимости и дубликаты приложений. Плюс есть дашборд здоровья системы и автообновления через меню бар. Если ты разработчик на Mac, то наверняка пользуешься Homebrew. И наверняка периодически забываешь, что там вообще установлено, какие пакеты устарели и сколько мусора накопилось. TapHouse решает эту проблему. ## Что это TapHouse — это графическая оболочка для Homebrew. Вместо терминала получаешь нормальное окно со списком пакетов, поиском и кнопками. Но самое интересное — это не просто «brew в красивой обёртке». ## Главные фишки **CVE-сканер** — приложение проверяет установленные пакеты на известные уязвимости. Думаю, это полезно, если у тебя десятки инструментов и следить за всеми вручную нереально. **Health Dashboard** — дашборд показывает общую оценку системы. Видно, где накопился мусор, какие зависимости осиротели (нужны были для пакета, который ты удалил), есть ли дубликаты приложений. **Pre-install инспекция** — перед установкой показывает, что именно будет добавлено. Никаких сюрпризов с двадцатью зависимостями. **Обновления сторонних приложений** — TapHouse умеет обновлять не только brew-пакеты, но и обычные приложения через Sparkle, GitHub и Electron. Плюс интеграция с Mac App Store. **Меню бар режим** — можно свернуть в меню бар и включить автообновления. Приложения будут обновляться в фоне. ## Что ещё - Поддержка 6 языков - Экспорт Brewfile (удобно для настройки нового мака) - Проверка подписи кода - Поиск забытых файлов после удаления пакетов ## Вывод Если честно, Homebrew и из терминала работает нормально. Но если ты хочешь держать систему в порядке без постоянных `brew cleanup` и `brew doctor` — TapHouse упрощает жизнь. Особенно CVE-сканер полезен: один клик и видишь, есть ли проблемы с безопасностью. Приложение платное, но для разработчиков, которые ценят своё время, это разумная инвестиция. [Taphouse - The Missing GUI for Homebrew on macOSThe best Homebrew GUI for Mac. A visual Homebrew manager with brew cleanup tool, service management, and one-click installs. No terminal required.![](https://matveev.tech/content/images/icon/faviconV2)🍺 TaphouseTaphouse![](https://taphouse.multimodalsolutions.gr/og-image.png)](https://taphouse.multimodalsolutions.gr/?ref=producthunt) ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — ещё один инструмент для автоматизации на Mac - [GLM-4.7 обновление модели для кодинга](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — если интересуют инструменты разработчика ### Лучшие AI-редакторы кода в 2026 году — тест 10+ инструментов URL: https://matveev.tech/luchshie-ai-redaktory-koda-2026/ Last updated: 2026-02-12T20:20:29.000Z > **TL;DR:** Cursor — для тех, кто хочет максимум AI. VS Code + Copilot — проверенный вариант. Windsurf — лучший бесплатный. PlayCode — если нужен браузерный редактор с кучей моделей. AI в редакторах кода — это уже не будущее, а настоящее. Вопрос только в том, какой выбрать. Я прошёлся по десятку вариантов и собрал честное сравнение: что реально работает, а что — маркетинг. ## Быстрая таблица ## Cursor — когда AI на первом месте Cursor — это не просто «редактор с AI», это AI-инструмент, который умеет редактировать код. Разница принципиальная. **Что умеет:**\- Индексирует весь проект и понимает контекст - Inline-редактирование — выделяешь код, описываешь что нужно - Composer — создаёт и редактирует несколько файлов сразу - Подсказки команд прямо в терминале **Плюсы:** Глубокая интеграция AI, понимает весь проект, поддержка разных моделей, совместим с расширениями VS Code. **Минусы:** $20/месяц за Pro, жрёт ресурсы, иногда нестабилен. **Для кого:** Разработчики, которые хотят выжать максимум из AI. ## VS Code + GitHub Copilot — классика Проверенная связка для тех, кто не любит эксперименты. Copilot «прикручен» к VS Code, а не встроен в него — и это чувствуется. **Плюсы:** Огромная экосистема расширений, стабильность, бесплатно для студентов. **Минусы:** AI как надстройка, а не часть редактора. Слабее понимает контекст проекта. $10/месяц. **Для кого:** Все, кому нужна надёжность. ## PlayCode — браузерный вариант Полноценная среда разработки прямо в браузере. Главная фишка — 15+ моделей AI на выбор: Claude, GPT, Gemini, Grok. **Что умеет:**\- Три режима работы: Agent, Plan, Ask - Работает на любом устройстве - Встроенный npm и публикация по URL **Плюсы:** Не нужно ничего устанавливать, максимум выбора моделей, работает даже на планшете. **Минусы:** Только для веба, нужен интернет, AI за пейволлом. **Для кого:** Веб-разработчики, прототипирование, работа с разных устройств. **Цена:** Бесплатный playground, Pro за $10/месяц. ## Windsurf — лучший бесплатный Бывший Codeium Editor. Бесплатный AI-редактор на базе VS Code. Удивительно, но работает неплохо. **Плюсы:** Полностью бесплатный AI, знакомый интерфейс VS Code, приватность данных. **Минусы:** Слабее Cursor и Copilot, маленькое комьюнити, меньше расширений. **Для кого:** Кто хочет AI бесплатно и готов к компромиссам. ## Zed — для ценителей скорости Редактор на Rust. Самый-самый быстрый из всех. AI пока базовый, но развивается. **Плюсы:** Молниеносная скорость, встроенная коллаборация, минималистичный дизайн, open-source. **Минусы:** Только macOS/Linux (Windows в разработке), мало расширений, AI на начальном этапе. **Для кого:** Кому важна скорость и современный дизайн. ## Replit — для команд Кодинг + AI + хостинг в одном месте. Сильная сторона — совместная работа. **Плюсы:** Multiplayer из коробки, встроенный деплой, много языков. **Минусы:** $25/месяц за Pro — дороговато, бывает медленным. **Для кого:** Команды, обучение, быстрые прототипы. ## JetBrains + AI — энтерпрайз Если ты уже в экосистеме JetBrains, AI Assistant интегрируется в знакомые IDE. **Плюсы:** Мощный рефакторинг, поддержка специфики языков, энтерпрайз-поддержка. **Минусы:** Дорого (IDE + AI), тяжёлые, избыточны для простых проектов. **Для кого:** Большие команды на JetBrains. ## Остальные **Neovim + AI-плагины** — для терминальных гиков. Copilot.vim, Codeium.nvim работают, но настройка требует времени. **Fleet** — лёгкий редактор от JetBrains, пока в бете. AI минимальный. **Sublime Text + AI** — быстрый, но AI нужно настраивать через плагины. $99 за лицензию. ## Так что выбрать? - **Максимум AI** → Cursor - **Надёжность** → VS Code + Copilot - **Бесплатно с AI** → Windsurf - **В браузере** → PlayCode - **Скорость** → Zed - **Команда** → Replit или Cursor Думаю, для большинства VS Code + Copilot — оптимальный выбор. Но если хочется попробовать что-то новое — Cursor действительно впечатляет глубиной интеграции AI. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — как использовать AI-кодинг без навыков программирования - [GLM-4.7 обновление модели для кодинга](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — ещё одна модель для AI-редакторов - [Devstral 2 — опенсорсная модель для кодинга от Mistral](https://matveev.tech/devstral-2-opiensorsnaia-modiel-dlia-kodingha-ot-mistral-2/) — альтернатива для self-hosted решений ### Vellum — AI-агенты на простом английском URL: https://matveev.tech/vellum-ai-agenty-bez-koda/ Last updated: 2026-02-25T12:17:09.000Z > **TL;DR:** Vellum позволяет создавать AI-агентов, просто описав задачу текстом. Без кода, без сложной настройки. Запускаешь по расписанию или через API, видишь каждый шаг работы. Для маркетинга, продаж, саппорта — всех, кто устал от рутины. Заметил интересный продукт на Product Hunt — 430 голосов, 50 комментариев. Vellum обещает сделать то, что пока удавалось только программистам: автоматизировать работу с помощью AI-агентов. ## В чём идея Создатель Vellum Акаш сформулировал проблему чётко: AI-агенты вроде Cursor, Devin и Claude Code реально помогают разработчикам. А вот остальные застряли в 2023 году — куча вкладок с ChatGPT, бесконечное переключение контекста, толку мало. Vellum пытается это исправить. Ты описываешь задачу на простом английском, а сервис сам: - Задаёт уточняющие вопросы - Подключается к твоим инструментам - Выстраивает логику работы - Показывает, что агент делает и почему ## Что можно автоматизировать Несколько примеров из документации и комментариев: **SEO-контент.** Агент берёт ключевик из Google Sheets, анализирует топ выдачи, пишет черновик статьи в Google Doc. Каждый день в 9 утра. **Подготовка к встречам.** Тянет события из календаря, ресёрчит компании клиентов, собирает последние новости, отправляет саммари в Slack. **Мониторинг клиентов.** Следит за активностью в Hubspot, находит «засыпающих» пользователей, постит еженедельные отчёты в Notion. Один пользователь в комментариях написал, что собрал агента для мониторинга трендов в Twitter за 10 минут. Другой хочет автоматизировать полный цикл лидгена — от анализа профилей до добавления в CRM. ## Чем отличается от других Главное — прозрачность. Можно посмотреть каждый шаг до запуска, проверить историю выполнений, понять, что пошло не так. Это важно: многие боятся автоматизации именно потому, что не понимают, что происходит внутри. Ещё: - 1000+ интеграций - Запуск по расписанию, через API или по событиям из приложений - Если процесс меняется — правишь один шаг, а не переписываешь всё - Код можно экспортировать и запускать локально ## Для кого это Vellum явно целится в людей, которые: - Пробовали AI-инструменты, но «почти работает» — это не то - Писали промпты, которым не доверяют - Хотят автоматизировать, но боятся, что что-то сломается Sales, маркетинг, продакт-опс, саппорт — все, кто владеет своими процессами и хочет их автоматизировать без помощи разработчиков. Думаю, таких инструментов будет всё больше. AI-агенты — это круто, но пока они в основном для технарей. Vellum пытается изменить правила игры. Посмотрим, получится ли. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — если хочешь автоматизировать с помощью Claude - [TaskWand — генерация воркфлоу для n8n с помощью ИИ](https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/) — похожий подход, но для n8n - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как устроены агенты изнутри ### Предсказания на 2026 — что думают инженеры Oxide о будущем AI и разработки URL: https://matveev.tech/predicty-oxide-2026/ Last updated: 2026-01-16T14:30:09.000Z > **TL;DR:** Подкаст Oxide and Friends собрал Брайана Кантрилла, Саймона Уиллисона и других инженеров для прогнозов на 1, 3 и 6 лет. Самое интересное: вайбкодинг уйдёт из лексикона, появится «Челленджер» AI-безопасности, а программисты будут переживать «Deep Blue» — экзистенциальный кризис из-за AI. Привет! Наткнулся на свежий выпуск подкаста Oxide and Friends, где ребята делают предсказания на ближайшие годы. Формат необычный — прогнозы на 1, 3 и 6 лет вперёд. И состав крутой: Брайан Кантрилл из Oxide, Саймон Уиллисон (создатель Datasette и один из авторов Django), Стив Клабник и другие. Мне понравилось, что это не хайповые «AI всех заменит» или «AI — это пузырь». Скорее честный разговор инженеров, которые реально работают с этими технологиями. ## Прогнозы на 1 год ### Вайбкодинг уйдёт из лексикона Брайан уверен: термин «вайбкодинг» исчезнет в течение года. Не потому что практика умрёт — просто само слово раздражает людей. Оно превратилось в ругательство, хотя изначально описывало вполне конкретный подход. Скорее всего, появится что-то более нейтральное. Или практика станет настолько обыденной, что отдельное название не понадобится. ### AI-агенты станут мейнстримом Саймон предсказывает, что в этом году AI-агенты войдут в повседневную практику разработки. Не как эксперимент, а как рабочий инструмент. Ключевой вопрос — песочницы и безопасность. Сейчас агенты работают в окружении разработчика с полным доступом ко всему. Это проблема. ### «Челленджер» AI-безопасности Брайан делает мрачное предсказание: в этом году случится серьёзный инцидент с AI-агентами. Что-то вроде «момента Челленджера» — когда станет очевидно, что песочницы и изоляция критически важны. Не обязательно катастрофа уровня утечки данных крупной компании. Но достаточно громкий случай, чтобы индустрия задумалась о безопасности. ## Прогнозы на 3 года ### Парадокс Джевонса решит судьбу программистов Интересная мысль от Брайана: через 3 года мы узнаем, работает ли парадокс Джевонса для разработки. Парадокс Джевонса — это когда повышение эффективности использования ресурса приводит к росту его потребления, а не к экономии. Применительно к программированию: если AI делает код дешевле, возможно, мы увидим взрывной рост спроса на кастомный софт. Каждый малый бизнес сможет позволить себе внутреннее приложение. Каждая организация — специфические инструменты. Это может создать больше работы для программистов, а не меньше. ### AGI объявят «достигнутым» Саймон уверен: через 3 года кто-то официально объявит, что AGI достигнут. Не потому что это будет правдой, а потому что определение AGI настолько размыто, что под него можно подогнать почти что угодно. ### Кастомный софт вместо SaaS Ещё одно следствие дешёвого кода — меньше зависимости от универсальных SaaS-решений. Зачем платить за Salesforce, если можно сгенерировать CRM под свои процессы? ## Прогнозы на 6 лет ### DSM добавит AI как фактор психоза Самое неожиданное предсказание: через 6 лет в DSM (справочник психических расстройств) добавят LLM как триггер психотических эпизодов. Звучит дико, но подумай: люди уже сейчас путают AI-галлюцинации с реальностью. А что будет, когда модели станут ещё убедительнее? ### Tesla уйдёт с рынка потребительских авто Брайан предсказывает, что через 6 лет Tesla выйдет из бизнеса легковых автомобилей. Компания сфокусируется на роботакси или других направлениях, а традиционные автопроизводители заберут рынок электромобилей. ### NVIDIA пройдёт пик Ещё один смелый прогноз: через 6 лет NVIDIA будет уже не на пике. Возможно, Дженсен Хуанг уйдёт с поста CEO. Конкуренты догонят, или рынок AI-чипов изменится. ## Бонус: «Deep Blue» для программистов Брайан ввёл термин, который мне очень понравился — «Deep Blue». Это состояние экзистенциального кризиса, когда программист видит, как AI делает то, что он считал своим уникальным навыком. Название отсылает к моменту, когда Deep Blue обыграл Каспарова в шахматы. Шахматисты тогда пережили похожий кризис. Теперь очередь программистов. Брайан признаётся, что сам периодически испытывает «Deep Blue» — особенно когда видит, как AI решает задачи, над которыми он бы провёл часы. ## \--- Мне нравится формат таких предсказаний — они честные и конкретные. Через год можно проверить, сбылось или нет. Главная мысль, которую я вынес: никто не знает, что будет. Даже люди, которые создают эти технологии. Но можно готовиться к разным сценариям. Парадокс Джевонса — это то, за чем я буду следить особенно внимательно. Если он сработает, программисты не только выживут, но и будут нужнее, чем когда-либо. ## Что ещё почитать - [Что ждёт разработчиков в ближайшие 2 года](https://matveev.tech/budushchee-razrabotki-2-goda/) — похожий анализ от Адди Османи из Google - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — как уже сейчас использовать AI в работе ### GPT-5.2 Codex теперь доступен через API URL: https://matveev.tech/gpt-5-2-codex-api/ Last updated: 2026-01-16T11:50:06.000Z > **TL;DR:** OpenAI выпустили GPT-5.2 Codex в Responses API. Раньше модель была заперта в среде Codex, теперь её можно интегрировать куда угодно. Четыре уровня глубины рассуждений, работа с картинками и лучший поиск уязвимостей среди всех моделей OpenAI. Привет! OpenAI наконец открыли доступ к GPT-5.2 Codex через свой API. До этого модель работала только внутри среды Codex — удобно, но ограниченно. Теперь можно встраивать её в любые инструменты. ## Что умеет Модель заточена под код: - Рефакторинг - Генерация тестов - Поиск багов - Код-ревью Принимает на вход текст и картинки. Так что можно скормить скриншот дизайна или схему архитектуры. ## Четыре уровня рассуждений Интересная фича — можно выбрать глубину reasoning: - **Low** — быстрые ответы - **Medium** — баланс скорости и качества - **High** — глубокий анализ - **Very high** — максимальная тщательность В зависимости от задачи можно выбрать, что важнее — скорость или качество рассуждений. ## Безопасность OpenAI заявляют, что это их лучшая модель для кибербезопасности. Хорошо находит уязвимости в коде. Для тех, кто работает с security-критичными проектами — может быть полезно как дополнительный слой проверки. ## Цены Модель стала дороже предыдущих версий: - **Вход:** $1.75 за миллион токенов (было $1.25) - **Выход:** $14 за миллион токенов (было $10) Рост примерно на 40%. Ну, за качество приходится платить. ## Кто уже подключил Cursor и Windsurf уже интегрировали модель. Windsurf даже даёт 50% скидку на время промо-периода. OpenAI выложили [гайд](https://cookbook.openai.com/examples/gpt-5/gpt-5-2%5Fprompting%5Fguide?ref=matveev.tech) по промптингу в своём кукбуке — если планируешь использовать, стоит почитать. ## \--- Думаю, это хороший шаг. Codex был крутой моделью для кода, но закрытость ограничивала применение. Теперь разработчики IDE, CI/CD систем и других инструментов смогут встроить его напрямую. Это означает лучше автокомплит, умнее код-ревью и более глубокий анализ безопасности. Ну и четыре уровня рассуждений — удобно. Не всегда нужен «максимальный мозг», иногда важнее скорость. ## Что ещё почитать - [Что ждёт разработчиков в ближайшие 2 года](https://matveev.tech/budushchee-razrabotki-2-goda/) — как AI меняет профессию программиста - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — альтернативный подход к AI-помощнику для кода ### ChatGPT Translate — OpenAI выпустили свой переводчик URL: https://matveev.tech/chatgpt-translate-50-yazykov/ Last updated: 2026-01-16T07:06:32.000Z > **TL;DR:** OpenAI запустили отдельный сервис ChatGPT Translate. Переводит на 50+ языков, сам определяет исходный язык, и может переписать перевод под нужный тон — формальный, дружелюбный, деловой. Пока без документов и реал-тайм разговоров, но как быстрый переводчик — вполне рабочий. OpenAI зашли на территорию Google Translate. Вчера компания запустила [ChatGPT Translate](https://chatgpt.com/translate/?ref=matveev.tech) — отдельный инструмент для перевода текстов. Не внутри чата, а как самостоятельный сервис. ## Что умеет Интерфейс простой: слева вводишь текст, справа получаешь перевод. Классика. Основные фишки: - **50+ языков** — все популярные есть - **Автоопределение** — не нужно указывать исходный язык - **Адаптация тона** — можно в один клик переписать перевод под формальный, дружелюбный или деловой стиль - **Голосовой ввод** — работает в мобильных браузерах Последний пункт про тон — это интересно. Обычные переводчики просто переводят. А тут можно сразу получить версию для делового письма или неформального сообщения другу. ## Чего пока нет OpenAI честно признают, что это MVP: - Нет работы с документами - Нет перевода сайтов по URL - Нет реал-тайм перевода разговоров - На десктопе нельзя загрузить картинку (хотя в интерфейсе об этом написано) Google Translate всё это умеет. Плюс поддерживает больше языков. ## Что это значит Думаю, это первый шаг. OpenAI явно метят в рынок переводчиков, и начали с простого. Фича с адаптацией тона — это то, чего нет у конкурентов. Если развить эту идею (например, адаптация под конкретную культуру или аудиторию), может получиться что-то действительно полезное. Пока это скорее удобный способ перевести что-то быстро, не открывая полноценный ChatGPT. Для простых задач — почему бы и нет. Попробовать можно тут: [chatgpt.com/translate](https://chatgpt.com/translate/?ref=matveev.tech) ## Что ещё почитать - [GPT-5.2 Codex теперь доступен через API](https://matveev.tech/gpt-5-2-codex-api/) — свежий релиз специализированной модели для кода ### TranslateGemma — Google открыл модели перевода на 55 языков URL: https://matveev.tech/translategemma-google-perevod/ Last updated: 2026-01-15T22:59:09.000Z > **TL;DR:** Google выпустил TranslateGemma — семейство опенсорсных моделей для перевода на базе Gemma 3\. Три размера: 4B для смартфонов, 12B для ноутбуков, 27B для серверов. 55 языков, включая редкие. Модель в 12B обходит 27B базовую Gemma по качеству перевода. Google продолжает открывать свои модели. На этот раз — специализированные модели для перевода. ## Что это TranslateGemma — это три модели на базе Gemma 3, заточенные именно под перевод. Размеры: 4B, 12B и 27B параметров. Самое интересное — 12B модель показывает результаты лучше, чем базовая Gemma 3 27B на бенчмарке MetricX. То есть специализация реально работает, и не нужно гонять монстра на 27 миллиардов параметров, чтобы получить качественный перевод. ## Что умеет **Языки:**\- 55 тщательно протестированных языковых пар - Ещё \~500 дополнительных пар в обучении - Поддержка редких языков, не только «большая тройка» **Мультимодальность:**Модели сохранили способности Gemma 3 работать с картинками. Перевод текста на изображениях улучшился без специального обучения — приятный бонус. ## Где запускать Google чётко разложил по полочкам: - **4B** — телефоны и edge-устройства - **12B** — обычный ноутбук, локальная разработка - **27B** — один H100 или облачный TPU 4B версия конкурирует с 12B базовыми моделями. Для мобильных приложений — самое то. ## Как обучали Двухэтапный процесс: 1\. **Supervised Fine-Tuning** — на смеси человеческих переводов и синтетических от Gemini 2\. **Reinforcement Learning** — с наградой от MetricX-QE и AutoMQM В общем, классическая схема RLHF, но с метриками качества перевода вместо человеческих оценок. ## Где взять Модели уже доступны: - [Kaggle](https://www.kaggle.com/models/google/translategemma/?ref=matveev.tech)\- [Hugging Face](https://huggingface.co/collections/google/translategemma?ref=matveev.tech)\- [Vertex AI для облачного деплоя](https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/translategemma%29?ref=matveev.tech)\- [Gemma Cookbook с примерами использования](https://colab.research.google.com/github/google-gemini/gemma-cookbook/blob/main/Research/[TranslateGemma]Example.ipynb?ref=matveev.tech) Думаю, для разработчиков это полезно. Не всегда хочется гонять запросы через API — то лимиты, то задержки, то приватность данных. А тут можно развернуть свой переводчик локально, причём качество на уровне. ## Что ещё почитать - [DeepSeek Engram - память для LLM](https://matveev.tech/deepseek-engram-pamyat-llm/) — ещё один интересный опенсорс подход к улучшению моделей - [GLM-4.7 обновление модели для кодинга](https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/) — китайцы тоже делают крутые открытые модели - [Devstral 2 — опенсорсная модель от Mistral](https://matveev.tech/devstral-2-opiensorsnaia-modiel-dlia-kodingha-ot-mistral-2/) — ещё один сильный опенсорс игрок ### Movens — вся поездка на экране блокировки iPhone URL: https://matveev.tech/movens-travel-organizer/ Last updated: 2026-01-20T21:04:35.000Z > **TL;DR:** Приложение для iPhone, которое выносит самую важную информацию о поездке на экран блокировки и в Dynamic Island. Код от Airbnb, номер места в самолёте, PDF-билет — всё в одно касание. Работает офлайн, без аккаунтов. Привет! Знакомая ситуация: стоишь у двери Airbnb с чемоданом, а код от замка где-то в переписке с хозяином. Или ищешь посадочный в куче скриншотов, пока очередь на гейт движется. Movens решает именно эту проблему. ## Что это Movens — это приватный органайзер путешествий для iPhone. Главная фишка — Live Activities. Приложение выводит критически важную информацию прямо на экран блокировки: коды от дверей, пароли от Wi-Fi, номера мест в самолёте. Не нужно разблокировать телефон и копаться в приложениях, когда руки заняты багажом. ## Как работает - **Live Activities на Lock Screen** — закрепляешь код от двери или номер гейта, и он всегда перед глазами - **Dynamic Island** — на iPhone 14 Pro и новее информация отображается в «острове» - **Вложения файлов** — прикрепляешь PDF-билеты и посадочные к любой активности, открываются в одно касание - **Расстояние до точки** — показывает, сколько осталось до отеля или аэропорта в реальном времени - **Полная приватность** — все данные хранятся только на устройстве, никаких облаков и аккаунтов ## Тарифы Приложение бесплатное с базовым функционалом. Для продвинутых фич есть подписка Movens Pro: - **$1.99/месяц** — помесячная оплата - **$19.99/год** — годовая подписка ## Для кого Movens подойдёт тем, кто часто путешествует и устал искать информацию в разных местах. Особенно полезно, если ты: - Бронируешь жильё через Airbnb или Booking - Летаешь и хочешь иметь посадочный под рукой без лишних действий - Ценишь приватность и не хочешь хранить данные о поездках в облаке Требует iOS 18.5 или новее. Попробовать можно тут: [Movens в App Store](https://apps.apple.com/us/app/movens-trip-organizer/id6757230586?ref=matveev.tech) ### DeepSeek Engram - память для LLM URL: https://matveev.tech/deepseek-engram-pamyat-llm/ Last updated: 2026-01-15T20:45:55.000Z > **TL;DR:** DeepSeek представили Engram - модуль памяти для языковых моделей, который позволяет напрямую искать часто встречающиеся паттерны токенов вместо их пересчёта. Работает в связке с MoE и даёт прирост до +5 пунктов на бенчмарках. DeepSeek продолжают радовать интересными архитектурными решениями. На этот раз - модуль условной памяти под названием Engram. ## В чём идея Классические трансформеры каждый раз заново вычисляют одни и те же фразы. Вопрос «Как дела?» модель обрабатывает так, будто видит его впервые. Каждый. Раз. Engram решает это просто - вместо пересчёта модель напрямую ищет паттерн в памяти. Сложность O(1), никаких лишних вычислений. ## Как это работает Три ключевых компонента: **Сжатие токенизатора** \- словарь уменьшили на 23%. Меньше токенов - быстрее поиск. **Многоголовое хэширование** \- несколько хэш-функций для предотвращения коллизий. Если два разных паттерна дают одинаковый хэш - проблема. Мультиголовый подход это решает. **Контекстное гейтирование** \- attention-механизм фильтрует, когда использовать память, а когда считать по-старому. Не все паттерны одинаково полезны в любом контексте. ## MoE + Engram = оптимальное соотношение Интересный момент - исследователи нашли U-образную зависимость производительности от распределения ресурсов. Оптимум: 75-80% на MoE, 20-25% на Engram. MoE маршрутизирует вычисления, Engram маршрутизирует память. Вместе работают лучше, чем по отдельности. ## Результаты На модели Engram-27B: Особенно впечатляет результат на длинном контексте - почти 13 пунктов разницы. ## \--- DeepSeek показывают, что улучшать модели можно не только увеличением параметров. Умная работа с памятью освобождает ресурсы для того, что действительно важно - рассуждений и сложных задач. Думаю, мы увидим больше таких архитектурных инноваций. Гонка за размером моделей упирается в потолок, а вот оптимизация памяти - открытое поле для экспериментов. 📚 Источники [DeepSeek Engram: The Conditional Memory Revolution for LLMs](https://www.analyticsvidhya.com/blog/2026/01/deepseek-engram/?ref=matveev.tech) ### Что ждёт разработчиков в ближайшие 2 года URL: https://matveev.tech/budushchee-razrabotki-2-goda/ Last updated: 2026-01-15T20:46:23.000Z > **TL;DR:** Адди Османи разобрал пять главных вопросов о будущем разработки: судьба джунов, атрофия навыков, смена ролей, специалисты vs универсалы и кризис образования. Вместо прогнозов — два сценария на каждый вопрос и конкретные рекомендации. Привет! Наткнулся на отличную статью Адди Османи о том, что ждёт нашу индустрию в ближайшие пару лет. Адди — известный инженер из Google, и его мнение стоит послушать. Мне понравилось, что он не играет в пророка и не кричит «AI всех заменит». Вместо этого — честный разбор двух сценариев для каждого вопроса: пессимистичного и оптимистичного. Плюс конкретные советы. ## Вопрос 1: Что будет с джунами? **Пессимистичный сценарий.** Найм джунов обвалится, потому что AI автоматизирует входные задачи. Исследование Гарварда показало: когда компании внедряют генеративный AI, найм джунов падает на 9-10% за полтора года. **Оптимистичный сценарий.** AI откроет огромный спрос на софт в отраслях за пределами IT — здравоохранение, сельское хозяйство, производство. Появятся новые входные позиции. **Что делать джуну:** освоить AI-инструменты для кодинга, показать универсальность, прокачать навыки, которые AI пока не заменит — коммуникацию, декомпозицию задач, понимание предметной области. ## Вопрос 2: Навыки атрофируются? **Пессимистичный сценарий.** Базовые навыки программирования деградируют, потому что AI пишет большую часть кода. Появляются разработчики, которые не могут кодить без ассистента и пропускают тонкие баги. **Оптимистичный сценарий.** Пока AI берёт на себя рутину, люди фокусируются на архитектуре, интеграции и edge cases. Глубокая экспертиза становится ценнее. **Что делать джуну:** использовать AI как инструмент обучения, а не костыль. Периодически писать алгоритмы без помощи. Сравнивать свои решения с AI-генерированными. ## Вопрос 3: Кем станут разработчики? **Пессимистичный сценарий.** Роль разработчика сужается до проверки AI-кода. Вместо творчества — compliance и аудит. **Оптимистичный сценарий.** Разработчики превращаются в архитекторов, которые оркестрируют AI-агентов и сервисы. Ты задаёшь мелодию системы, а компоненты играют отдельные ноты. **Что делать:** искать возможности за пределами чистого кодинга — тестирование, CI/CD, мониторинг. Развивать системное мышление. Сохранять творческий настрой через личные проекты. ## Вопрос 4: Специалисты или универсалы? **Пессимистичный сценарий.** Узкие специалисты рискуют: их нишу автоматизируют или она станет неактуальной из-за быстрых изменений. **Оптимистичный сценарий.** Побеждают T-shaped люди — широкая адаптивность плюс одна-две глубокие экспертизы. Они становятся клеем организации, решая проблемы end-to-end. **Что делать:** строить широкий фундамент, но обязательно иметь одну специализацию. Изучать инструменты деплоя. Развивать смежные компетенции. ## Вопрос 5: Что с образованием? **Пессимистичный сценарий.** Традиционные CS-программы остаются по умолчанию, но отстают от индустрии. Дорогой билет со слабой релевантностью. **Оптимистичный сценарий.** Буткемпы, сертификации, портфолио и корпоративное обучение заменяют дипломы как критерий найма. **Что делать:** дополнять формальное образование реальными проектами. Искать стажировки. Получать индустриальные сертификаты. Поддерживать активный GitHub. Доказывать навыки делом, а не бумажками. ## Что это значит Главная мысль Адди: неважно, наступит ли ренессанс кодинга или мир, где код пишет себя сам. Спрос на инженеров, которые думают системно, постоянно учатся и направляют технологии на решение реальных проблем — никуда не денется. Непрерывное обучение и адаптивность отделяют тех, кто будет процветать, от тех, кто останется позади. Думаю, это правильный фреймворк. Вместо паники — спокойный анализ сценариев и конкретные действия. Рекомендую почитать оригинал целиком. ## Что ещё почитать - [Claude Code для нетехнарей — 50 способов применения](https://matveev.tech/claude-code-bez-koda/) — практические примеры использования AI-инструментов 📚 Источники - [The Next Two Years of Software Engineering — Addy](https://addyosmani.com/blog/next-two-years/?ref=matveev.tech) ### Claude Code для нетехнарей — 50 способов применения URL: https://matveev.tech/claude-code-bez-koda/ Last updated: 2026-01-14T10:37:10.000Z Привет! Думаю, многие слышали про Claude Code и автоматически решили — «это для программистов». Ну и зря. На самом деле это самый гибкий AI-ассистент для автоматизации чего угодно. Главная фишка — Claude Code работает локально. Это значит, что он может копаться в твоих файлах, запускать программы и делать кучу вещей, которые облачные решения просто не потянут. ## Как установить Если ещё не пробовал — вот быстрый старт: **Mac:** открой терминал (Command + Space → Terminal) и введи: ```bash curl -fsSL https://claude.ai/install.sh | bash ``` **Windows:** открой терминал (Windows + R → wt) и введи: ```powershell irm https://claude.ai/install.ps1 | iex ``` После установки просто пиши `claude` в терминале. Нужна подписка Pro за $20/месяц. ## Работа с файлами и медиа Самое простое, с чего можно начать: - **Очистка диска** — Claude найдёт и удалит дубликаты, временные файлы, освободит место - **Улучшение картинок** — повышение качества скриншотов и фото - **Скачивание видео с YouTube** — просто даёшь ссылку - **Организация хаоса** — переименование и сортировка документов по папкам с пониманием контекста - **Массовый экспорт** — например, вытащить все картинки из Google Docs ## Бизнес и продажи Вот где начинается магия: - **Генератор доменов** — придумывает креативные названия и сразу проверяет доступность - **Поиск лидов** — анализирует проекты на GitHub и находит потенциальных клиентов - **Анализ встреч** — находит паттерны в записях созвонов, выявляет конфликты - **Диагностика проблем** — объясняет, почему комп тормозит, и предлагает решения ## Организация жизни - **Сортировка счетов для налоговой** — автоматическое переименование и раскладка по папкам - **Строительные проекты** — да, серьёзно. Люди создают чертежи и инструкции для домашних поделок - **Обработка голосовых заметок** — надиктовал мысли, получил структурированный текст - **Составление вакансий** — анализирует рынок и генерирует нормальные JD ## Контент и коммуникация - **Синтез интервью** — скармливаешь расшифровки встреч с клиентами, получаешь инсайты - **Редактор в реальном времени** — улучшает стиль текста прямо пока пишешь - **Обработка аудио** — конвертация форматов, перевод, переименование файлов - **Автодокументация** — находит пробелы в документации и заполняет их ## Продвинутые сценарии А вот тут совсем интересно. Люди строят целые «операционные системы» для жизни: **«Claude CEO»** — агент, который каждое утро собирает отчёт из Gmail, Slack, Mercury и Linear. Просыпаешься — и уже знаешь, что важного произошло. **Система управления вниманием** — центральный интерфейс для целей дня. Claude анализирует, на чём фокусироваться. **Карьерная ОС** — 7 агентов анализируют вакансии, генерируют резюме и сопроводительные письма. За 5 минут готов полный пакет документов. **Конвейер подкастов** — от сценария до готового аудио через ElevenLabs API. **Ежедневный оператор** — обрабатывает 50+ писем и готовит стендап-отчёт. ## Чем это отличается от ChatGPT Хорошая аналогия из [оригинальной статьи](https://teletype.in/@tipsai/3BDyY-lhF9p?ref=matveev.tech): > Claude Code в твоей системе — это консьерж, который работает в отеле 10 лет. ChatGPT в браузере — это случайный консультант. Claude видит твои файлы, помнит контекст, может запускать команды. Это совсем другой уровень интеграции. ## Что это значит Мне кажется, большинство людей недооценивают Claude Code. Это не «инструмент для программистов» — это персональная автоматизация на стероидах. Начни с простого — попроси навести порядок в папке с загрузками или переименовать фотки. А потом втянешься. ### Память AI-агентов — почему хранить всё подряд не работает URL: https://matveev.tech/pamyat-ai-agentov/ Last updated: 2026-01-13T11:44:56.000Z > **TL;DR:** Текущие системы памяти AI-агентов — это просто свалка данных в векторных базах. Но реальная память работает иначе: фильтрация, консолидация и забывание так же важны, как запоминание. Архитектура по образцу человеческого мозга решает проблему. Привет! Наткнулся на интересный разбор того, почему память у AI-агентов работает так себе. И знаешь, автор прав — мы подходим к проблеме не с того конца. ## Проблема Сейчас большинство решений для памяти агентов выглядят одинаково: сохраняем всё в векторную базу, добавляем BM25 для поиска, и надеемся, что это сработает. Но что происходит на практике: - Контекст раздувается до безобразия - Поиск возвращает нерелевантный мусор - Персонализация ломается, потому что старые данные мешают новым Главная проблема — нет механизма забывания. А ведь забывание — это не баг, это фича. Без него система тонет в собственных данных. ## Как работает человеческая память Автор статьи предлагает посмотреть, как устроена память у нас в голове: 1. **Сенсорная память** — первичный фильтр, отсеивает шум 2. **Кратковременная память** — удерживает контекст текущей задачи 3. **Долговременная память** — консолидированные знания и опыт 4. **Консолидация и забывание** — периодическая чистка и укрепление важного 5. **Ядро личности** — стабильные черты и предпочтения И это не просто красивая аналогия — это рабочая архитектура. ## Архитектура для агентов Перенося это на AI-агентов, получаем: **Сенсорный слой** — фильтрует входящий поток, извлекает сущности и отбрасывает мусор. **Буфер кратковременной памяти** — держит контекст текущего разговора или задачи. Не пытается запомнить всё навсегда. **Долговременное хранилище** — индексированные знания, которые переживают отдельные сессии. Семантический поиск работает именно здесь. **Менеджеры памяти** — фоновые процессы консолидации. Объединяют похожие воспоминания, удаляют устаревшее, усиливают важное. **Ядро памяти** — устойчивая информация о пользователе: предпочтения, привычки, контекст отношений. ## Главный инсайт Будущее памяти агентов — не в том, чтобы хранить больше. Оно в том, чтобы думать лучше. Метакогниция и рефлексия важнее объёма хранилища. Агент должен понимать, что он знает, чего не знает, и что пора забыть. Думаю, это правильный вектор. Пока все соревнуются в размере контекстного окна, реальный прорыв будет в качестве работы с памятью. 📚 **Источник:** [Towards Human like Memory for AI Agents](https://manthanguptaa.in/posts/towards%5Fhuman%5Flike%5Fmemory%5Ffor%5Fai%5Fagents/?ref=matveev.tech) ### TRMNL — e-ink дисплей для тех, кто устал от уведомлений URL: https://matveev.tech/trmnl-e-ink-dashboard/ Last updated: 2026-01-12T14:25:31.000Z > **TL;DR:** TRMNL — это отдельный e-ink экран размером 7.5 дюймов, который показывает календарь, погоду, задачи и другую полезную информацию. Без подсветки, без уведомлений, без отвлечений. Работает 3-6 месяцев от одной зарядки. Интересная штука попалась. Если ты, как и я, периодически страдаешь от бесконечного потока уведомлений — возможно, это решение. ## Что это такое TRMNL — это маленький e-ink дисплей с подставкой, который стоит на столе и показывает только то, что тебе нужно. Никаких пушей, никакого дофаминового колеса. Просто информация. Экран 7.5 дюйма, чёрно-белый. Да, как в читалках. Это значит — никакой подсветки, глаза не устают, а батарея живёт месяцами. ## Что умеет На экран можно вывести: - Календарь и события - Погоду - Курсы акций - Новости - Задачи из любимого таск-менеджера - Кастомные виджеты Всего доступно 794 плагина — и нативных, и от сообщества. Можно даже свои написать, если знаешь базовый HTML. Самое крутое — можно настроить «плейлисты» из разных экранов. Утром показывает одно, днём другое, вечером третье. До 8 разных лейаутов. ## Характеристики - **Экран:** 7.5" e-ink, чёрно-белый - **Размер:** 17 × 11.5 × 1 см - **Вес:** 165 грамм - **Батарея:** 1800 mAh (3 месяца) или 2500 mAh (6+ месяцев) - **Зарядка:** USB-C - **Корпус:** soft-touch пластик + хромированная подставка ## Про приватность Отдельно понравился подход к безопасности. Устройство работает в режиме «только приём» — оно получает данные с сервера, но ничего не отправляет обратно. То есть даже сами разработчики не имеют доступа к твоей локальной сети. Плюс весь софт open-source, можно поднять свой сервер. ## Для кого это Думаю, TRMNL подойдёт тем, кто: - Работает за компьютером и хочет видеть расписание без открытия новых вкладок - Устал отвлекаться на телефон ради проверки погоды или курсов - Любит минимализм и продуманные гаджеты - Хочет отдельный экран на холодильник) Ну и просто выглядит красиво на столе, чего уж. Изучить можно тут: [usetrmnl.com](https://usetrmnl.com/?ref=matveev.tech) ### CosyVoice 3 - голосовой ИИ от Alibaba на миллион часов речи URL: https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/ Last updated: 2026-01-11T14:34:35.000Z --- > **TL;DR:** Alibaba представили CosyVoice 3 - модель синтеза речи нового поколения. Обучена на миллионе часов аудио, понимает 9 языков и 18 китайских диалектов. Умеет клонировать голос, передавать эмоции и смешивать языки в одной фразе. Привет! Команда FunAudioLLM из Alibaba выкатила третью версию своей модели синтеза речи CosyVoice. И тут есть на что посмотреть. ## Что нового Главное - масштаб. Датасет вырос с 10 тысяч часов до миллиона. Это примерно 114 лет непрерывной речи. Параметров тоже прибавилось - с 500 миллионов до 1.5 миллиарда. Что умеет: - **Zero-shot клонирование** \- даёшь образец голоса, получаешь синтез этим голосом - **9 языков** \- английский, китайский, японский, корейский, немецкий, испанский, французский, итальянский, русский - **18 китайских диалектов** \- кантонский, сычуаньский, шанхайский и другие - **Эмоции** \- радость, грусть, страх, злость, удивление - **Смешивание языков** \- можно говорить на нескольких языках в одной фразе ## Как это работает Под капотом - комбинация LLM и технологии chunk-aware flow matching. Звучит сложно, но суть простая: модель понимает контекст и генерирует речь кусками, сохраняя естественность интонаций. Интересная штука - новый токенизатор речи. Его обучали на нескольких задачах сразу: распознавание речи, определение эмоций, идентификация языка, анализ говорящего. Это помогает модели лучше передавать просодику - то, как мы выделяем слова и расставляем паузы. ## Что это значит Синтез речи становится всё ближе к человеческому. Миллион часов обучающих данных - это серьёзно. Думаю, скоро увидим эту модель в продуктах Alibaba, а может и в open-source. Для тех, кто работает с голосовыми интерфейсами - стоит следить за развитием. 📚 Источники - [Официальная страница CosyVoice 3](https://funaudiollm.github.io/cosyvoice3/?ref=matveev.tech) ### GLM-4.7 обновление модели для кодинга от z.ai URL: https://matveev.tech/glm-4-7-obnovlieniie-modieli-dlia-kodingha-ot-z-ai/ Last updated: 2025-12-23T19:47:09.000Z ## Zhipu AI выпустили GLM-4.7 с отличными результатами в кодинге и поддержкой Claude Code. Разбираемся, что умеет --- > **TL;DR:** GLM-4.7 - модель с фокусом на кодинг. 73.8% на SWE-bench, три режима «думания», работает с Claude Code и другими кодовыми агентами. Веса открыты, можно запускать локально. Привет! Китайские модели продолжают радовать. Zhipu AI (те самые, что делают ChatGLM) выкатили GLM-4.7, и результаты интересные. ## Что умеет Основное - кодинг. На SWE-bench модель показывает 73.8%, это +5.8% к предыдущей версии. На мультиязычном SWE-bench ещё круче — 66.7% (+12.9%). Для опенсорсной модели это очень хороший результат. Но кодинг — не единственное: - **UI-генерация** — создаёт более чистые и современные веб-страницы, лучше работает со слайдами - **Использование инструментов** — улучшения в τ²-Bench и веб-браузинге - **Математика** — 42.8% на HLE benchmark (+12.4%) ## Три режима thinking 1. **Interleaved Thinking** — модель рассуждает перед каждым ответом и вызовом инструмента 2. **Preserved Thinking** — сохраняет цепочку рассуждений между сообщениями в диалоге 3. **Turn-level Thinking** — можно контролировать глубину рассуждений на уровне отдельных реплик Гибкость хорошая — можно выбирать баланс между скоростью и качеством. ## Интеграции Модель сразу работает с популярными агентами: - Claude Code - Kilo Code - Cline - Roo Code То есть можно подключить вместо Claude или GPT и использовать как кодинг-ассистента. ## Где попробовать Вариантов много: - **Z.ai** — родной интерфейс от Zhipu - **OpenRouter** — если хочешь через API - **HuggingFace / ModelScope** — веса для локального запуска - **vLLM / SGLang** — для деплоя на своём железе ## Что думаю Zhipu продолжают двигаться вперёд. GLM-4.7 — не «убийца GPT-5», но для опенсорсной модели результаты впечатляют, да и GLM-4.6 тоже была хороша. Особенно в кодинге. Если ищешь альтернативу для локального запуска или просто хочешь попробовать что-то новое в кодинг-агентах — стоит глянуть. Попробовать можно тут: [z.ai](https://z.ai/?ref=matveev.tech) 📚 Источники - [GLM-4.7: Advancing the Coding Capability](https://z.ai/blog/glm-4.7?ref=matveev.tech) — оригинал статьи ### Devstral 2 — опенсорсная модель для кодинга от Mistral URL: https://matveev.tech/devstral-2-opiensorsnaia-modiel-dlia-kodingha-ot-mistral-2/ Last updated: 2025-12-21T20:12:12.000Z > **TL;DR:** Mistral выкатили Devstral 2 — опенсорсную модель для кодинга, которая набрала 72.2% на SWE-bench Verified. Есть две версии: большая (123B) и компактная (24B), которую можно запустить локально. API пока бесплатный. Бонусом — CLI-агент Mistral Vibe. Французы из Mistral не перестают радовать. Вчера они выпустили Devstral 2 — и это реально крутая штука для разработчиков. ## Что это Devstral 2 — это семейство моделей, заточенных под программирование: - **Devstral 2 (123B)** — большая модель, 72.2% на SWE-bench Verified, лицензия Modified MIT - **Devstral Small 2 (24B)** — компактная версия, 68.0% на SWE-bench, Apache 2.0 Обе модели поддерживают контекст в 256K токенов. Это много — можно скормить целый репозиторий. ## Почему это круто Главное — это баланс размера и качества. Devstral 2 в 5 раз меньше DeepSeek V3.2 и в 8 раз меньше Kimi K2, но показывает сравнимые результаты. Что умеет: - Исследовать кодовую базу и понимать архитектуру - Вносить изменения в несколько файлов одновременно - Отслеживать зависимости фреймворков - Детектить ошибки и автоматически исправлять их - Работать с legacy-кодом По независимым тестам, Devstral 2 до 7 раз дешевле Claude Sonnet на реальных задачах. ## Mistral Vibe CLI Вместе с моделью Mistral выпустили Vibe CLI — опенсорсный агент для терминала. Он умеет: - Автоматически сканировать структуру проекта и git-статус - Работать с файлами через @ автокомплит - Выполнять команды через ! - Понимать весь проект, а не только текущий файл Интеграция с Zed уже готова, для других IDE — через Agent Communication Protocol. ## Как попробовать API пока **бесплатный**. После окончания бесплатного периода цены будут: - Devstral 2: $0.40 / $2.00 за миллион токенов (вход/выход) - Devstral Small 2: $0.10 / $0.30 Devstral Small 2 можно запустить локально — хватит одной видеокарты потребительского класса. **API:** [console.mistral.ai](https://console.mistral.ai/?ref=matveev.tech) **Vibe CLI:** [github.com/mistralai/mistral-vibe](https://github.com/mistralai/mistral-vibe?ref=matveev.tech) ### Scouts by Yutori - AI-агенты мониторят веб за тебя URL: https://matveev.tech/scouts-by-yutori-ai-aghienty-monitoriat-vieb-za-tiebia/ Last updated: 2025-12-23T23:06:06.000Z > **TL;DR:** Scouts от Yutori - это AI-агенты, которые мониторят интернет и присылают уведомления о важном. Отслеживают цены, новости, резервации, вакансии - что угодно. Работают 24/7 в фоне, пока ты занимаешься своими делами. Знаешь это чувство, когда открываешь 20 вкладок, чтобы отслеживать цену на билеты, проверить наличие столика в ресторане, и не пропустить новости по важной теме? Scouts решают именно эту проблему. ## Что это Scouts - это AI-агенты от команды Yutori, которые автономно бродят по интернету и мониторят то, что тебе важно. Ты просто говоришь, что отслеживать — а они работают 24/7 в фоне и присылают уведомления. Позиционируют себя как "AI chief-of-staff для каждого" - такой персональный помощник, который следит за интернетом вместо тебя. ## Что можно мониторить Примеры готовых скаутов на сайте впечатляют: **Шопинг и цены:** - Снижение цен на Sony WH-1000XM6 - Скидки на Patagonia - Появление редких товаров (винтажные часы, коллекционные вещи) **Путешествия:** - Дешёвые билеты на конкретное направление - Доступность отелей на CES - Кэмпинги в Big Sur на выходные **Бронирования:** - Свободные столики в популярных ресторанах - Билеты на концерты - Места в фитнес-классах **Работа и бизнес:** - Новые вакансии в AI-стартапах - Новости о раундах финансирования - Упоминания брендов в соцсетях **Новости:** - Дайджест по AI и криптовалютам - Политические новости - Научные публикации по теме ## Как работает Ты описываешь, что хочешь отслеживать, естественным языком. Scouts создают команду агентов, которые автономно навигируют по вебу и проверяют нужную информацию. Когда находят что-то релевантное - присылают уведомление. Главная идея - освободить твою голову от постоянного мониторинга. Вместо того чтобы держать открытыми десятки вкладок, ты просто реагируешь на уведомления. ## Для кого - Если ты охотишься за скидками или редкими товарами - Если нужно забронировать популярное место - Если следишь за новостями по определённой теме - Если занимаешься продажами и мониторишь лиды Попробовать можно тут: [yutori.com/scouts](https://yutori.com/scouts?ref=matveev.tech) ### GLM-4.6V - опенсорс мультимодалка с function calling URL: https://matveev.tech/glm-4-6v-opiensors-multimodalka-s-function-calling/ Last updated: 2026-01-22T22:07:08.000Z > **TL;DR:** Zhipu AI выкатили GLM-4.6V - опенсорсную мультимодальную модель с 128K контекстом. Умеет понимать картинки и видео, а главное - нативно вызывать функции. При регистрации дают 20 миллионов бесплатных токенов. А вот это интересно. Китайцы из Zhipu AI (это те, кто делают ChatGLM) выпустили новую визуальную модель, и она реально крутая. ## Что это GLM-4.6V - это мультимодальная модель, которая понимает текст, изображения и видео. Но самое-самое - она умеет нативно вызывать функции (function calling), что делает её пригодной для агентских сценариев. Основные характеристики: - 128K контекстное окно - Понимание изображений, видео и документов - Native function calling из коробки - Open-source (можно скачать и запустить локально) - SOTA среди опенсорс моделей в своём классе ## Как работает Модель заточена под агентские workflow. Ты можешь скормить ей скриншот интерфейса, и она поймёт что там происходит. Или дать задачу типа "найди информацию в интернете" - и она сама вызовет нужные функции. Что умеет: - Анализ изображений и скриншотов - Понимание видео - OCR и парсинг документов - Веб-поиск через tool use - Написание и анализ кода ## Тарифы Zhipu дают щедрый бесплатный тир: - **20 миллионов токенов** при регистрации - Ещё до 200M токенов через реферальную программу Платные тарифы (для визуальных моделей): - Input до 32K: ¥2 / 1M токенов (\~$0.27) - Output: ¥6 / 1M токенов (\~$0.82) - Input 32-64K: ¥4 / 1M токенов Есть бесплатная модель **GLM-4.5-Flash** для тех, кому нужно экономить. А ещё у них есть **GLM Coding Plan от $3/месяц** \- это подписка для интеграции с Claude Code, Cline и другими инструментами для кодинга. ## Для кого Думаю, GLM-4.6V пригодится: - Разработчикам AI-агентов, которым нужен визуальный ввод - Тем, кто строит автоматизации с анализом скриншотов - Командам, которые хотят опенсорс альтернативу GPT-4V - Тем, кто работает с документами и нужен OCR + понимание контекста Если тебе нужна мультимодальная модель с function calling и ты не хочешь платить OpenAI - это отличный вариант. Попробовать можно тут: [bigmodel.cn](https://bigmodel.cn/?ref=matveev.tech) ## Что ещё почитать - [TranslateGemma — Google открыл модели перевода на 55 языков](https://matveev.tech/translategemma-google-perevod/) — опенсорсные модели перевода на базе Gemma 3, 55 языков, работает на смартфоне - [DeepSeek Engram — память для LLM](https://matveev.tech/deepseek-engram-pamyat-llm/) — ещё один интересный опенсорс подход к улучшению моделей - [Devstral 2 — опенсорсная модель от Mistral](https://matveev.tech/devstral-2-opiensorsnaia-modiel-dlia-kodingha-ot-mistral-2/) — сильный опенсорс игрок для кодинга ### TaskWand - генерация воркфлоу для n8n с помощью ИИ URL: https://matveev.tech/taskwand-ghienieratsiia-vorkflou-dlia-n8n-s-pomoshchiu-ii/ Last updated: 2025-12-20T17:42:16.000Z > **TL;DR:** TaskWand - это AI-инструмент, который превращает обычный текстовый запрос в готовый воркфлоу для n8n. Описываешь, что нужно автоматизировать, и получаешь готовый workflow с логикой, циклами и обработкой ошибок. Экспортируешь в n8n и запускаешь. Привет! Если ты когда-нибудь работал с n8n, то знаешь это чувство - открываешь пустой холст и думаешь: "Так, с чего начать?". Нода за нодой, настройка за настройкой, и вот уже прошёл час, а ты всё ещё разбираешься, почему данные не передаются между шагами. Я нашёл инструмент, который решает эту проблему. ## Что такое n8n (для тех, кто не в теме) n8n - это платформа для автоматизации. Что-то вроде Zapier или Make, только с открытым исходным кодом и возможностью хостить у себя. Можно связывать разные сервисы между собой: получил письмо → создал задачу в Notion → отправил уведомление в Telegram. Всё это без кода, через визуальный редактор. Звучит просто, но на практике создание сложных воркфлоу требует времени и понимания, как всё работает. Особенно когда нужны условия, циклы или обработка ошибок. ## TaskWand - ИИ-ассистент для n8n [TaskWand](https://taskwand.io/?ref=matveev.tech) \- это сервис, который генерирует готовые воркфлоу для n8n по текстовому описанию. Пишешь на обычном языке, что хочешь автоматизировать, и получаешь готовый workflow, который можно сразу импортировать в n8n. ### Как это работает 1. Описываешь задачу текстом. Например: «Создай Telegram-бота, который подключён к Google Calendar и отправляет напоминания о встречах» 2. TaskWand генерирует полный воркфлоу со всеми нодами, логикой и связями 3. Экспортируешь JSON и импортируешь в свой n8n 4. Настраиваешь API-ключи и запускаешь То, что раньше занимало 30-40 минут ручной настройки, теперь делается за минуту-две. ### Что умеет - Генерирует сложные воркфлоу с условиями и циклами - Добавляет обработку ошибок (это важно!) - Объясняет, как работает сгенерированный workflow - Помогает уточнить запрос, если он слишком общий ### Для кого это TaskWand больше всего полезен: - **Фрилансерам** \- быстро собрать автоматизацию для клиента - **Соло-основателям** \- не тратить время на рутину - **Маленьким командам** \- прототипировать идеи на лету - **Новичкам в n8n** \- учиться на готовых примерах ## Плюсы и минусы **Что нравится:** - Экономит кучу времени на старте - Убирает "страх пустого холста" - Генерирует воркфлоу с правильной структурой - Помогает понять, как строить автоматизации **Что стоит учитывать:** - Сервис новый, комьюнити пока небольшое - Бесплатная версия ограничена - Сгенерированные воркфлоу всё равно нужно проверять и адаптировать под свои ключи/настройки ## А что насчёт встроенного AI Builder в n8n? Кстати, в самом n8n тоже появился AI Workflow Builder. Он работает похожим образом - описываешь задачу, получаешь воркфлоу. Плюс у n8n есть встроенные ноды для работы с ChatGPT, Claude, Gemini и другими LLM. Если ты уже используешь n8n, попробуй оба варианта и сравни. TaskWand заточен именно под генерацию воркфлоу и делает это хорошо. Встроенный билдер удобен тем, что работает прямо в интерфейсе n8n. ## Итого TaskWand - это отличный инструмент для тех, кто работает с n8n и хочет тратить меньше времени на сборку воркфлоу. Описал задачу текстом → получил готовый workflow → импортировал → работает. Это не замена пониманию того, как работает n8n. Но это крутой способ ускориться и не изобретать велосипед каждый раз. **Попробовать:** [taskwand.io](https://taskwand.io/?ref=matveev.tech) 📚 Источники - [TaskWand - официальный сайт](https://taskwand.io/?ref=matveev.tech) - [AI Workflow Builder - документация n8n](https://docs.n8n.io/advanced-ai/ai-workflow-builder/?ref=matveev.tech) - [n8n AI Agents 2025 - обзор на Latenode](https://latenode.com/blog/low-code-no-code-platforms/n8n-setup-workflows-self-hosting-templates/n8n-ai-agents-2025-complete-capabilities-review-implementation-reality-check?ref=matveev.tech) ### MuteKey - мьют микрофона на Mac одной клавишей URL: https://matveev.tech/mutekey-upravlieniie-mikrofonom-na-mac-iz-liubogho-miesta/ Last updated: 2025-12-23T23:14:49.000Z > **TL;DR:** MuteKey - бесплатная утилита для Mac, которая позволяет мьютить и анмьютить микрофон глобальной горячей клавишей из любого приложения. Есть Push-to-Talk режим, индикатор в менюбаре и поддержка нескольких микрофонов. Привет! Знакомая ситуация: сидишь на звонке в Zoom или Google Meet, параллельно что-то делаешь в другом окне, и тут тебя спрашивают, а ты замьючен. Переключаешься обратно в окно звонка, ищешь кнопку микрофона, жмёшь... Или наоборот - думаешь, что замьючен, а на самом деле нет. И коллеги слышат, как ты ругаешься на код или разговариваешь с котом. ## Зачем нужен глобальный мьют Проблема в том, что у каждого приложения свои горячие клавиши для микрофона: - **Zoom:** ⌘⇧A или пробел (только в фокусе) - **Google Meet:** ⌘D (только в фокусе) - **Slack:** M (только в фокусе) - **Teams:** ⌘⇧M (только в фокусе) Заметил паттерн? «Только в фокусе». Если ты в другом окне - не работает. А переключаться каждый раз - это боль. ## MuteKey - решение [MuteKey](https://apps.apple.com/ru/app/mutekey/id1509590766?mt=12&ref=matveev.tech) \- это маленькая утилита, которая добавляет глобальную горячую клавишу для управления микрофоном. Работает из любого приложения, в любой момент. ### Как это работает 1. Устанавливаешь приложение из App Store 2. Выбираешь микрофон, который хочешь контролировать 3. Назначаешь горячую клавишу 4. Готово - теперь мьют работает отовсюду ### Что умеет - **Глобальная горячая клавиша** \- работает из любого приложения - **Push-to-Talk** \- зажал клавишу = микрофон включён, отпустил = мьют - **Индикатор в менюбаре** \- видно, замьючен ты или нет - **HUD-уведомление** \- всплывает при переключении - **Выбор устройства** \- можно указать конкретный микрофон - **Мьют всех устройств** \- одной клавишей выключить все микрофоны ### Для кого это MuteKey полезен всем, кто часто на созвонах: - **Удалёнщикам** \- созвоны каждый день, мьют нужен постоянно - **Тем, кто работает из дома** \- дети, собаки, курьеры - **Стримерам и подкастерам** \- быстрый контроль над микрофоном - **Всем, кто параллельно делает что-то во время звонка** \- а это почти все ## Плюсы и минусы **Что нравится:** - Бесплатно (есть добровольные чаевые) - Работает мгновенно, без задержки - Push-to-Talk режим - удобно для шумных окружений - Минималистичный - ничего лишнего **Что стоит учитывать:** - Иконка в менюбаре неинтуитивная (серая = микрофон включён) - некоторых это путает - Если отключить AirPods во время звонка, приложение может крашнуться (исправлено в последних версиях) ## А что насчёт альтернатив? Есть несколько похожих приложений: | Приложение | Цена | Особенности | | -------------------------------------------------------- | --------- | -------------------------------------- | | **MuteKey** | Бесплатно | Push-to-Talk, выбор устройства | | **[Mic Drop](https://getmicdrop.com/?ref=matveev.tech)** | $4.99 | Красивый интерфейс, рекомендован Apple | | **Shush** | $4.99 | Популярная платная альтернатива | | **MicMüter** | Бесплатно | Минималистичный kill switch | | **Mutify** | $2.99 | Работает с Touch Bar | MuteKey выигрывает тем, что бесплатный и при этом имеет все нужные функции. Mic Drop красивее, но стоит денег. ## Мой сетап Я использую MuteKey в связке с Google Meet. Назначил ⌥M как горячую клавишу - теперь могу мьютиться из любого окна. В шумные моменты включаю Push-to-Talk - зажал клавишу, сказал, отпустил. ## Итого MuteKey - это одна из тех утилит, про которые думаешь: "Почему это не встроено в macOS?". Маленькая, бесплатная, делает одну вещь и делает её хорошо. Если ты часто на созвонах и устал переключаться между окнами ради кнопки мьюта - попробуй. Занимает пару минут на настройку и экономит нервы каждый день. **Скачать:** [App Store](https://apps.apple.com/ru/app/mutekey/id1509590766?mt=12&ref=matveev.tech) 📚 Источники - [MuteKey в App Store](https://apps.apple.com/ru/app/mutekey/id1509590766?mt=12&ref=matveev.tech) - [Mic Drop — альтернатива](https://getmicdrop.com/?ref=matveev.tech) ### Spokenly - транскрибация голоса в текст на Mac URL: https://matveev.tech/spokenly-transkribatsiia-gholosa-v-tiekst-na-mac/ Last updated: 2026-02-25T12:25:23.000Z > **TL;DR:** Spokenly - это приложение для диктовки на Mac, которое превращает голос в текст через Whisper, GPT или Soniox. Работает в любом приложении, поддерживает 100+ языков и может работать полностью локально. Подписка не нужна - достаточно своего API-ключа. Привет! Знаешь это чувство, когда мысль в голове есть, а печатать её лень? Или когда нужно быстро набросать текст, но руки заняты? Я долго искал нормальное решение для голосового ввода на Mac и, кажется, нашёл. ## Зачем вообще диктовка Встроенная диктовка в macOS работает, но... так себе. Ошибки, зависания, ограниченный словарь. Для быстрой заметки сойдёт, для серьёзной работы - нет. А ещё есть момент с приватностью: всё, что ты говоришь, улетает на серверы Apple. Если диктуешь что-то рабочее или личное - не самый приятный факт. ## Spokenly - что это [Spokenly](https://spokenly.app/?ref=matveev.tech) \- это приложение для Mac, которое превращает голос в текст. Звучит просто, но дьявол в деталях: - Работает в **любом приложении** \- браузер, мессенджер, IDE, заметки - Поддерживает **100+ языков** с автоопределением - Может работать **полностью локально** \- голос не покидает твой Mac - Умеет не только транскрибировать, но и **обрабатывать текст** через AI ### Как это работает 1. Нажимаешь горячую клавишу (настраиваешь сам) 2. Говоришь 3. Текст появляется там, где стоит курсор Всё. Никаких окон, переключений, копипаста. Просто говоришь - и текст печатается. ### Какие модели поддерживает Тут самое интересное. Spokenly даёт выбор: **Локальные модели (бесплатно, без лимитов):** - Whisper - классика от OpenAI - Parakeet от NVIDIA - компактная и быстрая - Встроенный движок Apple **Облачные модели (нужен API-ключ):** - GPT-4o-transcribe - то, чем пользуюсь я - GPT-4o-mini-transcribe - дешевле, но тоже хорошо В моём случае мне нечего скрывать от OpenAI, поэтому использую облачную модель - она точнее и быстрее. Но если важна приватность, локальные модели работают отлично. ## Для кого это Spokenly полезен: - **Писателям и блогерам** \- набросать черновик голосом в 4 раза быстрее - **Разработчикам** \- диктовать комментарии, документацию, сообщения - **Тем, кто много переписывается -** Slack, Telegram, почта - **Людям с RSI** \- если руки устают от клавиатуры ## Плюсы и минусы **Что нравится:** - Работает везде, где есть текстовое поле - Локальные модели реально бесплатные и без лимитов - Можно подключить свой API-ключ и не платить подписку - Приватность - голос может не покидать Mac - Умеет переводить и форматировать текст на лету **Что стоит учитывать:** - Только Mac (Windows и Linux нет) - Для облачных моделей нужен API-ключ OpenAI - Интерфейс минималистичный - кому-то может не хватить настроек ## А что насчёт альтернатив? Есть несколько вариантов: - **Встроенная диктовка macOS** \- бесплатно, но качество хуже - **Whisper.cpp** \- для тех, кто любит терминал - **MacWhisper** \- похожее приложение, но платное Spokenly выигрывает гибкостью: хочешь локально - пожалуйста, хочешь через облако - тоже можно. И не нужно платить подписку, если есть свой ключ. ## Итого Spokenly - это то, как должна работать диктовка на Mac. Быстро, точно, в любом приложении. Локальные модели бесплатны, облачные работают через твой API-ключ за копейки. Если ты много печатаешь и хочешь иногда давать рукам отдохнуть - попробуй. Я пользуюсь уже пару месяцев и доволен. **Скачать:** [spokenly.app](https://spokenly.app/?ref=matveev.tech) 📚 Источники - [Spokenly - официальный сайт](https://spokenly.app/?ref=matveev.tech) - [Spokenly в App Store](https://apps.apple.com/us/app/spokenly-voice-to-text-ai/id6740315592?ref=matveev.tech) ### ElevenLabs теперь владеет твоим голосом навсегда URL: https://matveev.tech/elevenlabs-tos-golos-navsegda/ Last updated: 2026-02-25T12:17:10.000Z > **TL;DR:** В феврале 2025 ElevenLabs обновили условия использования. Теперь ты даёшь им «бессрочную, безотзывную» лицензию на голосовые записи. Даже после удаления аккаунта они могут использовать производные модели. Некоторые партнёры уже разорвали сотрудничество. Если ты пользуешься ElevenLabs для озвучки или клонирования голоса — есть важные новости. Компания обновила Terms of Service, и там появились интересные формулировки. ## Что изменилось 28 февраля 2025 года ElevenLabs выкатили новую версию условий. Главное изменение — лицензия, которую ты предоставляешь на свой контент. Теперь она: - **Бессрочная** (perpetual) — действует вечно - **Безотзывная** (irrevocable) — нельзя отозвать - **Безвозмездная** (royalty-free) — никаких выплат - **Всемирная** (worldwide) — везде в мире - **Сублицензируемая** — могут передавать третьим лицам Вообще, такие формулировки — норма для многих сервисов. Но есть нюанс. ## В чём подвох ElevenLabs обещают удалить сырые записи через 3 года неактивности аккаунта. Звучит нормально, да? Но вот штука — они сохраняют право использовать *производные модели*. То есть сам голос удалят, а модель, обученную на твоём голосе, могут использовать дальше. Удалил аккаунт? Запросил удаление данных? Технически записи удалят, но всё, что на них обучили — остаётся у ElevenLabs навсегда. ## Реакция индустрии Kukarella — сервис синтеза речи, который использовал технологию ElevenLabs — полностью разорвал партнёрство. Их позиция: новые условия создают неприемлемые риски для пользователей. Интересно, что обновление условий произошло буквально за несколько дней до анонса партнёрства ElevenLabs с Google Cloud. Совпадение? Возможно. Но голосовые данные теперь могут обрабатываться через глобальную инфраструктуру Google. ## Что с бесплатным планом Ещё одно изменение — бесплатный план теперь явно ограничен некоммерческим использованием. Раньше это было размыто, теперь чётко прописано. Хуже того: если ты создал голос на платном плане, а потом перешёл на бесплатный — коммерческие права на этот голос теряются. ## Можно ли отказаться Да. В настройках аккаунта есть раздел «Data use» в «Terms and Privacy». Там можно запретить использование твоего контента для обучения моделей. Но это не отменяет бессрочную лицензию на уже загруженные данные. Оно работает только для будущих загрузок. ## Что делать Думаю, паниковать не стоит. ElevenLabs прямо пишут, что не будут коммерциализировать твой голос отдельно без разрешения. Лицензия им нужна для работы самого сервиса. Но если тебя беспокоит приватность голосовых данных: 1. Зайди в настройки и отключи использование для обучения 2. Посмотри на альтернативы с открытым исходным кодом — тот же CosyVoice от Alibaba 3. Для критичных проектов — используй локальные решения В целом, ElevenLabs делает крутой продукт. Но условия использования — это то, что стоит читать. Особенно когда речь о биометрических данных вроде голоса. ## Что ещё почитать - [CosyVoice 3 — голосовой ИИ от Alibaba](https://matveev.tech/cosyvoice-3-gholosovoi-ii-ot-alibaba-na-million-chasov-riechi/) — открытая альтернатива для клонирования голоса - [Память AI-агентов — почему хранить всё подряд не работает](https://matveev.tech/pamyat-ai-agentov/) — как компании обращаются с пользовательскими данными