GLM-5.3 от Z.ai: обзор модели
Z.ai выпустила GLM-5.3 — лучшую открытую модель для кодинга. Разбираю бенчмарки, находки по безопасности и цены GLM Coding Plan.
TL;DR: Z.ai выпустила GLM-5.3 — модель для кодинга. База та же, что у GLM-5.2, весь прирост дал пост-тренинг. Побочный эффект оказался громче основного: модель нашла 2436 реальных уязвимостей в 269 open-source проектах, а старейшая из них жила в коде с 1981 года. Веса придержали до конца августа - компания сама притормозила релиз из-за того, насколько хорошо модель научилась ломать чужой код.
14 августа Z.ai (бывшая Zhipu AI) показала GLM-5.3. Формально это апдейт кодинг-модели: SOTA среди открытых на Terminal-Bench 3.0 и Agents' Last Exam, +50% на внутреннем бенчмарке компании. Но главная история в анонсе — не про кодинг.
Про предыдущие поколения я писал: GLM-4.7 была крепкой моделью для терминала, GLM-4.6V — мультимодалкой с function calling. GLM-5.3 из другой лиги, и разбирать её интереснее с конца, начиная с раздела про безопасность.
Что такое GLM-5.3 и что в ней нового
GLM-5.3 использует ту же базовую модель, что и GLM-5.2. Никакого нового претрейна, никакого пересчёта весов с нуля. Z.ai честно пишет: «scaling post-training is all we did». Весь прирост получен за счёт масштабирования обучения с подкреплением на длинных задачах.
Под этим лежит стек, который компания собрала ещё для 5.2: IndexShare для длинного контекста, SAO для RL на долгих задачах и открытый фреймворк slime для асинхронного обучения. За месяц команда добавила окружений, разнообразила задачи и залила туда больше компьюта. Системные оптимизации подняли пропускную способность RL-обучения на длинных кодинг-задачах больше чем в 2,3 раза.
Отдельно интересен подход к самим окружениям. Задачи для обучения теперь синтезируются конвейером: агенты-исследователи собирают паттерны из реальной работы и превращают их в запускаемые окружения с многошаговыми зависимостями, а агент-судья проверяет, что задача вообще решаема. Верификатор пишется без доступа к эталонному решению, иначе модель научится обходить награду вместо того, чтобы решать задачу.
Некоторые окружения — это несколько дней работы опытного инженера. Например, диагностика узких мест в ML-инфраструктуре с доступом к кластеру, хранилищу, внутренней документации и результатам экспериментов, где надо реально ускорить обучение и не сломать корректность.
Кибербезопасность: 2436 уязвимостей в живом коде
Вот ради этого раздела и стоит читать анонс. Z.ai добавила в обучающую смесь данные и окружения по поиску уязвимостей, тут ничего удивительного. Удивило команду другое: как быстро способность продолжала расти дальше. Модель перестала находить изолированные баги и начала выстраивать цепочки эксплуатации целиком.

Цифры по трём бенчмаркам:
| Бенчмарк | GLM-5.3 | GLM-5.2 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| CyberGym | 84,5 | 77,2 | 78,1 | 83,8 | 83,6 |
| ExploitBench | 54,4 | 24,4 | 40,0 | 78,0 | 76,5 |
| ExploitGym 2ч / 6ч | 105 / 130 | 29 / 39 | 80 / 120 | 181 / 247 | 216 / 293 |
На CyberGym, где модель ищет и подтверждает уязвимость по исходникам, GLM-5.3 показывает лучший результат из всех — 84,5% против 83,8% у Fable 5 и 83,6% у GPT-5.6 Sol. На ExploitBench, где нужно рассуждать глубже, результат удвоился относительно 5.2, но до закрытых моделей всё ещё далеко: 54,4% против 78%. На ExploitGym разрыв ещё заметнее.
Закономерность Z.ai описывает так: чем выше по цепочке эксплуатации стоит бенчмарк, тем больше прирост относительно GLM-5.2 и тем шире оставшийся разрыв с закрытым фронтиром. Способности растут быстрее всего ровно там, где отставание сильнее.
Начиная с GLM-5.2 Z.ai работает с несколькими security-командами в Китае и гоняет модели по реальным кодовым базам. После экспертной проверки и дедупликации получилось 2436 уязвимостей в 269 проектах, из них 1097 — средней и высокой критичности.
| Критичность | Количество |
|---|---|
| Critical | 107 |
| High | 990 |
| Medium | 1286 |
| Low | 53 |
Находки разбросаны по системным ядрам, операционкам, браузерным движкам, инфраструктурному опенсорсу, веб-приложениям и сетевым протоколам. Многие лежали незамеченными годами. Старейшая уязвимость появилась в коде в 1981 году, а средний возраст дыры до момента обнаружения — 26,6 лет.
Публично раскрыто пока 53 находки, остальные 2383 под эмбарго. Z.ai завела для этого публичный реестр раскрытия, где видно проект, критичность, CVE и сколько лет уязвимость прожила в коде. Названия проектов там серьёзные: по данным Axios, среди находок есть ядро Linux, продукты VMware и проекты фонда Apache.
Самая громкая находка случилась уже после анонса. Модель нашла, как пишет VentureBeat со ссылкой на девелопер-адвоката Z.ai, «потенциально серьёзную уязвимость» в Cursor — том самом редакторе, которым половина индустрии пишет код с помощью ИИ. Уязвимость передали приватно, команда Cursor работает над патчем, детали обещают раскрыть после того, как пользователи будут защищены.
Заодно Z.ai запустила OpenVuln — мейнтейнер открытого проекта может прийти и попросить прогнать GLM по своему репозиторию. Если у тебя есть свой опенсорс, это самый дешёвый способ пощупать модель на реальной задаче.
Мне кажется, это самая важная часть релиза, и не только для безопасников. Модель, которую можно будет запустить локально после открытия весов, находит в опенсорсе то, что не нашли за сорок лет. Одна и та же способность одинаково хорошо работает и на защиту, и на атаку. Скоро она будет лежать в свободном доступе, и я честно не знаю, как к этому относиться: аудит своего кода станет доступнее всем, но и вторая сторона получит тот же инструмент.
Похоже, в Z.ai думают примерно о том же. Пока веса не открыты, доступ к самым чувствительным возможностям дают по отдельной программе — только отобранным партнёрам по безопасности и в контролируемых окружениях. Компания при этом честно признаёт: после открытия весов контролировать, кто и как дообучит модель, она уже не сможет. Свою позицию Z.ai формулирует примерно так: если мир открытый, то открытой должна быть не только поверхность атаки, но и щит. Красиво, но проверить это утверждение можно будет только постфактум.
Американские лаборатории в это же время тормозят релизы из-за киберрисков — OpenAI отложила свою Astra ровно по этой причине. Китайские команды идут в обратную сторону и целенаправленно тренируют открытые модели на кибербез. А неделей раньше исследователи зафиксировали автоматизированную атаку на правительственные системы Тайваня, где нападающей стороной работали открытые ИИ-агенты. В администрации Трампа на этом фоне обсуждают, как вообще регулировать открытые модели. На таком фоне две недели задержки выглядят вполне осмысленной паузой, а не жестом ради приличия.
Почему безопасники пересаживаются на GLM
У этой истории есть сторона, о которой в анонсе ни слова, а на практике она решает. Западные флагманы регулярно отказываются работать с задачами по безопасности: guardrails срабатывают на слова «эксплойт», «уязвимость», «red team», и модель вежливо уходит от ответа. Для пентестера или разработчика, который чинит собственный баг, это стена на ровном месте.
Показательный случай был в июле: Hugging Face расследовала утечку данных и в итоге взяла для анализа GLM-5.2 — американские фронтир-модели помогать отказались. Ситуация, где для разбора инцидента с моделями OpenAI приходится звать китайскую модель, говорит о состоянии индустрии больше, чем любая таблица бенчмарков.
В обсуждении на Hacker News (1158 голосов и почти 600 комментариев за пару дней) та же тема всплывает первым же комментарием. Разработчик рассказывает, как купил Lite за 18 долларов, прогнал полноценный red team сценарий — 0-day в WP-плагинах, RCE, адаптация эксплойта под ядро, причём вторым GLM-агентом в роли защитника — и сразу ушёл на тариф за 80. Другой участник с корпоративным бюджетом в 500 долларов пишет, что переезжает с подписки Anthropic, потому что Fable 5 и Opus 5 отказывались чинить security-баги и собирать инструменты мониторинга.
Насколько это здоровая ситуация — вопрос отдельный. Но если твоя работа связана с безопасностью, аргумент «модель просто не отказывает» перевешивает пару пунктов в бенчмарке.
Что GLM-5.3 показывает в кодинге?
Основная заявка релиза — лучшая открытая модель для кодинга. На внутреннем Z.ai Code Bench прирост к 5.2 составил 50%.
| Бенчмарк | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,2 | 81,0 | 88,3 | 85,0 | 88,0 | 88,8 |
| Terminal-Bench 3.0 | 28,3 | 4,6 | 17,4 | 21,1 | 33,7 | 34,6 |
| DeepSWE v1.1 | 66,9 | 46,2 | 67,5 | 58,0 | 69,7 | 72,7 |
| FrontierSWE | 78,1 | 67,5 | — | 66,5 | 88,2 | — |
| SWE-Marathon v1.1 | 42,5 | 19,4 | 48,1 | 48,8 | 33,1 | 42,5 |
| Agents' Last Exam | 28,5 | 23,8 | 27,6 | 25,7 | 23,8 | 28,6 |
Самый показательный скачок — Terminal-Bench 3.0: с 4,6 до 28,3. Свежий бенчмарк, на котором ещё недавно все модели буксовали, теперь берётся почти на треть. На FrontierSWE GLM-5.3 набирает 78,1 против 66,5 у Opus 4.8. То есть открытая модель обходит флагман Anthropic прошлого поколения, хотя Fable 5 всё равно впереди с 88,2.
Есть и провалы. На SWE-Marathon Kimi K3 и Opus 4.8 обходят GLM-5.3, на DeepSWE отставание от закрытых моделей сохраняется. Но для модели, веса которой скоро можно будет скачать, картина всё равно нетипичная.
Токен-эффективность — почему это важнее бенчмарков
Тут цифры, на которые я смотрю в первую очередь. Задач GLM-5.3 решает больше, и при этом расходует меньше токенов.

На максимальном уровне рассуждений модель берёт 34,5% задач Z.ai Code Bench, расходуя около 75 тысяч выходных токенов на задачу. GLM-5.2 брала 23,4% при 96 тысячах. То есть плюс одиннадцать пунктов и минус пятая часть расхода.
Сравнение с закрытыми ещё нагляднее: на уровне high GLM-5.3 даёт 31,4% при 50 тысячах токенов, а Claude Opus 4.8 — 29,5% при 120 тысячах. Результат чуть выше, токенов в 2,4 раза меньше. Fable 5 остаётся впереди по качеству (39,5% на максимуме), но и по счёту тоже.
Для агентного кодинга это метрика номер один. Когда агент крутится в цикле часами, стоимость решённой задачи важнее позиции в таблице.
Как подключить GLM-5.3 к Claude Code
Отдельный API-ключ для GLM-5.3 не нужен. Модель уже раскатана всем подписчикам GLM Coding Plan и работает в ZCode, Claude Code, OpenCode, Cline и ещё паре десятков агентов.
- Оформи подписку на z.ai/subscribe. Минимальный тариф Lite стоит 18 долларов в месяц.
- Установи Claude Code, если ещё нет:
npm install -g @anthropic-ai/claude-code(нужен Node.js 18+). - Запусти официальный конфигуратор:
npx @z_ai/coding-helper. Он пропишет нужные переменные окружения в конфиг Claude Code и подставит твой ключ. - Запусти
claudeв папке проекта. На вопрос про использование API-ключа ответь «Yes».
Если правил ~/.claude/settings.json руками и настройки не подхватились, закрой все окна Claude Code и запусти заново. В упрямом случае удали файл и дай конфигуратору создать новый.
Одна вещь ломает обратную совместимость: в GLM-5.3 больше нельзя отключить рассуждения. Параметр thinking.type: "disabled" не поддерживается, вместо него появились три уровня усилий.
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
Уровни — low, high и max, по умолчанию max. Для кодинга Z.ai рекомендует максимальный. Если в твоём коде сейчас стоит disabled, поменяй на enabled с reasoning_effort: low до смены идентификатора модели, иначе запрос упадёт с ошибкой.
Сколько стоит GLM Coding Plan
Три тарифа, цена зависит от периода оплаты. При годовой подписке скидка 30%.
| Тариф | В месяц | При годовой оплате | Кредиты за 5 часов | Кредиты в неделю |
|---|---|---|---|---|
| Lite | $18 | $12,6 | 2 000 | 10 000 |
| Pro | $80 | $56 | 12 000 | 60 000 |
| Max | $168 | $117,6 | 28 000 | 140 000 |
Считается всё в кредитах: вход, кешированный вход и выход учитываются с разными коэффициентами. У GLM-5.3 это 6,9 за вход, 1,7 за кеш и 24 за выход на 10 тысяч токенов. В токенах Z.ai оценивает недельный лимит так: Lite — 43–87 миллионов, Pro — 263–526 миллионов, Max — 613–1226 миллионов.
Разброс объясняется скидкой на непиковые часы: вне интервала 14:00–18:00 по пекинскому времени в будни всё стоит вдвое дешевле. Для нас это удобно, рабочий день в Москве почти целиком попадает в льготные часы.
У ZCode, собственной агентной IDE от Z.ai, есть свои плюшки: кеш попадает больше чем в 98% случаев (это примерно +30% полезных токенов), а до 31 августа действует полуторакратный буст квоты. Плюс режим Goal, который планирует, пишет, тестирует и проверяет до достижения цели, и управление длинными задачами с телефона через WeChat или Feishu.
Когда откроют веса GLM-5.3
Обещанные две недели отсчитываются от 14 августа, то есть веса ждём в районе 28-го. До этого момента модель живёт только внутри GLM Coding Plan и ZCode, публичного API нет.
Что именно выложат — вопрос открытый. Задержку Z.ai объясняет «safety evaluation and hardening», и в обсуждениях сразу появилось разумное подозрение: кибербез-способности к моменту релиза могут подрезать. Логика простая — если компания две недели закаляет модель, то самая опасная её часть и есть предмет закалки. Проверить это можно будет только замерами после выкладки.
С лицензией тоже неясно. У GLM-5.2 была MIT, что для модели такого размера почти неприлично щедро, но автоматически переносить это на 5.3 я бы не стал: у релиза совсем другой профиль рисков.
И трезвая нота про «запущу локально». База — примерно 750 миллиардов параметров, так что домашней видеокартой тут не обойтись, нужна серверная сборка с сотнями гигабайт памяти и ценником как у неплохого автомобиля. Локальный запуск реалистичен для компаний и хостеров, а не для отдельного разработчика. Большинству всё равно останется API или чужое облако.
Вердикт
Больше всего в релизе подкупает не таблица с бенчмарками, а публичный реестр уязвимостей. Компания могла ограничиться строчкой «модель хорошо ищет баги», а выложила номера CVE, критичность и сроки жизни каждой находки. Проверяемо. К этому прибавь токен-эффективность, которая делает GLM-5.3 дешевле Opus 4.8 при сопоставимом результате, и работу в привычном Claude Code без смены инструментов.
Претензии тоже есть. В эксплуатации уязвимостей до Fable 5 ещё далеко: 54,4 против 78 на ExploitBench, это не «почти догнали». Кредитная система вместо цены за миллион токенов считается неудобно, придётся смотреть на расход в дашборде. Главное же — все цифры в этом обзоре опубликовала сама Z.ai, включая результаты конкурентов, которые она выбирала и замеряла на свой вкус. Независимого аудита пока нет ни одного: пока веса закрыты, проверить модель снаружи попросту нечем. Часть бенчмарков внутренние, а Z.ai Code Bench вообще приватный — аргумент про защиту от протечки тестов разумный, но результат от этого проверяемым не становится. Читай таблицы как заявку производителя, а не как независимый замер.
Если платишь за подписку Anthropic ради агентного кодинга и упираешься в лимиты, GLM-5.3 стоит попробовать прямо сейчас. Восемнадцать долларов за Lite, тот же Claude Code, заметно меньший расход токенов. На больших рефакторингах Fable 5 всё равно сильнее, но соотношение цены и результата у Z.ai сейчас лучшее на рынке. Безопасникам я бы советовал дождаться открытия весов: модель, которая нашла две с половиной тысячи дыр в чужом коде, пригодится для аудита своего, и запустить её можно будет локально, не отправляя исходники в чужое облако.
Кому точно мимо: тем, кто работает с чувствительными данными и не готов гонять их через китайские серверы. Тут вопрос не в качестве модели, а в юрисдикции и политике хранения.
Что ещё почитать
- GLM-4.7 — китайская модель для кодинга, которая удивляет — предыдущее поколение линейки, с которого началась поддержка Claude Code
- GLM-4.6V — опенсорс мультимодалка с function calling — визуальная модель Z.ai, которая сейчас работает как Vision MCP внутри Coding Plan
- Kimi K3: открытая модель на 2,8 трлн параметров — главный конкурент GLM среди открытых китайских моделей, он же в таблицах выше
- GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI — закрытый фронтир, с которым GLM-5.3 сравнивают по кибербезу