GLM-5.3 от Z.ai: обзор модели

Z.ai выпустила GLM-5.3 — лучшую открытую модель для кодинга. Разбираю бенчмарки, находки по безопасности и цены GLM Coding Plan.

GLM-5.3 от Z.ai: обзор модели
TL;DR: Z.ai выпустила GLM-5.3 — модель для кодинга. База та же, что у GLM-5.2, весь прирост дал пост-тренинг. Побочный эффект оказался громче основного: модель нашла 2436 реальных уязвимостей в 269 open-source проектах, а старейшая из них жила в коде с 1981 года. Веса придержали до конца августа - компания сама притормозила релиз из-за того, насколько хорошо модель научилась ломать чужой код.

14 августа Z.ai (бывшая Zhipu AI) показала GLM-5.3. Формально это апдейт кодинг-модели: SOTA среди открытых на Terminal-Bench 3.0 и Agents' Last Exam, +50% на внутреннем бенчмарке компании. Но главная история в анонсе — не про кодинг.

Про предыдущие поколения я писал: GLM-4.7 была крепкой моделью для терминала, GLM-4.6V — мультимодалкой с function calling. GLM-5.3 из другой лиги, и разбирать её интереснее с конца, начиная с раздела про безопасность.

Что такое GLM-5.3 и что в ней нового

GLM-5.3 использует ту же базовую модель, что и GLM-5.2. Никакого нового претрейна, никакого пересчёта весов с нуля. Z.ai честно пишет: «scaling post-training is all we did». Весь прирост получен за счёт масштабирования обучения с подкреплением на длинных задачах.

Под этим лежит стек, который компания собрала ещё для 5.2: IndexShare для длинного контекста, SAO для RL на долгих задачах и открытый фреймворк slime для асинхронного обучения. За месяц команда добавила окружений, разнообразила задачи и залила туда больше компьюта. Системные оптимизации подняли пропускную способность RL-обучения на длинных кодинг-задачах больше чем в 2,3 раза.

Отдельно интересен подход к самим окружениям. Задачи для обучения теперь синтезируются конвейером: агенты-исследователи собирают паттерны из реальной работы и превращают их в запускаемые окружения с многошаговыми зависимостями, а агент-судья проверяет, что задача вообще решаема. Верификатор пишется без доступа к эталонному решению, иначе модель научится обходить награду вместо того, чтобы решать задачу.

Некоторые окружения — это несколько дней работы опытного инженера. Например, диагностика узких мест в ML-инфраструктуре с доступом к кластеру, хранилищу, внутренней документации и результатам экспериментов, где надо реально ускорить обучение и не сломать корректность.

Кибербезопасность: 2436 уязвимостей в живом коде

Вот ради этого раздела и стоит читать анонс. Z.ai добавила в обучающую смесь данные и окружения по поиску уязвимостей, тут ничего удивительного. Удивило команду другое: как быстро способность продолжала расти дальше. Модель перестала находить изолированные баги и начала выстраивать цепочки эксплуатации целиком.

Результаты GLM-5.3 на кибербез-бенчмарках CyberGym, ExploitBench и ExploitGym в сравнении с GLM-5.2, Kimi K3 и закрытыми моделями

Цифры по трём бенчмаркам:

Бенчмарк GLM-5.3 GLM-5.2 Opus 4.8 Fable 5 GPT-5.6 Sol
CyberGym 84,5 77,2 78,1 83,8 83,6
ExploitBench 54,4 24,4 40,0 78,0 76,5
ExploitGym 2ч / 6ч 105 / 130 29 / 39 80 / 120 181 / 247 216 / 293

На CyberGym, где модель ищет и подтверждает уязвимость по исходникам, GLM-5.3 показывает лучший результат из всех — 84,5% против 83,8% у Fable 5 и 83,6% у GPT-5.6 Sol. На ExploitBench, где нужно рассуждать глубже, результат удвоился относительно 5.2, но до закрытых моделей всё ещё далеко: 54,4% против 78%. На ExploitGym разрыв ещё заметнее.

Закономерность Z.ai описывает так: чем выше по цепочке эксплуатации стоит бенчмарк, тем больше прирост относительно GLM-5.2 и тем шире оставшийся разрыв с закрытым фронтиром. Способности растут быстрее всего ровно там, где отставание сильнее.

Начиная с GLM-5.2 Z.ai работает с несколькими security-командами в Китае и гоняет модели по реальным кодовым базам. После экспертной проверки и дедупликации получилось 2436 уязвимостей в 269 проектах, из них 1097 — средней и высокой критичности.

Критичность Количество
Critical 107
High 990
Medium 1286
Low 53

Находки разбросаны по системным ядрам, операционкам, браузерным движкам, инфраструктурному опенсорсу, веб-приложениям и сетевым протоколам. Многие лежали незамеченными годами. Старейшая уязвимость появилась в коде в 1981 году, а средний возраст дыры до момента обнаружения — 26,6 лет.

Публично раскрыто пока 53 находки, остальные 2383 под эмбарго. Z.ai завела для этого публичный реестр раскрытия, где видно проект, критичность, CVE и сколько лет уязвимость прожила в коде. Названия проектов там серьёзные: по данным Axios, среди находок есть ядро Linux, продукты VMware и проекты фонда Apache.

Самая громкая находка случилась уже после анонса. Модель нашла, как пишет VentureBeat со ссылкой на девелопер-адвоката Z.ai, «потенциально серьёзную уязвимость» в Cursor — том самом редакторе, которым половина индустрии пишет код с помощью ИИ. Уязвимость передали приватно, команда Cursor работает над патчем, детали обещают раскрыть после того, как пользователи будут защищены.

Заодно Z.ai запустила OpenVuln — мейнтейнер открытого проекта может прийти и попросить прогнать GLM по своему репозиторию. Если у тебя есть свой опенсорс, это самый дешёвый способ пощупать модель на реальной задаче.

Мне кажется, это самая важная часть релиза, и не только для безопасников. Модель, которую можно будет запустить локально после открытия весов, находит в опенсорсе то, что не нашли за сорок лет. Одна и та же способность одинаково хорошо работает и на защиту, и на атаку. Скоро она будет лежать в свободном доступе, и я честно не знаю, как к этому относиться: аудит своего кода станет доступнее всем, но и вторая сторона получит тот же инструмент.

Похоже, в Z.ai думают примерно о том же. Пока веса не открыты, доступ к самым чувствительным возможностям дают по отдельной программе — только отобранным партнёрам по безопасности и в контролируемых окружениях. Компания при этом честно признаёт: после открытия весов контролировать, кто и как дообучит модель, она уже не сможет. Свою позицию Z.ai формулирует примерно так: если мир открытый, то открытой должна быть не только поверхность атаки, но и щит. Красиво, но проверить это утверждение можно будет только постфактум.

Американские лаборатории в это же время тормозят релизы из-за киберрисков — OpenAI отложила свою Astra ровно по этой причине. Китайские команды идут в обратную сторону и целенаправленно тренируют открытые модели на кибербез. А неделей раньше исследователи зафиксировали автоматизированную атаку на правительственные системы Тайваня, где нападающей стороной работали открытые ИИ-агенты. В администрации Трампа на этом фоне обсуждают, как вообще регулировать открытые модели. На таком фоне две недели задержки выглядят вполне осмысленной паузой, а не жестом ради приличия.

🔍
Разбираю такие релизы в день выхода — подписывайся в телеге.

Почему безопасники пересаживаются на GLM

У этой истории есть сторона, о которой в анонсе ни слова, а на практике она решает. Западные флагманы регулярно отказываются работать с задачами по безопасности: guardrails срабатывают на слова «эксплойт», «уязвимость», «red team», и модель вежливо уходит от ответа. Для пентестера или разработчика, который чинит собственный баг, это стена на ровном месте.

Показательный случай был в июле: Hugging Face расследовала утечку данных и в итоге взяла для анализа GLM-5.2 — американские фронтир-модели помогать отказались. Ситуация, где для разбора инцидента с моделями OpenAI приходится звать китайскую модель, говорит о состоянии индустрии больше, чем любая таблица бенчмарков.

В обсуждении на Hacker News (1158 голосов и почти 600 комментариев за пару дней) та же тема всплывает первым же комментарием. Разработчик рассказывает, как купил Lite за 18 долларов, прогнал полноценный red team сценарий — 0-day в WP-плагинах, RCE, адаптация эксплойта под ядро, причём вторым GLM-агентом в роли защитника — и сразу ушёл на тариф за 80. Другой участник с корпоративным бюджетом в 500 долларов пишет, что переезжает с подписки Anthropic, потому что Fable 5 и Opus 5 отказывались чинить security-баги и собирать инструменты мониторинга.

Насколько это здоровая ситуация — вопрос отдельный. Но если твоя работа связана с безопасностью, аргумент «модель просто не отказывает» перевешивает пару пунктов в бенчмарке.

Что GLM-5.3 показывает в кодинге?

Основная заявка релиза — лучшая открытая модель для кодинга. На внутреннем Z.ai Code Bench прирост к 5.2 составил 50%.

Бенчмарк GLM-5.3 GLM-5.2 Kimi K3 Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal-Bench 2.1 88,2 81,0 88,3 85,0 88,0 88,8
Terminal-Bench 3.0 28,3 4,6 17,4 21,1 33,7 34,6
DeepSWE v1.1 66,9 46,2 67,5 58,0 69,7 72,7
FrontierSWE 78,1 67,5 66,5 88,2
SWE-Marathon v1.1 42,5 19,4 48,1 48,8 33,1 42,5
Agents' Last Exam 28,5 23,8 27,6 25,7 23,8 28,6

Самый показательный скачок — Terminal-Bench 3.0: с 4,6 до 28,3. Свежий бенчмарк, на котором ещё недавно все модели буксовали, теперь берётся почти на треть. На FrontierSWE GLM-5.3 набирает 78,1 против 66,5 у Opus 4.8. То есть открытая модель обходит флагман Anthropic прошлого поколения, хотя Fable 5 всё равно впереди с 88,2.

Есть и провалы. На SWE-Marathon Kimi K3 и Opus 4.8 обходят GLM-5.3, на DeepSWE отставание от закрытых моделей сохраняется. Но для модели, веса которой скоро можно будет скачать, картина всё равно нетипичная.

Токен-эффективность — почему это важнее бенчмарков

Тут цифры, на которые я смотрю в первую очередь. Задач GLM-5.3 решает больше, и при этом расходует меньше токенов.

График точности GLM-5.3 на Z.ai Code Bench относительно расхода выходных токенов на уровнях low, high и max в сравнении с Claude Fable 5 и Opus 4.8

На максимальном уровне рассуждений модель берёт 34,5% задач Z.ai Code Bench, расходуя около 75 тысяч выходных токенов на задачу. GLM-5.2 брала 23,4% при 96 тысячах. То есть плюс одиннадцать пунктов и минус пятая часть расхода.

Сравнение с закрытыми ещё нагляднее: на уровне high GLM-5.3 даёт 31,4% при 50 тысячах токенов, а Claude Opus 4.8 — 29,5% при 120 тысячах. Результат чуть выше, токенов в 2,4 раза меньше. Fable 5 остаётся впереди по качеству (39,5% на максимуме), но и по счёту тоже.

Для агентного кодинга это метрика номер один. Когда агент крутится в цикле часами, стоимость решённой задачи важнее позиции в таблице.

Как подключить GLM-5.3 к Claude Code

Отдельный API-ключ для GLM-5.3 не нужен. Модель уже раскатана всем подписчикам GLM Coding Plan и работает в ZCode, Claude Code, OpenCode, Cline и ещё паре десятков агентов.

  1. Оформи подписку на z.ai/subscribe. Минимальный тариф Lite стоит 18 долларов в месяц.
  2. Установи Claude Code, если ещё нет: npm install -g @anthropic-ai/claude-code (нужен Node.js 18+).
  3. Запусти официальный конфигуратор: npx @z_ai/coding-helper. Он пропишет нужные переменные окружения в конфиг Claude Code и подставит твой ключ.
  4. Запусти claude в папке проекта. На вопрос про использование API-ключа ответь «Yes».

Если правил ~/.claude/settings.json руками и настройки не подхватились, закрой все окна Claude Code и запусти заново. В упрямом случае удали файл и дай конфигуратору создать новый.

Одна вещь ломает обратную совместимость: в GLM-5.3 больше нельзя отключить рассуждения. Параметр thinking.type: "disabled" не поддерживается, вместо него появились три уровня усилий.

{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

Уровни — low, high и max, по умолчанию max. Для кодинга Z.ai рекомендует максимальный. Если в твоём коде сейчас стоит disabled, поменяй на enabled с reasoning_effort: low до смены идентификатора модели, иначе запрос упадёт с ошибкой.

⚠️
Запросы к GLM-5.2 и GLM-5.1 теперь автоматически уходят на 5.3 — откатиться на старую версию не получится.

Сколько стоит GLM Coding Plan

Три тарифа, цена зависит от периода оплаты. При годовой подписке скидка 30%.

Тариф В месяц При годовой оплате Кредиты за 5 часов Кредиты в неделю
Lite $18 $12,6 2 000 10 000
Pro $80 $56 12 000 60 000
Max $168 $117,6 28 000 140 000

Считается всё в кредитах: вход, кешированный вход и выход учитываются с разными коэффициентами. У GLM-5.3 это 6,9 за вход, 1,7 за кеш и 24 за выход на 10 тысяч токенов. В токенах Z.ai оценивает недельный лимит так: Lite — 43–87 миллионов, Pro — 263–526 миллионов, Max — 613–1226 миллионов.

Разброс объясняется скидкой на непиковые часы: вне интервала 14:00–18:00 по пекинскому времени в будни всё стоит вдвое дешевле. Для нас это удобно, рабочий день в Москве почти целиком попадает в льготные часы.

У ZCode, собственной агентной IDE от Z.ai, есть свои плюшки: кеш попадает больше чем в 98% случаев (это примерно +30% полезных токенов), а до 31 августа действует полуторакратный буст квоты. Плюс режим Goal, который планирует, пишет, тестирует и проверяет до достижения цели, и управление длинными задачами с телефона через WeChat или Feishu.

Когда откроют веса GLM-5.3

Обещанные две недели отсчитываются от 14 августа, то есть веса ждём в районе 28-го. До этого момента модель живёт только внутри GLM Coding Plan и ZCode, публичного API нет.

Что именно выложат — вопрос открытый. Задержку Z.ai объясняет «safety evaluation and hardening», и в обсуждениях сразу появилось разумное подозрение: кибербез-способности к моменту релиза могут подрезать. Логика простая — если компания две недели закаляет модель, то самая опасная её часть и есть предмет закалки. Проверить это можно будет только замерами после выкладки.

С лицензией тоже неясно. У GLM-5.2 была MIT, что для модели такого размера почти неприлично щедро, но автоматически переносить это на 5.3 я бы не стал: у релиза совсем другой профиль рисков.

И трезвая нота про «запущу локально». База — примерно 750 миллиардов параметров, так что домашней видеокартой тут не обойтись, нужна серверная сборка с сотнями гигабайт памяти и ценником как у неплохого автомобиля. Локальный запуск реалистичен для компаний и хостеров, а не для отдельного разработчика. Большинству всё равно останется API или чужое облако.

Вердикт

Больше всего в релизе подкупает не таблица с бенчмарками, а публичный реестр уязвимостей. Компания могла ограничиться строчкой «модель хорошо ищет баги», а выложила номера CVE, критичность и сроки жизни каждой находки. Проверяемо. К этому прибавь токен-эффективность, которая делает GLM-5.3 дешевле Opus 4.8 при сопоставимом результате, и работу в привычном Claude Code без смены инструментов.

Претензии тоже есть. В эксплуатации уязвимостей до Fable 5 ещё далеко: 54,4 против 78 на ExploitBench, это не «почти догнали». Кредитная система вместо цены за миллион токенов считается неудобно, придётся смотреть на расход в дашборде. Главное же — все цифры в этом обзоре опубликовала сама Z.ai, включая результаты конкурентов, которые она выбирала и замеряла на свой вкус. Независимого аудита пока нет ни одного: пока веса закрыты, проверить модель снаружи попросту нечем. Часть бенчмарков внутренние, а Z.ai Code Bench вообще приватный — аргумент про защиту от протечки тестов разумный, но результат от этого проверяемым не становится. Читай таблицы как заявку производителя, а не как независимый замер.

Если платишь за подписку Anthropic ради агентного кодинга и упираешься в лимиты, GLM-5.3 стоит попробовать прямо сейчас. Восемнадцать долларов за Lite, тот же Claude Code, заметно меньший расход токенов. На больших рефакторингах Fable 5 всё равно сильнее, но соотношение цены и результата у Z.ai сейчас лучшее на рынке. Безопасникам я бы советовал дождаться открытия весов: модель, которая нашла две с половиной тысячи дыр в чужом коде, пригодится для аудита своего, и запустить её можно будет локально, не отправляя исходники в чужое облако.

Кому точно мимо: тем, кто работает с чувствительными данными и не готов гонять их через китайские серверы. Тут вопрос не в качестве модели, а в юрисдикции и политике хранения.

GLM Coding Plan — подписка на GLM-5.3
От $18 в месяц. Работает в Claude Code, ZCode, OpenCode, Cline и ещё двух десятках агентов. Вне пиковых часов расход вдвое меньше.

Что ещё почитать