> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# GLM-5.3 от Z.ai: обзор модели
- URL: https://matveev.tech/glm-5-3-obzor/
- Published: 2026-08-17T09:34:30.000Z
- Updated: 2026-08-17T09:34:30.000Z
- Description: Z.ai выпустила GLM-5.3 — лучшую открытую модель для кодинга. Разбираю бенчмарки, находки по безопасности и цены GLM Coding Plan.
- Author: Pavel Matveev
- Tags: AI, LLM, Open Source, Безопасность, Обзор

> TL;DR: Z.ai выпустила GLM-5.3 — модель для кодинга. База та же, что у GLM-5.2, весь прирост дал пост-тренинг. Побочный эффект оказался громче основного: модель нашла 2436 реальных уязвимостей в 269 open-source проектах, а старейшая из них жила в коде с 1981 года. Веса придержали до конца августа - компания сама притормозила релиз из-за того, насколько хорошо модель научилась ломать чужой код.

14 августа Z.ai (бывшая Zhipu AI) показала GLM-5.3\. Формально это апдейт кодинг-модели: SOTA среди открытых на Terminal-Bench 3.0 и Agents' Last Exam, +50% на внутреннем бенчмарке компании. Но главная история в [анонсе](https://z.ai/blog/glm-5.3?ref=matveev.tech) — не про кодинг.

Про предыдущие поколения я писал: [GLM-4.7](https://matveev.tech/glm-4-7-zhipu/) была крепкой моделью для терминала, [GLM-4.6V](https://matveev.tech/glm-4-6v-open-source-multimodal/) — мультимодалкой с function calling. GLM-5.3 из другой лиги, и разбирать её интереснее с конца, начиная с раздела про безопасность.

## Что такое GLM-5.3 и что в ней нового

GLM-5.3 использует ту же базовую модель, что и [GLM-5.2](https://matveev.tech/glm-5-2-claude-code/). Никакого нового претрейна, никакого пересчёта весов с нуля. Z.ai честно пишет: «scaling post-training is all we did». Весь прирост получен за счёт масштабирования обучения с подкреплением на длинных задачах.

Под этим лежит стек, который компания собрала ещё для 5.2: IndexShare для длинного контекста, SAO для RL на долгих задачах и открытый фреймворк [slime](https://github.com/THUDM/slime?ref=matveev.tech) для асинхронного обучения. За месяц команда добавила окружений, разнообразила задачи и залила туда больше компьюта. Системные оптимизации подняли пропускную способность RL-обучения на длинных кодинг-задачах больше чем в 2,3 раза.

Отдельно интересен подход к самим окружениям. Задачи для обучения теперь синтезируются конвейером: агенты-исследователи собирают паттерны из реальной работы и превращают их в запускаемые окружения с многошаговыми зависимостями, а агент-судья проверяет, что задача вообще решаема. Верификатор пишется без доступа к эталонному решению, иначе модель научится обходить награду вместо того, чтобы решать задачу.

Некоторые окружения — это несколько дней работы опытного инженера. Например, диагностика узких мест в ML-инфраструктуре с доступом к кластеру, хранилищу, внутренней документации и результатам экспериментов, где надо реально ускорить обучение и не сломать корректность.

## Кибербезопасность: 2436 уязвимостей в живом коде

Вот ради этого раздела и стоит читать анонс. Z.ai добавила в обучающую смесь данные и окружения по поиску уязвимостей, тут ничего удивительного. Удивило команду другое: как быстро способность продолжала расти дальше. Модель перестала находить изолированные баги и начала выстраивать цепочки эксплуатации целиком.

![Результаты GLM-5.3 на кибербез-бенчмарках CyberGym, ExploitBench и ExploitGym в сравнении с GLM-5.2, Kimi K3 и закрытыми моделями](https://matveev.tech/content/images/2026/08/glm-5-3-cyber.png)

Цифры по трём бенчмаркам:

| Бенчмарк           | GLM-5.3   | GLM-5.2 | Opus 4.8 | Fable 5   | GPT-5.6 Sol |
| ------------------ | --------- | ------- | -------- | --------- | ----------- |
| CyberGym           | 84,5      | 77,2    | 78,1     | 83,8      | 83,6        |
| ExploitBench       | 54,4      | 24,4    | 40,0     | 78,0      | 76,5        |
| ExploitGym 2ч / 6ч | 105 / 130 | 29 / 39 | 80 / 120 | 181 / 247 | 216 / 293   |

На CyberGym, где модель ищет и подтверждает уязвимость по исходникам, GLM-5.3 показывает лучший результат из всех — 84,5% против 83,8% у Fable 5 и 83,6% у GPT-5.6 Sol. На ExploitBench, где нужно рассуждать глубже, результат удвоился относительно 5.2, но до закрытых моделей всё ещё далеко: 54,4% против 78%. На ExploitGym разрыв ещё заметнее.

Закономерность Z.ai описывает так: чем выше по цепочке эксплуатации стоит бенчмарк, тем больше прирост относительно GLM-5.2 и тем шире оставшийся разрыв с закрытым фронтиром. Способности растут быстрее всего ровно там, где отставание сильнее.

Начиная с GLM-5.2 Z.ai работает с несколькими security-командами в Китае и гоняет модели по реальным кодовым базам. После экспертной проверки и дедупликации получилось **2436 уязвимостей в 269 проектах**, из них 1097 — средней и высокой критичности.

| Критичность | Количество |
| ----------- | ---------- |
| Critical    | 107        |
| High        | 990        |
| Medium      | 1286       |
| Low         | 53         |

Находки разбросаны по системным ядрам, операционкам, браузерным движкам, инфраструктурному опенсорсу, веб-приложениям и сетевым протоколам. Многие лежали незамеченными годами. Старейшая уязвимость появилась в коде в 1981 году, а средний возраст дыры до момента обнаружения — 26,6 лет.

Публично раскрыто пока 53 находки, остальные 2383 под эмбарго. Z.ai завела для этого [публичный реестр раскрытия](https://cvd.z.ai/?ref=matveev.tech), где видно проект, критичность, CVE и сколько лет уязвимость прожила в коде. Названия проектов там серьёзные: [по данным Axios](https://www.axios.com/2026/08/14/china-open-source-ai-glm-53?ref=matveev.tech), среди находок есть ядро Linux, продукты VMware и проекты фонда Apache.

Самая громкая находка случилась уже после анонса. Модель нашла, [как пишет VentureBeat](https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor?ref=matveev.tech) со ссылкой на девелопер-адвоката Z.ai, «потенциально серьёзную уязвимость» в Cursor — том самом редакторе, которым половина индустрии пишет код с помощью ИИ. Уязвимость передали приватно, команда Cursor работает над патчем, детали обещают раскрыть после того, как пользователи будут защищены.

Заодно Z.ai запустила [OpenVuln](https://huggingface.co/spaces/zai-org/OpenVuln?ref=matveev.tech) — мейнтейнер открытого проекта может прийти и попросить прогнать GLM по своему репозиторию. Если у тебя есть свой опенсорс, это самый дешёвый способ пощупать модель на реальной задаче.

Мне кажется, это самая важная часть релиза, и не только для безопасников. Модель, которую можно будет запустить локально после открытия весов, находит в опенсорсе то, что не нашли за сорок лет. Одна и та же способность одинаково хорошо работает и на защиту, и на атаку. Скоро она будет лежать в свободном доступе, и я честно не знаю, как к этому относиться: аудит своего кода станет доступнее всем, но и вторая сторона получит тот же инструмент.

Похоже, в Z.ai думают примерно о том же. Пока веса не открыты, доступ к самым чувствительным возможностям дают по отдельной программе — только отобранным партнёрам по безопасности и в контролируемых окружениях. Компания при этом честно признаёт: после открытия весов контролировать, кто и как дообучит модель, она уже не сможет. Свою позицию Z.ai формулирует примерно так: если мир открытый, то открытой должна быть не только поверхность атаки, но и щит. Красиво, но проверить это утверждение можно будет только постфактум.

Американские лаборатории в это же время тормозят релизы из-за киберрисков — OpenAI [отложила](https://www.axios.com/2026/08/07/openai-astra-model-delay-cybersecurity-risks?ref=matveev.tech) свою Astra ровно по этой причине. Китайские команды идут в обратную сторону и целенаправленно тренируют открытые модели на кибербез. А неделей раньше исследователи [зафиксировали](https://edition.cnn.com/2026/08/13/tech/china-taiwan-ai-agent-cyberattack-intl-hnk?ref=matveev.tech) автоматизированную атаку на правительственные системы Тайваня, где нападающей стороной работали открытые ИИ-агенты. В администрации Трампа на этом фоне [обсуждают](https://www.axios.com/2026/08/14/open-source-ai-government-scrutiny?ref=matveev.tech), как вообще регулировать открытые модели. На таком фоне две недели задержки выглядят вполне осмысленной паузой, а не жестом ради приличия.

🔍

Разбираю такие релизы в день выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Почему безопасники пересаживаются на GLM

У этой истории есть сторона, о которой в анонсе ни слова, а на практике она решает. Западные флагманы регулярно отказываются работать с задачами по безопасности: guardrails срабатывают на слова «эксплойт», «уязвимость», «red team», и модель вежливо уходит от ответа. Для пентестера или разработчика, который чинит собственный баг, это стена на ровном месте.

Показательный случай был в июле: Hugging Face [расследовала](https://www.axios.com/2026/07/20/hugging-face-ai-cyberattack-data-breach?ref=matveev.tech) утечку данных и в итоге взяла для анализа GLM-5.2 — американские фронтир-модели помогать отказались. Ситуация, где для разбора инцидента с моделями OpenAI приходится звать китайскую модель, говорит о состоянии индустрии больше, чем любая таблица бенчмарков.

В [обсуждении на Hacker News](https://news.ycombinator.com/item?id=49294997&ref=matveev.tech) (1158 голосов и почти 600 комментариев за пару дней) та же тема всплывает первым же комментарием. Разработчик рассказывает, как купил Lite за 18 долларов, прогнал полноценный red team сценарий — 0-day в WP-плагинах, RCE, адаптация эксплойта под ядро, причём вторым GLM-агентом в роли защитника — и сразу ушёл на тариф за 80\. Другой участник с корпоративным бюджетом в 500 долларов пишет, что переезжает с подписки Anthropic, потому что Fable 5 и Opus 5 отказывались чинить security-баги и собирать инструменты мониторинга.

Насколько это здоровая ситуация — вопрос отдельный. Но если твоя работа связана с безопасностью, аргумент «модель просто не отказывает» перевешивает пару пунктов в бенчмарке.

## Что GLM-5.3 показывает в кодинге?

Основная заявка релиза — лучшая открытая модель для кодинга. На внутреннем Z.ai Code Bench прирост к 5.2 составил 50%.

| Бенчмарк           | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
| ------------------ | ------- | ------- | ------- | -------- | ------- | ----------- |
| Terminal-Bench 2.1 | 88,2    | 81,0    | 88,3    | 85,0     | 88,0    | 88,8        |
| Terminal-Bench 3.0 | 28,3    | 4,6     | 17,4    | 21,1     | 33,7    | 34,6        |
| DeepSWE v1.1       | 66,9    | 46,2    | 67,5    | 58,0     | 69,7    | 72,7        |
| FrontierSWE        | 78,1    | 67,5    | —       | 66,5     | 88,2    | —           |
| SWE-Marathon v1.1  | 42,5    | 19,4    | 48,1    | 48,8     | 33,1    | 42,5        |
| Agents' Last Exam  | 28,5    | 23,8    | 27,6    | 25,7     | 23,8    | 28,6        |

Самый показательный скачок — Terminal-Bench 3.0: с 4,6 до 28,3\. Свежий бенчмарк, на котором ещё недавно все модели буксовали, теперь берётся почти на треть. На FrontierSWE GLM-5.3 набирает 78,1 против 66,5 у Opus 4.8\. То есть открытая модель обходит флагман Anthropic прошлого поколения, хотя Fable 5 всё равно впереди с 88,2.

Есть и провалы. На SWE-Marathon Kimi K3 и Opus 4.8 обходят GLM-5.3, на DeepSWE отставание от закрытых моделей сохраняется. Но для модели, веса которой скоро можно будет скачать, картина всё равно нетипичная.

## Токен-эффективность — почему это важнее бенчмарков

Тут цифры, на которые я смотрю в первую очередь. Задач GLM-5.3 решает больше, и при этом расходует меньше токенов.

![График точности GLM-5.3 на Z.ai Code Bench относительно расхода выходных токенов на уровнях low, high и max в сравнении с Claude Fable 5 и Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-token-efficiency.png)

На максимальном уровне рассуждений модель берёт 34,5% задач Z.ai Code Bench, расходуя около 75 тысяч выходных токенов на задачу. GLM-5.2 брала 23,4% при 96 тысячах. То есть плюс одиннадцать пунктов и минус пятая часть расхода.

Сравнение с закрытыми ещё нагляднее: на уровне high GLM-5.3 даёт 31,4% при 50 тысячах токенов, а Claude Opus 4.8 — 29,5% при 120 тысячах. Результат чуть выше, токенов в 2,4 раза меньше. Fable 5 остаётся впереди по качеству (39,5% на максимуме), но и по счёту тоже.

Для агентного кодинга это метрика номер один. Когда агент крутится в цикле часами, стоимость решённой задачи важнее позиции в таблице.

## Как подключить GLM-5.3 к Claude Code

Отдельный API-ключ для GLM-5.3 не нужен. Модель уже раскатана всем подписчикам GLM Coding Plan и работает в ZCode, Claude Code, OpenCode, Cline и ещё паре десятков агентов.

1. Оформи подписку на [z.ai/subscribe](https://z.ai/subscribe?ref=matveev.tech). Минимальный тариф Lite стоит 18 долларов в месяц.
2. Установи Claude Code, если ещё нет: `npm install -g @anthropic-ai/claude-code` (нужен Node.js 18+).
3. Запусти официальный конфигуратор: `npx @z_ai/coding-helper`. Он пропишет нужные переменные окружения в конфиг Claude Code и подставит твой ключ.
4. Запусти `claude` в папке проекта. На вопрос про использование API-ключа ответь «Yes».

Если правил `~/.claude/settings.json` руками и настройки не подхватились, закрой все окна Claude Code и запусти заново. В упрямом случае удали файл и дай конфигуратору создать новый.

Одна вещь ломает обратную совместимость: в GLM-5.3 больше нельзя отключить рассуждения. Параметр `thinking.type: "disabled"` не поддерживается, вместо него появились три уровня усилий.

```json
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

```

Уровни — `low`, `high` и `max`, по умолчанию `max`. Для кодинга Z.ai рекомендует максимальный. Если в твоём коде сейчас стоит `disabled`, поменяй на `enabled` с `reasoning_effort: low` **до** смены идентификатора модели, иначе запрос упадёт с ошибкой.

⚠️

Запросы к GLM-5.2 и GLM-5.1 теперь автоматически уходят на 5.3 — откатиться на старую версию не получится.

## Сколько стоит GLM Coding Plan

Три тарифа, цена зависит от периода оплаты. При годовой подписке скидка 30%.

| Тариф | В месяц | При годовой оплате | Кредиты за 5 часов | Кредиты в неделю |
| ----- | ------- | ------------------ | ------------------ | ---------------- |
| Lite  | $18     | $12,6              | 2 000              | 10 000           |
| Pro   | $80     | $56                | 12 000             | 60 000           |
| Max   | $168    | $117,6             | 28 000             | 140 000          |

Считается всё в кредитах: вход, кешированный вход и выход учитываются с разными коэффициентами. У GLM-5.3 это 6,9 за вход, 1,7 за кеш и 24 за выход на 10 тысяч токенов. В токенах Z.ai оценивает недельный лимит так: Lite — 43–87 миллионов, Pro — 263–526 миллионов, Max — 613–1226 миллионов.

Разброс объясняется скидкой на непиковые часы: вне интервала 14:00–18:00 по пекинскому времени в будни всё стоит вдвое дешевле. Для нас это удобно, рабочий день в Москве почти целиком попадает в льготные часы.

У ZCode, собственной агентной IDE от Z.ai, есть свои плюшки: кеш попадает больше чем в 98% случаев (это примерно +30% полезных токенов), а до 31 августа действует полуторакратный буст квоты. Плюс режим Goal, который планирует, пишет, тестирует и проверяет до достижения цели, и управление длинными задачами с телефона через WeChat или Feishu.

## Когда откроют веса GLM-5.3

Обещанные две недели отсчитываются от 14 августа, то есть веса ждём в районе 28-го. До этого момента модель живёт только внутри GLM Coding Plan и ZCode, публичного API нет.

Что именно выложат — вопрос открытый. Задержку Z.ai объясняет «safety evaluation and hardening», и в обсуждениях сразу появилось разумное подозрение: кибербез-способности к моменту релиза могут подрезать. Логика простая — если компания две недели закаляет модель, то самая опасная её часть и есть предмет закалки. Проверить это можно будет только замерами после выкладки.

С лицензией тоже неясно. У GLM-5.2 была MIT, что для модели такого размера почти неприлично щедро, но автоматически переносить это на 5.3 я бы не стал: у релиза совсем другой профиль рисков.

И трезвая нота про «запущу локально». База — примерно 750 миллиардов параметров, так что домашней видеокартой тут не обойтись, нужна серверная сборка с сотнями гигабайт памяти и ценником как у неплохого автомобиля. Локальный запуск реалистичен для компаний и хостеров, а не для отдельного разработчика. Большинству всё равно останется API или чужое облако.

## Вердикт

Больше всего в релизе подкупает не таблица с бенчмарками, а публичный реестр уязвимостей. Компания могла ограничиться строчкой «модель хорошо ищет баги», а выложила номера CVE, критичность и сроки жизни каждой находки. Проверяемо. К этому прибавь токен-эффективность, которая делает GLM-5.3 дешевле Opus 4.8 при сопоставимом результате, и работу в привычном Claude Code без смены инструментов.

Претензии тоже есть. В эксплуатации уязвимостей до Fable 5 ещё далеко: 54,4 против 78 на ExploitBench, это не «почти догнали». Кредитная система вместо цены за миллион токенов считается неудобно, придётся смотреть на расход в дашборде. Главное же — все цифры в этом обзоре опубликовала сама Z.ai, включая результаты конкурентов, которые она выбирала и замеряла на свой вкус. Независимого аудита пока нет ни одного: пока веса закрыты, проверить модель снаружи попросту нечем. Часть бенчмарков внутренние, а Z.ai Code Bench вообще приватный — аргумент про защиту от протечки тестов разумный, но результат от этого проверяемым не становится. Читай таблицы как заявку производителя, а не как независимый замер.

Если платишь за подписку Anthropic ради агентного кодинга и упираешься в лимиты, GLM-5.3 стоит попробовать прямо сейчас. Восемнадцать долларов за Lite, тот же Claude Code, заметно меньший расход токенов. На больших рефакторингах Fable 5 всё равно сильнее, но соотношение цены и результата у Z.ai сейчас лучшее на рынке. Безопасникам я бы советовал дождаться открытия весов: модель, которая нашла две с половиной тысячи дыр в чужом коде, пригодится для аудита своего, и запустить её можно будет локально, не отправляя исходники в чужое облако.

Кому точно мимо: тем, кто работает с чувствительными данными и не готов гонять их через китайские серверы. Тут вопрос не в качестве модели, а в юрисдикции и политике хранения.

[GLM Coding Plan — подписка на GLM-5.3От $18 в месяц. Работает в Claude Code, ZCode, OpenCode, Cline и ещё двух десятках агентов. Вне пиковых часов расход вдвое меньше.z.ai](https://z.ai/subscribe?ref=matveev.tech)

## Что ещё почитать

- [GLM-4.7 — китайская модель для кодинга, которая удивляет](https://matveev.tech/glm-4-7-zhipu/) — предыдущее поколение линейки, с которого началась поддержка Claude Code
- [GLM-4.6V — опенсорс мультимодалка с function calling](https://matveev.tech/glm-4-6v-open-source-multimodal/) — визуальная модель Z.ai, которая сейчас работает как Vision MCP внутри Coding Plan
- [Kimi K3: открытая модель на 2,8 трлн параметров](https://matveev.tech/kimi-k3/) — главный конкурент GLM среди открытых китайских моделей, он же в таблицах выше
- [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/) — закрытый фронтир, с которым GLM-5.3 сравнивают по кибербезу