> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# GLM-5.3-Flash: обзор модели Z.ai, та самая ox-alpha
- URL: https://matveev.tech/glm-5-3-flash/
- Published: 2026-08-26T19:58:11.000Z
- Updated: 2026-08-26T19:58:11.000Z
- Description: Шесть дней модель под именем ox-alpha возглавляла OpenRouter. Теперь Z.ai призналась, что это GLM-5.3-Flash: 320 млрд параметров, MIT и цена как у мелких моделей.
- Author: Pavel Matveev
- Tags: LLM, AI, Open Source, Обзор

> TL;DR: GLM-5.3-Flash — открытая модель Z.ai на 320 млрд параметров, из которых работают 18 млрд. Веса под MIT, контекст 1 млн токенов, цена $0,075 за миллион входных токенов против $0,15 у базового прайса. По кодингу и агентным задачам подбирается к Claude Opus 4.8, хотя такой уровень раньше стоил примерно вдесятеро дороже.

Последнюю неделю в топе OpenRouter висела модель с именем ox-alpha, про которую никто ничего не знал. За шесть дней она съела 23,2 триллиона токенов, в 2,3 раза больше, чем модель на втором месте. Ещё 43 триллиона прошли через неё в OpenCode.

26 августа Z.ai [призналась](https://z.ai/blog/glm-5.3-flash?ref=matveev.tech), что ox-alpha — это GLM-5.3-Flash, и выложила веса на HuggingFace под MIT.

![График OpenRouter: ox-alpha на первом месте с 23,2 трлн токенов за шесть дней, в 2,3 раза опережая deepseek-v4-flash](https://matveev.tech/content/images/2026/08/ox-alpha-openrouter-top-model.png)

## Что такое GLM-5.3-Flash

Это первая нативно мультимодальная модель в линейке GLM-5\. Зрение живёт внутри того же стека, который отвечает за текст, так что на вход можно кидать картинки и видео без отдельной vision-модели сбоку.

Цифры такие: 320 млрд параметров всего, 18 млрд активных, 45 слоёв. Контекст — миллион токенов, максимальная генерация 131 072 токена. Для сравнения, у GLM-4.5 при почти том же общем размере (355 млрд) активных было 32 млрд, а слоёв 92\. То есть Z.ai почти вдвое срезала и то, и другое, а качество при этом подняла.

Предобучение шло на мультимодальном корпусе в 30 триллионов токенов. Базовая модель на MMLU выдаёт 88,1 против 86,1 у GLM-4.5-Base, а на LiveCodeBench-Base — 37,6 против 34,4 у гораздо более крупной GLM-5-Base на 744 млрд параметров.

Веса лежат на [HuggingFace](https://huggingface.co/zai-org/GLM-5.3-Flash?ref=matveev.tech) под MIT. Из фреймворков поддерживаются SGLang, vLLM и TokenSpeed, остальные обещают позже.

## Архитектура GLM-5.3-Flash: откуда взялась дешевизна

Главное изменение — гибридное внимание. Три блока из четырёх используют линейное внимание, которое держит локальные зависимости через состояние, а каждый четвёртый — разреженное, которое достаёт нужный кусок глобального контекста через лёгкий индексатор.

![Схема архитектуры GLM-5.3-Flash: чередование линейного и разреженного внимания, блоки mHC, ViT для картинок, графики KV-кеша и вычислений](https://matveev.tech/content/images/2026/08/glm-5-3-flash-architecture.png)

Индексатор на миллионе токенов сам по себе становится проблемой: его кеш надо где-то держать. Z.ai добавила IndexPool: четыре ключа индексатора сжимаются в один взвешенным пулингом. Плюс механизм mHC (Manifold-Constrained Hyper-Connections) для более эффективного масштабирования.

Результат в замерах самой компании: против GLM-5.3 вычисления внимания упали в 3 раза, размер KV-кеша — в 4,4 раза. По вычислениям на токен это лучший показатель среди сравниваемых моделей, включая DeepSeek-V4-Flash и [Kimi K3](https://matveev.tech/kimi-k3/). По KV-кешу Z.ai честно пишет, что пока проигрывает обеим, и место для улучшений осталось.

## Бенчмарки GLM-5.3-Flash против Opus 4.8 и Gemini 3.7 Flash

Шесть кодинговых и агентных бенчмарков, все цифры из анонса Z.ai:

| Бенчмарк            | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
| ------------------- | ------------- | ------- | -------- | ------------- | ---------------- |
| Terminal Bench 2.1  | 84,3          | 81,0    | 85,0     | 87,4          | 85,8             |
| DeepSWE v1.1        | 63,4          | 46,2    | 58,0     | 69,6          | 65,3             |
| Toolathlon Verified | 78,4          | 59,9    | 76,2     | 74,9          | —                |
| AutomationBench     | 48,8          | 26,2    | 41,0     | 37,2          | 52,3             |
| Agents' Last Exam   | 26,3          | 20,4    | 27,0     | 28,0          | —                |
| GDPval-AA v2        | 1773          | 1504    | 1582     | 1571          | 1527             |

![Столбчатые диаграммы шести бенчмарков: GLM-5.3-Flash обходит GLM-5.2 везде и держится вровень с Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-flash-benchmarks.png)

Разрыв с GLM-5.2 местами двукратный: 63,4 против 46,2 на DeepSWE и 48,8 против 26,2 на AutomationBench. С Opus 4.8 картина ровнее: где-то Flash впереди (Toolathlon, GDPval), где-то на полбалла позади (Terminal Bench, Agents' Last Exam).

По зрению сравнивать особо не с чем, GLM-5.2 картинки не понимала. Против DeepSeek-V4-Vision-Exp Flash выигрывает почти везде: 62,4 против 57,9 на OfficeQA Pro, 78 против 64,3 на Chartography. А вот Gemini 3.7 Flash на видео сильнее, 82,2 против 77,8 на MVBench.

Независимых замеров пока нет, кроме [Artificial Analysis](https://artificialanalysis.ai/models/glm-5-3-flash?ref=matveev.tech). Там модель набирает 57 баллов Intelligence Index v4.1.1 при $0,045 за задачу, и это действительно новая точка на границе Парето.

## Где GLM-5.3-Flash отстаёт от GLM-5.3

Самый честный график в анонсе — внутренний Z.ai Code Bench, прогнанный на Claude Code 2.1.207.

![График Z.ai Code Bench: точность против расхода токенов на разных уровнях effort для GLM-5.3-Flash, GLM-5.3, Fable 5 и Opus 4.8](https://matveev.tech/content/images/2026/08/glm-5-3-flash-code-bench-effort.png)

На максимальном effort Flash даёт 29,0 против 29,5 у Opus 4.8\. Формально почти паритет. Но на том же графике GLM-5.3 стоит около 34,6, а Claude Fable 5 — около 39\. Старшую модель Flash не заменяет, у неё своя ниша: примерно уровень Opus 4.8 за очень маленькие деньги.

Второй нюанс виден по горизонтальной оси. Чтобы вытянуть свои 29 баллов, Flash сжигает около 138 тысяч выходных токенов на задачу. Это больше, чем у Opus 4.8 на его максимуме, и почти вдвое больше, чем у GLM-5.3\. Дешёвая модель, которая много думает, в пересчёте на задачу выходит не так дёшево, как кажется по прайсу за миллион токенов. Разница всё равно в разы, но не в те десять раз, которые обещает заголовок анонса.

⚠️

Режим размышления в GLM-5.3-Flash [нельзя выключить](https://docs.z.ai/guides/llm/glm-5.3-flash?ref=matveev.tech): параметр thinking.type принимает только значение enabled. Для коротких запросов вроде классификации или извлечения полей это лишний расход.

## Зачем модели для кода зрение

Тут у Z.ai интересная мысль. Во фронтенде, геймдеве и 3D результат работы видно только после рендера: страница, интерфейс, сцена. Половина ошибок вылезает только при рендере: элементы наехали друг на друга, текст вылез за блок, кнопка ушла за экран. Модель, которая видит только исходник, эти ошибки не поймает в принципе.

Поэтому зрение вшито в цикл: модель генерирует, смотрит на результат своими глазами и правит. Для фронтенда компания дополнительно гоняла обучение с подкреплением на обратной связи от окружения и проверяла суждения о вёрстке агентами на реальных пользовательских сценариях.

![Слайд презентации до и после: в первой версии заголовок RMB 173M наезжает на текст, а подпись графика перекрыта столбцами; во второй всё выровнено](https://matveev.tech/content/images/2026/08/glm-5-3-flash-visual-self-check.jpg)

Пример из анонса — слайд для инвесторского отчёта. В первой версии число «RMB 173M» наехало на подпись, а заголовок графика скрылся за столбцами. Модель посмотрела на рендер и переверстала.

То же самое работает за пределами кода: таблицы, дашборды, PDF, презентации. В [ZCode](https://zcode.z.ai/?ref=matveev.tech) к этому прикручены Browser Use и Computer Use: агент кликает по странице, смотрит, что получилось, и работает с десктопными приложениями.

Думаю, это направление важнее бенчмарков. Оценить вёрстку по скриншоту умеют и другие модели, но здесь она делает это сама, внутри своего же цикла работы, без лишнего шага.

Если интересны такие же разборы новых моделей и инструментов — [в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Инференс на китайских чипах

Всю прошлую неделю ox-alpha обслуживалась на кластере китайских ускорителей. Это были те самые 23 триллиона токенов на OpenRouter, никакого тестового стенда.

Под эту архитектуру Z.ai собрала свой инференс-движок поверх SGLang. Самая любопытная деталь: движок помогал писать агент на базе GLM-5.3\. Он подбирал кернелы, искал узкие места, чинил сервинг-стек. Модель оптимизировала систему, которая обслуживает модель.

Главное ограничение китайских чипов — память и её пропускная способность, особенно на миллионе токенов контекста. В ход пошло всё подряд: тензорный параллелизм внутри узла для линейного внимания и LM head, ReplaySSM, квантизация весов в W8A8, гибридный кеш в INT8/FP8/BF16, Layer Split. На уровне кластера — архитектура EPD, где мультимодальное кодирование, префилл и декодирование разнесены по отдельным пулам воркеров.

Итог: трёхкратный прирост сквозной производительности против стартового бейзлайна на том же железе и стоимость токена, сопоставимая с NVIDIA. Проверить это снаружи нельзя, но заявка серьёзная. До сих пор фронтир-инференс на китайском железе выглядел скорее политическим заявлением, чем рабочей схемой.

## Сколько стоит GLM-5.3-Flash

Базовый прайс — $0,15 за миллион входных токенов и $0,50 за миллион выходных. Сейчас действует скидка 50%, то есть реально платишь $0,075 и $0,25\. Чтение из кеша — $0,015.

| Провайдер             | Вход / 1M | Выход / 1M |
| --------------------- | --------- | ---------- |
| Z.ai (со скидкой)     | $0,075    | $0,25      |
| NovitaAI (со скидкой) | $0,075    | $0,25      |
| Cloudflare            | $0,15     | $0,50      |
| io.net                | $0,15     | $0,50      |

Для подписчиков GLM Coding Plan отдельный API-ключ не нужен, модель уже раскатана всем. Причём квота на Flash втрое больше, чем на GLM-5.3: тариф Lite за $18 в месяц с ней проживёт заметно дольше. Pro стоит $80, Max — $168, при годовой оплате скидка 30%.

## Как подключить GLM-5.3-Flash

1. Оформить [GLM Coding Plan](https://z.ai/subscribe?ref=matveev.tech) от $18 в месяц и прописать эндпоинт Z.ai в Claude Code, OpenCode, Cline или другом агенте. Как это настраивается, я разбирал в [статье про GLM-5.2](https://matveev.tech/glm-5-2-claude-code/), для Flash отличий нет.
2. Взять ключ в консоли Z.ai и дёргать API напрямую. Модель называется `glm-5.3-flash`, [документация тут](https://docs.z.ai/guides/llm/glm-5.3-flash?ref=matveev.tech).
3. Пойти через [OpenRouter](https://openrouter.ai/z-ai/glm-5.3-flash?ref=matveev.tech), если не хочется заводить аккаунт в Z.ai или нужен запасной провайдер на случай, когда основной ляжет.
4. Поднять локально: веса с HuggingFace плюс SGLang, vLLM или TokenSpeed.

## Вердикт

Бенчмарки тут не главное. Неделю модель работала под чужим именем на живом трафике, и люди голосовали токенами, не зная, чей продукт они гоняют. Такую проверку графиком не подделаешь. Плюс MIT-лицензия и цена, которая ломает привычную шкалу.

Есть и ложка дёгтя. Z.ai обещала открыть веса GLM-5.3 к концу августа, а первой под MIT легла Flash. Формально сроки ещё не вышли, но ощущение подмены осталось.

Претензии по делу тоже есть. Расход выходных токенов на максимальном effort съедает часть выигрыша в цене, так что на длинных агентных задачах разница с Opus 4.8 окажется меньше обещанной. Размышление не выключается, и на мелких запросах модель избыточна. Все бенчмарки, кроме Artificial Analysis, собрала сама компания, а Z.ai Code Bench вообще приватный.

Кому советую попробовать прямо сейчас: тем, кто упирается в лимиты подписки Anthropic и гоняет много агентных задач. Восемнадцать долларов, тот же Claude Code, втрое большая квота, чем у GLM-5.3\. Кому мимо: тем, кто делает большие рефакторинги, там GLM-5.3 и Fable 5 всё ещё сильнее, разрыв в пять-десять баллов на Code Bench никуда не делся. И тем, кто работает с чувствительными данными: вопрос не к качеству модели, а к юрисдикции.

[GLM Coding Plan — подписка с доступом к GLM-5.3-FlashОт $18 в месяц. Квота на Flash втрое больше, чем на GLM-5.3\. Работает в Claude Code, ZCode, OpenCode, Cline и других агентах.z.ai](https://z.ai/subscribe?ref=matveev.tech)

## Частые вопросы

**Какое железо нужно, чтобы запустить GLM-5.3-Flash локально?**

320 млрд параметров в 8-битной квантизации — это порядка 320 ГБ только под веса, плюс KV-кеш. Домашней видеокартой не обойтись, нужна серверная сборка. В 4 битах требования падают примерно вдвое, но всё равно речь про несколько ускорителей на 80 ГБ.

**Можно ли отключить режим размышления?**

Нет. По документации Z.ai параметр `thinking.type` принимает только `enabled`. Управлять расходом получится только уровнем effort в агенте.

**Модель понимает видео или только картинки?**

Понимает и видео. Z.ai замеряла её на MVBench (77,8) и MMVU (80,5) — это бенчмарки на понимание видеороликов, а не отдельных кадров. По ним Flash уступает Gemini 3.7 Flash, но обходит DeepSeek-V4-Vision-Exp.

## Что ещё почитать

- [GLM-5.3 от Z.ai: обзор модели](https://matveev.tech/glm-5-3-obzor/) — старшая модель линейки, та самая, что нашла 2436 уязвимостей в открытом коде
- [Claude Opus 4.8: что нового против Opus 4.7](https://matveev.tech/claude-opus-4-8/) — главный ориентир в таблицах выше
- [Kimi K3: открытая модель на 2,8 трлн параметров](https://matveev.tech/kimi-k3/) — конкурент по эффективности KV-кеша, с которым Z.ai сравнивает архитектуру
- [DeepSeek V4 Pro: обзор открытой модели для кодинга](https://matveev.tech/deepseek-v4-pro/) — вторая по трафику модель на OpenRouter, которую ox-alpha и подвинула