> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# Kimi K3: открытая модель на 2,8 трлн параметров
- URL: https://matveev.tech/kimi-k3/
- Published: 2026-07-17T09:57:38.000Z
- Updated: 2026-07-17T09:57:38.000Z
- Description: Moonshot AI выпустила первую открытую модель класса 3T. Что показывают бенчмарки против Claude Fable 5 и GPT-5.6 Sol и сколько стоит API.
- Author: Pavel Matveev
- Tags: LLM, AI, Open Source, Обзор

> TL;DR: Moonshot AI выпустила [Kimi K3](https://www.kimi.com/blog/kimi-k3?ref=matveev.tech) — первую открытую модель класса 3T: 2,8 трлн параметров, нативное зрение и контекст 1 млн токенов. По бенчмаркам она уступает только Claude Fable 5 и GPT-5.6 Sol, а остальных обходит. Веса обещают выложить к 27 июля 2026.

Открытые модели догоняли закрытый фронтир давно, но обычно с отставанием на поколение. Kimi K3 сокращает разрыв до минимума: по данным Moonshot, модель проигрывает только двум самым сильным проприетарным моделям — Claude Fable 5 и GPT-5.6 Sol, и при этом стабильно обходит всё остальное, включая Claude Opus 4.8 и GPT-5.5\. Разбираю, что внутри и почём.

## Что такое Kimi K3?

Kimi K3 — флагманская модель Moonshot AI на 2,8 трлн параметров. Это первая открытая модель такого масштаба: по словам компании, девять из последних двенадцати месяцев именно модели Kimi держали верхнюю планку размеров среди open source.

Ключевые характеристики из [анонса](https://www.kimi.com/blog/kimi-k3?ref=matveev.tech):

- 2,8 трлн параметров, MoE-архитектура с активацией 16 из 896 экспертов
- Контекст 1 млн токенов
- Нативная мультимодальность: текст, картинки и видео в одной модели
- Масштабирование примерно в 2,5 раза эффективнее, чем у Kimi K2

*Важная оговорка: «открытая» пока означает «будет открытой». На старте модель доступна только через продукты Kimi и API, а полные веса обещают выложить к 27 июля 2026 вместе с техническим отчётом.*

## Как Kimi K3 выглядит на фоне Claude Fable 5 и GPT-5.6 Sol?

K3 уступает Claude Fable 5 и GPT-5.6 Sol.

![Сравнение Kimi K3 с Claude Fable 5, GPT-5.6 Sol и другими моделями на бенчмарках](https://matveev.tech/content/images/2026/07/kimi-k3-benchmarks.jpg)

Несколько показательных строк из полной таблицы:

| Бенчмарк                    | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
| --------------------------- | ------- | -------------- | ----------- | --------------- |
| DeepSWE (кодинг)            | 67.5    | 70.0           | 73.0        | 59.0            |
| Terminal Bench 2.1          | 88.3    | 84.6           | 88.8        | 84.6            |
| SWE Marathon                | 42.0    | 35.0           | 39.0        | 40.0            |
| BrowseComp (агентный поиск) | 91.2    | 88.0           | 90.4        | 84.3            |
| GPQA-Diamond (знания)       | 93.5    | 92.6           | 94.1        | 91.0            |
| HLE-Full                    | 43.5    | 53.3           | 44.5        | 49.8            |

В агентных задачах и долгих кодинг-сессиях K3 местами выходит на первое место (SWE Marathon, BrowseComp, Automation Bench). В чистом ризонинге модель держится рядом с лидерами, а вот на Humanity's Last Exam отстаёт ощутимо. И всё равно для открытой модели это территория, куда раньше никто не добирался.

К бенчмаркам от вендора всегда стоит относиться с поправкой: Moonshot сравнивает модели в разных харнессах (KimiCode, Claude Code, Codex), а результаты Claude Fable 5 частично получены с fallback на Opus 4.8, когда Fable отказывался выполнять задачи. Методология подробно расписана в футноутах анонса.

## Что у Kimi K3 под капотом?

Главные архитектурные новинки — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). KDA отвечает за эффективное внимание на длинных последовательностях, AttnRes выборочно достаёт представления с разных глубин модели вместо равномерного накопления. Вместе они, по словам Moonshot, дают ту самую 2,5-кратную эффективность масштабирования по сравнению с K2.

Модель обучалась с quantization-aware training начиная со стадии SFT — веса MXFP4, активации MXFP8\. Это сделано для совместимости с широким спектром железа. Для инференса Moonshot рекомендует суперноды от 64 ускорителей и уже законтрибьютила поддержку prefix caching для KDA в vLLM.

## Что Kimi K3 делает в автономных сессиях?

Самая впечатляющая часть анонса — кейсы долгих автономных прогонов. Moonshot тестировала модели в одинаковых песочницах с лимитом до 24 часов на оптимизацию GPU-кернелов. K3 за 15 часов непрерывных итераций ускорила кернел AttnRes с 283,6 мс до 114,4 мс, придумав двухфазный алгоритм и сохранив численную точность. Результат на уровне Claude Fable 5, но K3 оптимизировала быстрее за итерацию.

Дальше больше. K3 с нуля написала MiniTriton — компактный Triton-подобный компилятор с собственным IR-слоем над MLIR и генерацией PTX. На roofline-бенчмарках он местами обгоняет сам Triton и выдерживает end-to-end обучение nanoGPT со стабильной сходимостью.

А в 48-часовом автономном прогоне K3 спроектировала чип под нано-модель на собственной архитектуре: open-source EDA-инструменты, библиотека Nangate 45nm, 4 мм², тайминг на 100 МГц и 8 700 токенов в секунду в симуляции. Чип, спроектированный моделью для модели. Про то, как нейросети впаивают в кремний всерьёз, я писал в [обзоре Taalas ChatJimmy](https://matveev.tech/taalas-chatjimmy/) — а тут модель сама выступает в роли проектировщика.

![Процедурный 3D-мир с лесами, деревней и горами, который Kimi K3 собрала на Three.js WebGPU](https://matveev.tech/content/images/2026/07/kimi-k3-open-world.png)

Есть и более наглядные кейсы: браузерная 3D-игра с процедурной генерацией мира на Three.js WebGPU, интерактивный отчёт по 42 годам индустрии ASIC (2 800+ веб-запросов, 11 000+ страниц источников) и монтаж собственного тизера из 56 клипов с попаданием склеек в бит. Обычному монтажёру такой ролик стоил бы день-два работы.

✈️

Слежу за гонкой открытых моделей с закрытым фронтиром и разбираю такие релизы по горячим следам — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Сколько стоит Kimi K3 и как попробовать?

Модель уже доступна на kimi.com, в Kimi Work, Kimi Code и через API. Цены по [прайсу Kimi API](https://platform.moonshot.ai/?ref=matveev.tech): $0.30 за миллион входных токенов при попадании в кэш, $3.00 при промахе и $15.00 за миллион выходных. Для сравнения: это заметно дешевле закрытых флагманов, а кэш-хит в кодинг-задачах, по данным Moonshot, превышает 90%.

В терминале модель включается через Kimi Code командой `/model`. На старте K3 работает только с максимальным thinking effort, режимы попроще обещают добавить позже.

[Kimi K3 — попробовать бесплатноЧат с Kimi K3 на kimi.com, агентные задачи, Kimi Work и Kimi Code. Модель доступна с максимальным thinking effort.Moonshot AI](https://www.kimi.com/en?ref=matveev.tech)

## Какие у Kimi K3 ограничения?

Во-первых, модель обучена в режиме сохранения истории размышлений: если харнесс не передаёт thinking-контент обратно или вы переключаетесь на K3 посреди сессии с другой моделью, генерация может стать нестабильной. Во-вторых, K3 склонна к самодеятельности: при неоднозначной задаче она принимает решения за пользователя. Лечится это явными ограничениями в системном промпте или AGENTS.md. В-третьих, сама компания признаёт заметный разрыв в пользовательском опыте с Claude Fable 5 и GPT-5.6 Sol.

## Что ещё почитать

- [GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI](https://matveev.tech/gpt-5-6-sol/) — один из двух главных конкурентов K3 из таблицы бенчмарков
- [Claude Sonnet 5: агентность как у Opus, но дешевле](https://matveev.tech/claude-sonnet-5/) — как Anthropic удешевляет агентные сценарии
- [Taalas ChatJimmy: нейросеть, впаянная в кремний](https://matveev.tech/taalas-chatjimmy/) — продолжение темы «модель и железо», только с другой стороны