Kimi K3: открытая модель на 2,8 трлн параметров
Moonshot AI выпустила первую открытую модель класса 3T. Что показывают бенчмарки против Claude Fable 5 и GPT-5.6 Sol и сколько стоит API.
TL;DR: Moonshot AI выпустила Kimi K3 — первую открытую модель класса 3T: 2,8 трлн параметров, нативное зрение и контекст 1 млн токенов. По бенчмаркам она уступает только Claude Fable 5 и GPT-5.6 Sol, а остальных обходит. Веса обещают выложить к 27 июля 2026.
Открытые модели догоняли закрытый фронтир давно, но обычно с отставанием на поколение. Kimi K3 сокращает разрыв до минимума: по данным Moonshot, модель проигрывает только двум самым сильным проприетарным моделям — Claude Fable 5 и GPT-5.6 Sol, и при этом стабильно обходит всё остальное, включая Claude Opus 4.8 и GPT-5.5. Разбираю, что внутри и почём.
Что такое Kimi K3?
Kimi K3 — флагманская модель Moonshot AI на 2,8 трлн параметров. Это первая открытая модель такого масштаба: по словам компании, девять из последних двенадцати месяцев именно модели Kimi держали верхнюю планку размеров среди open source.
Ключевые характеристики из анонса:
- 2,8 трлн параметров, MoE-архитектура с активацией 16 из 896 экспертов
- Контекст 1 млн токенов
- Нативная мультимодальность: текст, картинки и видео в одной модели
- Масштабирование примерно в 2,5 раза эффективнее, чем у Kimi K2
Важная оговорка: «открытая» пока означает «будет открытой». На старте модель доступна только через продукты Kimi и API, а полные веса обещают выложить к 27 июля 2026 вместе с техническим отчётом.
Как Kimi K3 выглядит на фоне Claude Fable 5 и GPT-5.6 Sol?
K3 уступает Claude Fable 5 и GPT-5.6 Sol.

Несколько показательных строк из полной таблицы:
| Бенчмарк | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE (кодинг) | 67.5 | 70.0 | 73.0 | 59.0 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp (агентный поиск) | 91.2 | 88.0 | 90.4 | 84.3 |
| GPQA-Diamond (знания) | 93.5 | 92.6 | 94.1 | 91.0 |
| HLE-Full | 43.5 | 53.3 | 44.5 | 49.8 |
В агентных задачах и долгих кодинг-сессиях K3 местами выходит на первое место (SWE Marathon, BrowseComp, Automation Bench). В чистом ризонинге модель держится рядом с лидерами, а вот на Humanity's Last Exam отстаёт ощутимо. И всё равно для открытой модели это территория, куда раньше никто не добирался.
К бенчмаркам от вендора всегда стоит относиться с поправкой: Moonshot сравнивает модели в разных харнессах (KimiCode, Claude Code, Codex), а результаты Claude Fable 5 частично получены с fallback на Opus 4.8, когда Fable отказывался выполнять задачи. Методология подробно расписана в футноутах анонса.
Что у Kimi K3 под капотом?
Главные архитектурные новинки — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). KDA отвечает за эффективное внимание на длинных последовательностях, AttnRes выборочно достаёт представления с разных глубин модели вместо равномерного накопления. Вместе они, по словам Moonshot, дают ту самую 2,5-кратную эффективность масштабирования по сравнению с K2.
Модель обучалась с quantization-aware training начиная со стадии SFT — веса MXFP4, активации MXFP8. Это сделано для совместимости с широким спектром железа. Для инференса Moonshot рекомендует суперноды от 64 ускорителей и уже законтрибьютила поддержку prefix caching для KDA в vLLM.
Что Kimi K3 делает в автономных сессиях?
Самая впечатляющая часть анонса — кейсы долгих автономных прогонов. Moonshot тестировала модели в одинаковых песочницах с лимитом до 24 часов на оптимизацию GPU-кернелов. K3 за 15 часов непрерывных итераций ускорила кернел AttnRes с 283,6 мс до 114,4 мс, придумав двухфазный алгоритм и сохранив численную точность. Результат на уровне Claude Fable 5, но K3 оптимизировала быстрее за итерацию.
Дальше больше. K3 с нуля написала MiniTriton — компактный Triton-подобный компилятор с собственным IR-слоем над MLIR и генерацией PTX. На roofline-бенчмарках он местами обгоняет сам Triton и выдерживает end-to-end обучение nanoGPT со стабильной сходимостью.
А в 48-часовом автономном прогоне K3 спроектировала чип под нано-модель на собственной архитектуре: open-source EDA-инструменты, библиотека Nangate 45nm, 4 мм², тайминг на 100 МГц и 8 700 токенов в секунду в симуляции. Чип, спроектированный моделью для модели. Про то, как нейросети впаивают в кремний всерьёз, я писал в обзоре Taalas ChatJimmy — а тут модель сама выступает в роли проектировщика.

Есть и более наглядные кейсы: браузерная 3D-игра с процедурной генерацией мира на Three.js WebGPU, интерактивный отчёт по 42 годам индустрии ASIC (2 800+ веб-запросов, 11 000+ страниц источников) и монтаж собственного тизера из 56 клипов с попаданием склеек в бит. Обычному монтажёру такой ролик стоил бы день-два работы.
Сколько стоит Kimi K3 и как попробовать?
Модель уже доступна на kimi.com, в Kimi Work, Kimi Code и через API. Цены по прайсу Kimi API: $0.30 за миллион входных токенов при попадании в кэш, $3.00 при промахе и $15.00 за миллион выходных. Для сравнения: это заметно дешевле закрытых флагманов, а кэш-хит в кодинг-задачах, по данным Moonshot, превышает 90%.
В терминале модель включается через Kimi Code командой /model. На старте K3 работает только с максимальным thinking effort, режимы попроще обещают добавить позже.
Какие у Kimi K3 ограничения?
Во-первых, модель обучена в режиме сохранения истории размышлений: если харнесс не передаёт thinking-контент обратно или вы переключаетесь на K3 посреди сессии с другой моделью, генерация может стать нестабильной. Во-вторых, K3 склонна к самодеятельности: при неоднозначной задаче она принимает решения за пользователя. Лечится это явными ограничениями в системном промпте или AGENTS.md. В-третьих, сама компания признаёт заметный разрыв в пользовательском опыте с Claude Fable 5 и GPT-5.6 Sol.
Что ещё почитать
- GPT-5.6 Sol, Terra и Luna: новое поколение OpenAI — один из двух главных конкурентов K3 из таблицы бенчмарков
- Claude Sonnet 5: агентность как у Opus, но дешевле — как Anthropic удешевляет агентные сценарии
- Taalas ChatJimmy: нейросеть, впаянная в кремний — продолжение темы «модель и железо», только с другой стороны