Kimi K3: открытая модель на 2,8 трлн параметров

Moonshot AI выпустила первую открытую модель класса 3T. Что показывают бенчмарки против Claude Fable 5 и GPT-5.6 Sol и сколько стоит API.

Kimi K3: открытая модель на 2,8 трлн параметров
TL;DR: Moonshot AI выпустила Kimi K3 — первую открытую модель класса 3T: 2,8 трлн параметров, нативное зрение и контекст 1 млн токенов. По бенчмаркам она уступает только Claude Fable 5 и GPT-5.6 Sol, а остальных обходит. Веса обещают выложить к 27 июля 2026.

Открытые модели догоняли закрытый фронтир давно, но обычно с отставанием на поколение. Kimi K3 сокращает разрыв до минимума: по данным Moonshot, модель проигрывает только двум самым сильным проприетарным моделям — Claude Fable 5 и GPT-5.6 Sol, и при этом стабильно обходит всё остальное, включая Claude Opus 4.8 и GPT-5.5. Разбираю, что внутри и почём.

Что такое Kimi K3?

Kimi K3 — флагманская модель Moonshot AI на 2,8 трлн параметров. Это первая открытая модель такого масштаба: по словам компании, девять из последних двенадцати месяцев именно модели Kimi держали верхнюю планку размеров среди open source.

Ключевые характеристики из анонса:

  • 2,8 трлн параметров, MoE-архитектура с активацией 16 из 896 экспертов
  • Контекст 1 млн токенов
  • Нативная мультимодальность: текст, картинки и видео в одной модели
  • Масштабирование примерно в 2,5 раза эффективнее, чем у Kimi K2

Важная оговорка: «открытая» пока означает «будет открытой». На старте модель доступна только через продукты Kimi и API, а полные веса обещают выложить к 27 июля 2026 вместе с техническим отчётом.

Как Kimi K3 выглядит на фоне Claude Fable 5 и GPT-5.6 Sol?

K3 уступает Claude Fable 5 и GPT-5.6 Sol.

Сравнение Kimi K3 с Claude Fable 5, GPT-5.6 Sol и другими моделями на бенчмарках

Несколько показательных строк из полной таблицы:

Бенчмарк Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE (кодинг) 67.5 70.0 73.0 59.0
Terminal Bench 2.1 88.3 84.6 88.8 84.6
SWE Marathon 42.0 35.0 39.0 40.0
BrowseComp (агентный поиск) 91.2 88.0 90.4 84.3
GPQA-Diamond (знания) 93.5 92.6 94.1 91.0
HLE-Full 43.5 53.3 44.5 49.8

В агентных задачах и долгих кодинг-сессиях K3 местами выходит на первое место (SWE Marathon, BrowseComp, Automation Bench). В чистом ризонинге модель держится рядом с лидерами, а вот на Humanity's Last Exam отстаёт ощутимо. И всё равно для открытой модели это территория, куда раньше никто не добирался.

К бенчмаркам от вендора всегда стоит относиться с поправкой: Moonshot сравнивает модели в разных харнессах (KimiCode, Claude Code, Codex), а результаты Claude Fable 5 частично получены с fallback на Opus 4.8, когда Fable отказывался выполнять задачи. Методология подробно расписана в футноутах анонса.

Что у Kimi K3 под капотом?

Главные архитектурные новинки — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes). KDA отвечает за эффективное внимание на длинных последовательностях, AttnRes выборочно достаёт представления с разных глубин модели вместо равномерного накопления. Вместе они, по словам Moonshot, дают ту самую 2,5-кратную эффективность масштабирования по сравнению с K2.

Модель обучалась с quantization-aware training начиная со стадии SFT — веса MXFP4, активации MXFP8. Это сделано для совместимости с широким спектром железа. Для инференса Moonshot рекомендует суперноды от 64 ускорителей и уже законтрибьютила поддержку prefix caching для KDA в vLLM.

Что Kimi K3 делает в автономных сессиях?

Самая впечатляющая часть анонса — кейсы долгих автономных прогонов. Moonshot тестировала модели в одинаковых песочницах с лимитом до 24 часов на оптимизацию GPU-кернелов. K3 за 15 часов непрерывных итераций ускорила кернел AttnRes с 283,6 мс до 114,4 мс, придумав двухфазный алгоритм и сохранив численную точность. Результат на уровне Claude Fable 5, но K3 оптимизировала быстрее за итерацию.

Дальше больше. K3 с нуля написала MiniTriton — компактный Triton-подобный компилятор с собственным IR-слоем над MLIR и генерацией PTX. На roofline-бенчмарках он местами обгоняет сам Triton и выдерживает end-to-end обучение nanoGPT со стабильной сходимостью.

А в 48-часовом автономном прогоне K3 спроектировала чип под нано-модель на собственной архитектуре: open-source EDA-инструменты, библиотека Nangate 45nm, 4 мм², тайминг на 100 МГц и 8 700 токенов в секунду в симуляции. Чип, спроектированный моделью для модели. Про то, как нейросети впаивают в кремний всерьёз, я писал в обзоре Taalas ChatJimmy — а тут модель сама выступает в роли проектировщика.

Процедурный 3D-мир с лесами, деревней и горами, который Kimi K3 собрала на Three.js WebGPU

Есть и более наглядные кейсы: браузерная 3D-игра с процедурной генерацией мира на Three.js WebGPU, интерактивный отчёт по 42 годам индустрии ASIC (2 800+ веб-запросов, 11 000+ страниц источников) и монтаж собственного тизера из 56 клипов с попаданием склеек в бит. Обычному монтажёру такой ролик стоил бы день-два работы.

✈️
Слежу за гонкой открытых моделей с закрытым фронтиром и разбираю такие релизы по горячим следам — подписывайся в телеге.

Сколько стоит Kimi K3 и как попробовать?

Модель уже доступна на kimi.com, в Kimi Work, Kimi Code и через API. Цены по прайсу Kimi API: $0.30 за миллион входных токенов при попадании в кэш, $3.00 при промахе и $15.00 за миллион выходных. Для сравнения: это заметно дешевле закрытых флагманов, а кэш-хит в кодинг-задачах, по данным Moonshot, превышает 90%.

В терминале модель включается через Kimi Code командой /model. На старте K3 работает только с максимальным thinking effort, режимы попроще обещают добавить позже.

Kimi K3 — попробовать бесплатно
Чат с Kimi K3 на kimi.com, агентные задачи, Kimi Work и Kimi Code. Модель доступна с максимальным thinking effort.

Какие у Kimi K3 ограничения?

Во-первых, модель обучена в режиме сохранения истории размышлений: если харнесс не передаёт thinking-контент обратно или вы переключаетесь на K3 посреди сессии с другой моделью, генерация может стать нестабильной. Во-вторых, K3 склонна к самодеятельности: при неоднозначной задаче она принимает решения за пользователя. Лечится это явными ограничениями в системном промпте или AGENTS.md. В-третьих, сама компания признаёт заметный разрыв в пользовательском опыте с Claude Fable 5 и GPT-5.6 Sol.

Что ещё почитать