Nemotron 3.5 Lightning: быстрая открытая модель для агентов
NVIDIA открыла MoE-модель на 30 млрд параметров с 3 млрд активных: 670 токенов в секунду, свободная лицензия, открытые данные обучения и запуск на одной видеокарте.
TL;DR: NVIDIA выложила Nemotron 3.5 Lightning, открытую MoE-модель на 30 млрд параметров с 3 млрд активных. Лицензия OpenMDW-1.1 разрешает коммерческое использование, веса и рецепты обучения тоже открыты. Модель запускается на одной видеокарте и выдаёт около 670 токенов в секунду. Заточена под роль исполнителя в агентских связках, а не под роль главного мозга.
Что за модель и зачем она нужна
Nemotron 3.5 Lightning вышла 11 августа 2026 года. Это Mixture-of-Experts на 30 млрд параметров, из которых на каждый токен активируются примерно 3 млрд (NVIDIA Technical Blog). Независимый замер Artificial Analysis даёт чуть другие цифры, 31,6 млрд общих и 3,6 млрд активных, так что круглые числа в блоге NVIDIA слегка причёсаны.
Архитектура гибридная, Mamba плюс трансформер, унаследована от Nemotron 3 Nano. Контекст 1 млн токенов.
Позиционирование у модели узкое, и это как раз хорошо. NVIDIA не пытается продать её как замену фронтирным моделям. Lightning делали для слоя исполнения в агентах: когда планирование ушло к большой модели, а дальше надо много раз быстро и дёшево делать понятные шаги.
Насколько она умная
По индексу интеллекта Artificial Analysis Lightning набирает 24 балла. Для сравнения: Nemotron 3 Nano набирал 15, Nemotron 3 Super набирает 26, GPT-OSS-120B тоже 24.
То есть по уму это уровень GPT-OSS-120B при примерно вчетверо меньшем размере. Прирост в 9 пунктов над предыдущим Nano внутри той же архитектуры выглядит солидно.
| Модель | Индекс интеллекта Artificial Analysis |
|---|---|
| Nemotron 3 Nano | 15 |
| Nemotron 3.5 Lightning | 24 |
| GPT-OSS-120B | 24 |
| Nemotron 3 Super | 26 |
На агентских бенчмарках картина такая. GDPval-AA v2 Elo 824, это выше и Nemotron 3 Super, и GPT-OSS-120B. Terminal-Bench v2.1 показывает 24% против 7% у Nano. Комментировать 24% на Terminal-Bench как «хороший результат» я бы не стал, фронтирные модели там сильно выше, но для 3 млрд активных параметров скачок втрое за одно поколение заметный.
Скорость
Главная цифра модели не про ум, а про темп. На эндпоинте DeepInfra Artificial Analysis намерил почти 670 токенов в секунду.
В переводе на задачи: одну задачу из набора Intelligence Index Lightning проходит примерно за 0,5 минуты. Qwen3.6 35B на той же задаче тратит около 3,5 минут, Gemma 4 31B около 5,8 минут.
NVIDIA отдельно заявляет, что на PinchBench модель держит 86% точности, проходя 10 000 задач на 30% быстрее, чем Qwen3.6 35B.
В предобучение вшили multi-token prediction для спекулятивного декодирования, в комплекте идут черновые модели DSpark и DFlash под разную нагрузку. Плюс чекпойнты в NVFP4 и BF16.
Что открыли и на чём это запускается
Лицензия OpenMDW-1.1, разрешает коммерческое использование без существенных ограничений. Открыли не только веса, но и данные обучения с рецептами. Это редкость: большинство «открытых» моделей отдают только веса.
Скачать можно с Hugging Face и ModelScope, потрогать без установки на build.nvidia.com и через OpenRouter.
NeMo Switchyard, про который зря говорят меньше
Вместе с моделью NVIDIA выпустила NeMo Switchyard, открытую библиотеку-роутер. Она разбирает шаги агентского воркфлоу и отправляет каждый той модели, которая для него подходит: планирование уходит к фронтирной модели, исполнение к Lightning.
Мне эта штука кажется интереснее самой модели. Одна модель на всю задачу экономически неудобна: платить за рассуждения топ-модели там, где надо просто дёрнуть три инструмента подряд, глупо. Роутер решает ровно эту проблему, и он не привязан жёстко к Nemotron.
Заодно это ложится в ту же логику, что и работа NVIDIA про агентский харнесс: результат агента определяется устройством системы вокруг моделей, а не выбором одной самой сильной.
Стоит ли брать
Если строишь агента и весь трафик гоняешь через Opus или GPT-5.6, посмотреть однозначно стоит. Не как на замену, а как на второй ярус: планирование оставить наверху, рутинные шаги свести вниз. Экономия тут считается легко, а качество на простых шагах почти не проседает.
Если нужна одна модель на всё, Lightning не подойдёт. 24 балла по индексу интеллекта это уверенный середняк.
Если гоняешь локально на своём железе, это один из самых интересных вариантов лета. Открытые данные и рецепты, свободная лицензия, работает на одной карте, скорость выше всех соседей по размеру.
Что ещё почитать
- Харнесс важнее модели: Opus 5 и 100% на ARC-AGI-3. Исследование NVIDIA о том, что обвязка агента решает больше выбора модели
- Kimi K3: открытая модель на 2,8 трлн параметров. Противоположный подход к открытым весам, ставка на размер
- GLM-5.3 от Z.ai: обзор модели. Ещё один сильный игрок в открытых моделях
- MiniMax M3 vs Kimi K2.7 vs GLM-5.2: что выбрать. Сравнение открытых моделей, если выбираешь под свою задачу