Taalas ChatJimmy: нейросеть, впаянная в кремний
Команда ветеранов Tenstorrent и AMD впаяла нейросеть в кремний. Чип HC1 выдаёт до 17 000 токенов в секунду, но так ли это полезно?
TL;DR: Стартап Taalas из Торонто впаял нейросеть Llama 3.1 8B прямо в кремний (чип HC1) и сделал демо-чат ChatJimmy, который выдаёт до 17 000 токенов в секунду. Это на порядок быстрее видеокарт и в разы экономичнее, но модель внутри старая и регулярно ошибается. Главное тут не сам чат, а заявка: ИИ может стать дешёвой железкой, а не вечной облачной подпиской.
Заходишь на chatjimmy.ai, пишешь вопрос, жмёшь Enter и ответ уже там. Не «быстро печатается по буковке», а просто появляется целиком, будто страницу подготовили заранее. Первая мысль: что-то глюкнуло. Вторая: так вот как выглядит инференс, когда модель не прогоняют через GPU, а вшивают в сам чип.
Что такое ChatJimmy и кто такие Taalas
ChatJimmy сам по себе примитивный: голое поле ввода, счётчик токенов и подпись «How can I help you today?». Никаких настроек, регистрации и тарифов. Это витрина, а не продукт. За ней стоит куда более интересная штука, чип HC1 от компании Taalas.
Taalas основали в Торонто осенью 2023 года три выходца из Tenstorrent: Любиша Баич (CEO, до этого он же основал Tenstorrent и успел поработать архитектором чипов в AMD и год в Nvidia), его жена Лейла Баич (COO) и Драго Игнятович (CTO). Команда маленькая, 24 человека. В феврале 2026-го они разом показали чип, демо-чат, манифест и подняли раунд на 169 млн долларов, доведя общий объём инвестиций примерно до 219 млн (Reuters). Любопытная деталь: на разработку первого чипа ушло всего около 30 млн из этих денег.
Слоган у них прямой: «The model is the computer». Идея в том, что нейросеть не должна жить как софт поверх универсального железа. Она сама должна стать железом.
Как нейросеть впаивают прямо в кремний
Чтобы понять, в чём фокус, надо вспомнить, почему обычный инференс медленный. На видеокарте веса модели лежат в памяти (HBM или VRAM), и на каждый сгенерированный токен их нужно тащить из памяти в вычислительные блоки и обратно, слой за слоем. Эта «стена памяти» и есть главное узкое место.
Taalas убирает память как отдельную сущность. Веса Llama 3.1 8B зашиты прямо в транзисторы чипа. По словам Баича в интервью The Next Platform, один транзистор хранит четырёхбитный вес и сразу выполняет умножение на него. Вход просто протекает через слои транзисторов, как вода по трубам. Отдельной загрузки весов нет, потому что весам некуда загружаться, они и есть схема.

Сам HC1 сделан на 6-нанометровом техпроцессе TSMC, это кристалл площадью 815 мм² с 53 млрд транзисторов (спеки Taalas). Llama внутри хранится в урезанном виде, смесь 3- и 6-битных параметров, плюс немного SRAM на чипе под контекст и кэш. Один чип потребляет около 250 ватт, целый сервер примерно 2,5 кВт и стоит в обычной воздушной стойке, без жидкостного охлаждения и стопок памяти.
Тут важное отличие от других «убийц Nvidia». Groq и Cerebras делают универсальные ускорители: на них можно скомпилировать любую модель. Taalas намертво зашивает одну конкретную модель. Отсюда и выигрыш в скорости, и главная слабость, о которой ниже.
17 000 токенов в секунду: это вообще много?
Очень. Для одного пользователя на модели такого класса это запредельная цифра. Вот как HC1 выглядит на фоне остальных на той же Llama 3.1 8B:
| Железо | Токенов/с на пользователя |
|---|---|
| Taalas HC1 | ~15 000–17 000 |
| Nvidia H200 | ~2 000 |
| Cerebras | ~2 000 |
| Groq | ~600 |
Цифры конкурентов Taalas мерил сам, так что относиться к ним стоит с поправкой на заинтересованность. Но даже независимые замеры впечатляют: журналисты EE Times в живом демо стабильно видели больше 15 000 токенов в секунду, а заявленные 17 000 это внутренний пик. Запрос обрабатывается меньше чем за 30 миллисекунд, поэтому ответ и кажется мгновенным.
Помимо скорости Taalas обещает примерно в 10 раз меньше энергии на токен и в 20 раз более дешёвое производство. Аналитик Карл Фройнд в Forbes оценил отрыв осторожнее, в один-два порядка по производительности. Кстати, если тебе где-то попадалась цифра «в 1000 раз эффективнее», это преувеличение из пересказов. Сама Taalas про тысячекратный отрыв не заявляет, реалистичная оценка по энергии на токен ближе к стократной.
Если так быстро, почему Jimmy тупит?
А вот это честная часть. Скорость впечатляет, качество ответов нет. Классический пример из обсуждений на Hacker News: спрашиваешь, сколько букв «r» в слове strawberry, получаешь «две» за одну тысячную секунды. Кто-то метко назвал Jimmy цифровым спиннером для рук, красиво крутится, толку ноль.
Причин несколько, и все они упираются в саму концепцию. Внутри Llama 3.1 8B, открытая модель почти двухлетней давности, да ещё и сжатая до 3 бит. Контекст в демо упирается примерно в 6 тысяч токенов, длинный документ туда не положишь. И поскольку модель буквально отлита в кремнии, поменять её нельзя. Новая модель означает новый чип. Taalas говорит, что путь от весов до готового железа занимает около двух месяцев, но на фоне моделей, которые обновляются каждые пару месяцев, это много.
Поэтому и относиться к Jimmy стоит как к демонстратору идеи. Рабочего ассистента из него пока не сделали, доступ дают через бесплатное демо и заявку на API. Защитники на том же HN повторяют мысль, которая звучит разумно: чип тупит не потому, что подход плохой, а потому, что в него зашили маленькую старую модель. Зашей модель побольше, и она будет работать примерно так же быстро, но отвечать заметно умнее.
Что model-on-silicon значит для будущего ИИ
Вот ради чего стоит смотреть на ChatJimmy. Не ради ответов Jimmy, а ради траектории.
В своём манифесте Taalas проводит аналогию с историей вычислений. Универсальные компьютеры стали массовыми, когда подешевели и упростились до транзистора. С ИИ, по их логике, должно случиться то же самое: из дорогой штуки, которая живёт в датацентрах, он превращается в дешёвый компонент, помещающийся в слот PCIe. Думаю, аналогия натянута ровно настолько, насколько вдохновляет, но направление мысли понятное.
Самый живой нерв всей дискуссии не про скорость, а про деньги и контроль. Сейчас почти весь ИИ это аренда: ты платишь за токены и подписки, а железо чужое и стоит в чужом облаке. Если модель уровня Llama или Qwen можно зашить в доступный чип и держать у себя дома или в офисной стойке, вопрос «зачем платить за API» становится неудобным. ИИ как прибор, который купил и пользуешься, а не как счётчик, который тикает. Для приватных данных это вообще другой разговор, я как-то разбирал локальный запуск моделей для работы с персональными данными, и там вся боль именно в том, что серьёзный инференс тяжело утащить с облака на свою машину.
Дальше начинается интересное. Когда токены почти бесплатны и появляются мгновенно, открываются сценарии, которые на медленном железе бессмысленны:
- голосовые ассистенты, отвечающие без паузы, разговор как с живым человеком;
- роботы, дроны и автомобили, где задержка критична;
- спекулятивное декодирование, когда быстрая модель набрасывает черновик ответа для большой и умной (это, к слову, родственник трюка с MTP-драфтерами, которым Google ускорил Gemma 4, только на уровне железа);
- агентные циклы, где модель генерирует сотню вариантов решения и выбирает лучший;
- массовая обработка данных: классификация, чистка персональных данных, превращение хаоса в таблицы.
Для всего этого не нужна гениальная модель, нужна быстрая и дешёвая. И вот тут «тупой, но молниеносный» чип внезапно перестаёт быть игрушкой.
Стоит ли паниковать Nvidia? Вердикт
Если коротко: пока нет. Заголовки про «убийцу Nvidia» и «в 74 раза быстрее B200» это маркетинг и хайп СМИ, сама Taalas формулирует аккуратнее. HC1 умеет только инференс, обучать модели всё равно нужно на универсальных GPU. Трезвая оценка с того же Hacker News звучит как «это конкурент не для Nvidia целиком, а максимум для 5–10% рынка», и она мне кажется честной.
Но списывать тоже глупо. Перед нами не презентация и не whitepaper, а работающий чип от команды, которая собаку съела на проектировании процессоров в AMD, Nvidia и Tenstorrent, да ещё и с 219 млн долларов за спиной. Они доказали, что модель реально можно отлить в кремний и получить скорость, которой у видеокарт нет и близко. Дальше вопрос инженерный: получится ли так же зашить модель побольше, договориться с темпом, в котором ИИ устаревает, и не утонуть в горах быстро протухающих чипов.
Кому стоит потыкать ChatJimmy прямо сейчас: всем, кому интересно, куда катится железо для ИИ. Это редкий случай, когда можно своими руками пощупать идею, которая может оказаться важной через пару лет. Кому не стоит: тем, кто ищет рабочий аналог ChatGPT, тут его нет и не планировалось. Воспринимай Jimmy как демо из будущего, у которого пока не подвезли мозги.
Я бы за этим следил. Не из-за Jimmy, а из-за того, что он намекает: ИИ потихоньку нащупывает путь от облачной услуги к вещи, которую просто покупаешь.
Частые вопросы
Что такое model-on-silicon простыми словами? Это подход, при котором веса нейросети физически встроены в транзисторы чипа, а не загружаются из памяти во время работы. Модель перестаёт быть программой и становится самой схемой. За счёт этого пропадает главный тормоз инференса, постоянная пересылка весов между памятью и вычислителем.
Можно ли купить чип HC1 или Jimmy? Нет. HC1 это демонстратор технологии, в продажу он не поступил. Доступен бесплатный демо-чат на chatjimmy.ai и форма заявки на доступ к API. Полноценный коммерческий продукт Taalas обещает на следующей платформе, HC2.
Заменит ли Taalas видеокарты Nvidia? В обозримом будущем нет. HC1 делает только инференс и только одной зашитой модели, а обучение и универсальные задачи остаются за GPU. Речь идёт скорее об отдельной нише сверхбыстрого дешёвого инференса, а не о замене Nvidia целиком.
Что ещё почитать
- Anthropic и SpaceX: 220 тысяч GPU ради лимитов Claude — другой полюс индустрии, где ставку делают на гигантские GPU-кластеры
- Gemma 4 ускорили в 3 раза с помощью MTP-драфтеров — как ускоряют инференс софтом, а не железом
- Как запустить OpenAI Privacy Filter локально — про локальный инференс и зачем он нужен для приватных данных
- DeepSeek V4 Pro: обзор открытой модели для кодинга — из таких открытых моделей и «отливают» чипы вроде HC1