AssemblyAI Universal-3.5: распознавание речи для агентов
Новая стриминговая модель AssemblyAI в раннем доступе. Что умеет Universal-3.5 Pro Realtime и стоит ли брать её для голосового агента.
TL;DR: AssemblyAI открыла ранний доступ к Universal-3.5 Pro Realtime — новой стриминговой модели распознавания речи для голосовых агентов. Главное: определение конца реплики около 300 мс, три режима под скорость или точность, память разговора и фокус на основном спикере. Пока это preview, и цифры идут от самой AssemblyAI, но для тех, кто строит голосовых агентов, заявка серьёзная.
Мне на почту упало приглашение в ранний доступ к Universal-3.5 Pro Realtime. Если ты когда-нибудь делал голосового агента, то знаешь: узкое место почти всегда одно, и это ритм. Качество распознавания давно приличное, а вот паузы и перебивания всё портят. Пока модель слушает и решает, договорил человек или просто задумался, агент молчит или, наоборот, влезает посреди фразы. Universal-3.5 целится ровно в эту боль.
Что такое Universal-3.5 Pro Realtime?
Это стриминговая модель распознавания речи (speech-to-text) от AssemblyAI, продолжение линейки Universal-3 Pro. Базовую версию Universal-3 Pro Streaming компания выпустила в марте 2026, а дальше несколько месяцев докручивала по кусочкам: диаризация спикеров, режимы задержки, передача контекста, 19 языков. Universal-3.5 Pro Realtime собирает эти наработки в один флагман и добавляет пару новых вещей. Сейчас доступна в preview по приглашению.
Задача у неё простая на словах и сложная на деле. Распознать живую речь за доли секунды и отдать текст голосовому агенту так, чтобы тот отвечал в темп разговора, не перебивал и не залипал на паузах. Французский и португальский, кстати, уже работают на флагманской точности, так что это не «английская» модель с прикрученными языками.
Почему задержка решает всё для голосового агента
Когда говоришь с голосовым ботом, бесит обычно не то, что он не расслышал слово. Бесит ритм. Делаешь паузу подумать — бот влезает. Договорил — бот тупит секунду, прежде чем ответить. Виновата здесь не «тупость» модели, а end-of-turn detection: момент, когда система решает, что твоя реплика закончилась.
AssemblyAI заявляет определение конца реплики в районе 300 мс. Для контекста: задержка до первого транскрипта у Universal-3 Pro на дефолтных настройках около 800 мс, но падает примерно до 300 мс с параметром interruption_delay: 0 (из changelog). Сама расшифровка идёт с P50 около 150 мс и P90 около 240 мс после того, как система поймала конец фразы (данные из блога). На практике это значит, что агент отвечает почти в темп живого диалога. Задержку в треть секунды человек почти не замечает.
Под разные задачи модель даёт три режима: min_latency, balanced и max_accuracy. Один и тот же endpoint, переключаешь режим под сценарий. Для агента в реальном времени берёшь min_latency и жертвуешь долей точности ради скорости. Для постобработки записи звонка ставишь max_accuracy, где спешить некуда, а ошибаться нельзя. Это удобнее, чем держать две разные модели под два сценария.
Что нового: Context Carryover и Voice Focus
Две фичи, которых в мартовском релизе не было.
Context Carryover держит реплику в контексте разговора. Через параметр agent_context ты передаёшь модели, что сейчас делает твой агент и в каком состоянии беседа, а скользящая память удерживает нить диалога. Звучит абстрактно, но на практике это меньше ошибок в словах, которые понятны только из контекста: имена, термины, числа, к чему относится «он» или «это». Модель распознаёт не голую звуковую дорожку, а реплику внутри разговора.
Voice Focus изолирует основного спикера. Фоновые голоса (телевизор, коллеги в опенспейсе, разговор на улице) не превращаются в фантомные слова и, что важнее для агента, не считаются попыткой перебить. Если ты делаешь голосового ассистента, который работает не в студии, а в реальной шумной комнате, это разница между «агент слушает тебя» и «агент реагирует на чужую речь из телевизора».
Сколько языков понимает и есть ли русский?
Universal-3.5 распознаёт 19 языков на флагманской точности. К английскому, испанскому, немецкому, французскому, итальянскому и португальскому в июне добавили турецкий, нидерландский, шведский, норвежский, датский, финский, хинди, вьетнамский, арабский, иврит, японский, урду и китайский. Плюс code-switching — переключение языка прямо посреди фразы, без сброса распознавания. И параметр language_code, чтобы зафиксировать язык, если ты знаешь его заранее: так быстрее и точнее, чем гонять автоопределение.
Теперь честно про русский. В стриминговом списке из 19 языков его нет. На асинхронной транскрипции (готовые записи) AssemblyAI поддерживает под сотню языков, русский там есть, но realtime-флагман его пока не покрывает. Для русскоязычного голосового агента это прямой стоп-фактор. Если проект на русском, придётся смотреть конкурентов — тот же Soniox v5 я разбирал отдельно.
Как подключить Universal-3.5
Отдельного гайда под 3.5 пока нет, она в preview. Но механика та же, что у Universal-3 Pro Streaming:
- Зарегистрируйся в AssemblyAI и возьми API-ключ в дашборде.
- Открой WebSocket-соединение к стриминговому endpoint и укажи модель через
speech_model. Для preview проще всего зайти в playground в дашборде и потыкать 3.5 без единой строчки кода. - Лей аудио в сокет чанками (обычно PCM16, 16 кГц), получай в ответ частичные и финальные транскрипты.
- Настрой поведение под агента: режим
min_latency,interruption_delayпод нужную агрессивность перебивания,agent_contextс состоянием разговора. - Лови сообщения о конце реплики, чтобы понимать, когда пора передавать текст в LLM.
Если возиться со связкой распознавание-LLM-синтез отдельно не хочется, у AssemblyAI есть Voice Agent API: один endpoint, аудио на вход и аудио на выход, по единому тарифу. Под капотом там как раз Universal-3 Pro Streaming.
Сколько стоит AssemblyAI Universal-3.5?
Цену на саму preview-модель AssemblyAI отдельно не называет, но линейка Universal-3 Pro Streaming стоит так:
| Модель | Цена | Языки |
|---|---|---|
| Universal-3 Pro Streaming | $0.45/час | 19 |
| Universal Streaming | $0.15/час | английский |
| Universal Streaming Multilingual | $0.15/час | 6 |
К Pro-тарифу стекаются доплаты за то, чем реально пользуешься: диаризация спикеров +$0.12/час, prompting в бете +$0.05/час. Биллинг идёт по длительности сессии, жёстких лимитов на параллельные потоки нет (из описания продукта). Отдельно стоит Voice Agent API, $4.50/час all-in, и сюда уже зашиты распознавание, LLM и синтез.
В пересчёте $0.45/час — это $0.0075 за минуту. Час разговоров в день выйдет примерно в $13–14 в месяц только на распознавание. Не самый дешёвый вариант: Universal Streaming втрое дешевле. Но Pro-линейка и не претендует на дешевизну, она про точность.
Universal-3.5 против Soniox v5 и Deepgram
AssemblyAI давит на точность диаризации и turn-taking. По их собственным бенчмаркам против Deepgram Nova-3 (ближайший конкурент) Universal-3 Pro выдаёт в 2 раза лучше cpWER на телефонии с двумя спикерами, на 13% лучше на встречах с четырьмя и на 91% меньше фантомных слов, приписанных несуществующим спикерам. Цифры эффектные, но это замеры самого вендора на своих данных. На своём аудио проверяй сам.
Что такое cpWER?
cpWER — доля ошибок в словах с поправкой на то, какому спикеру они приписаны: метрика штрафует и за неверное слово, и за неверного говорящего. Чем ниже, тем лучше.
Soniox v5 Real-Time, который я недавно разбирал, играет в той же лиге realtime-STT для агентов и берёт в первую очередь языковым охватом. Если совсем коротко: AssemblyAI 3.5 — это про предсказуемый turn-taking и тонкую настройку задержки под агента, Soniox — про языки и цену. Для русскоязычного проекта выбор сейчас не в пользу AssemblyAI просто потому, что русского в realtime у неё нет. Deepgram при этом остаётся самым дешёвым и быстрым рабочим конём, но по точности диаризации AssemblyAI его, судя по цифрам, обходит.
Стоит ли брать: вердикт
Если строишь голосового агента на английском или одном из 19 поддержанных языков, Universal-3.5 Pro Realtime стоит поставить в очередь на тест. Сильная сторона очевидна: AssemblyAI заморочилась ровно тем, что ломает ощущение живого диалога — моментом конца реплики, перебиваниями, фоновыми голосами. Режимы задержки и agent_context звучат как маркетинг, но в проде это ровно те ручки, которые крутишь, чтобы агент звучал естественно.
Что настораживает. Это preview, и все красивые цифры пока идут от самой AssemblyAI, независимых замеров на грязном продакшен-аудио нет. Русского в realtime нет вообще, так что для местных проектов модель сразу мимо. И $0.45/час — не для экономных: если точность диаризации некритична, Universal Streaming или Deepgram обойдутся втрое дешевле.
Мне эта линейка нравится тем, что собрана именно под агентов, а не как очередной универсальный STT. Но брать вслепую по пресс-релизу я бы не стал, дождусь общего доступа и погоняю на живых звонках. А вот если делаешь англоязычного агента и тебе важен ритм разговора, в early access податься точно стоит, там есть на что смотреть.
FAQ
Universal-3.5 Pro Realtime уже доступна всем? Нет, пока это preview по приглашению (early access). Публичной страницы и финальных цен на саму 3.5 ещё нет. Базовая Universal-3 Pro Streaming при этом доступна с марта 2026.
Поддерживает ли Universal-3.5 русский язык? В realtime-стриминге нет: список ограничен 19 языками, русского среди них пока нет. На асинхронной транскрипции готовых записей русский поддерживается. Для голосового агента на русском это стоп-фактор.
Чем 3.5 отличается от Universal-3 Pro Streaming? Universal-3.5 собирает все обновления линейки (диаризация, режимы задержки, 19 языков, agent_context) в один релиз и добавляет две новые фичи: Context Carryover (память разговора) и Voice Focus (изоляция основного спикера от фоновых голосов).
Что ещё почитать
- Soniox v5 Real-Time: распознавание речи для агентов — прямой конкурент в realtime-STT, сильный в языках
- Gemini 3.1 Flash Live: голосовые агенты Google стали точнее — голосовой стек от Google
- Microsoft MAI: три модели для голоса, транскрипции и картинок — альтернативный набор моделей для речи
- Voice Studio Companion — озвучка из меню-бара Mac — вторая половина голосового стека, синтез речи