> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# AssemblyAI Universal-3.5: распознавание речи для агентов
- URL: https://matveev.tech/assemblyai-universal-3-5-pro-realtime/
- Published: 2026-07-22T11:39:59.000Z
- Updated: 2026-07-22T11:39:59.000Z
- Description: Новая стриминговая модель AssemblyAI в раннем доступе. Что умеет Universal-3.5 Pro Realtime и стоит ли брать её для голосового агента.
- Author: Pavel Matveev
- Tags: AI, Обзор, Агенты, Инструменты

> TL;DR: AssemblyAI открыла ранний доступ к Universal-3.5 Pro Realtime — новой стриминговой модели распознавания речи для голосовых агентов. Главное: определение конца реплики около 300 мс, три режима под скорость или точность, память разговора и фокус на основном спикере. Пока это preview, и цифры идут от самой AssemblyAI, но для тех, кто строит голосовых агентов, заявка серьёзная.

Мне на почту упало приглашение в ранний доступ к Universal-3.5 Pro Realtime. Если ты когда-нибудь делал голосового агента, то знаешь: узкое место почти всегда одно, и это ритм. Качество распознавания давно приличное, а вот паузы и перебивания всё портят. Пока модель слушает и решает, договорил человек или просто задумался, агент молчит или, наоборот, влезает посреди фразы. Universal-3.5 целится ровно в эту боль.

## Что такое Universal-3.5 Pro Realtime?

Это стриминговая модель распознавания речи (speech-to-text) от AssemblyAI, продолжение линейки Universal-3 Pro. Базовую версию [Universal-3 Pro Streaming](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech) компания выпустила в марте 2026, а дальше несколько месяцев докручивала по кусочкам: диаризация спикеров, режимы задержки, передача контекста, 19 языков. Universal-3.5 Pro Realtime собирает эти наработки в один флагман и добавляет пару новых вещей. Сейчас доступна в preview по приглашению.

Задача у неё простая на словах и сложная на деле. Распознать живую речь за доли секунды и отдать текст голосовому агенту так, чтобы тот отвечал в темп разговора, не перебивал и не залипал на паузах. Французский и португальский, кстати, уже работают на флагманской точности, так что это не «английская» модель с прикрученными языками.

## Почему задержка решает всё для голосового агента

Когда говоришь с голосовым ботом, бесит обычно не то, что он не расслышал слово. Бесит ритм. Делаешь паузу подумать — бот влезает. Договорил — бот тупит секунду, прежде чем ответить. Виновата здесь не «тупость» модели, а end-of-turn detection: момент, когда система решает, что твоя реплика закончилась.

AssemblyAI заявляет определение конца реплики в районе 300 мс. Для контекста: задержка до первого транскрипта у Universal-3 Pro на дефолтных настройках около 800 мс, но падает примерно до 300 мс с параметром `interruption_delay: 0` ([из changelog](https://www.assemblyai.com/changelog?ref=matveev.tech)). Сама расшифровка идёт с P50 около 150 мс и P90 около 240 мс после того, как система поймала конец фразы ([данные из блога](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech)). На практике это значит, что агент отвечает почти в темп живого диалога. Задержку в треть секунды человек почти не замечает.

💡

Грубый ориентир: в живом разговоре люди подхватывают реплику друг друга примерно за пятую долю секунды. Чем ближе голосовой агент к этому порогу, тем меньше ощущается, что говоришь с машиной.

Под разные задачи модель даёт три режима: `min_latency`, `balanced` и `max_accuracy`. Один и тот же endpoint, переключаешь режим под сценарий. Для агента в реальном времени берёшь `min_latency` и жертвуешь долей точности ради скорости. Для постобработки записи звонка ставишь `max_accuracy`, где спешить некуда, а ошибаться нельзя. Это удобнее, чем держать две разные модели под два сценария.

## Что нового: Context Carryover и Voice Focus

Две фичи, которых в мартовском релизе не было.

Context Carryover держит реплику в контексте разговора. Через параметр `agent_context` ты передаёшь модели, что сейчас делает твой агент и в каком состоянии беседа, а скользящая память удерживает нить диалога. Звучит абстрактно, но на практике это меньше ошибок в словах, которые понятны только из контекста: имена, термины, числа, к чему относится «он» или «это». Модель распознаёт не голую звуковую дорожку, а реплику внутри разговора.

Voice Focus изолирует основного спикера. Фоновые голоса (телевизор, коллеги в опенспейсе, разговор на улице) не превращаются в фантомные слова и, что важнее для агента, не считаются попыткой перебить. Если ты делаешь голосового ассистента, который работает не в студии, а в реальной шумной комнате, это разница между «агент слушает тебя» и «агент реагирует на чужую речь из телевизора».

## Сколько языков понимает и есть ли русский?

Universal-3.5 распознаёт 19 языков на флагманской точности. К английскому, испанскому, немецкому, французскому, итальянскому и португальскому в июне добавили турецкий, нидерландский, шведский, норвежский, датский, финский, хинди, вьетнамский, арабский, иврит, японский, урду и китайский. Плюс code-switching — переключение языка прямо посреди фразы, без сброса распознавания. И параметр `language_code`, чтобы зафиксировать язык, если ты знаешь его заранее: так быстрее и точнее, чем гонять автоопределение.

Теперь честно про русский. В стриминговом списке из 19 языков его нет. На асинхронной транскрипции (готовые записи) AssemblyAI поддерживает под сотню языков, русский там есть, но realtime-флагман его пока не покрывает. Для русскоязычного голосового агента это прямой стоп-фактор. Если проект на русском, придётся смотреть конкурентов — тот же [Soniox v5 я разбирал отдельно](https://matveev.tech/soniox-v5-real-time).

## Как подключить Universal-3.5

Отдельного гайда под 3.5 пока нет, она в preview. Но механика та же, что у Universal-3 Pro Streaming:

1. Зарегистрируйся в AssemblyAI и возьми API-ключ в дашборде.
2. Открой WebSocket-соединение к стриминговому endpoint и укажи модель через `speech_model`. Для preview проще всего зайти в [playground в дашборде](https://www.assemblyai.com/dashboard/playground/realtime?ref=matveev.tech) и потыкать 3.5 без единой строчки кода.
3. Лей аудио в сокет чанками (обычно PCM16, 16 кГц), получай в ответ частичные и финальные транскрипты.
4. Настрой поведение под агента: режим `min_latency`, `interruption_delay` под нужную агрессивность перебивания, `agent_context` с состоянием разговора.
5. Лови сообщения о конце реплики, чтобы понимать, когда пора передавать текст в LLM.

Если возиться со связкой распознавание-LLM-синтез отдельно не хочется, у AssemblyAI есть [Voice Agent API](https://www.assemblyai.com/blog/universal-3-pro-streaming?ref=matveev.tech): один endpoint, аудио на вход и аудио на выход, по единому тарифу. Под капотом там как раз Universal-3 Pro Streaming.

## Сколько стоит AssemblyAI Universal-3.5?

Цену на саму preview-модель AssemblyAI отдельно не называет, но линейка Universal-3 Pro Streaming стоит так:

| Модель                           | Цена      | Языки      |
| -------------------------------- | --------- | ---------- |
| Universal-3 Pro Streaming        | $0.45/час | 19         |
| Universal Streaming              | $0.15/час | английский |
| Universal Streaming Multilingual | $0.15/час | 6          |

К Pro-тарифу стекаются доплаты за то, чем реально пользуешься: диаризация спикеров +$0.12/час, prompting в бете +$0.05/час. Биллинг идёт по длительности сессии, жёстких лимитов на параллельные потоки нет ([из описания продукта](https://www.assemblyai.com/products/streaming-speech-to-text?ref=matveev.tech)). Отдельно стоит Voice Agent API, $4.50/час all-in, и сюда уже зашиты распознавание, LLM и синтез.

В пересчёте $0.45/час — это $0.0075 за минуту. Час разговоров в день выйдет примерно в $13–14 в месяц только на распознавание. Не самый дешёвый вариант: Universal Streaming втрое дешевле. Но Pro-линейка и не претендует на дешевизну, она про точность.

✈️

Разбираю голосовые модели и инструменты для агентов по мере выхода — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Universal-3.5 против Soniox v5 и Deepgram

AssemblyAI давит на точность диаризации и turn-taking. По их собственным бенчмаркам против Deepgram Nova-3 (ближайший конкурент) Universal-3 Pro выдаёт в 2 раза лучше cpWER на телефонии с двумя спикерами, на 13% лучше на встречах с четырьмя и на 91% меньше фантомных слов, приписанных несуществующим спикерам. Цифры эффектные, но это замеры самого вендора на своих данных. На своём аудио проверяй сам.

#### Что такое cpWER?

cpWER — доля ошибок в словах с поправкой на то, какому спикеру они приписаны: метрика штрафует и за неверное слово, и за неверного говорящего. Чем ниже, тем лучше.

[Soniox v5 Real-Time](https://matveev.tech/soniox-v5-real-time), который я недавно разбирал, играет в той же лиге realtime-STT для агентов и берёт в первую очередь языковым охватом. Если совсем коротко: AssemblyAI 3.5 — это про предсказуемый turn-taking и тонкую настройку задержки под агента, Soniox — про языки и цену. Для русскоязычного проекта выбор сейчас не в пользу AssemblyAI просто потому, что русского в realtime у неё нет. Deepgram при этом остаётся самым дешёвым и быстрым рабочим конём, но по точности диаризации AssemblyAI его, судя по цифрам, обходит.

## Стоит ли брать: вердикт

Если строишь голосового агента на английском или одном из 19 поддержанных языков, Universal-3.5 Pro Realtime стоит поставить в очередь на тест. Сильная сторона очевидна: AssemblyAI заморочилась ровно тем, что ломает ощущение живого диалога — моментом конца реплики, перебиваниями, фоновыми голосами. Режимы задержки и `agent_context` звучат как маркетинг, но в проде это ровно те ручки, которые крутишь, чтобы агент звучал естественно.

Что настораживает. Это preview, и все красивые цифры пока идут от самой AssemblyAI, независимых замеров на грязном продакшен-аудио нет. Русского в realtime нет вообще, так что для местных проектов модель сразу мимо. И $0.45/час — не для экономных: если точность диаризации некритична, Universal Streaming или Deepgram обойдутся втрое дешевле.

Мне эта линейка нравится тем, что собрана именно под агентов, а не как очередной универсальный STT. Но брать вслепую по пресс-релизу я бы не стал, дождусь общего доступа и погоняю на живых звонках. А вот если делаешь англоязычного агента и тебе важен ритм разговора, в early access податься точно стоит, там есть на что смотреть.

[Realtime Speech-to-Text — AssemblyAIСтриминговое распознавание речи Universal-3 Pro для голосовых агентов: низкая задержка, диаризация спикеров, 19 языков.assemblyai.com](https://www.assemblyai.com/products/streaming-speech-to-text?ref=matveev.tech)

## FAQ

**Universal-3.5 Pro Realtime уже доступна всем?** Нет, пока это preview по приглашению (early access). Публичной страницы и финальных цен на саму 3.5 ещё нет. Базовая Universal-3 Pro Streaming при этом доступна с марта 2026.

**Поддерживает ли Universal-3.5 русский язык?** В realtime-стриминге нет: список ограничен 19 языками, русского среди них пока нет. На асинхронной транскрипции готовых записей русский поддерживается. Для голосового агента на русском это стоп-фактор.

**Чем 3.5 отличается от Universal-3 Pro Streaming?** Universal-3.5 собирает все обновления линейки (диаризация, режимы задержки, 19 языков, agent\_context) в один релиз и добавляет две новые фичи: Context Carryover (память разговора) и Voice Focus (изоляция основного спикера от фоновых голосов).

## Что ещё почитать

- [Soniox v5 Real-Time: распознавание речи для агентов](https://matveev.tech/soniox-v5-real-time) — прямой конкурент в realtime-STT, сильный в языках
- [Gemini 3.1 Flash Live: голосовые агенты Google стали точнее](https://matveev.tech/gemini-3-1-flash-live-obzor) — голосовой стек от Google
- [Microsoft MAI: три модели для голоса, транскрипции и картинок](https://matveev.tech/microsoft-mai-modeli-foundry) — альтернативный набор моделей для речи
- [Voice Studio Companion — озвучка из меню-бара Mac](https://matveev.tech/voice-studio-companion) — вторая половина голосового стека, синтез речи