Mistral OCR 4: обзор модели распознавания документов
Mistral выпустила OCR 4: модель не просто извлекает текст, а возвращает структуру документа с координатами блоков, типами и оценкой уверенности. Разобрал, зачем это RAG-пайплайнам и агентам.
TL;DR: Mistral выпустила OCR 4 — модель распознавания документов, которая возвращает структуру страницы вместе с текстом: координаты каждого блока, его тип (заголовок, таблица, формула, подпись) и оценку уверенности по словам. Главное для тех, кто строит RAG и агентов на документах. Цена $2-4 за 1000 страниц, есть self-hosting.
Если ты когда-нибудь прогонял PDF через OCR, а потом руками разбирал кашу из строк, пытаясь понять, где тут таблица, где сноска, а где подпись внизу страницы, то знаешь главную боль. Распознать буквы — полдела. Дальше надо понять, что это за буквы и где они лежат. Mistral OCR 4 как раз про вторую половину.
Что такое Mistral OCR 4
Это специализированная модель для извлечения текста из документов: PDF, сканы, картинки, презентации. По данным Mistral, она поддерживает 170 языков в 10 языковых группах и работает как компонент для enterprise-поиска, RAG и агентных пайплайнов. Прошлые версии (OCR 3 вышел в январе 2026) умели превращать страницу в чистый текст и таблицы. Четвёртая делает шаг дальше: отдаёт структурированное представление документа.
Разница принципиальная. Раньше на выходе был markdown с текстом, и дальше ты сам угадывал структуру. Теперь модель говорит: вот блок, это таблица, её координаты такие-то, уверенность 0.98. То есть ты получаешь не только что написано в документе, но и где это лежит, какую роль играет и насколько модель в этом уверена.
Структура вместо просто текста: главное в v4
Здесь и живёт всё обновление. OCR 4 возвращает три вещи поверх обычного текста, и каждая закрывает конкретную дыру в реальных пайплайнах.
Первое — bounding boxes, координаты блоков. Самая запрашиваемая фича, по словам самой Mistral. Каждый кусок текста привязан к прямоугольнику на странице. Зачем это нужно: подсветить источник прямо в исходном документе, когда LLM сослался на конкретное место. Для юристов и финансистов это обязательное требование. Ответ без указания, откуда взят кусок, в таких сценариях бесполезен.
Второе — классификация блоков. Модель размечает каждый блок типом. В документации перечислены: text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature. Блоки идут в порядке чтения. Это решает старую проблему semantic chunking для RAG: вместо того чтобы резать документ по 500 токенов вслепую, ты режешь по реальным смысловым единицам. Заголовок отдельно, таблица отдельно, сноска не приклеивается к абзацу.
Третье — confidence scores, оценка уверенности. Можно получить на уровне страницы или каждого слова (параметр confidence_scores_granularity). Практический смысл простой: ты отправляешь на проверку человеку только те регионы, где модель сомневается, а не весь документ. Для обработки инвойсов и форм с human-in-the-loop это прямая экономия часов.
Вместе эти три штуки превращают OCR из «прочитай текст» в «разбери документ на детали, которыми можно управлять». Агент перестаёт просто читать и начинает действовать: заполнять формы, обрабатывать счета, проверять документы на соответствие.
Быстрый старт
Модель доступна через один API-эндпоинт. Под капотом mistral-ocr-latest — это и есть OCR 4 (mistral-ocr-4-0). Ставишь SDK и делаешь один вызов.
pip install mistralai
from mistralai import Mistral
client = Mistral(api_key="ВАШ_КЛЮЧ")
resp = client.ocr.process(
model="mistral-ocr-latest",
document={
"type": "document_url",
"document_url": "https://example.com/contract.pdf",
},
include_blocks=True, # блоки с координатами и типом
confidence_scores_granularity="word", # уверенность по каждому слову
)
for page in resp.pages:
for block in page.blocks:
print(block.type, "→", block.content[:80])
Ключевой параметр здесь include_blocks=True — именно он включает тот самый структурированный вывод. Важная деталь: блоки работают только на OCR 4 и новее. Старые модели параметр примут, но вернут пустой массив. Документ можно подать тремя способами: публичной ссылкой, base64 или загрузкой файла в облако Mistral. Таблицы по умолчанию идут inline в markdown, но через table_format их можно вынести отдельно как markdown или html.
Бенчмарки и честные оговорки
По цифрам Mistral заявляет первое место. В слепой человеческой оценке независимые аннотаторы предпочли OCR 4 в среднем в 72% случаев против ведущих OCR и document-AI систем. На публичном OlmOCRBench модель набрала 85.20, на OmniDocBench — 93.07.

Что мне понравилось в этом релизе — Mistral сама честно разбирает, где бенчмарки врут. Компания признаёт, что автоматические метрики штрафуют модель за вещи, которые на деле верны: эквивалентная запись формул в LaTeX, разбивка уравнений на фрагменты, перенос слов через границу колонок, ошибки в самих эталонных аннотациях. То есть часть «ошибок» — это артефакты сравнения строк, а не реальные промахи модели. Поэтому к агрегатной цифре они относятся как к ориентиру, а не приговору, и прямо советуют гонять тесты на своих документах. Для технического обзора такая откровенность дороже красивого графика.
Отдельно стоит мультиязычность. По внутренней оценке Crawl Multilingual OCR 4 лидирует во всех языковых группах, и разрыв с конкурентами шире всего на редких и специализированных языках, где многие системы резко проседают. Для русскоязычных документов это скорее хорошая новость, хотя конкретных цифр по русскому Mistral не дала.
Цена и где доступен
Тарификация постраничная, три варианта:
| Режим | Цена за 1000 страниц | Когда брать |
|---|---|---|
| OCR 4 API | $4 | Чистое извлечение текста и структуры |
| OCR 4 Batch-API | $2 | Массовая обработка, скидка 50% |
| Document AI | $5 | Структурированный JSON по своей схеме без кода |
Разница между OCR 4 и Document AI важная. Базовый OCR всегда отдаёт текст, координаты, типы блоков и confidence. Document AI — это тот же эндпоинт, но с дополнительными параметрами: передаёшь JSON-схему, и вывод приводится к нужной форме через mistral-small-2603. Грубо так: нужен сырой разбор — берёшь OCR как есть. Нужен готовый JSON под свои поля — добавляешь параметры Document AI в тот же вызов.
Доступ есть через Mistral Studio, Amazon SageMaker, Microsoft Foundry, и скоро обещают Snowflake Parse Document. Один цинизм в сторону: красивая отдельная цена $4 против $5 выглядит как маркетинг, по факту это одна модель с разным уровнем обвязки.
Self-hosting и приватность
Для меня это второй по важности пункт после структуры. OCR 4 достаточно компактна, чтобы развернуться в одном контейнере, и может работать полностью self-hosted — документы не уходят за пределы твоей инфраструктуры. Для медицины, юристов и финансов с требованиями по data residency это снимает главный барьер на пути к облачным API. Правда, есть нюанс: self-managed развёртывание Mistral отдаёт только enterprise-клиентам, так что просто скачать и запустить дома не выйдет. Если тебе важна локальная обработка чувствительных данных, это направление стоит держать в уме (мы недавно разбирали похожий подход в обзоре OpenAI Privacy Filter).
Плюсы и минусы
Что понравилось:
- Структурированный вывод — это реально другой уровень. Координаты, типы блоков и confidence закрывают конкретные боли RAG и агентов, а не абстрактную «точность»
- Честность с бенчмарками. Mistral сама показывает, где метрики врут, и советует тестировать на своих данных
- Self-hosting для чувствительных документов
- Адекватная цена, особенно $2 за 1000 страниц в Batch-режиме
Что не понравилось:
- Модель не open source. Несмотря на репутацию Mistral как открытой компании, OCR 4 закрытая, а self-hosting только для enterprise
- Бенчмарки против конкурентов — внутренние репродукции Mistral. Цифры соперников считала сама же Mistral, это всегда повод для скепсиса
- По русскому языку конкретных метрик нет, только общее «лидируем в восточноевропейской группе»
- Модель сознательно не для real-time: для latency-чувствительных сценариев не подходит
Вердикт
Если ты строишь RAG или агентов поверх документов, OCR 4 стоит протестировать в первую очередь. Структурированный вывод с координатами и типами блоков экономит тот самый постпроцессинг, на который обычно уходит больше времени, чем на сам OCR. Связка confidence scores плюс bounding boxes делает human-in-the-loop вменяемым, а не сплошной перепроверкой.
Кому не подойдёт: тем, кому нужен полностью открытый локальный инструмент без enterprise-договора, и тем, у кого real-time сценарии. И не стоит верить агрегатным цифрам на слово — Mistral сама об этом просит. Берёшь свою пачку реальных документов, гоняешь, смотришь на своих данных. Благо $2 за 1000 страниц позволяют это сделать почти бесплатно.
Попробовать: Mistral OCR 4
Что ещё почитать
- OpenAI Privacy Filter: обзор открытой модели для PII — про локальную обработку документов и защиту персональных данных
- Soniox v5 Real-Time: распознавание речи для агентов — соседняя модальность того же ingestion-слоя, только для звука
- DeepSeek V4 Pro: обзор открытой модели — если интересна тема локального запуска моделей