Mistral OCR 4: обзор модели распознавания документов

Mistral выпустила OCR 4: модель не просто извлекает текст, а возвращает структуру документа с координатами блоков, типами и оценкой уверенности. Разобрал, зачем это RAG-пайплайнам и агентам.

Mistral OCR 4: обзор модели распознавания документов
TL;DR: Mistral выпустила OCR 4 — модель распознавания документов, которая возвращает структуру страницы вместе с текстом: координаты каждого блока, его тип (заголовок, таблица, формула, подпись) и оценку уверенности по словам. Главное для тех, кто строит RAG и агентов на документах. Цена $2-4 за 1000 страниц, есть self-hosting.

Если ты когда-нибудь прогонял PDF через OCR, а потом руками разбирал кашу из строк, пытаясь понять, где тут таблица, где сноска, а где подпись внизу страницы, то знаешь главную боль. Распознать буквы — полдела. Дальше надо понять, что это за буквы и где они лежат. Mistral OCR 4 как раз про вторую половину.

Что такое Mistral OCR 4

Это специализированная модель для извлечения текста из документов: PDF, сканы, картинки, презентации. По данным Mistral, она поддерживает 170 языков в 10 языковых группах и работает как компонент для enterprise-поиска, RAG и агентных пайплайнов. Прошлые версии (OCR 3 вышел в январе 2026) умели превращать страницу в чистый текст и таблицы. Четвёртая делает шаг дальше: отдаёт структурированное представление документа.

Разница принципиальная. Раньше на выходе был markdown с текстом, и дальше ты сам угадывал структуру. Теперь модель говорит: вот блок, это таблица, её координаты такие-то, уверенность 0.98. То есть ты получаешь не только что написано в документе, но и где это лежит, какую роль играет и насколько модель в этом уверена.

Структура вместо просто текста: главное в v4

Здесь и живёт всё обновление. OCR 4 возвращает три вещи поверх обычного текста, и каждая закрывает конкретную дыру в реальных пайплайнах.

Первое — bounding boxes, координаты блоков. Самая запрашиваемая фича, по словам самой Mistral. Каждый кусок текста привязан к прямоугольнику на странице. Зачем это нужно: подсветить источник прямо в исходном документе, когда LLM сослался на конкретное место. Для юристов и финансистов это обязательное требование. Ответ без указания, откуда взят кусок, в таких сценариях бесполезен.

Второе — классификация блоков. Модель размечает каждый блок типом. В документации перечислены: text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature. Блоки идут в порядке чтения. Это решает старую проблему semantic chunking для RAG: вместо того чтобы резать документ по 500 токенов вслепую, ты режешь по реальным смысловым единицам. Заголовок отдельно, таблица отдельно, сноска не приклеивается к абзацу.

Третье — confidence scores, оценка уверенности. Можно получить на уровне страницы или каждого слова (параметр confidence_scores_granularity). Практический смысл простой: ты отправляешь на проверку человеку только те регионы, где модель сомневается, а не весь документ. Для обработки инвойсов и форм с human-in-the-loop это прямая экономия часов.

Вместе эти три штуки превращают OCR из «прочитай текст» в «разбери документ на детали, которыми можно управлять». Агент перестаёт просто читать и начинает действовать: заполнять формы, обрабатывать счета, проверять документы на соответствие.

Быстрый старт

Модель доступна через один API-эндпоинт. Под капотом mistral-ocr-latest — это и есть OCR 4 (mistral-ocr-4-0). Ставишь SDK и делаешь один вызов.

pip install mistralai
from mistralai import Mistral

client = Mistral(api_key="ВАШ_КЛЮЧ")

resp = client.ocr.process(
    model="mistral-ocr-latest",
    document={
        "type": "document_url",
        "document_url": "https://example.com/contract.pdf",
    },
    include_blocks=True,                   # блоки с координатами и типом
    confidence_scores_granularity="word",  # уверенность по каждому слову
)

for page in resp.pages:
    for block in page.blocks:
        print(block.type, "→", block.content[:80])

Ключевой параметр здесь include_blocks=True — именно он включает тот самый структурированный вывод. Важная деталь: блоки работают только на OCR 4 и новее. Старые модели параметр примут, но вернут пустой массив. Документ можно подать тремя способами: публичной ссылкой, base64 или загрузкой файла в облако Mistral. Таблицы по умолчанию идут inline в markdown, но через table_format их можно вынести отдельно как markdown или html.

Бенчмарки и честные оговорки

По цифрам Mistral заявляет первое место. В слепой человеческой оценке независимые аннотаторы предпочли OCR 4 в среднем в 72% случаев против ведущих OCR и document-AI систем. На публичном OlmOCRBench модель набрала 85.20, на OmniDocBench — 93.07.

Сравнение производительности Mistral OCR 4 с конкурентами по бенчмаркам

Что мне понравилось в этом релизе — Mistral сама честно разбирает, где бенчмарки врут. Компания признаёт, что автоматические метрики штрафуют модель за вещи, которые на деле верны: эквивалентная запись формул в LaTeX, разбивка уравнений на фрагменты, перенос слов через границу колонок, ошибки в самих эталонных аннотациях. То есть часть «ошибок» — это артефакты сравнения строк, а не реальные промахи модели. Поэтому к агрегатной цифре они относятся как к ориентиру, а не приговору, и прямо советуют гонять тесты на своих документах. Для технического обзора такая откровенность дороже красивого графика.

Отдельно стоит мультиязычность. По внутренней оценке Crawl Multilingual OCR 4 лидирует во всех языковых группах, и разрыв с конкурентами шире всего на редких и специализированных языках, где многие системы резко проседают. Для русскоязычных документов это скорее хорошая новость, хотя конкретных цифр по русскому Mistral не дала.

Цена и где доступен

Тарификация постраничная, три варианта:

Режим Цена за 1000 страниц Когда брать
OCR 4 API $4 Чистое извлечение текста и структуры
OCR 4 Batch-API $2 Массовая обработка, скидка 50%
Document AI $5 Структурированный JSON по своей схеме без кода

Разница между OCR 4 и Document AI важная. Базовый OCR всегда отдаёт текст, координаты, типы блоков и confidence. Document AI — это тот же эндпоинт, но с дополнительными параметрами: передаёшь JSON-схему, и вывод приводится к нужной форме через mistral-small-2603. Грубо так: нужен сырой разбор — берёшь OCR как есть. Нужен готовый JSON под свои поля — добавляешь параметры Document AI в тот же вызов.

Доступ есть через Mistral Studio, Amazon SageMaker, Microsoft Foundry, и скоро обещают Snowflake Parse Document. Один цинизм в сторону: красивая отдельная цена $4 против $5 выглядит как маркетинг, по факту это одна модель с разным уровнем обвязки.

Self-hosting и приватность

Для меня это второй по важности пункт после структуры. OCR 4 достаточно компактна, чтобы развернуться в одном контейнере, и может работать полностью self-hosted — документы не уходят за пределы твоей инфраструктуры. Для медицины, юристов и финансов с требованиями по data residency это снимает главный барьер на пути к облачным API. Правда, есть нюанс: self-managed развёртывание Mistral отдаёт только enterprise-клиентам, так что просто скачать и запустить дома не выйдет. Если тебе важна локальная обработка чувствительных данных, это направление стоит держать в уме (мы недавно разбирали похожий подход в обзоре OpenAI Privacy Filter).

✈️
Разбираю новые модели и инструменты для документов и AI-агентов почти каждый день — подписывайся в телеге.

Плюсы и минусы

Что понравилось:

  • Структурированный вывод — это реально другой уровень. Координаты, типы блоков и confidence закрывают конкретные боли RAG и агентов, а не абстрактную «точность»
  • Честность с бенчмарками. Mistral сама показывает, где метрики врут, и советует тестировать на своих данных
  • Self-hosting для чувствительных документов
  • Адекватная цена, особенно $2 за 1000 страниц в Batch-режиме

Что не понравилось:

  • Модель не open source. Несмотря на репутацию Mistral как открытой компании, OCR 4 закрытая, а self-hosting только для enterprise
  • Бенчмарки против конкурентов — внутренние репродукции Mistral. Цифры соперников считала сама же Mistral, это всегда повод для скепсиса
  • По русскому языку конкретных метрик нет, только общее «лидируем в восточноевропейской группе»
  • Модель сознательно не для real-time: для latency-чувствительных сценариев не подходит

Вердикт

Если ты строишь RAG или агентов поверх документов, OCR 4 стоит протестировать в первую очередь. Структурированный вывод с координатами и типами блоков экономит тот самый постпроцессинг, на который обычно уходит больше времени, чем на сам OCR. Связка confidence scores плюс bounding boxes делает human-in-the-loop вменяемым, а не сплошной перепроверкой.

Кому не подойдёт: тем, кому нужен полностью открытый локальный инструмент без enterprise-договора, и тем, у кого real-time сценарии. И не стоит верить агрегатным цифрам на слово — Mistral сама об этом просит. Берёшь свою пачку реальных документов, гоняешь, смотришь на своих данных. Благо $2 за 1000 страниц позволяют это сделать почти бесплатно.

Попробовать: Mistral OCR 4

Что ещё почитать