> ## Content Index
> Fetch the complete content index at: https://matveev.tech/llms.txt
> Use this file to discover other available public pages before exploring further.

# Mistral OCR 4: обзор модели распознавания документов
- URL: https://matveev.tech/mistral-ocr-4/
- Published: 2026-07-21T16:38:00.000Z
- Updated: 2026-07-21T16:38:00.000Z
- Description: Mistral выпустила OCR 4: модель не просто извлекает текст, а возвращает структуру документа с координатами блоков, типами и оценкой уверенности. Разобрал, зачем это RAG-пайплайнам и агентам.
- Author: Pavel Matveev
- Tags: AI, Инструменты, Агенты, Обзор

> TL;DR: Mistral выпустила OCR 4 — модель распознавания документов, которая возвращает структуру страницы вместе с текстом: координаты каждого блока, его тип (заголовок, таблица, формула, подпись) и оценку уверенности по словам. Главное для тех, кто строит RAG и агентов на документах. Цена $2-4 за 1000 страниц, есть self-hosting.

Если ты когда-нибудь прогонял PDF через OCR, а потом руками разбирал кашу из строк, пытаясь понять, где тут таблица, где сноска, а где подпись внизу страницы, то знаешь главную боль. Распознать буквы — полдела. Дальше надо понять, что это за буквы и где они лежат. Mistral OCR 4 как раз про вторую половину.

## Что такое Mistral OCR 4

Это специализированная модель для извлечения текста из документов: PDF, сканы, картинки, презентации. По данным Mistral, она поддерживает 170 языков в 10 языковых группах и работает как компонент для enterprise-поиска, RAG и агентных пайплайнов. Прошлые версии (OCR 3 вышел в январе 2026) умели превращать страницу в чистый текст и таблицы. Четвёртая делает шаг дальше: отдаёт структурированное представление документа.

Разница принципиальная. Раньше на выходе был markdown с текстом, и дальше ты сам угадывал структуру. Теперь модель говорит: вот блок, это таблица, её координаты такие-то, уверенность 0.98\. То есть ты получаешь не только что написано в документе, но и где это лежит, какую роль играет и насколько модель в этом уверена.

## Структура вместо просто текста: главное в v4

Здесь и живёт всё обновление. OCR 4 возвращает три вещи поверх обычного текста, и каждая закрывает конкретную дыру в реальных пайплайнах.

Первое — bounding boxes, координаты блоков. Самая запрашиваемая фича, по словам самой Mistral. Каждый кусок текста привязан к прямоугольнику на странице. Зачем это нужно: подсветить источник прямо в исходном документе, когда LLM сослался на конкретное место. Для юристов и финансистов это обязательное требование. Ответ без указания, откуда взят кусок, в таких сценариях бесполезен.

Второе — классификация блоков. Модель размечает каждый блок типом. В документации перечислены: `text`, `title`, `list`, `table`, `image`, `equation`, `caption`, `code`, `references`, `aside_text`, `header`, `footer`, `signature`. Блоки идут в порядке чтения. Это решает старую проблему semantic chunking для RAG: вместо того чтобы резать документ по 500 токенов вслепую, ты режешь по реальным смысловым единицам. Заголовок отдельно, таблица отдельно, сноска не приклеивается к абзацу.

Третье — confidence scores, оценка уверенности. Можно получить на уровне страницы или каждого слова (параметр `confidence_scores_granularity`). Практический смысл простой: ты отправляешь на проверку человеку только те регионы, где модель сомневается, а не весь документ. Для обработки инвойсов и форм с human-in-the-loop это прямая экономия часов.

Вместе эти три штуки превращают OCR из «прочитай текст» в «разбери документ на детали, которыми можно управлять». Агент перестаёт просто читать и начинает действовать: заполнять формы, обрабатывать счета, проверять документы на соответствие.

## Быстрый старт

Модель доступна через один API-эндпоинт. Под капотом `mistral-ocr-latest` — это и есть OCR 4 (`mistral-ocr-4-0`). Ставишь SDK и делаешь один вызов.

```bash
pip install mistralai

```

```python
from mistralai import Mistral

client = Mistral(api_key="ВАШ_КЛЮЧ")

resp = client.ocr.process(
    model="mistral-ocr-latest",
    document={
        "type": "document_url",
        "document_url": "https://example.com/contract.pdf",
    },
    include_blocks=True,                   # блоки с координатами и типом
    confidence_scores_granularity="word",  # уверенность по каждому слову
)

for page in resp.pages:
    for block in page.blocks:
        print(block.type, "→", block.content[:80])

```

Ключевой параметр здесь `include_blocks=True` — именно он включает тот самый структурированный вывод. Важная деталь: блоки работают только на OCR 4 и новее. Старые модели параметр примут, но вернут пустой массив. Документ можно подать тремя способами: публичной ссылкой, base64 или загрузкой файла в облако Mistral. Таблицы по умолчанию идут inline в markdown, но через `table_format` их можно вынести отдельно как markdown или html.

## Бенчмарки и честные оговорки

По цифрам Mistral заявляет первое место. В слепой человеческой оценке независимые аннотаторы предпочли OCR 4 в среднем в 72% случаев против ведущих OCR и document-AI систем. На публичном OlmOCRBench модель набрала 85.20, на OmniDocBench — 93.07.

![Сравнение производительности Mistral OCR 4 с конкурентами по бенчмаркам](https://matveev.tech/content/images/2026/06/mistral-ocr-4-benchmark.webp)

Что мне понравилось в этом релизе — Mistral сама честно разбирает, где бенчмарки врут. Компания признаёт, что автоматические метрики штрафуют модель за вещи, которые на деле верны: эквивалентная запись формул в LaTeX, разбивка уравнений на фрагменты, перенос слов через границу колонок, ошибки в самих эталонных аннотациях. То есть часть «ошибок» — это артефакты сравнения строк, а не реальные промахи модели. Поэтому к агрегатной цифре они относятся как к ориентиру, а не приговору, и прямо советуют гонять тесты на своих документах. Для технического обзора такая откровенность дороже красивого графика.

Отдельно стоит мультиязычность. По внутренней оценке Crawl Multilingual OCR 4 лидирует во всех языковых группах, и разрыв с конкурентами шире всего на редких и специализированных языках, где многие системы резко проседают. Для русскоязычных документов это скорее хорошая новость, хотя конкретных цифр по русскому Mistral не дала.

## Цена и где доступен

Тарификация постраничная, три варианта:

| Режим           | Цена за 1000 страниц | Когда брать                                    |
| --------------- | -------------------- | ---------------------------------------------- |
| OCR 4 API       | $4                   | Чистое извлечение текста и структуры           |
| OCR 4 Batch-API | $2                   | Массовая обработка, скидка 50%                 |
| Document AI     | $5                   | Структурированный JSON по своей схеме без кода |

Разница между OCR 4 и Document AI важная. Базовый OCR всегда отдаёт текст, координаты, типы блоков и confidence. Document AI — это тот же эндпоинт, но с дополнительными параметрами: передаёшь JSON-схему, и вывод приводится к нужной форме через `mistral-small-2603`. Грубо так: нужен сырой разбор — берёшь OCR как есть. Нужен готовый JSON под свои поля — добавляешь параметры Document AI в тот же вызов.

Доступ есть через Mistral Studio, Amazon SageMaker, Microsoft Foundry, и скоро обещают Snowflake Parse Document. Один цинизм в сторону: красивая отдельная цена $4 против $5 выглядит как маркетинг, по факту это одна модель с разным уровнем обвязки.

## Self-hosting и приватность

Для меня это второй по важности пункт после структуры. OCR 4 достаточно компактна, чтобы развернуться в одном контейнере, и может работать полностью self-hosted — документы не уходят за пределы твоей инфраструктуры. Для медицины, юристов и финансов с требованиями по data residency это снимает главный барьер на пути к облачным API. Правда, есть нюанс: self-managed развёртывание Mistral отдаёт только enterprise-клиентам, так что просто скачать и запустить дома не выйдет. Если тебе важна локальная обработка чувствительных данных, это направление стоит держать в уме (мы недавно разбирали похожий подход в [обзоре OpenAI Privacy Filter](https://matveev.tech/openai-privacy-filter)).

✈️

Разбираю новые модели и инструменты для документов и AI-агентов почти каждый день — [подписывайся в телеге](https://t.me/ctospeech?ref=matveev.tech).

## Плюсы и минусы

**Что понравилось:**

- Структурированный вывод — это реально другой уровень. Координаты, типы блоков и confidence закрывают конкретные боли RAG и агентов, а не абстрактную «точность»
- Честность с бенчмарками. Mistral сама показывает, где метрики врут, и советует тестировать на своих данных
- Self-hosting для чувствительных документов
- Адекватная цена, особенно $2 за 1000 страниц в Batch-режиме

**Что не понравилось:**

- Модель не open source. Несмотря на репутацию Mistral как открытой компании, OCR 4 закрытая, а self-hosting только для enterprise
- Бенчмарки против конкурентов — внутренние репродукции Mistral. Цифры соперников считала сама же Mistral, это всегда повод для скепсиса
- По русскому языку конкретных метрик нет, только общее «лидируем в восточноевропейской группе»
- Модель сознательно не для real-time: для latency-чувствительных сценариев не подходит

## Вердикт

Если ты строишь RAG или агентов поверх документов, OCR 4 стоит протестировать в первую очередь. Структурированный вывод с координатами и типами блоков экономит тот самый постпроцессинг, на который обычно уходит больше времени, чем на сам OCR. Связка confidence scores плюс bounding boxes делает human-in-the-loop вменяемым, а не сплошной перепроверкой.

Кому не подойдёт: тем, кому нужен полностью открытый локальный инструмент без enterprise-договора, и тем, у кого real-time сценарии. И не стоит верить агрегатным цифрам на слово — Mistral сама об этом просит. Берёшь свою пачку реальных документов, гоняешь, смотришь на своих данных. Благо $2 за 1000 страниц позволяют это сделать почти бесплатно.

Попробовать: [Mistral OCR 4](https://mistral.ai/news/ocr-4/?ref=matveev.tech)

## Что ещё почитать

- [OpenAI Privacy Filter: обзор открытой модели для PII](https://matveev.tech/openai-privacy-filter) — про локальную обработку документов и защиту персональных данных
- [Soniox v5 Real-Time: распознавание речи для агентов](https://matveev.tech/soniox-v5-real-time) — соседняя модальность того же ingestion-слоя, только для звука
- [DeepSeek V4 Pro: обзор открытой модели](https://matveev.tech/deepseek-v4-pro) — если интересна тема локального запуска моделей