Claude Opus 5.5: обзор модели уровня Fable дешевле Opus 5

Anthropic выпустила Opus 5.5: качество на уровне Fable 5.1, цена на 20% ниже Opus 5. Разбираю бенчмарки, экономику, ломающие изменения API и подвох с fallback на старые модели.

Claude Opus 5.5: обзор модели уровня Fable дешевле Opus 5
TL;DR: Claude Opus 5.5 — новая модель Anthropic от 22 сентября 2026. По бенчмаркам она на уровне Fable 5.1, а на агентном кодинге обходит её, при этом стоит $4 за миллион входных токенов и $20 за выходные: на 20% дешевле Opus 5 и в 2,5 раза дешевле Fable 5.1. Если сидишь на Opus 5 — переходи. Если платишь за Fable 5.1 ради агентного кода — тоже, скорее всего, пора.

Три недели назад я писал, что Fable 5.1 наконец стала экономически осмысленной для агентных задач за счёт дешёвого кэша. И вот Anthropic выпустила модель, которая делает тот же вывод наполовину устаревшим. Opus 5.5 в анонсе прямо позиционируется как «уровень Fable дешевле Opus». Разберу, насколько это правда, что сломается при переезде и где подвох.

Что такое Claude Opus 5.5 и чем она отличается от Opus 5

Opus 5.5 — первая модель линейки Claude 5.5. Sonnet 5.5 и Haiku 5.5, по словам Anthropic, выйдут в ближайшие недели. Вышла модель через два месяца после Opus 5, который появился 24 июля.

Характеристики по странице модели в документации: контекст 1 млн токенов, до 128k токенов на выходе (через Batch API с бета-хедером — до 300k), срез знаний июнь 2026. Идентификатор в API — claude-opus-5-5, на Bedrock — anthropic.claude-opus-5-5. Модель доступна в Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry, а также на подписках.

Главные отличия от Opus 5 три:

  1. Качество выросло до уровня Fable 5.1, а на агентном кодинге модель её обходит.
  2. Ставка за токен упала на 20%, а самих токенов на задачу уходит меньше.
  3. Модель пишет короче и понятнее. Anthropic отдельно чинила то, что в The Decoder называют «клодовским» стилем: многословные ответы с жаргоном, где главное спрятано в середине.

Бенчмарки: Opus 5.5 против Fable 5.1, Opus 5 и GPT-6 Astra

Все цифры из анонса Anthropic от 22 сентября 2026, замеры вендора.

Бенчмарк Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Terminal-Bench 4.0 (агентный кодинг) 66,4% 55,8% 52,3% 57,9%
FrontierCode v1.1 54,4% 50,3% 48,0% 53,3%
CursorBench 4.0 57,8% 51,8% 46,6% —
GDPval-AA v2.1 (офисная работа, Elo) 1846 1735 1708 1542
AutomationBench (бизнес-процессы) 40,0% 31,4% 26,9% 41,4%
Humanity's Last Exam (с инструментами) 67,7% 65,6% 63,6% 57,2%
Terminal-Bench-Science 0.1 58,7% 52,6% 29,0% 64,6%
OSWorld 2.0 (computer use) 81,8% 80,7% 74,0% —

Отрыв на Terminal-Bench 4.0 выглядит внушительно: плюс 10,6 пункта к Fable 5.1 при стандартной ошибке ±2,6. GPT-6 Astra, которую я разбирал в обзоре модели OpenAI, держится впереди в двух местах: в научных агентных задачах и на AutomationBench.

Интересно, что сама Anthropic советует не читать эти проценты буквально. Цитата из анонса: на таком уровне возможностей разница в бенчмарках стала хуже предсказывать реальную разницу, и в их собственной работе разрыв между Opus 5.5 и Fable 5.1 уже, чем показывают цифры. Честная оговорка. Я бы читал её так: Opus 5.5 примерно равна Fable 5.1, на коде чуть сильнее.

Про AutomationBench есть деталь в сноске. Прогоны делал Zapier без fallback-моделей, поэтому каждое срабатывание защитных фильтров засчитали как провал. Anthropic пишет, что на практике результат был бы выше. Проверить это снаружи нельзя.

Есть и независимая цифра. Artificial Analysis поставила Opus 5.5 на high effort на третье место из 206 моделей в своём Intelligence Index с результатом 54. По данным The Decoder, на max effort модель набирает 58 и выходит на первое место.

Сколько стоит Claude Opus 5.5 и откуда берутся «минус 40%»

Модель Вход Чтение кэша Запись кэша (5 мин) Выход
Opus 5.5 $4 $0,20 $5 $20
Opus 5 $5 $0,50 $6,25 $25
Fable 5.1 $10 $0,25 — $50
Sonnet 5 $2 $0,20 — $10

Цены за миллион токенов, по документации Anthropic на 22 сентября 2026. Batch API режет вход и выход вдвое, до $2 и $10.

Ставка упала на 20%, а чтение кэша подешевело в 2,5 раза, с $0,50 до $0,20. Для агентных циклов, где один и тот же контекст перечитывается на каждом шаге, второе даже важнее первого. Чтение кэша у Opus 5.5 теперь стоит столько же, сколько у Sonnet 5.

Обещанные 40% экономии складываются из цены и из того, что модель тратит меньше токенов. Истории от компаний в анонсе почти все про это. В Box модель потратила втрое меньше токенов, чем Opus 5, а ответы стали на 40% короче без потери точности. В Optiver на агентных задачах Opus 5.5 выдала качество Opus 5 примерно за половину ходов, времени и выходных токенов, и нагрузка подешевела на 40-50%. У Kiro на публичном бенчмарке командной строки модель решила больше задач, чем Opus 5, сделав примерно на 40% меньше вызовов.

Самая выразительная история у Deloitte. На самом низком уровне усилий Opus 5.5 нашла 72% известных багов в код-ревью. Opus 5 на high находила 56%.

⚠️
Экономия работает на дефолтных и низких уровнях усилий. По данным Artificial Analysis, на max effort Opus 5.5 тратит около 119 тысяч выходных токенов на задачу их индекса против ~73 тысяч у Opus 5 и ~27 тысяч у GPT-6 Astra. За счёт скидки стоимость задачи выходит примерно как у Opus 5, но не дешевле.

Ещё есть fast mode: до 2,5 раза быстрее за $8 и $40 за миллион токенов. Он работает в Claude Code и Claude API и, по документации, недоступен на Bedrock, Google Cloud и Foundry.

На подписках тоже приятно. По данным The New Stack, пятичасовые лимиты на всех планах выросли на 20%, а за счёт дешёвой модели и пятичасовые, и недельные лимиты должны тянуть на 25% дольше. Плюс каждому подписчику дают один сброс лимита, который можно отложить и использовать, когда понадобится.

Быстрый старт: как перейти на Opus 5.5

  1. В API поменяй model на claude-opus-5-5. На Bedrock — anthropic.claude-opus-5-5.
  2. В Claude Code выбери модель через /model. Fast mode включается там же, отдельно тарифицируется.
  3. Выстави effort явно. Дефолт на Opus 5.5 — medium, а на Opus 5 был high. Если не указать, модель молча начнёт работать на уровень ниже, чем ты привык.
  4. Прогони свой набор задач на двух-трёх уровнях усилий. Документация прямо советует заново подбирать effort, а не переносить старую настройку: на том же уровне модель думает больше, чем Opus 5, особенно на xhigh и max. Оставь запас в max_tokens.

Factory пишет, что Opus 5.5 — первая модель, которую они готовы держать по умолчанию на medium. У них она на medium сравнялась с Opus 5 на high и потратила на 20-25% меньше выходных токенов. Про то, как вообще работают уровни усилий, я писал в разборе effort level в Claude Code.

Что сломается при переезде с Opus 5

В документации четыре ломающих изменения. Первые три уже знакомы тем, кто переезжал на Fable 5.1.

Thinking больше нельзя выключить. thinking: {"type": "disabled"} и ручной budget_tokens возвращают 400. Убери поле thinking совсем или поставь adaptive, а глубину размышлений регулируй через effort. Если в ответах ты берёшь текст по позиции (content[0]), переделай на выбор по type: ответ теперь может начинаться с thinking-блоков.

Форсированный вызов инструмента не поддерживается. tool_choice со значениями any и tool возвращает 400. Остались auto и none. Для валидного JSON оставь auto и включи strict: true или structured outputs, а нужный инструмент назови прямо в промпте.

Thinking-блоки привязаны к модели и к истории. Opus 5.5 читает блоки от Opus 5 и старых Opus, Sonnet и Haiku, но не от Fable и Mythos. Если в роутере разговор переключается с Fable на Opus 5.5, рассуждения предыдущей модели API молча выкинет. Для аккаунтов, созданных после 31 августа 2026, правка системного промпта, инструментов или прошлых сообщений перед thinking-блоком даёт 400. Держи историю append-only и меняй инструкции через системные сообщения посреди разговора.

Старый инструмент computer use computer_20251124 не принимается на Claude API и Google Cloud. Нужно перейти на computer_toolset_20260801. На Bedrock старый вариант пока работает.

И одно тихое изменение, которое ничего не роняет. Короткие реплики, которые модель пишет между вызовами инструментов, теперь приходят в thinking-блоках, а не в text, и при дефолтном display: "omitted" они пустые. Если твой интерфейс показывал их пользователю как прогресс, он замолчит без единой ошибки в логах. Лечится настройкой thinking.display, подробности в гайде по миграции.

✈️
Разбираю такие мелочи в релизах до того, как они стреляют в проде. Если гоняешь агентов на Claude — заходи в телеграм-канал.

Как Opus 5.5 справляется с долгими задачами

Вокруг выносливости на длинной дистанции строились все отзывы про Fable 5.1, и Opus 5.5 рассказывает ту же историю, только дешевле.

Самое показательное сравнение Anthropic провела сама: обе модели переписывали HAProxy с C на Rust. Обе версии прошли почти все регрессионные тесты HAProxy, но Opus 5.5 закончила за 9,5 часов против 12 у Fable 5.1 и обошлась на 51% дешевле. Ещё один ранний тестер провёл аудит и исправления в кодовой базе на 200 тысяч строк меньше чем за три часа. Opus 5 на ту же задачу понадобилось больше 20 часов и в 2,5 раза больше токенов.

Из историй партнёров мне больше всего понравились две. Инженер Stripe Кристиан Ривера описывает многодневный ребейз 40 стековых pull request'ов, где одна сессия Opus 5.5 управляла ещё дюжиной сессий и понятно расписала каждый конфликт. Шон Хайнц из Clio отдал модели задачу сразу по шести репозиториям и оставил её на ночь, она продержалась на задаче больше 18 часов.

Кто тестировал Opus 5.5 до релиза

Отзывы в анонсе оставила 21 компания: GitHub, Clio, Lovable, Quantium, Spotify, Optiver, Column, Kiro, Deloitte, Rogo, LexisNexis, Walleye Capital, Hex, Thomson Reuters Labs, Hebbia, Viktor, Ramp, Stripe, Box, Chicago Trading Company и Factory.

Отдельно про стиль. Джон Руэлас из Ramp пишет, что многословный запутанный вывод был его главной претензией к фронтирным моделям, и Opus 5.5 это исправила: пишет как нормальный коллега и соблюдает их правила оформления. Я на это надеюсь больше всего. После долгой сессии в Claude Code читать простыню с тремя уровнями вложенных списков тяжелее, чем сам код.

Понятно, что это витрина: провальные прогоны Anthropic в анонс не понесёт. Меня убеждает другое. Двадцать одна компания с разными задачами рассказывает одну и ту же историю про меньшее число шагов и токенов на тот же результат, и это сложнее подогнать, чем один красивый процент.

Безопасность: что Anthropic пишет про поведение модели

Anthropic пишет, что Opus 5.5 показала лучший результат среди недавних моделей Claude почти по всем метрикам автоматического поведенческого аудита, где около 2000 сценариев. В новом тесте на попытки выйти за границы песочницы модель пыталась обойти ограничения примерно на 85% реже, чем Opus 5 и Mythos 5.1. По данным Gray Swan, у неё вместе с Fable 5.1 самая низкая доля успешных prompt injection среди всех протестированных моделей. До релиза модель проверяли внешние оценщики Frontier Design и METR.

И оговорка, которую Anthropic сделала сама: есть признаки, что Opus 5.5 часто подозревает, что её тестируют. Это усложняет оценку того, как она поведёт себя в реальных условиях. Хорошо, что об этом пишут открыто, но в сочетании с «лучшими результатами аудита» читается это немного тревожно.

Вердикт: кому переходить на Opus 5.5

Если ты на Opus 5, переходи без раздумий, но с тестовым прогоном. Модель дешевле за токен, тратит меньше токенов и сильнее почти везде. Главное — выставить effort явно и проверить четыре ломающих изменения, особенно если у тебя свой агентный цикл, а не Claude Code.

С Fable 5.1 интереснее. Для агентного кода Opus 5.5 выглядит лучшим выбором: на кодовых бенчмарках она сильнее, а в HAProxy-сравнении быстрее и вдвое дешевле. Оставлять Fable я бы стал только там, где у тебя уже есть свои замеры, что она лучше на конкретной задаче, или если нужен доступ к Mythos через программы проверки. Сама Anthropic говорит, что разрыв между моделями в реальной работе меньше, чем в таблицах. При разнице в цене в 2,5 раза это аргумент в пользу Opus.

Что меня настораживает, так это fallback. Цифры от вендора — привычная история, их подтвердят или опровергнут независимые замеры через пару недель. А вот запрос, который молча закрыла другая модель, в многошаговом агенте может всплыть багом через десять шагов, и искать его будет больно. Если строишь таких агентов, закрой это логированием до прода. Ну и на max effort чуда не жди: там модель жжёт токенов больше, чем Opus 5.

Думаю, это самый приятный релиз Anthropic за этот год. Обычно выбираешь между «лучше» и «дешевле», а тут дали и то и другое, да ещё лимиты на подписке подняли. Попробуй на своей самой тяжёлой задаче в Claude Code и сравни с тем, к чему привык.

Claude Opus 5.5
Модель Anthropic для долгих агентных задач в коде и офисной работе. Доступна в API как claude-opus-5-5, в Claude Code и на подписках Pro, Max, Team и Enterprise.

Что ещё почитать

Частые вопросы

Сколько стоит Claude Opus 5.5? $4 за миллион входных токенов и $20 за миллион выходных, на 20% дешевле Opus 5. Чтение кэша стоит $0,20 вместо $0,50. Anthropic оценивает экономию на типичной нагрузке в 40%, потому что модель тратит меньше токенов на задачу. Fast mode стоит $8 и $40.

Что лучше: Opus 5.5 или Fable 5.1? На агентном кодинге Opus 5.5 сильнее по бенчмаркам Anthropic и в 2,5 раза дешевле. На остальных задачах модели примерно равны, и сама Anthropic говорит, что в реальной работе разрыв меньше, чем в таблицах. Fable имеет смысл оставить, если твои собственные эвалы показывают её преимущество.

Можно ли отключить thinking в Opus 5.5? Нет. Adaptive thinking включён всегда, запрос с thinking: {"type": "disabled"} вернёт ошибку 400. Глубину размышлений и расход токенов регулирует параметр effort, его дефолт на Opus 5.5 — medium.

Почему мой запрос к Opus 5.5 обработала другая модель? Если сработал защитный классификатор по кибербезопасности, биологии или разработке LLM и у тебя включён fallback, запрос уходит на Opus 4.8 или Opus 5. Смотри stop_reason и stop_details в ответе, чтобы отслеживать такие случаи.