Корона
Продукты

Anthropic выпустила Claude Opus 5.5: уровень Fable 5.1 и на 40% дешевле Opus 5

Первая модель семейства Claude 5.5 лидирует в большинстве тестов Anthropic на агентное программирование и офисную работу, стоит $4 и $20 за миллион токенов и работает с защитами уровня Fable 5.1. Сравнили с конкурентами по отдельным тестам.

4 мин чтения
Разработчик за компьютером проверяет код на рабочем месте.

Что произошло

22 сентября 2026 года Anthropic представила Claude Opus 5.5 — первую модель нового семейства Claude 5.5. По оценке компании, на большинстве задач она работает на уровне Claude Fable 5.1, а на типичных нагрузках обходится на 40% дешевле Opus 5.

Это первый релиз Anthropic после призыва её главы Дарио Амодеи соразмерять темп развития самых мощных моделей. До выхода Opus 5.5 проверили внешние организации — Frontier Design и METR.

Цена, скорость и доступность

Токены подешевели на 20%: $4 за миллион входных и $20 за миллион выходных против $5 и $25 у Opus 5. Чтение из кэша, на которое приходится основная часть затрат в агентной работе, стоит $0,20 за миллион — на 60% меньше. Запись в кэш обойдётся в $5 за миллион.

По данным Anthropic, модель выдаёт ответ более чем на 30% быстрее Opus 5. В Claude Code и на Claude Platform есть быстрый режим — до 2,5 раза быстрее, по $8 и $40 за миллион токенов. Подписчикам Pro, Max, Team и корпоративных тарифов подняли пятичасовые лимиты.

Opus 5.5 доступна на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure; в API модель называется claude-opus-5-5. Отключить у неё режим размышлений нельзя.

Безопасность

Anthropic заявляет, что во внутреннем аудите поведения — почти 2000 смоделированных сценариев — Opus 5.5 показала лучший результат среди всех проверенных компанией моделей. В новом тесте она пыталась выйти за границы отведённой среды примерно на 85% реже, чем Opus 5.

Защиты у модели сопоставимы с Fable 5.1: большинство задач по кибербезопасности перенаправляется на Opus 4.8, а помеченные фильтрами запросы по биологии — на Opus 5. Лаборатории могут подать заявку в программу доступа для наук о жизни, а специалистам по киберзащите доступ обещан в ближайшие недели.

Компания сама называет слабое место: модель часто подозревает, что её тестируют, и это мешает понять, как она поведёт себя в реальной работе.

Opus 5.5 на фоне конкурентов

Ниже — результаты из анонса Anthropic. Каждый график — отдельный тест со своей шкалой: тесты измеряют разные навыки, поэтому сводить их в единый «рейтинг мощности» нельзя. Ни один бенчмарк не является универсальной шкалой интеллекта моделей.

Почти все цифры опубликовала сама Anthropic — это данные разработчика, а не независимая проверка. Результаты моделей OpenAI компания взяла из отчётов OpenAI или публичных таблиц. Anthropic и сама предупреждает, что на таком уровне разница в баллах всё хуже отражает реальную разницу в работе.

Terminal-Bench 4.0: Claude Opus 5.5 — 66,4%, GPT-6 Astra — 57,9%, Claude Fable 5.1 — 55,8%, Claude Opus 5 — 52,3%, GPT-5.6 Sol — 37,3%

Terminal-Bench 4.0 проверяет многошаговые профессиональные задачи в командной строке. Модели Claude прогоняла Anthropic, Opus 5.5 — на уровне усилий xhigh, погрешность ±2,6 пункта. Цифры GPT-6 Astra и GPT-5.6 Sol опубликовала OpenAI; результата GPT-6 Sol в этом тесте нет.

FrontierCode v1.1: Claude Opus 5.5 — 54,4%, GPT-6 Astra — 53,3%, Claude Fable 5.1 — 50,3%, GPT-6 Sol — 49,3%, Claude Opus 5 — 48,0%, GPT-5.6 Sol — 47,5%

FrontierCode v1.1 оценивает, приняли бы в реальный проект изменения, которые внёс агент. Результат GPT-6 Sol — 49,3% — Anthropic привела позже, 28 сентября, в анонсе Claude Sonnet 5.5.

GDPval-AA v2.1, рейтинг Эло: Claude Opus 5.5 — 1846, Claude Fable 5.1 — 1735, Claude Opus 5 — 1708, GPT-5.6 Sol — 1588, GPT-6 Astra — 1542, GPT-6 Sol — 1487

GDPval-AA v2.1 — бенчмарк компании Artificial Analysis: рабочие задачи 44 профессий с оценкой по шкале Эло. Для GPT-6 Sol Anthropic оговаривает, что официальная оценка могла ещё не обновиться после исправления ошибки у OpenAI.

Humanity’s Last Exam с инструментами: Claude Opus 5.5 — 67,7%, Claude Fable 5.1 — 65,6%, Claude Opus 5 — 63,6%, GPT-6 Astra — 57,2%

Humanity’s Last Exam — трудные вопросы из разных областей знаний; здесь модели отвечали с доступом к инструментам. Для GPT-5.6 Sol результата в публикации нет.

AutomationBench: GPT-6 Astra — 41,4%, Claude Opus 5.5 — 40,0%, Claude Fable 5.1 — 31,4%, GPT-5.6 Sol — 28,8%, Claude Opus 5 — 26,9%

AutomationBench — тест компании Zapier: справляется ли агент с реальными бизнес-процессами в связке приложений. Замер провела сама Zapier, и здесь GPT-6 Astra немного впереди: 41,4% против 40,0%. Срабатывание защит Opus 5.5 Zapier засчитывала как провал задачи.

Есть и другие тесты, где Opus 5.5 не первая. В научных задачах Terminal-Bench-Science 0.1 у GPT-6 Astra 64,6% против 58,7% у Opus 5.5 — цифру для модели OpenAI опубликовала OpenAI.

Что пока неизвестно

Независимых проверок большинства этих результатов пока нет: сравнение опирается на отчёты самих разработчиков. Моделей Google в таблице Anthropic нет, поэтому сравнения с ними здесь тоже нет. 28 сентября вышла Claude Sonnet 5.5, а Claude Haiku 5.5 компания обещает в ближайшие недели.

Источники

Читайте также

Anthropic выпустила Claude Opus 5.5: уровень Fable 5.1 и на 40% дешевле Opus 5 — Корона