Корона
Продукты

Anthropic выпустила Claude Sonnet 5.5: на 30% быстрее и дешевле на задачу

Вторая модель семейства Claude 5.5 набирает 70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5. Цена за токен прежняя, но токенов на задачу уходит меньше. Впервые у Sonnet — защиты по кибербезопасности, как у старших моделей.

2 мин чтения
Разработчик работает за компьютером и проверяет код с помощью новой модели.

Что произошло

28 сентября Anthropic представила Claude Sonnet 5.5 — вторую модель семейства Claude 5.5 после вышедшей неделей раньше Opus 5.5. Компания описывает её как более быструю и дешёвую пару к Opus 5.5: сильнее всего она в понятных повседневных задачах, исправлении ошибок и подготовке документов, презентаций и таблиц.

По данным Anthropic, Sonnet 5.5 выдаёт ответ более чем на 30% быстрее предшественницы и обходится до 30% дешевле на задачу. Цена за токен не изменилась: $2 за миллион входных, $10 за миллион выходных и $0,20 за чтение из кэша, но модели обычно нужно заметно меньше токенов.

Что показывают тесты

В тесте агентного программирования Terminal-Bench 4.0 модель набирает 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5. В бенчмарке GDPval-AA, где проверяют реальную работу в 44 профессиях, у неё 1844 пункта по шкале Эло — на два меньше, чем у Opus 5.5.

Anthropic сама оговаривает, что баллы отражают лишь часть возможностей: по её оценке и отзывам внешних тестировщиков, в сложной открытой работе Opus 5.5 остаётся заметно сильнее. Это первая модель Sonnet, которая прошла игру Pokémon Red, ориентируясь только по скриншотам.

Защиты и доступность

Возможности Sonnet 5.5 в кибербезопасности сопоставимы с Opus 5, поэтому это первая модель Sonnet с защитами и резервным переключением, как у старших моделей: рискованные задачи по кибербезопасности будут уходить на Sonnet 5. Защиты для биологии остались прежними.

Модель доступна на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure; в API она называется claude-sonnet-5-5. Claude Haiku 5.5 компания обещает в ближайшие недели.

Что пока неизвестно

Все приведённые результаты опубликовала сама Anthropic. GDPval-AA проводила компания Artificial Analysis на предварительной версии модели, в которой Anthropic позже нашла и исправила ошибку; как это повлияло на оценку, точно не известно.

Источники

Читайте также