Anthropic в понедельник представила модель Claude Sonnet 5.5, заявив, что новый «средний» ИИ-уровень работает более чем на 30% быстрее и снижает стоимость выполнения задач до 30% по сравнению с предыдущей версией.
Ключевые факты:
- Sonnet 5.5 набрал 70,6% в тесте на программирование Terminal-Bench 4.0 против 10,3% у Sonnet 5.
- Это первый Sonnet, который сразу выходит с киберзащитой, ранее зарезервированной для топовых моделей Anthropic.
- Один независимый бенчмарк сообщил, что при максимальной нагрузке модель обходится дороже Sonnet 5 по стоимости задачи.
Результаты тестов Claude Sonnet 5.5
Sonnet 5.5 — второй представитель линейки Claude 5.5, появившийся всего через шесть дней после флагманского Claude Opus 5.5, сообщила компания в релизе здесь.
Anthropic позиционирует модель как более быструю и доступную альтернативу Opus 5.5, рассчитанную на чётко определённые повседневные задачи, исправление ошибок, а также подготовку выверенных документов, презентаций и таблиц. Тариф — $2 за миллион входных токенов и $10 за миллион выходных.
В агентном тесте на программирование Terminal-Bench 4.0 Sonnet 5.5 показал результат 70,6% против 10,3% у Sonnet 5 и 66,4% у более дорогого Opus 5.5. Модель также стала первым Sonnet, сумевшим пройти Pokémon Red, опираясь только на скриншоты, — это проверка долгосрочного планирования и понимания изображений.
Сейчас Sonnet 5.5 доступен на всех платформах Anthropic, включая Amazon Web Services, Google Cloud и Microsoft Azure. В ближайшие недели компания обещает выпустить младшую модель Claude Haiku 5.5, ориентированную на сценарии с большим объёмом вызовов и жёсткими ценовыми ограничениями. Это замкнёт линейку из трёх моделей.
По теме: OpenAI приостанавливает развитие Frontier AI после побега из «песочницы» 20 сентября
Защита и экономика Sonnet 5.5
Anthropic приводит слова Даниэля Фогеля (Daniel Vogel), операционного директора Epic Games. По его оценке, модель на ранних испытаниях успешно справлялась с десятками тысяч строк кода игровых систем, выдерживая «тот же уровень качества, что вы ожидаете от моделей более высокого класса».
Поскольку кибер-возможности Sonnet 5.5 сопоставимы с Opus 5, это первый Sonnet, который выходит сразу с теми же средствами кибербезопасности, что и самые мощные модели Anthropic. Обычные задачи по поиску и исправлению багов не ограничиваются, но более рискованные запросы в сфере кибербезопасности явно откатываются на Sonnet 5. Дополнительные классификаторы блокируют попытки вытащить пошаговую логику работы модели.
При этом заявления о снижении стоимости подтверждают не все испытания. По данным Artificial Analysis, компания зафиксировала взвешенную стоимость в $7,60 за задачу-бенчмарк при максимальном уровне усилий против $5,09 у Sonnet 5, хотя интегральный индекс модели вырос с 38 до 56.
Запуск Sonnet 5.5 последовал за премьерой Opus 5.5 22 сентября, когда Anthropic снизила цену флагмана на 20% — до $4 за миллион входных токенов и $20 за миллион выходных. Тогда компания заявляла, что Opus 5.5 будет примерно на 40% дешевле Opus 5 в типичных задачах и обеспечит более чем на 30% более быструю генерацию ответов. В тот же день OpenAI представила GPT-6 Sol и GPT-6 Luna, установив цены на уровне примерно половины от предшественников.
Читайте также: BlackRock прогнозирует выход вычислительной мощности на рынок фьючерсов

