Anthropic у понеділок презентувала Claude Sonnet 5.5, заявивши, що її нова середня модель ШІ працює більш як на 30% швидше й здешевлює виконання завдань до 30% порівняно з попередником.
Основні тези:
- Sonnet 5.5 набрала 70,6% у тесті кодування Terminal-Bench 4.0 проти 10,3% у Sonnet 5.
- Це перша модель лінійки Sonnet, яка від старту отримала кіберзахист рівня флагманських систем Anthropic.
- Один із незалежних бенчмарків показав вищу собівартість завдання, ніж у Sonnet 5, за максимального навантаження.
Бенчмарки Claude Sonnet 5.5
Модель стала другою в лінійці Claude 5.5 і вийшла всього через шість днів після флагмана Claude Opus 5.5, йдеться в релізі компанії said.
Anthropic позиціонує Sonnet 5.5 як швидше та дешевше доповнення до Opus 5.5 — для чітко окреслених щоденних завдань, виправлення багів, підготовки відшліфованих документів, презентацій і таблиць. Тариф: $2 за 1 млн вхідних токенів і $10 за 1 млн вихідних.
У тесті Terminal-Bench 4.0, який моделює агентне кодування, Sonnet 5.5 scored 70,6% — проти 10,3% у Sonnet 5 та 66,4% у дорожчого Opus 5.5. Модель також became першою в серії Sonnet, яка пройшла гру Pokémon Red, маючи доступ лише до скриншотів, що тестує здатність до довгих ланцюжків дій і розуміння зображень.
Модель уже runs на всіх платформах Anthropic, зокрема в Amazon Web Services, Google Cloud та Microsoft Azure. Anthropic анонсувала, що компактніша Claude Haiku 5.5, орієнтована на великі обсяги й чутливі до ціни сценарії, з’явиться протягом кількох тижнів. Це замкне трищабельну лінійку.
Також читайте: OpenAI натискає на гальма у Frontier AI після «втечі» із пісочниці 20 вересня
Захист і вартість Sonnet 5.5
Anthropic cited слова операційного директора Epic Games Даніеля Фогеля, який заявив, що модель на етапі тестування опрацьовувала десятки тисяч рядків коду ігрових систем. За його оцінкою, вона «відповідає тій самій планці якості, яку очікуєш від моделі вищого класу».
Оскільки кіберможливості Sonnet 5.5 зіставні з Opus 5, це перша модель середнього рівня Anthropic, яка виходить із повним набором кіберзапобіжників, раніше зарезервованих для найпотужніших систем компанії. Рутинний пошук і виправлення багів при цьому не обмежується, але ризиковіші кіберзапити явно переводяться назад на Sonnet 5. Додаткові класифікатори блокують спроби витягти ланцюжок міркувань моделі.
Не всі тести підтверджують заявлену економію. За даними Artificial Analysis, компанія measured зважену вартість $7,60 за еталонне завдання за максимального рівня зусиль проти $5,09 у Sonnet 5, попри те, що інтегральний індекс моделі зріс із 38 до 56.
Запуск Sonnet 5.5 відбувся слідом за релізом Opus 5.5 22 вересня, коли Anthropic cut ціну флагмана на 20% — до $4 за 1 млн вхідних токенів і $20 за 1 млн вихідних. Тоді компанія заявляла, що Opus 5.5 знизить витрати приблизно на 40% проти Opus 5 на типових навантаженнях і генеруватиме відповіді більш ніж на 30% швидше. OpenAI того ж дня представила GPT-6 Sol і GPT-6 Luna, встановивши ціни на рівні половини вартості їхніх попередників.
Далі по темі: BlackRock прогнозує появу ф’ючерсів на обчислювальні потужності

