Независимые тестировщики оценили новую модель Anthropic — Claude Opus 5 — в 159 баллов по одному из индексов возможностей. Это всего на два пункта ниже, чем у Claude Fable 5, однако наибольшие споры вызвали именно результаты модели в задачах ревью кода.
Ключевые выводы:
- Epoch AI присвоила Claude Opus 5 159 баллов в своем индексе возможностей против 161 у Claude Fable 5; по показателям в разработке ПО модели оказались на уровне.
- CodeRabbit зафиксировала точность 39,3% по «действенным» комментариям к коду (против базовых 35,2%), но при этом численность придирок выросла вчетверо.
- Корпоративные клиенты Cognition и Zapier сообщили о заметном росте качества в отладке и сквозной автоматизации бизнес‑процессов.
Ранние бенчмарки Claude Opus 5 под пристальным вниманием
Anthropic выпустила модель в пятницу и заявила, что по уровню «фронтирного» интеллекта она вплотную подходит к Fable 5, но при этом стоит вдвое дешевле. Компания позиционирует Opus 5 как инструмент на каждый день, а не нишевое решение. Внешние оценщики в целом согласились с таким позиционированием — но разошлись в оценке разрыва.
Epoch AI поставила Opus 5 159 баллов против 161 у Fable 5 и признала их равными по инженерным задачам. Об этом следует из обзора Latent Space (подробности).
Artificial Analysis вывела модель на первое место в своем бенчмарке «агентского» интеллектуального труда: Opus 5 обошёл Fable 5 почти на 150 пунктов Elo, одновременно снизив стоимость выполнения задачи примерно на 20%. Часть разработчиков подвергла сомнению сам индекс возможностей: по их мнению, зафиксированный прирост всего в один пункт по сравнению с прошлой версией Opus 4.8 сильно занижает скачок, который они наблюдают в повседневной работе. Один из оценщиков даже отметил, что при средних настройках усилия модель справилась с кодинг‑тестом лучше, чем при более «агрессивных».
Также по теме: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
Оценка возможностей ревью кода расколола тестировщиков
CodeRabbit прогнала Opus 5 через около сотни реальных шаблонов ошибок, извлечённых из открытых pull‑request’ов, три прохода для каждой конфигурации, и получила 39,3% точности по «действенным» комментариям.
Этот результат выше базового уровня 35,2%, который показывает используемый в продакшене ревьюер, но при этом модель выявила меньше известных багов и выдала в четыре раза больше «нитпиков» — малоценных замечаний, которые инженерам приходится вручную просеивать.
На стандартном уровне усилия точность падала до 26,4%. Вывод компании: командам стоит использовать Opus 5 как второго, «точечного» ревьюера, а не как прямую замену уже отлаженному пайплайну код‑ревью. Клэр Во, которая ведёт собственное сравнение семи моделей для продуктовых команд, назвала Opus 5 «блестящей, но раздражающей» — отметив у модели «невротичный характер» и случай с конфликтом слияния, к которому та отказалась прикасаться.
Клиенты Anthropic сообщают о росте эффективности агентов
Гендиректор Cognition Скотт Ву заявил, что внутри агента Devin Opus 5 по эффективности вплотную приблизился к уровню Fable при вдвое меньшей стоимости, особенно в задачах отладки и поиска первопричин сбоев. Руководитель Zapier Уэйд Фостер сообщил, что модель возглавила внутренний рейтинг инструментов для автоматизации, не потребляя при этом больше токенов, чем предыдущие версии Claude с той же ценой — $5 за миллион входных токенов.
Однако восторженные оценки сопровождались оговорками. В Anthropic признали, что по наступательным задачам в кибербезопасности Opus 5 уступает модели Mythos 5, а запросы, которые срабатывают на фильтрах безопасности компании, автоматически откатываются на Opus 4.8.
Осторожный подход объясним: у топ‑линейки Anthropic выдался непростой период. Fable 5 вышла в июне, была снята с сервиса спустя несколько дней и вернулась пользователям лишь в начале июля.
Читайте далее: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent





