Независимые испытатели оценили новую модель Anthropic — Claude Opus 5 — в 159 баллов по одному из индексов возможностей, всего на два пункта ниже Claude Fable 5, но особенно резко разошлись в оценках её поведения на задачах код‑ревью.
Ключевые факты:
- Epoch AI присвоила Claude Opus 5 159 баллов по собственному индексу возможностей против 161 у Claude Fable 5; по инженерным задачам по ПО модели показали паритет.
- CodeRabbit зафиксировала точность в 39,3% по «действенным» комментариям в код‑ревью против базового уровня 35,2%, но при этом получила в четыре раза больше «придирок».
- Корпоративные заказчики Cognition и Zapier сообщили о заметном приросте на отладке и сквозной автоматизации бизнес‑процессов.
Ранние бенчмарки Claude Opus 5 под прицелом
Anthropic выпустила модель в пятницу и заявила, что по уровню «передовой» интеллекта она вплотную подбирается к Fable 5 при вдвое более низкой цене, позиционируя релиз как повседневный рабочий инструмент, а не нишевой продукт. Внешние оценщики в целом согласились с этим тезисом, но разошлись в оценке разрыва.
Epoch AI поставила Opus 5 159 баллов по своему индексу возможностей против 161 у Fable 5 и оценила их как сопоставимые по уровню в программной инженерии, следует из обзора Latent Space (подробнее).
Artificial Analysis вывела модель на первое место в своём бенчмарке «агентного» интеллектуального труда: Opus 5 обошёл Fable 5 почти на 150 Elo при снижении стоимости задачи примерно на 20%. Однако часть разработчиков раскритиковала сам индекс возможностей: по их мнению, прибавка всего в один пункт относительно прежнего Opus 4.8 радикально занижает скачок качества, который они видят в ежедневной работе. Один из оценщиков сообщил, что режим «среднего усилия» показал себя лучше усиленных настроек в тестах на программирование.
Также по теме: BitMEX прекращает работу после 11 лет без покупателя
Оценки качества код‑ревью разделили тестировщиков
CodeRabbit прогнала Opus 5 по примерно 100 типовым шаблонам ошибок из реальных open source pull‑request’ов, по три прогона на каждую конфигурацию, и замерила точность в 39,3% по «действенным» комментариям.
Это выше базового уровня 35,2%, который показывает их текущий производственный ревьюер, но при этом модель нашла меньше заранее известных багов и выдала в четыре раза больше «нитпиков» — малозначимых замечаний, которые инженерам приходится вручную отсеивать.
В стандартном режиме усилия точность падала до 26,4%. По итогам компания сделала вывод, что Opus 5 логичнее использовать как второго, «точностного» ревьюера, а не как прямую замену уже настроенного пайплайна. Клэр Во, которая ведёт сравнительную оценку семи моделей для продуктовых команд, назвала модель «блистательной, но раздражающей», указав на «невротичность» и отказ разруливать конкретный конфликт при слиянии веток.
Клиенты Anthropic видят прирост в агентных сценариях
Скотт Ву, гендиректор Cognition, сообщил, что в рамках их ИИ‑разработчика Devin Opus 5 вплотную приближается к уровню Fable при вдвое меньшей стоимости, особенно выигрывая в отладке и анализе первопричин ошибок. Уэйд Фостер, глава Zapier, отметил, что модель возглавила внутренний рейтинг систем автоматизации, не сжигая больше токенов, чем более ранние версии Claude с той же ценой в $5 за миллион входных токенов.
Однако высокая оценка сопровождается оговорками. В Anthropic подчеркнули, что по наступательным задачам кибербезопасности Opus 5 уступает их модели Mythos 5, а запросы, которые помечаются внутренними классификаторами безопасности, автоматически «откатываются» на Opus 4.8.
Осторожность объяснима: топовая линейка пережила непростой период — Fable 5 вышла в июне, была снята с сервиса через несколько дней и вернулась к пользователям лишь в начале июля.
Читайте далее: HubSpot упал на 12,7%, и аналитики винят новый агент OpenAI





