Эксперты разошлись во мнениях о Claude Opus 5 после первых независимых тестов

Эксперты разошлись во мнениях о Claude Opus 5 после первых независимых тестов

Независимые тестировщики оценили новую модель AnthropicClaude Opus 5 — в 159 баллов по одному из индексов возможностей. Это всего на два пункта ниже, чем у Claude Fable 5, однако наибольшие споры вызвали именно результаты модели в задачах ревью кода.

Ключевые выводы:

  • Epoch AI присвоила Claude Opus 5 159 баллов в своем индексе возможностей против 161 у Claude Fable 5; по показателям в разработке ПО модели оказались на уровне.
  • CodeRabbit зафиксировала точность 39,3% по «действенным» комментариям к коду (против базовых 35,2%), но при этом численность придирок выросла вчетверо.
  • Корпоративные клиенты Cognition и Zapier сообщили о заметном росте качества в отладке и сквозной автоматизации бизнес‑процессов.

Ранние бенчмарки Claude Opus 5 под пристальным вниманием

Anthropic выпустила модель в пятницу и заявила, что по уровню «фронтирного» интеллекта она вплотную подходит к Fable 5, но при этом стоит вдвое дешевле. Компания позиционирует Opus 5 как инструмент на каждый день, а не нишевое решение. Внешние оценщики в целом согласились с таким позиционированием — но разошлись в оценке разрыва.

Epoch AI поставила Opus 5 159 баллов против 161 у Fable 5 и признала их равными по инженерным задачам. Об этом следует из обзора Latent Space (подробности).

Artificial Analysis вывела модель на первое место в своем бенчмарке «агентского» интеллектуального труда: Opus 5 обошёл Fable 5 почти на 150 пунктов Elo, одновременно снизив стоимость выполнения задачи примерно на 20%. Часть разработчиков подвергла сомнению сам индекс возможностей: по их мнению, зафиксированный прирост всего в один пункт по сравнению с прошлой версией Opus 4.8 сильно занижает скачок, который они наблюдают в повседневной работе. Один из оценщиков даже отметил, что при средних настройках усилия модель справилась с кодинг‑тестом лучше, чем при более «агрессивных».

Также по теме: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

Оценка возможностей ревью кода расколола тестировщиков

CodeRabbit прогнала Opus 5 через около сотни реальных шаблонов ошибок, извлечённых из открытых pull‑request’ов, три прохода для каждой конфигурации, и получила 39,3% точности по «действенным» комментариям.

Этот результат выше базового уровня 35,2%, который показывает используемый в продакшене ревьюер, но при этом модель выявила меньше известных багов и выдала в четыре раза больше «нитпиков» — малоценных замечаний, которые инженерам приходится вручную просеивать.

На стандартном уровне усилия точность падала до 26,4%. Вывод компании: командам стоит использовать Opus 5 как второго, «точечного» ревьюера, а не как прямую замену уже отлаженному пайплайну код‑ревью. Клэр Во, которая ведёт собственное сравнение семи моделей для продуктовых команд, назвала Opus 5 «блестящей, но раздражающей» — отметив у модели «невротичный характер» и случай с конфликтом слияния, к которому та отказалась прикасаться.

Клиенты Anthropic сообщают о росте эффективности агентов

Гендиректор Cognition Скотт Ву заявил, что внутри агента Devin Opus 5 по эффективности вплотную приблизился к уровню Fable при вдвое меньшей стоимости, особенно в задачах отладки и поиска первопричин сбоев. Руководитель Zapier Уэйд Фостер сообщил, что модель возглавила внутренний рейтинг инструментов для автоматизации, не потребляя при этом больше токенов, чем предыдущие версии Claude с той же ценой — $5 за миллион входных токенов.

Однако восторженные оценки сопровождались оговорками. В Anthropic признали, что по наступательным задачам в кибербезопасности Opus 5 уступает модели Mythos 5, а запросы, которые срабатывают на фильтрах безопасности компании, автоматически откатываются на Opus 4.8.

Осторожный подход объясним: у топ‑линейки Anthropic выдался непростой период. Fable 5 вышла в июне, была снята с сервиса спустя несколько дней и вернулась пользователям лишь в начале июля.

Читайте далее: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Эксперты разошлись во мнениях о Claude Opus 5 после первых независимых тестов | Yellow