Мнения аналитиков о Claude Opus 5 разошлись после первых независимых тестов

Мнения аналитиков о Claude Opus 5 разошлись после первых независимых тестов

Независимые испытатели оценили новую модель AnthropicClaude Opus 5 — в 159 баллов по одному из индексов возможностей, всего на два пункта ниже Claude Fable 5, но особенно резко разошлись в оценках её поведения на задачах код‑ревью.

Ключевые факты:

  • Epoch AI присвоила Claude Opus 5 159 баллов по собственному индексу возможностей против 161 у Claude Fable 5; по инженерным задачам по ПО модели показали паритет.
  • CodeRabbit зафиксировала точность в 39,3% по «действенным» комментариям в код‑ревью против базового уровня 35,2%, но при этом получила в четыре раза больше «придирок».
  • Корпоративные заказчики Cognition и Zapier сообщили о заметном приросте на отладке и сквозной автоматизации бизнес‑процессов.

Ранние бенчмарки Claude Opus 5 под прицелом

Anthropic выпустила модель в пятницу и заявила, что по уровню «передовой» интеллекта она вплотную подбирается к Fable 5 при вдвое более низкой цене, позиционируя релиз как повседневный рабочий инструмент, а не нишевой продукт. Внешние оценщики в целом согласились с этим тезисом, но разошлись в оценке разрыва.

Epoch AI поставила Opus 5 159 баллов по своему индексу возможностей против 161 у Fable 5 и оценила их как сопоставимые по уровню в программной инженерии, следует из обзора Latent Space (подробнее).

Artificial Analysis вывела модель на первое место в своём бенчмарке «агентного» интеллектуального труда: Opus 5 обошёл Fable 5 почти на 150 Elo при снижении стоимости задачи примерно на 20%. Однако часть разработчиков раскритиковала сам индекс возможностей: по их мнению, прибавка всего в один пункт относительно прежнего Opus 4.8 радикально занижает скачок качества, который они видят в ежедневной работе. Один из оценщиков сообщил, что режим «среднего усилия» показал себя лучше усиленных настроек в тестах на программирование.

Также по теме: BitMEX прекращает работу после 11 лет без покупателя

Оценки качества код‑ревью разделили тестировщиков

CodeRabbit прогнала Opus 5 по примерно 100 типовым шаблонам ошибок из реальных open source pull‑request’ов, по три прогона на каждую конфигурацию, и замерила точность в 39,3% по «действенным» комментариям.

Это выше базового уровня 35,2%, который показывает их текущий производственный ревьюер, но при этом модель нашла меньше заранее известных багов и выдала в четыре раза больше «нитпиков» — малозначимых замечаний, которые инженерам приходится вручную отсеивать.

В стандартном режиме усилия точность падала до 26,4%. По итогам компания сделала вывод, что Opus 5 логичнее использовать как второго, «точностного» ревьюера, а не как прямую замену уже настроенного пайплайна. Клэр Во, которая ведёт сравнительную оценку семи моделей для продуктовых команд, назвала модель «блистательной, но раздражающей», указав на «невротичность» и отказ разруливать конкретный конфликт при слиянии веток.

Клиенты Anthropic видят прирост в агентных сценариях

Скотт Ву, гендиректор Cognition, сообщил, что в рамках их ИИ‑разработчика Devin Opus 5 вплотную приближается к уровню Fable при вдвое меньшей стоимости, особенно выигрывая в отладке и анализе первопричин ошибок. Уэйд Фостер, глава Zapier, отметил, что модель возглавила внутренний рейтинг систем автоматизации, не сжигая больше токенов, чем более ранние версии Claude с той же ценой в $5 за миллион входных токенов.

Однако высокая оценка сопровождается оговорками. В Anthropic подчеркнули, что по наступательным задачам кибербезопасности Opus 5 уступает их модели Mythos 5, а запросы, которые помечаются внутренними классификаторами безопасности, автоматически «откатываются» на Opus 4.8.

Осторожность объяснима: топовая линейка пережила непростой период — Fable 5 вышла в июне, была снята с сервиса через несколько дней и вернулась к пользователям лишь в начале июля.

Читайте далее: HubSpot упал на 12,7%, и аналитики винят новый агент OpenAI

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Мнения аналитиков о Claude Opus 5 разошлись после первых независимых тестов | Yellow