Експерти розділилися щодо Claude Opus 5 після перших незалежних тестів

Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)
Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)

Незалежні оцінювачі поставили новій моделі Anthropic Claude Opus 5 159 балів за одним індексом можливостей — лише на два менше, ніж у Claude Fable 5, — але суттєво розійшлися в оцінках її роботи з кодом.

Головне:

  • Epoch AI оцінила Claude Opus 5 у 159 балів за своїм індексом можливостей проти 161 у Claude Fable 5; у сфері розробки ПЗ моделі показали паритет.
  • CodeRabbit зафіксувала 39,3% точності «дієвих» коментарів у код‑рев’ю, проти базових 35,2%, але кількість дрібних зауважень зросла вчетверо.
  • Корпоративні клієнти Cognition і Zapier повідомляють про кращий дебагінг та повніші сценарії бізнес‑автоматизації.

Ранні бенчмарки Claude Opus 5 під прицілом ринку

Anthropic випустила модель у п’ятницю й заявила, що вона майже дорівнює Fable 5 за «фронтирним» інтелектом, але коштує вдвічі дешевше. Компанія позиціонує Opus 5 як щоденний робочий інструмент, а не нішевий флагман. Зовнішні оцінювачі загалом погодилися — але не в деталях.

Epoch AI виставила Opus 5 159 балів проти 161 у Fable 5 за своїм індексом можливостей і поставила моделі в один ряд за інженерією ПЗ, про що свідчить огляд Latent Space Latent Space.

Artificial Analysis вивела Opus 5 на перше місце у своєму бенчмарку агентної інтелектуальної праці: модель обійшла Fable 5 майже на 150 Elo і водночас знизила вартість одного завдання на 20%. Частина розробників розкритикувала сам індекс можливостей: на їхню думку, приріст лише на один пункт порівняно з попереднім Opus 4.8 геть не відображає відчутну різницю в щоденній роботі. Один із оцінювачів зафіксував, що середній рівень «зусилля» дав кращі результати в задачах із кодування, ніж вищі налаштування.

Читайте також: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

Вирок щодо код‑рев’ю розколов тестувальників

CodeRabbit прогнала Opus 5 через близько сотні реальних патернів помилок з відкритих pull‑request’ів, по три прогони на кожну конфігурацію, і зафіксувала 39,3% точності саме по «дієвих» коментарях.

Це вище за базові 35,2%, які нині демонструє їхній бойовий рев’юер, але нова модель виявила менше вже відомих багів і видала вчетверо більше дрібних зауважень — малозначущих коментарів, які інженерам доводиться вручну відсівати.

На стандартних налаштуваннях «зусилля» точність впала до 26,4%. Висновок CodeRabbit: командам варто використовувати Opus 5 як додаткового, «прицільного» рев’юера, а не як пряме оновлення вже відлагоджених пайплайнів. Клер Во, яка веде семимодельну оцінку для продуктових команд, у своєму огляді назвала модель «блискучою, але дратівливою» — через її схильність до «неврозів» і випадок, коли Opus 5 категорично відмовилася розв’язувати конфлікт злиття.

Клієнти Anthropic звітують про прогрес агентів

Скотт Ву, CEO Cognition, заявив, що всередині їхнього агента Devin Opus 5 підходить до рівня Fable за продуктивністю, але за половину вартості, особливо вирізняючись у дебагінгу та пошуку першопричин помилок. Вейд Фостер, керівник Zapier, повідомив, що Opus 5 очолила внутрішній рейтинг автоматизації, не витрачаючи більше токенів, ніж попередні версії Claude з ціною $5 за мільйон вхідних токенів.

Втім, є й обмеження. Anthropic зазначає, що Opus 5 поступається моделі Mythos 5 у наступальних кібербезпекових сценаріях, а запити, які тригерять внутрішні класифікатори безпеки, автоматично віддаються на Opus 4.8.

Обережність не випадкова: у верхньому сегменті лінійки триває непростий період. Fable 5 запустили у червні, за кілька днів модель зняли з сервісу, а користувачам її повернули лише на початку липня.

Далі до читання: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Експерти розділилися щодо Claude Opus 5 після перших незалежних тестів | Yellow