Незалежні тестувальники оцінили нову модель Anthropic — Claude Opus 5 — у 159 балів за одним із індексів можливостей, що лише на два пункти менше, ніж у Claude Fable 5. Водночас думки різко розійшлися щодо того, як трактувати її результат у рев’ю коду.
Головне:
- Epoch AI оцінила Claude Opus 5 у 159 балів за власним індексом можливостей проти 161 бала в Claude Fable 5; у розділі “software engineering” моделі зрівнялися.
- CodeRabbit зафіксував 39,3% точності для практично корисних коментарів до коду (проти базових 35,2%), однак модель у чотири рази збільшила кількість дрібних зауважень.
- Корпоративні тестери з Cognition і Zapier повідомляють про приріст у налагодженні коду та наскрізній автоматизації бізнес-процесів.
Ранні бенчмарки Claude Opus 5 під прицілом
Anthropic представила модель у п’ятницю і заявила, що за рівнем інтелекту вона майже наздоганяє Fable 5, але коштує вдвічі дешевше. Компанія позиціонує реліз як інструмент «на щодень», а не як вузькоспеціалізований продукт. Зовнішні оцінювачі загалом погодилися з такою рамкою, але — не з масштабом відриву.
Epoch AI поставила Opus 5 на позначку 159 у своєму індексі можливостей проти 161 балу в Fable 5, зафіксувавши паритет у блокові “software engineering”, на що вказує огляд Latent Space показав.
Аналітики Artificial Analysis підняли модель на перше місце у своєму бенчмарку агентної інтелектуальної праці: Opus 5 майже на 150 Elo випередила Fable 5 і водночас знизила вартість виконання одного завдання приблизно на 20%. Частина розробників розкритикувала такий індекс: за їхніми словами, «плюс один» бал до старішої Opus 4.8 абсолютно не відображає того стрибка, який вони бачать у щоденній роботі. Один із оцінювачів виявив, що середній рівень зусиль у тесті з програмування дав кращий результат, ніж вищі налаштування.
Читайте також: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
Оцінки рев’ю коду розкололи тестерів
CodeRabbit прогнав Opus 5 через приблизно 100 типових помилок, виділених з реальних pull request в open source, зробивши по три прогони на кожну конфігурацію, і зафіксував 39,3% точності для «actionable» коментарів — тобто зауважень, які реально приводять до змін у коді.
Це перевищило базовий показник у 35,2%, отриманий від їхнього продакшен-рев’юера, але водночас модель знаходила менше відомих багів і генерувала вчетверо більше «нітпіків» — малозначущих дрібних коментарів, які інженерам доводиться відсівати вручну.
На стандартному рівні зусиль точність падала до 26,4%. У підсумку компанія дійшла висновку, що командам варто ставитися до Opus 5 як до другого, більш «прицільного» рев’юера, а не до прямої заміни вже налагодженого пайплайну.
Клер Во (Claire Vo), яка керує семимодельною системою оцінки для продуктових команд, у своєму огляді назвала модель «блискучою, але дратівливою», звернувши увагу на «невротичну» манеру поведінки і випадок, коли Opus 5 категорично відмовилася розбиратися з конфліктом при злитті гілок.
Клієнти Anthropic фіксують прорив в агентах
Генеральний директор Cognition Скотт Ву заявив, що всередині агента Devin Claude Opus 5 наближається до рівня Fable за якістю, але за половину вартості, демонструючи особливу силу в налагодженні коду та пошуку глибинних причин збоїв.
Керівник Zapier Вейд Фостер розповів, що модель очолила внутрішній рейтинг автоматизації в компанії, не витрачаючи більше токенів, ніж попередні версії Claude з тією ж ціною — $5 за мільйон вхідних токенів.
Водночас захоплені відгуки мають застереження. Anthropic зазначає, що Opus 5 поступається моделі Mythos 5 в офензивній кібербезпеці, а запити, які блокують внутрішні класифікатори безпеки, автоматично відкотили до Opus 4.8.
Обережність не випадкова: флагманська лінійка пережила непростий період — Fable 5 вийшла у червні, була знята зі служби вже за кілька днів, а повернулася до користувачів лише на початку липня.
Читайте далі: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent





