Niezależni testerzy ocenili nowy model Anthropic, Claude Opus 5, na 159 punktów w jednym z indeksów możliwości – o dwa mniej niż Claude Fable 5 – przy jednoczesnym ostrym sporze o jego skuteczność w code review.
Najważniejsze ustalenia:
- Epoch AI wycenił Claude Opus 5 na 159 punktów w swoim indeksie możliwości, wobec 161 dla Claude Fable 5; oba modele uzyskały remis w inżynierii oprogramowania.
- CodeRabbit odnotował 39,3% precyzji w „actionable” komentarzach do kodu (wzrost z poziomu 35,2%), ale jednocześnie czterokrotny wzrost liczby drobnych uwag.
- Klienci korporacyjni Cognition i Zapier zgłaszają wyraźne postępy w debugowaniu i kompleksowej automatyzacji procesów biznesowych.
Wczesne benchmarki Claude Opus 5 pod lupą rynku
Anthropic wprowadził nowy model na rynek w piątek i ogłosił, że Opus 5 zbliża się możliwościami do Fable 5, oferując „frontier intelligence” za połowę ceny. Firma pozycjonuje go jako narzędzie do codziennej pracy, a nie wyspecjalizowanego eksperta. Zewnętrzni ewaluatorzy generalnie to potwierdzają, choć różnią się co do skali przewagi.
Epoch AI wycenił Opus 5 na 159 punktów w swoim indeksie możliwości wobec 161 dla Fable 5, przy takim samym wyniku obu modeli w kategorii inżynierii oprogramowania – wynika z podsumowania przygotowanego przez Latent Space pokazującego najnowsze benchmarki.
Artificial Analysis umieścił model na pierwszym miejscu w swoim benchmarku „agentic knowledge work”, gdzie Opus 5 wyprzedził Fable 5 o niemal 150 punktów Elo, jednocześnie obniżając koszt pojedynczego zadania o 20%. Część deweloperów skrytykowała jednak sam indeks możliwości, argumentując, że „jednopunktowa” poprawa względem starszego Opus 4.8 zdecydowanie zaniża skok jakości, który widzą w codziennym użyciu. Jeden z ewaluatorów odkrył też, że testy kodu najlepiej wypadają przy średnim, a nie najwyższym ustawieniu „wysiłku” modelu.
Przeczytaj także: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight
Oceny w code review dzielą testerów
CodeRabbit zestawił Opus 5 z ok. 100 wzorcami błędów wyciągniętych z rzeczywistych „pull requestów” open source. Każdą konfigurację przepuszczono przez zestaw trzech przebiegów, a wyniki pokazały 39,3% precyzji, jeśli chodzi o komentarze naprawdę przydatne do poprawy kodu.
To wynik lepszy niż 35,2% bazowego modelu produkcyjnego CodeRabbit, ale z wyraźnymi kosztami ubocznymi: Opus 5 zidentyfikował mniej znanych wcześniej błędów, za to wygenerował czterokrotnie więcej „nitpicks” – drobnych, mało wartościowych uwag, które inżynierowie muszą ręcznie przesiać.
Przy domyślnym poziomie wysiłku precyzja spadała do 26,4%. W efekcie firma uznała, że zespoły powinny traktować Opus 5 jako drugiego, mocno zorientowanego na precyzję recenzenta, a nie prostą podmianę elementu pipeline’u, który już działa poprawnie. Claire Vo, prowadząca siedmiomodelową ewaluację narzędzi dla zespołów produktowych, określiła Opus 5 jako „genialny, ale irytujący”, wskazując na „neurotyczną” skłonność do nadmiernej ostrożności i przypadek konfliktu scalania, którego model uparcie odmawiał ruszyć.
Klienci Anthropic chwalą postęp agentów
Scott Wu, prezes Cognition, ocenił, że Opus 5 zbliża się do poziomu Fable przy połowie kosztu w ramach systemu Devin – szczególnie w obszarze debugowania i analizy przyczyn źródłowych błędów. Wade Foster, szef Zapier, poinformował, że model wskoczył na pierwsze miejsce wewnętrznego rankingu automatyzacji, nie zużywając przy tym więcej tokenów niż wcześniejsze wersje Claude’a, wciąż wyceniane na 5 dol. za milion tokenów wejściowych.
Pochwały są jednak obwarowane zastrzeżeniami. Anthropic podkreśla, że Opus 5 pozostaje w tyle za modelem Mythos 5, jeśli chodzi o ofensywne zastosowania cyberbezpieczeństwa, a każde żądanie, które zostanie oznaczone przez wewnętrzne klasyfikatory bezpieczeństwa, automatycznie „spada” do Opus 4.8.
Ostrożność nie jest przypadkowa: najwyższa półka modeli Anthropic ma za sobą nerwowy okres. Fable 5 zadebiutował w czerwcu, po kilku dniach został wyłączony z użytku, a do użytkowników wrócił dopiero na początku lipca.
Następny artykuł: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent





