Eksperci podzieleni w sprawie Claude Opus 5 po pierwszych niezależnych testach

Eksperci podzieleni w sprawie Claude Opus 5 po pierwszych niezależnych testach

Niezależni testerzy ocenili nowy model Anthropic, Claude Opus 5, na 159 punktów w jednym z indeksów możliwości – o dwa punkty mniej niż Claude Fable 5 – przy jednoczesnym ostrym sporze o jakość jego pracy w code review.

Najważniejsze ustalenia:

  • Epoch AI wycenił Claude Opus 5 na 159 pkt w swoim indeksie możliwości, wobec 161 pkt dla Claude Fable 5, przy remisie w kategorii inżynierii oprogramowania.
  • CodeRabbit odnotował 39,3% precyzji w komentarzach faktycznie przydatnych do poprawy kodu (wobec bazowych 35,2%), ale aż czterokrotny wzrost liczby „czepialskich” uwag.
  • Zespoły korporacyjne Cognition i Zapier raportują wyraźne zyski w debugowaniu i kompleksowej automatyzacji procesów biznesowych.

Wczesne benchmarki Claude Opus 5 pod lupą rynku

Anthropic udostępnił model w piątek i w swoim komunikacie podał, że Opus 5 zbliża się do „frontierowej” inteligencji Fable 5 przy połowie jego ceny, pozycjonując go raczej jako model do codziennego użytku niż wyspecjalizowane narzędzie premium. Zewnętrzni ewaluatorzy w większości z tą tezą się zgadzają, choć różnią się co do skali przewagi.

Epoch AI wycenił Opus 5 na 159 pkt w swoim indeksie możliwości, wobec 161 pkt dla Fable 5, i – jak pokazało zestawienie Latent Spaceuznał, że oba modele są porównywalne pod względem inżynierii oprogramowania.

Artificial Analysis umieścił Opus 5 na pierwszym miejscu w benchmarku agentów do pracy wiedzochłonnej, z przewagą blisko 150 punktów Elo nad Fable 5 i jednocześnie o 20% niższym kosztem zadania. Część deweloperów skrytykowała jednak sam indeks możliwości: ich zdaniem zaledwie jeden punkt przewagi nad starszym Opus 4.8 rażąco zaniża skok jakości widoczny w codziennym użytkowaniu. Jeden z ewaluatorów zauważył, że średni poziom „wysiłku” modelu dał lepsze wyniki w teście kodowania niż ustawienia wyższe.

Zobacz też: BitMEX kończy działalność po 11 latach. Kupiec się nie znalazł

Code review dzieli społeczność testującą

CodeRabbit przetestował Opus 5 na ok. 100 wzorcach błędów wyciągniętych z rzeczywistych pull requestów open source, wykonując po trzy przebiegi dla każdej konfiguracji, i zmierzył 39,3% precyzji w komentarzach, które faktycznie prowadziły do poprawy kodu.

To wynik lepszy od bazowych 35,2% osiąganych przez działającego w produkcji recenzenta CodeRabbit. Jednocześnie jednak Opus 5 wychwycił mniej znanych już błędów i wygenerował czterokrotnie więcej „nitpicków” – drobnych, niskowartościowych uwag, które inżynierowie muszą ręcznie przesiać.

Przy domyślnym poziomie wysiłku precyzja spadła do 26,4%. Firma podsumowała, że zespoły powinny traktować Opus 5 raczej jako drugiego, nastawionego na precyzję recenzenta, niż prosty upgrade istniejących, działających już potoków przeglądu kodu. Claire Vo, prowadząca siedmiomodelową ewaluację dla zespołów produktowych, w swojej recenzji określiła model jako „genialny, ale irytujący”, wskazując na „neurotyczną” skłonność do nadmiernych ostrzeżeń i przypadek konfliktu scalania, którego Opus 5 uparcie odmawiał ruszyć.

Klienci Anthropic widzą skok w działaniu agentów

Scott Wu, prezes Cognition, powiedział, że wewnątrz systemu Devin Opus 5 zbliża się do poziomu Fable przy połowie jego kosztu, szczególnie wyróżniając się w debugowaniu i analizie przyczyn źródłowych błędów. Wade Foster, szef Zapier, poinformował, że model wskoczył na szczyt wewnętrznego rankingu automatyzacji, nie zużywając przy tym więcej tokenów niż wcześniejsze wersje Claude, wycenione identycznie – 5 dol. za milion tokenów wejściowych.

Pochwałom towarzyszyły jednak zastrzeżenia. Anthropic zaznacza, że Opus 5 ustępuje modelowi Mythos 5 w ofensywnych zastosowaniach cyberbezpieczeństwa, a każde żądanie oznaczone przez wewnętrzne klasyfikatory bezpieczeństwa jest automatycznie przełączane na Opus 4.8.

Ostrożność spółki nie jest przypadkowa. Najmocniejsza linia modeli miała za sobą trudne tygodnie: Fable 5 zadebiutował w czerwcu, kilka dni później został wycofany z użytku, by powrócić do klientów dopiero na początku lipca.

Czytaj dalej: HubSpot spadł o 12,7%, a analitycy wskazują na nowego agenta OpenAI

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Najnowsze wiadomości
Pokaż wszystkie wiadomości
Eksperci podzieleni w sprawie Claude Opus 5 po pierwszych niezależnych testach | Yellow