Anthropic w poniedziałek zaprezentował Claude Sonnet 5.5, twierdząc, że nowy model AI ze średniej półki działa ponad 30% szybciej i obniża koszt pojedynczego zadania nawet o 30% w porównaniu z poprzednią wersją.
Kluczowe informacje:
- Sonnet 5.5 zdobył 70,6% w teście kodowania Terminal-Bench 4.0, wobec 10,3% dla Sonnet 5.
- To pierwszy model Sonnet uruchomiony z zabezpieczeniami cybernetycznymi, dotąd zarezerwowanymi dla topowych systemów Anthropic.
- Niezależny benchmark miał jednak wykazać, że przy maksymalnym obciążeniu Sonnet 5.5 bywa droższy od Sonnet 5 w przeliczeniu na zadanie.
Benchmarki Claude Sonnet 5.5
To drugi model z rodziny Claude 5.5, który zadebiutował zaledwie sześć dni po flagowym Claude Opus 5.5, jak podała spółka w komunikacie said.
Anthropic pozycjonuje Sonnet 5.5 jako szybszy i tańszy odpowiednik Opus 5.5, przeznaczony do dobrze zdefiniowanych, codziennych zadań, poprawek błędów oraz dopracowywania dokumentów, prezentacji i arkuszy kalkulacyjnych. Cennik: 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych.
W teście Terminal-Bench 4.0, nastawionym na agentowe kodowanie, Sonnet 5.5 scored 70,6%, wobec 10,3% dla Sonnet 5 i 66,4% dla droższego Opus 5.5. Model became też pierwszym Sonnetem, który „przeszedł” grę Pokémon Red wyłącznie na podstawie zrzutów ekranu – to test zdolności do długotrwałej pracy sekwencyjnej i rozumienia obrazu.
Sonnet 5.5 runs już na wszystkich głównych platformach Anthropic, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Firma zapowiedziała, że w kolejnych tygodniach udostępni mniejszy model Claude Haiku 5.5, celowany w zastosowania o dużej skali i wysokiej wrażliwości na koszt. Dopełni on portfolio trzech modeli.
Zobacz także: OpenAI hamuje prace nad Frontier AI po ucieczce z piaskownicy 20 września
Zabezpieczenia i koszty Sonnet 5.5
Anthropic cited wypowiedź Daniela Vogla, dyrektora operacyjnego Epic Games, który relacjonował, że model w testach radził sobie z dziesiątkami tysięcy linii kodu odpowiedzialnych za systemy rozgrywki. Według Vogla Sonnet 5.5 „spełnił ten sam próg jakości, jakiego oczekuje się od modelu z wyższej półki”.
Dzięki kompetencjom cybernetycznym porównywalnym z Opus 5, Sonnet 5.5 jest pierwszym modelem serii, który startuje z pakietem zabezpieczeń, dotąd zarezerwowanym jedynie dla najmocniejszych systemów Anthropic. Rutynowe poprawianie błędów pozostaje bez zmian, natomiast bardziej ryzykowne zapytania z obszaru cyberbezpieczeństwa są widocznie przekierowywane na Sonnet 5. Nowe klasyfikatory blokują też próby wydobywania sposobu rozumowania modelu.
Nie wszystkie testy potwierdzają jednak obiecywane oszczędności. Firma Artificial Analysis measured ważony koszt na poziomie 7,60 dolara za zadanie benchmarkowe przy maksymalnym wysiłku, wobec 5,09 dolara dla Sonnet 5, mimo że indeksowy wynik nowego modelu wzrósł z 38 do 56.
Premiera Sonnet 5.5 następuje po debiucie Opus 5.5 z 22 września, kiedy Anthropic cut ceny flagowego modelu o 20%, do 4 dolarów za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych. Spółka deklarowała wówczas, że Opus 5.5 obniży typowe koszty obliczeń o ok. 40% względem Opus 5, jednocześnie generując odpowiedzi ponad 30% szybciej. OpenAI tego samego dnia wprowadził modele GPT-6 Sol i GPT-6 Luna, wyceniając je na połowę kosztu poprzednich generacji.
Czytaj dalej: BlackRock prognozuje, że moc obliczeniowa trafi na rynek kontraktów terminowych

