Anthropic ha presentato lunedì Claude Sonnet 5.5, sostenendo che il suo nuovo modello AI di fascia media è oltre il 30% più rapido e fino al 30% meno costoso per task rispetto alla versione precedente.
Punti chiave:
- Sonnet 5.5 ha ottenuto il 70,6% al test di coding Terminal-Bench 4.0, contro il 10,3% di Sonnet 5.
- È il primo modello Sonnet a esordire con le misure di cyber-sicurezza finora riservate ai sistemi di punta di Anthropic.
- Un benchmark indipendente sostiene che, al massimo livello di sforzo, il costo per task sarebbe superiore a quello di Sonnet 5.
I benchmark di Claude Sonnet 5.5
Si tratta del secondo modello della famiglia Claude 5.5, arrivato sei giorni dopo il top di gamma Claude Opus 5.5, ha dichiarato la società nel comunicato di lancio pubblicato.
Anthropic lo posiziona come complemento più rapido ed economico di Opus 5.5, pensato per attività quotidiane ben definite: correzione di bug, documenti rifiniti, presentazioni e fogli di calcolo. Il pricing è di 2 dollari per milione di token in input e 10 dollari per milione di token in output.
Nel Terminal-Bench 4.0, un test di coding “agentico”, Sonnet 5.5 ha raggiunto il 70,6%, contro il 10,3% di Sonnet 5 e il 66,4% del più costoso Opus 5.5. È anche diventato il primo modello Sonnet a completare Pokémon Red usando solo screenshot, un banco di prova per lavori di lungo respiro e capacità di comprensione visiva.
Il modello è ora disponibile su tutte le piattaforme Anthropic, tra cui Amazon Web Services, Google Cloud e Microsoft Azure. Anthropic ha annunciato che il più compatto Claude Haiku 5.5, mirato a casi d’uso ad alto volume e molto sensibili al prezzo, arriverà nelle prossime settimane, completando così la lineup a tre modelli.
Da leggere anche: OpenAI rallenta sui Frontier AI dopo la fuga dalla sandbox del 20 settembre
Sicurezza informatica e costi di Sonnet 5.5
Anthropic ha richiamato la testimonianza di Daniel Vogel, chief operating officer di Epic Games, secondo cui il modello ha gestito decine di migliaia di righe di codice dei sistemi di gameplay nei test preliminari. Vogel ha affermato che ha “raggiunto lo stesso livello qualitativo che ci si aspetterebbe da un modello di fascia più alta”.
Poiché le sue capacità cyber sono considerate paragonabili a quelle di Opus 5, Sonnet 5.5 è il primo modello della serie a essere lanciato con i meccanismi di salvaguardia che Anthropic aveva riservato alle sue soluzioni più potenti. La correzione ordinaria di bug non viene limitata, ma le richieste cyber a rischio più elevato vengono reindirizzate in modo visibile a Sonnet 5. Nuovi classificatori bloccano inoltre i tentativi di estrarre in modo diretto il processo di ragionamento del modello.
Non tutti i test, però, confermano i risparmi promessi. Artificial Analysis avrebbe misurato un costo ponderato di 7,60 dollari per task di benchmark al massimo livello di sforzo, contro i 5,09 dollari di Sonnet 5, pur con l’indice di performance del nuovo modello salito a 56 da 38.
Il lancio segue la presentazione del 22 settembre di Opus 5.5, in occasione della quale Anthropic ha tagliato del 20% il prezzo del modello di punta a 4 dollari per milione di token in input e 20 dollari per milione di token in output. Allora la società aveva indicato che Opus 5.5 avrebbe ridotto i costi tipici di circa il 40% rispetto a Opus 5, con una velocità di generazione superiore del 30%. OpenAI ha risposto lo stesso giorno con il lancio di GPT-6 Sol e GPT-6 Luna, prezzati a circa metà delle rispettive versioni precedenti.
Prossimo articolo: BlackRock prevede che la potenza di calcolo approderà sui mercati dei futures

