Anthropic hat am Montag Claude Sonnet 5.5 vorgestellt. Das neue Midrange-Modell der Claude-Familie soll laut Anbieter über 30 % schneller sein und die Kosten pro Task um bis zu 30 % senken – verglichen mit dem Vorgänger Sonnet 5.
Wichtigste Fakten:
- Sonnet 5.5 erzielte im Coding-Benchmark Terminal-Bench 4.0 eine Trefferquote von 70,6 %, nach 10,3 % bei Sonnet 5.
- Es ist das erste Sonnet-Modell, das mit Cyber-Schutzmechanismen startet, die zuvor den Top-Systemen von Anthropic vorbehalten waren.
- Ein unabhängiger Benchmark kommt dagegen zum Ergebnis, dass Sonnet 5.5 bei maximaler Auslastung pro Task teurer sein kann als Sonnet 5.
Benchmarks zu Claude Sonnet 5.5
Das Modell ist die zweite Variante der Claude-5.5-Reihe und folgte nur sechs Tage nach dem Flaggschiff Claude Opus 5.5, wie das Unternehmen in seiner Ankündigung erklärte.
Anthropic positioniert Sonnet 5.5 als schnellere und günstigere Ergänzung zu Opus 5.5, ausgelegt für klar umrissene Alltagsaufgaben, Bugfixes sowie die Erstellung und Überarbeitung von Dokumenten, Präsentationen und Tabellen. Die Nutzungspreise liegen bei 2 US‑Dollar pro eine Million Input-Tokens und 10 US‑Dollar pro eine Million Output-Tokens.
Im agentenbasierten Coding-Test Terminal-Bench 4.0 erreichte Sonnet 5.5 eine Punktzahl von 70,6 %, nach 10,3 % für Sonnet 5 und 66,4 % für das teurere Opus 5.5. Zudem wurde es das erste Sonnet-Modell, das Pokémon Red ausschließlich anhand von Screenshots durchspielt – ein Test für langfristige Aufgabenplanung und Bildverständnis.
Das Modell läuft inzwischen auf allen Anthropic-Plattformen, darunter Amazon Web Services, Google Cloud und Microsoft Azure. Das kleinere Claude Haiku 5.5, das auf hohe Volumina und besonders kostensensible Workloads zielt, soll in den nächsten Wochen folgen. Damit wäre die Drei-Modell-Palette komplett.
Lesetipp: OpenAI tritt bei Frontier-AI nach Sandbox-Ausbruch am 20. September auf die Bremse
Schutzmechanismen und Kosten von Sonnet 5.5
Anthropic verwies auf Daniel Vogel, Chief Operating Officer bei Epic Games, der berichtete, Sonnet 5.5 habe in frühen Tests zehntausende Zeilen Gameplay-System-Code verarbeitet. Das Modell habe „denselben Qualitätsstandard erfüllt, den man sonst von einer höheren Modellklasse erwarten würde“.
Da die Cyber-Fähigkeiten von Sonnet 5.5 nach Einschätzung von Anthropic in etwa dem Niveau von Opus 5 entsprechen, ist es das erste Sonnet-Modell, das mit denselben Schutzvorkehrungen startet, die bislang den leistungsstärksten Systemen vorbehalten waren. Routinemäßige Bugfixes sollen dadurch nicht beeinträchtigt werden, risikoreichere Cyber-Anfragen werden jedoch sichtbar auf Sonnet 5 zurückgestuft. Neue Klassifizierer blockieren zudem Versuche, das interne Entscheidungsverhalten des Modells offenzulegen.
Allerdings stützen nicht alle Tests die Kostenargumentation. Das Analysehaus Artificial Analysis soll laut Bericht ermittelt haben, dass Sonnet 5.5 bei maximaler Rechenintensität auf gewichtete Benchmark-Kosten von 7,60 US‑Dollar pro Task kommt – gegenüber 5,09 US‑Dollar bei Sonnet 5. Gleichzeitig stieg der Index-Score des neuen Modells jedoch von 38 auf 56.
Der Launch folgt auf die Einführung von Opus 5.5 am 22. September. Damals senkte Anthropic die Preise für das Flaggschiffmodell um 20 % auf 4 US‑Dollar pro eine Million Input-Tokens und 20 US‑Dollar pro eine Million Output-Tokens. Opus 5.5 solle typischerweise rund 40 % günstiger sein als Opus 5 und die Ausgabe über 30 % schneller erzeugen. OpenAI brachte am selben Tag GPT‑6 Sol und GPT‑6 Luna auf den Markt und halbierte dabei die Preise im Vergleich zu den jeweiligen Vorgängern.
Nächster Beitrag: BlackRock sieht Rechenleistung auf dem Weg an die Terminmärkte

