Anthropic & Claude

Claude Sonnet 5.5: gleicher Preis, 30 Prozent schneller, fünf Breaking Changes

3 Min. Lesezeit KI-generiert

Artificial Analysis misst bei maximalem Effort 193.000 Ausgabe-Token pro Aufgabe. Der höchste Wert, den sie je bei einem Modell gesehen haben, und rund siebenmal so viel wie GPT-6 Astra.

Featured image for "Claude Sonnet 5.5: gleicher Preis, 30 Prozent schneller, fünf Breaking Changes"

Sechs Tage nach Opus 5.5 hat Anthropic am Montag Claude Sonnet 5.5 veröffentlicht, das zweite Modell der 5.5-Familie. Die Model-ID lautet claude-sonnet-5-5, es läuft auf der Claude API, Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS. Haiku 5.5 soll in den nächsten Wochen folgen.

Der Preis bleibt bei 2 Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token, Cache-Lesezugriffe bei 20 Cent. Genau wie bei Sonnet 5. Anthropic argumentiert trotzdem mit bis zu 30 Prozent niedrigeren Kosten pro Aufgabe, weil das Modell weniger Token braucht. Die Ausgabe kommt zusätzlich 30 Prozent schneller.

Was die Benchmarks sagen

Auf Terminal-Bench 4.0, einem Test für agentisches Arbeiten in der Kommandozeile, springt Sonnet 5.5 von 10,3 auf 70,6 Prozent und liegt damit über Opus 5.5 (66,4). Auf GDPval-AA, das echte Arbeitsaufgaben aus 44 Berufen abbildet, fehlen ihm zwei Elo-Punkte zu Opus 5.5 – 1844 gegen 1846, nach 1449 bei Sonnet 5. Es ist außerdem das erste Sonnet, das Pokémon Rot allein anhand von Screenshots durchgespielt hat.

Epic Games sagt, das Modell habe zehntausende Zeilen Gameplay-Code verwaltet und mehrstündige Aufgaben durchgehalten. Balyasny hat 2.441 Finanzaufgaben durchgerechnet: 121.000 Token pro Antwort, wo Sonnet 5 noch 497.000 brauchte. Base44 kam über 118 App-Builds auf 3,6 Iterationen statt 7,7 mit Opus 5.

Fünf Dinge, die bestehenden Code brechen

Anthropic listet sie selbst auf, und sie sind unangenehm konkret:

  1. thinking: {"type": "disabled"} gibt einen 400er. Wer das Vorab-Denken abschalten will, schickt between_tools – und das geht nur bis Effort-Stufe high.
  2. Erzwungene Werkzeugnutzung ist weg. tool_choice mit any oder tool antwortet mit 400.
  3. Thinking-Blöcke sind an Modell und Gespräch gebunden. Sonnet 5.5 liest Blöcke von Sonnet 5, Opus 4.8 und Haiku 4.5, aber keine von Opus 5, Opus 5.5, Fable oder Mythos. Umgekehrt liest kein anderes Modell die Blöcke von Sonnet 5.5.
  4. Auf der Claude API und in Google Cloud wird computer_20251124 nicht mehr angenommen, nur noch computer_toolset_20260801. Auf Bedrock läuft das alte Tool weiter.
  5. Als Advisor werden Opus 4.8, Opus 4.7 und Sonnet 5 abgelehnt.

Dazu eine Änderung, die keinen Request kippt, aber Oberflächen leer aussehen lässt: Text zwischen Werkzeugaufrufen kommt jetzt in Thinking-Blöcken zurück. Wer ihn an Nutzer streamt, sieht dort nichts mehr, bis er den display-Wert setzt.

Der Preisvorteil hängt am Effort-Regler

Artificial Analysis hat nachgemessen und kommt auf Platz zwei ihres Intelligence Index, hinter Opus 5.5. Auf Terminal-Bench 4.0 bestätigen sie den Sprung: 64 Prozent gegen 14 Prozent bei Sonnet 5.

Der Haken steht im selben Bericht. Bei maximalem Effort verbrennt Sonnet 5.5 rund 193.000 Ausgabe-Token pro Aufgabe – 60 Prozent mehr als Opus 5.5 auf Max, etwa das Siebenfache von GPT-6 Astra. Damit liegt es auf der Kurve aus Intelligenz und Kosten pro Aufgabe nicht vorn, sondern daneben. Anthropics Rechnung mit den 30 Prozent gilt für den Alltag, nicht für die Spitze.

Der Distillationsschutz ist die eigentliche Neuerung

Punkt 3 der Breaking-Change-Liste klingt nach Verwaltungskram und ist es nicht. Thinking-Blöcke von Sonnet 5.5 funktionieren nur noch in dem Konto, das sie erzeugt hat, oder in einem verknüpften. Schickt ein anderes Konto sie, wirft die API sie stillschweigend weg. Der Request läuft durch, nur ohne Gedanken.

Anthropic nennt den Grund offen: Distillation über tausende Fake-Accounts. Sonnet 5.5 ist das erste Sonnet mit Klassifikatoren gegen Reasoning-Extraktion. Das ist ein Eingeständnis darüber, wie leicht sich Fähigkeiten aus Ausgaben herausziehen lassen – und der erste Fall, in dem Anthropics Antwort darauf die Ergonomie für ehrliche Entwickler verschlechtert. Wer in Claude Code mitten in der Sitzung das Konto wechselt, merkt es.

Quellen

AnthropicClaudeModelleAPI