Anthropic hat am 7. Oktober Claude Haiku 5.5 veröffentlicht, Modell-ID claude-haiku-5-5. Das kleine Modell bekommt 1 Million Token Kontext, 128.000 Token maximale Ausgabe und als erstes Haiku einen Effort-Regler. Der Preis fällt um rund 75 Prozent gegenüber Haiku 4.5.
Zwei Preisstufen statt einer
Haiku 5.5 rechnet unterschiedlich ab, je nachdem ob ein Prompt unter oder über 100.000 Token liegt. Unten kostet eine Million Input-Token 10 Cent, oben 50. Output: 50 Cent beziehungsweise 2,50 Dollar. Cache-Lesevorgänge liegen bei 1 Cent oder 5 Cent pro Million.
Zum Vergleich: Haiku 4.5 nahm pauschal 1 Dollar für Input und 5 für Output. Für Anfragen unter 100.000 Token ist Haiku 5.5 also 90 Prozent billiger, darüber 50 Prozent. Laut Anthropic fielen 90 Prozent aller Haiku-4.5-Anfragen in die günstigere Klasse.
Ein Haken steckt im Kleingedruckten: Haiku 5.5 benutzt den neuen Tokenizer von Sonnet 5.5 und Opus 5.5. Derselbe Text zählt damit etwas mehr Token als vorher. Die 75 Prozent Ersparnis rechnen das schon ein.
Der Sprung gegenüber Haiku 4.5 ist groß
Die Benchmarks sehen nach einem Generationswechsel aus, nicht nach einem Punkt-Release:
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| OSWorld 2.1 | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Terminal-Bench 4.0 | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| Humanity’s Last Exam | 45,9 % | 10,2 % | – | 56,9 % |
| Chartography | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Terminal-Bench ist der Ausreißer: Haiku 4.5 hat dort keine einzige Aufgabe gelöst. Bei OSWorld, also Rechnerbedienung, steht Haiku 5.5 näher an Sonnet 5.5 als an seinem Vorgänger.
Frühe Kunden berichten Ähnliches. Asana sah über 30 Prozent weniger Latenz und bis zu 2,5-mal schnellere Inferenz pro Agentenzug. HubSpot kam auf 92,8 Prozent in einer CRM-Testreihe, nach eigener Angabe der beste Wert, den dort je ein Modell erreicht hat. Box meldet 11 Punkte mehr als Haiku 4.5 bei etwa halber Latenz.
Was beim Umstieg bricht
Code für Haiku 4.5 läuft nicht unbedingt weiter. Manuelles Extended Thinking über budget_tokens gibt jetzt einen 400er zurück. Adaptive Thinking ist standardmäßig an, eine Antwort kann also mit Thinking-Blöcken anfangen. Dazu kommt der Tokenizer-Wechsel.
Bei den Schutzmechanismen liegt Haiku 5.5 zwischen den Generationen: strenger als Haiku 4.5, aber lockerer als die jüngeren großen Modelle. Im Cyber-Bereich erlaubt es mehr defensive Arbeit als Sonnet 5.5, blockiert aber Penetrationstests. Die Biologie-Schranken sind dieselben wie bei Sonnet 5, Sonnet 5.5 und Opus 5.
Verfügbar ist das Modell über die Claude API, Amazon Bedrock, die Claude Platform auf AWS, Google Cloud und Microsoft Foundry.
Haiku 5.5 ersetzt kein Opus
Anthropic sagt das selbst, und die Zahlen stützen es: Für komplexe Agenten-Codierung bleiben Sonnet 5.5 und Opus 5.5 die bessere Wahl. 39,2 Prozent auf Terminal-Bench sind gegen 70,6 kein Ersatz.
Interessant wird Haiku 5.5 bei der Arbeit, die man vorher gar nicht gemacht hat, weil sie zu teuer war. Kompaktierung, Zusammenfassungen, Klassifikation, Subagenten, die in einem Dokument eine Zahl suchen. Bei 10 Cent pro Million Token kann man ein Modell laufen lassen, wo man vorher eine Regex geschrieben hätte. Das ist die eigentliche Änderung – nicht der Benchmark-Sprung, sondern die Schwelle, ab der sich ein Modellaufruf lohnt.