Anthropic & Claude

Claude Opus 5.5 arbeitet auf Fable-Niveau und kostet 40 Prozent weniger

3 Min. Lesezeit KI-generiert

Ein früher Tester hat eine Migration über 680.000 Zeilen an einem Tag durchgezogen. Die Cache-Reads, bei Agenten der dickste Kostenblock, fallen von 50 auf 20 Cent je Million Token.

Featured image for "Claude Opus 5.5 arbeitet auf Fable-Niveau und kostet 40 Prozent weniger"

Anthropic hat gestern Claude Opus 5.5 veröffentlicht, das erste Modell der neuen 5.5-Familie. Es arbeitet laut Anthropic bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1 und kostet dabei 40 Prozent weniger als Opus 5. Sonnet 5.5 und Haiku 5.5 sollen in den kommenden Wochen folgen.

Dass etwas kommt, war absehbar: Vor drei Tagen habe ich darüber geschrieben, dass Anthropic ein neues Modell erwägt. Jetzt ist es da.

66,4 Prozent auf Terminal-Bench, und ein Vorbehalt von Anthropic selbst

Auf Terminal-Bench 4.0 steht Opus 5.5 bei 66,4 Prozent. Fable 5.1 kommt auf 55,8, Opus 5 auf 52,3, GPT-6 Astra auf 57,9. Bei FrontierCode v1.1 sind es 54,4 gegen 50,3 und 48,0, bei GDPval-AA v2.1 1846 Elo gegen 1735 und 1708. OSWorld 2.0 liegt bei 81,8 Prozent.

Bemerkenswert ist der Satz, den Anthropic direkt daneben schreibt: Auf diesem Fähigkeitsniveau seien Benchmark-Abstände «ein weniger verlässlicher Hinweis auf Unterschiede in der Praxis» geworden. Im eigenen Gebrauch sei der Abstand zwischen Opus 5.5 und Fable 5.1 schmaler, als die Zahlen nahelegen. Eine Firma, die ihre eigene Tabelle relativiert, liest man nicht jeden Tag.

Der Preis fällt dort am stärksten, wo Agenten am meisten verbrauchen

Eingabe kostet 4 Dollar je Million Token, Ausgabe 20 Dollar. Gegenüber Opus 5 mit 5 und 25 Dollar sind das jeweils 20 Prozent weniger. Der eigentliche Hebel steckt woanders: Cache-Reads fallen von 50 auf 20 Cent, ein Minus von 60 Prozent. Wer einen Agenten stundenlang über dieselbe Codebasis laufen lässt, zahlt genau dort das meiste.

Dazu kommt, dass Opus 5.5 pro Aufgabe weniger Token braucht. Beides zusammen ergibt die 40 Prozent. Die Ausgabe entsteht außerdem über 30 Prozent schneller. Für Claude Code und die Claude Platform gibt es einen Fast Mode mit bis zu 2,5-facher Geschwindigkeit, der 8 und 40 Dollar je Million Token kostet.

Und noch etwas, das viele direkt merken werden: Anthropic erhöht die Fünf-Stunden-Limits auf Pro, Max, Team und den platzbasierten Enterprise-Plänen. Abonnenten bekommen zusätzlich einen Rate-Limit-Reset, den man aufheben und dann einsetzen kann, wenn man ihn braucht.

Achtzehn Stunden ohne Aufsicht

Die Zahlen der frühen Tester sind konkreter als jeder Benchmark. Ein Tester hat eine Migration über 680.000 Zeilen in weniger als einem Tag abgeschlossen. Ein anderer hat eine Codebasis mit 200.000 Zeilen in unter drei Stunden geprüft und repariert, wofür Opus 5 über 20 Stunden brauchte und 2,5-mal so viele Token.

Sean Heintz von Clio hat dem Modell eine Aufgabe über sechs Repositories gegeben und es über Nacht unbeaufsichtigt laufen lassen: «Es blieb über 18 Stunden bei der Sache.» Anthropic selbst hat Opus 5.5 und Fable 5.1 HAProxy von C nach Rust übersetzen lassen. Beide bestanden fast alle Regressionstests, Opus 5.5 brauchte 9,5 statt 12 Stunden und kostete 51 Prozent weniger.

Dieselben Schranken wie bei Fable 5.1

Weil Opus 5.5 in Biologie und Cybersicherheit auf dem Niveau von Claude Mythos 5.1 liegt, gelten dieselben Schutzmaßnahmen wie bei Fable 5.1. Geprüfte Organisationen können sich ab sofort für das Life Sciences Verification Program bewerben, das Cyber Verification Program wird in den kommenden Wochen geöffnet.

Beim internen Verhaltensaudit, Anthropics umfangreichstem Alignment-Test, ist Opus 5.5 nach eigener Aussage das bislang bestbewertete Modell. Es greife seltener zu schwer umkehrbaren Aktionen und sei widerstandsfähiger gegen Prompt Injection als Opus 5. Bei einem Test der Sicherheitsfirma Gray Swan liegt es gleichauf mit Fable 5.1 an der Spitze. Vor dem Release haben externe Prüfer getestet, darunter METR und Frontier Design.

Das erste Modell nach dem Bremsruf ist ein Effizienzmodell

Anthropic schreibt selbst, dies sei die erste Veröffentlichung seit Amodeis Aufruf, das Tempo zu drosseln. Und wenn man genau hinsieht, ist der Release tatsächlich anders gebaut als die vorherigen: Der größte Sprung liegt nicht bei der Intelligenz, sondern beim Preis und beim Token-Verbrauch. Gleiches Niveau wie Fable 5.1, deutlich billiger.

Wer täglich mit Claude Code arbeitet, bekommt damit den nützlicheren Fortschritt. Ein Modell, das dieselbe Arbeit für 40 Prozent weniger erledigt, ändert im Alltag mehr als zehn Punkte auf einem Benchmark, den außerhalb der Labore niemand nachrechnet.

Quellen

ClaudeModelleAnthropic