Anthropic & Claude

GPT-6.1 Sol kostet genauso viel wie Claude Sonnet 5.5 und wird gegen Opus 5.5 gemessen

3 Min. Lesezeit KI-generiert

In einer Fußnote räumt OpenAI ein, dass Claude Fable 5.1 in der eigenen Grafik zu günstig dasteht: Bei rund 40 Prozent der Aufgaben fehlen die Kosten der Fallbacks.

Featured image for "GPT-6.1 Sol kostet genauso viel wie Claude Sonnet 5.5 und wird gegen Opus 5.5 gemessen"

OpenAI hat auf dem DevDay am Dienstag GPT-6.1 Sol vorgestellt. Das Interessante daran steht nicht in den Benchmark-Balken, sondern in der Preistabelle und in der Auswahl der Vergleichsmodelle.

Die Preise stehen auf derselben Zeile

GPT-6.1 Sol kostet über die API 2 Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token. Das ist auf den Cent dasselbe wie bei Claude Sonnet 5.5 und dasselbe wie bei GPT-6 Sol davor. Beim Cache liegt OpenAI darunter: 10 Cent pro Million gegen 20 Cent bei Sonnet 5.5, und halb so viel wie beim Vorgänger.

Verfügbar ist das Modell ab sofort für Plus, Pro, Business, Enterprise und Edu in ChatGPT Work und in Codex, über die API als gpt-6.1-sol. Im normalen Chat noch nicht. Eine Variante namens GPT-6.1 Sol Ultrafast soll in den nächsten Tagen folgen, mit bis zu achtfacher Ausgabegeschwindigkeit in Codex.

Das Verkaufsargument ist die Nähe zum großen Modell: OpenAI sagt, Sol 6.1 erreiche bei agentischem Programmieren, Computernutzung und Büroarbeit fast die Werte von GPT-6 Astra, zu einem Fünftel des Astra-Preises.

Gemessen wird gegen Opus 5.5 und Fable 5.1

Bemerkenswert ist, wen OpenAI in die eigenen Diagramme stellt. Auf DeepSWE v1.1, das echte Software-Aufgaben in vorhandenen Codebasen prüft, zieht Sol 6.1 mit Astra gleich und liegt 6,4 Prozentpunkte über GPT-6 Sol, bei geringerem Reasoning-Aufwand. Auf GDP.pdf, wo Modelle Fachfragen anhand komplizierter PDFs beantworten, schneidet Sol 6.1 besser ab als Opus 5.5 mit Fallbacks, bei weniger als der Hälfte der Kosten pro Aufgabe. Auf AutomationBench, 47 Werkzeuge über sechs Unternehmensbereiche, liegt es bei mittlerem Aufwand 2,2 Punkte über Opus 5.5 und kostet dabei etwa ein Drittel.

Eine Fußnote in derselben Grafik verdient Beachtung: Der Datenpunkt für Claude Fable 5.1 unterschätze dessen tatsächliche Kosten, weil die Kosten der Fallbacks fehlen. Die traten bei rund 40 Prozent der Aufgaben auf. OpenAI rechnet die Konkurrenz an dieser Stelle also besser, als sie in der eigenen Messung dastand, und sagt es dazu.

Bei der Computernutzung (OSWorld 2.0, Offline-Satz) kommt Sol 6.1 bei maximalem Aufwand auf 2,1 Punkte hinter Astra, für etwa ein Siebtel der Kosten pro Aufgabe. Auf Terminal-Bench Science 0.1 kommt es bei maximalem Aufwand auf mehr als den doppelten Wert von GPT-6 Sol, bei 5,47 Dollar pro Aufgabe im Schnitt.

Alle Vergleichswerte für fremde Modelle stammen laut OpenAI aus öffentlich verfügbaren Berichten, die eigenen aus der internen Umgebung oder über die API. Diese Einschränkung ist üblich, und sie gilt hier wie überall.

Der Preis ist kein Argument mehr

Zwei Dollar rein, zehn raus: Diese Zeile war bis Dienstag die Sonnet-Zeile. Jetzt steht dasselbe bei OpenAIs Arbeitstier, und beim Cache sogar günstiger. Wer eine Pipeline hat, die viel Kontext wiederverwendet, sieht diese zehn Cent sofort in der Rechnung.

Die zweite Beobachtung ist die wichtigere. OpenAI vergleicht sein mittleres Modell nicht mehr mit Sonnet, sondern mit Opus 5.5 und Fable 5.1, also mit dem, was Anthropic für lange Agentenläufe und Wissensarbeit anbietet. Das ist eine Positionierung, keine Messung: Die Behauptung ist, dass man Anthropics großes Modell nicht mehr braucht, weil das mittlere von OpenAI reicht. Ob das trägt, entscheidet niemand an einem Benchmark-Balken, sondern am dritten Tag in einem echten Repository.

Quellen

OpenAIClaudeBenchmarksPreise