Coding-Benchmarks sind die Währung, in der die KI-Branche ihre Modelle vergleicht. Genau deshalb ist die neue Prüfung von OpenAI so unangenehm — und so wichtig.
Von der Empfehlung zum Rückzug
Nachdem in SWE-bench Verified Schwächen gefunden worden waren, hatte OpenAI der Community empfohlen, auf den neueren Benchmark SWE-Bench Pro umzusteigen. Jetzt hat das Unternehmen denselben kritischen Blick auf SWE-Bench Pro gerichtet — und die Empfehlung wieder zurückgezogen.
Eine automatisierte Analyse-Pipeline markierte 286 von 731 Aufgaben im öffentlichen Set als potenziell problematisch. Eine anschließende Prüfung — mit ermittelnden Codex-Agenten plus fünf unabhängigen menschlichen Ingenieuren pro Aufgabe — bestätigte, dass 200 bis 249 Aufgaben tatsächlich defekt sind. Je nach Zählweise sind das 27,4 bis 34,1 Prozent des Benchmarks.
Was ‘defekt’ heißt
Die Mängel sind vielfältig: zu strenge Tests, die korrekte Lösungen fälschlich durchfallen lassen; unterspezifizierte Aufgabenstellungen, bei denen gar nicht klar ist, was gefragt ist; schlechte Testabdeckung; und irreführende Prompts. Mit anderen Worten: Ein Modell kann an solchen Aufgaben scheitern, obwohl es richtig gearbeitet hat — oder umgekehrt punkten, ohne das Problem wirklich gelöst zu haben.
OpenAIs Schlussfolgerung: Die Community sollte neue Benchmarks direkt von erfahrenen Entwicklern bauen lassen, statt sie automatisch aus Open-Source-Pull-Requests zu extrahieren.
Meine Einordnung
Für unsere Leser ist das aus einem Grund relevant: Wir alle vergleichen Claude, GPT und Grok anhand solcher Zahlen. Wenn ein Drittel eines viel zitierten Benchmarks fehlerhaft ist, dann sind auch die schönen Balkendiagramme, mit denen jedes neue Modell beworben wird, mit Vorsicht zu genießen — inklusive der Grok-4.5-Zahlen von dieser Woche, die genau auf SWE-Bench Pro fußen.
Ich lese das nicht als ‘Benchmarks sind wertlos’. Eher als Reifezeichen: Die Messinstrumente selbst werden jetzt kontinuierlich geprüft, statt als feste Wahrheit zu gelten. Gesund ist das. Nur sollte man beim nächsten ‘80 Prozent auf SWE-Bench Pro’-Post kurz innehalten und fragen: auf welcher Version, und wie sauber war das Set?
Quellen: