Vor ein paar Tagen hat Simon Willison Claude Fable 5 gebeten, aus einer vier Jahre alten Spielidee — damals mit GPT-3 und DALL-E entstanden — in einem einzigen Prompt ein lauffähiges Spiel zu bauen. «Raccoon Heist»: ein Waschbär, der im Hinterhof Münzen und Fische einsammelt. Nett, aber überschaubar. Jetzt hat er den exakt gleichen Prompt an Codex Desktop mit GPT-5.6 Sol Ultra gegeben — dem Modus, in dem Sol aggressiv Sub-Agenten einsetzt. Ein direkter Vergleich zweier Coding-Agenten an derselben Aufgabe.
Das bessere Spiel — und der Kugelaugen-Bug
Codex hat abgeliefert. Das Ergebnis heißt «Moonlight & Mayhem» und ist deutlich ambitionierter: Du bist in einem Museum, rettest deine zwei Waschbär-Kollegen, stapelst euch aufeinander und brecht die goldene Sardine aus ihrer Vitrine. Also tatsächlich ein Heist — nicht nur Münzen sammeln. Deutlich mehr «heisty», wie Simon es nennt.
Ein Haken bleibt: Die Version aus dem reinen One-Shot hatte einen wunderbaren Bug. Jeder Waschbär trug einen riesigen schwarzen Kugel-Augapfel, viermal so groß wie sein Körper, schwebend über dem Kopf. Und das Beste: Codex hat während der Entwicklung Screenshots geprüft — und den Fehler trotzdem nicht bemerkt. Simon hat ihn mit zwei kurzen Prompts behoben: «Warum haben die Waschbären große schwarze Kugeln an sich?» und dann «Fix it».
Zahlen und ein kleiner Neid
Codex hat 52 Minuten an dem Projekt gearbeitet. Die Kostenschätzung von AgentsView: rund 23,28 US-Dollar, wenn man volle API-Preise zahlen würde — bei 700.000 Input-Tokens plus 32,5 Millionen gecachten Tokens und 148.000 Output-Tokens. Für einen Monats-Abo-Nutzer also praktisch geschenkt.
Ein Detail am Rande, das Claude-Code-Nutzer aufhorchen lässt: Simon wünscht sich, Claude Code hätte Codex’ «Copy as Markdown»-Funktion, mit der man ganze Transkripte sauber teilen kann.
Meine Einordnung
Ich mag solche Vergleiche, weil sie ehrlich sind. Fable 5 hat schnell und sauber ein kleines Spiel gebaut, Codex mit aggressiven Sub-Agenten ein größeres und reicheres — dafür mit einem Bug, den es selbst hätte sehen müssen. Genau das ist der aktuelle Stand: Die Agenten werden verblüffend gut, aber die Qualitätskontrolle bleibt lückenhaft. Wer täglich mit Claude Code arbeitet, sollte den Blick über den Tellerrand nicht scheuen. Nicht, weil das eine Werkzeug «gewinnt» — sondern weil man an solchen Duellen am schnellsten lernt, wo die eigenen Werkzeuge stark sind und wo nicht.
Quellen: Simon Willison: Moonlight & Mayhem (Raccoon Heist by Codex + GPT-5.6 Sol Ultra)