Matt von Hippel war theoretischer Physiker, heute schreibt er über Physik. Im August hat er den KI-Firmen eine Aufgabe hingelegt: Wenn ihr mich beeindrucken wollt, nehmt euch mein altes Feld vor. Rechnet eine Streuamplitude, die als zu teuer gilt, und zwar mit dem Rechenbudget, das ein Universitätsinstitut hat. Konkret nannte er zwei Ziele. Eines davon: die Sechs-Teilchen-Amplitude in planarer N=4 Super-Yang-Mills-Theorie bei neun Loops.
Ende August meldeten sich Liam Fitzpatrick und Siddharth Mishra-Sharma, zwei Physiker bei Anthropic. Sie hatten es.
Warum bei neun Loops vorher Schluss war
Streuamplituden sagen, wie wahrscheinlich Teilchen auf bestimmte Weise reagieren. Je mehr Loops eine Rechnung mitnimmt, desto genauer wird sie und desto teurer. Die meisten realen Amplituden liegen bei zwei Loops, ein paar bei drei. Die präziseste Vorhersage der Teilchenphysik, von der du vielleicht gehört hast, nutzte fünf.
N=4 Super-Yang-Mills ist ein Spielzeugmodell, an dem Amplitudenforscher ihre Methoden testen. Lance Dixon, Professor am SLAC in Stanford, war vor einigen Jahren bis acht Loops gekommen, über einen Umweg. Neun hatte niemand. Dixon rechnete damit, den nächsten Schritt noch indirekter gehen zu müssen. Seine Begründung ist die interessanteste Zeile der ganzen Geschichte: Hätte man einfach die übliche Bootstrap-Methode einen Loop weiter laufen lassen können, hätte es längst jemand getan.
Ein Satz Prompt, dann sechs Stunden Ruhe
Anthropic hat nicht Millionen an Rechenleistung verbrannt. Gearbeitet wurde mit Fable 5.1 in Claude Science, der Plattform, die Forschende bezahlen können. Der Prompt lautete: Berechne die Sechs-Teilchen-Amplitude in planarer N=4 SYM bei neun Loops. Danach kam vor allem eine Sorte Nachricht, und die klingt nach jedem von uns, der nachts einen Agenten laufen lässt: Ich gehe schlafen und bin ein paar Stunden nicht erreichbar. Mach weiter, bis ich Stop sage. Melde dich alle vier bis sechs Stunden.
Claude hat die Rechnung dann zweimal gemacht, über den klassischen Bootstrap und über den indirekten Formfaktor-Weg. Für einen Endkunden hätte das ein bis zwei Tausend Dollar gekostet, fast alles davon Laufzeit des Modells. Der eigentliche Rechenteil, Python mit SymPy, schlug mit rund 100 Dollar zu Buche: 96 CPUs, eine Woche. Dixon hat das Ergebnis geprüft. Eine Gruppe um Song He an der Chinesischen Akademie der Wissenschaften war übrigens mit GPT-6-Hilfe kurz davor, hatte den größten Teil schon.
Erstaunlich ist, was die Rechnung nicht gebraucht hat
Von Hippel selbst ist ein wenig enttäuscht, und das macht seinen Text stark. Er hatte gehofft, eine KI würde eine Rechenhürde auf überraschendem Weg umgehen. Stattdessen hat Claude bekannte Methoden benutzt, nur mit etwas mehr Rechenzeit, als sich vorher jemand die Mühe gemacht hatte einzusetzen. Seine Bilanz: Es liegt mehr niedrig hängendes Obst herum, als Fachleute vermuten.
Für uns steckt die Pointe an einer anderen Stelle. Diese Rechnungen sind heikel und fehleranfällig; von Hippel schreibt, er selbst hätte aus einer Woche garantiert zwei gemacht. Der Harness hat Claude ohne fachliche Aufsicht durchgebracht. Kein Kollege, der zwischendurch schaut, ob das Zwischenergebnis Sinn ergibt. Nur „mach weiter”. Wer KI noch für zu unzuverlässig hält, um sie so einzusetzen, sollte diesen Satz zweimal lesen. Wie schon bei Claudes Enzymsystem-Fund ist das Ergebnis weniger erstaunlich als der Weg dorthin.