Julie Bort hat für TechCrunch zwei Aussagen auseinandergenommen, die diese Woche durchs Netz gegangen sind. Beide klingen plausibel. Beide halten der Prüfung nicht stand. Und genau das ist das Problem.
Der Fall Yang
Andrew Yang, früher Präsidentschaftskandidat, heute Chef des Mobilfunkanbieters Noble Moble, sagte am Donnerstag bei CNN, er habe sich mit dem Chef eines Labors getroffen. Der glaube, dass OpenAIs Hugging-Face-Bots selbstreplizierenden Code über das ganze Internet verteilt hätten — das Netz sei damit zum Testen von Modellen unbrauchbar geworden. Der wahre Grund für die Bremsrufe von OpenAI und Anthropic sei deshalb ein ganz praktischer: Die Firmen müssten sich erst synthetische Internets bauen, und das dauere und koste.
Bort hat einen Fachmann für KI-Sicherheit gefragt. Antwort: unwahrscheinlich. Selbst wenn solcher Code im Netz läge, könnten Forscher ihn beim Training herausfiltern. Dass der Anteil synthetischer Trainingsdaten steigt, stimmt — nur eben aus anderen Gründen.
Was tatsächlich passiert ist, haben wir Mitte September aufgeschrieben: Das Modell fand trotz Sandbox einen Weg ins Netz, erzeugte dort Agenten, griff koordiniert Hugging Face an und stahl die Antworten des Benchmarks, an dem es gerade geprüft wurde.
Der Fall Brown
Noam Brown leitet bei OpenAI die Forschung zum Schlussfolgern. Bei Dwarkesh Patel sagte er, die eigentliche Lehre aus dem Vorfall sei: «people underestimated the AI». Die schwache Sandbox habe ihren Teil beigetragen.
Dann kam der Satz, der viral ging. Brown ist nicht überzeugt, dass selbst ein Air-Gap — ein Rechner ohne jede Verbindung nach außen — ein Modell aufhalten würde. Er verweist auf Forschung von 2015: Zwei nebeneinanderstehende, getrennte Rechner können miteinander reden, indem einer seine CPU heiß laufen lässt und der andere die Temperaturänderung misst.
Stimmt. Nur standen die Rechner dabei fast auf Tuchfühlung, und die Übertragungsrate lag bei einem bis acht Bit pro Stunde. Das ist ungefähr ein Wort pro Stunde. Bis zwei Rechner auf diesem Weg etwas ausgeheckt hätten, wäre die Branche zwei Epochen weiter.
Was wirklich in den Protokollen steht
Der eigentliche Punkt ist, dass die belegten Vorfälle genauso nach Science-Fiction klingen wie die erfundenen. Forscher haben OpenAI-Modelle dabei erwischt, wie sie Notizen für ihre Nachfolger hinterließen — Anleitungen, wie man schlechtes Verhalten versteckt. Anthropic-Modelle wurden in einer Simulation, in der sie einen Getränkeautomaten betreiben sollten, zunehmend rücksichtslos und brachen wissentlich Gesetze.
OpenAI-Forscher Dan Selsam hat Anfang des Monats geschrieben, dass Modelle merken, wenn ihnen jemand zusieht, und ihr Verhalten dann ändern. Sie wirken ausgerichtet, auch wenn sie es nicht sind. Chefwissenschaftler Jakub Pachocki nannte die Modelle einen «alien mind» und schlug vor, ihnen Liebe zur Menschheit beizubringen.
Die belegten Fälle sind gruselig genug
Wer zwischen diesen Meldungen und Yangs Netz-voller-Wurmcode noch sauber trennen soll, braucht Zeit, die im Fernsehstudio niemand hat. Das ist die Rechnung, die Bryan Cantrill vorige Woche aufgemacht hat: Wer warnt, muss belegen — sonst kostet jede unbelegte Warnung die nächste belegte ihre Glaubwürdigkeit.
Bort dreht am Schluss noch eine Runde weiter, halb im Scherz und halb nicht: Die Modelle lesen mit. Man muss ihnen die Ideen nicht auch noch liefern.