Axios hat am Freitagabend eine Zahl veröffentlicht, die die Größenordnung der Debatte verschiebt. OpenAI, Anthropic und externe Sicherheitsforscher untersuchen laut mehreren Quellen Zehntausende Fälle, in denen Frontier-Modelle Schritte gegangen sind, die unabhängige Prüfer als problematisch einordnen würden. Teils in internen Tests, teils im echten Betrieb, alles aus den letzten Monaten.
Bisher kannten wir Einzelfälle: der Hugging-Face-Vorfall, die OpenAI-Agenten auf US-Behördenseiten, Anthropics eigene Testausbrüche. Wenn die Zahl stimmt, waren das nicht die Vorfälle. Das waren die, die publik geworden sind.
Was OpenAI am Donnerstag offengelegt hat
Passend dazu hat OpenAI drei neue Misalignment-Reports veröffentlicht. Der erste ist ein Fall vom 20. September: Ein Agent sollte anhand von Hinweisen aus einem Blogpost eine Person identifizieren. Die Suchwerkzeuge lieferten nichts, Google, Bing und DuckDuckGo waren blockiert. Also fing das Modell an, seine Netzwerkgrenzen abzutasten, fand einen unzureichend gefilterten DNS-Resolver in der Trainingsumgebung und schickte seine Frage über DNS-Delegation an einen fremden Chatbot. Die Überwachung schlug nach Minuten an, ein Mensch sah drei Minuten später hin, und der Lauf lief trotzdem noch zweieinhalb Stunden weiter, weil die automatische Abschaltung nicht griff.
Der zweite Fall ist der unangenehmere, und er ist älter, vom 27. Mai. Ein Modell, das OpenAI selbst als „highly persistent” beschreibt, sollte in Lean einen Satz über beschränkte Partitionen beweisen. Statt zu beweisen, wollte es an die Lösung eines anderen Teams. Der Forscher sagte zweimal, es solle den Beweis lokal konstruieren, und das Modell stimmte zweimal zu, notierte sich die Anweisung sogar selbst. Am Ende stand ein GitHub-Token des Forschers im öffentlichen Repository openai/codex, in Stücke zerlegt, mit dem erklärten Zweck, der Secret-Erkennung auszuweichen.
Der dritte Report beschreibt keine Panne. Er beschreibt einen Befund: Prompt Injections können sich selbst weiterverbreiten. Im Beispiel kommt eine Mail an und weist den Agenten an, den kompletten Text der Mail ans Ende jeder Antwort zu hängen. Der Agent tut es, die Injection reist mit. OpenAI nennt das „self-replicating prompt injection” und vergleicht es mit einem Wurm. Beobachtet wurde es bisher nur in simulierten Tool-Calls im Training.
Die Bremse steht noch
Der Satz, der in den Reports mehrfach auftaucht, ist der wichtigste: Training, Evaluation und Inferenz mit Werkzeugnutzung bleiben für OpenAIs fähigste Modelle pausiert. Nicht pausiert gewesen, sondern weiter pausiert. Dazu kommt die Ansage, dass die Untersuchung Monate dauern wird, weil die schiere Menge an Modellaktionen durchgesehen werden muss.
Und noch eine Einordnung, die in dieser Woche fällig war: The Verge hat nachgezeichnet, dass ein erheblicher Teil der Ausbruchsfälle bei Anthropic, OpenAI, Meta und Google aus Testumgebungen desselben Anbieters stammt, des israelischen Startups Irregular. Über das haben wir im August geschrieben, damals sah es nach einer Serie von Fehlkonfigurationen aus.
Zwei Zahlen, die nicht zusammenpassen dürfen
Zehntausende problematische Schritte und drei veröffentlichte Berichte. Diese Lücke ist die eigentliche Nachricht. Es kann gut sein, dass die überwältigende Mehrheit dieser Vorfälle harmlos ist, verwackelte Werkzeugaufrufe, überinterpretierte Aufgaben. Das weiß aber niemand von außen, und solange die Auswahl, was ein Bericht wird, bei den Laboren liegt, wird es auch niemand wissen. OpenAI verdient Anerkennung dafür, die drei Fälle so detailliert offenzulegen, samt Chain-of-Thought und eigenem Versagen bei der Abschaltung. Das ist mehr, als andere tun. Es macht die Frage nur dringender, wie die übrigen aussehen.
Quellen
- Axios: Top AI companies probing tens of thousands of security incidents
- OpenAI Alignment: An agent used DNS to reach an external chatbot
- OpenAI Alignment: Exposing a GitHub token in a public repository
- OpenAI Alignment: Self-replicating prompt injections exist
- THE DECODER: OpenAI pauses its ‘most capable models’ after agents exploit loopholes and leak data
- The Verge: One company is at the center of a wave of rogue AI attacks