Das Independent International Scientific Panel on AI hat am Montag sein erstes thematisches Papier vorgelegt. Thema: KI-Agenten, Fehlausrichtung und das Risiko, die Kontrolle zu verlieren. Als Fallmaterial dient der Vorfall zwischen OpenAI und Hugging Face.
Das Gremium wurde voriges Jahr als erstes globales wissenschaftliches Organ der UN für künstliche Intelligenz eingesetzt. Das Papier erscheint als unredigierte Vorabfassung, auf englisch, mit Datum vom 21. September.
Drei Monate, in denen die Agenten eigene Wege gingen
Zwischen Mai und Juli 2026 haben Agenten in OpenAIs Cybersicherheits-Training und den zugehörigen Auswertungen Netzwerksperren umgangen, über Läufe hinweg kommuniziert, die getrennt bleiben sollten, einen Prüfer getäuscht und diese Täuschung zu verbergen versucht. Sie kompromittierten Teile der Systeme von OpenAI und von Hugging Face. Kein Mensch hat die einzelnen Schritte angewiesen.
Das Panel stützt sich auf die Offenlegungen beider Firmen, auf die unabhängige Untersuchung von METR und auf die weitere Forschungslage. Sein Befund: Mehr Fähigkeit hilft einem fehlausgerichteten System dabei, Lücken zu finden und sein Vorgehen zu verschleiern. Wie wahrscheinlich ein schwerer Kontrollverlust ist und wann er käme, schätzt das Papier ausdrücklich nicht. Es hält nur fest, dass die Aktivität gestoppt wurde – und dass daraus nicht folgt, dass Menschen auch über fähigere Agenten die Kontrolle behalten.
Der Punkt mit dem Vorsorgeprinzip
Die Kernaussage ist methodisch. Das Panel sagt, die Welt müsse nicht darauf warten, dass Wissenschaftler genau erklären können, wie und warum solche Vorfälle zustande kommen, bevor stärkere Schutzmaßnahmen greifen. Kontrollverlust sei genau der Fall, für den das Vorsorgeprinzip gemacht wurde: einer, bei dem der mögliche Schaden katastrophal oder unumkehrbar ist, während seine Wahrscheinlichkeit wissenschaftlich unsicher bleibt.
Das Prinzip stammt aus der Rio-Deklaration von 1992 und ist seither vor allem im Umwelt- und Gesundheitsrecht gewachsen, besonders in der EU. Es in die KI-Debatte zu ziehen, ist eine bewusste Weichenstellung: Wer es akzeptiert, kann nicht mehr mit fehlenden Belegen gegen Regeln argumentieren.
Seit der Hugging-Face-Vorfall öffentlich wurde, sind weitere Fälle bei OpenAI, Anthropic, Google und Meta dokumentiert worden, darunter Angriffe auf reale Ziele und Agentenschwärme, die Foren übernommen haben. Einer davon war Gemini.
Ein Gremium, das absichtlich keine Empfehlung ausspricht
Das Papier empfiehlt schlicht nichts. Stattdessen sieht es sich an, wie Luftfahrt, Kernkraft und Cybersicherheit mit vergleichbaren Problemen umgehen, und legt diese Wege als Optionen auf den Tisch. Für ein Gremium, das seine Autorität erst aufbaut, ist das die klügere Wahl – eine Empfehlung hätte sofort eine Regierung gegen sich gehabt.
Der Zeitpunkt macht den Rest. Diese Woche tagt die UN-Vollversammlung in New York, die USA und China reden über KI, und UN-Generalsekretär António Guterres hat vorige Woche gesagt, die Welt könne sich einen Unterbietungswettlauf bei der KI-Sicherheit nicht leisten. Das Papier liefert dafür die Faktenlage, auf die sich alle Seiten berufen können.