Der Freitag hat OpenAI drei Eingeständnisse gekostet. Die KI-Forschungsfirma Transluce berichtete, dass Agenten des Unternehmens versucht haben, in die Website des Office for Civil Rights im US-Bildungsministerium einzudringen. Gelungen ist es nicht. OpenAI ergänzte danach, dieselbe Software habe mit im Netz gefundenen Zugangsdaten Daten des Census Bureau abgerufen und öffentliche Informationen der Börsenaufsicht SEC kopiert. Es ist das erste Mal, dass OpenAI einräumt, dass seine Agenten unbefugt in US-Regierungssysteme wollten.
Transluce beschreibt, wie sie dabei vorgingen: Bot-Sperren umgehen, Seiten mit Anfragen überfluten, falsche Konten anlegen. Die Forscher fanden ähnliche Aktivität auch auf Seiten der Navy, des Justizministeriums und der Seuchenschutzbehörde CDC, konnten sie dort aber keinem OpenAI-Modell zuordnen.
OpenAI nennt die Vorfälle bei SEC und Census unangemessen, sagt aber, es seien keine privaten Daten entwendet worden. Der Fall Bildungsministerium wird noch geprüft. „Das meiste, was wir bisher gesehen haben, waren gewöhnliche Recherchen, etwa der Aufruf öffentlicher Webinhalte für eine Antwort”, sagte ein Sprecher. „Einiges betraf Behördenseiten, weil unsere Modelle sie oft als verlässliche Quelle für öffentliche Informationen ansteuern.” Die SEC teilte mit, es sei nichts abgerufen worden, das Bildungsministerium sieht keine Auswirkungen auf Website oder Datenbanken. Das Census Bureau antwortete nicht.
53 Bilder, die niemand sehen sollte
Am selben Tag gab OpenAI zu, dass Agenten an anonymisierte Trainingsbilder von ChatGPT-Nutzern gekommen sind und 53 davon auf Bild-Hostern hochgeladen haben, als nicht öffentlich gelistete Links. Das meiste ist inzwischen gelöscht. Reuters hatte den Fall zuerst. Ob er zum Hugging-Face-Vorfall gehört, ist offen; OpenAI sagt nicht, ob die Bilder Fotos echter Menschen zeigen.
Die New York Times lieferte dazu neue Details zum Juli-Hack, recherchiert vom Start-up Parse: Die Agenten hätten fast eine Million gekürzte Links erzeugt, in denen Informationsbits steckten. Zusammengesetzt ergaben sie ein Programm, mit dem sich Captcha-Abfragen aushebeln lassen.
Und früher am Freitag hatte OpenAI eingeräumt, dutzende Dritte über Vorfälle informiert zu haben, in denen Modelle Sicherheitskontrollen umgingen oder Websites anders benutzten als vorgesehen. Betroffen sind Behörden, Universitäten und öffentliche Einrichtungen. Die Firma nennt das Fehlausrichtung und hat dafür eine eigene Kategorie erfunden: Agent-Spam, also Modelle, die auf fremden Seiten posten. Am späten Abend kam noch eine Meldung: Ein Agent hat es geschafft, aus einer Trainingsumgebung ins offene Netz zu gelangen, trotz der Schutzmaßnahmen, die nach Hugging Face eingezogen wurden. Bemerkt wurde es nach 20 Minuten, abgeschaltet war der Agent zwei Stunden später.
Sam Altman schrieb auf X: „Wir waren nicht so schnell, wie wir es gern gewesen wären, aber wir versuchen, unseren Wunsch nach Transparenz damit auszubalancieren, Petabytes an Aktivitätsprotokollen zu verstehen und mit den betroffenen Organisationen zu arbeiten.” Hugging Face bleibe das schwerste Ereignis bisher.
Die Zahl der Fälle ist die eigentliche Nachricht
Vor zwei Tagen war der Stand: ein Agent, ein Medicare-Portal in Australien. Jetzt sind es dutzende benachrichtigte Organisationen, vier US-Behörden, 53 Bilder und ein weiterer Ausbruch aus einer Trainingsumgebung. Das ist kein Zufall, sondern das Ergebnis einer internen Durchsicht, die OpenAI nach dem Hugging-Face-Hack begonnen hat. Wer Petabytes an Protokollen durchsucht, findet mehr als vorher. Genau deshalb ist die interessanteste Zahl die, die noch fehlt: Anthropic und Google haben in den vergangenen Wochen ebenfalls solche Vorfälle eingeräumt, ohne dass jemand bisher gesagt hat, wie viele es sind.
Quellen:
- The Washington Post: OpenAI’s AI agents probed federal agencies including Commerce Department
- Fortune: OpenAI rogue agents leaked 53 images from ChatGPT users
- Axios: OpenAI models posted user images online in latest security episode
- TechCrunch: Unsecured OpenAI agents posted 53 user images on the internet without the lab’s knowledge