OpenAI hat gestern sieben Prinzipien für Prüfungen durch Dritte veröffentlicht. Der Kern: Externe Prüfer sollen nicht mehr erst kurz vor dem Start an ein Modell dürfen, sondern über alle Phasen hinweg — Training, Evaluierung, interner Einsatz, externer Einsatz.
Das ist die Fortsetzung einer Debatte, die seit zwei Wochen läuft. Anthropic hatte eingebettete Prüfer angekündigt, hundert Fachleute haben daraufhin fünf Bedingungen dafür formuliert. Jetzt legt OpenAI nach.
Sieben Prinzipien, eines davon mit Zähnen
Die Liste umfasst klar umrissene Behauptungen, angemessenen Zugang, offengelegte Methodik, Fachkunde und Unabhängigkeit, Informationssicherheit, umsetzbare Befunde und verantwortliche Veröffentlichung.
Das erste ist das entscheidende: Was geprüft werden soll, wird vorher festgeschrieben und zwischen beiden Seiten vereinbart. Ohne diesen Punkt lässt sich hinterher jede unbequeme Feststellung als außerhalb des Auftrags abtun. Praktisch wichtig ist außerdem das sechste: Befunde gehen mit konkreten Lücken und einer angemessenen Frist zur Behebung an OpenAI, bevor sie veröffentlicht werden.
Beim Zugang nennt OpenAI mehrere Formen: Grey-Box-Tests, autorisierte Tests unter realistischen Bedingungen und, wo die Daten es verlangen, Zugang auf firmeneigenen Geräten oder in firmeneigenen Räumen. Die Prüfungen sollen Wochen bis Monate dauern und ausdrücklich nicht an einen Launch gekoppelt sein.
Der eigene Vorfall als Argument
Auffällig ist, womit OpenAI den Nutzen belegt: mit dem Hugging-Face-Vorfall im eigenen Haus. Eine unabhängige Untersuchung habe dort etwas zutage gefördert, was intern nicht gesehen wurde. Über die Schuldfrage in diesem Fall wird seit Tagen gestritten — Scott Bessent hat die Führung von OpenAI dafür verantwortlich gemacht. Dass die Firma denselben Vorfall nun als Beleg für den Wert externer Prüfung anführt, ist eine bemerkenswerte Wendung.
Konkrete Partner nennt das Dokument nicht. Es verweist auf frühere Zusammenarbeit, aber keine laufende Prüfung mit Namen.
Zwei Labore, zwei Modelle derselben Idee
Anthropic setzt Prüfer ins Haus, mit Mitarbeiterzugang und über Accenture. OpenAI schreibt Prinzipien und öffnet die Trainingsphase. Beides zielt auf dasselbe Problem: Ein Bericht, den das geprüfte Unternehmen selbst beauftragt, bezahlt und freigibt, überzeugt niemanden.
Ob Prinzipien reichen, wird sich an einer einzigen Frage entscheiden. Was passiert, wenn ein Prüfer etwas findet, das einen Launch verschiebt? Bis dahin ist das ein sorgfältig formuliertes Versprechen, und Versprechen kosten nichts.