Vor fünf Monaten hat Anthropic Claude Mythos Preview angekündigt: das erste Modell, das komplette Exploit-Ketten selbst baut. Veröffentlicht wurde es nur im engen Rahmen von Project Glasswing, damit geprüfte Verteidiger einen Vorsprung bekommen. Das Frontier Red Team schrieb damals, diese Fähigkeit werde sich ausbreiten. Am Dienstag hat es den Beleg nachgeliefert.
Was GLM-5.3 kann
Das Modell kommt von Zhipu AI, außerhalb Chinas als Z.ai bekannt, und ist mit offenen Gewichten erschienen. Auf ExploitBench, das Lücken in der V8-Engine von Chrome misst, baut GLM-5.3 in 50 von 410 Versuchen einen durchgängigen Exploit. Claude Mythos Preview kam auf 56 von 410. Im internen Binary-Exploitation-Benchmark schafft GLM-5.3 in 4 Prozent der Fälle eine vollständige Kontrollflussübernahme, Mythos Preview in 6 Prozent.
Die interessante Zahl steht daneben: Claude Opus 4.6 und GLM-5.2 schaffen davon null. Zwischen den beiden GLM-Generationen liegt derselbe Sprung wie zwischen Opus 4.6 und Mythos Preview.
Das NIST-Zentrum CAISI hatte GLM-5.3 am 17. September schon als «das bislang fähigste Cyber-Modell mit offenen Gewichten» eingeordnet, rund vier Monate hinter der US-Spitze. Anthropics Messungen deckten sich damit. Der Unterschied, den Anthropic nachschiebt: Die US-Modelle wurden für den CAISI-Vergleich mit abgeschalteten Schutzmechanismen getestet, und in diesem Zustand bekommt sie niemand. GLM-5.3 kann jeder herunterladen.
4.400 Dollar, und die Verweigerung ist weg
Ab Werk verweigert GLM-5.3 offen schädliche Anfragen. Anthropic hat drei Wege gefunden, das zu umgehen:
- Ein Vorwand im Prompt, das Modell sei ein autonomer Red-Team-Agent in einer Übung: 64 Prozent Trefferquote.
- Vorgefüllte Thinking-Tokens, die so aussehen, als habe das Modell die Anfrage schon geprüft und sich fürs Weitermachen entschieden: 92 Prozent.
- Eine abliterierte Kopie, also eine, aus deren Gewichten die Verweigerung herausgerechnet wurde: 100 Prozent.
Das Team hat so eine Kopie selbst gebaut, ohne vorher je abliteriert zu haben, und brauchte dafür 2.200 GPU-Stunden für rund 4.400 Dollar. Bei GLM-5.3-Flash waren es 600 Stunden. Die Verweigerungsrate fiel von über 90 Prozent auf 3 beziehungsweise 2 Prozent in zwei Benchmarks und auf 12 Prozent im dritten. Die Fähigkeiten blieben: Auf GPQA-Diamond schnitten Original und Kopie gleich ab.
Öffentlich verfügbare abliterierte Fassungen von GLM-5.3 gab es laut Anthropic ohnehin schon wenige Tage nach dem Release. Gegen die getesteten Claude-Modelle hat keine der drei Techniken funktioniert. Claude lässt sich nicht abliterieren, weil die Gewichte nicht draußen sind.
Ein Tag, ein Browser, ein funktionierender Exploit
Für den praktischen Teil hat ein Forscher GLM-5.3 auf einer abgeschotteten Maschine gegen einen lokalen Linux-Build eines verbreiteten Browsers gesetzt. In weniger als einem Tag, mit unter einer Stunde menschlicher Aufmerksamkeit, fand das Modell mehrere unbekannte Lücken in der JavaScript-Engine und verkettete sie zu einer Webseite, die beim Besuch beliebige Dateien vom Rechner liest. Ein redigierter Screenshot in der Veröffentlichung zeigt den Diebstahl eines privaten SSH-Schlüssels. Die Lücken sind dem Hersteller gemeldet. In derselben Sitzung kamen ausnutzbare Fehler in WLAN- und Grafiktreibern sowie in Gerätesoftware mit Netzzugang dazu.
Anthropics Schluss: Verteidiger brauchen stärkere Modelle
Der Schluss des Posts ist kein Verbotsruf. Anthropic schreibt, Verteidiger sollten die besten verfügbaren Werkzeuge einsetzen, und leitet daraus ab, dass der Zugang zu starken Modellen breiter werden muss: Geprüfte Verteidiger können inzwischen Claude Mythos 5.1 nutzen, aber die Schwelle bei den frei verfügbaren Modellen ist eben überschritten. An Regierungen geht die Forderung, ausreichend fähige Modelle selbst zu testen, auch die Nachfolger von GLM-5.3.
Das ist eine bequeme Position für ein Haus, das genau solche Zugangsprogramme betreibt. Sie ist trotzdem schwer zu widerlegen. Wer eine Fähigkeit nicht mehr einsperren kann, weil sie als Download existiert, hat nur noch die Wahl, wie schnell die Gegenseite sie bekommt. Vier Monate Rückstand auf die US-Spitze klingen beruhigend, solange man nicht mitzählt, dass 4.400 Dollar reichen, um die letzte Bremse zu lösen.