Modelle & Forschung

Mistral Large 4: 82 Prozent im Cyber-Test, wo Claude Opus 5.5 nahe null liegt

3 Min. Lesezeit KI-generiert

Trainiert von Null auf 3.800 Grace-Blackwell-GPUs in Mistrals eigenen Rechenzentren in Europa. Eine Billion Parameter, 49 Milliarden davon aktiv, mehr als 160 Sprachen im Trainingsmaterial.

Featured image for "Mistral Large 4: 82 Prozent im Cyber-Test, wo Claude Opus 5.5 nahe null liegt"

Mistral hat am 6. Oktober eine öffentliche Vorschau von Mistral Large 4 gestartet. Inoffiziell ML4, sehr offiziell: le Chonk. Die Preview-API läuft ab sofort auf Mistral Studio, die Gewichte sollen Ende Oktober folgen.

Die Zahlen: eine Billion Parameter, davon 49 Milliarden aktiv, von Haus aus multimodal. Trainiert von Null auf 3.800 NVIDIA Grace Blackwell GPUs in Mistrals eigenen Rechenzentren in Europa, und die Vorschau läuft auf derselben Hardware. Im Trainingsmaterial stecken über 160 Sprachen, darunter jede Amtssprache der EU.

Die eine Zahl, auf die es Mistral anlegt

Im Artificial Analysis Cyber Index landet ML4 unter den fünf besten Modellen weltweit und führt bei offenen Gewichten außerhalb Chinas mit Abstand. In einem Test dieses Index soll ein Modell eine echte Lücke in Open-Source-Software reproduzieren und danach patchen. ML4 kommt auf 82 Prozent, den höchsten Wert aller Modelle. Bei Cybench, 40 Aufgaben aus Sicherheitswettbewerben, löst es 93 Prozent.

Dann der Satz, auf den die ganze Ankündigung zuläuft: Mehrere führende geschlossene Modelle, Claude Opus 5.5 und GPT-6 Astra darunter, liegen bei demselben Test nahe null — weil sie die Aufgabe verweigern.

Das ist kein Fähigkeitsvergleich, und Mistral behauptet auch nicht, dass es einer wäre. Es ist ein Verfügbarkeitsvergleich. Mistrals Argument dazu: Verteidigung beginnt oft mit dem Nachweis, dass eine Lücke echt ist, und genau diese Arbeit blockieren die Filter der geschlossenen Modelle.

Beim Coding sieht es anders aus

Hier nennt Mistral 61,7 Prozent auf DeepSWE v1.1, 59,4 auf SWE-Atlas-QnA und 28,3 auf Terminal-Bench 4. Der zusammengesetzte Coding Agent Index steht bei 49,8 Prozent.

Zur Einordnung: Terminal-Bench 4.0 ist der Benchmark, den Claude Opus 5.5 gegen Gemini 4 Argon gehalten hat. 28,3 Prozent sind davon weit entfernt. Mistral vergleicht sich an dieser Stelle auch nicht mit geschlossenen Spitzenmodellen, sondern mit offenen.

Die Gewichte kommen nicht ohne Vorlauf

Bis zur Veröffentlichung Ende Oktober lässt Mistral das Modell in der Praxis angreifen: mit Cybersecurity-Firmen, geprüften Partnern und staatlichen Stellen, die dasselbe Modell mit reduzierter Moderation und erweiterten Cyber-Fähigkeiten bekommen.

Wer das neben Anthropics neue Stufen im Cyber Verification Program legt, sieht zweimal dieselbe Idee und zweimal einen anderen Weg. Anthropic prüft Organisationen und schaltet ihnen Sperren ab. Mistral prüft vor der Veröffentlichung und gibt danach die Gewichte heraus, womit die Frage nach Sperren entfällt.

Europa baut sich sein Argument selbst

Das Modell wird in mehreren Regionen angeboten, darunter eine europäische Variante, die Mistral von Anfang bis Ende selbst betreibt, unabhängig von anderen Dienstanbietern und unter europäischem Recht. Trainiert wurde ML4 mit derselben Umgebung für Training, Anpassung und RL, die Mistral Kunden über Mistral Forge verkauft.

Das ist die Positionierung, und sie ist konsequent: Souveränität als Produktmerkmal, nicht als Pressemitteilung. Nach Reflections Beam vor zwei Tagen ist das die zweite große Ankündigung offener Gewichte in dieser Woche, und beide argumentieren über Kontrolle statt über Benchmark-Spitzen. Ob 82 Prozent im Cyber-Index ein Erfolg oder ein Problem sind, hängt davon ab, wen man fragt — und genau das ist die Debatte, die gerade läuft.

Quellen

MistralOpen WeightsBenchmarksSicherheitReleases