Modelle & Forschung

Gemini 4 Argon führt auf 12 von 18 Benchmarks, Claude Opus 5.5 hält Terminal-Bench 4.0

2 Min. Lesezeit KI-generiert

Googles neues Spitzenmodell gibt eine Million Token aus, bei Gemini waren bisher 64.000 die Grenze. Googles eigene Agenten haben damit den Video-Decoder libgav1 in sicheres Rust umgeschrieben: 2,7-mal schneller bei identischer Bildausgabe.

Featured image for "Gemini 4 Argon führt auf 12 von 18 Benchmarks, Claude Opus 5.5 hält Terminal-Bench 4.0"

Google hat am Mittwoch Gemini 4 Argon ausgerollt, und zwar nicht an Entwickler, sondern an geprüfte Verteidiger. Außerhalb der eigenen Teams kommen zunächst nur die über 650 Organisationen des Fairwind-Programms an das Modell, darunter CrowdStrike und Palo Alto Networks. Koray Kavukcuoglu, Chief AI Architect bei Google, schreibt in der Ankündigung, Fähigkeiten auf diesem Niveau freizugeben verlange «a phased approach».

Die Zahlen gegen Claude

Auf DeepSWE v1.1, das Software-Arbeit über lange Strecken misst, kommt Argon auf 77,9 Prozent. Claude Opus 5.5 liegt in Googles Tabelle bei 74,2 Prozent, einen Zehntelpunkt vor GPT-6 Astra. Auf AutomationBench, das Geschäftsvorgänge von Anfang bis Ende prüft, ist der Abstand größer: 51,3 gegen 42,5 Prozent. Von 18 Benchmarks in Googles Charts führt Argon zwölf. Terminal-Bench 4.0 bleibt bei Opus 5.5, FrontierSWE v2 bei Astra.

Dazu eine Zahl, die kein Benchmark ist. Argon gibt bis zu eine Million Token aus. Frühere Gemini-Modelle hörten bei 64.000 auf. Google hat das Limit ausdrücklich auf die Art Arbeit zugeschnitten, die DeepSWE abfragt.

Was Googles eigene Leute damit machen

Tausende Google-Mitarbeiter arbeiten schon mit dem Modell. Agenten portieren C- und C++-Code nach Rust, von Bibliotheken mit Zehntausenden Zeilen bis zum Zircon-Kernel von Fuchsia mit über 800.000 Zeilen. Beim Video-Decoder libgav1 haben sie 32.000 Zeilen des geschwindigkeitskritischen Teils als sicheres Rust neu geschrieben, das der Compiler selbst optimieren kann. Der Decoder läuft jetzt 2,7-mal schneller als die vorherige Rust-Portierung, bei identischer Bildausgabe. Eine zweite Flotte durchsucht Profiling-Daten nach verschwendetem Speicher und hat bisher über 300 Tebibyte in Googles Rechenzentren freigeräumt.

Der Preis ist die eigentliche Nachricht

Zum Start kostet Argon 2 Dollar je Million Eingabe-Token und 10 Dollar je Million Ausgabe-Token, gecachte Eingaben 95 Prozent günstiger. Anthropic nimmt für Opus 5.5 genau das Doppelte, 4 und 20 Dollar. Und auf eben diese Werte steigt Argon, sobald der Einführungspreis ausläuft. Google unterbietet also nicht dauerhaft, sondern befristet.

Interessanter ist, wem Google das Modell zuerst gibt. Anthropic veröffentlicht seine Cyber-Befunde als Forschungsposts, zuletzt zu GLM-5.3. Google gibt das Werkzeug direkt an Verteidiger, für Fairwind-Mitglieder und interne Teams sogar mit abgeschalteten Cyber-Leitplanken. Bei Wiz hat Argon in der Scan-for-Good-Initiative eine kritische Lücke in Krankenhaus-Software gefunden, die frühere Spitzenmodelle übersehen hatten. Das überzeugt mehr als jede Benchmark-Tabelle.

Quellen:

GoogleGeminiClaude OpusBenchmarksCybersecurity