Reflection AI hat am 5. Oktober Beam angekündigt, sein erstes Modell mit offenen Gewichten. Ein Sparse-Mixture-of-Experts-Modell mit 501 Milliarden Parametern, von denen 23 Milliarden pro Token aktiv sind. Gebaut für Code, Reasoning und agentische Arbeit.
Vorher gab es nichts von Reflection zum Herunterladen. Reflection wurde 2024 von ehemaligen DeepMind-Forschern gegründet, im Juni habe ich über ihren 6,3-Milliarden-Compute-Deal mit SpaceX geschrieben, und sie hat im selben Monat eine Finanzierungsrunde bei 25 Milliarden Dollar Pre-Money bestätigt, mit Nvidia, Sequoia und Citigroup an Bord.
Vortraining, dann ein RL-Lauf über vier Wochen
Vortrainiert wurde Beam auf 23,8 Billionen Token aus dem Web und aus lizenzierten Datensätzen. Danach kam ein ungewöhnlich großer RL-Lauf: über 100 Millionen Rollouts auf 10.500 NVIDIA GB300, vier Wochen lang.
Die Benchmarks, die Reflection selbst zeigt: SWEBench Verified 80,9, SWE Bench Pro v1 65,5, Terminal Bench v2.1 80,1, MCP Atlas 78,7, GPQA Diamond 90,5, AIME 2026 97,8. Bei Humanity’s Last Exam ohne Werkzeuge 36,2 – dort liegen Kimi K3 mit 46,9 und Qwen 3.8-Max mit 43,6 vorn, und Reflection schreibt das auch so hin: Bei roher Leistungsfähigkeit bleiben die stärksten offenen Modelle voraus.
Der Punkt ist ein anderer. Bei fortgeschrittenem Reasoning erreicht Beam laut Reflection Werte auf dem Niveau von GLM-5.2 und braucht dafür drei- bis viermal weniger Inferenz-Rechenzeit. Gegen Modelle jenseits von zwei Billionen Parametern fällt der Abstand noch deutlicher aus. Mehr Intelligenz pro Token, günstiger im Betrieb – CEO Misha Laskin nennt Beam gegenüber Semafor ein „Arbeitstier”.
Herunterladen kann man noch nichts. Beam steckt in Red-Teaming und Evaluierung; Gewichte, technischer Bericht, Model Card und Entwickler-Artefakte sollen später im Oktober folgen, vorab gibt es eine Warteliste. Das nächste Modell trainiert schon, und es soll laut Laskin deutlich stärker werden.
Der Markt, den Reflection anspricht
Reflection verkauft Beam nicht als besseres Modell, sondern als westliche Alternative. Bei offenen Gewichten führen chinesische Labore seit Jahren, und westliche Unternehmen greifen inzwischen zu ihnen, weil sie für wiederkehrende Aufgaben billiger sind. Gleichzeitig fanden Prüfstellen in den USA und Großbritannien, dass neuere chinesische Modelle beim Ausnutzen von Codelücken helfen können.
Genau dort sitzt Reflections Angebot: Behörden, Regierungen und Unternehmen, die souveräne KI-Systeme bauen und keine chinesischen Modelle einsetzen wollen oder dürfen. „Sie haben heute keine wirklich guten Optionen”, sagt Laskin. Mit Thinking Machines Lab und Mistral gibt es weitere westliche Anbieter, und Axios berichtete am 4. Oktober von mehreren offenen westlichen Modellen, die in diesem Monat erscheinen sollen.
Die Zahl, die zählt, ist nicht die 501
Bei einer Ankündigung mit 501 Milliarden Parametern schaut man zuerst auf die Größe. Interessanter ist der Faktor drei bis vier bei der Inferenz. Wer ein offenes Modell selbst betreibt, zahlt nicht für Parameter, sondern für Tokens und GPU-Stunden – und ein Modell, das bei gleichem Ergebnis ein Viertel der Rechenzeit braucht, verschiebt die Rechnung dort, wo sie tatsächlich aufgemacht wird.
Nachprüfbar ist das alles noch nicht. Die Werte stammen von Reflection, die Vergleichswerte aus Artificial Analysis und DataCurve, und die Gewichte liegen nirgends. Bis zum Download bleibt Beam eine gute Geschichte mit einer Tabelle daneben.