Reflection AI kündigte Beam am 5. Oktober 2026 als sein erstes Open-Weight-Modell an. Das Modell soll für Coding, Reasoning und agentische Aufgaben gedacht sein. Gewichte und technische Unterlagen plant das Unternehmen für später im Oktober. Zur Beam-Ankündigung von Reflection AI
NeoTeo hatte zuvor über Reflections Pläne für ein erstes Open-Weight-Modell berichtet; die frühere Berichterstattung ordnete den damaligen Entwicklungsstand ein.
Was Reflection AI über Beam angekündigt hat
Open Weight bezeichnet ein Modell, dessen trainierte Gewichte veröffentlicht werden. Das ist nicht automatisch gleichbedeutend mit der Veröffentlichung der Trainingsdaten. Reflection AI plant, Beam unter der Apache-2.0-Lizenz bereitzustellen; außerdem sollen ein technischer Bericht, eine Model Card und Entwicklerdateien folgen. Das Unternehmen bot einer ausgewählten Gruppe frühzeitigen Zugang an.
Beam ist laut Reflection AI ein textbasiertes Sparse-Mixture-of-Experts-Modell (MoE). Bei dieser Architektur werden für eine Anfrage jeweils Teile des Modells aktiviert. Reflection nennt insgesamt 501 Milliarden Parameter, von denen 23 Milliarden pro Inferenz aktiv sind. Inferenz bezeichnet hier die Berechnung, mit der das Modell eine Antwort erzeugt.
Für das Vortraining gibt Reflection AI 23,8 Billionen Tokens an. Die effektive Kontextlänge beziffert das Unternehmen auf eine Million Tokens. Davon zu unterscheiden ist das Kontextmaximum von 256.000 Tokens im beschriebenen Reinforcement-Learning-Lauf.
Reflection zufolge umfasste dieser Lauf mehr als 100 Millionen Rollouts und nutzte 10.500 NVIDIA-GB300-GPUs über vier Wochen. Rollouts sind einzelne Durchläufe, in denen das Modell Aufgaben bearbeitet und Rückmeldungen erhält.
Benchmarks und der Vergleich mit GLM-5.2
In den von Reflection AI veröffentlichten Benchmark-Ergebnissen erreicht Beam 80,9 bei SWE-Bench Verified, 80,1 bei Terminal-Bench 2.1 und 36,2 bei Humanity’s Last Exam ohne Tools. Das sind die vom Unternehmen angegebenen Werte.
Reflection AI zufolge erzielt Beam bei vergleichbaren Ergebnissen in anspruchsvollen Reasoning-Benchmarks mit drei- bis viermal weniger Inferenz-Rechenaufwand ähnliche Resultate wie GLM-5.2. Die Schätzung bezieht sich auf die Rechenoperationen für die Textgenerierung, abgeleitet aus aktiven Parametern und der mittleren Zahl erzeugter Tokens. Sie lässt den Rechenaufwand für die Verarbeitung der Eingabe, kontextabhängige Aufmerksamkeitsoperationen und den Betrieb des Dienstes außen vor.