Reflection AI kondigde Beam op 5 oktober 2026 aan als zijn eerste open-weightmodel, bedoeld voor programmeren, redeneren en AI-agenten. Het bedrijf noemt 501 miljard parameters, waarvan er per inferentie 23 miljard actief zijn. De gewichten en technische documentatie wilde Reflection later in oktober publiceren.
NeoTeo schreef eerder over de plannen voor Reflection AI’s eerste open-weightmodel; het bedrijf maakte nu bekend dat Beam de naam van het model is.
Reflection AI kondigt Beam aan
Bij een open-weightmodel worden de modelgewichten beschikbaar gemaakt, zodat ontwikkelaars die kunnen gebruiken en aanpassen. Reflection AI beschrijft Beam als een tekstmodel met een sparse mixture-of-expertsarchitectuur (MoE): het model bevat gespecialiseerde onderdelen, maar gebruikt bij een inferentie slechts een deel daarvan. Reflection noemt 501 miljard parameters in totaal en 23 miljard actieve parameters per inferentie.
Het bedrijf zegt Beam te hebben voorgetraind op 23,8 biljoen tokens uit het web, openbare bronnen en gelicentieerde datasets. Reflection rapporteert een effectieve contextlengte van 1 miljoen tokens na de midtraining. Dat is een andere maat dan de maximale context van 256K tokens in de beschreven reinforcement-learningrun.
Reflection zegt voor die trainingsrun 10.500 NVIDIA GB300-gpu’s gedurende vier weken te hebben ingezet. In de reinforcement-learningcampagne genereerde het bedrijf naar eigen zeggen meer dan 100 miljoen roll-outs. Het noemt daarnaast ongeveer 1,3 miljard simulatieomgevingen voor training en beoordeling en een verzameling van ongeveer één miljoen programmeer-, agent- en STEM-omgevingen.
Reflection wilde de gewichten later in oktober onder de Apache 2.0-licentie publiceren. Ook een technisch rapport, een modelkaart en ontwikkelaarsmateriaal stonden op de planning. Bij de aankondiging bood het bedrijf vroege toegang aan een selecte groep.
Benchmarks en de vergelijking met GLM-5.2
Reflection AI rapporteert een score van 80,9 op SWE-Bench Verified en 80,1 op Terminal-Bench 2.1. In dezelfde aankondiging noemt het bedrijf 44,4 op DeepSWE v1.1 en 36,2 op Humanity’s Last Exam zonder tools. Dit zijn de resultaten die Reflection publiceerde.
Voor geavanceerde redeneertaken zegt Reflection dat Beam scores behaalt die vergelijkbaar zijn met GLM-5.2, met naar schatting drie tot vier keer minder inferentieberekeningen. Inferentie is de berekening die nodig is wanneer een model een antwoord genereert. De schatting van Reflection telt de verwerking van de prompt, contextafhankelijke aandacht en overhead voor het aanbieden van het model niet mee; ze beschrijft dus niet de totale kosten van een draaiende dienst.
Reflection karakteriseert Beam ook als een model dat op programmeer- en agenttaken Qwen 3.8-Max benadert, terwijl Kimi K3 volgens het bedrijf op algemene capaciteit voorloopt. Die vergelijkingen zijn onderdeel van Reflections eigen positionering van Beam.
De specificaties, benchmarks en vergelijkingen staan in Reflection AI’s aankondiging van Beam.