Il 5 ottobre 2026 Reflection AI ha annunciato Beam, il suo primo modello open-weight, progettato per programmazione, ragionamento e attività agentiche. L’azienda ha detto che avrebbe pubblicato i pesi più avanti in ottobre.

La precedente ricostruzione di NeoTeo sui piani di Reflection AI per il suo primo modello open-weight raccontava la fase preparatoria; con Beam, l’azienda ha annunciato il nome del modello e le sue specifiche.

Il primo modello open-weight di Reflection AI

Open-weight indica un modello i cui pesi — i parametri appresi durante l’addestramento — sono destinati a essere resi disponibili. Reflection ha presentato Beam come un modello testuale basato su una miscela sparsa di esperti (MoE): in questa architettura, solo una parte dei parametri viene attivata per ciascuna inferenza. Reflection lo ha pensato per la programmazione, il ragionamento e i compiti affidati ad agenti AI.

Secondo Reflection AI, Beam conta 501 miliardi di parametri complessivi, con 23 miliardi attivi per inferenza. L’azienda afferma che il modello è stato preaddestrato su 23.800 miliardi di token, raccolti dal web, da fonti pubbliche e da dataset proprietari con licenza.

Reflection dichiara una lunghezza effettiva del contesto di 1 milione di token, raggiunta dopo una fase intermedia di addestramento. È una misura diversa dal limite massimo di 256.000 token usato nel contesto dei rollout del ciclo di reinforcement learning descritto dall’azienda.

Per quel ciclo di addestramento ad alto consumo di calcolo, Reflection riferisce di aver impiegato 10.500 GPU NVIDIA GB300 per quattro settimane e di aver generato oltre 100 milioni di rollout. L’azienda ha previsto di pubblicare più avanti in ottobre anche un rapporto tecnico, una scheda del modello e strumenti per sviluppatori; ha indicato Apache 2.0 come licenza prevista per i pesi.

I benchmark e il confronto con GLM-5.2

Nella tabella pubblicata da Reflection, Beam ottiene 80,9 in SWE-Bench Verified e 80,1 in Terminal-Bench 2.1. Sono risultati dichiarati dall’azienda.

Reflection sostiene inoltre che Beam raggiunga punteggi comparabili a GLM-5.2 nei benchmark di ragionamento avanzato usando 3–4 volte meno calcolo d’inferenza. La stima riguarda il calcolo del passaggio in avanti durante la generazione e non comprende il prefill del prompt, le operazioni di attenzione che dipendono dal contesto né l’overhead di serving: descrive quindi una stima del calcolo d’inferenza, non una misura del costo complessivo di erogazione.

Nel confronto che propone, Reflection afferma anche che Kimi K3 resta avanti nelle capacità grezze e che Beam si avvicina a Qwen 3.8-Max nei compiti di programmazione e agentici.