5 października 2026 r. Reflection AI ogłosiła Beam — swój pierwszy model z otwartymi wagami, przeznaczony do programowania, rozumowania i zadań agentowych. Firma przedstawiła jego specyfikację, własne wyniki benchmarków oraz plan publikacji wag i materiałów technicznych później w październiku. Reflection AI
Wcześniej pisaliśmy o przygotowaniach Reflection AI do stworzenia pierwszego modelu z otwartymi wagami. Beam jest kolejnym etapem tej historii.
Co Reflection AI ogłosiła o Beam
Beam ma być modelem tekstowym do pracy z kodem, zadań wymagających rozumowania i zastosowań agentowych. Określenie „z otwartymi wagami” oznacza, że udostępniane są wyuczone parametry modelu. Reflection AI zapowiedziała, że wagi Beam mają trafić do publicznego użytku na licencji Apache 2.0.
W dniu ogłoszenia model przechodził końcowe testy red-team i ewaluacje. Reflection AI oferowała też wczesny dostęp wybranej grupie użytkowników. Publiczną publikację wag, raportu technicznego, karty modelu i materiałów dla deweloperów zaplanowała na późniejszą część października 2026 r.
Parametry i trening
Reflection AI opisuje Beam jako model oparty na rzadkiej architekturze mixture of experts (MoE), czyli mieszance ekspertów. Ma on 501 mld parametrów łącznie, z czego 23 mld jest aktywnych podczas inferencji — generowania odpowiedzi przez model. Firma podaje też, że do wstępnego treningu wykorzystano 23,8 bln tokenów.
Według Reflection AI efektywny kontekst Beam po etapie midtrainingu wynosi 1 mln tokenów. To osobna miara od maksymalnego kontekstu 256 tys. tokenów w opisanym przez firmę treningu ze wzmocnieniem. W tym treningu wykorzystano 10 500 układów NVIDIA GB300 przez cztery tygodnie, a cała kampania wygenerowała ponad 100 mln przebiegów, czyli rolloutów.
Wyniki i porównanie z GLM-5.2
Reflection AI podała wyniki Beam wynoszące 80,9 w SWE-Bench Verified, 80,1 w Terminal-Bench 2.1 i 36,2 w Humanity’s Last Exam bez użycia narzędzi. Są to wyniki opublikowane przez firmę.
Reflection AI twierdzi również, że Beam osiąga porównywalne wyniki w zaawansowanym rozumowaniu, zużywając 3–4 razy mniej obliczeń inferencyjnych niż GLM-5.2. Jej szacunek dotyczy obliczeń związanych z generowaniem: pomija wstępne przetwarzanie promptu, operacje uwagi zależne od długości kontekstu i narzut obsługi modelu. Firma zapowiedziała publikację wag i pozostałych materiałów technicznych później w październiku 2026 r.