A Reflection AI anunciou Beam em 5 de outubro de 2026 como seu primeiro modelo de pesos abertos, voltado a programação, raciocínio e tarefas agênticas — aquelas em que um modelo pode conduzir etapas para cumprir uma tarefa. A empresa planejava publicar os pesos e materiais técnicos mais adiante em outubro.
A NeoTeo já havia acompanhado a preparação do projeto em sua cobertura anterior sobre o primeiro modelo open-weight da Reflection. Agora, o nome anunciado é Beam.
O que a Reflection anunciou sobre Beam
A Reflection descreve Beam como um modelo de linguagem de texto com arquitetura de mistura esparsa de especialistas, conhecida pela sigla MoE. Nessa arquitetura, diferentes componentes especializados podem ser acionados conforme a tarefa. A empresa informa 501 bilhões de parâmetros no total e 23 bilhões ativos por inferência — a etapa em que o modelo gera uma resposta.
Segundo a Reflection, Beam foi pré-treinado com 23,8 trilhões de tokens. A empresa também declara um contexto efetivo de 1 milhão de tokens, a quantidade de texto que o modelo consegue considerar no contexto de uma tarefa. Esse número é diferente do limite máximo de 256 mil tokens usado no treinamento por reforço descrito pela empresa.
A Reflection afirma que esse treinamento por reforço gerou mais de 100 milhões de tentativas, chamadas de rollouts, ao longo de quatro semanas com 10.500 GPUs NVIDIA GB300. Os números e detalhes técnicos foram divulgados pela própria empresa na página oficial de Beam.
Benchmarks e a comparação com GLM-5.2
A Reflection divulgou pontuações de 80,9 no SWE-Bench Verified, 80,1 no Terminal-Bench 2.1, 44,4 no DeepSWE v1.1 e 36,2 no Humanity’s Last Exam sem ferramentas. Esses resultados são apresentados pela empresa como avaliações de Beam.
A empresa também afirma que Beam alcança pontuações comparáveis às de GLM-5.2 em benchmarks avançados de raciocínio usando de 3 a 4 vezes menos computação de inferência. Essa estimativa trata do processamento necessário para gerar respostas: segundo a Reflection, ela exclui o processamento inicial do prompt, operações de atenção que dependem do contexto e custos de operação do serviço. Portanto, a comparação não representa um cálculo completo do custo de disponibilizar o modelo.
A Reflection caracteriza Beam como próximo de Qwen 3.8-Max em programação e tarefas agênticas, e diz que Kimi K3 segue à frente em capacidade bruta. São avaliações da própria empresa sobre os modelos.
O cronograma anunciado
Em 5 de outubro, a Reflection disse que Beam passava por uma etapa final de testes de segurança e avaliações. A empresa planejava publicar os pesos, um relatório técnico, um cartão do modelo e materiais para desenvolvedores mais adiante em outubro de 2026.