Em 7 de outubro de 2026, a Microsoft Research detalhou o Agent Lightning v1.0 e relatou que, em um experimento com Qwen3.5-9B, o Pass@1 no SWE-bench Verified subiu de 41,8% para 56,4% após cerca de 6.000 amostras de treinamento. O repositório situa a abertura do código em agosto de 2026.
A proposta é treinar agentes de IA sem transferir para o framework de treinamento o controle de toda a interação com o ambiente. O harness — a estrutura que conduz o agente durante a execução — continua no circuito.
Como o harness muda o treinamento
No aprendizado por reforço (RL, na sigla em inglês) agêntico convencional, o framework de treinamento costuma controlar o ciclo de interação: o agente age, recebe uma resposta do ambiente e segue para a próxima etapa. No Harnessed Agentic RL, a abordagem usada pelo Agent Lightning, o harness de implantação mantém esse controle. O framework encaminha as chamadas ao modelo por um proxy compatível com a API da OpenAI, que registra dados como solicitações e respostas do modelo.
Isso pode permitir que ferramentas, gestão de contexto, fluxo de controle e ambiente já usados pelo agente permaneçam no lugar, desde que o endpoint do modelo possa ser redirecionado ao proxy. O treinamento observa sequências de chamadas e respostas do modelo, em vez de assumir o controle direto de todo o ciclo do ambiente.
Gateway, controlador de rollouts e Trainer
O Agent Lightning v1.0 organiza o trabalho em três componentes. O API Gateway encaminha chamadas ao modelo e coleta dados; o Rollout Controller inicia agentes como processos locais ou Kubernetes Jobs; e o Trainer integra verl e vLLM para coletar amostras e atualizar a política do modelo.
Um rollout é uma execução do agente durante a qual ele interage com o ambiente. Como o harness pode produzir quantidades diferentes de chamadas e amostras a cada execução, o treinamento precisa lidar com desafios específicos: retokenizar e combinar amostras, calcular vantagens quando um rollout se divide em várias amostras, normalizar a função de perda para que rollouts com mais amostras não pesem demais e agendar cargas variáveis para recursos de backend fixos.
Duas formas de controlar o ciclo de interação
Atualizações assíncronas compartilham GPUs
No Collocated Async RL, rollouts e atualizações da política compartilham GPUs. Quando começa uma atualização, o gateway pausa novas solicitações e deixa as chamadas em andamento terminarem. Depois da atualização, os rollouts são retomados. A Microsoft relatou cerca de 2× de aceleração de ponta a ponta em relação ao RL síncrono em seu experimento.
Dois experimentos no SWE-bench Verified
A Microsoft relatou o resultado do Qwen3.5-9B; o repositório lista separadamente os números do Qwen3.5-35B-A3B. São experimentos distintos, com quantidades próprias de exemplos de treinamento.
| Experimento e modelo | Resultado informado no SWE-bench Verified | Exemplos de treinamento |
| Qwen3.5-9B, Pass@1 | 41,8% antes; 56,4% depois | Cerca de 6.000 |
| Qwen3.5-35B-A3B | 47,8% antes; 61,6% depois | 1,8 mil |
O pipeline do Qwen3.5-9B combinou SWE-smith, mini-SWE-agent e treinamento por RL, com limpeza de dados, construção do ambiente e salvaguardas contra exploração da função de recompensa. Os resultados descrevem esses experimentos no benchmark; não são uma previsão de ganhos para outros modelos, agentes ou tarefas.
O repositório identifica o Agent Lightning v1.0 como código aberto sob a licença MIT e registra sua abertura em agosto de 2026. A Microsoft Research publicou o relato técnico detalhado em 7 de outubro de 2026.