Em 7 de outubro de 2026, a Microsoft Research detalhou o Agent Lightning v1.0 e relatou que, em um experimento com Qwen3.5-9B, o Pass@1 no SWE-bench Verified subiu de 41,8% para 56,4% após cerca de 6.000 amostras de treinamento. O repositório situa a abertura do código em agosto de 2026.

A proposta é treinar agentes de IA sem transferir para o framework de treinamento o controle de toda a interação com o ambiente. O harness — a estrutura que conduz o agente durante a execução — continua no circuito.

Como o harness muda o treinamento

No aprendizado por reforço (RL, na sigla em inglês) agêntico convencional, o framework de treinamento costuma controlar o ciclo de interação: o agente age, recebe uma resposta do ambiente e segue para a próxima etapa. No Harnessed Agentic RL, a abordagem usada pelo Agent Lightning, o harness de implantação mantém esse controle. O framework encaminha as chamadas ao modelo por um proxy compatível com a API da OpenAI, que registra dados como solicitações e respostas do modelo.

Isso pode permitir que ferramentas, gestão de contexto, fluxo de controle e ambiente já usados pelo agente permaneçam no lugar, desde que o endpoint do modelo possa ser redirecionado ao proxy. O treinamento observa sequências de chamadas e respostas do modelo, em vez de assumir o controle direto de todo o ciclo do ambiente.

Gateway, controlador de rollouts e Trainer

O Agent Lightning v1.0 organiza o trabalho em três componentes. O API Gateway encaminha chamadas ao modelo e coleta dados; o Rollout Controller inicia agentes como processos locais ou Kubernetes Jobs; e o Trainer integra verl e vLLM para coletar amostras e atualizar a política do modelo.

Um rollout é uma execução do agente durante a qual ele interage com o ambiente. Como o harness pode produzir quantidades diferentes de chamadas e amostras a cada execução, o treinamento precisa lidar com desafios específicos: retokenizar e combinar amostras, calcular vantagens quando um rollout se divide em várias amostras, normalizar a função de perda para que rollouts com mais amostras não pesem demais e agendar cargas variáveis para recursos de backend fixos.

Duas formas de controlar o ciclo de interação

Agent Lightning treina agentes mantendo o harness de implantação

Atualizações assíncronas compartilham GPUs

No Collocated Async RL, rollouts e atualizações da política compartilham GPUs. Quando começa uma atualização, o gateway pausa novas solicitações e deixa as chamadas em andamento terminarem. Depois da atualização, os rollouts são retomados. A Microsoft relatou cerca de 2× de aceleração de ponta a ponta em relação ao RL síncrono em seu experimento.

Dois experimentos no SWE-bench Verified

A Microsoft relatou o resultado do Qwen3.5-9B; o repositório lista separadamente os números do Qwen3.5-35B-A3B. São experimentos distintos, com quantidades próprias de exemplos de treinamento.

Experimento e modeloResultado informado no SWE-bench VerifiedExemplos de treinamento
Qwen3.5-9B, Pass@141,8% antes; 56,4% depoisCerca de 6.000
Qwen3.5-35B-A3B47,8% antes; 61,6% depois1,8 mil

O pipeline do Qwen3.5-9B combinou SWE-smith, mini-SWE-agent e treinamento por RL, com limpeza de dados, construção do ambiente e salvaguardas contra exploração da função de recompensa. Os resultados descrevem esses experimentos no benchmark; não são uma previsão de ganhos para outros modelos, agentes ou tarefas.

O repositório identifica o Agent Lightning v1.0 como código aberto sob a licença MIT e registra sua abertura em agosto de 2026. A Microsoft Research publicou o relato técnico detalhado em 7 de outubro de 2026.