Microsoft Research publiceerde op 7 oktober 2026 een uitgebreid technisch artikel over Agent Lightning v1.0 en meldde daarin dat Pass@1 voor Qwen3.5-9B op SWE-bench Verified steeg van 41,8% naar 56,4%, na ongeveer 6.000 trainingssamples. Agent Lightning traint agents via hun bestaande deployment-harnas: dat blijft de interactie met de omgeving beheren, terwijl een proxy modelaanroepen doorstuurt en trainingsgegevens vastlegt. De repository vermeldt de open-sourcepublicatie van v1.0 in augustus 2026.

Wat verandert er als het agent-harnas de interactielus beheert?

Agent Lightning traint AI-agents met een bestaand agent-harnas

Bij reinforcement learning (RL), oftewel leren door beloningen voor gedrag, kan een trainingsframework zelf het interactieproces met de omgeving beheren. Bij Harnessed Agentic RL blijft die taak bij het deployment-harnas van de agent. Agent Lightning leidt modelaanroepen via een OpenAI-compatibele proxy, die gegevens over die aanroepen verzamelt voor de training.

Dat kan het bestaande harnas behouden, met zijn tools, contextbeheer en besturingslogica, als de modelaanvragen via de proxy kunnen worden gerouteerd. Het trainingssysteem volgt dan reeksen van aanvragen en antwoorden van het model; het neemt niet de volledige interactielus van de agent over.

De gateway, rolloutcontroller en trainer

Agent Lightning v1.0 bestaat uit drie onderdelen. De API Gateway fungeert als proxy en legt modelaanroepen vast. De Rollout Controller start agents als lokale processen of als Kubernetes Jobs. De Trainer, die volgens de projectbeschrijving met verl en vLLM werkt, verzamelt trainingssamples en past het beleid van het model aan.

De aanpak levert ook technische puzzels op. Microsoft noemt onder meer het opnieuw tokeniseren en samenvoegen van samples, het berekenen van advantages wanneer één rollout meerdere samples oplevert, en het normaliseren van de loss zodat rollouts met meer samples niet zwaarder meewegen. Ook moet de backend wisselende rolloutbelasting afstemmen op vaste rekenbronnen.

Collocated Async RL deelt GPU’s tussen rollouts en updates

Bij Collocated Async RL worden GPU’s gebruikt voor zowel rollouts als updates van het beleid. Wanneer een update begint, pauzeert de gateway nieuwe aanvragen en laat die lopende aanvragen afronden. Na de update gaan de rollouts verder.

Microsoft meldt voor dit experiment ongeveer 2× hogere end-to-end-snelheid dan bij synchrone RL. Dat resultaat hoort bij de beschreven proefopzet.

Twee afzonderlijke SWE-bench-experimenten

De twee gepubliceerde voorbeelden gebruiken verschillende modellen en aantallen trainingsvoorbeelden. Microsoft meldt het Qwen3.5-9B-resultaat; de projectrepository vermeldt het afzonderlijke voorbeeld met Qwen3.5-35B-A3B.

ModelSWE-bench Verified-resultatenTrainingsvoorbeelden
Qwen3.5-9BPass@1: 41,8% vóór training; 56,4% ernaOngeveer 6.000
Qwen3.5-35B-A3B47,8% vóór training; 61,6% erna1.800

Pass@1 is het aandeel taken dat bij de eerste poging slaagt. De resultaten beschrijven deze afzonderlijke modellen en experimenten; ze geven geen algemene prestatieverwachting voor andere agents of taken.

Open-sourcepublicatie en licentie

De repository vermeldt dat Agent Lightning v1.0 in augustus 2026 open source is gepubliceerd onder de MIT-licentie.