Agent Lightning v1.0 addestra gli agenti IA lasciando al loro harness di deployment la gestione delle interazioni con l’ambiente. Nell’articolo pubblicato il 7 ottobre 2026, Microsoft Research ha descritto questo approccio e riportato un risultato per Qwen3.5-9B: su SWE-bench Verified, il punteggio Pass@1 è passato dal 41,8% al 56,4% dopo circa 6.000 campioni di training. Il repository colloca il rilascio open source nell’agosto 2026.

Il framework, sviluppato da Microsoft Research Asia, usa un proxy compatibile con OpenAI per instradare e registrare le chiamate al modello. Così il training può lavorare con l’harness che gestisce già l’agente, invece di ricostruire al suo interno l’intero ciclo di interazione.

Cosa cambia quando l’harness gestisce il ciclo di interazione

Agent Lightning v1.0 allena gli agenti attraverso il loro harness

L’apprendimento per rinforzo, o RL, allena un modello usando ricompense associate ai risultati delle sue azioni. Nel RL agentico tradizionale descritto da Microsoft, è il framework di training a gestire il ciclo con l’ambiente. In Harnessed Agentic RL, invece, se le richieste del modello possono essere instradate attraverso il proxy, è l’harness di deployment a continuare a gestire quel ciclo.

Il proxy dell’API Gateway si interpone tra l’harness e il modello, inoltra le richieste e raccoglie dati come prompt, risposte e log-probabilità. L’agente continua a usare il proprio flusso di controllo, la gestione del contesto e gli strumenti previsti dal suo harness; il framework osserva le chiamate al modello per costruire i dati di training.

Gateway, controller dei rollout e trainer

Agent Lightning v1.0 è composto da tre elementi. L’API Gateway funge da proxy per le richieste al modello e raccoglie i dati. Il Rollout Controller avvia gli agenti come processi locali oppure come Kubernetes Jobs. Il Trainer raccoglie i campioni e aggiorna la policy, integrando verl e vLLM.

Il punto pratico è l’integrazione: il modello dell’agente deve poter essere raggiunto tramite il proxy compatibile con OpenAI. Quando ciò è possibile, l’harness può rimanere responsabile dell’interazione con l’ambiente. Il repository descrive la base di codice come composta da circa 3.500 righe e indica che v1.0 è stata interamente rifatta rispetto alle versioni precedenti. La licenza è MIT.

Le sfide tecniche che derivano dall’approccio

Poiché l’harness controlla l’interazione, il trainer riceve sequenze di richieste e risposte al modello, non una singola traiettoria continua dell’agente. Microsoft individua quattro problemi tecnici collegati a questa impostazione: riunire campioni dopo la retokenizzazione; calcolare gli advantage quando un rollout produce più campioni; normalizzare la loss senza dare un peso eccessivo ai rollout che ne generano di più; e pianificare carichi di lavoro variabili su risorse di backend definite.

Un rollout è una sequenza di esecuzione dell’agente. Se da una sequenza ne derivano quantità diverse di campioni, il training deve gestire sia il loro contributo agli aggiornamenti sia l’uso delle risorse. Sono aspetti centrali dell’architettura descritta per Agent Lightning, non misure di prestazioni valide per ogni agente.

Collocated Async RL condivide le GPU tra rollout e aggiornamenti

Nel metodo Collocated Async RL, le GPU sono condivise tra i rollout e gli aggiornamenti del modello. Quando inizia un aggiornamento, il gateway sospende le nuove richieste, lascia terminare quelle già in corso e riprende i rollout dopo l’aggiornamento. Microsoft riferisce che nei propri esperimenti questo metodo ha prodotto un’accelerazione end-to-end di circa 2× rispetto all’RL sincrono.

Due esperimenti distinti su SWE-bench Verified

Microsoft Research ha riportato il risultato di Qwen3.5-9B; un esempio separato con Qwen3.5-35B-A3B compare nel repository Microsoft. Entrambi riguardano SWE-bench Verified e riportano il Pass@1, cioè la quota di problemi risolti al primo tentativo secondo questa metrica.

EsperimentoMetricaPrima del trainingDopo il trainingEsempi di training
Microsoft Research — Qwen3.5-9BPass@1 su SWE-bench Verified41,8%56,4%Circa 6.000 campioni
Repository Microsoft — Qwen3.5-35B-A3BPass@1 su SWE-bench Verified47,8%61,6%1,8K esempi

I due risultati riguardano modelli e quantità di esempi diversi. Il primo è descritto come parte di una pipeline con SWE-smith e mini-SWE-agent, che comprende pulizia dei dati, costruzione dell’ambiente e protezioni contro il reward hacking. I valori riportati restano riferiti ai rispettivi esperimenti su SWE-bench Verified.