7 października 2026 r. Microsoft Research opublikował szczegółowy opis Agent Lightning v1.0, frameworka, który pozwala trenować agenta z pozostawieniem jego harnessu w pętli interakcji. W eksperymencie z Qwen3.5-9B Microsoft podał wzrost wyniku Pass@1 w SWE-bench Verified z 41,8% do 56,4% po użyciu około 6 000 próbek treningowych.

Repozytorium projektu datuje udostępnienie Agent Lightning v1.0 jako open source na sierpień 2026 r. Październikowy artykuł przedstawiał szczegóły frameworka i eksperymentu, a nie jego pierwsze wydanie.

Co się zmienia, gdy harness zarządza pętlą interakcji

Agent Lightning v1.0 zachowuje harness agenta podczas treningu

Harness agenta to jego warstwa wykonawcza: obsługuje interakcję ze środowiskiem, kontekst i przebieg działania. W tradycyjnym agentowym uczeniu ze wzmocnieniem (reinforcement learning, RL) pętlą interakcji zarządza zwykle framework treningowy. W podejściu nazwanym Harnessed Agentic RL pozostaje ona po stronie harnessu wdrożeniowego.

Agent Lightning kieruje wywołania modelu przez zgodne z OpenAI proxy API. Brama rejestruje żądania i odpowiedzi modelu, a także logarytmy prawdopodobieństw tokenów, wiążąc te dane z przebiegiem agenta. Dzięki temu istniejący harness może pozostać na miejscu, jeśli da się przekierować jego żądania do modelu przez proxy. Narzędzia, obsługa kontekstu i sterowanie agentem mogą więc pozostać częścią dotychczasowego środowiska.

Trzy elementy frameworka

Agent Lightning v1.0 składa się z trzech głównych komponentów. API Gateway pośredniczy w komunikacji z modelem i gromadzi dane. Rollout Controller uruchamia agentów jako procesy lokalne lub zadania Kubernetes. Trainer zbiera próbki i aktualizuje model; repozytorium wymienia w tym komponencie verl i vLLM.

Różnica względem podejścia, w którym framework treningowy przejmuje cały przebieg interakcji, wpływa na to, jakie dane otrzymuje Trainer. Obserwuje on sekwencje żądań i odpowiedzi modelu, a nie jedną ciągłą trajektorię całej interakcji agenta.

Wyzwania techniczne i wspólne użycie GPU

Taki podział pracy stawia kilka wyzwań. Microsoft wskazuje na retokenizację i łączenie próbek, obliczanie advantage, gdy jeden przebieg daje wiele próbek, oraz normalizację funkcji straty tak, by przebiegi tworzące więcej próbek nie zyskiwały nadmiernej wagi. Dochodzi do tego planowanie zmiennego obciążenia rolloutów przy stałych zasobach zaplecza.

W Collocated Async RL rollouty i aktualizacje modelu korzystają z tych samych GPU. Gdy rozpoczyna się aktualizacja, gateway wstrzymuje nowe żądania i czeka na zakończenie tych już obsługiwanych; po aktualizacji wznawia rollouty. Microsoft podał około dwukrotne przyspieszenie end-to-end względem synchronicznego RL w swoim eksperymencie.

Dwa odrębne eksperymenty na SWE-bench Verified

Wyniki dotyczą dwóch różnych modeli i osobnych eksperymentów. Dla Qwen3.5-9B Microsoft podał wzrost Pass@1 z 41,8% do 56,4% po treningu na około 6 000 próbek. Pass@1 określa odsetek zadań rozwiązanych przy pierwszej próbie.

Repozytorium projektu wymienia osobny przykład z Qwen3.5-35B-A3B: wynik na SWE-bench Verified wzrósł w nim z 47,8% do 61,6% po treningu na 1 800 przykładach. To odrębne doświadczenie od eksperymentu Qwen3.5-9B.

Wydanie open source i licencja

Repozytorium opisuje bazę Agent Lightning v1.0 jako liczącą około 3 500 linii kodu i podaje licencję MIT. Framework został udostępniony jako open source w sierpniu 2026 r.