Am 7. Oktober 2026 veröffentlichte Microsoft Research einen ausführlichen Bericht zu Agent Lightning v1.0 und meldete für einen Trainingslauf mit Qwen3.5-9B einen Anstieg auf SWE-bench Verified von 41,8 auf 56,4 Prozent Pass@1. Pass@1 misst, wie oft der erste Lösungsvorschlag erfolgreich ist. Das Repository listet die Open-Source-Veröffentlichung des Frameworks bereits für August 2026. Microsofts Bericht Projekt-Repository

Was sich ändert, wenn das Harness den Interaktionsablauf steuert

Microsoft erklärt Agent Lightnings Training mit Harness

Reinforcement Learning (RL) ist ein Trainingsverfahren, bei dem ein Modell aus Rückmeldungen zu seinen Aktionen lernt. Bei herkömmlichem agentischem RL verwaltet das Trainingsframework den Ablauf, in dem ein Agent mit seiner Umgebung interagiert. Agent Lightning setzt auf Harnessed Agentic RL: Das Deployment-Harness – die Software, die den Agenten im Einsatz steuert – behält diese Aufgabe auch während des Trainings.

Dafür leitet Agent Lightning die Modellaufrufe über einen OpenAI-kompatiblen Proxy. Das Gateway erfasst Anfragen und Antworten sowie Log-Wahrscheinlichkeiten und ordnet die Aufrufe den jeweiligen Rollouts zu. Ein Rollout bezeichnet hier einen Trainingsdurchlauf des Agenten. So kann das vorhandene Harness in der Trainingsschleife bleiben, sofern sich dessen Modell-Endpunkt auf den Proxy umstellen lässt.

Gateway, Rollout Controller und Trainer

Agent Lightning v1.0 besteht aus drei Komponenten: Das API Gateway vermittelt Modellanfragen und erfasst Daten. Der Rollout Controller startet Agenten als lokale Prozesse oder als Kubernetes Jobs. Der Trainer sammelt Trainingsbeispiele und aktualisiert das Modell; laut Repository nutzt er dafür verl und vLLM. Microsoft nennt mini-SWE-agent, OpenHands und OpenClaw als Beispiele in seiner Architekturbeschreibung.

Das Projekt beschreibt v1.0 als vollständig überarbeitete Version mit einem Umfang von ungefähr 3.500 Codezeilen. Das ist ein Rahmenwert für die Codebasis, keine Aussage darüber, wie viel Infrastruktur oder Rechenleistung ein Einsatz benötigt.

Warum der Ansatz neue Trainingsaufgaben mit sich bringt

Wenn das Harness die Interaktion steuert, sieht der Trainer Modellaufrufe als Anfrage-Antwort-Paare statt als durchgehenden Token-Verlauf. Microsoft beschreibt vier damit verbundene technische Aufgaben: Text erneut zu tokenisieren und Trainingsproben zusammenzuführen, Advantage-Werte für Rollouts mit unterschiedlich vielen Proben zu berechnen, den Loss so zu normalisieren, dass Rollouts mit mehr Proben nicht überproportional gewichtet werden, und variable Rollout-Arbeit mit festen Backend-Ressourcen zu planen.

Diese Punkte prägen die Architektur: Das Trainingssystem muss mit unterschiedlich großen und langen Abläufen umgehen, obwohl es die Umgebungsschleife nicht selbst besitzt.

Collocated Async RL teilt GPUs zwischen Rollouts und Updates

Bei Collocated Async RL nutzen Rollouts und Modell-Updates gemeinsam GPUs. Beginnt ein Update, pausiert das Gateway neue Anfragen und wartet, bis laufende Aufrufe abgeschlossen sind. Nach dem Update werden die Rollouts fortgesetzt.

Für sein Experiment berichtet Microsoft gegenüber synchronem RL von einer etwa zweifachen Ende-zu-Ende-Beschleunigung. Der Wert bezieht sich auf dieses Experiment und diesen Vergleich.

Zwei getrennte SWE-bench-Experimente

Microsoft berichtet für Qwen3.5-9B einen Anstieg von 41,8 auf 56,4 Prozent Pass@1 auf SWE-bench Verified mit rund 6.000 Trainingsbeispielen. Das Repository führt ein getrenntes Beispiel mit Qwen3.5-35B-A3B auf: Dort stiegen die angegebenen SWE-bench-Verified-Werte von 47,8 auf 61,6 Prozent nach 1,8K Beispielen.

ModellSWE-bench-Verified-Werte vor und nach dem TrainingTrainingsbeispiele
Qwen3.5-9B41,8 % → 56,4 % (Pass@1)rund 6.000
Qwen3.5-35B-A3B47,8 % → 61,6 %1,8K

Für Qwen3.5-9B entspricht der Anstieg 14,6 Prozentpunkten; beim separaten Qwen3.5-35B-A3B-Beispiel sind es 13,8 Prozentpunkte. Microsoft berichtet das erste Ergebnis, das Repository führt das zweite auf. Beide Wertepaare beziehen sich auf die jeweiligen Projektbeispiele und beschreiben keine allgemeine Leistungssteigerung für andere Modelle, Agenten oder Aufgaben.