El 7 de octubre de 2026, Microsoft Research publicó un artículo técnico sobre Agent Lightning v1.0 y comunicó que un experimento con Qwen3.5-9B elevó su resultado Pass@1 en SWE-bench Verified del 41,8 % al 56,4 %. El marco conserva el arnés de despliegue del agente durante el entrenamiento. El repositorio de Microsoft sitúa la publicación del proyecto como código abierto en agosto de 2026, y lo distribuye con licencia MIT.
Qué cambia cuando el arnés controla el bucle de interacción
El aprendizaje por refuerzo (RL, por sus siglas en inglés) ajusta un modelo a partir de recompensas obtenidas al completar tareas. En el enfoque tradicional de RL agéntico, el marco de entrenamiento gestiona el bucle de interacción con el entorno. En Harnessed Agentic RL, ese bucle sigue bajo el control del arnés del agente: la estructura que gestiona su interacción y su flujo de trabajo durante el despliegue.
Agent Lightning coloca un proxy de modelo compatible con la API de OpenAI entre el arnés y el modelo. El proxy registra las llamadas y sus respuestas para el entrenamiento; si el punto de conexión del modelo puede redirigirse al proxy, el agente puede conservar sus herramientas, su gestión del contexto y su flujo de control.
La diferencia práctica es quién lleva el bucle: el marco de entrenamiento o el arnés que ya participa en el despliegue.
El gateway, el controlador de ejecuciones y el entrenador
Agent Lightning v1.0 organiza el trabajo en tres componentes. El API Gateway actúa como proxy y captura las llamadas al modelo, incluidas las solicitudes, las respuestas y las log-probabilidades. El Rollout Controller inicia agentes como procesos locales o como trabajos de Kubernetes. El Trainer, integrado con verl y vLLM, reúne muestras y actualiza la política del modelo.
El entrenador observa secuencias de solicitudes y respuestas del modelo, mientras el arnés gestiona la interacción completa con el entorno. Una ejecución puede generar cantidades distintas de muestras, lo que plantea retos técnicos concretos: volver a tokenizar y combinar muestras, calcular ventajas cuando una ejecución se divide en varias muestras, normalizar la pérdida para que las ejecuciones con más muestras no pesen de más y ajustar la planificación del backend a cargas de trabajo variables.
Para optimizar prompts, la documentación de Agent Lightning describe un ciclo automático que usa trazas de ejecución y recompensas para elaborar una crítica y reescribir una plantilla. El flujo puede guardar plantillas o pesos de política actualizados; la inspección manual de trazas es posible, pero no es necesaria para ese ciclo documentado.
Collocated Async RL comparte GPU entre ejecuciones y actualizaciones
En Collocated Async RL, las ejecuciones de los agentes y las actualizaciones del modelo comparten GPU. Cuando empieza una actualización, el gateway deja de aceptar solicitudes nuevas, espera a que terminen las que siguen en curso y reanuda las ejecuciones después de aplicar los cambios.
Microsoft comunicó que este método alcanzó una velocidad de extremo a extremo de aproximadamente 2× frente al RL síncrono en sus experimentos.
Dos experimentos distintos en SWE-bench Verified
Pass@1 indica la proporción de tareas resueltas en el primer intento. Microsoft Research comunicó el resultado de Qwen3.5-9B; el repositorio del proyecto enumera por separado el experimento con Qwen3.5-35B-A3B.
| Modelo | Pass@1 antes del entrenamiento | Pass@1 después del entrenamiento | Ejemplos de entrenamiento |
| Qwen3.5-9B | 41,8 % | 56,4 % | Unas 6.000 muestras |
| Qwen3.5-35B-A3B | 47,8 % | 61,6 % | 1.800 ejemplos |
En el primer experimento, la diferencia entre las dos puntuaciones fue de 14,6 puntos porcentuales. En el segundo fue de 13,8 puntos porcentuales. Los dos resultados corresponden a modelos y conjuntos de entrenamiento distintos.
La explicación de Microsoft sobre el experimento con Qwen3.5-9B menciona una cadena de trabajo con SWE-smith y mini-SWE-agent, además de limpieza de datos, construcción del entorno, medidas contra la manipulación de recompensas y entrenamiento por refuerzo.