Investigadores de Stanford y Nvidia presentaron CLM-8B, un modelo de pesos abiertos que puntúa acciones candidatas para agentes de IA en vez de generar texto. En cuatro pruebas comunicadas por el proyecto, registró menos latencia que Jev; sin embargo, Jev obtuvo mejores resultados en dos de ellas.

Qué hace CLM-8B en un agente de IA

Un sistema con CLM-8B le proporciona el estado actual —por ejemplo, la situación que debe resolver— y una lista de acciones posibles. El modelo puntúa esas opciones y las ordena según su relación con el estado. Otro componente del agente debe aportar la información y ejecutar la acción elegida.

Así, CLM-8B está pensado para decisiones acotadas, como elegir una herramienta, clasificar una solicitud o priorizar respuestas candidatas. No redacta una respuesta abierta ni sustituye por sí solo a un modelo de razonamiento general.

Cómo compara CLM-8B un estado con acciones candidatas

CLM-8B puntúa acciones de agentes y redujo la latencia frente a Jev en cuatro pruebas

CLM-8B usa un codificador Qwen3-8B congelado —sus parámetros no se actualizan durante el ajuste de CLM— y dos cabezales de proyección separados: uno para el estado y otro para las acciones. El aprendizaje contrastivo busca acercar las representaciones de los pares estado-acción adecuados y separar las que no encajan.

Cuando la lista de acciones se repite, sus representaciones pueden calcularse y guardarse para reutilizarlas en decisiones posteriores. El estado, en cambio, puede cambiar entre consultas. Esa separación es especialmente útil para un agente que evalúa muchas veces las mismas opciones.

El proyecto describe un entrenamiento con unos 60 millones de pares de preguntas y respuestas, 30 millones de ejemplos negativos difíciles sintéticos y cerca de un millón de trayectorias de agentes. Los pesos de CLM-8B figuran bajo la licencia Apache 2.0.

Qué muestran las pruebas comunicadas frente a Jev

En las pruebas sin ajuste fino comunicadas por el proyecto, CLM-8B tuvo menos latencia que Jev en las cuatro tareas. Los resultados de acierto coincidieron en T-Rex y Super Mario; Jev logró una puntuación superior en BFCL v4 y WikiRacing.

TareaLatencia de CLM-8BLatencia de JevResultado de CLM-8BResultado de Jev
T-Rex16,5 ms149,8 ms5/55/5
Llamadas a herramientas (BFCL v4)76,8 ms125,5 ms95,2 %99,2 %
WikiRacing79,8 ms225 ms26/3030/30
Super Mario33,5 ms132,6 ms5/55/5

El proyecto comunicó una mejora máxima de hasta 9× en las condiciones probadas. Los mayores incrementos se asociaron a conjuntos amplios de opciones o a situaciones en las que podían reutilizarse las representaciones de las acciones. No es una proporción que se aplique por igual a cualquier tarea.

En las pruebas de código, CLM puntuó soluciones generadas por otros modelos

Los resultados de código corresponden a cabezales de CLM ajustados para actuar como verificadores: ordenaron soluciones candidatas generadas por modelos de mayor tamaño. Opus 5 generó las soluciones para DeepSWE y Fable 5 las de Terminal-Bench 2.1.

Prueba y subconjunto reservadoResultado de CLMResultado de JevLatencia de CLMLatencia de Jev
DeepSWE, 38 tareas81,6 %71,1 %79 ms449 ms
Terminal-Bench 2.1, 30 tareas87,6 %83,1 %32 ms131 ms

Son resultados de subconjuntos evaluados con cabezales ajustados. En este esquema, los modelos generadores proponen soluciones y CLM ayuda a seleccionar entre ellas; CLM-8B no resuelve esas tareas de código desde cero.

Qué papel puede ocupar en un agente

Demostración en pantalla de CLM-8B clasificando una solicitud de atención al cliente por urgencia y departamento

CLM-8B puntúa las opciones que recibe y sus probabilidades son relativas a esa lista. Si todas las acciones candidatas son inadecuadas, el modelo seguirá ordenándolas; para que el agente pueda abstenerse, esa posibilidad debe estar entre las opciones que se le presentan.

Una demostración en pantalla muestra la clasificación de una solicitud de atención al cliente por urgencia y departamento, un ejemplo concreto de enrutamiento y puntuación de opciones.

Jacky Kwok, responsable del proyecto CLM, dijo que el equipo estaba entrenando un modelo multimodal, CLM-35B-A3B, y que preveía publicarlo a comienzos de octubre de 2026.