Investigadores de Stanford y Nvidia presentaron CLM-8B, un modelo de pesos abiertos que puntúa acciones candidatas para agentes de IA en vez de generar texto. En cuatro pruebas comunicadas por el proyecto, registró menos latencia que Jev; sin embargo, Jev obtuvo mejores resultados en dos de ellas.
Qué hace CLM-8B en un agente de IA
Un sistema con CLM-8B le proporciona el estado actual —por ejemplo, la situación que debe resolver— y una lista de acciones posibles. El modelo puntúa esas opciones y las ordena según su relación con el estado. Otro componente del agente debe aportar la información y ejecutar la acción elegida.
Así, CLM-8B está pensado para decisiones acotadas, como elegir una herramienta, clasificar una solicitud o priorizar respuestas candidatas. No redacta una respuesta abierta ni sustituye por sí solo a un modelo de razonamiento general.
Cómo compara CLM-8B un estado con acciones candidatas
CLM-8B usa un codificador Qwen3-8B congelado —sus parámetros no se actualizan durante el ajuste de CLM— y dos cabezales de proyección separados: uno para el estado y otro para las acciones. El aprendizaje contrastivo busca acercar las representaciones de los pares estado-acción adecuados y separar las que no encajan.
Cuando la lista de acciones se repite, sus representaciones pueden calcularse y guardarse para reutilizarlas en decisiones posteriores. El estado, en cambio, puede cambiar entre consultas. Esa separación es especialmente útil para un agente que evalúa muchas veces las mismas opciones.
El proyecto describe un entrenamiento con unos 60 millones de pares de preguntas y respuestas, 30 millones de ejemplos negativos difíciles sintéticos y cerca de un millón de trayectorias de agentes. Los pesos de CLM-8B figuran bajo la licencia Apache 2.0.
Qué muestran las pruebas comunicadas frente a Jev
En las pruebas sin ajuste fino comunicadas por el proyecto, CLM-8B tuvo menos latencia que Jev en las cuatro tareas. Los resultados de acierto coincidieron en T-Rex y Super Mario; Jev logró una puntuación superior en BFCL v4 y WikiRacing.
| Tarea | Latencia de CLM-8B | Latencia de Jev | Resultado de CLM-8B | Resultado de Jev |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Llamadas a herramientas (BFCL v4) | 76,8 ms | 125,5 ms | 95,2 % | 99,2 % |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
El proyecto comunicó una mejora máxima de hasta 9× en las condiciones probadas. Los mayores incrementos se asociaron a conjuntos amplios de opciones o a situaciones en las que podían reutilizarse las representaciones de las acciones. No es una proporción que se aplique por igual a cualquier tarea.
En las pruebas de código, CLM puntuó soluciones generadas por otros modelos
Los resultados de código corresponden a cabezales de CLM ajustados para actuar como verificadores: ordenaron soluciones candidatas generadas por modelos de mayor tamaño. Opus 5 generó las soluciones para DeepSWE y Fable 5 las de Terminal-Bench 2.1.
| Prueba y subconjunto reservado | Resultado de CLM | Resultado de Jev | Latencia de CLM | Latencia de Jev |
| DeepSWE, 38 tareas | 81,6 % | 71,1 % | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 tareas | 87,6 % | 83,1 % | 32 ms | 131 ms |
Son resultados de subconjuntos evaluados con cabezales ajustados. En este esquema, los modelos generadores proponen soluciones y CLM ayuda a seleccionar entre ellas; CLM-8B no resuelve esas tareas de código desde cero.
Qué papel puede ocupar en un agente
CLM-8B puntúa las opciones que recibe y sus probabilidades son relativas a esa lista. Si todas las acciones candidatas son inadecuadas, el modelo seguirá ordenándolas; para que el agente pueda abstenerse, esa posibilidad debe estar entre las opciones que se le presentan.
Una demostración en pantalla muestra la clasificación de una solicitud de atención al cliente por urgencia y departamento, un ejemplo concreto de enrutamiento y puntuación de opciones.
Jacky Kwok, responsable del proyecto CLM, dijo que el equipo estaba entrenando un modelo multimodal, CLM-35B-A3B, y que preveía publicarlo a comienzos de octubre de 2026.