Des chercheurs de Stanford et Nvidia ont rendu public CLM-8B, un modèle à poids ouverts qui classe les actions proposées à un agent IA au lieu de générer une réponse en texte. Dans les tests zéro-shot rapportés par le projet, sa latence était inférieure à celle de Jev sur quatre tâches, mais les deux modèles n’obtenaient pas les mêmes résultats sur tous les benchmarks.

CLM-8B privilégie les décisions à choix limité

Un système d’agent fournit à CLM-8B un état — par exemple, la situation à laquelle il doit répondre — ainsi qu’une liste d’actions possibles. Le modèle évalue ces options et les classe selon leur adéquation à cet état. Il sert donc à choisir parmi des possibilités données, pas à produire une réponse longue ou à mener un raisonnement ouvert.

Cette distinction est utile pour des tâches comme le routage d’un outil, le tri ou le classement de réponses. Un dispositif externe doit transmettre à CLM l’état et les actions disponibles, puis gérer la suite de l’interaction.

Comment CLM-8B compare état et actions candidates

CLM-8B classe les actions proposées aux agents IA

CLM-8B repose sur un encodeur Qwen3-8B gelé — dont les paramètres ne sont pas réentraînés — et deux têtes de projection distinctes, l’une pour l’état, l’autre pour les actions. L’apprentissage contrastif rapproche les représentations des associations jugées correctes et distingue celles qui le sont moins. Le modèle compare ainsi les représentations dans un espace commun, sans générer de séquence de texte.

Lorsque la liste d’actions reste la même, le système peut calculer leurs représentations une fois et les réutiliser pour évaluer plusieurs états. Cette mise en cache est particulièrement pertinente pour des agents qui confrontent régulièrement de nouvelles situations aux mêmes choix.

Le projet décrit un entraînement sur environ 60 millions de paires question-réponse, 30 millions d’exemples négatifs synthétiques difficiles et près d’un million de trajectoires d’agents. Les poids de CLM-8B sont proposés sous licence Apache 2.0.

Ce que montrent les tests rapportés face à Jev

Dans la comparaison zéro-shot rapportée par le projet, CLM-8B affichait une latence plus faible que Jev sur les quatre tâches. Les résultats variaient toutefois selon le test : les modèles étaient à égalité sur T-Rex et Super Mario, tandis que Jev obtenait de meilleurs scores sur BFCL v4 et WikiRacing.

TâcheLatence de CLM-8BLatence de JevRésultat de CLM-8BRésultat de Jev
T-Rex16,5 ms149,8 ms5/55/5
Appel d’outils (BFCL v4)76,8 ms125,5 ms95,2 %99,2 %
WikiRacing79,8 ms225 ms26/3030/30
Super Mario33,5 ms132,6 ms5/55/5

Le projet a également rapporté un avantage pouvant atteindre 9 fois la vitesse de Jev dans ces tests. Les gains les plus importants étaient associés à des listes de candidats plus longues ou à la réutilisation d’actions ; ce chiffre décrit donc les conditions des essais, pas une performance identique sur chaque tâche.

En code, CLM a classé des solutions générées par d’autres modèles

Les résultats sur DeepSWE et Terminal-Bench 2.1 proviennent d’expériences distinctes : des têtes de vérification CLM affinées ont classé des solutions candidates, sans résoudre les tâches de code à partir de zéro. Opus 5 a généré les candidats de DeepSWE et Fable 5 ceux de Terminal-Bench 2.1.

Benchmark et sous-ensemble évaluéRésultat du vérificateur CLMRésultat de JevLatence du vérificateur CLMLatence de Jev
DeepSWE, 38 tâches mises de côté81,6 %71,1 %79 ms449 ms
Terminal-Bench 2.1, 30 tâches mises de côté87,6 %83,1 %32 ms131 ms

Ces chiffres concernent les sous-ensembles évalués et les têtes affinées. Ils mesurent la sélection parmi des solutions candidates, et non la capacité de CLM-8B à écrire ces solutions lui-même.

À quoi sert ce score dans un agent ?

Une démonstration de CLM-8B montre le classement d’un ticket d’assistance et de réponses candidates.

Les scores de CLM-8B sont calculés sur les options transmises au modèle : les probabilités sont donc relatives à cette liste. Si toutes les actions proposées sont inadéquates, le modèle les classe quand même, à moins qu’une option de refus fasse elle-même partie des candidats. Le choix des options compte autant que leur classement.

Une démonstration en interface applique ce principe à un ticket d’assistance : le système classe son urgence et son orientation, puis compare plusieurs réponses candidates.

CLM-8B convient ainsi aux décisions encadrées où un autre système fournit déjà l’état et les choix possibles. Pour la rédaction longue, le raisonnement ouvert ou la planification de haut niveau, il ne remplace pas un modèle généraliste.

La prochaine étape annoncée pour le projet

Jacky Kwok, responsable du projet, a indiqué que l’équipe entraînait le modèle multimodal CLM-35B-A3B en vue d’une sortie prévue début octobre 2026.