Des chercheurs de Stanford et Nvidia ont rendu public CLM-8B, un modèle à poids ouverts qui classe les actions proposées à un agent IA au lieu de générer une réponse en texte. Dans les tests zéro-shot rapportés par le projet, sa latence était inférieure à celle de Jev sur quatre tâches, mais les deux modèles n’obtenaient pas les mêmes résultats sur tous les benchmarks.
CLM-8B privilégie les décisions à choix limité
Un système d’agent fournit à CLM-8B un état — par exemple, la situation à laquelle il doit répondre — ainsi qu’une liste d’actions possibles. Le modèle évalue ces options et les classe selon leur adéquation à cet état. Il sert donc à choisir parmi des possibilités données, pas à produire une réponse longue ou à mener un raisonnement ouvert.
Cette distinction est utile pour des tâches comme le routage d’un outil, le tri ou le classement de réponses. Un dispositif externe doit transmettre à CLM l’état et les actions disponibles, puis gérer la suite de l’interaction.
Comment CLM-8B compare état et actions candidates
CLM-8B repose sur un encodeur Qwen3-8B gelé — dont les paramètres ne sont pas réentraînés — et deux têtes de projection distinctes, l’une pour l’état, l’autre pour les actions. L’apprentissage contrastif rapproche les représentations des associations jugées correctes et distingue celles qui le sont moins. Le modèle compare ainsi les représentations dans un espace commun, sans générer de séquence de texte.
Lorsque la liste d’actions reste la même, le système peut calculer leurs représentations une fois et les réutiliser pour évaluer plusieurs états. Cette mise en cache est particulièrement pertinente pour des agents qui confrontent régulièrement de nouvelles situations aux mêmes choix.
Le projet décrit un entraînement sur environ 60 millions de paires question-réponse, 30 millions d’exemples négatifs synthétiques difficiles et près d’un million de trajectoires d’agents. Les poids de CLM-8B sont proposés sous licence Apache 2.0.
Ce que montrent les tests rapportés face à Jev
Dans la comparaison zéro-shot rapportée par le projet, CLM-8B affichait une latence plus faible que Jev sur les quatre tâches. Les résultats variaient toutefois selon le test : les modèles étaient à égalité sur T-Rex et Super Mario, tandis que Jev obtenait de meilleurs scores sur BFCL v4 et WikiRacing.
| Tâche | Latence de CLM-8B | Latence de Jev | Résultat de CLM-8B | Résultat de Jev |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Appel d’outils (BFCL v4) | 76,8 ms | 125,5 ms | 95,2 % | 99,2 % |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Le projet a également rapporté un avantage pouvant atteindre 9 fois la vitesse de Jev dans ces tests. Les gains les plus importants étaient associés à des listes de candidats plus longues ou à la réutilisation d’actions ; ce chiffre décrit donc les conditions des essais, pas une performance identique sur chaque tâche.
En code, CLM a classé des solutions générées par d’autres modèles
Les résultats sur DeepSWE et Terminal-Bench 2.1 proviennent d’expériences distinctes : des têtes de vérification CLM affinées ont classé des solutions candidates, sans résoudre les tâches de code à partir de zéro. Opus 5 a généré les candidats de DeepSWE et Fable 5 ceux de Terminal-Bench 2.1.
| Benchmark et sous-ensemble évalué | Résultat du vérificateur CLM | Résultat de Jev | Latence du vérificateur CLM | Latence de Jev |
| DeepSWE, 38 tâches mises de côté | 81,6 % | 71,1 % | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 tâches mises de côté | 87,6 % | 83,1 % | 32 ms | 131 ms |
Ces chiffres concernent les sous-ensembles évalués et les têtes affinées. Ils mesurent la sélection parmi des solutions candidates, et non la capacité de CLM-8B à écrire ces solutions lui-même.
À quoi sert ce score dans un agent ?
Les scores de CLM-8B sont calculés sur les options transmises au modèle : les probabilités sont donc relatives à cette liste. Si toutes les actions proposées sont inadéquates, le modèle les classe quand même, à moins qu’une option de refus fasse elle-même partie des candidats. Le choix des options compte autant que leur classement.
Une démonstration en interface applique ce principe à un ticket d’assistance : le système classe son urgence et son orientation, puis compare plusieurs réponses candidates.
CLM-8B convient ainsi aux décisions encadrées où un autre système fournit déjà l’état et les choix possibles. Pour la rédaction longue, le raisonnement ouvert ou la planification de haut niveau, il ne remplace pas un modèle généraliste.
La prochaine étape annoncée pour le projet
Jacky Kwok, responsable du projet, a indiqué que l’équipe entraînait le modèle multimodal CLM-35B-A3B en vue d’une sortie prévue début octobre 2026.