Stanford- und Nvidia-Forscher haben CLM-8B veröffentlicht, ein Modell, das für KI-Agenten vorgegebene Aktionen bewertet, statt selbst Texte zu verfassen. In den vom Projekt berichteten Zero-Shot-Tests war seine Latenz bei vier Aufgaben niedriger als bei Jev. Bei BFCL v4 und WikiRacing erzielte Jev jedoch die besseren Ergebnisse.
CLM-8B bewertet Aktionen statt Texte zu schreiben
Ein KI-Agent kann CLM-8B den aktuellen Zustand und eine Auswahl möglicher Aktionen übergeben. Das Modell bewertet, welche Aktion am besten zu diesem Zustand passt, und ordnet die vorgegebenen Optionen. Die Wahrnehmung des Umfelds und die Ausführung der gewählten Aktion übernimmt das umgebende Agentensystem.
Damit ist CLM-8B für klar abgegrenzte Entscheidungen gedacht, etwa für die Auswahl eines Werkzeugs, die Sortierung von Kandidaten oder die Priorisierung einer Anfrage. Für offene Aufgaben wie längere Texte, umfangreiche Schlussfolgerungen oder übergeordnete Planung ist es kein Ersatz für ein generatives, allgemein einsetzbares Modell.
So vergleicht das Modell Zustand und mögliche Aktionen
CLM-8B verwendet einen eingefrorenen Qwen3-8B-Encoder sowie getrennte Projektionsköpfe für Zustände und Aktionen. Ein Projektionskopf bildet eine Eingabe in eine numerische Repräsentation ab. Ein kontrastives Trainingsverfahren bringt passende Zustands- und Aktionsrepräsentationen näher zusammen und trennt unpassende Paare voneinander.
Bleibt die Auswahl möglicher Aktionen über mehrere Anfragen hinweg gleich, können ihre Repräsentationen zwischengespeichert und wiederverwendet werden. Das Modell muss sie dann nicht für jede neue Zustandsabfrage erneut berechnen. Dieser Ansatz passt besonders zu Abläufen mit wiederkehrenden Aktionsoptionen.
Das Modell berechnet Wahrscheinlichkeiten relativ zu den Kandidaten, die ein Agent übergibt. Sind alle Optionen ungeeignet, ergibt sich daraus keine automatische Zurückweisung außerhalb dieser Auswahl; dafür müsste eine passende Ablehnungsoption Teil der Kandidatenliste sein.
Was die berichteten Tests mit Jev zeigen
In den vom CLM-Projekt berichteten Zero-Shot-Vergleichen war die Latenz von CLM-8B bei allen vier Aufgaben niedriger. Bei T-Rex und Super Mario erzielten beide Modelle dieselbe Erfolgszahl. Bei BFCL v4 und WikiRacing fiel das Ergebnis für Jev höher aus.
| Aufgabe | CLM-8B: Latenz | Jev: Latenz | CLM-8B: Ergebnis | Jev: Ergebnis |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Tool-Aufrufe (BFCL v4) | 76,8 ms | 125,5 ms | 95,2 % | 99,2 % |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Das Projekt bezifferte den größten Geschwindigkeitsvorteil in seinen Tests auf bis zu 9×. Besonders große Zugewinne seien bei wiederverwendbaren Aktionen oder großen Kandidatenmengen aufgetreten. Das ist ein Ergebnis für die getesteten Abläufe, kein pauschaler Geschwindigkeitsfaktor für beliebige Aufgaben.
Coding-Ergebnisse stammen aus Ranglistenversuchen
Bei den Coding-Experimenten ordneten feinabgestimmte CLM-Köpfe Lösungsvorschläge, die größere Modelle erzeugt hatten. Für DeepSWE kamen die Kandidaten von Opus 5, für Terminal-Bench 2.1 von Fable 5. CLM-8B löste diese Aufgaben also nicht selbstständig von Grund auf.
| Benchmark und ausgewertete Teilmenge | CLM: Ergebnis | Jev: Ergebnis | CLM: Latenz | Jev: Latenz |
| DeepSWE, 38 zurückgehaltene Aufgaben | 81,6 % | 71,1 % | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 zurückgehaltene Aufgaben | 87,6 % | 83,1 % | 32 ms | 131 ms |
Diese Werte beziehen sich auf die jeweiligen Teilmengen und feinabgestimmten Bewertungsmodelle. Sie sind keine Ergebnisse vollständiger Bestenlisten-Einreichungen.
Wo ein Bewertungsmodell sinnvoll ist – und wo nicht
CLM-8B kann in einem Agentenablauf zwischen bereitgestellten Werkzeugen, Antworten oder nächsten Aktionen auswählen. Es berechnet aber keine neue Textantwort und liefert keine Option außerhalb der vorgegebenen Kandidaten. Der umgebende Agent muss den aktuellen Zustand und die möglichen Aktionen bereitstellen und die ausgewählte Aktion ausführen.
Das Projekt nennt rund 60 Millionen Frage-Antwort-Paare, 30 Millionen synthetische schwierige Negativbeispiele und etwa eine Million Agenten-Trajektorien als Trainingsdaten. Die Modellgewichte stehen unter der Apache-2.0-Lizenz.
Ein Bildschirmmitschnitt zeigt die Einrichtung des Modells sowie eine Spielwiese, in der ein Support-Ticket nach Dringlichkeit und Zuständigkeit eingeordnet und Kandidaten sortiert werden.
Der nächste angekündigte Schritt
Projektleiter Jacky Kwok zufolge arbeitete das Team an einem multimodalen CLM-35B-A3B und plante dessen Veröffentlichung für Anfang Oktober 2026.