Stanford- en Nvidia-onderzoekers brachten CLM-8B uit, een model dat AI-agents helpt kiezen uit aangeleverde acties. In plaats van zelf tekst te schrijven, vergelijkt het model de huidige toestand met beschikbare opties. In gerapporteerde tests was de latency lager dan bij Jev, al verschilde de prestatie per taak.
Hoe CLM-8B acties rangschikt
Een agentomgeving levert CLM-8B een beschrijving van de huidige toestand en een lijst met mogelijke acties. Het model geeft die invoer een representatie en scoort hoe goed elke optie bij de toestand past. De agent kan vervolgens een van die opties uitvoeren.
CLM-8B gebruikt een bevroren Qwen3-8B-encoder met afzonderlijke projectiehoofden voor de toestand en de acties. De encoder zet invoer om in representaties; contrastief leren traint het model om passende combinaties van toestand en actie dichter bij elkaar te plaatsen dan niet-passende combinaties.
Doordat acties apart worden gecodeerd, kunnen hun representaties opnieuw worden gebruikt wanneer dezelfde opties bij een volgende beslissing terugkomen. Dat kan tijd besparen bij agenten die vaak uit een vaste lijst acties kiezen. Het project meldt daarnaast tot 13× hogere snelheid dan Jev bij ongeveer 1.000 kandidaten; die claim hoort bij die omvang van de kandidatenlijst.
Het project beschrijft training met circa 60 miljoen vraag-antwoordparen, circa 30 miljoen synthetische moeilijke negatieve voorbeelden en ongeveer één miljoen agenttrajecten. De modelgewichten staan onder de Apache 2.0-licentie.
Wat de zero-shot-tests met Jev laten zien
In de gerapporteerde tests zonder taakspecifieke fine-tuning had CLM-8B bij elk van de vier taken een lagere latency dan Jev. De projectclaim van maximaal 9× hogere snelheid geldt voor geteste omstandigheden; de gemeten uitkomsten waren niet op elke taak gelijk.
| Taak | CLM-8B-latency | Jev-latency | Resultaat CLM-8B | Resultaat Jev |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Toolgebruik (BFCL v4) | 76,8 ms | 125,5 ms | 95,2% | 99,2% |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
De uitkomsten maken het verschil concreet: CLM-8B en Jev kwamen gelijk uit bij T-Rex en Super Mario, terwijl Jev hoger scoorde op BFCL v4 en WikiRacing. Volgens het project waren de grootste snelheidswinsten te zien wanneer actievoorstellingen opnieuw konden worden gebruikt of wanneer de kandidatenlijst groot was.
Codingresultaten gaan over het rangschikken van oplossingen
De codingtests waren een ander soort experiment. Fijn afgestemde CLM-beoordelingsmodellen rangschikten mogelijke oplossingen die grotere modellen hadden gemaakt; CLM-8B loste deze taken dus niet zelf vanaf nul op.
| Benchmark en testsubset | Resultaat CLM-beoordelaar | Resultaat Jev | Latency CLM-beoordelaar | Latency Jev |
| DeepSWE, 38 achtergehouden taken | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 achtergehouden taken | 87,6% | 83,1% | 32 ms | 131 ms |
Voor DeepSWE werden de kandidaatoplossingen gegenereerd door Opus 5; voor Terminal-Bench 2.1 door Fable 5. CLM rangschikte de kandidaten voor de inzending. De cijfers slaan op die achtergehouden subsets en op fijn afgestemde beoordelingsmodellen.
Waar past CLM-8B in een agent?
CLM-8B is bedoeld voor begrensde beslissingen: bijvoorbeeld een keuze uit mogelijke acties, het rangschikken van antwoorden of het routeren van een verzoek. Een externe agentomgeving moet de toestand en de beschikbare opties aanleveren; CLM-8B beoordeelt die invoer.
De scores zijn relatief aan de kandidaten die de agent aanlevert. Als alle opties ongeschikt zijn, kan de verdeling over die opties op zichzelf niet aangeven dat de agent beter geen keuze maakt. CLM-8B is daarom geen vervanging voor een generatief model bij open vragen, lange teksten of taken die uitgebreid redeneren en plannen vereisen.
Het project plant een multimodaal vervolgmodel
Op 25 september zei CLM-projectleider Jacky Kwok dat het team CLM-35B-A3B trainde en een release voor begin oktober 2026 plande. Dat model is bedoeld als multimodaal vervolg op CLM-8B.