Stanford- en Nvidia-onderzoekers brachten CLM-8B uit, een model dat AI-agents helpt kiezen uit aangeleverde acties. In plaats van zelf tekst te schrijven, vergelijkt het model de huidige toestand met beschikbare opties. In gerapporteerde tests was de latency lager dan bij Jev, al verschilde de prestatie per taak.

Hoe CLM-8B acties rangschikt

Stanford en Nvidia brengen CLM-8B uit voor AI-agentacties

Een agentomgeving levert CLM-8B een beschrijving van de huidige toestand en een lijst met mogelijke acties. Het model geeft die invoer een representatie en scoort hoe goed elke optie bij de toestand past. De agent kan vervolgens een van die opties uitvoeren.

CLM-8B gebruikt een bevroren Qwen3-8B-encoder met afzonderlijke projectiehoofden voor de toestand en de acties. De encoder zet invoer om in representaties; contrastief leren traint het model om passende combinaties van toestand en actie dichter bij elkaar te plaatsen dan niet-passende combinaties.

Doordat acties apart worden gecodeerd, kunnen hun representaties opnieuw worden gebruikt wanneer dezelfde opties bij een volgende beslissing terugkomen. Dat kan tijd besparen bij agenten die vaak uit een vaste lijst acties kiezen. Het project meldt daarnaast tot 13× hogere snelheid dan Jev bij ongeveer 1.000 kandidaten; die claim hoort bij die omvang van de kandidatenlijst.

Het project beschrijft training met circa 60 miljoen vraag-antwoordparen, circa 30 miljoen synthetische moeilijke negatieve voorbeelden en ongeveer één miljoen agenttrajecten. De modelgewichten staan onder de Apache 2.0-licentie.

Wat de zero-shot-tests met Jev laten zien

In de gerapporteerde tests zonder taakspecifieke fine-tuning had CLM-8B bij elk van de vier taken een lagere latency dan Jev. De projectclaim van maximaal 9× hogere snelheid geldt voor geteste omstandigheden; de gemeten uitkomsten waren niet op elke taak gelijk.

TaakCLM-8B-latencyJev-latencyResultaat CLM-8BResultaat Jev
T-Rex16,5 ms149,8 ms5/55/5
Toolgebruik (BFCL v4)76,8 ms125,5 ms95,2%99,2%
WikiRacing79,8 ms225 ms26/3030/30
Super Mario33,5 ms132,6 ms5/55/5

De uitkomsten maken het verschil concreet: CLM-8B en Jev kwamen gelijk uit bij T-Rex en Super Mario, terwijl Jev hoger scoorde op BFCL v4 en WikiRacing. Volgens het project waren de grootste snelheidswinsten te zien wanneer actievoorstellingen opnieuw konden worden gebruikt of wanneer de kandidatenlijst groot was.

Codingresultaten gaan over het rangschikken van oplossingen

De codingtests waren een ander soort experiment. Fijn afgestemde CLM-beoordelingsmodellen rangschikten mogelijke oplossingen die grotere modellen hadden gemaakt; CLM-8B loste deze taken dus niet zelf vanaf nul op.

Benchmark en testsubsetResultaat CLM-beoordelaarResultaat JevLatency CLM-beoordelaarLatency Jev
DeepSWE, 38 achtergehouden taken81,6%71,1%79 ms449 ms
Terminal-Bench 2.1, 30 achtergehouden taken87,6%83,1%32 ms131 ms

Voor DeepSWE werden de kandidaatoplossingen gegenereerd door Opus 5; voor Terminal-Bench 2.1 door Fable 5. CLM rangschikte de kandidaten voor de inzending. De cijfers slaan op die achtergehouden subsets en op fijn afgestemde beoordelingsmodellen.

Waar past CLM-8B in een agent?

Een demonstratie van het rangschikken en routeren van een supportverzoek met kandidaatkeuzes.

CLM-8B is bedoeld voor begrensde beslissingen: bijvoorbeeld een keuze uit mogelijke acties, het rangschikken van antwoorden of het routeren van een verzoek. Een externe agentomgeving moet de toestand en de beschikbare opties aanleveren; CLM-8B beoordeelt die invoer.

De scores zijn relatief aan de kandidaten die de agent aanlevert. Als alle opties ongeschikt zijn, kan de verdeling over die opties op zichzelf niet aangeven dat de agent beter geen keuze maakt. CLM-8B is daarom geen vervanging voor een generatief model bij open vragen, lange teksten of taken die uitgebreid redeneren en plannen vereisen.

Het project plant een multimodaal vervolgmodel

Op 25 september zei CLM-projectleider Jacky Kwok dat het team CLM-35B-A3B trainde en een release voor begin oktober 2026 plande. Dat model is bedoeld als multimodaal vervolg op CLM-8B.