I ricercatori di Stanford e Nvidia hanno presentato CLM-8B, un modello a pesi aperti che aiuta gli agenti IA a scegliere tra azioni già definite. Invece di generare una risposta in prosa, valuta le opzioni fornite in base allo stato corrente; nei test riportati dal progetto ha avuto latenze inferiori a Jev, con risultati che cambiano a seconda del compito.
CLM-8B sceglie tra opzioni, non scrive risposte
Un agente che usa CLM-8B deve fornire al modello una rappresentazione dello stato e un insieme di azioni candidate. CLM assegna un punteggio alle alternative e le ordina: il modello può servire, per esempio, a indirizzare una richiesta, classificare un caso o selezionare una risposta già generata. È il sistema esterno a fornire lo stato e a gestire l’azione scelta.
L’architettura descritta dal progetto usa un encoder Qwen3-8B congelato, cioè non aggiornato durante l’addestramento, e due teste di proiezione distinte: una per lo stato, l’altra per le azioni. L’apprendimento contrastivo, basato sull’obiettivo InfoNCE, avvicina le rappresentazioni delle coppie stato-azione corrette e separa quelle non corrette.
La distinzione tra le due teste permette di codificare in anticipo le azioni e riutilizzarne le rappresentazioni quando l’insieme delle opzioni resta lo stesso. Il modello deve comunque valutare lo stato di volta in volta, ma non occorre ricominciare da capo con le stesse azioni a ogni richiesta: è una caratteristica utile nei flussi di lavoro con scelte ricorrenti.
Il progetto descrive un addestramento che comprende circa 60 milioni di coppie domanda-risposta, 30 milioni di esempi negativi difficili sintetici e circa un milione di traiettorie di agenti. I pesi di CLM-8B sono indicati con licenza Apache 2.0.
I test zero-shot mostrano compromessi diversi per ogni compito
Nei test zero-shot riportati dal progetto, CLM-8B ha registrato una latenza inferiore a Jev in tutti e quattro i compiti elencati. Il risultato operativo, però, non è uniforme: nei giochi i due modelli hanno ottenuto lo stesso conteggio, mentre Jev ha segnato risultati migliori in BFCL v4 e WikiRacing.
| Compito | Latenza CLM-8B | Latenza Jev | Risultato CLM-8B | Risultato Jev |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Tool calling (BFCL v4) | 76,8 ms | 125,5 ms | 95,2% | 99,2% |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Il progetto ha descritto il vantaggio massimo come una velocità fino a nove volte superiore nelle condizioni testate. I guadagni maggiori sono stati associati al riuso delle azioni tra stati diversi o a insiemi di candidati più ampi: non è una misura valida per ogni carico di lavoro.
Nei test di coding, CLM ha selezionato soluzioni generate da altri modelli
Gli esperimenti su DeepSWE e Terminal-Bench 2.1 hanno usato teste CLM ottimizzate per il compito, che hanno valutato soluzioni candidate generate da modelli più grandi. CLM ha quindi selezionato tra le proposte: non ha risolto quei problemi partendo da zero.
| Benchmark e sottoinsieme valutato | Risultato CLM ottimizzato | Risultato Jev | Latenza CLM | Latenza Jev |
| DeepSWE, 38 attività escluse dall’addestramento | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 attività escluse dall’addestramento | 87,6% | 83,1% | 32 ms | 131 ms |
Per DeepSWE, Opus 5 ha generato le soluzioni candidate; per Terminal-Bench 2.1, il modello generatore è stato Fable 5. I risultati riguardano quei sottoinsiemi di attività e teste ottimizzate.
I punteggi dipendono dalle alternative fornite
CLM-8B calcola le probabilità tra i candidati ricevuti: il valore assegnato a un’opzione è relativo alle altre opzioni dello stesso insieme. Un punteggio alto indica quindi che il modello la preferisce alle alternative presentate, non che sia necessariamente adatta in assoluto. Se un agente deve poter rifiutare tutte le proposte, l’insieme delle opzioni deve includere una possibilità di astensione.
Questo rende CLM-8B adatto a decisioni circoscritte come classificare, ordinare o instradare alternative già disponibili. Non sostituisce un modello generativo quando servono ragionamento aperto, pianificazione ad alto livello o testi lunghi: non produce risposte in prosa e non raccoglie da solo informazioni sull’ambiente.
Il progetto ha indicato un piano per CLM-35B-A3B
Jacky Kwok, responsabile del progetto CLM, ha riferito che il team stava addestrando il modello multimodale CLM-35B-A3B e ne prevedeva il rilascio all’inizio di ottobre 2026.