Pesquisadores de Stanford e da Nvidia lançaram o CLM-8B, um modelo de pesos abertos que pontua ações candidatas para agentes de IA em vez de gerar respostas em texto. Ele compara o estado atual com as opções fornecidas pelo agente e pode reutilizar representações dessas ações. Nos testes divulgados pelo projeto, teve menor latência que Jev nas quatro tarefas avaliadas, embora Jev tenha alcançado resultados melhores em duas delas.
Como o CLM-8B compara estado e ações
Um sistema ao redor do agente fornece ao CLM-8B uma representação do estado atual e uma lista de ações possíveis. O modelo calcula a compatibilidade entre o estado e cada opção, então pontua as alternativas para ajudar a selecionar uma delas. Quem percebe o ambiente e executa a ação é o sistema do agente; o CLM-8B faz a pontuação.
A arquitetura usa um codificador Qwen3-8B mantido congelado e duas cabeças de projeção separadas, uma para o estado e outra para as ações. O treinamento contrastivo InfoNCE aproxima as representações de pares estado-ação corretos e afasta as de pares incorretos. Como as ações passam por uma representação própria, o agente pode armazenar essas representações e reutilizá-las quando a lista de opções permanece a mesma.
O projeto descreve o treinamento com cerca de 60 milhões de pares de perguntas e respostas, 30 milhões de exemplos negativos sintéticos e aproximadamente um milhão de trajetórias de agentes. Os pesos do CLM-8B estão sob a licença Apache 2.0.
O que mostram os testes divulgados pelo projeto
Na comparação zero-shot — sem ajuste específico para essas tarefas — o CLM-8B teve menor latência que Jev nos quatro casos. Jev, porém, pontuou melhor em BFCL v4 e WikiRacing; nos dois jogos, os modelos empataram no resultado informado.
| Tarefa | Latência do CLM-8B | Resultado do CLM-8B | Latência de Jev | Resultado de Jev |
| T-Rex | 16,5 ms | 5/5 | 149,8 ms | 5/5 |
| BFCL v4, uso de ferramentas | 76,8 ms | 95,2% | 125,5 ms | 99,2% |
| WikiRacing | 79,8 ms | 26/30 | 225 ms | 30/30 |
| Super Mario | 33,5 ms | 5/5 | 132,6 ms | 5/5 |
A diferença entre rapidez e resultado importa: uma latência menor não significa que o CLM-8B tenha vencido em todas as métricas. Os números apresentados variam conforme a tarefa.
Nos testes de código, o CLM ranqueou soluções
Os resultados de código vieram de experimentos separados, com cabeças do CLM ajustadas para funcionar como verificadoras e ranquear soluções candidatas. No subconjunto de 38 tarefas do DeepSWE, o CLM marcou 81,6%, contra 71,1% de Jev; as latências foram de 79 ms e 449 ms, respectivamente. As soluções candidatas do DeepSWE foram geradas por Opus 5.
No subconjunto de 30 tarefas do Terminal-Bench 2.1, o CLM marcou 87,6%, contra 83,1% de Jev. A latência foi de 32 ms para o CLM e 131 ms para Jev; Fable 5 gerou as soluções candidatas. Nesses experimentos, o CLM selecionou entre respostas produzidas por modelos maiores, em vez de resolver os desafios do zero.
| Benchmark e subconjunto avaliado | Resultado do CLM | Resultado de Jev | Latência do CLM | Latência de Jev |
| DeepSWE, 38 tarefas | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 tarefas | 87,6% | 83,1% | 32 ms | 131 ms |
Onde o CLM-8B se encaixa — e onde não
Pontuar uma lista definida de opções pode servir a tarefas como encaminhamento de ferramentas, triagem e classificação. O CLM-8B não foi projetado para escrever uma resposta longa ou fazer raciocínio aberto: sua função é comparar as opções que o agente já forneceu.
As probabilidades também são relativas à lista recebida. Se todas as opções forem ruins, o modelo ainda as compara entre si; uma pontuação alta indica a alternativa mais favorecida naquele conjunto, não uma garantia de que ela seja adequada. Para permitir uma recusa, o sistema precisa incluir uma opção de abstenção entre as candidatas.
Uma demonstração prática mostra um fluxo de classificação e encaminhamento de um chamado de suporte:
O próximo passo planejado pelo projeto
Jacky Kwok, líder do projeto, afirmou que a equipe treinava o modelo multimodal CLM-35B-A3B e planejava lançá-lo no início de outubro de 2026.