Pesquisadores de Stanford e da Nvidia lançaram o CLM-8B, um modelo de pesos abertos que pontua ações candidatas para agentes de IA em vez de gerar respostas em texto. Ele compara o estado atual com as opções fornecidas pelo agente e pode reutilizar representações dessas ações. Nos testes divulgados pelo projeto, teve menor latência que Jev nas quatro tarefas avaliadas, embora Jev tenha alcançado resultados melhores em duas delas.

Como o CLM-8B compara estado e ações

Pesquisadores de Stanford e da Nvidia lançam CLM-8B, que pontua ações candidatas de agentes de IA

Um sistema ao redor do agente fornece ao CLM-8B uma representação do estado atual e uma lista de ações possíveis. O modelo calcula a compatibilidade entre o estado e cada opção, então pontua as alternativas para ajudar a selecionar uma delas. Quem percebe o ambiente e executa a ação é o sistema do agente; o CLM-8B faz a pontuação.

A arquitetura usa um codificador Qwen3-8B mantido congelado e duas cabeças de projeção separadas, uma para o estado e outra para as ações. O treinamento contrastivo InfoNCE aproxima as representações de pares estado-ação corretos e afasta as de pares incorretos. Como as ações passam por uma representação própria, o agente pode armazenar essas representações e reutilizá-las quando a lista de opções permanece a mesma.

O projeto descreve o treinamento com cerca de 60 milhões de pares de perguntas e respostas, 30 milhões de exemplos negativos sintéticos e aproximadamente um milhão de trajetórias de agentes. Os pesos do CLM-8B estão sob a licença Apache 2.0.

O que mostram os testes divulgados pelo projeto

Na comparação zero-shot — sem ajuste específico para essas tarefas — o CLM-8B teve menor latência que Jev nos quatro casos. Jev, porém, pontuou melhor em BFCL v4 e WikiRacing; nos dois jogos, os modelos empataram no resultado informado.

TarefaLatência do CLM-8BResultado do CLM-8BLatência de JevResultado de Jev
T-Rex16,5 ms5/5149,8 ms5/5
BFCL v4, uso de ferramentas76,8 ms95,2%125,5 ms99,2%
WikiRacing79,8 ms26/30225 ms30/30
Super Mario33,5 ms5/5132,6 ms5/5

A diferença entre rapidez e resultado importa: uma latência menor não significa que o CLM-8B tenha vencido em todas as métricas. Os números apresentados variam conforme a tarefa.

Nos testes de código, o CLM ranqueou soluções

Os resultados de código vieram de experimentos separados, com cabeças do CLM ajustadas para funcionar como verificadoras e ranquear soluções candidatas. No subconjunto de 38 tarefas do DeepSWE, o CLM marcou 81,6%, contra 71,1% de Jev; as latências foram de 79 ms e 449 ms, respectivamente. As soluções candidatas do DeepSWE foram geradas por Opus 5.

No subconjunto de 30 tarefas do Terminal-Bench 2.1, o CLM marcou 87,6%, contra 83,1% de Jev. A latência foi de 32 ms para o CLM e 131 ms para Jev; Fable 5 gerou as soluções candidatas. Nesses experimentos, o CLM selecionou entre respostas produzidas por modelos maiores, em vez de resolver os desafios do zero.

Benchmark e subconjunto avaliadoResultado do CLMResultado de JevLatência do CLMLatência de Jev
DeepSWE, 38 tarefas81,6%71,1%79 ms449 ms
Terminal-Bench 2.1, 30 tarefas87,6%83,1%32 ms131 ms

Onde o CLM-8B se encaixa — e onde não

Demonstração do CLM-8B em uma interface de playground, com classificação e encaminhamento de um chamado de suporte.

Pontuar uma lista definida de opções pode servir a tarefas como encaminhamento de ferramentas, triagem e classificação. O CLM-8B não foi projetado para escrever uma resposta longa ou fazer raciocínio aberto: sua função é comparar as opções que o agente já forneceu.

As probabilidades também são relativas à lista recebida. Se todas as opções forem ruins, o modelo ainda as compara entre si; uma pontuação alta indica a alternativa mais favorecida naquele conjunto, não uma garantia de que ela seja adequada. Para permitir uma recusa, o sistema precisa incluir uma opção de abstenção entre as candidatas.

Uma demonstração prática mostra um fluxo de classificação e encaminhamento de um chamado de suporte:

O próximo passo planejado pelo projeto

Jacky Kwok, líder do projeto, afirmou que a equipe treinava o modelo multimodal CLM-35B-A3B e planejava lançá-lo no início de outubro de 2026.