Badacze ze Stanfordu i Nvidii udostępnili CLM-8B — model, który ocenia działania zaproponowane agentowi AI zamiast generować odpowiedź tekstową. W testach zero-shot raportowanych przez zespół CLM model osiągał krótszy czas odpowiedzi niż Jev, lecz w części zadań uzyskał niższe wyniki.

CLM-8B wybiera spośród podanych działań

Badacze ze Stanfordu i Nvidii udostępnili model CLM-8B

CLM-8B nie wymyśla swobodnie kolejnego kroku. Otrzymuje opis bieżącego stanu i listę możliwych działań, a następnie ocenia, które z nich najlepiej pasuje do sytuacji. W praktyce taki model może wspierać między innymi kierowanie zgłoszeń, wybór narzędzia lub porządkowanie gotowych odpowiedzi.

Podstawą CLM-8B jest zamrożony enkoder Qwen3-8B, czyli część modelu przekształcająca dane wejściowe w reprezentacje. Osobne głowice projekcyjne kodują stan i działania. Dzięki uczeniu kontrastywnemu, które zbliża reprezentacje pasujących par i oddala niepasujące, model może oceniać ich zgodność. Projekt opisuje trening obejmujący około 60 mln par pytań i odpowiedzi, około 30 mln syntetycznych trudnych przykładów negatywnych oraz mniej więcej milion trajektorii agentów.

Rozdzielenie stanu i działań ma praktyczną zaletę: gdy lista dostępnych działań pozostaje taka sama, ich reprezentacje można zapisać i wykorzystać ponownie przy kolejnych ocenach. Nie trzeba za każdym razem kodować od początku tego samego zestawu kandydatów.

Jak CLM-8B wypadł w testach zero-shot

Zespół CLM podał krótszy czas odpowiedzi niż Jev we wszystkich czterech przedstawionych zadaniach. Wynik zależał jednak od testu: CLM-8B zrównał się z Jev w T-Rex i Super Mario, a w BFCL v4 oraz WikiRacing uzyskał niższe wyniki.

ZadanieCzas odpowiedzi CLM-8BCzas odpowiedzi JevWynik CLM-8BWynik Jev
T-Rex16,5 ms149,8 ms5/55/5
Wywoływanie narzędzi (BFCL v4)76,8 ms125,5 ms95,2%99,2%
WikiRacing79,8 ms225 ms26/3030/30
Super Mario33,5 ms132,6 ms5/55/5

Hasło o maksymalnie dziewięciokrotnie krótszym czasie odpowiedzi odnosi się do raportowanych testów i ich warunków, a nie do każdego możliwego obciążenia. Największe korzyści z szybkości zespół wiązał z ponownym użyciem reprezentacji działań lub dużymi zestawami kandydatów. Projekt podaje także wynik 13× przy około 1000 kandydatach — to odrębne porównanie przypisane właśnie tak dużemu zestawowi.

Wyniki w zadaniach programistycznych dotyczą wyboru rozwiązań

W osobnych eksperymentach dostrojone głowice CLM-8B oceniały gotowe rozwiązania, a nie tworzyły je od zera. Kandydatów do zadań DeepSWE wygenerował Opus 5, a do Terminal-Bench 2.1 — Fable 5.

Test i oceniany zbiórWynik CLM-8BWynik JevCzas odpowiedzi CLM-8BCzas odpowiedzi Jev
DeepSWE, 38 zadań ze zbioru testowego81,6%71,1%79 ms449 ms
Terminal-Bench 2.1, 30 zadań ze zbioru testowego87,6%83,1%32 ms131 ms

To wyniki eksperymentów na wydzielonych podzbiorach, w których CLM wybierał spośród propozycji większych modeli. Nie są to rezultaty samodzielnego rozwiązywania zadań przez CLM-8B.

Do czego przydaje się CLM-8B, a czego nie robi

Demonstracja obejmuje uruchomienie CLM-8B oraz klasyfikowanie zgłoszenia i porządkowanie proponowanych działań w interfejsie playground.

Agent musi dostarczyć CLM-8B opis aktualnego stanu i listę dostępnych działań. Sam model ocenia te opcje; nie obserwuje otoczenia ani nie wykonuje wybranego działania. Takie rozwiązanie pasuje do ograniczonych decyzji, w których system ma już określony zestaw możliwości.

Wyniki CLM-8B są względne wobec kandydatów przekazanych w danym żądaniu. Model rozdziela oceny między tę listę, więc jego wynik nie jest sam w sobie potwierdzeniem, że któraś opcja jest odpowiednia. Karta projektu opisuje ocenianie podanych kandydatów, a nie automatyczne odrzucanie całego zestawu.

CLM-8B nie zastępuje modelu generatywnego w zadaniach wymagających dłuższej wypowiedzi, otwartego rozumowania czy planowania. Jego wagi są udostępnione na licencji Apache 2.0.

Planowany kolejny model

Jacky Kwok poinformował, że zespół planował multimodalny model CLM-35B-A3B na początek października 2026 r.