Badacze ze Stanfordu i Nvidii udostępnili CLM-8B — model, który ocenia działania zaproponowane agentowi AI zamiast generować odpowiedź tekstową. W testach zero-shot raportowanych przez zespół CLM model osiągał krótszy czas odpowiedzi niż Jev, lecz w części zadań uzyskał niższe wyniki.
CLM-8B wybiera spośród podanych działań
CLM-8B nie wymyśla swobodnie kolejnego kroku. Otrzymuje opis bieżącego stanu i listę możliwych działań, a następnie ocenia, które z nich najlepiej pasuje do sytuacji. W praktyce taki model może wspierać między innymi kierowanie zgłoszeń, wybór narzędzia lub porządkowanie gotowych odpowiedzi.
Podstawą CLM-8B jest zamrożony enkoder Qwen3-8B, czyli część modelu przekształcająca dane wejściowe w reprezentacje. Osobne głowice projekcyjne kodują stan i działania. Dzięki uczeniu kontrastywnemu, które zbliża reprezentacje pasujących par i oddala niepasujące, model może oceniać ich zgodność. Projekt opisuje trening obejmujący około 60 mln par pytań i odpowiedzi, około 30 mln syntetycznych trudnych przykładów negatywnych oraz mniej więcej milion trajektorii agentów.
Rozdzielenie stanu i działań ma praktyczną zaletę: gdy lista dostępnych działań pozostaje taka sama, ich reprezentacje można zapisać i wykorzystać ponownie przy kolejnych ocenach. Nie trzeba za każdym razem kodować od początku tego samego zestawu kandydatów.
Jak CLM-8B wypadł w testach zero-shot
Zespół CLM podał krótszy czas odpowiedzi niż Jev we wszystkich czterech przedstawionych zadaniach. Wynik zależał jednak od testu: CLM-8B zrównał się z Jev w T-Rex i Super Mario, a w BFCL v4 oraz WikiRacing uzyskał niższe wyniki.
| Zadanie | Czas odpowiedzi CLM-8B | Czas odpowiedzi Jev | Wynik CLM-8B | Wynik Jev |
| T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Wywoływanie narzędzi (BFCL v4) | 76,8 ms | 125,5 ms | 95,2% | 99,2% |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Hasło o maksymalnie dziewięciokrotnie krótszym czasie odpowiedzi odnosi się do raportowanych testów i ich warunków, a nie do każdego możliwego obciążenia. Największe korzyści z szybkości zespół wiązał z ponownym użyciem reprezentacji działań lub dużymi zestawami kandydatów. Projekt podaje także wynik 13× przy około 1000 kandydatach — to odrębne porównanie przypisane właśnie tak dużemu zestawowi.
Wyniki w zadaniach programistycznych dotyczą wyboru rozwiązań
W osobnych eksperymentach dostrojone głowice CLM-8B oceniały gotowe rozwiązania, a nie tworzyły je od zera. Kandydatów do zadań DeepSWE wygenerował Opus 5, a do Terminal-Bench 2.1 — Fable 5.
| Test i oceniany zbiór | Wynik CLM-8B | Wynik Jev | Czas odpowiedzi CLM-8B | Czas odpowiedzi Jev |
| DeepSWE, 38 zadań ze zbioru testowego | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1, 30 zadań ze zbioru testowego | 87,6% | 83,1% | 32 ms | 131 ms |
To wyniki eksperymentów na wydzielonych podzbiorach, w których CLM wybierał spośród propozycji większych modeli. Nie są to rezultaty samodzielnego rozwiązywania zadań przez CLM-8B.
Do czego przydaje się CLM-8B, a czego nie robi
Agent musi dostarczyć CLM-8B opis aktualnego stanu i listę dostępnych działań. Sam model ocenia te opcje; nie obserwuje otoczenia ani nie wykonuje wybranego działania. Takie rozwiązanie pasuje do ograniczonych decyzji, w których system ma już określony zestaw możliwości.
Wyniki CLM-8B są względne wobec kandydatów przekazanych w danym żądaniu. Model rozdziela oceny między tę listę, więc jego wynik nie jest sam w sobie potwierdzeniem, że któraś opcja jest odpowiednia. Karta projektu opisuje ocenianie podanych kandydatów, a nie automatyczne odrzucanie całego zestawu.
CLM-8B nie zastępuje modelu generatywnego w zadaniach wymagających dłuższej wypowiedzi, otwartego rozumowania czy planowania. Jego wagi są udostępnione na licencji Apache 2.0.
Planowany kolejny model
Jacky Kwok poinformował, że zespół planował multimodalny model CLM-35B-A3B na początek października 2026 r.