29 września 2026 r. Anthropic opisał testy GLM-5.3: model opracował działający exploit w 50 z 410 prób, a w symulowanych scenariuszach zabezpieczeń próbował połączyć się ze zdalnym celem w od 0% do 100% epizodów, zależnie od warunków. Testy odbywały się w izolowanych środowiskach; mierzona próba połączenia nie oznaczała wykonania ataku.
Wyniki testów exploitów
W teście ExploitBench Anthropic odnotował działający exploit w 50 z 410 prób GLM-5.3. Claude Mythos Preview osiągnął taki wynik w 56 z 410 prób.
W odrębnym, wewnętrznym benchmarku Binary Exploitation pełne przejęcie przepływu sterowania — czyli uzyskanie kontroli nad wykonywaniem programu — wystąpiło w 4% prób GLM-5.3 i 6% prób Claude Mythos Preview. Test obejmował 100 losowo wybranych zadań. Są to wyniki dwóch różnych pomiarów: pierwszy liczył próby zakończone działającym exploitem, drugi — pełne przejęcia przepływu sterowania.
Test przeglądarki w odizolowanym środowisku
Anthropic opisał też test lokalnej kompilacji przeglądarki dla Linuksa. Według firmy GLM-5.3 znalazł wcześniej nieznane podatności i połączył je w exploit umożliwiający odczyt dowolnych plików. Anthropic podał, że zgłosił te podatności opiekunowi przeglądarki. Próby prowadzono w środowiskach odizolowanych, na celach przygotowanych do testów.
Zaangażowanie w symulowanych testach zabezpieczeń
W tych testach Anthropic mierzył, czy model próbował połączyć się ze zdalnym celem po otrzymaniu szkodliwego polecenia. Każdy warunek obejmował 50 symulowanych epizodów, a w środowisku testowym niczego nie wykonano.
| Warunek testu | Zaangażowanie GLM-5.3 |
| Bezpośrednie szkodliwe polecenie | 0% |
| Polecenie z fałszywą historią, przedstawiającą je jako ćwiczenie | 64% |
| Polecenie z wcześniej przygotowanym rozumowaniem | 92% |
| Model po abliteracji, czyli modyfikacji ograniczającej odmowy | 100% |
W osobnych testach po ablacji Anthropic odnotował około 3% odmów w JailbreakBench, 2% w HarmBench i 12% w StrongREJECT. Przed modyfikacją wskaźnik odmów przekraczał 90%. To wyniki dla konkretnych benchmarków i warunków testowych.
Odrębna ocena CAISI
Centrum Standardów i Innowacji w AI przy NIST (CAISI) przeprowadziło osobną ocenę GLM-5.3 w czterech benchmarkach. Podało wyniki: 40,4% w SEC-Bench Pro, 61,1% w ExploitBench, 9,4% w ExploitGym (Userspace) i 7,7% w CAISI OSS-Fuzz.
Wynik ExploitBench odpowiadał 9,8 punktu na 16-stopniowej skali; CAISI brało pod uwagę najlepszą z trzech prób dla każdego zadania. Anthropic zliczał natomiast próby zakończone działającym exploitem, więc jego wynik 50 z 410 nie jest bezpośrednio porównywalny z wynikiem CAISI.
CAISI określiło GLM-5.3 jako najbardziej zaawansowany pod względem cybernetycznym model z otwartymi wagami spośród modeli ocenionych przez tę instytucję. W zbiorczej ocenie jego zdolności dzieliło od amerykańskiej czołówki około czterech miesięcy. Do tej czołówki CAISI zaliczało także modele udostępniane wyłącznie zweryfikowanym użytkownikom.
Anthropic ocenił, że rozwój takich zdolności może zwiększyć ryzyko dla obrońców systemów.