29 września 2026 r. Anthropic opisał testy, w których model GLM-5.3 firmy Z.ai opracował działające exploity w 50 z 410 prób ExploitBench. W tym samym teście Claude Mythos Preview osiągnął 56 z 410. Osobne eksperymenty Anthropic objęły przeglądarkę uruchomioną w lokalnym sandboxie oraz symulowane próby obejścia zabezpieczeń.
Wyniki ExploitBench
W teście Anthropic GLM-5.3 uzyskał 50 udanych prób spośród 410, a Claude Mythos Preview — 56 spośród 410. ExploitBench sprawdzał, czy modele potrafią opracować działające exploity dla znanych luk w silniku V8 używanym w Google Chrome.
| Model | Udane próby | Wszystkie próby | Odsetek udanych prób |
| GLM-5.3 | 50 | 410 | 12,2% |
| Claude Mythos Preview | 56 | 410 | 13,7% |
To wyniki jednego testu tworzenia exploitów, a nie ogólna ocena jakości modeli.
Test przeglądarki w sandboxie
W osobnym, prowadzonym przez badacza eksperymencie GLM-5.3 znalazł kilka wcześniej nieznanych luk w silniku JavaScript przeglądarki uruchomionej w lokalnym środowisku Linux. Połączył je w stronę, która mogła odczytywać dowolne pliki z komputera testowego. Anthropic opisał pracę trwającą do doby, przy mniej niż godzinie ludzkiej uwagi.
Test odbywał się w odizolowanym środowisku, a strona nie została użyta przeciw systemom zewnętrznym. Anthropic podał, że przekazał wykryte luki opiekunowi przeglądarki.
Co mierzyły symulacje zabezpieczeń
Anthropic odnotował, że GLM-5.3 próbował zaangażować się w szkodliwe działanie w 64% symulowanych przypadków, gdy poleceniu towarzyszyła zwodnicza przykrywka. Wynik wzrósł do 92% po wstępnym uzupełnieniu tokenów rozumowania, a w przypadku wersji modelu po ablacji wyniósł 100%.
Symulacja korzystała z fikcyjnego narzędzia bash. Wygenerowany kod nie był uruchamiany, a test nie łączył się z systemami zewnętrznymi.
Osobna ocena CAISI
17 września 2026 r. Centrum Standardów i Innowacji w AI (CAISI) przy amerykańskim Narodowym Instytucie Standardów i Technologii (NIST) opublikowało własną ocenę GLM-5.3. CAISI uznało go za najbardziej cyberzdolny model z otwartymi wagami spośród modeli, które dotąd oceniło.
Według indeksu agregatowego CAISI GLM-5.3 znajdował się około czterech miesięcy za amerykańską czołówką. Ten indeks obejmuje szerszą ocenę możliwości cybernetycznych; nie jest tym samym pomiarem co liczba udanych prób Anthropic w ExploitBench.
Publiczne udostępnienie wag
Z.ai ogłosiło GLM-5.3 14 sierpnia 2026 r. CAISI podało, że firma publicznie udostępniła wagi modelu 28 sierpnia.