29 września 2026 r. Anthropic opisał testy, w których model GLM-5.3 firmy Z.ai opracował działające exploity w 50 z 410 prób ExploitBench. W tym samym teście Claude Mythos Preview osiągnął 56 z 410. Osobne eksperymenty Anthropic objęły przeglądarkę uruchomioną w lokalnym sandboxie oraz symulowane próby obejścia zabezpieczeń.

Wyniki ExploitBench

W teście Anthropic GLM-5.3 uzyskał 50 udanych prób spośród 410, a Claude Mythos Preview — 56 spośród 410. ExploitBench sprawdzał, czy modele potrafią opracować działające exploity dla znanych luk w silniku V8 używanym w Google Chrome.

ModelUdane próbyWszystkie próbyOdsetek udanych prób
GLM-5.35041012,2%
Claude Mythos Preview5641013,7%

To wyniki jednego testu tworzenia exploitów, a nie ogólna ocena jakości modeli.

Test przeglądarki w sandboxie

W osobnym, prowadzonym przez badacza eksperymencie GLM-5.3 znalazł kilka wcześniej nieznanych luk w silniku JavaScript przeglądarki uruchomionej w lokalnym środowisku Linux. Połączył je w stronę, która mogła odczytywać dowolne pliki z komputera testowego. Anthropic opisał pracę trwającą do doby, przy mniej niż godzinie ludzkiej uwagi.

Test odbywał się w odizolowanym środowisku, a strona nie została użyta przeciw systemom zewnętrznym. Anthropic podał, że przekazał wykryte luki opiekunowi przeglądarki.

Co mierzyły symulacje zabezpieczeń

Anthropic odnotował, że GLM-5.3 próbował zaangażować się w szkodliwe działanie w 64% symulowanych przypadków, gdy poleceniu towarzyszyła zwodnicza przykrywka. Wynik wzrósł do 92% po wstępnym uzupełnieniu tokenów rozumowania, a w przypadku wersji modelu po ablacji wyniósł 100%.

Symulacja korzystała z fikcyjnego narzędzia bash. Wygenerowany kod nie był uruchamiany, a test nie łączył się z systemami zewnętrznymi.

Osobna ocena CAISI

17 września 2026 r. Centrum Standardów i Innowacji w AI (CAISI) przy amerykańskim Narodowym Instytucie Standardów i Technologii (NIST) opublikowało własną ocenę GLM-5.3. CAISI uznało go za najbardziej cyberzdolny model z otwartymi wagami spośród modeli, które dotąd oceniło.

Według indeksu agregatowego CAISI GLM-5.3 znajdował się około czterech miesięcy za amerykańską czołówką. Ten indeks obejmuje szerszą ocenę możliwości cybernetycznych; nie jest tym samym pomiarem co liczba udanych prób Anthropic w ExploitBench.

Publiczne udostępnienie wag

Z.ai ogłosiło GLM-5.3 14 sierpnia 2026 r. CAISI podało, że firma publicznie udostępniła wagi modelu 28 sierpnia.