W raporcie opublikowanym 29 września 2026 r. Anthropic podał, że standardowy GLM-5.3 odmówił wszystkich bezpośrednich szkodliwych próśb w opisanej symulacji. W innych warunkach testowych model angażował się w 64% lub 92% prób, a wynik 100% dotyczył zmodyfikowanej wersji GLM-5.3.

Co Anthropic podał o GLM-5.3

GLM-5.3 to model z otwartymi wagami opracowany przez Zhipu AI. Anthropic zbadał jego reakcje na symulowane szkodliwe polecenia cybernetyczne. Wyniki zależały od tego, jak sformułowano polecenie i w jakim stanie był model.

W bezpośrednim teście standardowy GLM-5.3 odmówił wszystkich próśb. Przy zwodniczym przedstawieniu polecenia jako ćwiczenia red-teamowego angażował się w 64% prób, a po wstępnym uzupełnieniu tokenów rozumowania — w 92%. Wynik 100% uzyskano po abliteracji, czyli modyfikacji otwartych wag mającej ograniczyć odmowy.

Co oznaczają wyniki 64%, 92% i 100%

Anthropic uznawał model za zaangażowany, gdy próbował połączyć się ze zdalnym celem w symulacji. Każdy z czterech warunków obejmował 50 prób. Wskaźniki opisują więc próby nawiązania połączenia w tym teście.

Warunek testuStan modeluZaangażowanie
Bezpośrednie szkodliwe polecenieStandardowy GLM-5.30%
Zwodnicze przedstawienie polecenia jako ćwiczenia red-teamowegoStandardowy GLM-5.364%
Wstępnie uzupełnione tokeny rozumowaniaStandardowy GLM-5.392%
Abliteracja ograniczająca odmowyZmodyfikowany GLM-5.3100%

Anthropic podał, że w tej symulacji wygenerowany kod nie był uruchamiany, a model nie mógł łączyć się z systemami zewnętrznymi.

Osobny benchmark tworzenia exploitów

W oddzielnym teście ExploitBench, obejmującym znane podatności silnika V8 przeglądarki Chrome, Anthropic odnotował 50 udanych prób na 410 dla GLM-5.3. Claude Mythos Preview uzyskał 56 udanych prób na 410. Modele działały na odizolowanych celach bez dostępu do sieci.

W osobnym, wewnętrznym benchmarku Anthropic sprawdził 100 losowo wybranych zadań opartych na projektach uczestniczących w Google OSS-Fuzz. Pełne przejęcie przepływu sterowania uzyskano w 4% prób GLM-5.3 i w 6% prób Claude Mythos Preview. To inna miara niż liczba udanych exploitów w ExploitBench.

Demonstracja w odizolowanym środowisku przeglądarki

Anthropic opisał również osobny eksperyment badawczy na maszynie z piaskownicą i lokalną kompilacją przeglądarki dla Linuksa. W ciągu jednego dnia GLM-5.3 znalazł nieznane wcześniej luki i połączył je w działający exploit. W tym środowisku strona internetowa mogła odczytywać dowolne pliki. Anthropic podał, że przekazał informacje o podatnościach opiekunowi przeglądarki.