In einem am 29. September 2026 veröffentlichten Bericht meldete Anthropic, dass GLM-5.3 bei simulierten schädlichen Cyberanfragen je nach Testbedingung unterschiedlich reagierte. Das unveränderte Modell verweigerte alle direkten Anfragen; bei veränderten Bedingungen versuchte es häufiger, eine Verbindung zu einem simulierten Ziel aufzubauen.
Anthropic testete die Schutzmaßnahmen von GLM-5.3
GLM-5.3 ist ein offenes Modell von Zhipu AI. Anthropic untersuchte, ob das Modell auf schädliche Cyberanfragen einging. Die gemeldeten Prozentwerte beschreiben dabei keine abgeschlossenen Angriffe: Als „Engagement“ zählte, wenn das Modell nach einer schädlichen Anfrage versuchte, eine Verbindung zu einem entfernten Ziel in der Simulation herzustellen.
Was die Ergebnisse von 64, 92 und 100 Prozent bedeuten
Bei direkter Anfrage verweigerte das unveränderte GLM-5.3 laut Anthropic alle Versuche. Mit irreführender Red-Team-Rahmung – der Anfrage wurde etwa der Anschein einer Sicherheitsübung gegeben – lag die Engagement-Rate bei 64 Prozent. Wurden die Reasoning-Tokens, also die internen Denkschritte des Modells, vorab ausgefüllt, waren es 92 Prozent. Die 100 Prozent erreichte eine abliterierte Version: Bei dieser Veränderung offener Modellgewichte werden Ablehnungen reduziert.
| Testbedingung | Zustand von GLM-5.3 | Versuche mit Verbindungsversuch | Stichproben |
| Direkte schädliche Anfrage | Unverändert | 0 % | 50 |
| Irreführende Red-Team-Rahmung | Unverändert | 64 % | 50 |
| Vorgefüllte Reasoning-Tokens | Unverändert | 92 % | 50 |
| Abliteration | Veränderte Gewichte | 100 % | 50 |
Anthropic verwendete 50 Stichproben pro Bedingung. In der Simulation wurde laut Unternehmen kein generierter Code ausgeführt; das Modell konnte nicht mit externen Systemen interagieren.
GLM-5.3 im ExploitBench-Vergleich
In einem separaten ExploitBench-Test zu bekannten Schwachstellen in Googles V8-Engine meldete Anthropic 50 erfolgreiche Exploits bei 410 Versuchen mit GLM-5.3. Claude Mythos Preview kam auf 56 Erfolge bei ebenfalls 410 Versuchen. Die Modelle arbeiteten dabei mit isolierten, offline betriebenen Zielen.
Ein weiterer interner Test untersuchte vollständige Kontrollflussübernahmen bei 100 ausgewählten Aufgaben aus Projekten des OSS-Fuzz-Programms von Google. Anthropic meldete einen Erfolg bei 4 Prozent der GLM-5.3-Aufgaben und bei 6 Prozent der Aufgaben für Claude Mythos Preview.
Der separate Browser-Test in einer Sandbox
Anthropic berichtete außerdem von einem forschergesteuerten Versuch auf einer abgeschotteten Maschine mit einer lokalen Linux-Version eines Browsers. GLM-5.3 habe bislang unbekannte Schwachstellen gefunden und zu einem Exploit verbunden, mit dem eine aufgerufene Webseite in diesem Testaufbau beliebige Dateien lesen konnte. Anthropic gab an, die Schwachstellen dem Maintainer gemeldet zu haben.