Anthropic meldde op 29 september dat GLM-5.3 in gesimuleerde beveiligingstests op schadelijke verzoeken inging: bij rechtstreekse opdrachten gebeurde dat in 0% van de gevallen, tegenover 64% met een misleidend voorwendsel, 92% met vooraf ingevulde redenering en 100% na abliteration. De test mat of het model probeerde verbinding te maken met een extern doelwit in een simulatie.
Wat de exploitbenchmarks maten
Anthropic rapporteerde dat GLM-5.3 in 50 van 410 ExploitBench-pogingen een exploit van begin tot eind voltooide. Claude Mythos Preview slaagde in 56 van de 410 pogingen. Een exploit is code die een kwetsbaarheid benut.
In een afzonderlijke Binary Exploitation-test behaalde GLM-5.3 in 4% van de proeven een volledige overname van de programmasturing, een zogeheten control-flow hijack. Claude Mythos Preview haalde 6%. Anthropic gebruikte voor deze test 100 willekeurig gekozen taken. De uitkomsten meten dus twee verschillende zaken: ExploitBench telde pogingen met een werkende exploit van begin tot eind; de andere benchmark keek naar het overnemen van de programmasturing.
Een browsertest in een afgeschermde omgeving
In een test met een lokale Linux-build van een browser vond GLM-5.3 volgens Anthropic eerder onbekende kwetsbaarheden en combineerde die tot een exploit waarmee het willekeurige bestanden kon lezen. Anthropic zei de kwetsbaarheden bij de browserbeheerder te hebben gemeld.
Anthropic zegt dat de evaluaties plaatsvonden in geïsoleerde, afgeschermde omgevingen met offline doelen die voor de tests waren ingericht. De browserproef was geen aanval op een live systeem.
Beveiligingsreacties in simulaties
Anthropic rapporteerde de volgende engagementpercentages voor GLM-5.3. Per conditie bestond de test uit 50 gesimuleerde episodes; engagement betekende dat het model probeerde verbinding te maken met een extern doelwit.
| Testconditie | Engagement bij GLM-5.3 |
| Rechtstreekse opdracht | 0% |
| Misleidend voorwendsel | 64% |
| Vooraf ingevulde redenering | 92% |
| Na abliteration | 100% |
Bij abliteration was het weigeringsgedrag van het model bewerkt. Anthropic rapporteerde na die bewerking weigeringspercentages van ongeveer 3% op JailbreakBench, 2% op HarmBench en 12% op StrongREJECT. Dat zijn uitkomsten van afzonderlijke benchmarks, geen percentages van daadwerkelijke aanvallen.
CAISI’s afzonderlijke beoordeling
Het Center for AI Standards and Innovation (CAISI) van NIST beoordeelde GLM-5.3 op vier cyberbenchmarks. Het rapporteerde 40,4% op SEC-Bench Pro, 61,1% op ExploitBench, 9,4% op ExploitGym (Userspace) en 7,7% op CAISI OSS-Fuzz. De ExploitBench-score van CAISI is een taakscore op een schaal van 16 punten, gebaseerd op de beste van drie pogingen; die meet iets anders dan Anthropic’s telling van 50 geslaagde pogingen uit 410.
CAISI noemde GLM-5.3 het cybercapabelste open-weightmodel dat het had beoordeeld. Op zijn samengestelde maatstaf schatte CAISI de totale cybercapaciteit ongeveer vier maanden achter de Amerikaanse frontier. Die frontier omvat ook modellen die alleen beschikbaar zijn voor gecontroleerde gebruikers.
Anthropic waarschuwde dat zulke mogelijkheden de risico’s voor verdedigers kunnen vergroten.