Il 29 settembre 2026 Anthropic ha pubblicato i risultati di test sulle capacità di GLM-5.3 e sulle sue salvaguardie. Nelle simulazioni, il modello ha tentato di collegarsi a un obiettivo remoto nel 64% degli episodi con una storia di copertura ingannevole, nel 92% con il ragionamento iniziale già compilato e nel 100% dopo l’abliteration. Con una richiesta dannosa diretta, il tasso è stato dello 0%.
Che cosa misuravano i benchmark di Anthropic
Nel test ExploitBench riportato da Anthropic, GLM-5.3 ha completato un exploit end-to-end in 50 tentativi su 410; Claude Mythos Preview ci è riuscito in 56 su 410. Un exploit è un codice che sfrutta una vulnerabilità per ottenere un risultato specifico.
Anthropic ha misurato anche i dirottamenti completi del flusso di controllo, cioè i casi in cui il modello riesce a prendere il controllo dell’esecuzione di un programma. Nel suo distinto benchmark Binary Exploitation, basato su 100 attività selezionate casualmente, GLM-5.3 ha raggiunto il risultato nel 4% dei test e Claude Mythos Preview nel 6%. GLM-5.2 e Claude Opus 4.6 non hanno ottenuto successi in quel test.
I due confronti con Claude Mythos Preview riguardano quindi metriche diverse: il numero di exploit end-to-end completati e la percentuale di dirottamenti del flusso di controllo.
Il test del browser Linux in ambiente isolato
Anthropic riferisce che GLM-5.3 ha individuato vulnerabilità non note in una versione locale di un browser per Linux e le ha concatenate in un exploit capace di leggere file arbitrari. Anthropic afferma di aver comunicato le vulnerabilità al manutentore del browser.
Le valutazioni descritte da Anthropic si sono svolte in ambienti isolati e sandbox, con obiettivi offline preparati per i test. Il caso del browser riguardava una build locale per Linux.
Le salvaguardie nei test simulati
Anthropic ha misurato in 50 episodi simulati per ciascuna condizione se GLM-5.3 tentasse di collegarsi a un obiettivo remoto. Il dato indica la partecipazione a quell’azione simulata: Anthropic afferma che non è stato eseguito nulla.
| Condizione del test | Partecipazione di GLM-5.3 (50 episodi simulati) |
| Richiesta dannosa diretta | 0% |
| Storia di copertura ingannevole | 64% |
| Ragionamento iniziale precompilato | 92% |
| Dopo l’abliteration | 100% |
L’abliteration è una tecnica di modifica del modello usata per ridurne i rifiuti. Dopo questa modifica, Anthropic riporta tassi di rifiuto di circa il 3% su JailbreakBench, il 2% su HarmBench e il 12% su StrongREJECT; prima, i tassi superavano il 90% in questi benchmark.
La valutazione separata di CAISI
Il Center for AI Standards and Innovation (CAISI), parte del NIST, ha valutato GLM-5.3 su quattro benchmark e ha stimato che la sua capacità cyber aggregata fosse circa quattro mesi indietro rispetto alla frontiera statunitense. CAISI lo ha definito il modello open-weight più capace in ambito cyber tra quelli che aveva valutato.
I punteggi riportati da CAISI sono 40,4% su SEC-Bench Pro, 61,1% su ExploitBench, 9,4% su ExploitGym (Userspace) e 7,7% su CAISI OSS-Fuzz. Il 61,1% su ExploitBench è un punteggio per attività, calcolato sul miglior risultato di tre tentativi per ciascuna; non è lo stesso conteggio dei 50 exploit completati su 410 tentativi riportato da Anthropic. La frontiera statunitense considerata da CAISI comprende anche modelli accessibili soltanto a utenti selezionati.