Il 29 settembre 2026 Anthropic ha riferito che GLM-5.3, il modello open-weight sviluppato da Z.ai, ha prodotto exploit funzionanti in 50 tentativi su 410 in ExploitBench. Nello stesso test, Claude Mythos Preview ne ha completati 56 su 410. Anthropic ha descritto anche una prova con un browser Linux isolato e simulazioni sulle salvaguardie del modello.

Il confronto in ExploitBench

Nel test di Anthropic, i tentativi consistevano nel trasformare vulnerabilità note del motore JavaScript V8 di Google Chrome in exploit funzionanti. GLM-5.3 ci è riuscito 50 volte su 410; Claude Mythos Preview, 56 volte su 410. La quota è rispettivamente di circa il 12,2% e il 13,7%.

ModelloTentativi riuscitiTentativi totaliQuota dei tentativi
GLM-5.350410circa 12,2%
Claude Mythos Preview56410circa 13,7%

Questi numeri descrivono i risultati dei due modelli in quello specifico test di sviluppo di exploit: non misurano la qualità generale dei modelli.

La prova con un browser Linux in sandbox

In una sessione di ricerca durata fino a un giorno, con meno di un’ora di attenzione umana, GLM-5.3 ha individuato più vulnerabilità fino ad allora sconosciute in una versione locale e isolata di un browser Linux. Anthropic ha riferito che il modello le ha concatenate in una pagina capace di leggere file arbitrari sul computer di test. La prova è rimasta nell’ambiente sandbox e l’exploit non è stato usato contro sistemi esterni.

Che cosa misurano le simulazioni sulle salvaguardie

Anthropic ha riferito tre percentuali di tentativi di adesione a richieste dannose in un ambiente simulato: 64% con una falsa storia di copertura, 92% con token di ragionamento precompilati e 100% dopo l’abliterazione del modello, una modifica volta a rimuovere i rifiuti.

La simulazione usava un falso strumento bash: il codice generato dal modello non veniva eseguito e non c’erano connessioni a sistemi esterni. Le percentuali misurano quindi tentativi di adesione in quelle condizioni simulate, non attacchi riusciti nel mondo reale.

La valutazione distinta di CAISI

Il 17 settembre 2026 il Center for AI Standards and Innovation (CAISI), centro del NIST, aveva definito GLM-5.3 il modello open-weight con le maggiori capacità cyber tra quelli valutati fino a quel momento. Nel suo indice aggregato, CAISI lo collocava circa quattro mesi indietro rispetto alla frontiera statunitense: un confronto basato su una metrica diversa dal conteggio dei tentativi riusciti di Anthropic.

Z.ai aveva annunciato GLM-5.3 il 14 agosto 2026. CAISI ha riferito che i pesi del modello sono stati resi pubblici due settimane dopo il lancio. Nell’esperimento simulato descritto da Anthropic, la condizione di abl iterazione riguardava una versione modificata del modello.