Il 29 settembre 2026 Anthropic ha riferito che, in una simulazione di richieste dannose, GLM-5.3 ha tentato di collegarsi a un bersaglio remoto nel 64% dei test con un inquadramento ingannevole e nel 92% con token di ragionamento precompilati. Il 100% riguarda una variante modificata per ridurre i rifiuti; nella stessa simulazione, GLM-5.3 standard ha rifiutato tutte le richieste dannose dirette.

Che cosa ha riferito Anthropic su GLM-5.3

La valutazione di Anthropic ha esaminato come il modello rispondesse a richieste informatiche dannose in un ambiente simulato. Per GLM-5.3 standard, tutte le richieste dirette sono state rifiutate. I risultati più alti sono emersi con condizioni diverse: un falso contesto da esercitazione red team, la precompilazione dei token di ragionamento e una modifica del modello volta a ridurne i rifiuti.

Che cosa significano i risultati del 64%, 92% e 100%

Anthropic ha definito «interazione» il tentativo del modello di collegarsi a un bersaglio remoto simulato. Ogni condizione ha usato 50 campioni: cinque sequenze di attacco, due bersagli e cinque tentativi. Anthropic ha riferito che il codice generato non è stato eseguito e che il modello non poteva interagire con sistemi esterni.

Condizione del testStato del modelloTentativi di collegamentoCampioniChe cosa è stato misurato
Richiesta dannosa direttaGLM-5.3 standard0%50Tentativo di collegarsi al bersaglio simulato
Inquadramento ingannevole come esercitazione red teamGLM-5.3 standard64%50Tentativo di collegarsi al bersaglio simulato
Token di ragionamento precompilatiGLM-5.3 standard92%50Tentativo di collegarsi al bersaglio simulato
Abliterazione, una modifica pensata per ridurre i rifiutiVariante modificata di GLM-5.3100%50Tentativo di collegarsi al bersaglio simulato

Il 100% equivale quindi a un tentativo di collegamento in tutti i 50 campioni di quella condizione. Non è il risultato ottenuto dal modello standard con una richiesta diretta: in quel caso GLM-5.3 ha rifiutato tutte le richieste.

Il confronto separato nel benchmark di exploit

In un test distinto su vulnerabilità note nel motore V8 di Google Chrome, Anthropic ha riportato 50 exploit end-to-end riusciti su 410 tentativi per GLM-5.3 e 56 su 410 per Claude Mythos Preview. I modelli sono stati valutati su bersagli offline e isolati.

In un altro benchmark interno, basato su 100 compiti selezionati casualmente, GLM-5.3 ha ottenuto un dirottamento completo del flusso di controllo nel 4% dei casi; Claude Mythos Preview ha raggiunto il 6%. Sono risultati di prove distinte: l’interazione nella simulazione di richieste dannose e il successo nei benchmark di exploit misurano aspetti diversi.

La dimostrazione in un browser isolato

Anthropic ha inoltre descritto una prova guidata da un ricercatore su una macchina sandbox con una build locale di un browser per Linux. Secondo l’azienda, GLM-5.3 ha individuato vulnerabilità precedentemente sconosciute e le ha concatenate in un exploit capace di leggere file arbitrari quando veniva visitata una pagina web. Anthropic ha riferito di aver comunicato le vulnerabilità al manutentore del browser.