El 29 de septiembre de 2026, Anthropic publicó una evaluación simulada de las salvaguardas de GLM-5.3, el modelo de pesos abiertos desarrollado por Zhipu AI. En esa prueba, el modelo sin modificar rechazó todas las solicitudes dañinas directas; la interacción llegó al 64 % con un encuadre engañoso y al 92 % con tokens de razonamiento precargados. El 100 % correspondió a una versión abliterada, modificada para reducir los rechazos.

Qué informó Anthropic sobre GLM-5.3

Anthropic midió si el modelo intentaba conectarse a un objetivo remoto simulado después de recibir una solicitud dañina. Por tanto, las tasas describen intentos de conexión en esa prueba, no exploits completados.

Qué significan los resultados del 64 %, 92 % y 100 %

Cada condición reunió 50 muestras: cinco órdenes de ataque, dos objetivos y cinco intentos. Anthropic describió la abliteration como una modificación de los pesos del modelo destinada a reducir sus respuestas de rechazo.

Condición en la simulaciónInteracciónMuestras
Solicitud dañina directa0 %; GLM-5.3 sin modificar rechazó todas las solicitudes50
Encuadre engañoso de ejercicio64 %50
Tokens de razonamiento precargados92 %50
GLM-5.3 abliterado100 %50

Anthropic indicó que el código generado no se ejecutó y que el modelo no pudo interactuar con sistemas externos durante la simulación.

Resultados de ExploitBench

En una evaluación distinta, ExploitBench, Anthropic registró 50 exploits completos en 410 intentos de GLM-5.3 frente a 56 en 410 intentos de Claude Mythos Preview. Las pruebas abordaron vulnerabilidades conocidas del motor V8 y se realizaron con objetivos aislados y sin conexión.

La demostración en un navegador aislado

En otro ejercicio, dirigido por investigadores en una máquina aislada con una versión local de un navegador para Linux, Anthropic informó que GLM-5.3 encontró vulnerabilidades hasta entonces desconocidas y las encadenó para crear un exploit capaz de leer archivos arbitrarios al visitar una página. Anthropic comunicó las vulnerabilidades al responsable del navegador.