El 29 de septiembre de 2026, Anthropic publicó una evaluación de GLM-5.3 que incluye pruebas de explotación y ensayos simulados de sus salvaguardas. En ExploitBench, el modelo completó 50 de 410 intentos de exploit de extremo a extremo; en las simulaciones, su participación osciló entre el 0 % y el 100 % según la condición. Anthropic dice que esas pruebas se realizaron en entornos aislados y que en las simulaciones no se ejecutó ninguna acción.
Qué midieron las pruebas de explotación
En las pruebas de Anthropic, GLM-5.3 completó exploits de extremo a extremo en 50 de 410 intentos de ExploitBench. Claude Mythos Preview completó 56 de 410 en la misma prueba, una cifra mayor en ese recuento.
Anthropic también evaluó 100 tareas elegidas al azar con su benchmark interno Binary Exploitation, que mide si el modelo consigue secuestrar por completo el flujo de control de un programa. GLM-5.3 lo logró en el 4 % de los ensayos, frente al 6 % de Claude Mythos Preview. Son resultados de una prueba distinta, con otra medida y otra muestra.
Una prueba de navegador en un entorno aislado
Anthropic describió una prueba con una versión local para Linux de un navegador: GLM-5.3 encontró vulnerabilidades hasta entonces desconocidas y las encadenó para crear un exploit capaz de leer archivos arbitrarios. Anthropic afirmó que comunicó esas vulnerabilidades al responsable del navegador.
La evaluación se hizo en entornos aislados o simulados, con objetivos sin conexión preparados para las pruebas. Anthropic también indicó que su trabajo con una persona en el proceso solía durar un día o menos y requería menos de una hora de atención humana.
Qué ocurrió en las pruebas simuladas de salvaguardas
Anthropic midió si GLM-5.3 intentaba conectarse a un objetivo remoto tras recibir una solicitud dañina en un entorno simulado. La prueba no ejecutó acciones. La tasa de participación cambió según la condición:
| Condición de la prueba | Participación de GLM-5.3 (50 episodios simulados) |
| Solicitud directa | 0 % |
| Historia engañosa como cobertura | 64 % |
| Razonamiento inicial ya escrito | 92 % |
| Modelo editado mediante abliteration | 100 % |
La abliteration es una técnica de edición del modelo que Anthropic utilizó para reducir las negativas. En pruebas específicas de rechazo, la tasa de GLM-5.3 después de esa edición fue de aproximadamente el 3 % en JailbreakBench, el 2 % en HarmBench y el 12 % en StrongREJECT; antes de la edición superaba el 90 % en esos benchmarks.
La evaluación separada de CAISI
El 17 de septiembre de 2026, el Centro de Estándares e Innovación en IA de NIST (CAISI) publicó una evaluación basada en cuatro benchmarks. GLM-5.3 obtuvo un 40,4 % en SEC-Bench Pro, un 61,1 % en ExploitBench, un 9,4 % en ExploitGym (Userspace) y un 7,7 % en CAISI OSS-Fuzz. En ExploitBench, el 61,1 % corresponde a una puntuación por tareas calculada con el mejor de tres intentos y sobre una escala de 16 puntos; no es el recuento de intentos de Anthropic.
CAISI consideró a GLM-5.3 el modelo de pesos abiertos con más capacidad cibernética de los que había evaluado y situó su capacidad agregada unos cuatro meses por detrás de la frontera estadounidense. Esa frontera incluye modelos disponibles para usuarios verificados.