El 29 de septiembre de 2026, Anthropic informó de que GLM-5.3, el modelo de pesos abiertos de Z.ai, produjo exploits funcionales en 50 de 410 intentos de ExploitBench. Claude Mythos Preview logró 56 de 410 en la misma prueba.
Qué midió Anthropic en ExploitBench
La prueba evaluó si los modelos conseguían desarrollar exploits de extremo a extremo a partir de vulnerabilidades conocidas del motor V8 de Google Chrome. Estos fueron los resultados que comunicó Anthropic:
| Modelo | Intentos con exploit funcional | Intentos totales | Proporción de intentos |
| GLM-5.3 | 50 | 410 | 12,2 % |
| Claude Mythos Preview | 56 | 410 | 13,7 % |
Las cifras corresponden a esa evaluación concreta de ciberseguridad. ExploitBench midió intentos de crear exploits; por sí solas, no describen el rendimiento general de los modelos en otras tareas.
Un navegador Linux en un entorno aislado
Anthropic describió una sesión de investigación de hasta un día, con menos de una hora de atención humana, en una versión local y aislada de un navegador Linux. Según su informe, GLM-5.3 encontró varias vulnerabilidades hasta entonces desconocidas del motor JavaScript y las encadenó en una página capaz de leer archivos del equipo de prueba. La página no se utilizó contra sistemas externos.
Qué midieron las simulaciones de salvaguardas
Anthropic informó de que GLM-5.3 rechazó solicitudes maliciosas directas al comienzo de las pruebas. Bajo una historia de cobertura engañosa, el modelo intentó participar en el 64 % de los casos; con tokens de razonamiento prefijados, en el 92 %; y con una versión sometida a abliteration, en el 100 %.
La simulación utilizó una herramienta bash ficticia: no ejecutó el código generado por el modelo ni se conectó a sistemas externos. Los porcentajes reflejan intentos de participación en esas condiciones simuladas.
La evaluación de CAISI utilizó otro indicador
El 17 de septiembre de 2026, el Center for AI Standards and Innovation (CAISI), centro de NIST, publicó una evaluación distinta. CAISI describió GLM-5.3 como el modelo de pesos abiertos con mayor capacidad cibernética de los que había evaluado hasta entonces y lo situó unos cuatro meses por detrás de la frontera estadounidense en su índice agregado.
Ese índice agregado ofrece una medida distinta de los intentos exitosos que contó Anthropic en ExploitBench: CAISI evaluó varios puntos de referencia y comparó sus resultados mediante un indicador conjunto.
Los pesos abiertos de GLM-5.3
Z.ai anunció GLM-5.3 el 14 de agosto de 2026. En su evaluación del 17 de septiembre, CAISI indicó que Z.ai había publicado los pesos del modelo dos semanas después del anuncio. En un modelo de pesos abiertos, los parámetros se publican para que puedan descargarse y modificarse.