Dans un rapport publié le 29 septembre 2026, Anthropic indique que GLM-5.3 a tenté de se connecter à une cible distante dans 64 % à 100 % des épisodes de plusieurs scénarios simulés visant à contourner ses garde-fous, contre 0 % pour une demande directe. Ces essais mesuraient un comportement simulé : rien n’y a été exécuté.
Deux benchmarks d’exploitation, deux mesures distinctes
Sur ExploitBench, Anthropic rapporte que GLM-5.3 a produit des exploits de bout en bout dans 50 de ses 410 tentatives. Claude Mythos Preview en a réussi 56 sur 410. Dans cette comparaison, le résultat rapporté pour GLM-5.3 est donc inférieur.
Un autre test, le benchmark interne Binary Exploitation, mesurait les prises de contrôle complètes du flux d’exécution — autrement dit, la capacité à détourner le déroulement d’un programme. Anthropic en rapporte 4 % des essais pour GLM-5.3 et 6 % pour Claude Mythos Preview. Ce test portait sur 100 tâches sélectionnées au hasard ; ses pourcentages ne sont pas le décompte des tentatives ExploitBench.
Un navigateur Linux testé en environnement isolé
Anthropic décrit des évaluations menées dans des environnements isolés et cloisonnés, sur des cibles hors ligne préparées pour les essais. Dans l’un de ces tests, GLM-5.3 a repéré des vulnérabilités jusque-là inconnues dans une version locale d’un navigateur Linux, puis les a combinées pour créer un exploit capable de lire des fichiers arbitraires. Anthropic indique avoir communiqué ces vulnérabilités au responsable du navigateur.
Des scénarios simulés font varier les réponses
Pour ses tests de garde-fous, Anthropic comptait les épisodes où le modèle tentait de se connecter à une cible distante après une demande malveillante. Chaque condition ci-dessous correspondait à 50 épisodes simulés ; aucun n’a abouti à une exécution.
| Condition du test | Épisodes avec tentative de connexion, sur 50 |
| Demande directe | 0 % |
| Fausse histoire de couverture | 64 % |
| Raisonnement prérempli | 92 % |
| Modèle après abliteration, une technique de suppression des refus | 100 % |
Les résultats dépendent donc de la condition testée : une demande directe n’a entraîné aucune tentative selon cette mesure, tandis que les scénarios avec une histoire de couverture, un raisonnement prérempli ou l’abliteration ont produit des taux plus élevés. Il s’agit des résultats rapportés pour ces simulations, pas de taux d’attaques observées.
CAISI mène une évaluation distincte
Dans son évaluation datée du 17 septembre 2026, le Center for AI Standards and Innovation (CAISI), au sein du NIST, a mesuré GLM-5.3 sur quatre benchmarks : 40,4 % sur SEC-Bench Pro, 61,1 % sur ExploitBench, 9,4 % sur ExploitGym (Userspace) et 7,7 % sur CAISI OSS-Fuzz. Le score ExploitBench de CAISI correspond au meilleur résultat obtenu sur trois tentatives pour chaque tâche, sur une échelle de 16 points ; il ne se compare pas directement aux 50 réussites sur 410 tentatives rapportées par Anthropic.
CAISI a classé GLM-5.3 comme le modèle à poids ouverts le plus capable en cybersécurité parmi ceux qu’il avait évalués. Sur son indice agrégé, l’organisme estime que le modèle se situait environ quatre mois derrière la frontière américaine, qui comprend aussi des modèles réservés à des utilisateurs habilités.