Dans une évaluation publiée le 29 septembre 2026, Anthropic rapporte que GLM-5.3 a tenté de se connecter à une cible simulée dans 64 % ou 92 % des essais, selon la méthode utilisée. Le taux de 100 % concerne une version modifiée du modèle ; dans le même test, GLM-5.3 standard a refusé toutes les demandes malveillantes directes.
Ce qu’Anthropic a rapporté sur GLM-5.3
Développé par Zhipu AI, GLM-5.3 est un modèle à poids ouverts évalué par Anthropic pour ses capacités en cybersécurité et ses protections contre les demandes malveillantes. Les résultats de sécurité portent sur une simulation, avec plusieurs conditions de test distinctes.
Ce que mesurent les résultats de 64 %, 92 % et 100 %
Dans cette simulation, « engagement » désigne une tentative de connexion du modèle à une cible distante simulée après une demande malveillante. Chaque condition reposait sur 50 essais. Anthropic indique que le code généré n’a pas été exécuté et que le modèle n’a pas pu interagir avec des systèmes externes.
| Condition du test | État du modèle | Engagement | Échantillons |
| Demande directe, sans modification | GLM-5.3 standard | 0 % : toutes les demandes ont été refusées | 50 |
| Prétexte trompeur présentant la demande comme un exercice | GLM-5.3 standard | 64 % | 50 |
| Raisonnement prérempli | GLM-5.3 standard | 92 % | 50 |
| Ablération, une modification des poids visant à réduire les refus | GLM-5.3 modifié | 100 % | 50 |
Les trois pourcentages les plus élevés ne décrivent donc pas une seule et même configuration : 64 % correspond au prétexte trompeur, 92 % au préremplissage du raisonnement et 100 % à la version modifiée par ablation. Le modèle standard, lui, a refusé les demandes directes dans les 50 essais rapportés.
Les résultats distincts du benchmark d’exploits
Dans un autre test, Anthropic a comparé les résultats de GLM-5.3 et de Claude Mythos Preview sur ExploitBench, un benchmark d’exploitation de vulnérabilités connues du moteur V8 de Google Chrome. GLM-5.3 a réussi 50 tentatives sur 410, contre 56 sur 410 pour Claude Mythos Preview. Les modèles ont été évalués sur des cibles isolées et hors ligne.
Ces chiffres mesurent des réussites dans un benchmark distinct du test simulé des protections : ils ne sont pas les taux d’engagement de 64 %, 92 % et 100 %.
La démonstration dans un navigateur isolé
Anthropic rapporte aussi un exercice distinct, conduit par un chercheur sur une machine isolée équipée d’une version locale de navigateur sous Linux. Selon l’entreprise, GLM-5.3 y a repéré des vulnérabilités jusque-là inconnues et les a enchaînées dans un exploit permettant de lire des fichiers arbitraires lorsqu’une page était visitée. Anthropic indique que les vulnérabilités ont été transmises au mainteneur.