Em publicação de 29 de setembro de 2026, a Anthropic relatou testes de exploração e salvaguardas do GLM-5.3. Em uma simulação de pedidos nocivos, o modelo tentou se conectar a um alvo remoto em até 100% dos episódios, dependendo da condição; em testes de exploração, completou exploits de ponta a ponta em 50 de 410 tentativas.
O que os benchmarks de exploração mediram
No ExploitBench, a Anthropic relatou que o GLM-5.3 completou exploits de ponta a ponta em 50 das 410 tentativas. O Claude Mythos Preview completou 56 das mesmas 410 tentativas. Em outra avaliação, chamada Binary Exploitation, o GLM-5.3 alcançou sequestro completo do fluxo de controle — isto é, controle sobre a execução do programa — em 4% das tentativas; o Claude Mythos Preview chegou a 6%. Esse segundo teste usou 100 tarefas escolhidas aleatoriamente.
Os resultados se referem a medidas diferentes: um conta tentativas de desenvolver exploits completos; o outro, casos de controle do fluxo de execução. Nos dois resultados comparáveis, o Claude Mythos Preview teve a taxa maior.
Um teste de navegador em ambiente isolado
A Anthropic também relatou que o GLM-5.3 encontrou vulnerabilidades até então desconhecidas em uma compilação local de navegador para Linux e as encadeou em um exploit capaz de ler arquivos arbitrários. A empresa disse ter comunicado essas vulnerabilidades ao mantenedor do navegador.
A Anthropic afirmou que as avaliações foram feitas em ambientes isolados e protegidos, com alvos offline preparados para os testes. O teste do navegador usou uma compilação local para Linux.
Como o GLM-5.3 respondeu às simulações de salvaguardas
A Anthropic mediu o engajamento como a proporção de episódios simulados em que o modelo tentou se conectar a um alvo remoto. Foram 50 episódios por condição; a execução ocorreu em simulação, sem ações no alvo.
| Condição simulada | Engajamento do GLM-5.3 (50 episódios) |
| Pedido direto | 0% |
| História de cobertura enganosa | 64% |
| Raciocínio pré-preenchido | 92% |
| Após abliteration, técnica de edição para reduzir recusas | 100% |
A taxa variou conforme o pedido e a configuração do modelo. Os percentuais medem tentativas de conexão dentro dessas simulações, não invasões bem-sucedidas.
A avaliação separada do NIST/CAISI
Em avaliação datada de 17 de setembro de 2026, o Centro de Padrões e Inovação em IA (CAISI), do NIST, chamou o GLM-5.3 de modelo de pesos abertos com maior capacidade cibernética entre os que havia avaliado. O CAISI estimou que a capacidade agregada do modelo estava cerca de quatro meses atrás da fronteira dos EUA; essa fronteira inclui modelos disponíveis apenas a usuários aprovados.
O CAISI relatou resultados de 40,4% no SEC-Bench Pro, 61,1% no ExploitBench, 9,4% no ExploitGym (Userspace) e 7,7% no CAISI OSS-Fuzz. No ExploitBench, o valor corresponde à pontuação por tarefa, calculada com a melhor de três tentativas. É uma métrica diferente das 50 conclusões em 410 tentativas relatadas pela Anthropic.