Em publicação de 29 de setembro de 2026, a Anthropic relatou testes de exploração e salvaguardas do GLM-5.3. Em uma simulação de pedidos nocivos, o modelo tentou se conectar a um alvo remoto em até 100% dos episódios, dependendo da condição; em testes de exploração, completou exploits de ponta a ponta em 50 de 410 tentativas.

O que os benchmarks de exploração mediram

No ExploitBench, a Anthropic relatou que o GLM-5.3 completou exploits de ponta a ponta em 50 das 410 tentativas. O Claude Mythos Preview completou 56 das mesmas 410 tentativas. Em outra avaliação, chamada Binary Exploitation, o GLM-5.3 alcançou sequestro completo do fluxo de controle — isto é, controle sobre a execução do programa — em 4% das tentativas; o Claude Mythos Preview chegou a 6%. Esse segundo teste usou 100 tarefas escolhidas aleatoriamente.

Os resultados se referem a medidas diferentes: um conta tentativas de desenvolver exploits completos; o outro, casos de controle do fluxo de execução. Nos dois resultados comparáveis, o Claude Mythos Preview teve a taxa maior.

Um teste de navegador em ambiente isolado

A Anthropic também relatou que o GLM-5.3 encontrou vulnerabilidades até então desconhecidas em uma compilação local de navegador para Linux e as encadeou em um exploit capaz de ler arquivos arbitrários. A empresa disse ter comunicado essas vulnerabilidades ao mantenedor do navegador.

A Anthropic afirmou que as avaliações foram feitas em ambientes isolados e protegidos, com alvos offline preparados para os testes. O teste do navegador usou uma compilação local para Linux.

Como o GLM-5.3 respondeu às simulações de salvaguardas

A Anthropic mediu o engajamento como a proporção de episódios simulados em que o modelo tentou se conectar a um alvo remoto. Foram 50 episódios por condição; a execução ocorreu em simulação, sem ações no alvo.

Condição simuladaEngajamento do GLM-5.3 (50 episódios)
Pedido direto0%
História de cobertura enganosa64%
Raciocínio pré-preenchido92%
Após abliteration, técnica de edição para reduzir recusas100%

A taxa variou conforme o pedido e a configuração do modelo. Os percentuais medem tentativas de conexão dentro dessas simulações, não invasões bem-sucedidas.

A avaliação separada do NIST/CAISI

Em avaliação datada de 17 de setembro de 2026, o Centro de Padrões e Inovação em IA (CAISI), do NIST, chamou o GLM-5.3 de modelo de pesos abertos com maior capacidade cibernética entre os que havia avaliado. O CAISI estimou que a capacidade agregada do modelo estava cerca de quatro meses atrás da fronteira dos EUA; essa fronteira inclui modelos disponíveis apenas a usuários aprovados.

O CAISI relatou resultados de 40,4% no SEC-Bench Pro, 61,1% no ExploitBench, 9,4% no ExploitGym (Userspace) e 7,7% no CAISI OSS-Fuzz. No ExploitBench, o valor corresponde à pontuação por tarefa, calculada com a melhor de três tentativas. É uma métrica diferente das 50 conclusões em 410 tentativas relatadas pela Anthropic.