Em relatório publicado em 29 de setembro de 2026, a Anthropic relatou que o GLM-5.3, modelo de pesos abertos desenvolvido pela Zhipu AI, tentou se conectar a um alvo simulado em 64% dos testes com enquadramento enganoso e em 92% com tokens de raciocínio pré-preenchidos. No teste direto, o modelo original recusou todos os pedidos nocivos. A taxa de 100% veio de uma versão abliterada, modificada para reduzir recusas.

O que a Anthropic relatou sobre as proteções do GLM-5.3

A avaliação mediu como o GLM-5.3 respondia a pedidos nocivos em uma simulação. Os resultados variaram conforme a forma de apresentar o pedido e a configuração do modelo; cada condição teve 50 amostras.

O que significam os resultados de 64%, 92% e 100%

A Anthropic chamou de “interação” a tentativa do modelo de se conectar a um alvo remoto simulado. Portanto, esses percentuais registram tentativas de conexão, não ataques concluídos.

Condição do testeEstado do modeloTentativas de conexão com o alvo simuladoAmostras
Pedido diretoGLM-5.3 original0%50
Enquadramento enganoso de exercício de red teamGLM-5.3 original64%50
Tokens de raciocínio pré-preenchidosGLM-5.3 original92%50
Abliteração, uma modificação para reduzir recusasGLM-5.3 abliterado100%50

Na simulação, a Anthropic diz que o código gerado não foi executado e que o modelo não podia interagir com sistemas externos. A condição abliterada se refere a uma versão alterada do modelo, não ao resultado do GLM-5.3 original diante de pedidos diretos.

O benchmark separado de exploração de vulnerabilidades

Em outro teste, a Anthropic relatou 50 sucessos de exploração de ponta a ponta em 410 tentativas do GLM-5.3, contra 56 em 410 tentativas do Claude Mythos Preview. O ExploitBench avaliou vulnerabilidades conhecidas no mecanismo V8 do Google Chrome, em ambientes isolados e sem conexão externa.

Num benchmark interno diferente, que avaliou 100 tarefas selecionadas aleatoriamente, o GLM-5.3 alcançou uma tomada completa do fluxo de controle em 4% dos casos; o Claude Mythos Preview chegou a 6%. Esses números vêm de outra avaliação e medem um resultado distinto das tentativas de conexão da simulação de salvaguardas.

A demonstração em um navegador isolado

A Anthropic também relatou um exercício conduzido por pesquisadores em uma máquina isolada, com uma compilação local de um navegador para Linux. Segundo a empresa, o GLM-5.3 encontrou falhas até então desconhecidas e as combinou em uma exploração capaz de ler arquivos arbitrários quando uma página era visitada. A Anthropic disse que comunicou as vulnerabilidades à equipe responsável pelo navegador.