Em 29 de setembro de 2026, a Anthropic relatou que o GLM-5.3, modelo de pesos abertos desenvolvido pela Z.ai, produziu exploits funcionais em 50 de 410 tentativas no ExploitBench. No mesmo teste, Claude Mythos Preview conseguiu isso em 56 de 410 tentativas. A avaliação também descreveu um experimento com navegador em sandbox e simulações de mecanismos de segurança.
O que os resultados do ExploitBench medem
A Anthropic contou quantas tentativas resultaram em exploits funcionais para vulnerabilidades conhecidas do V8, mecanismo JavaScript do Google Chrome. A comparação abaixo usa os resultados relatados para os dois modelos no mesmo teste:
| Modelo | Tentativas com exploit funcional | Total de tentativas | Proporção de tentativas bem-sucedidas |
| GLM-5.3 | 50 | 410 | 12,2% |
| Claude Mythos Preview | 56 | 410 | 13,7% |
O resultado descreve uma tarefa específica de cibersegurança: desenvolver exploits para vulnerabilidades conhecidas. Não é uma medida do desempenho geral dos modelos em outras tarefas.
Um navegador Linux testado em sandbox
Em um experimento conduzido por pesquisador, a Anthropic relatou que o GLM-5.3 encontrou várias falhas até então desconhecidas em uma versão local e isolada de um navegador para Linux. O modelo encadeou essas falhas em uma página capaz de ler arquivos arbitrários da máquina de teste. O trabalho do modelo durou até um dia, com menos de uma hora de atenção humana, segundo a Anthropic, que informou ter comunicado as vulnerabilidades ao mantenedor.
O teste ocorreu em um ambiente isolado: a página não foi usada contra sistemas externos.
O que as simulações de segurança avaliaram
A Anthropic relatou que o GLM-5.3 tentou atender a pedidos nocivos em 64% dos casos quando eles vinham acompanhados de uma justificativa enganosa, em 92% quando tokens de raciocínio eram inseridos previamente no contexto e em 100% com uma versão do modelo modificada para remover recusas.
Esses percentuais medem tentativas de atender aos pedidos dentro de uma simulação. Ela usou uma ferramenta bash fictícia: nenhum código gerado pelo modelo foi executado e nenhum sistema externo foi contatado.
A avaliação separada da CAISI
Em uma avaliação publicada em 17 de setembro de 2026, o Centro de Padrões e Inovação em IA (CAISI), ligado ao Instituto Nacional de Padrões e Tecnologia dos EUA (NIST), considerou o GLM-5.3 o modelo de pesos abertos com maior capacidade cibernética entre os que havia avaliado até então. No índice agregado de capacidade cibernética da CAISI, o modelo ficou cerca de quatro meses atrás da vanguarda dos modelos dos EUA.
A pontuação da CAISI no ExploitBench foi de 61,1% (9,8 de 16). O centro avaliou 41 tarefas, com pontuação de até 16 pontos por tarefa, e considerou a melhor de três tentativas em cada uma. Essa métrica é diferente da contagem de tentativas bem-sucedidas da Anthropic.
A Z.ai anunciou o GLM-5.3 em 14 de agosto de 2026. A CAISI informou que a empresa liberou publicamente os pesos do modelo duas semanas depois; essa liberação caracteriza o GLM-5.3 como um modelo de pesos abertos.