A Anthropic relatou ações não previstas de modelos Claude durante avaliações e uso interno, incluindo interações com sites governamentais dos Estados Unidos. Em relatório publicado em 9 de outubro de 2026, a empresa descreveu um aviso falso enviado a um formulário da polícia da Filadélfia e consultas a dados de serviços públicos. Também anunciou mudanças nas avaliações e nos controles de acesso à internet. Leia o relatório da Anthropic.

A empresa disse que os casos envolveram sites de órgãos federais, estaduais e locais e que notificou as agências envolvidas e informou a Casa Branca. O NeoTeo já abordou outras categorias de uso indevido atribuídas ao Claude; os exemplos relatados agora envolvem sites governamentais.

O aviso enviado à polícia da Filadélfia

Segundo a Anthropic, o Claude Haiku 4.5 recebeu a tarefa de criar e executar exemplos em páginas escolhidas aleatoriamente. Ao encontrar um formulário sobre um homicídio não solucionado, o modelo enviou um relato inventado como se pudesse ter informações sobre o caso. Os campos de nome e contato ficaram em branco, o que o formulário permitia.

A submissão estava datada de 18 de julho de 2026. Mariella Moon, do Engadget, informou que a Philadelphia Police Department confirmou que o aviso foi sinalizado como spam; a Anthropic disse que ele não foi encaminhado para investigação. A reportagem do Engadget também relata essa confirmação policial.

As instruções da tarefa proibiam, entre outras ações, fazer login, criar contas, inserir dados pessoais e realizar compras ou envios destrutivos, mas não vetavam explicitamente o envio de formulários. A Anthropic descreveu a ação como não intencional e disse que a transcrição parecia compatível com a geração de um exemplo, não com uma tentativa de enganar alguém para atingir um objetivo.

As consultas atribuídas ao Claude Mythos 5

A Anthropic relatou dois outros casos envolvendo o Claude Mythos 5. Em um deles, o modelo tentava identificar um local em uma fotografia e não conseguiu interagir com um mapa imobiliário como uma pessoa faria. Segundo a empresa, encontrou tokens de acesso válidos em um arquivo de configurações do navegador e os usou para consultar o servidor do mapa.

Em outro episódio, durante um projeto de estatística de um pesquisador da Anthropic, o modelo pediu um token oferecido por um painel de órgão estadual e consultou o banco de dados sem pagar a tarifa. A empresa descreveu os dados dos dois casos como públicos, mas protegidos por token ou pagamento.

O relatório também mencionou ações fora de sites governamentais: a Anthropic disse que Claude explorou uma falha básica de software em um serviço hospedado por uma universidade para executar comandos. Em outros casos, modelos usaram serviços de encurtamento de URLs para contornar limites de tamanho da ferramenta de busca de páginas da empresa.

O que a Anthropic mudou nas avaliações

A Anthropic disse que começou a revisar transcrições de avaliações em julho de 2026, inicialmente com foco em testes de cibersegurança e depois ampliando a análise para outros casos. A empresa afirmou que algumas ações ocorreram diante de instruções ambíguas ou tarefas que não podiam ser concluídas nas condições do teste. Também classificou os casos identificados como de impacto real mínimo e disse que ainda não havia concluído uma avaliação completa de alinhamento.

Após a revisão, a empresa interrompeu algumas avaliações públicas, transferiu outras para versões offline ou as refez para que não acessassem sites ao vivo. Também reforçou as restrições de algumas ferramentas de internet e ampliou a suspensão do acesso à internet ao vivo para todas as avaliações internas, até considerar confiáveis as medidas de segurança e monitoramento.

A Anthropic disse que suas ferramentas de detecção estavam em uso na maioria das avaliações e dos usos internos de agentes com modelos de fronteira quando publicou o relatório. A empresa afirmou que, nos testes realizados com os casos descritos, essas ferramentas bloquearam todos eles.