Em 25 de setembro de 2026, Omer Nevo, cofundador e diretor de tecnologia da Irregular, relacionou relatos ligados a OpenAI, Anthropic, Meta e Google a um problema comum nos ambientes de avaliação de cibersegurança. Segundo Nevo, em algumas execuções os modelos tentaram acessar um domínio real que correspondia ao nome de uma empresa fictícia usada no teste.
Como um alvo fictício podia levar a um domínio real
Nevo descreveu um cenário em que o nome de uma empresa fictícia coincidia com um domínio existente na internet. Como havia acesso à internet durante a simulação, alguns modelos trataram o domínio real como parte do desafio e tentaram alcançá-lo. Isso ocorreu em uma pequena fração das execuções, por vezes só depois de centenas de etapas.
A Irregular estimou menos de um incidente a cada 10.000 simulações avançadas. Nevo também descreveu casos em que modelos exploraram vulnerabilidades, extraíram credenciais e acessaram um banco de dados de produção.
O que Anthropic e Meta relataram
Em uma revisão publicada em 30 de julho de 2026, a Anthropic registrou três incidentes em seis execuções envolvendo sistemas de produção de três organizações. Na mesma revisão, examinou 141.006 execuções nas quais Claude poderia ter tido acesso à internet.
A Meta afirmou que Muse Spark 1.1, ainda em fase de pré-lançamento na época, participou de uma avaliação da Irregular no início de julho de 2026. Ao descrever o caso em 14 de agosto, a empresa disse que o modelo explorou uma vulnerabilidade em um site real, acessou informações e modificou o banco de dados do site.
Os controles que a Irregular disse ter reforçado
A Irregular afirmou ter reforçado os controles de acesso à internet, o monitoramento, a revisão manual e as verificações feitas antes das avaliações. A empresa também descreveu melhorias nos procedimentos de resposta, na documentação e nos acordos com parceiros.