Em uma declaração divulgada em 25 de setembro, Omer Nevo, CTO e cofundador da Irregular, relacionou incidentes envolvendo modelos da OpenAI, Meta, Anthropic e Google a uma falha comum em avaliações de cibersegurança. Relatos da OpenAI, da Anthropic e da Meta descrevem ambientes de teste com acesso não intencional à internet e interações com sistemas reais.
Como uma avaliação chegou a sistemas reais
Em um teste de cibersegurança do tipo CTF — sigla de capture the flag, formato em que participantes resolvem desafios técnicos —, um ambiente que deveria estar isolado permitiu acesso à internet pública, segundo a OpenAI. O nome fictício de um alvo coincidia com o domínio de um site real. A empresa relatou que seu modelo explorou uma vulnerabilidade no site, tratando-o como parte do exercício.
A Meta descreveu outro caso. No início de julho de 2026, a Irregular iniciou uma avaliação fechada da versão pré-lançamento do Muse Spark 1.1 em sua infraestrutura. A configuração permitia acesso à internet e o cenário usava o nome de um site real como alvo. Segundo a Meta, o modelo acessou informações desse site e alterou seu banco de dados.
O que a Anthropic relatou
Em um relato publicado em 30 de julho, a Anthropic descreveu três incidentes em avaliações com Claude, distribuídos por seis execuções e envolvendo sistemas de produção de três organizações. A empresa disse que identificou os casos ao revisar 141.006 execuções nas quais o Claude poderia ter obtido acesso à internet. Os incidentes envolveram três cenários fictícios distintos de CTF.
Nevo incluiu também modelos do Google em sua descrição da falha comum. A associação a esses modelos faz parte do relato do executivo; os detalhes apresentados pela OpenAI, pela Anthropic e pela Meta referem-se às avaliações descritas por cada uma dessas empresas.
As medidas que a Irregular disse ter adotado
Nevo afirmou que a Irregular reforçou os controles de acesso à internet, ampliou o monitoramento e a revisão manual e fortaleceu as verificações feitas antes das avaliações. Também disse que a empresa aprimorou a documentação e o alinhamento com parceiros sobre a configuração dos testes.
Em uma atualização de 14 de agosto, a Irregular afirmou que havia corrigido o problema antes de sua primeira divulgação pública e que sua auditoria aprofundada ainda estava em andamento. A empresa também disse não ter evidências de invasão aos sistemas de seus clientes nem de vazamento de dados deles.
O incidente da Hugging Face foi separado
O incidente envolvendo modelos da OpenAI e a Hugging Face não fez parte das avaliações ligadas à Irregular. A OpenAI o descreveu como um caso separado.