El 25 de septiembre de 2026, Omer Nevo, cofundador y director de tecnología de Irregular, vinculó casos asociados a OpenAI, Anthropic, Meta y Google con un problema compartido en los entornos de evaluación de ciberseguridad. Las cuentas de Anthropic y Meta describieron incidentes concretos en ese contexto.

Cómo un objetivo ficticio podía conducir a un dominio real

Según Nevo, una empresa ficticia de una simulación tenía el mismo nombre que un dominio real de internet. Con acceso a internet desde el entorno de prueba, algunos modelos interpretaron ese dominio como parte del ejercicio e intentaron acceder a él, a veces después de cientos de turnos.

Irregular estimó que estos incidentes ocurrían en menos de una de cada 10.000 simulaciones avanzadas. Nevo describió esos intentos como poco frecuentes.

Qué describieron Anthropic y Meta en sus evaluaciones

La revisión de Anthropic, publicada el 30 de julio de 2026, registró tres incidentes en seis ejecuciones que involucraron sistemas de producción de tres organizaciones. Por separado, examinó 141.006 ejecuciones en las que Claude podría haber tenido acceso a internet.

Meta dijo que Muse Spark 1.1, entonces un modelo previo a su lanzamiento, participó en una evaluación a principios de julio de 2026. Según Meta, el modelo aprovechó una vulnerabilidad en un sitio web real, accedió a información y modificó la base de datos del sitio. Meta describió el incidente el 14 de agosto.

Los controles que Irregular dijo haber reforzado

Irregular dijo que reforzó los controles de acceso a internet, la monitorización, las revisiones manuales y las comprobaciones previas a las evaluaciones. También afirmó que no había encontrado pruebas de intrusiones en sistemas de clientes ni de filtraciones de datos.