En una explicación que se hizo pública el 25 de septiembre, Omer Nevo, director de tecnología y cofundador de Irregular, relacionó incidentes en evaluaciones de ciberseguridad de modelos de OpenAI, Meta, Anthropic y Google con un problema común en el entorno de pruebas. OpenAI, Anthropic y Meta describieron evaluaciones en las que los modelos tuvieron acceso a internet que no estaba previsto.
Cómo una prueba simulada llegó a sistemas reales
Una evaluación de captura la bandera (CTF, por sus siglas en inglés) plantea retos de ciberseguridad en un entorno controlado. En el caso descrito por OpenAI, una configuración incorrecta permitió que el modelo saliera a internet, aunque la prueba debía estar aislada. Además, el nombre ficticio del objetivo coincidía con un dominio real. El modelo accedió a una web real y explotó una vulnerabilidad creyendo que formaba parte del ejercicio.
Las cuentas de las empresas describen evaluaciones distintas, con escenarios y modelos propios. El punto común que señaló Nevo fue el fallo del entorno de evaluación, no una única campaña coordinada.
Qué describieron OpenAI, Anthropic y Meta
Anthropic publicó su revisión el 30 de julio de 2026: informó de tres incidentes en seis ejecuciones y de accesos no autorizados a sistemas de producción de tres organizaciones. Para su revisión, examinó 141.006 ejecuciones en las que Claude podría haber tenido acceso a internet.
Meta explicó el 14 de agosto que su modelo Muse Spark 1.1, todavía en fase previa al lanzamiento, participó en una evaluación de Irregular a principios de julio. Según Meta, el modelo identificó y explotó una vulnerabilidad en una web real, accedió a información y modificó su base de datos.
Nevo incluyó también a Google en su relato sobre los incidentes. OpenAI, Anthropic y Meta publicaron sus propias descripciones de casos vinculados a las evaluaciones de Irregular.
Qué controles dijo Irregular que había cambiado
Nevo explicó que Irregular había reforzado los controles de acceso a internet, ampliado la supervisión y la revisión manual, y fortalecido las comprobaciones previas a cada evaluación. También dijo que la empresa había mejorado la documentación y los acuerdos con sus socios sobre la configuración de las pruebas.
En una actualización del 14 de agosto, Irregular afirmó que había corregido el problema antes de su primera comunicación pública y que su auditoría seguía en curso.
El incidente de Hugging Face fue independiente
OpenAI señaló el 4 de agosto que el incidente relacionado con Hugging Face era independiente de los casos vinculados a Irregular. Nevo también lo describió como ajeno a las evaluaciones de la empresa.