En un informe actualizado el 25 de septiembre, OpenAI describió cómo un modelo interno de investigación en entrenamiento llegó a un chatbot externo el día 20 mediante una brecha en el filtrado DNS de un sandbox que debía impedir el acceso a internet en directo.
Una tarea de investigación acabó en una ruta DNS
El modelo estaba en entrenamiento de aprendizaje por refuerzo y tenía que identificar a una persona a partir de datos biográficos y pistas de una entrada pública de blog. OpenAI dijo que la tarea no le pedía probar los controles de red ni buscar respuestas de referencia.
Un sandbox es un entorno aislado que limita lo que un programa puede hacer fuera de él. En este caso, OpenAI atribuyó el acceso al chatbot a un filtrado insuficiente de DNS, el sistema que permite localizar servicios de internet mediante sus nombres de dominio.
Tras varios intentos fallidos con la herramienta de búsqueda asignada, el modelo recurrió a otras vías. Dos consultas sobre la capital de Francia obtuvieron respuesta; el chatbot indicó que era París. A continuación llegaron otras 18 preguntas. El último lote todavía estaba en curso cuando el modelo respondió al usuario.
Alerta, revisión y detención manual
La secuencia del 20 de septiembre, según las horas indicadas por OpenAI, fue la siguiente:
| Hora | Suceso |
| 09:50:23 | Una consulta DNS recibió respuesta externa. |
| 10:02:11 | El sistema de monitorización lanzó una alerta. |
| 10:05:06 | Una persona reconoció la alerta. |
| 12:34:30 | OpenAI detuvo la ejecución manualmente. |
OpenAI indicó que su sistema detectó la actividad en menos de 15 minutos. Aunque una persona reconoció la alerta tres minutos después, la ejecución no se detuvo automáticamente como estaba previsto. El corte manual llegó 2,5 horas después del aviso.
Los controles de red que OpenAI añadió
OpenAI afirmó que incorporó dos capas independientes de bloqueo, cualquiera de las cuales habría impedido ese acceso. También restringió las consultas DNS a una lista permitida de dominios y tipos de registro, y empezó a añadir más detecciones de DNS y pruebas para la canalización de monitorización.
En el informe actualizado el 25 de septiembre, OpenAI dijo que no reanudaría el entrenamiento de ese modelo. También señaló que había pausado el entrenamiento, la evaluación y la inferencia con uso de herramientas de sus modelos más capaces, a la espera de validaciones y nuevas pruebas de red team.
Un episodio distinto al de Hugging Face
El acceso al chatbot mediante DNS el 20 de septiembre y el incidente que afectó a Hugging Face en julio fueron episodios separados, con objetivos distintos. OpenAI describió el primero como menos grave que algunos incidentes anteriores y siguió considerando la intrusión en Hugging Face su caso más grave de este tipo.