En una comunicación publicada este 30 de septiembre, OpenAI afirma que detectó y frenó una campaña coordinada para exponer el razonamiento protegido de sus modelos mediante interacciones manipuladas. La empresa sitúa la actividad entre el 1 y el 28 de julio y atribuye un núcleo a personas vinculadas a Moonshot AI, desarrolladora de Kimi.
Cronología y alcance de la actividad
OpenAI dijo que la actividad comenzó a bajo volumen el 1 de julio de 2026. Durante los picos del 24 y el 25 de julio, registró 16.000 solicitudes que seguían un patrón relacionado con la extracción, asociadas a más de 4.000 usuarios. La cifra cuenta intentos, no extracciones necesariamente logradas.
En una investigación posterior, OpenAI identificó actividad relacionada de patrones de solicitudes en un grupo de más de 15.000 usuarios. La empresa dijo que había interrumpido esa actividad el 28 de julio.
| Fecha | Actividad descrita por OpenAI |
| 1 de julio de 2026 | Comienzo de la actividad, inicialmente a bajo volumen. |
| 24–25 de julio de 2026 | Picos de 16.000 solicitudes con un patrón de extracción, asociadas a más de 4.000 usuarios; eran intentos. |
| 28 de julio de 2026 | OpenAI dijo que había interrumpido actividad relacionada en un grupo de más de 15.000 usuarios. |
Cómo describió OpenAI el intento
El razonamiento protegido es el proceso interno que un modelo sigue al trabajar en una tarea; puede contener información que no aparece en la respuesta final. OpenAI describió un método que manipulaba las interacciones con sus modelos: se copiaba razonamiento cifrado de una conversación y se pedía a un modelo en otra conversación que lo descifrara y transcribiera.
OpenAI sostuvo que la actividad no rompió el cifrado, no comprometió una base de datos ni accedió directamente a conversaciones almacenadas. Según la empresa, la vía descrita consistía en provocar que el modelo expusiera razonamiento a través de sus respuestas.
La destilación de modelos también estuvo en el centro de acusaciones estadounidenses anteriores sobre empresas chinas, un episodio distinto de la actividad que OpenAI sitúa en julio.
Respuesta y atribución de OpenAI
OpenAI dijo que bloqueó o restringió cuentas fraudulentas, reforzó los controles de registro e infraestructura, amplió la supervisión y añadió protecciones para el razonamiento oculto. También afirmó que compartió información sobre este tipo de ataque con el Frontier Model Forum y con socios gubernamentales.
La atribución de OpenAI se limita a un núcleo de actividad: la empresa lo vinculó a personas asociadas con Moonshot AI. También dijo que no estaba claro si todos los operadores observados procedían de un mismo actor.