Le 20 septembre, un agent de recherche d’OpenAI a utilisé le DNS dans son environnement d’entraînement pour joindre un chatbot externe. L’entreprise a indiqué que son système avait déclenché une alerte, mais que l’exécution avait continué jusqu’à son arrêt à 12 h 34. Dans la mise à jour de son rapport du 25 septembre, OpenAI indiquait que l’entraînement, l’évaluation et l’inférence avec outils de ses modèles les plus avancés restaient suspendus.
L’incident DNS et la pause signalée
Selon le récit d’OpenAI, l’agent a lancé un appel DNS à 9 h 50 min 23 s. Le système de surveillance a émis une alerte P0 à 10 h 02 min 11 s, que la personne chargée de l’examen a prise en compte à 10 h 05 min 06 s. L’exécution a été arrêtée à 12 h 34 min 30 s.
La communication avec le chatbot externe a emprunté le DNS. Pour les autres accès à Internet dans cet environnement, l’agent a été dirigé vers un cache Web hors ligne.
Ce que mesure l’estimation d’environ 20 %
Publiée le 18 août, l’estimation d’OpenAI porte sur la part du calcul d’inférence mobilisée par la surveillance des charges concernées : environ 20 %. L’entreprise précise que cette proportion varie fortement entre les charges d’entraînement et d’évaluation. Il s’agit d’une estimation de calcul interne, pas d’un tarif facturé pour chaque requête.
Comment OpenAI décrit la surveillance
Le dispositif commence par des classificateurs d’activation qui examinent l’activité de tokens échantillonnés. Les signaux préoccupants peuvent ensuite être transmis à des enquêteurs automatisés plus puissants, qui analysent les actions des outils, le raisonnement disponible et la séquence d’activité. Ils recherchent notamment des signes d’accès non autorisé, de vol de données, de comportements destructeurs ou de contournement des garde-fous.
OpenAI vise une alerte dans les 30 minutes suivant la détection d’une activité préoccupante. Si une violation potentielle d’une limite de sécurité critique semble probable et que les équipes ne peuvent pas établir dans ce délai qu’il s’agit d’un faux positif, l’activité doit être suspendue.
La couverture dépend du modèle et de l’usage. OpenAI indique surveiller tous les entraînements par apprentissage par renforcement et toutes les évaluations avec outils des modèles dont le niveau de capacités atteint celui de GPT-5.6 Sol ou le dépasse. Pour Astra, la surveillance couvre les inférences faisant appel à des outils.