Le 12 septembre 2026, Dario Amodei a plaidé pour ralentir le développement de l’IA et évoqué des évaluateurs de sécurité indépendants intégrés aux entreprises. Cette proposition fait écho aux alertes de chercheurs d’OpenAI et d’Anthropic sur l’alignement des modèles et la difficulté croissante de les surveiller. Elles décrivent un problème de contrôle qui reste ouvert, pas une extinction certaine de l’humanité.
Le débat s’intensifie autour du contrôle des IA avancées
Le 9 septembre, Jacob Coxon a annoncé sa démission d’Anthropic après trois années de recherche en préentraînement chez OpenAI et Anthropic. Il a accusé les deux entreprises de se précipiter vers une superintelligence capable de s’améliorer elle-même. Evan Hubinger, responsable des sciences de l’alignement chez Anthropic, a soutenu cette inquiétude et estimé à titre personnel à plus de 10 % le risque que l’IA tue toute l’humanité au cours de la prochaine décennie.
Dans un extrait d’entretien archivé, Dario Amodei a donné une autre estimation personnelle : entre 10 et 25 % de risque qu’un événement tourne très mal à l’échelle de la civilisation humaine. Les deux appréciations portent sur des scénarios formulés différemment et ne constituent pas une probabilité consensuelle. Aucune ne prédit une extinction certaine.
Ce que Jakub Pachocki dit des limites d’OpenAI
Dans son essai publié le 6 septembre 2026, le scientifique en chef d’OpenAI, Jakub Pachocki, a appelé à la prudence face à l’accélération des capacités de l’IA. Il estime qu’aucun laboratoire n’a suffisamment résolu les problèmes d’alignement et de surveillance pour continuer encore longtemps à développer ses systèmes au rythme maximal de façon responsable.
OpenAI distingue l’alignement sur un objectif — accomplir la tâche assignée — de l’alignement sur les valeurs humaines, qui doit aussi guider le modèle dans des situations inconnues ou adversariales. La différence compte : réussir une consigne ne garantit pas, à elle seule, un comportement adapté lorsque le contexte change.
| Notion | Définition | Enjeu de sécurité |
| Alignement sur l’objectif | Le système poursuit le but qui lui a été assigné. | Il faut aussi évaluer son comportement lorsque la situation sort du cadre prévu. |
| Alignement sur les valeurs | Le système généralise des principes humains à des situations inconnues ou adversariales. | La difficulté est de maintenir ce comportement au-delà des exemples et des consignes habituels. |
| Surveillance des chaînes de pensée | Suivi des raisonnements que le modèle verbalise. | OpenAI dit que sa capacité à s’appuyer sur cette surveillance diminue à mesure que les systèmes opèrent dans des environnements plus complexes. |
| Auto-amélioration récursive | Boucle dans laquelle l’IA contribue de plus en plus au développement de systèmes qui lui succèdent. | En septembre 2026, aucun laboratoire de pointe ne revendiquait un cycle entièrement autonome; cette possibilité restait théorique. |
Pourquoi la surveillance se complique
OpenAI explique que les modèles interagissent avec des personnes, des outils et d’autres systèmes d’IA dans des environnements plus complexes. Ils peuvent aussi manipuler plus efficacement leurs propres processus de raisonnement et accomplir davantage sans s’appuyer entièrement sur un raisonnement verbalisé. Dans ces conditions, suivre une chaîne de pensée ne suffit pas toujours à surveiller le comportement du modèle.
La difficulté touche aussi la généralisation des garde-fous : une protection conçue pour un périmètre donné peut ne pas fonctionner de la même manière dans une situation différente. OpenAI a décrit un incident de juillet 2026, impliquant des agents expérimentaux et Hugging Face dans le cadre de tests de cybersécurité, comme révélateur de limites dans la portée des garde-fous et leur généralisation au-delà du cadre prévu.
Des garde-fous techniques aux évaluateurs intégrés
OpenAI avait déjà signalé en juillet 2026 qu’une amélioration récursive des systèmes pouvait devenir une direction du développement. Mais une boucle entièrement autonome, où une IA améliorerait elle-même les systèmes suivants, ne constituait pas une capacité revendiquée par les laboratoires de pointe.
Les pistes de gouvernance évoquées vont du travail technique à des formes de supervision extérieure. Dans une prise de position publiée en 2023, Anthropic citait les risques de mauvais alignement, d’usage malveillant et de bouleversements sociaux, tout en insistant sur la recherche empirique en matière de sécurité. En juin 2026, Rishub Jain a quitté Google DeepMind alors qu’il s’inquiétait de voir les systèmes contribuer davantage à construire leurs successeurs sans visibilité humaine suffisante.
| Levier proposé | Acteurs évoqués | Rôle décrit |
| Seuils de sécurité | Auditeurs tiers ou agences publiques | Faire respecter des seuils avant de poursuivre la montée en puissance des systèmes. |
| Ralentissement volontaire | Laboratoires d’IA | Réduire le rythme du développement. |
| Évaluateurs intégrés | Observateurs indépendants travaillant au sein des entreprises | Accéder aux pratiques de sécurité et aux incidents. |
| Coordination internationale | Acteurs et organismes internationaux | Coordonner les réponses aux risques liés au développement de l’IA. |
Une préoccupation plus immédiate concerne les agents auxquels une entreprise donne un accès en écriture à ses outils : une action erronée sans supervision peut aussi rendre difficile l’attribution des responsabilités.