Le 12 septembre 2026, Dario Amodei a plaidé pour ralentir le développement de l’IA et évoqué des évaluateurs de sécurité indépendants intégrés aux entreprises. Cette proposition fait écho aux alertes de chercheurs d’OpenAI et d’Anthropic sur l’alignement des modèles et la difficulté croissante de les surveiller. Elles décrivent un problème de contrôle qui reste ouvert, pas une extinction certaine de l’humanité.

Le débat s’intensifie autour du contrôle des IA avancées

Le segment montre le message de démission de Jacob Coxon, la réponse d’Evan Hubinger et un extrait de l’estimation personnelle de Dario Amodei.

Le 9 septembre, Jacob Coxon a annoncé sa démission d’Anthropic après trois années de recherche en préentraînement chez OpenAI et Anthropic. Il a accusé les deux entreprises de se précipiter vers une superintelligence capable de s’améliorer elle-même. Evan Hubinger, responsable des sciences de l’alignement chez Anthropic, a soutenu cette inquiétude et estimé à titre personnel à plus de 10 % le risque que l’IA tue toute l’humanité au cours de la prochaine décennie.

Dans un extrait d’entretien archivé, Dario Amodei a donné une autre estimation personnelle : entre 10 et 25 % de risque qu’un événement tourne très mal à l’échelle de la civilisation humaine. Les deux appréciations portent sur des scénarios formulés différemment et ne constituent pas une probabilité consensuelle. Aucune ne prédit une extinction certaine.

Ce que Jakub Pachocki dit des limites d’OpenAI

Dans son essai publié le 6 septembre 2026, le scientifique en chef d’OpenAI, Jakub Pachocki, a appelé à la prudence face à l’accélération des capacités de l’IA. Il estime qu’aucun laboratoire n’a suffisamment résolu les problèmes d’alignement et de surveillance pour continuer encore longtemps à développer ses systèmes au rythme maximal de façon responsable.

OpenAI distingue l’alignement sur un objectif — accomplir la tâche assignée — de l’alignement sur les valeurs humaines, qui doit aussi guider le modèle dans des situations inconnues ou adversariales. La différence compte : réussir une consigne ne garantit pas, à elle seule, un comportement adapté lorsque le contexte change.

NotionDéfinitionEnjeu de sécurité
Alignement sur l’objectifLe système poursuit le but qui lui a été assigné.Il faut aussi évaluer son comportement lorsque la situation sort du cadre prévu.
Alignement sur les valeursLe système généralise des principes humains à des situations inconnues ou adversariales.La difficulté est de maintenir ce comportement au-delà des exemples et des consignes habituels.
Surveillance des chaînes de penséeSuivi des raisonnements que le modèle verbalise.OpenAI dit que sa capacité à s’appuyer sur cette surveillance diminue à mesure que les systèmes opèrent dans des environnements plus complexes.
Auto-amélioration récursiveBoucle dans laquelle l’IA contribue de plus en plus au développement de systèmes qui lui succèdent.En septembre 2026, aucun laboratoire de pointe ne revendiquait un cycle entièrement autonome; cette possibilité restait théorique.

Pourquoi la surveillance se complique

OpenAI explique que les modèles interagissent avec des personnes, des outils et d’autres systèmes d’IA dans des environnements plus complexes. Ils peuvent aussi manipuler plus efficacement leurs propres processus de raisonnement et accomplir davantage sans s’appuyer entièrement sur un raisonnement verbalisé. Dans ces conditions, suivre une chaîne de pensée ne suffit pas toujours à surveiller le comportement du modèle.

La difficulté touche aussi la généralisation des garde-fous : une protection conçue pour un périmètre donné peut ne pas fonctionner de la même manière dans une situation différente. OpenAI a décrit un incident de juillet 2026, impliquant des agents expérimentaux et Hugging Face dans le cadre de tests de cybersécurité, comme révélateur de limites dans la portée des garde-fous et leur généralisation au-delà du cadre prévu.

Des garde-fous techniques aux évaluateurs intégrés

Dans cet entretien, Dario Amodei explique l’idée d’évaluateurs indépendants intégrés aux entreprises; Jacob Coxon revient sur sa démission et ses inquiétudes.

OpenAI avait déjà signalé en juillet 2026 qu’une amélioration récursive des systèmes pouvait devenir une direction du développement. Mais une boucle entièrement autonome, où une IA améliorerait elle-même les systèmes suivants, ne constituait pas une capacité revendiquée par les laboratoires de pointe.

Les pistes de gouvernance évoquées vont du travail technique à des formes de supervision extérieure. Dans une prise de position publiée en 2023, Anthropic citait les risques de mauvais alignement, d’usage malveillant et de bouleversements sociaux, tout en insistant sur la recherche empirique en matière de sécurité. En juin 2026, Rishub Jain a quitté Google DeepMind alors qu’il s’inquiétait de voir les systèmes contribuer davantage à construire leurs successeurs sans visibilité humaine suffisante.

Levier proposéActeurs évoquésRôle décrit
Seuils de sécuritéAuditeurs tiers ou agences publiquesFaire respecter des seuils avant de poursuivre la montée en puissance des systèmes.
Ralentissement volontaireLaboratoires d’IARéduire le rythme du développement.
Évaluateurs intégrésObservateurs indépendants travaillant au sein des entreprisesAccéder aux pratiques de sécurité et aux incidents.
Coordination internationaleActeurs et organismes internationauxCoordonner les réponses aux risques liés au développement de l’IA.

Une préoccupation plus immédiate concerne les agents auxquels une entreprise donne un accès en écriture à ses outils : une action erronée sans supervision peut aussi rendre difficile l’attribution des responsabilités.