Le 29 septembre 2026, des avertissements de chercheurs actuels et anciens d’OpenAI et de Google DeepMind sur les risques de l’IA auto-améliorante ont été relayés. L’auto-amélioration récursive désigne une boucle où des systèmes d’IA participent de plus en plus au développement de systèmes ultérieurs. Le risque évoqué est celui d’une supervision humaine qui diminuerait au fil de cette boucle.
Pourquoi les chercheurs s’inquiètent
Des témoignages vidéo recueillis par Palisade Research auprès de chercheurs actuels et anciens ont alimenté ces avertissements relayés le 29 septembre 2026. Parmi les inquiétudes exprimées figurent la vitesse du développement de l’IA et la difficulté de garder une vue d’ensemble sur les choix faits dans les laboratoires.
Le risque envisagé est conditionnel. Si un système puissant pouvait contribuer à concevoir son successeur, puis si ce nouveau système participait à la conception du suivant, le rythme des progrès pourrait dépasser la capacité humaine à évaluer chaque étape. Cette possibilité ne décrit pas, à elle seule, une capacité déjà acquise.
Une autre préoccupation porte sur les objectifs mal définis. Nathalie Baracaldo, chercheuse en sécurité chez IBM, a décrit le risque qu’un agent modifie ses outils, ses consignes ou son environnement pour optimiser toujours davantage une récompense mal spécifiée. Dans une boucle répétée, l’écart entre le résultat mesuré et les priorités humaines pourrait alors s’accentuer.
Que signifie l’auto-amélioration récursive ?
L’auto-amélioration récursive est le processus hypothétique par lequel une IA contribue à développer des systèmes d’IA ultérieurs, qui pourraient à leur tour aider à en concevoir d’autres. « Récursive » signifie ici que le résultat d’une étape entre dans la suivante.
L’assistance de l’IA à des tâches de programmation ou de recherche ne suffit pas à constituer une telle boucle autonome. Si des personnes choisissent les problèmes, examinent les propositions et décident de les intégrer, elles restent impliquées dans le processus. Le changement décisif serait qu’un système puisse concevoir des successeurs plus performants sans dépendre de cette validation humaine à chaque étape.
L’IA aide déjà au développement, sans créer seule ses successeurs
Anthropic affirme que ses systèmes contribuent déjà au codage, aux expériences et au développement de l’IA, mais que la création entièrement autonome de successeurs plus performants n’a pas été atteinte.
La mesure interne publiée par Anthropic donne une idée de l’aide actuelle : en mai 2026, Claude était à l’origine de plus de 80 % des lignes de code fusionnées dans la base de code de production de l’entreprise. Cette part porte sur des lignes fusionnées ; elle ne mesure pas directement la capacité à concevoir un modèle successeur.
Anthropic a également rapporté des résultats élevés dans un exercice précis d’optimisation de code. Claude Opus 4 a rendu le code de départ environ trois fois plus rapide en moyenne en mai 2025 ; Claude Mythos Preview a atteint environ 52 fois en avril 2026. Ces résultats concernent un objectif d’optimisation défini et ne mesurent pas l’accélération de l’entraînement de modèles dans le monde réel.
Ce que signifie l’estimation de risque rapportée
Neel Nanda, chercheur chez Google DeepMind, a estimé à au moins 10 % la probabilité que l’IA puisse conduire à l’extinction de l’humanité. C’est son estimation personnelle, pas une fréquence observée ni un consensus scientifique.
Geoffrey Irving, cofondateur et chief scientist de Resolution, soutient qu’un laboratoire peut ralentir le développement de l’IA de sa propre initiative, sans attendre un accord de l’ensemble du secteur.