Le retest publié le 14 septembre 2026 apporte un nouvel élément au débat sur l’AGI : GPT-5.6 Luna a donné des réponses différentes face à des problèmes très proches, tandis que GPT-5.6 Sol affiche des résultats ARC-AGI-3 qui changent fortement selon l’environnement d’évaluation. Ces tests décrivent une capacité impressionnante, mais encore sensible à la formulation des tâches et au protocole utilisé.
Un changement minimal dans l’énoncé, une réponse différente
Le retest de GPT-5.6 Luna portait notamment sur un schéma de Winograd, un exercice conçu pour vérifier si un modèle relie correctement un pronom à son antécédent dans une phrase ambiguë.
Dans un premier exemple, GPT-5.6 a correctement répondu que la valise marron était trop petite. Dans une version modifiée au minimum, le modèle a ensuite répondu : « La table était trop petite », alors que l’antécédent attendu était la voiture.
Cette observation concerne les exemples examinés dans ce retest. Elle ne fournit pas un taux général d’échec pour toute la famille GPT-5.6, mais elle met le doigt sur un problème concret : une réponse fluide peut changer lorsque la structure de la phrase change légèrement.
Une blague et un plateau de morpion ont aussi fait vaciller le raisonnement
Le même retest a soumis GPT-5.6 Luna à une blague de Will Rogers sur les moyennes d’intelligence entre l’Oklahoma et la Californie. Le modèle a produit des explications contradictoires, en traitant notamment la plaisanterie comme une contradiction mathématique au lieu d’en saisir la comparaison implicite entre des moyennes.
Le test du morpion a suivi une logique similaire. Après une rotation de 90 degrés du plateau, GPT-5.6 a présenté tour à tour cette transformation comme stratégiquement importante, puis comme un simple changement de repères sur un plateau classique de 3 × 3.
Le retest portait sur trois familles de problèmes : la résolution d’un pronom, l’interprétation d’une blague mathématique et le raisonnement spatial appliqué au morpion. Il s’agissait d’observations rapportées, et non d’un score standardisé comparable à celui d’un benchmark public.
Les résultats d’ARC-AGI-3 changent avec le protocole
ARC-AGI-3 place les agents face à des jeux 2D inconnus. Ils doivent en déduire les règles, apprendre à agir et progresser efficacement. Les résultats de GPT-5.6 Sol montrent pourquoi la condition de mesure compte autant.
| Évaluation | Condition | Résultat de GPT-5.6 Sol | Ce que le résultat mesure |
| ARC-AGI-3, ensemble public | Évaluation standard publiée | 13,33 % | La réussite sur les tâches publiques selon le protocole indiqué |
| ARC-AGI-3, ensemble semi-privé | Évaluation standard publiée | 7,78 % | La réussite sur une partie semi-privée du benchmark |
| ARC-AGI-3, ensemble public | Environnement d’OpenAI avec raisonnement conservé et compactage | 38,3 % | La réussite obtenue avec une configuration et un environnement différents |
OpenAI rapporte que le raisonnement conservé maintient des informations utiles entre les étapes d’une tâche et que le compactage remplace la troncature progressive du contexte dans les tâches longues. Dans son expérience, ces deux réglages ont fait passer le score de GPT-5.6 Sol de 13,3 % à 38,3 % sur l’ensemble public.
La différence ne décrit donc pas une progression unique mesurée dans des conditions identiques. Elle montre plutôt que le modèle, le réglage du raisonnement, la gestion du contexte et l’environnement d’exécution peuvent modifier sensiblement le résultat.
Ce qu’ARC-AGI-3 peut mesurer — et ce qu’il ne suffit pas à établir
Un score ARC-AGI-3 mesure la capacité d’un agent à comprendre et résoudre une famille déterminée de jeux inconnus dans des conditions données. Il ne mesure pas automatiquement la performance sur l’ensemble des tâches cognitives auxquelles un système général devrait faire face.
François Chollet souligne que les situations réelles impliquent des horizons d’apprentissage beaucoup plus longs, des modèles du monde plus complexes, des objectifs plus ambigus et des espaces d’exploration plus vastes que les jeux d’ARC-AGI-3. Le benchmark apporte donc un signal utile sur l’adaptation à des règles nouvelles, mais il ne constitue pas à lui seul un test complet de l’AGI.
La définition même de l’AGI reste discutée. Elle désigne généralement un système capable d’égaler ou de dépasser les aptitudes humaines dans presque toutes les tâches cognitives, mais aucun seuil universel ne permet de transformer automatiquement un score de benchmark en verdict.
GPT-6 Astra n’est pas GPT-5.6
GPT-6 Astra est un produit distinct et plus récent. Ses scores rapportés sur ARC-AGI-3 ne sont donc pas des résultats de GPT-5.6 et ne peuvent pas être ajoutés à ceux de GPT-5.6 Sol.
Cette distinction est importante, car comparer directement les deux modèles mélangerait à la fois des produits différents et des protocoles différents. Pour GPT-5.6, les éléments les plus parlants restent les mêmes : Luna a produit des réponses instables sur des formulations proches, tandis que Sol a obtenu des scores très différents selon l’environnement d’évaluation.
La vraie épreuve : transférer le raisonnement
Les chiffres d’ARC-AGI-3 indiquent où GPT-5.6 Sol réussit dans un cadre précis. Le retest de GPT-5.6 Luna pose une question complémentaire : le modèle conserve-t-il la même interprétation lorsque la tâche change légèrement, sans changer son idée centrale ?
C’est cette combinaison — réussite sur des tâches nouvelles et transfert fiable vers des variantes proches — qui permet de mieux cerner la portée réelle des tests de GPT-5.6.