ARC-AGI-3 est un benchmark où un modèle doit apprendre à agir dans des environnements abstraits et interactifs. Pour GPT-6 Astra, ARC Prize a rapporté trois scores sur la version Semi-Private : 62,7 % avec Standard harness à effort de raisonnement maximal, 98,6 % avec Provider Adapter à effort maximal et 99,9 % avec Provider Adapter à effort élevé. Ces résultats dépendent donc à la fois du harnais et du réglage de raisonnement.
Un score élevé sur ces tâches ne suffit pas à conclure qu’un modèle possède une intelligence générale. ARC Prize a publié son évaluation d’Astra le 3 septembre 2026 et a précisé ne pas prétendre que le modèle est une AGI.
Les scores de GPT-6 Astra sur ARC-AGI-3
ARC-AGI-3 évalue la capacité d’un agent à explorer un environnement inédit, à en déduire les règles et les objectifs, puis à planifier et exécuter des actions. Les consignes ne donnent pas directement la marche à suivre : le modèle doit apprendre en interagissant avec les niveaux.
Les trois résultats publiés par ARC Prize pour la version Semi-Private se répartissent ainsi :
| Condition d’évaluation | Score | Effort de raisonnement | Gestion du contexte |
| Standard harness | 62,7 % | Maximal | Interface neutre vis-à-vis des fournisseurs |
| Provider Adapter | 98,6 % | Maximal | Conservation de l’état de raisonnement opaque entre les requêtes et compaction |
| Provider Adapter | 99,9 % | Élevé | Conservation de l’état de raisonnement opaque entre les requêtes et compaction |
Les scores de 62,7 % et 99,9 % ne proviennent pas des mêmes conditions : le premier correspond à Standard harness à effort maximal, le second à Provider Adapter à effort élevé. À réglage maximal, le résultat associé à Provider Adapter est de 98,6 %. La comparaison entre les deux harnais n’isole donc pas une seule variable.
Ce qui distingue les deux harnais
Standard harness est une interface neutre vis-à-vis des fournisseurs, conçue pour faciliter les comparaisons entre modèles. Provider Adapter, lui, utilise des fonctions de gestion du contexte propres au fournisseur. ARC Prize indique qu’il conserve l’état de raisonnement opaque entre les requêtes et recourt à la compaction, une méthode qui aide à gérer les conversations longues.
Ces différences comptent parce qu’un modèle peut disposer d’un contexte de travail différent selon le harnais. Les deux configurations répondent à des questions distinctes : Standard vise une comparaison neutre entre fournisseurs, tandis que Provider Adapter inclut ces fonctions de gestion du contexte.
NeoTeo a déjà présenté le lancement de GPT-6 Astra et la question de l’AGI dans son précédent article sur le modèle. Cette explication porte sur ce que les conditions d’ARC-AGI-3 changent à l’interprétation des scores.
Ce que mesure la comparaison avec les actions humaines
Pour établir son repère humain, ARC Prize indique avoir testé environ 500 personnes du grand public. Pour chaque niveau, la référence est la médiane du nombre d’actions effectuées par les participants qui l’ont terminé.
À effort maximal avec Provider Adapter, GPT-6 Astra a utilisé moins d’actions que cette médiane sur 96,0 % des niveaux et 51,7 % d’actions en moins par niveau en moyenne. Ces chiffres décrivent l’efficacité en actions dans les niveaux d’ARC-AGI-3 ; ils ne mesurent pas une compétence générale dans l’ensemble des tâches humaines.
Pourquoi ces tests ne démontrent pas l’AGI
ARC Prize décrit ARC-AGI-3 comme un benchmark aux environnements bornés, déterministes et fermés. Il évalue l’apprentissage et la prise de décision dans une famille de tâches précises, mais ne représente pas la complexité du monde réel. La réussite à ces épreuves ne suffit donc pas à établir une intelligence générale, et ARC Prize dit explicitement ne pas prétendre que GPT-6 Astra est une AGI.
ARC Prize détaille les résultats et les conditions de l’évaluation d’Astra.