GPT-6 Astra obtuvo un 62,7 % en ARC-AGI-3 con Standard harness y esfuerzo de razonamiento máximo. En Provider Adapter logró un 98,6 % con esfuerzo máximo y un 99,9 % con esfuerzo alto. Son resultados de distintas configuraciones; ARC Prize publicó la evaluación el 3 de septiembre de 2026 y afirma que no está diciendo que Astra sea AGI.
ARC-AGI-3 es un benchmark que evalúa cómo un modelo aprende y actúa en entornos abstractos, nuevos y por turnos. Para entender sus puntuaciones importa tanto el entorno de prueba como el modelo. NeoTeo ya repasó el lanzamiento de GPT-6 Astra y la cuestión de si demuestra AGI; aquí, la clave son las condiciones de ARC-AGI-3.
Las puntuaciones de GPT-6 Astra en ARC-AGI-3
ARC Prize publicó tres resultados de GPT-6 Astra en ARC-AGI-3 Semi-Private. La puntuación de 62,7 % corresponde a Standard harness con esfuerzo máximo. En Provider Adapter, Astra logró un 98,6 % con esfuerzo máximo y un 99,9 % con esfuerzo alto.
| Condición de evaluación | Puntuación | Esfuerzo de razonamiento | Gestión del contexto |
| Standard harness | 62,7 % | Máximo | Interfaz neutral para proveedores |
| Provider Adapter | 98,6 % | Máximo | Conserva el estado de razonamiento opaco entre solicitudes y emplea compactación |
| Provider Adapter | 99,9 % | Alto | Conserva el estado de razonamiento opaco entre solicitudes y emplea compactación |
La cifra del 99,9 % no corresponde al mismo conjunto de condiciones que la del 62,7 %: cambian tanto el arnés como el esfuerzo de razonamiento. Incluso dentro de Provider Adapter, las puntuaciones a esfuerzo máximo y alto son distintas: 98,6 % y 99,9 %, respectivamente.
Qué cambia entre los dos arneses
Un arnés de evaluación define cómo interactúa el modelo con una prueba. Standard harness ofrece una interfaz neutral para proveedores, pensada para facilitar comparaciones entre ellos. Provider Adapter aprovecha funciones propias de gestión del contexto: conserva el estado de razonamiento opaco entre solicitudes y utiliza compactación en conversaciones largas.
La compactación permite gestionar conversaciones extensas. En esta evaluación, por tanto, no solo cambió el arnés: también varió el esfuerzo de razonamiento entre los resultados de 62,7 % y 99,9 %. La puntuación de 98,6 % permite ver el resultado de Provider Adapter con esfuerzo máximo; la de 99,9 % corresponde a esfuerzo alto.
Qué mide la comparación con las acciones humanas
ARC-AGI-3 plantea entornos novedosos y abstractos en los que los participantes deben explorar, construir un modelo de la situación, fijar objetivos, planificar y ejecutar acciones. En lugar de recibir instrucciones explícitas, tienen que inferir qué se busca y aprender mediante la interacción.
Para medir la eficiencia en acciones, ARC Prize probó el benchmark con unas 500 personas del público general. En cada nivel, la referencia humana es la mediana de acciones de quienes lograron completarlo. Con Provider Adapter y esfuerzo máximo, GPT-6 Astra usó menos acciones que esa mediana en el 96,0 % de los niveles y, en promedio, un 51,7 % menos de acciones por nivel.
Esas cifras describen la cantidad de acciones en los niveles de ARC-AGI-3 bajo esa configuración. No son una medida general de la capacidad de Astra para realizar cualquier tarea humana.
Por qué estas pruebas no demuestran AGI
ARC Prize describe ARC-AGI-3 como un benchmark acotado, determinista y de entornos cerrados, que no representa la complejidad del mundo real. La organización afirma expresamente que no sostiene que GPT-6 Astra sea AGI y que alcanzar una puntuación alta en el benchmark no basta para demostrar inteligencia general.
La puntuación del 99,9 % refleja el resultado de Astra en ARC-AGI-3 Semi-Private con Provider Adapter y esfuerzo de razonamiento alto. La conclusión de ARC Prize se refiere al alcance de esa prueba: el resultado no constituye una afirmación de que Astra sea AGI.