A avaliação do ARC-AGI-3 publicada pela ARC Prize em 3 de setembro de 2026 deu ao GPT-6 Astra 62,7% no Standard com esforço máximo e 99,9% no Provider Adapter com esforço alto. O ARC-AGI-3 mede como um modelo aprende e age em ambientes abstratos novos; os dois resultados vêm de configurações diferentes, e a ARC Prize não afirma que o Astra seja AGI, ou inteligência artificial geral.

A cobertura anterior do lançamento e das tarefas complexas do GPT-6 Astra abordou o contexto do modelo. Os resultados do ARC-AGI-3 ajudam a entender, com mais detalhe, o que esse teste avalia.

As pontuações do GPT-6 Astra no ARC-AGI-3

O ARC-AGI-3 propõe ambientes abstratos, novos e organizados em turnos. O modelo precisa explorar, formular um modelo do ambiente, definir objetivos, planejar e executar ações, aprendendo pela interação em vez de receber instruções explícitas sobre como resolver cada tarefa.

Na avaliação Semi-Private, a ARC Prize publicou estes resultados:

Condição de avaliaçãoPontuaçãoEsforço de raciocínioGestão do contexto
Standard harness62,7%MáximoInterface neutra em relação ao provedor
Provider Adapter98,6%MáximoPreserva estado opaco de raciocínio entre solicitações e usa compactação
Provider Adapter99,9%AltoPreserva estado opaco de raciocínio entre solicitações e usa compactação

Assim, 62,7% e 99,9% não são resultados obtidos sob as mesmas condições: mudam tanto o harness quanto o esforço de raciocínio. O resultado de 98,6% mostra a pontuação do Provider Adapter no esforço máximo; 99,9% corresponde ao esforço alto.

O que muda entre os dois harnesses

Um harness é a estrutura que conecta o modelo ao benchmark e define como a avaliação acontece. O Standard foi projetado para permitir comparações neutras em relação ao provedor. Já o Provider Adapter usa recursos de gestão de contexto do provedor: conserva entre solicitações um estado opaco de raciocínio e emprega compactação em conversas longas.

Essas diferenças ajudam a explicar por que as pontuações variam. O resultado depende não só do modelo, mas também das condições de execução e dos recursos disponíveis durante a avaliação.

O que a comparação com ações humanas mede

A ARC Prize comparou as ações do Astra com uma referência baseada na mediana de ações usadas por participantes humanos que concluíram cada nível. No Provider Adapter com esforço máximo, o Astra usou menos ações que essa mediana em 96,0% dos níveis e registrou, em média, 51,7% menos ações por nível.

Esses números descrevem eficiência em ações dentro do ARC-AGI-3. O teste inclui tarefas de exploração e planejamento em seus ambientes abstratos; a comparação não mede o desempenho do modelo em todas as atividades humanas.

Por que esses testes não comprovam AGI

A ARC Prize define seu objetivo de AGI como adquirir qualquer habilidade que uma pessoa consiga realizar com eficiência comparável. Mas os ambientes do ARC-AGI-3 são delimitados, determinísticos e fechados; segundo a organização, eles não reproduzem a complexidade do mundo real.

Por isso, uma pontuação alta indica desempenho nas tarefas e nas condições especificadas pelo benchmark. A ARC Prize afirma que os resultados representam progresso em direção à generalização, mas não declara que o GPT-6 Astra seja AGI.