O GPT-5.6 ainda não tem uma resposta definitiva para a pergunta sobre AGI — inteligência artificial geral. Os testes mais recentes mostram duas coisas ao mesmo tempo: o modelo consegue lidar com tarefas sofisticadas, mas seu desempenho pode mudar bastante quando o enunciado ou o sistema de avaliação muda.
Uma pequena mudança no enunciado alterou a resposta
Em um reteste publicado em 14 de setembro de 2026, o GPT-5.6 Luna acertou um problema do tipo Winograd, usado para verificar se um sistema entende a que elemento um pronome se refere. A resposta identificou que a mala marrom era pequena demais.
Quando o enunciado foi alterado apenas o suficiente para criar um caso paralelo, o modelo respondeu que a mesa era pequena demais — embora o antecedente correto fosse o carro. O resultado é uma observação concreta sobre transferência de raciocínio: acertar uma formulação não garantiu que o GPT-5.6 Luna aplicasse a mesma lógica à versão muito parecida.
Esse episódio não produz uma taxa geral de erro para toda a família GPT-5.6. Ele mostra, em um conjunto específico de exemplos, como uma mudança mínima pode afetar a resposta.
Um chiste e um tabuleiro também expuseram oscilações
O mesmo reteste avaliou a explicação de uma piada de Will Rogers sobre médias de inteligência em Oklahoma e na Califórnia. O GPT-5.6 Luna apresentou explicações inconsistentes, alternando entre tratar a piada como uma contradição matemática e reconhecer a comparação relativa pretendida.
No jogo da velha, a tarefa envolvia uma rotação de 90 graus no tabuleiro. O modelo alternou entre dizer que a rotação tinha importância estratégica e tratá-la como uma simples mudança de orientação de um tabuleiro comum de 3 × 3.
Os três casos apontam para uma diferença importante: produzir uma explicação fluente não é o mesmo que manter uma interpretação estável quando a tarefa muda ligeiramente.
As pontuações do ARC-AGI-3 dependem da configuração
O GPT-5.6 Sol também aparece com resultados diferentes no ARC-AGI-3, um benchmark que coloca agentes diante de jogos 2D desconhecidos. Para avançar, o sistema precisa deduzir as regras e descobrir como agir com eficiência.
| Avaliação | Condição | Resultado do GPT-5.6 Sol | O que a medida representa |
| ARC-AGI-3, conjunto público | Condição listada na página de resultados | 13,33% | Desempenho nas tarefas públicas sob essa avaliação |
| ARC-AGI-3, conjunto semiprivado | Condição listada na página de resultados | 7,78% | Desempenho em tarefas semiprivadas sob essa avaliação |
| ARC-AGI-3, conjunto público | Raciocínio retido e compactação no sistema da OpenAI | 38,3% | Resultado do experimento divulgado pela OpenAI |
A diferença não é um detalhe cosmético. A OpenAI atribuiu a pontuação de 38,3% ao uso de raciocínio retido e compactação. O primeiro recurso preserva o raciocínio entre etapas, enquanto a compactação reorganiza o contexto de tarefas longas em vez de depender apenas do corte progressivo do histórico.
Os números, portanto, não descrevem uma propriedade única e imutável do GPT-5.6 Sol. Eles dependem da variante, da divisão do benchmark, do limite de saída e do sistema usado para conduzir a avaliação.
Uma demonstração em matemática avançada ilustra a mesma separação entre capacidade especializada e confiabilidade geral: o GPT-5.6 Sol Pro é apresentado resolvendo problemas de análise de Riemann–Hilbert, integrais oscilatórias e representações por determinantes, mas a avaliação também registra críticas à verbosidade e à necessidade de orientação cuidadosa.
O que o ARC-AGI-3 mede — e o que fica fora dele
O ARC-AGI-3 é útil porque força o agente a lidar com ambientes desconhecidos, em vez de apenas repetir respostas aprendidas. Ainda assim, seus jogos têm horizontes de tempo e escopos muito menores do que os problemas do mundo real.
Inteligência geral envolve mais do que descobrir regras em um conjunto delimitado de tarefas. Também exige lidar com objetivos ambíguos, aprendizagem contínua, contextos extensos e espaços de exploração muito maiores. Um bom resultado em um benchmark pode ser relevante sem funcionar como um veredito universal sobre AGI.
É por isso que a pontuação de 13,33%, a de 7,78% e a de 38,3% precisam permanecer ligadas às suas condições. Misturá-las em um único número apagaria justamente a informação mais importante: a avaliação mede o modelo junto com o método usado para avaliá-lo.
GPT-6 Astra é outro produto
GPT-6 Astra e GPT-5.6 não são o mesmo modelo. Os resultados associados ao Astra pertencem a um produto posterior e servem, neste contexto, para mostrar como diferentes sistemas de avaliação podem produzir pontuações muito distintas — não para completar ou substituir os resultados do GPT-5.6.
Também não há um limite universalmente aceito que transforme uma determinada pontuação ou demonstração em AGI. A definição mais comum descreve sistemas capazes de igualar ou superar seres humanos em praticamente todas as tarefas cognitivas, mas a própria fronteira dessa definição continua em disputa.
O que os testes do GPT-5.6 sustentam é mais específico — e mais útil: o modelo apresenta desempenho avançado em tarefas especializadas, mas ainda precisa ser avaliado quanto à consistência da transferência de raciocínio e à sua dependência das condições de teste.