Uma comparação de benchmarks divulgada em 2 de outubro colocou o Gemini 4 Argon e o GPT-6 Astra em 53 pontos no Intelligence Index. Claude Opus 5.5 marcou 58. O empate se limita a esse índice: em avaliações de factualidade, automação e programação, os resultados mudam conforme a tarefa.
O NeoTeo já abordou a resposta do Google às críticas sobre a programação do Gemini 4 Argon. Os resultados comparativos acrescentam outra dimensão à discussão sobre o modelo.
A comparação no Intelligence Index
O Intelligence Index reúne resultados em uma pontuação composta. Na avaliação divulgada, o Gemini 4 Argon marcou 53 pontos com o raciocínio configurado em High; o GPT-6 Astra também fez 53, com a configuração Max. Claude Opus 5.5 chegou a 58, enquanto GPT-6.1 Sol ficou em 52.
| Modelo | Pontuação no Intelligence Index |
| Gemini 4 Argon (High) | 53 |
| GPT-6 Astra (Max) | 53 |
| GPT-6.1 Sol (Max) | 52 |
| Claude Opus 5.5 | 58 |
A pontuação igual entre Argon e Astra não se repete em todas as tarefas. Além disso, as configurações informadas para os dois modelos foram diferentes: High para Argon e Max para Astra.
Resultados diferentes conforme a tarefa
No AA-Omniscience, o Gemini 4 Argon registrou 15% na medida de taxa de alucinação e 50% de acurácia. A primeira métrica avalia respostas incorretas ou incompletas dadas em vez de uma abstenção apropriada nos casos do teste; a acurácia é uma medida separada.
Em tarefas de automação, Argon marcou 78% no AutomationBench-AA, ante 71% do Claude Sonnet 5.5. Já no Terminal Bench 4, voltado a tarefas de terminal e programação, Argon fez 57%: Claude Sonnet 5.5 marcou 64%, Claude Opus 5.5 fez 60% e GPT-6 Astra chegou a 59%.
O quadro, portanto, varia de uma avaliação para outra: Argon superou Sonnet 5.5 no AutomationBench-AA, mas ficou abaixo dos modelos comparados no Terminal Bench 4. Um resultado composto não resume sozinho esse desempenho por tarefa.
A distribuição anunciada pelo Google
Em 30 de setembro de 2026, o Google anunciou uma liberação inicial do Gemini 4 Argon para um grupo de defensores cibernéticos de confiança, pelo programa Fairwind. A empresa indicou que clientes pagos da API e assinantes do Google AI Ultra seriam os primeiros grupos na etapa mais ampla de acesso.