Relatos divulgados em 30 de setembro atribuíram a pessoas com acesso direto ao projeto dificuldades do Gemini 4 Argon em algumas tarefas de programação e no design de interfaces. O Google contestou a avaliação de que o modelo teria desempenho inferior em programação e citou seu uso e testes internos.

Outro funcionário do Google, também ouvido sob anonimato, afirmou haver amplo acordo interno de que o modelo estava na fronteira do setor. As avaliações sobre o desempenho prático, portanto, vieram acompanhadas de posições divergentes.

Gemini 4 Argon: relatos sobre o desempenho prático

O Google anunciou o Gemini 4 Argon em 30 de setembro de 2026 como um modelo voltado a tarefas longas de engenharia de software, trabalho corporativo e defesa cibernética. O anúncio e o plano de acesso foram detalhados na cobertura anterior do NeoTeo.

As dificuldades relatadas se referiam a algumas tarefas práticas de programação e ao design de interfaces. Em resposta à crítica sobre programação, o Google citou o uso do modelo dentro da empresa e seus testes internos.

O que avaliam os quatro benchmarks divulgados pelo Google

O Google divulgou resultados em quatro benchmarks, cada um voltado a uma área distinta:

  • DeepSWE v1.1 — 77,9%: tarefas de engenharia de software de longo prazo.
  • AutomationBench — 51,3%: execução de funções empresariais de ponta a ponta.
  • LVBench — 91,7%: compreensão de vídeos longos.
  • CWE-bench v1 — 68%: correção de vulnerabilidades de software.

Os quatro percentuais foram divulgados pelo Google. Eles cobrem áreas diferentes, da engenharia de software à compreensão de vídeo e à correção de vulnerabilidades.

Relatos de uso prático e uma comparação limitada de prompts

Comparação em vídeo mostra respostas a prompts e a posição do Argon no Agent Arena; a amostra é pequena e os resultados variam.

Uma comparação em vídeo reúne respostas lado a lado a alguns prompts, mostra resultados que variam entre as tentativas e menciona a 8ª posição do Argon no Agent Arena. A própria apresentação descreve o exercício como uma checagem rápida, baseada em uma amostra pequena.

Acesso anunciado e limite de saída

No anúncio de 30 de setembro, o Google disse que o acesso externo começava a ser liberado a defensores cibernéticos de confiança pelo programa Fairwind. A expansão planejada, após testes e ajustes nas salvaguardas, começaria por clientes pagos da API e assinantes do Google AI Ultra.

O limite anunciado pelo Google é de 1 milhão de tokens de saída, ante 64 mil no limite anterior. A medida se refere à quantidade de texto que o modelo pode gerar.