Relatos divulgados em 30 de setembro atribuíram a pessoas com acesso direto ao projeto dificuldades do Gemini 4 Argon em algumas tarefas de programação e no design de interfaces. O Google contestou a avaliação de que o modelo teria desempenho inferior em programação e citou seu uso e testes internos.
Outro funcionário do Google, também ouvido sob anonimato, afirmou haver amplo acordo interno de que o modelo estava na fronteira do setor. As avaliações sobre o desempenho prático, portanto, vieram acompanhadas de posições divergentes.
Gemini 4 Argon: relatos sobre o desempenho prático
O Google anunciou o Gemini 4 Argon em 30 de setembro de 2026 como um modelo voltado a tarefas longas de engenharia de software, trabalho corporativo e defesa cibernética. O anúncio e o plano de acesso foram detalhados na cobertura anterior do NeoTeo.
As dificuldades relatadas se referiam a algumas tarefas práticas de programação e ao design de interfaces. Em resposta à crítica sobre programação, o Google citou o uso do modelo dentro da empresa e seus testes internos.
O que avaliam os quatro benchmarks divulgados pelo Google
O Google divulgou resultados em quatro benchmarks, cada um voltado a uma área distinta:
- DeepSWE v1.1 — 77,9%: tarefas de engenharia de software de longo prazo.
- AutomationBench — 51,3%: execução de funções empresariais de ponta a ponta.
- LVBench — 91,7%: compreensão de vídeos longos.
- CWE-bench v1 — 68%: correção de vulnerabilidades de software.
Os quatro percentuais foram divulgados pelo Google. Eles cobrem áreas diferentes, da engenharia de software à compreensão de vídeo e à correção de vulnerabilidades.
Relatos de uso prático e uma comparação limitada de prompts
Uma comparação em vídeo reúne respostas lado a lado a alguns prompts, mostra resultados que variam entre as tentativas e menciona a 8ª posição do Argon no Agent Arena. A própria apresentação descreve o exercício como uma checagem rápida, baseada em uma amostra pequena.
Acesso anunciado e limite de saída
No anúncio de 30 de setembro, o Google disse que o acesso externo começava a ser liberado a defensores cibernéticos de confiança pelo programa Fairwind. A expansão planejada, após testes e ajustes nas salvaguardas, começaria por clientes pagos da API e assinantes do Google AI Ultra.
O limite anunciado pelo Google é de 1 milhão de tokens de saída, ante 64 mil no limite anterior. A medida se refere à quantidade de texto que o modelo pode gerar.