Personas anónimas con acceso directo al proyecto describieron dificultades de Gemini 4 Argon en algunas tareas de programación y diseño de interfaces; Google rechazó que el modelo tuviera un rendimiento inferior al programar. Estas versiones se hicieron públicas el 30 de septiembre de 2026, el mismo día en que Google anunció el modelo y sus resultados en benchmarks.
Qué miden las puntuaciones de Gemini 4 Argon
Google comunicó cuatro resultados para Argon. Cada benchmark evalúa una tarea concreta, desde ingeniería de software hasta comprensión de vídeo:
| Benchmark | Tarea evaluada | Resultado comunicado por Google |
| DeepSWE v1.1 | Tareas de ingeniería de software de larga duración | 77,9 % |
| AutomationBench | Flujos de trabajo empresariales de principio a fin | 51,3 % |
| LVBench | Comprensión de vídeos largos | 91,7 % |
| CWE-bench v1 | Corrección de vulnerabilidades de software | 68 % |
Las puntuaciones describen el resultado en pruebas distintas; cada una se centra en un ámbito específico. Por sí solas, no describen el desempeño en cualquier proyecto de programación o trabajo diario.
Qué se ha dicho sobre el uso práctico
Las personas anónimas con acceso directo al proyecto señalaron problemas en algunas tareas reales de programación y en el diseño de interfaces. Google rechazó la caracterización de que Argon rindiera peor en programación y citó su uso y sus pruebas internas.
Como ejemplo de trabajo interno, Google afirmó que agentes de Argon sustituyeron 32.000 líneas de código SIMD en libgav1 y produjeron un decodificador en Rust 2,7 veces más rápido que la versión anterior en Rust, con una salida de vídeo idéntica. Es un caso concreto comunicado por la empresa, distinto de una valoración general de todas las tareas prácticas.
La comparación de prompts del vídeo reúne una muestra pequeña y muestra variaciones entre respuestas; funciona como una comprobación rápida, no como una evaluación exhaustiva.
Acceso por fases y límite de salida
Google anunció el acceso inicial a Gemini 4 Argon para defensores de ciberseguridad de confianza a través del programa Fairwind. El plan situaba una ampliación posterior para desarrolladores, empresas y consumidores, empezando por clientes de API de pago y suscriptores de Google AI Ultra. NeoTeo ya había resumido el plan inicial en su cobertura del despliegue por fases.
El límite anunciado es de 1.000.000 de tokens de salida, frente a los 64.000 anteriores. Se refiere a los tokens que el modelo puede generar.