Una comparación publicada el 2 de octubre situó a Gemini 4 Argon y GPT-6 Astra en 53 puntos cada uno en el Intelligence Index; Claude Opus 5.5 alcanzó 58. El empate se refiere a ese índice compuesto: en otras pruebas, los resultados variaron según la tarea.

El resultado del Intelligence Index

Gemini 4 Argon obtuvo 53 puntos con el ajuste de razonamiento High, mientras que GPT-6 Astra marcó los mismos 53 con Max. Claude Opus 5.5 consiguió 58 y GPT-6.1 Sol, 52.

ModeloPuntuación del Intelligence Index
Gemini 4 Argon53
GPT-6 Astra53
Claude Opus 5.558
GPT-6.1 Sol52

La puntuación resume un índice, no el rendimiento en cada tarea. La diferencia entre High y Max también importa al leer el empate entre Gemini 4 Argon y GPT-6 Astra: los dos modelos se evaluaron con ajustes distintos.

Resultados distintos según la prueba

En AA-Omniscience, Gemini 4 Argon obtuvo un 15 % en la medida de tasa de alucinación y un 50 % de precisión. La primera cifra corresponde a una medida del benchmark sobre respuestas incorrectas frente a la opción de reconocer incertidumbre; la precisión es otro indicador. En la misma prueba, GPT-6 Astra registró un 51 % en la medida de alucinación y un 63 % de precisión.

En AutomationBench-AA, Argon logró un 78 %, frente al 71 % de Claude Sonnet 5.5. En Terminal Bench 4, que evalúa tareas de terminal, Argon marcó un 57 %: GPT-6 Astra obtuvo un 59 %, Claude Opus 5.5 un 60 % y Claude Sonnet 5.5 un 64 %.

El perfil, por tanto, cambia con la tarea: Argon quedó por delante de Sonnet 5.5 en AutomationBench-AA, pero por detrás de los modelos citados en Terminal Bench 4. Las puntuaciones no condensan todas esas diferencias en un ganador único.

Una muestra de generación visual

Una comparación externa y acotada de unos pocos prompts visuales tuvo resultados mixtos: algunas generaciones fueron satisfactorias y otras mostraron problemas de coherencia. Es una muestra cualitativa, distinta de las puntuaciones estandarizadas de los benchmarks.

El despliegue anunciado por Google

El 30 de septiembre, Google anunció un despliegue inicial de Gemini 4 Argon dirigido a defensores de ciberseguridad de confianza mediante Fairwind. Para una ampliación posterior, señaló a los clientes de API de pago y a los suscriptores de Google AI Ultra como primeros grupos.

Esta noticia amplía la cobertura anterior de NeoTeo sobre la respuesta de Google a las críticas sobre el rendimiento de Gemini 4 Argon, con los resultados de la comparación entre modelos.