En la comparación del 6 de octubre de 2026, Mistral Large 4 Preview obtuvo 38 puntos en el Artificial Analysis Intelligence Index v4.3.2. Cinco modelos chinos de pesos abiertos incluidos en la misma tabla puntuaron más alto, entre 39 y 46; en las pruebas de ciberseguridad, en cambio, el resultado de Mistral varió según la tarea.

Mistral Large 4 Preview obtiene 38 puntos en la comparación del 6 de octubre

La puntuación de 38 sitúa a Mistral Large 4 Preview por debajo de cinco modelos de pesos abiertos de China en esa comparación concreta. Xiaomi MiMo-V2.6-Pro alcanzó 46 puntos, mientras que DeepSeek V4.1 Flash (max), el más cercano por encima, obtuvo 39.

El resultado corresponde al Intelligence Index, no a una medida única de todas las capacidades de un modelo. La comparación también incluye un índice de ciberseguridad y pruebas específicas, donde el orden cambia.

La vista previa pública de Mistral Large 4 ya fue el tema de una cobertura anterior de NeoTeo; esta nueva nota se centra en los resultados de las pruebas. También puedes consultar la nota de NeoTeo sobre la apertura de la vista previa.

Las puntuaciones del Intelligence Index, una junto a otra

Estas son las seis variantes con puntuaciones superiores o iguales al tramo que rodea a Mistral en la comparación, ordenadas por resultado. La tabla permite ver la distancia entre los modelos incluidos, no una clasificación universal para cualquier tarea.

ModeloPuntuación del índice
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Moonshot Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

La diferencia entre Mistral Large 4 Preview y Xiaomi MiMo-V2.6-Pro fue de ocho puntos en este índice. La tabla también muestra que la distancia con DeepSeek V4.1 Flash (max) fue de un punto. Son resultados de las variantes nombradas en la comparación del 6 de octubre.

El Cyber Index ofrece un perfil distinto según la prueba

Mistral Large 4 Preview obtuvo 50 puntos en el Cyber Index, el mismo resultado que Z.ai GLM-5.3-Flash entre las variantes recogidas aquí. Sus tres componentes, sin embargo, dieron porcentajes muy distintos: 51 % en CWE-Bench-AA, 16 % en DeepsecBench-AA y 81,7 % en CyberGym-E2E-AA.

Modelo y varianteCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Mistral Large 4 Preview5051 %16 %81,7 %
Xiaomi MiMo-V2.6-Pro5663 %26 %79 %
Z.ai GLM-5.3-Flash5056 %20 %74 %
OpenAI GPT-6 Luna (max)5357 %24 %78 %
Grok 4.7 (xhigh)5668 %27 %74 %

El 81,7 % de CyberGym-E2E-AA es el resultado más alto de Mistral entre esas cinco variantes en esa prueba componente, aunque su puntuación agregada del Cyber Index no fue la mayor. No conviene intercambiar ambas cifras: el índice reúne resultados distintos y CyberGym-E2E-AA es una de sus pruebas específicas.

Qué muestran las demostraciones de programación

Demostración en inglés de un rediseño de Wikipedia y un mundo de LEGO con South Park
Demostración en inglés de ocho tareas de KingBench 3

Dos demostraciones prácticas aportan ejemplos de tareas concretas, con métodos y puntuaciones propios; sus resultados no son sustitutos estandarizados del Intelligence Index. En una, un rediseño de Wikipedia quedó en el puesto 13 de la clasificación de esa tarea, y un mundo de LEGO con South Park, en el 9. La primera propuesta tenía un diseño estrecho, de estilo móvil, y animaciones deficientes; en el juego aparecieron problemas de movimiento y físicas.

En otra evaluación, ocho tareas de KingBench 3 ejecutadas con OpenCode a través de OpenRouter sumaron 42 de 80 puntos, o un 52,5 %, tras una corrección de permisos. La puntuación excluyó los reintentos y las reparaciones. Entre los ejemplos, funcionaron una simulación de ascensor y una mesa plegable en Three.js; las tareas del estuche para lentes de contacto y del problema de conteo terminaron sin generar archivos o respuestas.

La vista previa y el plan de publicación de los pesos

La comparación evaluó Mistral Large 4 Preview, que se ofreció como vista previa pública mediante API. Mistral había previsto publicar los pesos del modelo antes de que terminara octubre de 2026.