En la comparación del 6 de octubre de 2026, Mistral Large 4 Preview obtuvo 38 puntos en el Artificial Analysis Intelligence Index v4.3.2. Cinco modelos chinos de pesos abiertos incluidos en la misma tabla puntuaron más alto, entre 39 y 46; en las pruebas de ciberseguridad, en cambio, el resultado de Mistral varió según la tarea.
Mistral Large 4 Preview obtiene 38 puntos en la comparación del 6 de octubre
La puntuación de 38 sitúa a Mistral Large 4 Preview por debajo de cinco modelos de pesos abiertos de China en esa comparación concreta. Xiaomi MiMo-V2.6-Pro alcanzó 46 puntos, mientras que DeepSeek V4.1 Flash (max), el más cercano por encima, obtuvo 39.
El resultado corresponde al Intelligence Index, no a una medida única de todas las capacidades de un modelo. La comparación también incluye un índice de ciberseguridad y pruebas específicas, donde el orden cambia.
La vista previa pública de Mistral Large 4 ya fue el tema de una cobertura anterior de NeoTeo; esta nueva nota se centra en los resultados de las pruebas. También puedes consultar la nota de NeoTeo sobre la apertura de la vista previa.
Las puntuaciones del Intelligence Index, una junto a otra
Estas son las seis variantes con puntuaciones superiores o iguales al tramo que rodea a Mistral en la comparación, ordenadas por resultado. La tabla permite ver la distancia entre los modelos incluidos, no una clasificación universal para cualquier tarea.
| Modelo | Puntuación del índice |
| Xiaomi MiMo-V2.6-Pro | 46 |
| Z.ai GLM-5.3 (max) | 45 |
| Moonshot Kimi K3 (max) | 44 |
| Z.ai GLM-5.3-Flash | 42 |
| DeepSeek V4.1 Flash (max) | 39 |
| Mistral Large 4 Preview | 38 |
La diferencia entre Mistral Large 4 Preview y Xiaomi MiMo-V2.6-Pro fue de ocho puntos en este índice. La tabla también muestra que la distancia con DeepSeek V4.1 Flash (max) fue de un punto. Son resultados de las variantes nombradas en la comparación del 6 de octubre.
El Cyber Index ofrece un perfil distinto según la prueba
Mistral Large 4 Preview obtuvo 50 puntos en el Cyber Index, el mismo resultado que Z.ai GLM-5.3-Flash entre las variantes recogidas aquí. Sus tres componentes, sin embargo, dieron porcentajes muy distintos: 51 % en CWE-Bench-AA, 16 % en DeepsecBench-AA y 81,7 % en CyberGym-E2E-AA.
| Modelo y variante | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym-E2E-AA |
| Mistral Large 4 Preview | 50 | 51 % | 16 % | 81,7 % |
| Xiaomi MiMo-V2.6-Pro | 56 | 63 % | 26 % | 79 % |
| Z.ai GLM-5.3-Flash | 50 | 56 % | 20 % | 74 % |
| OpenAI GPT-6 Luna (max) | 53 | 57 % | 24 % | 78 % |
| Grok 4.7 (xhigh) | 56 | 68 % | 27 % | 74 % |
El 81,7 % de CyberGym-E2E-AA es el resultado más alto de Mistral entre esas cinco variantes en esa prueba componente, aunque su puntuación agregada del Cyber Index no fue la mayor. No conviene intercambiar ambas cifras: el índice reúne resultados distintos y CyberGym-E2E-AA es una de sus pruebas específicas.
Qué muestran las demostraciones de programación
Dos demostraciones prácticas aportan ejemplos de tareas concretas, con métodos y puntuaciones propios; sus resultados no son sustitutos estandarizados del Intelligence Index. En una, un rediseño de Wikipedia quedó en el puesto 13 de la clasificación de esa tarea, y un mundo de LEGO con South Park, en el 9. La primera propuesta tenía un diseño estrecho, de estilo móvil, y animaciones deficientes; en el juego aparecieron problemas de movimiento y físicas.
En otra evaluación, ocho tareas de KingBench 3 ejecutadas con OpenCode a través de OpenRouter sumaron 42 de 80 puntos, o un 52,5 %, tras una corrección de permisos. La puntuación excluyó los reintentos y las reparaciones. Entre los ejemplos, funcionaron una simulación de ascensor y una mesa plegable en Three.js; las tareas del estuche para lentes de contacto y del problema de conteo terminaron sin generar archivos o respuestas.
La vista previa y el plan de publicación de los pesos
La comparación evaluó Mistral Large 4 Preview, que se ofreció como vista previa pública mediante API. Mistral había previsto publicar los pesos del modelo antes de que terminara octubre de 2026.