Nel confronto del 6 ottobre 2026, Mistral Large 4 Preview ha ottenuto 38 punti nell’Intelligence Index v4.3.2. Cinque modelli cinesi open-weight inclusi nella stessa graduatoria hanno totalizzato da 39 a 46 punti; Xiaomi MiMo-V2.6-Pro ha raggiunto il risultato più alto, con 46. Nei test di cybersicurezza, invece, il profilo di Mistral cambia da una prova all’altra.
Il punteggio di Mistral Large 4 Preview nel confronto del 6 ottobre
Il risultato colloca Mistral Large 4 Preview sotto cinque modelli open-weight cinesi nella graduatoria dell’Intelligence Index. DeepSeek V4.1 Flash (max) ha ottenuto 39 punti, Z.ai GLM-5.3-Flash 42, Kimi K3 (max) 44, Z.ai GLM-5.3 (max) 45 e Xiaomi MiMo-V2.6-Pro 46.
I punteggi dell’Intelligence Index a confronto
| Modello | Punteggio dell’Intelligence Index |
| Xiaomi MiMo-V2.6-Pro | 46 |
| Z.ai GLM-5.3 (max) | 45 |
| Kimi K3 (max) | 44 |
| Z.ai GLM-5.3-Flash | 42 |
| DeepSeek V4.1 Flash (max) | 39 |
| Mistral Large 4 Preview | 38 |
Il punteggio riassume i risultati nell’indice, non è una percentuale di risposte corrette. Serve quindi a confrontare i modelli in quella valutazione; da solo non descrive come si comportino in ogni attività.
Il Cyber Index cambia il quadro
Mistral Large 4 Preview ha ottenuto 50 nel Cyber Index. Il valore coincide con quello di Z.ai GLM-5.3-Flash, ma i risultati dei singoli test componenti sono diversi: 51% in CWE-Bench-AA, 16% in DeepsecBench-AA e 81,7% in CyberGym-E2E-AA. Quest’ultimo è un risultato di una prova specifica, distinto dal punteggio aggregato dell’indice.
| Modello e variante | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym-E2E-AA |
| Grok 4.7 (xhigh) | 56 | 68% | 27% | 74% |
| Xiaomi MiMo-V2.6-Pro | 56 | 63% | 26% | 79% |
| OpenAI GPT-6 Luna (max) | 53 | 57% | 24% | 78% |
| Z.ai GLM-5.3-Flash | 50 | 56% | 20% | 74% |
| Mistral Large 4 Preview | 50 | 51% | 16% | 81,7% |
Fra questi cinque modelli, Mistral Large 4 Preview ha il risultato più alto in CyberGym-E2E-AA; il suo punteggio aggregato nel Cyber Index, però, è pari a quello di Z.ai GLM-5.3-Flash. Le due misure rispondono a confronti diversi: la percentuale appartiene a un singolo test, mentre il Cyber Index è un risultato composito.
Che cosa mostrano le dimostrazioni di programmazione
Due prove realizzate da creator aggiungono esempi pratici, ma usano task personalizzati e non sono confronti standardizzati come gli indici. Nel primo video, il redesign di una pagina di Wikipedia si è classificato 13º e un mondo LEGO a tema South Park 9º nelle rispettive classifiche. La dimostrazione del redesign evidenzia un layout stretto, pensato per dispositivi mobili, e animazioni poco riuscite; nel gioco si vedono problemi di movimento e di fisica.
In una seconda prova, otto task di KingBench 3 eseguiti con OpenCode attraverso OpenRouter hanno totalizzato 42/80, pari al 52,5%, dopo una correzione relativa ai permessi. Il punteggio escludeva tentativi di ripetizione e riparazioni. Fra gli esiti mostrati ci sono una simulazione di ascensore funzionante e un tavolo pieghevole realizzato con Three.js; alcuni task, invece, non hanno prodotto il file o la risposta attesi.
La preview e il piano di pubblicazione dei pesi
Il confronto riguarda Mistral Large 4 Preview. Il 6 ottobre 2026 Mistral aveva indicato l’intenzione di pubblicare i pesi entro la fine dello stesso mese. Per il contesto sul lancio, NeoTeo aveva già raccontato l’apertura dell’anteprima pubblica di Mistral Large 4.