Nel confronto del 6 ottobre 2026, Mistral Large 4 Preview ha ottenuto 38 punti nell’Intelligence Index v4.3.2. Cinque modelli cinesi open-weight inclusi nella stessa graduatoria hanno totalizzato da 39 a 46 punti; Xiaomi MiMo-V2.6-Pro ha raggiunto il risultato più alto, con 46. Nei test di cybersicurezza, invece, il profilo di Mistral cambia da una prova all’altra.

Il punteggio di Mistral Large 4 Preview nel confronto del 6 ottobre

Il risultato colloca Mistral Large 4 Preview sotto cinque modelli open-weight cinesi nella graduatoria dell’Intelligence Index. DeepSeek V4.1 Flash (max) ha ottenuto 39 punti, Z.ai GLM-5.3-Flash 42, Kimi K3 (max) 44, Z.ai GLM-5.3 (max) 45 e Xiaomi MiMo-V2.6-Pro 46.

I punteggi dell’Intelligence Index a confronto

ModelloPunteggio dell’Intelligence Index
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38

Il punteggio riassume i risultati nell’indice, non è una percentuale di risposte corrette. Serve quindi a confrontare i modelli in quella valutazione; da solo non descrive come si comportino in ogni attività.

Il Cyber Index cambia il quadro

Mistral Large 4 Preview ha ottenuto 50 nel Cyber Index. Il valore coincide con quello di Z.ai GLM-5.3-Flash, ma i risultati dei singoli test componenti sono diversi: 51% in CWE-Bench-AA, 16% in DeepsecBench-AA e 81,7% in CyberGym-E2E-AA. Quest’ultimo è un risultato di una prova specifica, distinto dal punteggio aggregato dell’indice.

Modello e varianteCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Grok 4.7 (xhigh)5668%27%74%
Xiaomi MiMo-V2.6-Pro5663%26%79%
OpenAI GPT-6 Luna (max)5357%24%78%
Z.ai GLM-5.3-Flash5056%20%74%
Mistral Large 4 Preview5051%16%81,7%

Fra questi cinque modelli, Mistral Large 4 Preview ha il risultato più alto in CyberGym-E2E-AA; il suo punteggio aggregato nel Cyber Index, però, è pari a quello di Z.ai GLM-5.3-Flash. Le due misure rispondono a confronti diversi: la percentuale appartiene a un singolo test, mentre il Cyber Index è un risultato composito.

Che cosa mostrano le dimostrazioni di programmazione

Due task personalizzati: redesign di Wikipedia e mondo LEGO a tema South Park. Video in inglese.
Otto task di KingBench 3 con OpenCode e OpenRouter; punteggio dichiarato: 42/80. Video in inglese.

Due prove realizzate da creator aggiungono esempi pratici, ma usano task personalizzati e non sono confronti standardizzati come gli indici. Nel primo video, il redesign di una pagina di Wikipedia si è classificato 13º e un mondo LEGO a tema South Park 9º nelle rispettive classifiche. La dimostrazione del redesign evidenzia un layout stretto, pensato per dispositivi mobili, e animazioni poco riuscite; nel gioco si vedono problemi di movimento e di fisica.

In una seconda prova, otto task di KingBench 3 eseguiti con OpenCode attraverso OpenRouter hanno totalizzato 42/80, pari al 52,5%, dopo una correzione relativa ai permessi. Il punteggio escludeva tentativi di ripetizione e riparazioni. Fra gli esiti mostrati ci sono una simulazione di ascensore funzionante e un tavolo pieghevole realizzato con Three.js; alcuni task, invece, non hanno prodotto il file o la risposta attesi.

La preview e il piano di pubblicazione dei pesi

Il confronto riguarda Mistral Large 4 Preview. Il 6 ottobre 2026 Mistral aveva indicato l’intenzione di pubblicare i pesi entro la fine dello stesso mese. Per il contesto sul lancio, NeoTeo aveva già raccontato l’apertura dell’anteprima pubblica di Mistral Large 4.