Le 6 octobre 2026, Mistral Large 4 Preview a obtenu 38 à l’Artificial Analysis Intelligence Index v4.3.2. Dans la même comparaison, cinq modèles chinois à poids ouverts ont fait mieux, avec des scores allant de 39 à 46. Les résultats de cybersécurité dessinent un tableau différent selon le test.

Cinq modèles à poids ouverts dépassent son score

Les scores de l’Intelligence Index situent Mistral Large 4 Preview derrière cinq modèles chinois à poids ouverts dans la comparaison du 6 octobre. Xiaomi MiMo-V2.6-Pro arrive en tête de la liste avec 46 ; DeepSeek V4 Pro 0813 (max) se classe sous Mistral, à 36.

ModèleScore à l’Intelligence Index
Xiaomi MiMo-V2.6-Pro46
Z.ai GLM-5.3 (max)45
Moonshot Kimi K3 (max)44
Z.ai GLM-5.3-Flash42
DeepSeek V4.1 Flash (max)39
Mistral Large 4 Preview38
DeepSeek V4 Pro 0813 (max)36

Ce score résume le résultat sur un indice donné. Il ne remplace pas les mesures obtenues sur des tâches précises, comme le montrent les tests de cybersécurité.

Le Cyber Index révèle des résultats différents selon les tests

Mistral Large 4 Preview a obtenu 50 au Cyber Index, à égalité avec Z.ai GLM-5.3-Flash. Ses résultats aux trois tests composants sont contrastés : 51 % à CWE-Bench-AA, 16 % à DeepsecBench-AA et 81,7 % à CyberGym-E2E-AA.

Modèle et varianteCyber IndexCWE-Bench-AADeepsecBench-AACyberGym-E2E-AA
Mistral Large 4 Preview5051 %16 %81,7 %
Xiaomi MiMo-V2.6-Pro5663 %26 %79 %
Z.ai GLM-5.3-Flash5056 %20 %74 %
OpenAI GPT-6 Luna (max)5357 %24 %78 %
Grok 4.7 (xhigh)5668 %27 %74 %

Sur CyberGym-E2E-AA, le résultat de Mistral est le plus élevé parmi ces cinq configurations ; Xiaomi MiMo-V2.6-Pro suit avec 79 %. Ce pourcentage correspond à un test composant, tandis que le Cyber Index est une mesure agrégée. Les deux scores répondent donc à des questions différentes.

Ce qu’ajoutent les démonstrations de programmation

Démonstration en anglais : refonte de Wikipédia classée 13e et jeu LEGO South Park classé 9e dans leurs classements respectifs
Démonstration en anglais des huit tâches KingBench 3 : score corrigé après prise en compte des autorisations, 42/80 (52,5 %)

Deux démonstrations vidéo en anglais proposent des tâches pratiques distinctes de l’Intelligence Index. Dans l’une, une refonte de Wikipédia se classe 13e dans le classement de la tâche, et un jeu LEGO South Park arrive 9e. La refonte présente une mise en page étroite de type mobile et des animations décevantes ; le jeu connaît des problèmes de commandes et de physique, notamment des sauts continus.

Une autre démonstration passe par huit tâches KingBench 3 dans OpenCode via OpenRouter. Le résultat final, corrigé après prise en compte des autorisations, est de 42/80, soit 52,5 %. Parmi les tâches réussies figurent une simulation d’ascenseur et une table pliante en Three.js ; d’autres ont échoué ou nécessité des reprises. Les nouvelles tentatives et les réparations ne comptent pas dans ce score.

Ces essais utilisent leurs propres tâches et méthodes de notation : ils apportent des exemples de programmation, mais ne sont pas des évaluations standardisées comparables à l’Intelligence Index.

La preview et le projet de publication des poids

Mistral a annoncé l’aperçu public de Large 4 le 6 octobre 2026, avec un accès par API. NeoTeo avait déjà présenté l’ouverture de cet aperçu public.

Mistral prévoit de publier les poids du modèle d’ici à la fin d’octobre 2026.