Im Vergleich vom 6. Oktober 2026 erzielte Mistral Large 4 Preview im Artificial Analysis Intelligence Index v4.3.2 38 Punkte. Fünf gelistete chinesische Open-Weight-Modelle lagen mit Ergebnissen zwischen 39 und 46 Punkten darüber. Bei den Cybertests zeigte sich ein anderes Profil: Im CyberGym-E2E-AA erreichte die Vorschau 81,7 Prozent.
Mistral Large 4 Preview erzielte 38 Punkte im Vergleich vom 6. Oktober
Der Wert von 38 gehört zum Intelligence Index, einem Vergleichsmaß für die dort geprüften Modelle. An der Spitze der sechs hier gegenübergestellten Varianten lag Xiaomi MiMo-V2.6-Pro mit 46 Punkten; Mistral Large 4 Preview kam auf 38. Das Ergebnis beschreibt die Vorschau in diesem Index, nicht ihre Leistung bei jeder denkbaren Aufgabe.
| Modell | Punkte im Intelligence Index |
| Xiaomi MiMo-V2.6-Pro | 46 |
| Z.ai GLM-5.3 (max) | 45 |
| Moonshot Kimi K3 (max) | 44 |
| Z.ai GLM-5.3-Flash | 42 |
| DeepSeek V4.1 Flash (max) | 39 |
| Mistral Large 4 Preview | 38 |
Die fünf höher platzierten Modelle waren in der aufgeführten Gegenüberstellung als Open-Weight-Modelle gelistet. Der Abstand zwischen Mistral Large 4 Preview und dem höchsten Wert beträgt acht Punkte. Das ist eine Rangfolge innerhalb dieses Indexes, kein allgemeines Urteil über alle Einsatzbereiche.
Cyber Index und Einzeltests zeigen ein anderes Leistungsprofil
Im Cyber Index erreichte Mistral Large 4 Preview 50 Punkte – ebenso wie Z.ai GLM-5.3-Flash. Die drei dazugehörigen Einzeltests ergaben jedoch unterschiedliche Werte: 51 Prozent bei CWE-Bench-AA, 16 Prozent bei DeepsecBench-AA und 81,7 Prozent bei CyberGym-E2E-AA. Der letzte Wert ist das Ergebnis eines Einzeltests, nicht der Gesamtwert des Cyber Index.
| Modell und Variante | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym-E2E-AA |
| Mistral Large 4 Preview | 50 | 51 % | 16 % | 81,7 % |
| Xiaomi MiMo-V2.6-Pro | 56 | 63 % | 26 % | 79 % |
| Z.ai GLM-5.3-Flash | 50 | 56 % | 20 % | 74 % |
| OpenAI GPT-6 Luna (max) | 53 | 57 % | 24 % | 78 % |
| Grok 4.7 (xhigh) | 56 | 68 % | 27 % | 74 % |
Bei CyberGym-E2E-AA lag der Wert von Mistral Large 4 Preview über den Ergebnissen der vier anderen aufgeführten Varianten, die zwischen 74 und 79 Prozent erreichten. In den beiden anderen Einzeltests lag die Vorschau bei 51 beziehungsweise 16 Prozent. Der Blick auf den Gesamtindex allein würde diese Unterschiede zwischen den Einzeltests nicht abbilden.
Was Coding-Demonstrationen zusätzlich zeigen
Zwei individuell zusammengestellte Coding-Demos ergänzen die Indexwerte um konkrete Aufgaben. Sie verwenden eigene Tests und Ranglisten und sind kein standardisierter Ersatz für den Indexvergleich.
In einer Demo entstanden eine Neugestaltung einer Wikipedia-Seite und eine LEGO-South-Park-Spielwelt. Die Wikipedia-Aufgabe belegte in der dazugehörigen Rangliste Platz 13, die Spielwelt Platz 9. Beschrieben wurden unter anderem eine schmale, mobil ausgerichtete Seitenansicht und Probleme mit Animation und Spielphysik.
Eine zweite Demo umfasste acht KingBench-3-Aufgaben, die mit OpenCode über OpenRouter bearbeitet wurden. Das Ergebnis nach einer Korrektur der Berechtigungen: 42 von 80 Punkten beziehungsweise 52,5 Prozent. Eine Aufzugssimulation und ein faltbarer Tisch funktionierten; andere Aufgaben blieben ohne Ergebnis oder erforderten erneute Versuche. Wiederholungs- und Reparaturläufe flossen nicht in die Wertung ein.
Vorschau und geplanter Release der Gewichte
Mistral AI stellte Mistral Large 4 am 6. Oktober 2026 als öffentliche Vorschau vor und plante, die Gewichte bis Ende Oktober freizugeben. Der Vergleich bezieht sich auf diese Vorschau. In unserer früheren Meldung zur öffentlichen Vorschau von Mistral Large 4 ging es um den Start des Modells.