Na comparação de benchmarks de 6 de outubro de 2026, Mistral Large 4 Preview marcou 38 no Artificial Analysis Intelligence Index v4.3.2. Cinco modelos chineses open-weight listados ficaram acima, entre 39 e 46. No Cyber Index, o modelo marcou 50, com resultados diferentes nos três testes componentes.
Mistral Large 4 Preview marcou 38 na comparação de 6 de outubro
O resultado de 38 pertence ao Intelligence Index, uma medida distinta das pontuações dos testes de cibersegurança. Entre as seis variantes comparadas na tabela, Xiaomi MiMo-V2.6-Pro liderou com 46, enquanto Mistral Large 4 Preview ficou com 38.
As pontuações do Intelligence Index
| Modelo | Pontuação |
| Xiaomi MiMo-V2.6-Pro | 46 |
| Z.ai GLM-5.3 (max) | 45 |
| Moonshot Kimi K3 (max) | 44 |
| Z.ai GLM-5.3-Flash | 42 |
| DeepSeek V4.1 Flash (max) | 39 |
| Mistral Large 4 Preview | 38 |
Os cinco modelos chineses open-weight listados marcaram de 39 a 46; o modelo da Mistral ficou oito pontos abaixo do MiMo-V2.6-Pro. A ordem vale para esse índice e para as variantes comparadas: os resultados de cibersegurança medem outros testes e formam um quadro diferente.
O Cyber Index mostra resultados diferentes conforme o teste
Mistral Large 4 Preview marcou 50 no Cyber Index, a mesma pontuação de Z.ai GLM-5.3-Flash. Nos testes componentes, registrou 51% no CWE-Bench-AA, 16% no DeepsecBench-AA e 81,7% no CyberGym-E2E-AA.
| Modelo e variante | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym-E2E-AA |
| Grok 4.7 (xhigh) | 56 | 68% | 27% | 74% |
| Xiaomi MiMo-V2.6-Pro | 56 | 63% | 26% | 79% |
| OpenAI GPT-6 Luna (max) | 53 | 57% | 24% | 78% |
| Z.ai GLM-5.3-Flash | 50 | 56% | 20% | 74% |
| Mistral Large 4 Preview | 50 | 51% | 16% | 81,7% |
O resultado de 81,7% no CyberGym-E2E-AA foi o maior entre esses cinco modelos. Já no DeepsecBench-AA, Mistral Large 4 Preview registrou 16%. O agregado do Cyber Index, por sua vez, empatou com Z.ai GLM-5.3-Flash e ficou abaixo dos 53 pontos de OpenAI GPT-6 Luna (max) e dos 56 de Grok 4.7 (xhigh) e Xiaomi MiMo-V2.6-Pro.
O que as demonstrações de programação mostram
Duas demonstrações em inglês acrescentam tarefas práticas, com placares próprios, à comparação de índices. Elas não são avaliações padronizadas equivalentes ao Intelligence Index.
Em uma delas, o criador testou um redesign de uma página da Wikipédia e um mundo de LEGO South Park. O redesign ficou em 13º lugar no placar da tarefa; o jogo, em 9º. A demonstração também mostra um layout estreito e animações insatisfatórias no redesign, além de problemas de controle e física no jogo.
Outra demonstração avaliou oito tarefas KingBench 3 usando OpenCode por meio do OpenRouter. O resultado informado foi de 42/80 (52,5%), após correção das permissões; novas tentativas e reparos ficaram fora da pontuação. Entre os resultados, houve uma simulação de elevador e uma mesa dobrável em Three.js que funcionaram, além de tarefas que falharam ou precisaram de novas tentativas.
A versão Preview e o plano para publicar os pesos
A comparação avaliou Mistral Large 4 Preview, apresentada como prévia pública em 6 de outubro de 2026. A cobertura anterior da NeoTeo sobre a abertura da prévia trata desse acesso; esta análise se concentra nos resultados dos benchmarks.
A Mistral planejava publicar os pesos do modelo até o fim de outubro de 2026.