Le 6 octobre 2026, Mistral AI a annoncé l’accès à Mistral Large 4 en aperçu public par API. L’entreprise prévoit de publier les poids téléchargeables d’ici à la fin octobre : cette étape est distincte de l’accès au modèle par API. (Annonce de Mistral AI)
Un aperçu public avant la publication des poids
L’aperçu public permet d’accéder au modèle par l’API de Mistral AI. L’entreprise prévoit de publier ses poids avant la fin octobre 2026. Mistral présente cette publication comme une étape vers l’utilisation du modèle sur sa propre infrastructure.
Les poids sont les valeurs apprises par le modèle pendant son entraînement. Leur publication permet à des organisations de les déployer elles-mêmes, sous réserve de disposer de l’infrastructure nécessaire. Mistral présente donc deux étapes distinctes : l’accès à l’aperçu par API, annoncé le 6 octobre, puis la publication des poids prévue pour la fin du mois.
Ce que disent les spécifications de Mistral Large 4
La documentation de Mistral AI décrit Mistral Large 4 comme un modèle multimodal à architecture « Mixture-of-Experts » granulaire, ou mélange d’experts. Dans ce type d’architecture, plusieurs groupes spécialisés de paramètres composent le modèle, et une partie d’entre eux est activée pour un calcul donné.
| Caractéristique | Spécification publiée par Mistral AI |
| Paramètres au total | 1 050 milliards |
| Paramètres actifs | 52 milliards |
| Encodeur de vision | 1,6 milliard de paramètres |
| Architecture | Mélange d’experts granulaire (« Mixture-of-Experts », ou MoE) |
| Modalités | Multimodalité native |
Les paramètres totaux correspondent à l’ensemble du modèle ; les paramètres actifs désignent la part mobilisée lors d’un calcul. Ces deux chiffres décrivent des aspects différents de sa taille. Ils ne suffisent pas, à eux seuls, à déterminer ses performances ou à établir qu’il serait le meilleur pour toutes les tâches.
Les performances annoncées par Mistral
Dans son annonce du 6 octobre, Mistral a communiqué plusieurs résultats obtenus sur des évaluations précises : 61,7 % sur DeepSWE v1.1, 28,3 % sur Terminal-Bench 4 et 93 % sur Cybench, une série de 40 exercices de cybersécurité. Sur Dense 200 visual grounding, Mistral rapporte 42 % pour Large 4 contre 41 % pour GPT-6-Astra.
Ces résultats sont ceux que Mistral publie pour son modèle. Ils concernent des tâches différentes et ne constituent pas un classement général des modèles d’IA.
L’entraînement du modèle
Mistral indique avoir entraîné Large 4 depuis zéro sur 3 800 processeurs graphiques NVIDIA Grace Blackwell, dans ses centres de données européens. Au moment de l’annonce, le 6 octobre, l’entreprise précisait que l’entraînement par apprentissage par renforcement se poursuivait.