Actualités · LLM Mechanics · Méthodes et architectures
Mistral Small 4 : comment fonctionne le mélange d’experts
Retour sur l’architecture de Small 4 : pourquoi un modèle peut-il posséder de nombreux experts sans tous les activer pour chaque token ?
Une architecture présentée en mars
Mistral a présenté Small 4 le 16 mars 2026. Son architecture comporte 128 experts, dont quatre sont actifs par token. Ce retour sur une annonce antérieure explique un terme fréquent dans les présentations de modèles : le mélange d’experts, ou MoE.
Un routage plutôt qu’un calcul uniforme
Dans les blocs concernés, un mécanisme de routage oriente chaque représentation vers certains sous-réseaux. Tous les paramètres ne sont donc pas mobilisés de la même manière pour chaque token. L’architecture sépare ainsi la capacité totale stockée d’une partie du calcul effectivement réalisée à chaque étape.
Le terme « expert » désigne ici un composant mathématique. Il ne faut pas imaginer nécessairement un juriste, un médecin et un traducteur qui se partageraient les questions. Le routage appris peut être bien moins facile à interpréter.
Moins de calcul ne signifie pas moins de contraintes
Activer une fraction des experts peut limiter le calcul par token, mais les autres paramètres doivent rester accessibles. La mémoire, les transferts de données et la répartition sur les processeurs influencent alors l’exécution.
Le nombre d’experts actifs ne suffit donc pas à prédire une vitesse sur un ordinateur donné. C’est une information sur le fonctionnement du modèle, à distinguer d’une mesure de performance et de la qualité de ses réponses.
Sources primaires
Sources consultées le
- Introducing Mistral Small 4 — Mistral AI