Actualidad · LLM Mechanics · Métodos y arquitecturas
Mistral Small 4: cómo funciona una mezcla de expertos
Una mirada a la arquitectura de Small 4: ¿por qué un modelo puede tener muchos expertos sin activarlos todos para cada token?
Una arquitectura presentada en marzo
Mistral presentó Small 4 el 16 de marzo de 2026, con 128 expertos y cuatro activos por token. Esta mirada a una noticia anterior explica un término habitual en los anuncios de modelos: mezcla de expertos, o MoE.
Enrutamiento en lugar de cálculo uniforme
En los bloques correspondientes, un mecanismo de enrutamiento dirige cada representación hacia determinadas subredes. No todos los parámetros se utilizan de la misma forma para cada token. La arquitectura separa así la capacidad total almacenada de una parte del cálculo realizado en cada paso.
Aquí, un «experto» es un componente matemático. No representa necesariamente a un abogado, un médico y un traductor que se reparten las preguntas. El enrutamiento aprendido puede ser bastante menos sencillo de interpretar.
Menos cálculo no elimina todas las limitaciones
Activar una fracción de los expertos puede reducir el cálculo por token, pero los demás parámetros deben seguir accesibles. La memoria, las transferencias de datos y la distribución entre procesadores influyen en la ejecución.
El número de expertos activos no permite predecir por sí solo la velocidad en un ordenador concreto. Describe el funcionamiento del modelo, algo distinto de una medición de rendimiento o de la calidad de sus respuestas.
Fuentes primarias
Fuentes consultadas el
- Introducing Mistral Small 4 — Mistral AI