Notícias · LLM Mechanics · Métodos e arquiteturas
Mistral Small 4: como funciona uma mistura de especialistas
Uma retomada da arquitetura do Small 4: por que um modelo pode ter muitos especialistas sem ativar todos para cada token?
Uma arquitetura apresentada em março
A Mistral apresentou o Small 4 em 16 de março de 2026, com 128 especialistas e quatro ativos por token. Esta retomada explica um termo frequente nos anúncios de modelos: mistura de especialistas, ou MoE.
Roteamento em vez de cálculo uniforme
Nos blocos envolvidos, um mecanismo de roteamento direciona cada representação para determinadas sub-redes. Nem todos os parâmetros são usados da mesma maneira para cada token. A arquitetura separa a capacidade total armazenada de uma parte do cálculo realizado a cada etapa.
Nesse contexto, um “especialista” é um componente matemático. Ele não representa necessariamente um advogado, um médico e um tradutor dividindo as perguntas. O roteamento aprendido pode ser bem menos simples de interpretar.
Menos cálculo não elimina todas as restrições
Ativar uma fração dos especialistas pode limitar o cálculo por token, mas os demais parâmetros precisam continuar acessíveis. A memória, as transferências de dados e a distribuição entre processadores influenciam a execução.
O número de especialistas ativos não permite prever sozinho a velocidade em um computador específico. Ele descreve o funcionamento do modelo, algo diferente de uma medição de desempenho ou da qualidade das respostas.
Fontes primárias
Fontes consultadas em
- Introducing Mistral Small 4 — Mistral AI