Notícias · LLM Mechanics · Métodos e arquiteturas

Mistral Small 4: como funciona uma mistura de especialistas

Uma retomada da arquitetura do Small 4: por que um modelo pode ter muitos especialistas sem ativar todos para cada token?

Uma arquitetura apresentada em março

A Mistral apresentou o Small 4 em 16 de março de 2026, com 128 especialistas e quatro ativos por token. Esta retomada explica um termo frequente nos anúncios de modelos: mistura de especialistas, ou MoE.

Roteamento em vez de cálculo uniforme

Nos blocos envolvidos, um mecanismo de roteamento direciona cada representação para determinadas sub-redes. Nem todos os parâmetros são usados da mesma maneira para cada token. A arquitetura separa a capacidade total armazenada de uma parte do cálculo realizado a cada etapa.

Nesse contexto, um “especialista” é um componente matemático. Ele não representa necessariamente um advogado, um médico e um tradutor dividindo as perguntas. O roteamento aprendido pode ser bem menos simples de interpretar.

Menos cálculo não elimina todas as restrições

Ativar uma fração dos especialistas pode limitar o cálculo por token, mas os demais parâmetros precisam continuar acessíveis. A memória, as transferências de dados e a distribuição entre processadores influenciam a execução.

O número de especialistas ativos não permite prever sozinho a velocidade em um computador específico. Ele descreve o funcionamento do modelo, algo diferente de uma medição de desempenho ou da qualidade das respostas.

Fontes primárias

Fontes consultadas em

Todas as notícias →