Artigos · Mustapha Alouani

A temperatura não controla a verdade

O que a decodificação muda e o que ela não pode garantir.

Um controle que não sabe o que é verdadeiro

A temperatura transforma uma distribuição de probabilidades antes da escolha de um token. Ela não consulta uma base documental nem um juiz da verdade. Reduzi-la geralmente concentra a distribuição; isso pode tornar um erro mais repetível, assim como uma resposta correta.

Partimos de quatro pontuações construídas: 2, 1, 0,5 e 0,1. Dividimos as pontuações por uma temperatura positiva e aplicamos softmax. A maior pontuação mantém sua posição, mas as diferenças de probabilidade mudam. A cápsula mostra os valores calculados para observar esse efeito diretamente.

Três ajustes, três operações

A temperatura muda a concentração. Top-k mantém os k candidatos mais bem classificados. Top-p mantém o menor conjunto inicial cuja probabilidade acumulada atinge um limiar. Após remover candidatos, as probabilidades restantes precisam ser renormalizadas.

Nosso experimento aplica temperatura, softmax, top-k, renormalização, top-p e renormalização. Essa ordem faz parte do protocolo. Outras implementações podem usar convenções diferentes; comparar apenas os números de duas interfaces não basta.

Por que cem sorteios não reproduzem exatamente as probabilidades

Uma probabilidade de 20% não exige exatamente vinte ocorrências em cem sorteios. As frequências flutuam. A cápsula usa uma semente fixa para comparações reproduzíveis; não mostra a variação entre sementes. Barras de probabilidade e contagens observadas são objetos diferentes.

O modo guloso escolhe o candidato com maior pontuação. Ele não calcula softmax com T = 0, o que causaria divisão por zero. A cápsula trata esse modo separadamente.

Um protocolo prático

Para uma tarefa factual, mantenha perguntas com respostas de referência. Compare ajustes nas mesmas entradas, registre acertos e variações e avalie a escolha final com perguntas reservadas. Uma resposta estável não é necessariamente correta; uma resposta variada não é necessariamente criativa de maneira útil para a tarefa.

Das pontuações às probabilidades

Uma pontuação de saída, frequentemente chamada de logit, ainda não é uma probabilidade. Ela pode ser negativa e as pontuações não precisam somar um. Softmax transforma esses valores em números positivos cuja soma é um. Para cada candidato, calculamos a exponencial de sua pontuação dividida pela temperatura e dividimos pela soma de todas essas exponenciais.

Com as pontuações da cápsula e T = 1, o primeiro candidato recebe aproximadamente 57,5% da probabilidade; o segundo, 21,1%; o terceiro, 12,8%; e o quarto, 8,6%. Com T = 0,5, o primeiro sobe para cerca de 82,8%. Nenhum documento adicional foi lido: apenas ampliamos as diferenças entre as pontuações existentes.

Uma maneira precisa de entender o efeito é comparar dois candidatos. A razão entre suas probabilidades é exp((pontuação A − pontuação B) / T). Se A tem a maior pontuação, reduzir T amplifica sua vantagem. Isso explica a concentração sem recorrer à ideia vaga de um modelo “mais inteligente” ou “menos imaginativo”.

Acompanhe uma operação de filtragem

Agora suponha que top-k mantenha apenas os dois primeiros candidatos, com T = 1. As probabilidades originais somam aproximadamente 78,6%. Para obter uma nova distribuição cuja soma seja um, renormalizamos os valores: o primeiro passa a cerca de 73,1% e o segundo a 26,9%. Os outros dois ficam em zero e não podem mais ser sorteados.

Se aplicarmos top-p = 0,7 em seguida, o primeiro candidato já ultrapassa o limiar na distribuição renormalizada e fica sozinho. Com top-p = 0,9, precisamos manter os dois. O limiar p não é um número de candidatos e não significa que o token escolhido esteja correto com probabilidade p.

Do cálculo a um texto completo

Em um modelo autorregressivo, essa escolha se repete para cada próximo token. O token escolhido entra no contexto e novas pontuações são calculadas. Uma pequena diferença inicial pode modificar as distribuições seguintes. A cápsula mantém as quatro pontuações fixas: isola uma escolha para tornar o mecanismo visível, mas não reproduz uma geração inteira.

Essa limitação sugere um método de aprendizagem: entender primeiro uma etapa e depois identificar o que se repete e o que muda no sistema completo. Os cálculos são exatos para o exemplo construído; conclusões sobre um assistente real precisam ser verificadas no protocolo desse assistente.

Exercício resolvido

Com top-k = 1, mudar uma temperatura positiva altera o token final? Não nesta cápsula: a classificação se mantém e apenas um candidato sobrevive. Isso não torna intercambiáveis todos os parâmetros de todas as bibliotecas.

Abrir a experiência interativa