Artículos · Mustapha Alouani
La temperatura no controla la verdad
Qué cambia la decodificación y qué no puede garantizar.
Un control que no sabe qué es verdadero
La temperatura transforma una distribución de probabilidades antes de elegir un token. No consulta una base documental ni un juez de la verdad. Reducirla suele concentrar la distribución; puede volver más repetible tanto un error como una respuesta correcta.
Partimos de cuatro puntuaciones construidas: 2, 1, 0,5 y 0,1. Las dividimos por una temperatura positiva y aplicamos softmax. La puntuación mayor conserva su posición, pero cambian las diferencias entre probabilidades. La cápsula muestra los valores calculados para observarlo directamente.
Tres ajustes, tres operaciones
La temperatura cambia la concentración. Top-k conserva los k candidatos mejor clasificados. Top-p conserva el conjunto inicial mínimo cuya probabilidad acumulada alcanza un umbral. Tras eliminar candidatos, hay que renormalizar las probabilidades restantes.
Nuestro orden es temperatura, softmax, top-k, renormalización, top-p y renormalización. El orden forma parte del protocolo. Otras implementaciones pueden usar convenciones distintas: comparar solo los números de dos interfaces no basta.
Por qué cien sorteos no reproducen exactamente las probabilidades
Una probabilidad del 20 % no exige exactamente veinte apariciones en cien sorteos. Las frecuencias fluctúan. La cápsula usa una semilla fija para comparar de forma reproducible; no muestra variabilidad entre semillas. Las barras de probabilidades y los recuentos observados son objetos diferentes.
El modo voraz elige el candidato con mayor puntuación. No calcula softmax con T = 0, lo que dividiría por cero. La cápsula trata ese modo por separado.
Un protocolo práctico
Para una tarea factual, conserva preguntas con respuestas de referencia. Compara ajustes sobre las mismas entradas, registra aciertos y variaciones y evalúa la elección final con preguntas reservadas. Una respuesta estable no siempre es correcta; una respuesta variada no siempre es creativa de forma útil.
De las puntuaciones a las probabilidades
Una puntuación de salida, llamada a menudo logit, todavía no es una probabilidad. Puede ser negativa y las puntuaciones no tienen por qué sumar uno. Softmax las transforma en números positivos cuya suma es uno. Para cada candidato, se calcula la exponencial de su puntuación dividida por la temperatura y se divide por la suma de todas esas exponenciales.
Con las puntuaciones de la cápsula y T = 1, el primer candidato recibe aproximadamente el 57,5 % de probabilidad; el segundo, el 21,1 %; el tercero, el 12,8 %, y el cuarto, el 8,6 %. Con T = 0,5, el primero sube a alrededor del 82,8 %. No se ha leído ningún documento adicional: solo se han acentuado las diferencias entre las puntuaciones existentes.
Para entender el efecto con precisión, compara dos candidatos. El cociente entre sus probabilidades es exp((puntuación A − puntuación B) / T). Si A tiene mayor puntuación, reducir T amplifica su ventaja. Esto explica la concentración sin recurrir a la idea imprecisa de un modelo «más inteligente» o «menos imaginativo».
Sigue una operación de filtrado
Supón que top-k conserva solo los dos primeros candidatos, con T = 1. Sus probabilidades iniciales suman aproximadamente el 78,6 %. Para que la nueva distribución sume uno, se renormalizan: el primero pasa a alrededor del 73,1 % y el segundo al 26,9 %. Los otros dos quedan en cero y no pueden seleccionarse.
Si después aplicamos top-p = 0,7, basta el primer candidato para superar el umbral de la distribución renormalizada. Con top-p = 0,9, deben conservarse ambos. El umbral p no es un número de candidatos ni significa que el token elegido sea correcto con probabilidad p.
Del cálculo a un texto completo
En un modelo autorregresivo, la elección se repite para cada token siguiente. El token elegido se añade al contexto y se calculan nuevas puntuaciones. Una pequeña diferencia inicial puede modificar las distribuciones posteriores. La cápsula mantiene las cuatro puntuaciones fijas: aísla una elección para hacer visible el mecanismo, pero no reproduce una generación completa.
Esta limitación sugiere un método de aprendizaje: entender primero un paso e identificar después qué se repite y qué cambia en el sistema completo. Los cálculos son exactos para el ejemplo construido; las conclusiones sobre un asistente real deben comprobarse con su propio protocolo.
Ejercicio resuelto
Con top-k = 1, ¿cambiar una temperatura positiva modifica el token final? No en esta cápsula: la clasificación no cambia y solo sobrevive un candidato. Eso no vuelve intercambiables todos los parámetros de todas las bibliotecas.