Articles · Mustapha Alouani
La température ne règle pas la vérité
Comprendre ce que change le décodage, et ce qu’il ne peut pas garantir.
Le bouton qui ne sait pas ce qui est vrai
La température transforme une distribution de probabilités avant le choix d’un token. Elle ne consulte ni une base documentaire ni un arbitre du vrai. La réduire rend généralement la distribution plus concentrée ; cela peut rendre une erreur plus répétable aussi bien qu’une bonne réponse.
Partons de quatre scores construits : 2, 1, 0,5 et 0,1. On divise les scores par une température positive, puis on applique softmax. Le score le plus élevé conserve son rang. En revanche, les écarts de probabilités changent. La capsule affiche les valeurs calculées pour voir cet effet directement.
Trois réglages, trois opérations
Température modifie la concentration. Top-k conserve les k candidats les mieux classés. Top-p garde le plus petit ensemble de tête dont la probabilité cumulée atteint un seuil. Après une suppression de candidats, les probabilités restantes doivent être renormalisées.
Dans notre expérience, l’ordre est température, softmax, top-k, renormalisation, top-p, renormalisation. Cet ordre fait partie du protocole : d’autres implémentations peuvent employer des conventions différentes. Ne comparez donc pas seulement les nombres affichés dans deux interfaces.
Pourquoi cent tirages ne reproduisent pas exactement les probabilités
Une probabilité de 20 % n’impose pas exactement vingt occurrences sur cent. Les fréquences fluctuent. La capsule utilise une graine fixe pour rendre les comparaisons reproductibles ; elle ne montre pas la variabilité entre plusieurs graines. Les barres avant tirage et les comptes observés sont deux objets différents.
Le mode glouton choisit le candidat maximal. Il ne s’agit pas de calculer softmax avec T = 0, car la formule diviserait par zéro. La capsule traite ce mode séparément.
Un protocole pratique
Pour une tâche factuelle, gardez un jeu de questions et leurs références. Comparez plusieurs réglages sur les mêmes entrées, notez les réponses exactes et les variations, puis testez votre choix sur des questions réservées. Une réponse stable n’est pas nécessairement exacte ; une réponse variée n’est pas nécessairement créative au sens utile à votre tâche.
Partir des scores pour comprendre les probabilités
Un score de sortie, souvent appelé logit, n’est pas encore une probabilité. Il peut être négatif et la somme des scores n’a pas de raison de valoir un. Softmax transforme ces valeurs en nombres positifs dont la somme vaut un. Pour chaque candidat, on exponentie son score divisé par la température, puis on divise ce résultat par la somme des exponentielles de tous les candidats.
Avec les scores de notre capsule et T = 1, le premier candidat reçoit environ 57,5 % de la probabilité. Le deuxième reçoit environ 21,1 %, le troisième 12,8 % et le quatrième 8,6 %. Si T devient 0,5, le premier monte à environ 82,8 %. Aucun document supplémentaire n’a été lu : nous avons seulement accentué les différences entre les scores existants.
Une manière précise de comprendre cet effet consiste à comparer deux candidats. Le rapport de leurs probabilités vaut exp((score A − score B) / T). Lorsque A a un score supérieur, diminuer T amplifie cet avantage. Cette relation explique l’effet de concentration sans recourir à l’idée vague d’un modèle qui deviendrait « plus intelligent » ou « moins imaginatif ».
Suivre l’effet d’un filtrage
Supposons maintenant que top-k ne conserve que les deux premiers candidats, toujours avec T = 1. Leurs probabilités initiales totalisent environ 78,6 %. Pour obtenir une nouvelle distribution qui somme à un, on les renormalise : le premier vaut alors environ 73,1 % et le second 26,9 %. Les deux autres valent zéro et ne peuvent plus être tirés.
Si l’on applique ensuite top-p = 0,7, le premier candidat suffit à dépasser le seuil dans cette distribution renormalisée. Il reste donc seul. Avec top-p = 0,9, il faut conserver les deux. Le seuil p n’est pas un nombre de candidats et ne signifie pas non plus que le token choisi sera correct avec une probabilité p.
Relier le calcul à un texte complet
Dans un modèle autorégressif, ce choix est répété pour chaque prochain token. Le token retenu est ajouté au contexte, puis de nouveaux scores sont calculés. Une petite différence au début peut ainsi modifier les distributions suivantes. Notre capsule garde les quatre scores fixes : elle isole un seul choix afin que le mécanisme soit observable, mais ne reproduit pas toute une génération.
Cette limite donne une bonne méthode de lecture : comprendre d’abord une étape, puis identifier ce qui se répète et ce qui change lorsqu’on passe au système complet. Les calculs de la capsule sont exacts pour l’exemple construit ; les conclusions sur un véritable assistant doivent ensuite être vérifiées dans son propre protocole.
Exercice et correction
Avec top-k = 1, modifier la température positive change-t-il le token final ? Non dans cette capsule : le classement reste identique et un seul candidat survit. Cela n’implique pas que tous les paramètres de toutes les bibliothèques soient interchangeables.