Le laboratoire
Température : changer les probabilités
Les mêmes scores, d’autres probabilités. Explorez la température, top-k et top-p sur quatre tokens.
Expérience construite · sans modèle exécuté
La situation · Comprendre la variation des réponses
À demande identique, votre assistant peut formuler des réponses différentes. Vous envisagez de baisser sa température pour le rendre plus fiable. Avant de prendre cette décision, vous voulez comprendre ce que ce réglage modifie réellement.
Ce que vous allez apprendre
Distinguer la probabilité de choisir un token de la probabilité qu’une réponse soit vraie.
Votre mission
Utilisez les quatre candidats comme une loupe sur un seul choix. Modifiez la température puis les filtres, et comparez la distribution attendue aux tirages observés.
À la fin de cette activité. Vous saurez expliquer les effets de température, top-k et top-p, ainsi que la limite d’une démonstration qui n’exécute pas un modèle complet.
À vous d’expérimenter
Le mode glouton choisit le score maximal. Les filtres et la température sont désactivés.
Les scores ne changent pas. Vous modifiez leur transformation en probabilités et leur filtrage.
Scores construits : 2 · 1 · 0,5 · 0,1. Les mots français sont des étiquettes fixes de l’expérience.
Afficher les valeurs
| Token | Avant filtrage | Après filtrage |
|---|---|---|
| chat | 57,5 % | 57,5 % |
| chien | 21,1 % | 21,1 % |
| souris | 12,8 % | 12,8 % |
| oiseau | 8,6 % | 8,6 % |
Échantillon à graine fixe 42 ; les fréquences observées ne sont pas les probabilités exactes.
Comprendre les valeurs avant de toucher aux réglages
Les quatre nombres de départ, 2, 1, 0,5 et 0,1, sont des scores construits. Ils servent à classer les candidats, mais ne sont pas encore des probabilités. La fonction softmax les transforme en valeurs positives dont la somme vaut un. Cette transformation permet ensuite de tirer un candidat au hasard en respectant les probabilités obtenues.
À température égale à 1, le candidat « chat » reçoit environ 57,5 % de la probabilité. Cela veut dire que, si l’on répétait de nombreux tirages indépendants avec exactement cette distribution, sa fréquence tendrait vers cette valeur. Cela ne signifie ni que le mot est vrai, ni qu’il constitue une bonne réponse à une question. La capsule ne contient d’ailleurs aucune question factuelle permettant de juger sa pertinence.
Une manipulation guidée en trois temps
Commencez par conserver les quatre candidats et un seuil top-p égal à 1. Descendez la température de 1 à 0,5 et observez la première barre. La probabilité du candidat déjà favori augmente parce que la division par une température plus faible amplifie les écarts entre scores. Le classement ne change pas ; la concentration change.
Revenez ensuite à la température initiale, puis mettez top-k à 2. Deux candidats sont exclus. Les probabilités des survivants sont recalculées pour que leur somme reste égale à un. Enfin, baissez top-p : lorsque la probabilité cumulée du premier candidat suffit à atteindre le seuil, le second est lui aussi retiré.
Lire les tirages sans confondre hasard et erreur
Le bouton de tirage transforme la distribution en cent observations. Les comptes peuvent différer des pourcentages attendus, car un échantillon fini fluctue. Pour faciliter la comparaison, la capsule recommence avec la même graine pseudoaléatoire. Une véritable étude de variabilité utiliserait plusieurs graines et davantage de répétitions.
Avant de lire la conclusion, formulez votre propre prédiction : avec top-k égal à 1, un autre candidat peut-il apparaître ? Non, car sa probabilité finale est exactement nulle. Cette réponse découle du filtrage, pas de la qualité des connaissances d’un modèle.
À retenir
Une température basse concentre la probabilité sur les scores les plus élevés. Elle n’apporte aucune garantie de vérité.
Ordre des opérations
Température → softmax stable → top-k → renormalisation → top-p → renormalisation finale. Top-p conserve le plus petit préfixe atteignant le seuil ; les égalités suivent l’ordre initial des tokens.
p(i) = exp((z(i) − max(z)) / T) / Σ exp((z(j) − max(z)) / T)
Ce que cet exemple ne montre pas
Quatre scores construits ne représentent pas un vocabulaire complet. Cette capsule ne génère pas de texte et n’exécute aucun modèle. Les bibliothèques peuvent appliquer d’autres conventions de filtrage.