LE PARCOURS · Intermédiaire
Le garage des LLM : remplacer une activation pour comprendre
Une information visible dans un modèle est-elle utilisée ? Construisez un contraste, mesurez une restauration et apprenez à tester une explication.
La question : une pièce utile, ou un simple témoin ?
Imaginez deux voitures identiques : l’une démarre, l’autre non. Vous transférez une pièce de la première vers la seconde. Si celle-ci démarre ensuite, vous avez appris quelque chose par une intervention, au-delà d’une simple observation. Le chapitre 9 du tome II utilise cette analogie pour introduire le remplacement d’activation. Elle guide le geste, sans faire d’un réseau neuronal un assemblage de pièces indépendantes.
Notre objectif est précis : comprendre comment tester le rôle d’un état interne dans une préférence de sortie. Il faut déjà distinguer les poids, conservés entre les requêtes, des activations, valeurs calculées pour une entrée donnée. Ici, nous remplaçons une activation pendant une exécution ; nous ne réentraînons pas les poids.
Construire deux calculs comparables
Considérez « James et Sarah vont au magasin. James donne un livre à… ». La réponse attendue est Sarah. Si le second sujet devient Sarah, James devient le destinataire attendu. La condition dite propre fournit un état donneur ; la condition dite corrompue reçoit cet état. Ces noms décrivent le protocole, pas la qualité linguistique des phrases.
On exécute les deux entrées. À un site choisi — une couche et une position de token — on conserve l’état propre. On relance ensuite le calcul corrompu et l’on remplace uniquement l’état de ce site par l’état conservé. Les couches suivantes poursuivent leur calcul. Les positions doivent être alignées dans la tokenisation réelle : compter des mots ne suffit pas.
Choisir la mesure avant de regarder le résultat
Un logit est un score avant la conversion en probabilités. Nous mesurons la différence entre les logits des deux candidats à la même position. Une différence positive favorise le premier ; une différence négative favorise le second. Cette mesure porte sur un contraste défini, pas sur la qualité générale du modèle.
Prenons les nombres inventés à des fins pédagogiques du livre : −4 dans la condition corrompue, +3 dans la condition propre, +1,5 après remplacement. L’écart de référence vaut 7. L’intervention a parcouru 5,5 unités de cet écart : la restauration vaut 5,5 / 7, soit environ 0,79. Il ne s’agit pas d’une probabilité de vérité de 79 %.
Trois vérifications qui donnent du sens au résultat
- L’auto-remplacement remet l’état corrompu à sa propre place. Le score doit rester identique à la tolérance numérique près. Sinon, il faut d’abord réparer le montage.
- Les perturbations témoins de même norme testent si n’importe quel déplacement de même amplitude suffirait à produire l’effet. Elles aident à distinguer la direction de l’intervention de sa seule force.
- L’intervention inverse transfère l’état corrompu dans le calcul propre. Elle complète le contraste, sans imposer une symétrie dans un système non linéaire.
Le choix du site doit aussi être séparé de sa validation. Si vous explorez vingt sites puis ne rapportez que le meilleur sur les mêmes phrases, vous avez surtout trouvé le meilleur de votre recherche. Choisissez sur des exemples de découverte, puis vérifiez sur d’autres exemples.
Ce que vous pouvez désormais conclure
Une restauration accompagnée de contrôles étaye le rôle causal de l’intervention définie dans les conditions testées. Elle ne démontre pas que le vecteur remplacé contient une seule notion, ni que le circuit complet a été identifié. Une absence d’effet peut également dépendre du site, de la mesure ou de chemins redondants.
Dans le calcul ci-dessous, cherchez successivement une absence d’effet, une restauration complète et un dépassement. Expliquez chaque cas avec la formule avant d’ouvrir la correction. Le dispositif calcule un rapport exact sur des valeurs choisies ; il n’exécute aucun LLM.
À vous de jouer : restaurer une préférence
Deux calculs servent de repères : −4 pour la condition corrompue et +3 pour la condition propre. Déplacez le résultat après remplacement. Le curseur modifie un exemple numérique, pas les activations d’un véritable modèle.
(après − corrompu) / (propre − corrompu)
Restauration normalisée :
Le remplacement retrouve une partie de l’écart entre les deux conditions. Ce pourcentage ne mesure ni une probabilité de réponse juste, ni une part de « compréhension ».
Un site restaure 80 % de l’écart. Avons-nous trouvé le mécanisme complet ? — Voir le raisonnement
Non. Nous avons établi un effet de cette intervention sur cette mesure. Il faut vérifier le montage par auto-remplacement, comparer des perturbations témoins et tester des exemples non utilisés pour choisir le site. Remplacer un vecteur entier peut déplacer plusieurs informations à la fois.