EL RECORRIDO · Intermedio
El taller de los LLM: reemplazar una activación para comprender
¿Se utiliza realmente una información visible dentro del modelo? Construye un contraste, mide una restauración y aprende a comprobar una explicación.
La pregunta: ¿una pieza útil o un simple testigo?
Imagina dos coches idénticos: uno arranca y el otro no. Trasladas una pieza del primero al segundo. Si este arranca, has aprendido mediante una intervención, más allá de la observación. El capítulo 9 del tomo II utiliza esta analogía para introducir el reemplazo de activaciones. La comparación orienta el procedimiento, sin convertir una red neuronal en un conjunto de piezas independientes.
El objetivo es concreto: comprender cómo comprobar el papel de un estado interno en una preferencia de salida. Distingue los pesos, conservados entre consultas, de las activaciones, valores calculados para una entrada. Sustituimos una activación durante una ejecución; no volvemos a entrenar los pesos.
Construir dos cálculos comparables
Considera «James y Sarah van a la tienda. James le da un libro a…». La destinataria esperada es Sarah. Si el segundo sujeto pasa a ser Sarah, James será el destinatario esperado. La condición limpia proporciona un estado donante; la condición corrupta lo recibe. Estos nombres describen el protocolo, no la calidad lingüística de las frases.
Ejecuta ambas entradas. En un sitio elegido —una capa y una posición de token— conserva el estado limpio. Después vuelve a ejecutar el cálculo corrupto y sustituye únicamente el estado de ese sitio por el conservado. Las capas siguientes continúan calculando. Las posiciones deben estar alineadas en la tokenización real: contar palabras no basta.
Elegir la medida antes de observar el resultado
Un logit es una puntuación anterior a la conversión en probabilidades. Medimos la diferencia entre los logits de los dos candidatos en la misma posición. Una diferencia positiva favorece al primero; una negativa, al segundo. La medida se refiere a un contraste definido, no a la calidad global del modelo.
Tomemos el ejemplo didáctico inventado del libro: −4 en la condición corrupta, +3 en la limpia y +1,5 después del reemplazo. La diferencia de referencia es 7. La intervención recupera 5,5 unidades: la restauración es 5,5 / 7, aproximadamente 0,79. No es una probabilidad de verdad del 79 %.
Tres comprobaciones que dan sentido al resultado
- El autorreemplazo devuelve el estado corrupto a su propio sitio. La puntuación debe mantenerse dentro de la tolerancia numérica. Si cambia, primero hay que reparar el montaje.
- Las perturbaciones de control de igual norma comprueban si cualquier desplazamiento de la misma magnitud produciría el efecto. Ayudan a distinguir la dirección de la intervención de su mera intensidad.
- El reemplazo inverso introduce el estado corrupto en el cálculo limpio. Completa el contraste sin exigir simetría en un sistema no lineal.
También hay que separar la selección del sitio de su validación. Si exploras veinte sitios y solo presentas el mejor sobre las mismas frases, has encontrado sobre todo el ganador de tu búsqueda. Elige con ejemplos de exploración y comprueba después con ejemplos diferentes.
Qué puedes concluir ahora
Una restauración acompañada de controles aporta evidencia del papel causal de la intervención definida en las condiciones probadas. No demuestra que el vector sustituido contenga un único concepto ni que se haya identificado el circuito completo. La ausencia de efecto también puede depender del sitio, de la medida o de vías redundantes.
En el cálculo siguiente, busca sucesivamente ausencia de efecto, restauración completa y un resultado superior a la referencia. Explica cada caso con la fórmula antes de abrir la solución. La herramienta calcula una proporción exacta a partir de valores elegidos; no ejecuta un LLM.
Tu turno: restaurar una preferencia
Dos ejecuciones sirven de referencia: −4 para la condición corrupta y +3 para la limpia. Mueve el resultado posterior al reemplazo. El control modifica un ejemplo numérico, no las activaciones de un modelo real.
(reemplazo − corrupta) / (limpia − corrupta)
Restauración normalizada :
El reemplazo recupera parte de la diferencia entre ambas condiciones. Este porcentaje no mide la probabilidad de una respuesta correcta ni una parte de la «comprensión».
Un sitio restaura el 80 % de la diferencia. ¿Hemos encontrado el mecanismo completo? — Ver el razonamiento
No. Hemos establecido un efecto de esta intervención sobre esta medida. Hay que verificar el montaje mediante autorreemplazo, comparar perturbaciones de control y probar ejemplos que no se hayan usado para elegir el sitio. Reemplazar un vector completo puede trasladar varias informaciones a la vez.