O PERCURSO · Intermediário
A oficina dos LLM: substituir uma ativação para compreender
Uma informação visível dentro do modelo é realmente usada? Construa um contraste, meça uma restauração e aprenda a testar uma explicação.
A pergunta: uma peça útil ou apenas uma testemunha?
Imagine dois carros idênticos: um liga, o outro não. Você transfere uma peça do primeiro para o segundo. Se ele passa a ligar, você aprendeu por intervenção, além da simples observação. O capítulo 9 do tomo II usa essa analogia para introduzir a substituição de ativações. Ela orienta o procedimento, sem transformar uma rede neural em um conjunto de peças independentes.
O objetivo é específico: entender como testar o papel de um estado interno em uma preferência de saída. Distinga os pesos, preservados entre consultas, das ativações, valores calculados para determinada entrada. Substituímos uma ativação durante uma execução; não treinamos novamente os pesos.
Construir dois cálculos comparáveis
Considere “James e Sarah vão à loja. James dá um livro para…”. A destinatária esperada é Sarah. Se o segundo sujeito passa a ser Sarah, James torna-se o destinatário esperado. A condição limpa fornece um estado doador; a condição corrompida o recebe. Esses nomes descrevem o protocolo, não a qualidade linguística das frases.
Execute as duas entradas. Em um local escolhido —uma camada e uma posição de token— guarde o estado limpo. Depois execute novamente o cálculo corrompido, substituindo apenas o estado desse local pelo estado guardado. As camadas seguintes continuam calculando. As posições precisam estar alinhadas na tokenização real: contar palavras não basta.
Escolher a medida antes de observar o resultado
Um logit é uma pontuação anterior à conversão em probabilidades. Medimos a diferença entre os logits dos dois candidatos na mesma posição. Uma diferença positiva favorece o primeiro; uma negativa favorece o segundo. Essa medida trata de um contraste definido, não da qualidade geral do modelo.
Usemos o exemplo didático inventado do livro: −4 na condição corrompida, +3 na limpa e +1,5 após a substituição. A diferença de referência é 7. A intervenção recupera 5,5 unidades: a restauração é 5,5 / 7, aproximadamente 0,79. Não se trata de uma probabilidade de verdade de 79%.
Três verificações que dão sentido ao resultado
- A autossubstituição recoloca o estado corrompido em seu próprio lugar. A pontuação deve permanecer igual, dentro da tolerância numérica. Caso mude, é preciso corrigir a montagem primeiro.
- As perturbações de controle de mesma norma testam se qualquer deslocamento da mesma magnitude produziria o efeito. Ajudam a distinguir a direção da intervenção de sua mera intensidade.
- A substituição inversa transfere o estado corrompido para o cálculo limpo. Ela complementa o contraste, sem exigir simetria em um sistema não linear.
A escolha do local também precisa ser separada da validação. Se você explora vinte locais e apresenta apenas o melhor nas mesmas frases, encontrou sobretudo o vencedor da busca. Escolha com exemplos de descoberta e depois verifique com outros exemplos.
O que você pode concluir agora
Uma restauração acompanhada de controles sustenta o papel causal da intervenção definida nas condições testadas. Não demonstra que o vetor substituído contenha um único conceito nem que o circuito completo tenha sido identificado. A ausência de efeito também pode depender do local, da medida ou de caminhos redundantes.
No cálculo abaixo, procure sucessivamente ausência de efeito, restauração completa e ultrapassagem da referência. Explique cada caso pela fórmula antes de abrir a resposta. A ferramenta calcula uma razão exata a partir de valores escolhidos; ela não executa um LLM.
Sua vez: restaurar uma preferência
Duas execuções servem de referência: −4 para a condição corrompida e +3 para a limpa. Mova o resultado após a substituição. O controle altera um exemplo numérico, não as ativações de um modelo real.
(substituição − corrompida) / (limpa − corrompida)
Restauração normalizada :
A substituição recupera parte da diferença entre as duas condições. Essa porcentagem não mede a probabilidade de uma resposta correta nem uma parcela de “compreensão”.
Um local restaura 80% da diferença. Encontramos o mecanismo completo? — Ver o raciocínio
Não. Estabelecemos um efeito desta intervenção sobre esta medida. É preciso verificar a montagem com autossubstituição, comparar perturbações de controle e testar exemplos que não foram usados para escolher o local. Substituir um vetor inteiro pode deslocar várias informações ao mesmo tempo.