Saltar al contenido
Nóesis
Todas las familias
F21Fronteradesde 2013

Interpretabilidad y alineamiento

Características, superposición, RLHF

Hemos construido sistemas que no entendemos del todo y que actúan en el mundo. Dos preguntas: ¿qué está pasando adentro?, y ¿cómo hacemos que quieran lo que queremos?

2013
año fundacional
3
laboratorios
3
ecuaciones
8
hitos citados
Ir al laboratorio en vivo
Lámina F21semitono de dos tintas · en vivo
§1

Intuición

Lo que se investiga hoy: representación, memoria, control.

La interpretabilidad mecanicista trata una red como un organismo por disecar: busca características (direcciones en el espacio de activaciones que representan conceptos) y circuitos (cómo se combinan). El obstáculo es que una neurona suele responder a muchas cosas no relacionadas: es polisemántica.

La hipótesis de superposición (Elhage et al., 2022) lo explica: si hay más características que dimensiones y las características son dispersas (rara vez activas a la vez), la red las empaqueta en direcciones casi ortogonales, aceptando algo de interferencia. El laboratorio entrena el modelo de juguete del artículo y verás pentágonos y antípodas aparecer cuando sube la dispersión.

El alineamiento busca que el sistema persiga los objetivos que pretendemos. El RLHF entrena un modelo de recompensa a partir de comparaciones humanas («esta respuesta es mejor que aquella») y optimiza la política contra él, sin alejarse demasiado del modelo original.

§2

Mecanismo

Modelo de juguete de superposición: nn características dispersas x∈Rnx \in \mathbb R^n se comprimen a m<nm < n dimensiones con h=Wxh = Wx y se reconstruyen con x^=ReLU(W⊤h+b)\hat x = \mathrm{ReLU}(W^\top h + b). Con importancias decrecientes y dispersión alta, las columnas de WW se ordenan en politopos regulares.

Para extraer características de modelos reales se entrenan autoencoders dispersos sobre las activaciones (Bricken et al., 2023; Templeton et al., 2024), que descomponen cada vector en unas pocas direcciones interpretables, como «Puente Golden Gate» o «código inseguro».

RLHF (Christiano et al., 2017; Ouyang et al., 2022): el modelo de recompensa se ajusta con la pérdida de Bradley-Terry sobre pares preferidos; la política se optimiza con PPO maximizando r(x,y)−β KL(π∥πref)r(x,y) - \beta\,\mathrm{KL}(\pi\|\pi_{\text{ref}}). DPO (Rafailov et al., 2023) obtiene la misma solución sin modelo de recompensa explícito.

Ec. 21.1Modelo de juguete de superposición
x^=ReLU(W⊤Wx+b),L=∑iIi (xi−x^i)2\hat{x} = \mathrm{ReLU}(W^\top W x + b), \quad \mathcal{L} = \sum_i I_i\,(x_i - \hat x_i)^2
Ec. 21.2Modelo de Bradley-Terry para preferencias
P(yw≻yl)=σ(r(yw)−r(yl))P(y_w \succ y_l) = \sigma\big(r(y_w) - r(y_l)\big)
Ec. 21.3Objetivo de RLHF
max⁡π E[r(x,y)]−β KL(π(⋅∣x) ∥ πref(⋅∣x))\max_\pi\ \mathbb{E}\big[r(x,y)\big] - \beta\,\mathrm{KL}\big(\pi(\cdot|x)\,\|\,\pi_{\text{ref}}(\cdot|x)\big)
§3

Laboratorio

Lab 21.1 calculado en tu navegadorDetectando…

Superposición en un modelo de juguete

Cinco características comprimidas en dos dimensiones. Sube la dispersión y observa cómo la red pasa de guardar dos características a empaquetar las cinco en un pentágono.

Lab 21.2 calculado en tu navegadorDetectando…

Modelo de recompensa a partir de tus preferencias

Elige entre dos respuestas; un modelo de Bradley-Terry aprende qué atributos valoras. Luego una política con penalización KL se desplaza hacia tu recompensa.

Lab 21.3 calculado en tu navegadorDetectando…

Ataque adversario FGSM

Un clasificador 2D con frontera visible. El ataque FGSM empuja un punto a través de la frontera con el signo del gradiente; observa la perturbación mínima.

§4

Historia

  1. 1952

    Bradley y Terry proponen el modelo de comparaciones por pares.

    Bradley & Terry (1952), Biometrika 39

  2. 1960

    Norbert Wiener advierte sobre máquinas que persiguen objetivos mal especificados.

    Wiener (1960), Science 131

  3. 2013

    Zeiler y Fergus visualizan qué aprenden las capas de una CNN.

    Zeiler & Fergus (2014), ECCV

  4. 2016

    Amodei et al. publican «Concrete Problems in AI Safety».

    Amodei et al. (2016), arXiv:1606.06565

  5. 2017

    Aprendizaje por refuerzo a partir de preferencias humanas.

    Christiano et al. (2017), NeurIPS

  6. 2020

    «Zoom In» introduce el programa de circuitos en Distill.

    Olah et al. (2020), Distill

  7. 2022

    Toy Models of Superposition; InstructGPT; Constitutional AI.

    Elhage et al. (2022), Transformer Circuits; Ouyang et al. (2022), NeurIPS; Bai et al. (2022), arXiv:2212.08073

  8. 2024

    Autoencoders dispersos extraen millones de características de un modelo de producción.

    Templeton et al. (2024), Scaling Monosemanticity, Transformer Circuits

§5

Límites

1

No sabemos si las características encontradas son «las verdaderas» o artefactos del método.

2

La interpretabilidad escala peor que los modelos.

3

RLHF puede producir complacencia (sycophancy) y optimizar la apariencia de ayuda más que la ayuda.

4

El problema de fondo —especificar valores humanos— no es técnico solamente.

§6 · Pregunta filosófica

¿Qué significa que una máquina tenga «valores»?

El RLHF entrena preferencias a partir de juicios humanos agregados. Pero ¿de qué humanos? Los valores no son un dato: se disputan, cambian, dependen de la cultura. Alinear con «la humanidad» es una ficción que oculta decisiones políticas.

Y en interpretabilidad: si encontramos en la red una dirección que se activa ante el engaño, ¿hemos encontrado una intención, o solo una correlación con textos sobre engaño?

Familias conectadas