Interpretabilidad y alineamiento
Características, superposición, RLHF
Hemos construido sistemas que no entendemos del todo y que actúan en el mundo. Dos preguntas: ¿qué está pasando adentro?, y ¿cómo hacemos que quieran lo que queremos?
Intuición
La interpretabilidad mecanicista trata una red como un organismo por disecar: busca características (direcciones en el espacio de activaciones que representan conceptos) y circuitos (cómo se combinan). El obstáculo es que una neurona suele responder a muchas cosas no relacionadas: es polisemántica.
La hipótesis de superposición (Elhage et al., 2022) lo explica: si hay más características que dimensiones y las características son dispersas (rara vez activas a la vez), la red las empaqueta en direcciones casi ortogonales, aceptando algo de interferencia. El laboratorio entrena el modelo de juguete del artículo y verás pentágonos y antípodas aparecer cuando sube la dispersión.
El alineamiento busca que el sistema persiga los objetivos que pretendemos. El RLHF entrena un modelo de recompensa a partir de comparaciones humanas («esta respuesta es mejor que aquella») y optimiza la política contra él, sin alejarse demasiado del modelo original.
Mecanismo
Modelo de juguete de superposición: características dispersas se comprimen a dimensiones con y se reconstruyen con . Con importancias decrecientes y dispersión alta, las columnas de se ordenan en politopos regulares.
Para extraer características de modelos reales se entrenan autoencoders dispersos sobre las activaciones (Bricken et al., 2023; Templeton et al., 2024), que descomponen cada vector en unas pocas direcciones interpretables, como «Puente Golden Gate» o «código inseguro».
RLHF (Christiano et al., 2017; Ouyang et al., 2022): el modelo de recompensa se ajusta con la pérdida de Bradley-Terry sobre pares preferidos; la política se optimiza con PPO maximizando . DPO (Rafailov et al., 2023) obtiene la misma solución sin modelo de recompensa explícito.
Laboratorio
Superposición en un modelo de juguete
Cinco características comprimidas en dos dimensiones. Sube la dispersión y observa cómo la red pasa de guardar dos características a empaquetar las cinco en un pentágono.
Modelo de recompensa a partir de tus preferencias
Elige entre dos respuestas; un modelo de Bradley-Terry aprende qué atributos valoras. Luego una política con penalización KL se desplaza hacia tu recompensa.
Ataque adversario FGSM
Un clasificador 2D con frontera visible. El ataque FGSM empuja un punto a través de la frontera con el signo del gradiente; observa la perturbación mínima.
Historia
- 1952
Bradley y Terry proponen el modelo de comparaciones por pares.
Bradley & Terry (1952), Biometrika 39
- 1960
Norbert Wiener advierte sobre máquinas que persiguen objetivos mal especificados.
Wiener (1960), Science 131
- 2013
Zeiler y Fergus visualizan qué aprenden las capas de una CNN.
Zeiler & Fergus (2014), ECCV
- 2016
Amodei et al. publican «Concrete Problems in AI Safety».
Amodei et al. (2016), arXiv:1606.06565
- 2017
Aprendizaje por refuerzo a partir de preferencias humanas.
Christiano et al. (2017), NeurIPS
- 2020
«Zoom In» introduce el programa de circuitos en Distill.
Olah et al. (2020), Distill
- 2022
Toy Models of Superposition; InstructGPT; Constitutional AI.
Elhage et al. (2022), Transformer Circuits; Ouyang et al. (2022), NeurIPS; Bai et al. (2022), arXiv:2212.08073
- 2024
Autoencoders dispersos extraen millones de características de un modelo de producción.
Templeton et al. (2024), Scaling Monosemanticity, Transformer Circuits
Límites
No sabemos si las características encontradas son «las verdaderas» o artefactos del método.
La interpretabilidad escala peor que los modelos.
RLHF puede producir complacencia (sycophancy) y optimizar la apariencia de ayuda más que la ayuda.
El problema de fondo —especificar valores humanos— no es técnico solamente.
¿Qué significa que una máquina tenga «valores»?
El RLHF entrena preferencias a partir de juicios humanos agregados. Pero ¿de qué humanos? Los valores no son un dato: se disputan, cambian, dependen de la cultura. Alinear con «la humanidad» es una ficción que oculta decisiones políticas.
Y en interpretabilidad: si encontramos en la red una dirección que se activa ante el engaño, ¿hemos encontrado una intención, o solo una correlación con textos sobre engaño?