Transformers y LLM
Tokens, embeddings, atención y muestreo
Una arquitectura que permite a cada palabra mirar a todas las demás a la vez. Escalada a billones de tokens, produjo los grandes modelos de lenguaje.
Intuición
Primero, el texto se trocea en tokens: pedazos frecuentes de palabras aprendidos por BPE (fusionar repetidamente el par de símbolos más común). Cada token se convierte en un vector, su embedding, en un espacio donde la cercanía refleja el uso.
Luego viene la atención: cada posición formula una consulta (qué busco), expone una clave (qué ofrezco) y un valor (qué entrego). La similitud consulta–clave decide cuánto de cada valor se mezcla. «Ella» puede así mirar hacia atrás hasta «la ingeniera» sin recorrer la frase paso a paso.
Un modelo de lenguaje solo aprende a predecir el siguiente token. Para generar, se muestrea de su distribución: la temperatura la aplana o la afila, y top-p (Holtzman et al., 2019) corta la cola improbable. En el laboratorio un Transformer diminuto se entrena en tu navegador sobre texto en español.
Mecanismo
Atención de producto escalado: . En un modelo causal se enmascaran las posiciones futuras. Varias cabezas atienden a relaciones distintas en paralelo; luego una red densa por posición procesa cada vector. Conexiones residuales y normalización de capa estabilizan decenas de bloques.
Como la atención ignora el orden, se suma una codificación posicional (sinusoidal en el artículo original; rotaciones RoPE en muchos modelos actuales).
Las leyes de escala (Kaplan et al., 2020; Hoffmann et al., 2022) muestran que la pérdida cae como una potencia del cómputo, los datos y los parámetros. El ajuste con instrucciones y preferencias humanas (RLHF) convierte un predictor de texto en un asistente.
Laboratorio
Tokenizador BPE en vivo
Escribe un texto y observa cómo el algoritmo fusiona los pares más frecuentes, construyendo un vocabulario de subpalabras paso a paso.
Un Transformer diminuto, entrenado aquí
Atención causal de una capa entrenada con TensorFlow.js sobre un fragmento del Quijote. Visualiza la matriz de atención real y genera texto con temperatura y top-p.
Historia
- 1951
Shannon estima la entropía del inglés pidiendo a personas que predigan la siguiente letra.
Shannon (1951), Bell System Technical Journal 30
- 2003
Bengio et al. proponen el modelo neuronal de lenguaje con embeddings aprendidos.
Bengio, Ducharme, Vincent & Jauvin (2003), JMLR 3
- 2013
word2vec: rey − hombre + mujer ≈ reina.
Mikolov et al. (2013), arXiv:1301.3781
- 2016
Sennrich, Haddow y Birch adaptan BPE para tokenizar subpalabras en traducción.
Sennrich, Haddow & Birch (2016), ACL
- 2017
«Attention Is All You Need» presenta el Transformer.
Vaswani et al. (2017), NeurIPS
- 2018
GPT y BERT: preentrenar en texto masivo y ajustar después.
Radford et al. (2018), OpenAI; Devlin et al. (2019), NAACL
- 2020
GPT-3 (175 mil millones de parámetros) muestra aprendizaje en contexto con pocos ejemplos.
Brown et al. (2020), NeurIPS
- 2022
InstructGPT y ChatGPT: RLHF convierte el modelo en asistente conversacional.
Ouyang et al. (2022), NeurIPS
Límites
Costo cuadrático de la atención en la longitud del contexto.
Alucinaciones: generan texto plausible sin garantía de verdad.
Aprenden de texto, no del mundo: su anclaje a la realidad es indirecto.
Consumo energético y de datos enorme; la curva de escala exige órdenes de magnitud por cada mejora.
¿Predecir la siguiente palabra puede llegar a ser comprender?
Bender y Koller (2020) argumentan que un sistema entrenado solo con forma nunca accede al significado, como un pulpo que escucha un cable telegráfico. Otros responden que para predecir bien un texto hay que modelar al mundo y a las personas que lo escribieron.
Wittgenstein sostenía que el significado es el uso. Si un modelo usa las palabras como las usamos, ¿qué le falta? ¿Vida, cuerpo, intención, o nada?