Saltar al contenido
Nóesis
Todas las familias
F07Redes que aprendendesde 2017

Transformers y LLM

Tokens, embeddings, atención y muestreo

Una arquitectura que permite a cada palabra mirar a todas las demás a la vez. Escalada a billones de tokens, produjo los grandes modelos de lenguaje.

2017
año fundacional
2
laboratorios
3
ecuaciones
8
hitos citados
Ir al laboratorio en vivo
Lámina F07semitono de dos tintas · en vivo
§1

Intuición

Pensar es ajustar millones de conexiones.

Primero, el texto se trocea en tokens: pedazos frecuentes de palabras aprendidos por BPE (fusionar repetidamente el par de símbolos más común). Cada token se convierte en un vector, su embedding, en un espacio donde la cercanía refleja el uso.

Luego viene la atención: cada posición formula una consulta (qué busco), expone una clave (qué ofrezco) y un valor (qué entrego). La similitud consulta–clave decide cuánto de cada valor se mezcla. «Ella» puede así mirar hacia atrás hasta «la ingeniera» sin recorrer la frase paso a paso.

Un modelo de lenguaje solo aprende a predecir el siguiente token. Para generar, se muestrea de su distribución: la temperatura la aplana o la afila, y top-p (Holtzman et al., 2019) corta la cola improbable. En el laboratorio un Transformer diminuto se entrena en tu navegador sobre texto en español.

§2

Mecanismo

Atención de producto escalado: Attn(Q,K,V)=softmax(QK⊤/dk) V\mathrm{Attn}(Q,K,V) = \mathrm{softmax}(QK^\top/\sqrt{d_k})\,V. En un modelo causal se enmascaran las posiciones futuras. Varias cabezas atienden a relaciones distintas en paralelo; luego una red densa por posición procesa cada vector. Conexiones residuales y normalización de capa estabilizan decenas de bloques.

Como la atención ignora el orden, se suma una codificación posicional (sinusoidal en el artículo original; rotaciones RoPE en muchos modelos actuales).

Las leyes de escala (Kaplan et al., 2020; Hoffmann et al., 2022) muestran que la pérdida cae como una potencia del cómputo, los datos y los parámetros. El ajuste con instrucciones y preferencias humanas (RLHF) convierte un predictor de texto en un asistente.

Ec. 07.1Atención causal (M enmascara el futuro)
Attn(Q,K,V)=softmax ⁣(QK⊤dk+M)V\mathrm{Attn}(Q,K,V) = \mathrm{softmax}\!\Big(\frac{QK^\top}{\sqrt{d_k}} + M\Big)V
Ec. 07.2Muestreo con temperatura T
pi=exp⁡(zi/T)∑jexp⁡(zj/T)p_i = \frac{\exp(z_i/T)}{\sum_j \exp(z_j/T)}
Ec. 07.3Objetivo de modelado del lenguaje
L=−∑tlog⁡pθ(xt∣x<t)\mathcal{L} = -\sum_{t} \log p_\theta(x_t \mid x_{<t})
§3

Laboratorio

Lab 07.1 calculado en tu navegadorDetectando…

Tokenizador BPE en vivo

Escribe un texto y observa cómo el algoritmo fusiona los pares más frecuentes, construyendo un vocabulario de subpalabras paso a paso.

Lab 07.2 calculado en tu navegadorDetectando…

Un Transformer diminuto, entrenado aquí

Atención causal de una capa entrenada con TensorFlow.js sobre un fragmento del Quijote. Visualiza la matriz de atención real y genera texto con temperatura y top-p.

§4

Historia

  1. 1951

    Shannon estima la entropía del inglés pidiendo a personas que predigan la siguiente letra.

    Shannon (1951), Bell System Technical Journal 30

  2. 2003

    Bengio et al. proponen el modelo neuronal de lenguaje con embeddings aprendidos.

    Bengio, Ducharme, Vincent & Jauvin (2003), JMLR 3

  3. 2013

    word2vec: rey − hombre + mujer ≈ reina.

    Mikolov et al. (2013), arXiv:1301.3781

  4. 2016

    Sennrich, Haddow y Birch adaptan BPE para tokenizar subpalabras en traducción.

    Sennrich, Haddow & Birch (2016), ACL

  5. 2017

    «Attention Is All You Need» presenta el Transformer.

    Vaswani et al. (2017), NeurIPS

  6. 2018

    GPT y BERT: preentrenar en texto masivo y ajustar después.

    Radford et al. (2018), OpenAI; Devlin et al. (2019), NAACL

  7. 2020

    GPT-3 (175 mil millones de parámetros) muestra aprendizaje en contexto con pocos ejemplos.

    Brown et al. (2020), NeurIPS

  8. 2022

    InstructGPT y ChatGPT: RLHF convierte el modelo en asistente conversacional.

    Ouyang et al. (2022), NeurIPS

§5

Límites

1

Costo cuadrático de la atención en la longitud del contexto.

2

Alucinaciones: generan texto plausible sin garantía de verdad.

3

Aprenden de texto, no del mundo: su anclaje a la realidad es indirecto.

4

Consumo energético y de datos enorme; la curva de escala exige órdenes de magnitud por cada mejora.

§6 · Pregunta filosófica

¿Predecir la siguiente palabra puede llegar a ser comprender?

Bender y Koller (2020) argumentan que un sistema entrenado solo con forma nunca accede al significado, como un pulpo que escucha un cable telegráfico. Otros responden que para predecir bien un texto hay que modelar al mundo y a las personas que lo escribieron.

Wittgenstein sostenía que el significado es el uso. Si un modelo usa las palabras como las usamos, ¿qué le falta? ¿Vida, cuerpo, intención, o nada?

Familias conectadas