Modelos generativos
Difusión, GAN, VAE y espacio latente
Clasificar es trazar fronteras; generar es aprender la forma entera de los datos para poder producir ejemplos nuevos que nunca existieron.
Intuición
Un modelo generativo aprende una distribución : de qué manera se reparten las caras, los paisajes o las frases posibles. Hay tres grandes estrategias, y el laboratorio entrena las tres en tu navegador.
Un autoencoder variacional (VAE) comprime cada ejemplo a unas pocas coordenadas —el espacio latente— y aprende a reconstruirlo desde ahí; al forzar que ese espacio sea una nube gaussiana ordenada, cualquier punto del latente se decodifica en algo plausible. Pasear por el latente es morfear entre ejemplos.
Una GAN enfrenta a dos redes: un generador que falsifica y un discriminador que detecta falsificaciones. La difusión hace algo más paciente: destruye los datos añadiendo ruido gaussiano en muchos pasos y entrena una red para deshacer un paso a la vez. Generar es partir de ruido puro y limpiarlo gradualmente.
Mecanismo
VAE (Kingma y Welling, 2013): maximiza una cota inferior de la verosimilitud (ELBO): reconstrucción menos la divergencia KL entre el codificador y el prior . El truco de reparametrización permite retropropagar a través del muestreo.
GAN (Goodfellow et al., 2014): un juego minimax . En el equilibrio ideal, el generador reproduce la distribución real. En la práctica: inestabilidad y colapso de modos (el generador aprende a producir solo una parte de la variedad).
Difusión (Sohl-Dickstein et al., 2015; Ho et al., 2020): el proceso hacia adelante tiene forma cerrada. Una red aprende a predecir el ruido; el muestreo invierte la cadena. Equivale a aprender el score en cada nivel de ruido (Song y Ermon, 2019).
Laboratorio
Difusión en 2D, entrenada en vivo
Una red aprende a quitar ruido a nubes de puntos con forma de espiral, anillos o de las letras «IA». Luego genera desde ruido puro, paso a paso.
GAN: generador contra discriminador
El generador (rojo) persigue la distribución real (azul). El fondo muestra el discriminador. Observa oscilaciones y colapso de modos.
VAE y paseo por el espacio latente
Un VAE aprende figuras de 16×16 con un latente de 2 dimensiones. Mueve el cursor sobre el latente para decodificar en vivo.
Historia
- 2013
Kingma y Welling presentan el autoencoder variacional.
Kingma & Welling (2014), ICLR, arXiv:1312.6114
- 2014
Goodfellow et al. inventan las redes generativas adversariales.
Goodfellow et al. (2014), NeurIPS
- 2015
Sohl-Dickstein et al. proponen modelos de difusión inspirados en termodinámica fuera del equilibrio.
Sohl-Dickstein et al. (2015), ICML
- 2019
StyleGAN genera rostros fotorrealistas; Song y Ermon introducen modelos basados en score.
Karras, Laine & Aila (2019), CVPR; Song & Ermon (2019), NeurIPS
- 2020
DDPM de Ho, Jain y Abbeel hace competitiva la difusión en imágenes.
Ho, Jain & Abbeel (2020), NeurIPS
- 2022
Difusión latente (Stable Diffusion), DALL·E 2 e Imagen llevan la generación de imágenes desde texto al público.
Rombach et al. (2022), CVPR; Ramesh et al. (2022), arXiv:2204.06125
Límites
Las GAN son inestables y colapsan modos; los VAE producen muestras borrosas; la difusión es lenta al muestrear (muchos pasos).
Memorización de ejemplos de entrenamiento y problemas de derechos de autor.
Evaluar la calidad es difícil: métricas como FID capturan solo parte de lo que percibimos.
¿Es creativo un sistema que muestrea de lo que ya existe?
Margaret Boden distinguió creatividad combinatoria, exploratoria y transformacional. Un modelo generativo explora con maestría el espacio aprendido; ¿puede transformarlo, crear el estilo que aún no existe?
Walter Benjamin habló del aura que la reproducción técnica le quita a la obra. Con la generación, lo que se reproduce ya no es una obra sino una distribución de obras posibles.