Saltar al contenido
Nóesis
Todas las familias
F08Modelos que imaginandesde 2013

Modelos generativos

Difusión, GAN, VAE y espacio latente

Clasificar es trazar fronteras; generar es aprender la forma entera de los datos para poder producir ejemplos nuevos que nunca existieron.

2013
año fundacional
3
laboratorios
3
ecuaciones
6
hitos citados
Ir al laboratorio en vivo
Lámina F08semitono de dos tintas · en vivo
§1

Intuición

Aprender una distribución para poder muestrearla.

Un modelo generativo aprende una distribución p(x)p(x): de qué manera se reparten las caras, los paisajes o las frases posibles. Hay tres grandes estrategias, y el laboratorio entrena las tres en tu navegador.

Un autoencoder variacional (VAE) comprime cada ejemplo a unas pocas coordenadas —el espacio latente— y aprende a reconstruirlo desde ahí; al forzar que ese espacio sea una nube gaussiana ordenada, cualquier punto del latente se decodifica en algo plausible. Pasear por el latente es morfear entre ejemplos.

Una GAN enfrenta a dos redes: un generador que falsifica y un discriminador que detecta falsificaciones. La difusión hace algo más paciente: destruye los datos añadiendo ruido gaussiano en muchos pasos y entrena una red para deshacer un paso a la vez. Generar es partir de ruido puro y limpiarlo gradualmente.

§2

Mecanismo

VAE (Kingma y Welling, 2013): maximiza una cota inferior de la verosimilitud (ELBO): reconstrucción menos la divergencia KL entre el codificador q(z∣x)q(z\mid x) y el prior N(0,I)\mathcal N(0, I). El truco de reparametrización z=μ+σ⊙ϵz = \mu + \sigma\odot\epsilon permite retropropagar a través del muestreo.

GAN (Goodfellow et al., 2014): un juego minimax min⁡Gmax⁡D E[log⁡D(x)]+E[log⁡(1−D(G(z)))]\min_G \max_D\ \mathbb E[\log D(x)] + \mathbb E[\log(1 - D(G(z)))]. En el equilibrio ideal, el generador reproduce la distribución real. En la práctica: inestabilidad y colapso de modos (el generador aprende a producir solo una parte de la variedad).

Difusión (Sohl-Dickstein et al., 2015; Ho et al., 2020): el proceso hacia adelante xt=αˉt x0+1−αˉt ϵx_t = \sqrt{\bar\alpha_t}\,x_0 + \sqrt{1-\bar\alpha_t}\,\epsilon tiene forma cerrada. Una red ϵθ(xt,t)\epsilon_\theta(x_t, t) aprende a predecir el ruido; el muestreo invierte la cadena. Equivale a aprender el score ∇xlog⁡p(x)\nabla_x \log p(x) en cada nivel de ruido (Song y Ermon, 2019).

Ec. 08.1Objetivo del VAE
LELBO=Eq(z∣x)[log⁡p(x∣z)]−KL(q(z∣x) ∥ N(0,I))\mathcal{L}_{\text{ELBO}} = \mathbb{E}_{q(z|x)}[\log p(x|z)] - \mathrm{KL}\big(q(z|x)\,\|\,\mathcal N(0,I)\big)
Ec. 08.2Juego adversarial de la GAN
min⁡Gmax⁡D Ex[log⁡D(x)]+Ez[log⁡(1−D(G(z)))]\min_G\max_D\ \mathbb{E}_{x}[\log D(x)] + \mathbb{E}_{z}[\log(1 - D(G(z)))]
Ec. 08.3Pérdida de difusión (DDPM)
Lsimple=Et,x0,ϵ∥ϵ−ϵθ(αˉtx0+1−αˉt ϵ, t)∥2\mathcal{L}_{\text{simple}} = \mathbb{E}_{t,x_0,\epsilon}\big\lVert \epsilon - \epsilon_\theta\big(\sqrt{\bar\alpha_t}x_0 + \sqrt{1-\bar\alpha_t}\,\epsilon,\ t\big)\big\rVert^2
§3

Laboratorio

Lab 08.1 calculado en tu navegadorDetectando…

Difusión en 2D, entrenada en vivo

Una red aprende a quitar ruido a nubes de puntos con forma de espiral, anillos o de las letras «IA». Luego genera desde ruido puro, paso a paso.

Lab 08.2 calculado en tu navegadorDetectando…

GAN: generador contra discriminador

El generador (rojo) persigue la distribución real (azul). El fondo muestra el discriminador. Observa oscilaciones y colapso de modos.

Lab 08.3 calculado en tu navegadorDetectando…

VAE y paseo por el espacio latente

Un VAE aprende figuras de 16×16 con un latente de 2 dimensiones. Mueve el cursor sobre el latente para decodificar en vivo.

§4

Historia

  1. 2013

    Kingma y Welling presentan el autoencoder variacional.

    Kingma & Welling (2014), ICLR, arXiv:1312.6114

  2. 2014

    Goodfellow et al. inventan las redes generativas adversariales.

    Goodfellow et al. (2014), NeurIPS

  3. 2015

    Sohl-Dickstein et al. proponen modelos de difusión inspirados en termodinámica fuera del equilibrio.

    Sohl-Dickstein et al. (2015), ICML

  4. 2019

    StyleGAN genera rostros fotorrealistas; Song y Ermon introducen modelos basados en score.

    Karras, Laine & Aila (2019), CVPR; Song & Ermon (2019), NeurIPS

  5. 2020

    DDPM de Ho, Jain y Abbeel hace competitiva la difusión en imágenes.

    Ho, Jain & Abbeel (2020), NeurIPS

  6. 2022

    Difusión latente (Stable Diffusion), DALL·E 2 e Imagen llevan la generación de imágenes desde texto al público.

    Rombach et al. (2022), CVPR; Ramesh et al. (2022), arXiv:2204.06125

§5

Límites

1

Las GAN son inestables y colapsan modos; los VAE producen muestras borrosas; la difusión es lenta al muestrear (muchos pasos).

2

Memorización de ejemplos de entrenamiento y problemas de derechos de autor.

3

Evaluar la calidad es difícil: métricas como FID capturan solo parte de lo que percibimos.

§6 · Pregunta filosófica

¿Es creativo un sistema que muestrea de lo que ya existe?

Margaret Boden distinguió creatividad combinatoria, exploratoria y transformacional. Un modelo generativo explora con maestría el espacio aprendido; ¿puede transformarlo, crear el estilo que aún no existe?

Walter Benjamin habló del aura que la reproducción técnica le quita a la obra. Con la generación, lo que se reproduce ya no es una obra sino una distribución de obras posibles.

Familias conectadas