Saltar al contenido
Nóesis
Todas las familias
F12Fronteradesde 2006

Autosupervisado y JEPA

Contrastivo, generativo y predicción en el espacio de representaciones

La mayor parte de lo que aprendemos no viene con etiquetas. El aprendizaje autosupervisado fabrica sus propias tareas a partir de los datos; JEPA propone que la tarea correcta es predecir representaciones, no píxeles.

2006
año fundacional
1
laboratorio
3
ecuaciones
7
hitos citados
Ir al laboratorio en vivo
Lámina F12semitono de dos tintas · en vivo
§1

Intuición

Lo que se investiga hoy: representación, memoria, control.

Tapa una parte de una foto y pide al modelo que la complete: ya tienes una tarea sin etiquetas humanas. Esa es la vía generativa (BERT enmascara palabras; MAE enmascara parches). El problema: predecir cada píxel obliga a modelar detalles impredecibles —la textura exacta de las hojas— que no importan.

La vía contrastiva (SimCLR, MoCo) pide que dos vistas aumentadas de la misma imagen tengan embeddings parecidos y que imágenes distintas los tengan lejanos. Funciona, pero necesita muchos negativos. Sin ellos, aparece el colapso: la solución trivial de mapear todo al mismo punto satisface la invariancia.

JEPA (Joint Embedding Predictive Architecture), propuesta por Yann LeCun en 2022, predice la representación de la parte oculta a partir de la representación del contexto. Evita el colapso sin negativos: con un codificador objetivo que es un promedio móvil (EMA) del codificador de contexto y un predictor, o con regularización de varianza y covarianza (VICReg). El laboratorio reproduce el colapso y sus remedios en vivo.

§2

Mecanismo

Arquitectura I-JEPA (Assran et al., 2023): un codificador de contexto sx=fθ(x)s_x = f_\theta(x), un codificador objetivo sy=fθˉ(y)s_y = f_{\bar\theta}(y) con θˉ←τθˉ+(1−τ)θ\bar\theta \leftarrow \tau\bar\theta + (1-\tau)\theta y un predictor gϕg_\phi. Pérdida: ∥gϕ(sx,z)−sg(sy)∥2\lVert g_\phi(s_x, z) - \mathrm{sg}(s_y)\rVert^2 en el espacio latente (sg\mathrm{sg} = sin gradiente; zz indica qué región predecir).

InfoNCE (Oord et al., 2018) maximiza una cota de información mutua: −log⁡esim(z,z+)/τ∑jesim(z,zj)/τ-\log \frac{e^{\mathrm{sim}(z,z^+)/\tau}}{\sum_{j} e^{\mathrm{sim}(z,z_j)/\tau}}. VICReg (Bardes, Ponce y LeCun, 2022) sustituye los negativos por tres términos: invariancia, varianza mínima por dimensión y covarianza nula entre dimensiones.

LeCun sitúa JEPA dentro de una arquitectura cognitiva mayor con un modelo de mundo predictivo: predecir en el espacio abstracto permite ignorar lo impredecible y planificar con lo relevante. V-JEPA (2024) y V-JEPA 2 (2025) extienden la idea a video.

Ec. 12.1Predicción en el espacio de embeddings
LJEPA=∥gϕ(fθ(x),z)−sg(fθˉ(y))∥22\mathcal{L}_{\text{JEPA}} = \big\lVert g_\phi\big(f_\theta(x), z\big) - \mathrm{sg}\big(f_{\bar\theta}(y)\big) \big\rVert_2^2
Ec. 12.2Pérdida contrastiva
LInfoNCE=−log⁡exp⁡(sim(zi,zi+)/τ)∑jexp⁡(sim(zi,zj)/τ)\mathcal{L}_{\text{InfoNCE}} = -\log \frac{\exp(\mathrm{sim}(z_i, z_i^+)/\tau)}{\sum_{j} \exp(\mathrm{sim}(z_i, z_j)/\tau)}
Ec. 12.3Término de varianza de VICReg (anticolapso)
v(Z)=1d∑j=1dmax⁡(0, γ−Var(Z:,j)+ϵ)v(Z) = \frac{1}{d}\sum_{j=1}^{d} \max\big(0,\ \gamma - \sqrt{\mathrm{Var}(Z_{:,j}) + \epsilon}\big)
§3

Laboratorio

Lab 12.1 calculado en tu navegadorDetectando…

Colapso y cómo evitarlo

Un codificador aprende sin etiquetas a partir de dos vistas aumentadas. Compara invariancia ingenua (colapsa), contrastiva, VICReg y predictor con EMA estilo JEPA. Los colores (clases ocultas) nunca se usan para entrenar.

§4

Historia

  1. 2006

    Hadsell, Chopra y LeCun: aprendizaje de métricas invariantes con pérdida contrastiva.

    Hadsell, Chopra & LeCun (2006), CVPR

  2. 2018

    Contrastive Predictive Coding introduce InfoNCE.

    van den Oord, Li & Vinyals (2018), arXiv:1807.03748

  3. 2020

    SimCLR y MoCo igualan al aprendizaje supervisado en ImageNet; BYOL evita negativos con un codificador EMA.

    Chen et al. (2020), ICML; He et al. (2020), CVPR; Grill et al. (2020), NeurIPS

  4. 2021

    DINO, Barlow Twins y los autoencoders enmascarados (MAE).

    Caron et al. (2021), ICCV; Zbontar et al. (2021), ICML; He et al. (2022), CVPR

  5. 2022

    LeCun publica «A Path Towards Autonomous Machine Intelligence», que propone JEPA; VICReg en ICLR.

    LeCun (2022), OpenReview; Bardes, Ponce & LeCun (2022), ICLR

  6. 2023

    I-JEPA aprende representaciones visuales prediciendo bloques en el espacio latente.

    Assran et al. (2023), CVPR

  7. 2024

    V-JEPA aplica la idea a video.

    Bardes et al. (2024), arXiv:2404.08471

§5

Límites

1

Evitar el colapso requiere trucos (EMA, predictores, regularizadores) cuya teoría todavía es incompleta.

2

La calidad de la representación se evalúa indirectamente, con tareas posteriores.

3

Las aumentaciones codifican qué invariancias importan: un sesgo diseñado a mano.

§6 · Pregunta filosófica

¿Aprender es predecir el mundo o predecir lo que importa del mundo?

La vía generativa apuesta por reconstruir la experiencia completa. JEPA apuesta por abstraer: predecir solo lo predecible. Es una idea con eco en la filosofía de la percepción de Gibson —percibimos affordances, lo que el entorno nos permite hacer— y en la hipótesis del cerebro predictivo.

Pero ¿quién decide qué es relevante? En JEPA, la relevancia emerge de lo que es predecible. ¿Es suficiente, o la relevancia depende de lo que un organismo necesita?

Familias conectadas