Autosupervisado y JEPA
Contrastivo, generativo y predicción en el espacio de representaciones
La mayor parte de lo que aprendemos no viene con etiquetas. El aprendizaje autosupervisado fabrica sus propias tareas a partir de los datos; JEPA propone que la tarea correcta es predecir representaciones, no píxeles.
Intuición
Tapa una parte de una foto y pide al modelo que la complete: ya tienes una tarea sin etiquetas humanas. Esa es la vía generativa (BERT enmascara palabras; MAE enmascara parches). El problema: predecir cada píxel obliga a modelar detalles impredecibles —la textura exacta de las hojas— que no importan.
La vía contrastiva (SimCLR, MoCo) pide que dos vistas aumentadas de la misma imagen tengan embeddings parecidos y que imágenes distintas los tengan lejanos. Funciona, pero necesita muchos negativos. Sin ellos, aparece el colapso: la solución trivial de mapear todo al mismo punto satisface la invariancia.
JEPA (Joint Embedding Predictive Architecture), propuesta por Yann LeCun en 2022, predice la representación de la parte oculta a partir de la representación del contexto. Evita el colapso sin negativos: con un codificador objetivo que es un promedio móvil (EMA) del codificador de contexto y un predictor, o con regularización de varianza y covarianza (VICReg). El laboratorio reproduce el colapso y sus remedios en vivo.
Mecanismo
Arquitectura I-JEPA (Assran et al., 2023): un codificador de contexto , un codificador objetivo con y un predictor . Pérdida: en el espacio latente ( = sin gradiente; indica qué región predecir).
InfoNCE (Oord et al., 2018) maximiza una cota de información mutua: . VICReg (Bardes, Ponce y LeCun, 2022) sustituye los negativos por tres términos: invariancia, varianza mínima por dimensión y covarianza nula entre dimensiones.
LeCun sitúa JEPA dentro de una arquitectura cognitiva mayor con un modelo de mundo predictivo: predecir en el espacio abstracto permite ignorar lo impredecible y planificar con lo relevante. V-JEPA (2024) y V-JEPA 2 (2025) extienden la idea a video.
Laboratorio
Colapso y cómo evitarlo
Un codificador aprende sin etiquetas a partir de dos vistas aumentadas. Compara invariancia ingenua (colapsa), contrastiva, VICReg y predictor con EMA estilo JEPA. Los colores (clases ocultas) nunca se usan para entrenar.
Historia
- 2006
Hadsell, Chopra y LeCun: aprendizaje de métricas invariantes con pérdida contrastiva.
Hadsell, Chopra & LeCun (2006), CVPR
- 2018
Contrastive Predictive Coding introduce InfoNCE.
van den Oord, Li & Vinyals (2018), arXiv:1807.03748
- 2020
SimCLR y MoCo igualan al aprendizaje supervisado en ImageNet; BYOL evita negativos con un codificador EMA.
Chen et al. (2020), ICML; He et al. (2020), CVPR; Grill et al. (2020), NeurIPS
- 2021
DINO, Barlow Twins y los autoencoders enmascarados (MAE).
Caron et al. (2021), ICCV; Zbontar et al. (2021), ICML; He et al. (2022), CVPR
- 2022
LeCun publica «A Path Towards Autonomous Machine Intelligence», que propone JEPA; VICReg en ICLR.
LeCun (2022), OpenReview; Bardes, Ponce & LeCun (2022), ICLR
- 2023
I-JEPA aprende representaciones visuales prediciendo bloques en el espacio latente.
Assran et al. (2023), CVPR
- 2024
V-JEPA aplica la idea a video.
Bardes et al. (2024), arXiv:2404.08471
Límites
Evitar el colapso requiere trucos (EMA, predictores, regularizadores) cuya teoría todavía es incompleta.
La calidad de la representación se evalúa indirectamente, con tareas posteriores.
Las aumentaciones codifican qué invariancias importan: un sesgo diseñado a mano.
¿Aprender es predecir el mundo o predecir lo que importa del mundo?
La vía generativa apuesta por reconstruir la experiencia completa. JEPA apuesta por abstraer: predecir solo lo predecible. Es una idea con eco en la filosofía de la percepción de Gibson —percibimos affordances, lo que el entorno nos permite hacer— y en la hipótesis del cerebro predictivo.
Pero ¿quién decide qué es relevante? En JEPA, la relevancia emerge de lo que es predecible. ¿Es suficiente, o la relevancia depende de lo que un organismo necesita?