Modelos de mundo
Aprender la física del entorno para imaginar antes de actuar
Un agente que puede simular las consecuencias de sus acciones en la cabeza no necesita equivocarse en el mundo real para aprender.
Intuición
Kenneth Craik escribió en 1943 que el organismo lleva «un modelo a pequeña escala de la realidad externa» con el que prueba alternativas. Un modelo de mundo es exactamente eso: una red que aprende , cómo cambia el entorno cuando actúas.
Con un modelo aprendido se puede imaginar: desplegar trayectorias ficticias (rollouts) y elegir la acción cuyo futuro imaginado es mejor. Ha y Schmidhuber (2018) entrenaron un agente de carreras «dentro de su propio sueño» y transfirieron la política al entorno real.
El riesgo es que el sueño se aleje de la realidad: los errores del modelo se acumulan en cada paso imaginado. El laboratorio muestra esa divergencia en un péndulo: la física real y la imaginada por una red, lado a lado.
Mecanismo
World Models (Ha y Schmidhuber, 2018): un VAE (V) comprime cada imagen, una RNN con densidad mixta (M) predice el siguiente latente, y un controlador lineal diminuto (C) se entrena con CMA-ES dentro de M.
Dreamer (Hafner et al., 2020–2023) aprende un modelo de espacio de estados recurrente (RSSM) y entrena actor y crítico con gradientes a través de trayectorias imaginadas. DreamerV3 consiguió diamantes en Minecraft desde cero. MuZero (Schrittwieser et al., 2020) aprende un modelo que solo predice lo necesario para planificar con MCTS: recompensa, valor y política.
Genie (Bruce et al., 2024) aprende, a partir de videos sin acciones etiquetadas, un espacio de acciones latentes y un modelo que genera mundos jugables fotograma a fotograma. En el laboratorio, una red aprende la dinámica del péndulo a partir de interacciones aleatorias y luego planifica por random shooting dentro de su imaginación (control predictivo por modelo).
Laboratorio
El péndulo y su sueño
Recolecta experiencia, entrena la red de dinámica y compara la realidad con la imaginación desde el mismo estado. Luego deja que el agente planifique solo dentro de su modelo para levantar el péndulo.
Lenia: vida artificial continua
Un autómata celular continuo con kernel radial y mapa de crecimiento. Siembra patrones (Orbium) y observa morfologías emergentes al estilo de Chan (2019).
Historia
- 1943
Kenneth Craik propone que la mente construye modelos a escala de la realidad.
Craik (1943), The Nature of Explanation
- 1990
Schmidhuber entrena una red para modelar el mundo y otra para planificar con ella; Sutton propone Dyna (1991).
Schmidhuber (1990), FKI-126-90; Sutton (1991), SIGART Bulletin 2(4)
- 2018
Ha y Schmidhuber: «World Models», agentes que aprenden en sus sueños.
Ha & Schmidhuber (2018), NeurIPS; arXiv:1803.10122
- 2020
Dreamer aprende comportamientos por imaginación latente; MuZero domina Go, ajedrez y Atari sin conocer las reglas.
Hafner et al. (2020), ICLR; Schrittwieser et al. (2020), Nature 588
- 2023
DreamerV3 recolecta diamantes en Minecraft sin demostraciones humanas.
Hafner et al. (2023), arXiv:2301.04104
- 2024
Genie genera entornos interactivos desde una imagen; Genie 2 extiende la idea a 3D.
Bruce et al. (2024), ICML
Límites
Error compuesto: cuanto más largo el sueño, menos fiable.
El agente puede explotar errores del modelo (acciones que solo funcionan en la imaginación).
Modelar píxeles es caro y a menudo innecesario: de ahí las propuestas latentes como JEPA y MuZero.
¿Pensar es simular?
La tradición empirista pensaba la imaginación como recombinación de impresiones. La ciencia cognitiva actual la piensa como simulación predictiva. Kant, en cambio, le asignaba a la imaginación un papel trascendental: sintetizar la experiencia misma.
Si un agente planifica soñando, ¿tiene algo parecido a una imaginación? ¿Y qué diferencia hay entre imaginar y alucinar, si ambos son predicciones sin contacto con el mundo?