Saltar al contenido
Nóesis
Todas las familias
F13Fronteradesde 1990

Modelos de mundo

Aprender la física del entorno para imaginar antes de actuar

Un agente que puede simular las consecuencias de sus acciones en la cabeza no necesita equivocarse en el mundo real para aprender.

1990
año fundacional
2
laboratorios
3
ecuaciones
6
hitos citados
Ir al laboratorio en vivo
Lámina F13semitono de dos tintas · en vivo
§1

Intuición

Lo que se investiga hoy: representación, memoria, control.

Kenneth Craik escribió en 1943 que el organismo lleva «un modelo a pequeña escala de la realidad externa» con el que prueba alternativas. Un modelo de mundo es exactamente eso: una red que aprende st+1≈f(st,at)s_{t+1} \approx f(s_t, a_t), cómo cambia el entorno cuando actúas.

Con un modelo aprendido se puede imaginar: desplegar trayectorias ficticias (rollouts) y elegir la acción cuyo futuro imaginado es mejor. Ha y Schmidhuber (2018) entrenaron un agente de carreras «dentro de su propio sueño» y transfirieron la política al entorno real.

El riesgo es que el sueño se aleje de la realidad: los errores del modelo se acumulan en cada paso imaginado. El laboratorio muestra esa divergencia en un péndulo: la física real y la imaginada por una red, lado a lado.

§2

Mecanismo

World Models (Ha y Schmidhuber, 2018): un VAE (V) comprime cada imagen, una RNN con densidad mixta (M) predice el siguiente latente, y un controlador lineal diminuto (C) se entrena con CMA-ES dentro de M.

Dreamer (Hafner et al., 2020–2023) aprende un modelo de espacio de estados recurrente (RSSM) y entrena actor y crítico con gradientes a través de trayectorias imaginadas. DreamerV3 consiguió diamantes en Minecraft desde cero. MuZero (Schrittwieser et al., 2020) aprende un modelo que solo predice lo necesario para planificar con MCTS: recompensa, valor y política.

Genie (Bruce et al., 2024) aprende, a partir de videos sin acciones etiquetadas, un espacio de acciones latentes y un modelo que genera mundos jugables fotograma a fotograma. En el laboratorio, una red aprende la dinámica del péndulo a partir de interacciones aleatorias y luego planifica por random shooting dentro de su imaginación (control predictivo por modelo).

Ec. 13.1Modelo de dinámica residual
s^t+1=st+fθ(st,at),L=∥st+1−s^t+1∥2\hat s_{t+1} = s_t + f_\theta(s_t, a_t), \qquad \mathcal{L} = \lVert s_{t+1} - \hat s_{t+1}\rVert^2
Ec. 13.2Planificación por imaginación (MPC)
at∗=arg⁡max⁡at:t+H∑k=0Hr(s^t+k)a_t^* = \arg\max_{a_{t:t+H}} \sum_{k=0}^{H} r\big(\hat s_{t+k}\big)
Ec. 13.3Acumulación de error (L: constante de Lipschitz del modelo)
∥s^t+H−st+H∥≲ϵ LH−1L−1\lVert \hat s_{t+H} - s_{t+H} \rVert \lesssim \epsilon\,\frac{L^H - 1}{L - 1}
§3

Laboratorio

Lab 13.1 calculado en tu navegadorDetectando…

El péndulo y su sueño

Recolecta experiencia, entrena la red de dinámica y compara la realidad con la imaginación desde el mismo estado. Luego deja que el agente planifique solo dentro de su modelo para levantar el péndulo.

Lab 13.2 calculado en tu navegadorDetectando…

Lenia: vida artificial continua

Un autómata celular continuo con kernel radial y mapa de crecimiento. Siembra patrones (Orbium) y observa morfologías emergentes al estilo de Chan (2019).

§4

Historia

  1. 1943

    Kenneth Craik propone que la mente construye modelos a escala de la realidad.

    Craik (1943), The Nature of Explanation

  2. 1990

    Schmidhuber entrena una red para modelar el mundo y otra para planificar con ella; Sutton propone Dyna (1991).

    Schmidhuber (1990), FKI-126-90; Sutton (1991), SIGART Bulletin 2(4)

  3. 2018

    Ha y Schmidhuber: «World Models», agentes que aprenden en sus sueños.

    Ha & Schmidhuber (2018), NeurIPS; arXiv:1803.10122

  4. 2020

    Dreamer aprende comportamientos por imaginación latente; MuZero domina Go, ajedrez y Atari sin conocer las reglas.

    Hafner et al. (2020), ICLR; Schrittwieser et al. (2020), Nature 588

  5. 2023

    DreamerV3 recolecta diamantes en Minecraft sin demostraciones humanas.

    Hafner et al. (2023), arXiv:2301.04104

  6. 2024

    Genie genera entornos interactivos desde una imagen; Genie 2 extiende la idea a 3D.

    Bruce et al. (2024), ICML

§5

Límites

1

Error compuesto: cuanto más largo el sueño, menos fiable.

2

El agente puede explotar errores del modelo (acciones que solo funcionan en la imaginación).

3

Modelar píxeles es caro y a menudo innecesario: de ahí las propuestas latentes como JEPA y MuZero.

§6 · Pregunta filosófica

¿Pensar es simular?

La tradición empirista pensaba la imaginación como recombinación de impresiones. La ciencia cognitiva actual la piensa como simulación predictiva. Kant, en cambio, le asignaba a la imaginación un papel trascendental: sintetizar la experiencia misma.

Si un agente planifica soñando, ¿tiene algo parecido a una imaginación? ¿Y qué diferencia hay entre imaginar y alucinar, si ambos son predicciones sin contacto con el mundo?

Familias conectadas