Aprendizaje por refuerzo
Q-learning, gradientes de política, MCTS y AlphaGo
Nadie le dice al agente qué hacer: solo recibe recompensas, a menudo tarde y escasas. Aprender es descubrir qué acciones, en qué estados, llevan a más recompensa a largo plazo.
Intuición
Un ratón en un laberinto encuentra queso después de muchos giros. ¿Qué giro fue el bueno? Es el problema de la asignación de crédito temporal. La idea de Bellman es que el valor de un estado se puede definir recursivamente: la recompensa inmediata más el valor (descontado) del estado al que llegas.
Q-learning aprende el valor de cada acción en cada estado, corrigiéndolo con cada experiencia hacia «recompensa + mejor valor siguiente». Debe equilibrar explotar lo que sabe con explorar lo que no: la estrategia -codiciosa elige al azar una fracción del tiempo.
En juegos como el Go el árbol de posibilidades es astronómico ( posiciones legales). La búsqueda de árbol Monte Carlo (MCTS) simula partidas y concentra el esfuerzo en las ramas prometedoras. AlphaGo (2016) combinó MCTS con redes que evalúan posiciones y proponen jugadas.
Mecanismo
Un proceso de decisión de Markov . La ecuación de Bellman óptima: . Q-learning (Watkins, 1989) hace una actualización de diferencia temporal hacia ese objetivo y converge bajo condiciones de exploración suficientes. DQN (Mnih et al., 2015) aproxima con una red convolucional sobre píxeles de Atari.
Los gradientes de política optimizan directamente . REINFORCE (Williams, 1992) sube la probabilidad de las acciones en proporción al retorno obtenido: . PPO (Schulman et al., 2017) recorta el cambio de política por paso y es hoy el caballo de batalla, incluido RLHF.
MCTS con UCT (Kocsis y Szepesvári, 2006) elige en cada nodo el hijo que maximiza valor medio + bono de exploración , expande, simula hasta el final y retropropaga el resultado. En el laboratorio juegas conecta-cuatro contra MCTS real y ves el conteo de visitas por columna.
Laboratorio
Q-learning en un mundo de celdas
Pinta muros, trampas y metas. Observa cómo los valores Q se propagan hacia atrás desde la recompensa y emerge la política (flechas).
Conecta-cuatro contra MCTS
Juega contra una búsqueda de árbol Monte Carlo real. Ajusta el número de simulaciones y observa las visitas y la tasa de victoria estimada por columna.
REINFORCE equilibra un péndulo invertido
Un gradiente de política con red lineal aprende a mantener el carrito con la vara vertical. La física y el aprendizaje corren en vivo.
Historia
- 1957
Bellman publica Dynamic Programming.
Bellman (1957), Princeton University Press
- 1959
Arthur Samuel entrena un programa de damas que mejora jugando contra sí mismo.
Samuel (1959), IBM J. Research and Development 3(3)
- 1988
Sutton formaliza el aprendizaje por diferencias temporales.
Sutton (1988), Machine Learning 3
- 1989
Watkins introduce Q-learning en su tesis doctoral.
Watkins (1989), tesis, Cambridge; Watkins & Dayan (1992), Machine Learning 8
- 1992
TD-Gammon de Tesauro alcanza nivel de campeón en backgammon; Williams publica REINFORCE.
Tesauro (1995), Comm. ACM 38(3); Williams (1992), Machine Learning 8
- 2015
DQN juega 49 juegos de Atari desde los píxeles.
Mnih et al. (2015), Nature 518
- 2016
AlphaGo vence a Lee Sedol 4–1.
Silver et al. (2016), Nature 529
- 2017
AlphaGo Zero aprende sin partidas humanas; PPO se publica.
Silver et al. (2017), Nature 550; Schulman et al. (2017), arXiv:1707.06347
- 2024
Barto y Sutton reciben el premio Turing (anunciado en 2025) por los fundamentos del aprendizaje por refuerzo.
ACM A.M. Turing Award 2024
Límites
Ineficiencia muestral: millones de episodios para lo que un humano aprende en minutos.
Diseñar la recompensa es difícil; los agentes explotan fallas (reward hacking, Amodei et al., 2016).
Del simulador al mundo real hay una brecha considerable.
¿Todo lo que llamamos inteligencia es maximizar una recompensa?
Silver, Singh, Precup y Sutton defendieron en 2021 que «la recompensa es suficiente»: percepción, lenguaje e inteligencia social emergerían de maximizarla en entornos ricos.
Pero las metas humanas no parecen un número escalar: cambian, se contradicen, se descubren. Aristóteles distinguía la acción orientada a un fin externo (poíesis) de la que es su propio fin (práxis). ¿Puede un maximizador tener una práxis?