Saltar al contenido
Nóesis
Todas las familias
F09Actuar en el mundodesde 1957

Aprendizaje por refuerzo

Q-learning, gradientes de política, MCTS y AlphaGo

Nadie le dice al agente qué hacer: solo recibe recompensas, a menudo tarde y escasas. Aprender es descubrir qué acciones, en qué estados, llevan a más recompensa a largo plazo.

1957
año fundacional
3
laboratorios
3
ecuaciones
9
hitos citados
Ir al laboratorio en vivo
Lámina F09semitono de dos tintas · en vivo
§1

Intuición

Inteligencia como política: percibir, decidir, corregir.

Un ratón en un laberinto encuentra queso después de muchos giros. ¿Qué giro fue el bueno? Es el problema de la asignación de crédito temporal. La idea de Bellman es que el valor de un estado se puede definir recursivamente: la recompensa inmediata más el valor (descontado) del estado al que llegas.

Q-learning aprende el valor Q(s,a)Q(s,a) de cada acción en cada estado, corrigiéndolo con cada experiencia hacia «recompensa + mejor valor siguiente». Debe equilibrar explotar lo que sabe con explorar lo que no: la estrategia ε\varepsilon-codiciosa elige al azar una fracción del tiempo.

En juegos como el Go el árbol de posibilidades es astronómico (∼10170\sim10^{170} posiciones legales). La búsqueda de árbol Monte Carlo (MCTS) simula partidas y concentra el esfuerzo en las ramas prometedoras. AlphaGo (2016) combinó MCTS con redes que evalúan posiciones y proponen jugadas.

§2

Mecanismo

Un proceso de decisión de Markov (S,A,P,R,γ)(S, A, P, R, \gamma). La ecuación de Bellman óptima: Q∗(s,a)=E[r+γmax⁡a′Q∗(s′,a′)]Q^*(s,a) = \mathbb E[r + \gamma\max_{a'}Q^*(s',a')]. Q-learning (Watkins, 1989) hace una actualización de diferencia temporal hacia ese objetivo y converge bajo condiciones de exploración suficientes. DQN (Mnih et al., 2015) aproxima QQ con una red convolucional sobre píxeles de Atari.

Los gradientes de política optimizan directamente πθ(a∣s)\pi_\theta(a\mid s). REINFORCE (Williams, 1992) sube la probabilidad de las acciones en proporción al retorno obtenido: ∇J=E[∇log⁡πθ(a∣s) Gt]\nabla J = \mathbb E[\nabla\log\pi_\theta(a|s)\,G_t]. PPO (Schulman et al., 2017) recorta el cambio de política por paso y es hoy el caballo de batalla, incluido RLHF.

MCTS con UCT (Kocsis y Szepesvári, 2006) elige en cada nodo el hijo que maximiza valor medio + bono de exploración cln⁡N/nc\sqrt{\ln N / n}, expande, simula hasta el final y retropropaga el resultado. En el laboratorio juegas conecta-cuatro contra MCTS real y ves el conteo de visitas por columna.

Ec. 09.1Actualización de Q-learning
Q(s,a)←Q(s,a)+α[r+γmax⁡a′Q(s′,a′)−Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha\big[r + \gamma \max_{a'} Q(s',a') - Q(s,a)\big]
Ec. 09.2REINFORCE con línea base
∇θJ(θ)=Eπθ[∇θlog⁡πθ(at∣st) (Gt−b)]\nabla_\theta J(\theta) = \mathbb{E}_{\pi_\theta}\big[\nabla_\theta \log \pi_\theta(a_t|s_t)\,(G_t - b)\big]
Ec. 09.3Selección en MCTS
UCT(i)=wini+cln⁡Nni\mathrm{UCT}(i) = \frac{w_i}{n_i} + c\sqrt{\frac{\ln N}{n_i}}
§3

Laboratorio

Lab 09.1 calculado en tu navegadorDetectando…

Q-learning en un mundo de celdas

Pinta muros, trampas y metas. Observa cómo los valores Q se propagan hacia atrás desde la recompensa y emerge la política (flechas).

Lab 09.2 calculado en tu navegadorDetectando…

Conecta-cuatro contra MCTS

Juega contra una búsqueda de árbol Monte Carlo real. Ajusta el número de simulaciones y observa las visitas y la tasa de victoria estimada por columna.

Lab 09.3 calculado en tu navegadorDetectando…

REINFORCE equilibra un péndulo invertido

Un gradiente de política con red lineal aprende a mantener el carrito con la vara vertical. La física y el aprendizaje corren en vivo.

§4

Historia

  1. 1957

    Bellman publica Dynamic Programming.

    Bellman (1957), Princeton University Press

  2. 1959

    Arthur Samuel entrena un programa de damas que mejora jugando contra sí mismo.

    Samuel (1959), IBM J. Research and Development 3(3)

  3. 1988

    Sutton formaliza el aprendizaje por diferencias temporales.

    Sutton (1988), Machine Learning 3

  4. 1989

    Watkins introduce Q-learning en su tesis doctoral.

    Watkins (1989), tesis, Cambridge; Watkins & Dayan (1992), Machine Learning 8

  5. 1992

    TD-Gammon de Tesauro alcanza nivel de campeón en backgammon; Williams publica REINFORCE.

    Tesauro (1995), Comm. ACM 38(3); Williams (1992), Machine Learning 8

  6. 2015

    DQN juega 49 juegos de Atari desde los píxeles.

    Mnih et al. (2015), Nature 518

  7. 2016

    AlphaGo vence a Lee Sedol 4–1.

    Silver et al. (2016), Nature 529

  8. 2017

    AlphaGo Zero aprende sin partidas humanas; PPO se publica.

    Silver et al. (2017), Nature 550; Schulman et al. (2017), arXiv:1707.06347

  9. 2024

    Barto y Sutton reciben el premio Turing (anunciado en 2025) por los fundamentos del aprendizaje por refuerzo.

    ACM A.M. Turing Award 2024

§5

Límites

1

Ineficiencia muestral: millones de episodios para lo que un humano aprende en minutos.

2

Diseñar la recompensa es difícil; los agentes explotan fallas (reward hacking, Amodei et al., 2016).

3

Del simulador al mundo real hay una brecha considerable.

§6 · Pregunta filosófica

¿Todo lo que llamamos inteligencia es maximizar una recompensa?

Silver, Singh, Precup y Sutton defendieron en 2021 que «la recompensa es suficiente»: percepción, lenguaje e inteligencia social emergerían de maximizarla en entornos ricos.

Pero las metas humanas no parecen un número escalar: cambian, se contradicen, se descubren. Aristóteles distinguía la acción orientada a un fin externo (poíesis) de la que es su propio fin (práxis). ¿Puede un maximizador tener una práxis?

Familias conectadas