Saltar al contenido
Nóesis
Todas las familias
F02Incertidumbre y datosdesde 1985

Modelos probabilísticos

Redes bayesianas, cadenas ocultas de Markov, inferencia

Cuando el mundo es incierto, razonar no es deducir sino actualizar creencias. La probabilidad es la lógica del sentido común con grados.

1985
año fundacional
2
laboratorios
3
ecuaciones
7
hitos citados
Ir al laboratorio en vivo
Lámina F02semitono de dos tintas · en vivo
§1

Intuición

Pensar es estimar, con probabilidades y ejemplos.

Te despiertas y el césped está mojado. ¿Llovió o se encendió el aspersor? Si luego ves que la calle está seca, la lluvia se vuelve menos creíble y el aspersor, más: una evidencia sobre una causa «explica» el efecto y debilita a la otra causa. Este patrón, llamado explaining away, es imposible de capturar con reglas rígidas y natural en probabilidad.

Una red bayesiana dibuja las dependencias como un grafo dirigido: cada nodo es una variable y cada flecha, una influencia causal o estadística. El grafo dice qué es independiente de qué, y eso permite escribir una distribución sobre muchas variables con pocos números.

Un modelo oculto de Markov (HMM) hace lo mismo en el tiempo: hay un estado que no vemos (el clima, el fonema, la palabra gramatical) que evoluciona y emite observaciones ruidosas. Inferir es reconstruir la historia oculta más plausible.

§2

Mecanismo

La regla de Bayes invierte la dirección del condicionamiento: P(H∣E)∝P(E∣H) P(H)P(H\mid E) \propto P(E\mid H)\,P(H). En una red bayesiana la distribución conjunta se factoriza como producto de probabilidades locales, P(X1,…,Xn)=∏iP(Xi∣padres(Xi))P(X_1,\dots,X_n) = \prod_i P(X_i \mid \text{padres}(X_i)). La inferencia exacta suma sobre las variables no observadas (enumeración, eliminación de variables, árbol de uniones); en el laboratorio se hace por enumeración completa, sin trucos.

Cuando la suma es intratable se usa inferencia aproximada: muestreo de Monte Carlo por cadenas de Markov (Metropolis 1953, Gibbs sampling según Geman y Geman 1984) o métodos variacionales que convierten la inferencia en optimización.

En un HMM, el algoritmo forward calcula la probabilidad de las observaciones sumando sobre todos los caminos ocultos en tiempo O(TK2)O(TK^2); Viterbi (1967) reemplaza la suma por un máximo y recupera la secuencia oculta más probable; Baum-Welch (un caso de EM) aprende las matrices de transición y emisión.

Ec. 02.1Regla de Bayes
P(H∣E)=P(E∣H) P(H)∑hP(E∣h) P(h)P(H \mid E) = \frac{P(E \mid H)\,P(H)}{\sum_{h} P(E \mid h)\,P(h)}
Ec. 02.2Factorización de una red bayesiana
P(X1,…,Xn)=∏i=1nP(Xi∣Pa(Xi))P(X_1,\dots,X_n) = \prod_{i=1}^{n} P\big(X_i \mid \mathrm{Pa}(X_i)\big)
Ec. 02.3Recursión de Viterbi
δt(j)=max⁡i[δt−1(i) aij]  bj(ot)\delta_t(j) = \max_i \big[\delta_{t-1}(i)\, a_{ij}\big]\; b_j(o_t)
§3

Laboratorio

Lab 02.1 calculado en tu navegadorDetectando…

Red bayesiana: lluvia, aspersor y césped

Fija evidencia haciendo clic en los nodos. Las probabilidades posteriores se recalculan por enumeración exacta de la distribución conjunta.

Lab 02.2 calculado en tu navegadorDetectando…

HMM y Viterbi

Un estado oculto (soleado o lluvioso) genera observaciones. Compara la verdad oculta con la reconstrucción de Viterbi y la marginal forward-backward.

§4

Historia

  1. 1763

    Se publica póstumamente el ensayo de Thomas Bayes sobre la probabilidad inversa, presentado por Richard Price.

    Bayes (1763), Phil. Trans. Royal Society 53

  2. 1953

    Metropolis, Rosenbluth, Rosenbluth, Teller y Teller introducen el muestreo que hoy llamamos MCMC.

    Metropolis et al. (1953), J. Chem. Phys. 21

  3. 1966

    Baum y Petrie formalizan los modelos ocultos de Markov; un año después aparece el algoritmo de Viterbi.

    Baum & Petrie (1966), Ann. Math. Stat. 37; Viterbi (1967), IEEE Trans. Inf. Theory 13

  4. 1977

    Dempster, Laird y Rubin unifican el algoritmo EM para modelos con variables latentes.

    Dempster, Laird & Rubin (1977), JRSS-B 39

  5. 1988

    Judea Pearl publica Probabilistic Reasoning in Intelligent Systems: nacen formalmente las redes bayesianas en IA.

    Pearl (1988), Morgan Kaufmann

  6. 1989

    El tutorial de Rabiner populariza los HMM en reconocimiento de voz, que dominarán el campo dos décadas.

    Rabiner (1989), Proc. IEEE 77(2)

  7. 2011

    Pearl recibe el premio Turing por sus contribuciones al razonamiento probabilístico y causal.

    ACM A.M. Turing Award 2011

§5

Límites

1

La inferencia exacta en redes generales es NP-difícil (Cooper, 1990).

2

Hay que especificar la estructura: qué variables existen y cómo se relacionan. Aprenderla de datos es difícil.

3

Los HMM tienen memoria de un solo paso: el futuro depende del presente, no de la historia.

4

Correlación no es causalidad: una red bayesiana solo es causal si se interpreta como tal y se valida con intervenciones.

§6 · Pregunta filosófica

¿Son las probabilidades grados de creencia o frecuencias del mundo?

Para el frecuentista, P=0,3P = 0{,}3 describe lo que pasa en muchas repeticiones. Para el bayesiano (De Finetti, Ramsey), describe cuánto estaría dispuesto a apostar un agente racional. La IA probabilística es profundamente bayesiana: sus máquinas tienen creencias.

Pearl dio un paso más: la probabilidad no basta; hace falta una escalera causal —asociación, intervención, contrafáctico— para responder «¿qué habría pasado si...?». ¿Puede una máquina subir esa escalera solo observando datos?

Familias conectadas