Modelos probabilísticos
Redes bayesianas, cadenas ocultas de Markov, inferencia
Cuando el mundo es incierto, razonar no es deducir sino actualizar creencias. La probabilidad es la lógica del sentido común con grados.
Intuición
Te despiertas y el césped está mojado. ¿Llovió o se encendió el aspersor? Si luego ves que la calle está seca, la lluvia se vuelve menos creíble y el aspersor, más: una evidencia sobre una causa «explica» el efecto y debilita a la otra causa. Este patrón, llamado explaining away, es imposible de capturar con reglas rígidas y natural en probabilidad.
Una red bayesiana dibuja las dependencias como un grafo dirigido: cada nodo es una variable y cada flecha, una influencia causal o estadística. El grafo dice qué es independiente de qué, y eso permite escribir una distribución sobre muchas variables con pocos números.
Un modelo oculto de Markov (HMM) hace lo mismo en el tiempo: hay un estado que no vemos (el clima, el fonema, la palabra gramatical) que evoluciona y emite observaciones ruidosas. Inferir es reconstruir la historia oculta más plausible.
Mecanismo
La regla de Bayes invierte la dirección del condicionamiento: . En una red bayesiana la distribución conjunta se factoriza como producto de probabilidades locales, . La inferencia exacta suma sobre las variables no observadas (enumeración, eliminación de variables, árbol de uniones); en el laboratorio se hace por enumeración completa, sin trucos.
Cuando la suma es intratable se usa inferencia aproximada: muestreo de Monte Carlo por cadenas de Markov (Metropolis 1953, Gibbs sampling según Geman y Geman 1984) o métodos variacionales que convierten la inferencia en optimización.
En un HMM, el algoritmo forward calcula la probabilidad de las observaciones sumando sobre todos los caminos ocultos en tiempo ; Viterbi (1967) reemplaza la suma por un máximo y recupera la secuencia oculta más probable; Baum-Welch (un caso de EM) aprende las matrices de transición y emisión.
Laboratorio
Red bayesiana: lluvia, aspersor y césped
Fija evidencia haciendo clic en los nodos. Las probabilidades posteriores se recalculan por enumeración exacta de la distribución conjunta.
HMM y Viterbi
Un estado oculto (soleado o lluvioso) genera observaciones. Compara la verdad oculta con la reconstrucción de Viterbi y la marginal forward-backward.
Historia
- 1763
Se publica póstumamente el ensayo de Thomas Bayes sobre la probabilidad inversa, presentado por Richard Price.
Bayes (1763), Phil. Trans. Royal Society 53
- 1953
Metropolis, Rosenbluth, Rosenbluth, Teller y Teller introducen el muestreo que hoy llamamos MCMC.
Metropolis et al. (1953), J. Chem. Phys. 21
- 1966
Baum y Petrie formalizan los modelos ocultos de Markov; un año después aparece el algoritmo de Viterbi.
Baum & Petrie (1966), Ann. Math. Stat. 37; Viterbi (1967), IEEE Trans. Inf. Theory 13
- 1977
Dempster, Laird y Rubin unifican el algoritmo EM para modelos con variables latentes.
Dempster, Laird & Rubin (1977), JRSS-B 39
- 1988
Judea Pearl publica Probabilistic Reasoning in Intelligent Systems: nacen formalmente las redes bayesianas en IA.
Pearl (1988), Morgan Kaufmann
- 1989
El tutorial de Rabiner populariza los HMM en reconocimiento de voz, que dominarán el campo dos décadas.
Rabiner (1989), Proc. IEEE 77(2)
- 2011
Pearl recibe el premio Turing por sus contribuciones al razonamiento probabilístico y causal.
ACM A.M. Turing Award 2011
Límites
La inferencia exacta en redes generales es NP-difícil (Cooper, 1990).
Hay que especificar la estructura: qué variables existen y cómo se relacionan. Aprenderla de datos es difícil.
Los HMM tienen memoria de un solo paso: el futuro depende del presente, no de la historia.
Correlación no es causalidad: una red bayesiana solo es causal si se interpreta como tal y se valida con intervenciones.
¿Son las probabilidades grados de creencia o frecuencias del mundo?
Para el frecuentista, describe lo que pasa en muchas repeticiones. Para el bayesiano (De Finetti, Ramsey), describe cuánto estaría dispuesto a apostar un agente racional. La IA probabilística es profundamente bayesiana: sus máquinas tienen creencias.
Pearl dio un paso más: la probabilidad no basta; hace falta una escalera causal —asociación, intervención, contrafáctico— para responder «¿qué habría pasado si...?». ¿Puede una máquina subir esa escalera solo observando datos?