El algoritmo EM
k-means toma una decisión dura por cada punto. EM se niega a adivinar — le
entrega a cada punto una probabilidad de pertenecer a cada grupo.
Expectation-Maximization: la receta que carga el peso de los problemas de
variables latentes y datos faltantes.
El huevo y la gallina
- Si supieras qué gaussiana generó cada punto, ajustar las gaussianas es cosa de una línea.
- Si conocieras las gaussianas, adivinar las etiquetas es cosa de una línea.
- No sabes ni una cosa ni la otra. Así que alterna:
- Paso E — adivina las etiquetas de forma suave a partir de las gaussianas actuales (responsabilidades).
- Paso M — reajusta las gaussianas a partir de esas etiquetas suaves.
- Repite hasta que los números dejen de moverse.
Las matemáticas
Paso E — responsabilidad del componente k por el punto i:
γik=∑jπjN(xi∣μj,σj2)πkN(xi∣μk,σk2)
Paso M — actualizaciones ponderadas por responsabilidad:
πk=N1i∑γik,μk=∑iγik∑iγikxi
Míralo converger
Dos campanas peleándose por una columna de números. Puntos coloreados por
responsabilidad suave; la log-verosimilitud sube — y nunca cae.
La garantía
La promesa central de EM: la log-verosimilitud nunca decrece. No "casi
siempre" — nunca, en cada iteración, de forma demostrable.
Esa subida monótona es la razón entera por la que se confía en el método.
Desde cero contra librería
Ajusta desde un arranque deliberadamente malo; aterriza en la misma respuesta
que sklearn.mixture.GaussianMixture.
- Medias: desde cero [−1.92,3.09] contra librería [−1.92,3.09]
- Log-verosimilitud: −681.48 para ambos; ARI de etiquetas suaves 0.87
- Las medias generadoras verdaderas eran [−2.0,3.0] — recuperadas.
Conclusiones
- EM es el método al que acudes para problemas de variables latentes y datos faltantes.
- Solo encuentra un óptimo local — la inicialización importa; reinicia y quédate con el mejor.
- Está debajo de las mezclas gaussianas, los modelos de temas y los HMM.
- Siguiente: la historia completa en 2-D con elipses de covarianza inclinadas — modelos de mezclas gaussianas.