← capítulo

El algoritmo EM

k-means toma una decisión dura por cada punto. EM se niega a adivinar — le entrega a cada punto una probabilidad de pertenecer a cada grupo.

Expectation-Maximization: la receta que carga el peso de los problemas de variables latentes y datos faltantes.

El huevo y la gallina

Las matemáticas

Paso E — responsabilidad del componente kk por el punto ii:

γik=πkN(xiμk,σk2)jπjN(xiμj,σj2)\gamma_{ik} = \frac{\pi_k\, \mathcal{N}(x_i \mid \mu_k, \sigma_k^2)}{\sum_j \pi_j\, \mathcal{N}(x_i \mid \mu_j, \sigma_j^2)}

Paso M — actualizaciones ponderadas por responsabilidad:

πk=1Niγik,μk=iγikxiiγik\pi_k = \frac{1}{N}\sum_i \gamma_{ik}, \quad \mu_k = \frac{\sum_i \gamma_{ik} x_i}{\sum_i \gamma_{ik}}

Míralo converger

Dos campanas peleándose por una columna de números. Puntos coloreados por responsabilidad suave; la log-verosimilitud sube — y nunca cae.

La garantía

La promesa central de EM: la log-verosimilitud nunca decrece. No "casi siempre" — nunca, en cada iteración, de forma demostrable.

Esa subida monótona es la razón entera por la que se confía en el método.

Desde cero contra librería

Ajusta desde un arranque deliberadamente malo; aterriza en la misma respuesta que sklearn.mixture.GaussianMixture.

Conclusiones