Definición
Procedimiento iterativo para estimación por máxima verosimilitud (o máxima a posteriori) de parámetros en modelos probabilísticos con variables latentes (no observadas) que alterna entre calcular estadísticos suficientes esperados dados los parámetros actuales (paso E) y optimizar parámetros para maximizar la esperanza del log-verosímil de datos completos (paso M).

Principio

Principio
Aprovechar la descomposición de la verosimilitud de datos observados como una esperanza sobre variables latentes y la verosimilitud de datos completos; alternar la esperanza de los estadísticos suficientes de las variables latentes bajo la estimación actual de parámetros y la maximización del objetivo esperado de datos completos para incrementar monotónicamente (o no disminuir) la verosimilitud observada.

Demostración

Demostración
Estimación de parámetros de un modelo de mezcla gaussiana calculando iterativamente las responsabilidades posteriores de cada componente para los puntos de datos en el paso E y actualizando pesos de mezcla, medias y covarianzas en el paso M hasta convergencia o estancamiento de la verosimilitud.

Aplicación incorrecta

Aplicación incorrecta
Confiar en EM con inicialización aleatoria pobre o sin supervisión de criterios de convergencia, lo que puede llevar a converger a máximos locales subóptimos, una convergencia muy lenta cerca de puntos de silla, o estimaciones de covarianza singulares en modelos de mezcla sin regularización.

Consecuencia

Consecuencia
Cuando es aplicable y está correctamente inicializado con pasos E y M tratables, EM ofrece un esquema simple y frecuentemente fiable que aumenta la verosimilitud en cada iteración, maneja naturalmente datos faltantes o latentes y produce estimaciones de parámetros interpretables en el marco de datos completos.

Inversión

Inversión
Realizar maximización directa de la verosimilitud incompleta con optimizadores basados en gradiente o usar inferencia variacional / aproximaciones de esperanza por Monte Carlo; estas alternativas invierten EM al optimizar directamente la verosimilitud incompleta o aproximar distribuciones posteriores en lugar de alternar esperanza y maximización.

Límite

Límite
Requiere que el paso E (esperanza bajo los parámetros actuales) y el paso M (maximización de la esperanza del log-verosímil completo) sean computables en forma cerrada o aproximables de forma práctica; solo garantiza convergencia a puntos estacionarios, no a máximos globales; el rendimiento es sensible a la inicialización e identificabilidad del modelo.

Tensión semántica

Tensión semántica
Tensión con la optimización directa por gradientes y métodos variacionales: EM proporciona mejora monótona de la verosimilitud y una estructura modular E/M, pero puede ser más lento y quedar atrapado en máximos locales, mientras que enfoques por gradiente o variacionales pueden escapar de óptimos locales o proporcionar cuantificación de incertidumbre a costa de mayor complejidad.

Síntesis

Síntesis
Marco de alternancia de esperanza y maximización que aprovecha la estructura de variables latentes para incrementar iterativamente la verosimilitud observada calculando esperanzas condicionales de variables ocultas y luego optimizando parámetros respecto a esas esperanzas.