Définition
Procédure itérative d'estimation du maximum de vraisemblance (ou maximum a posteriori) pour des modèles probabilistes contenant des variables latentes (non observées) qui alterne entre le calcul des statistiques suffisantes conditionnelles aux paramètres courants (E‑étape) et l'optimisation des paramètres pour maximiser l'espérance du log-vraisemblance des données complètes (M‑étape).

Principe

Principe
Exploiter la décomposition de la vraisemblance observée en une espérance sur les variables latentes et la vraisemblance des données complètes ; alterner l'espérance des statistiques suffisantes des variables latentes sous l'estimation courante des paramètres et la maximisation de l'objectif espéré des données complètes pour augmenter de façon monotone (ou non diminuer) la vraisemblance observée.

Démonstration

Démonstration
Estimation des paramètres d'un mélange gaussien en calculant itérativement les responsabilités postérieures de chaque composante pour chaque point de donnée à l'E‑étape et en mettant à jour les poids de mélange, moyennes et covariances à l'M‑étape jusqu'à convergence ou stagnation de la vraisemblance.

Mauvaise application

Mauvaise application
S'appuyer sur EM avec une initialisation aléatoire médiocre ou sans contrôle des critères de convergence, ce qui peut conduire à la convergence vers des maxima locaux sous-optimaux, à une convergence très lente près de points selle, ou à des estimations de covariance singulières dans les modèles de mélange sans régularisation.

Conséquence

Conséquence
Lorsque applicable et initialisé correctement avec des E‑ et M‑étapes calculables, EM fournit un schéma simple et souvent fiable qui augmente la vraisemblance à chaque itération, gère naturellement les données manquantes ou latentes et produit des estimations de paramètres interprétables dans le cadre des données complètes.

Inversion

Inversion
Effectuer la maximisation directe de la vraisemblance incomplète par optimiseurs à base de gradient ou utiliser l'inférence variationnelle / approximations par Monte‑Carlo de l'espérance ; ces approches inversent EM en optimisant directement la vraisemblance incomplète ou en approximant les distributions postérieures plutôt qu'en alternant espérance et maximisation.

Limite

Limite
Nécessite que l'E‑étape (espérance sous paramètres courants) et la M‑étape (maximisation de l'espérance du log‑vraisemblance complète) soient calculables en forme fermée ou approximables de manière praticable ; ne garantit que la convergence vers des points stationnaires, pas des maxima globaux ; sensibilité à l'initialisation et à l'identifiabilité du modèle.

Tension sémantique

Tension sémantique
Tension avec l'optimisation directe par gradient et les méthodes variationnelles : EM offre une amélioration monotone de la vraisemblance et une structure modulaire E/M mais peut être plus lente et piégée dans des maxima locaux, tandis que les approches par gradient ou variationnelles peuvent échapper aux optima locaux ou fournir une quantification de l'incertitude au prix d'une complexité accrue.

Synthèse

Synthèse
Cadre d'alternance espérance-maximisation qui exploite la structure à variables latentes pour augmenter itérativement la vraisemblance observée en calculant les espérances conditionnelles des variables cachées puis en optimisant les paramètres par rapport à ces espérances.