Définition
Techniques visant à réduire le nombre de variables considérées en trouvant des représentations de plus faible dimension (projections ou encodages) qui conservent la structure essentielle, la variance ou l'information prédictive de données haute dimension.

Principe

Principe
Exploiter la redondance, les corrélations ou la structure de variété pour représenter les données avec moins de coordonnées via des transformations linéaires (ACP), l'apprentissage de variétés non linéaires (t-SNE, Isomap) ou des encodeurs entraînés (autoencodeurs), en équilibrant fidélité de reconstruction, interprétabilité et performance sur tâches en aval.

Démonstration

Démonstration
Appliquer l'analyse en composantes principales sur des données d'expression génique de haute dimension pour extraire des axes principaux expliquant 90 % de la variance en vue de la visualisation et du clustering ; entraîner un autoencodeur pour compresser des patchs d'image en un code latent de basse dimension pour la classification.

Mauvaise application

Mauvaise application
Utiliser une méthode linéaire comme l'ACP sur des données situées sur une variété non linéaire et interpréter les axes principaux comme facteurs causaux, ou supprimer des dimensions contenant des signaux prédictifs rares mais critiques.

Conséquence

Conséquence
Réduit les besoins de stockage et de calcul, atténue la malédiction de la dimension, améliore la visualisation et parfois la généralisation lorsque la représentation réduite capture la structure pertinente pour la tâche.

Inversion

Inversion
L'expansion de caractéristiques ou le lifting (ajout de termes polynomiaux, d'interactions ou de caractéristiques aléatoires) augmente délibérément la dimensionnalité pour rendre la structure linéairement séparable ou accroître la capacité du modèle.

Limite

Limite
Concerne les transformations de variables mesurées en représentations de dimension inférieure ; distinct de la sélection de caractéristiques (qui choisit des sous-ensembles) et de la découverte de variables causales ; l'efficacité dépend de la taille de l'échantillon par rapport à la dimensionnalité intrinsèque.

Tension sémantique

Tension sémantique
Une tension existe entre réduction de dimension (qui transforme ou compresse les caractéristiques) et sélection de caractéristiques (qui conserve des coordonnées originales) : la première change la représentation tandis que la seconde préserve l'interprétabilité et les contraintes en aval.

Synthèse

Synthèse
La réduction de dimension identifie des représentations compactes en projetant ou en encodant des données haute dimension sur des structures de plus faible dimension qui préservent variance, géométrie ou contenu prédictif, facilitant le calcul et l'interprétation tout en nécessitant prudence quant au choix de la méthode et à la perte d'information.