Définition
Le processus de comparaison et de choix entre modèles mathématiques ou statistiques concurrents sur la base de critères tels que la performance prédictive, la complexité, la parcimonie, les critères d'information ou les scores de validation croisée.
Principe
Principe
La sélection de modèle équilibre la qualité d'ajustement et la complexité pour éviter le surajustement, en utilisant des critères formels (AIC, BIC), la validation prédictive (validation croisée) ou des métriques décisionnelles qui pèsent la perte prédictive attendue et l'interprétabilité du modèle.
Démonstration
Démonstration
Choisir entre une régression linéaire et polynomiale selon l'erreur prédictive par validation croisée, sélectionner le nombre de composantes d'un modèle de mélange par BIC, ou décider entre modèles épidémiologiques mécanistes concurrents sur la base de prévisions hors échantillon et de la parcimonie.
Mauvaise application
Mauvaise application
Sélectionner des modèles uniquement sur l'ajustement intra-échantillon ou sur un unique p-value sans pénaliser la complexité, ou effectuer la sélection en utilisant les mêmes données qui seront plus tard employées pour l'inférence ou le test (fuite de données), ce qui gonfle la performance apparente et nuit à la généralisation.
Conséquence
Conséquence
Une sélection appropriée produit des modèles qui généralisent mieux à de nouvelles données, simplifie l'interprétation et soutient des décisions fiables ; elle clarifie aussi l'incertitude modélisatrice et peut conduire au moyennage de modèles quand aucun modèle unique n'est décisif.
Inversion
Inversion
Moyennage de modèles ou approches ensemblistes : au lieu de choisir un modèle unique, combiner plusieurs modèles pondérés par leur performance ou probabilité a posteriori pour se prémunir contre l'incertitude de sélection et souvent améliorer la précision prédictive.
Limite
Limite
Se concentre sur les choix structurels entre formes de modèles et niveaux de complexité concurrents ; exclut l'estimation de paramètres au sein d'un modèle fixe (même si les deux interagissent) et la calibration visant à ajuster les performances prédictives d'un modèle choisi sans en changer la structure.
Tension sémantique
Tension sémantique
Une tension existe entre sélection et moyennage : la sélection s'engage sur une structure unique et facilite l'interprétation, tandis que le moyennage reconnaît l'incertitude modélisatrice et peut améliorer la prédiction au prix d'une interprétabilité et d'une simplicité opérationnelle réduites.
Synthèse
Synthèse
La sélection de modèle est la comparaison et le choix raisonné entre modèles alternatifs en utilisant des pénalités de complexité et des mesures de performance prédictive, fournissant une décision structurelle défendable tout en reconnaissant l'incertitude résiduelle et l'option du moyennage.