Analyse Discriminante
Ce matériel couvre les principes fondamentaux et les applications de l’analyse discriminante, une méthode statistique utilisée pour classifier des individus en groupes à partir de variables quantitatives.
D'après le document Analyse Discriminante
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Statistical Analysis, Data Science, Finance, Medicine · PPTX · 20 pages · 2019
Ce matériel couvre les principes fondamentaux et les applications de l’analyse discriminante, une méthode statistique utilisée pour classifier des individus en groupes à partir de variables quantitatives. Il s’adresse aux étudiants et chercheurs en statistiques, data science, ou disciplines appliquées souhaitant comprendre et appliquer cette technique pour la description et la prédiction des classes.
Introduction à l’analyse discriminante
L’analyse discriminante traite d’un ensemble d’individus caractérisés par une variable qualitative à expliquer Y (les classes) et des variables explicatives quantitatives X1, X2, ..., Xp. Elle répond à deux problématiques principales :
- Analyse discriminante descriptive : trouver une représentation des individus qui sépare au mieux les groupes.
- Analyse discriminante prédictive : établir des règles d’affectation des individus à leur groupe.
Le principe de base, proposé par Fisher en 1936, est de créer une méthode qui choisit parmi les combinaisons linéaires des variables explicatives celle qui maximise l’homogénéité de chaque classe.
Objectifs de l’analyse discriminante
On étudie un tableau individus × variables où chaque individu est décrit par p variables X1, ..., Xp. Les individus sont répartis en k classes selon la variable qualitative Y.
Les objectifs sont :
- Rechercher des variables discriminantes Zh, qui sont des combinaisons linéaires des Xj, non corrélées entre elles, et qui séparent au mieux les k classes (analyse factorielle discriminante).
- Affecter une nouvelle observation à une classe en fonction de ses valeurs observées des variables X (analyse discriminante bayésienne).
Domaines d’application
- Médecine : Diagnostiquer une maladie à partir des symptômes d’un patient.
- Finance : Estimer le risque de faillite d’une société ou le risque de crédit d’un client à partir de leurs caractéristiques financières.
- Pétrole : Prédire la présence d’une nappe de pétrole à partir d’analyses de carottes de forage.
- Télédétection : Identifier la nature du terrain (forêt, sable, ville, mer) à partir des mesures satellitaires.
- Marketing : Prédire la réponse d’un client à une offre commerciale selon ses caractéristiques.
Analyse discriminante descriptive
Les n individus de l’échantillon forment un nuage E dans Rp, divisé en k sous-nuages E1, E2, ..., Ek, chacun avec un centre de gravité g1, g2, ..., gk et une matrice de variance V1, V2, ..., Vk.
On note :
- g : centre de gravité global de E
- V : matrice de variance globale de E
- D : matrice diagonale des poids p1, p2, ..., pn représentant l’importance relative des individus
L’analyse factorielle discriminante cherche de nouvelles variables discriminantes, qui sont des directions dans Rp permettant de projeter les individus de façon à séparer au mieux les k groupes.
Exemple géométrique pour k=3
Le premier facteur discriminant définit un axe dans le nuage de points passant par l’origine, tel que la variance inter-classes (variance des moyennes de classe projetées) soit maximale.
Le deuxième facteur (F2) est orthogonal au premier et maximise également la variance inter-classes dans cette direction. Le troisième facteur suit le même principe, et ainsi de suite.
Propriétés des facteurs discriminants
- Les facteurs discriminants sont les vecteurs propres de la matrice V⁻¹B, où B est la matrice de variance inter-classes.
- Le nombre maximum de facteurs discriminants est k – 1, avec k le nombre de classes.
- La part de variance inter-classes expliquée par chaque facteur décroît avec les facteurs successifs.
- Pour deux groupes, un seul facteur suffit, qui correspond à l’axe de projection maximisant la séparation inter-classes.
- Pour plus de deux groupes, on obtient un plan discriminant formé par les deux premiers facteurs (F1, F2), où la dispersion des centroïdes est la mieux représentée.
Analyse discriminante prédictive
Les facteurs discriminants fournissent une représentation optimale des centroïdes des classes dans un espace orthonormé. Pour un individu x projeté dans cet espace, on l’affecte à la classe dont le centroïde est le plus proche.
On définit des régions de décision R1, R2, ..., Rk délimitant les zones d’appartenance aux différentes classes.
Distance de Mahalanobis
La distance d entre deux points x et y est donnée par :
d²(x,y) = (x - y)’ W⁻¹ (x - y)
où W est la matrice intra-classes (matrice de variance-covariance des groupes).
Pour classer un individu x, on calcule la distance au centroïde gi de chaque groupe Gi :
d²(x, gi) = (x - gi)’ W⁻¹ (x - gi) = x’ W⁻¹ x – 2 gi’ W⁻¹ x + gi’ W⁻¹ gi
On classe x dans le groupe Gi pour lequel d²(x, gi) est minimale, ce qui revient à maximiser :
2 gi’ W⁻¹ x – gi’ W⁻¹ gi
Le terme gi’ W⁻¹ gi est constant par rapport à x, donc la classification dépend de la maximisation de 2 gi’ W⁻¹ x.
Fonction discriminante de Fisher
Pour chaque groupe Gi, on définit une fonction discriminante linéaire :
2 gi’ W⁻¹ x = αi + βi,1 X1 + βi,2 X2 + … + βi,p Xp
où αi et les βi,j sont des coefficients calculés à partir des centroïdes et de la matrice W.
L’individu x est affecté au groupe pour lequel cette fonction est maximale.
Glossaire des termes clés
- Analyse discriminante : méthode statistique visant à classifier des individus en groupes à partir de variables explicatives.
- Variable qualitative Y : variable catégorielle définissant les classes des individus.
- Variable quantitative Xj : variable explicative numérique décrivant les individus.
- Facteurs discriminants : combinaisons linéaires des variables Xj qui maximisent la séparation entre les classes.
- Centre de gravité (gi) : moyenne des individus d’une classe Gi dans l’espace des variables.
- Matrice de variance intra-classes (W) : matrice de covariance des variables au sein des groupes.
- Matrice de variance inter-classes (B) : matrice représentant la dispersion des centroïdes des classes.
- Distance de Mahalanobis : mesure de distance prenant en compte la variance et la covariance des variables.
- Fonction discriminante de Fisher : fonction linéaire utilisée pour affecter un individu à une classe.
- Analyse factorielle discriminante : recherche des facteurs discriminants pour la représentation des groupes.
- Analyse discriminante bayésienne : classification d’une nouvelle observation selon les règles probabilistes basées sur les fonctions discriminantes.
Points clés à retenir
- L’analyse discriminante permet de décrire et de prédire l’appartenance à des groupes à partir de variables quantitatives.
- Les facteurs discriminants sont des combinaisons linéaires optimales des variables explicatives qui maximisent la séparation entre classes.
- Le nombre de facteurs discriminants est au maximum égal à k – 1, avec k le nombre de classes.
- La classification prédictive repose sur la minimisation de la distance de Mahalanobis entre l’individu et les centroïdes des classes.
- La fonction discriminante de Fisher est une fonction linéaire qui permet d’attribuer un individu à la classe la plus probable.
Commentaires
Aucun commentaire pour le moment. Posez la première question.