Analyse Discriminante
Cette leçon porte sur l'analyse discriminante, une méthode statistique utilisée pour classer des individus en groupes à partir de variables quantitatives explicatives et d'une variable qualitative à expliquer. Elle s'inscrit dans un cours de statistique multivariée et couvre à la fois l'analyse discriminante descriptive et prédictive.
D'après le document Analyse Discriminante
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Statistical Analysis · PPTX · 20 pages · 2019
Cette leçon porte sur l'analyse discriminante, une méthode statistique utilisée pour classer des individus en groupes à partir de variables quantitatives explicatives et d'une variable qualitative à expliquer. Elle s'inscrit dans un cours de statistique multivariée et couvre à la fois l'analyse discriminante descriptive et prédictive.
Introduction à l’analyse discriminante
L’analyse discriminante s’applique lorsqu’on dispose d’un ensemble d’individus caractérisés par une variable qualitative Y à expliquer, répartie en k classes, et par des variables quantitatives explicatives X1, X2, ..., Xp. Elle répond à deux objectifs principaux :
- Analyse discriminante descriptive : trouver une représentation des individus qui sépare au mieux les groupes.
- Analyse discriminante prédictive : établir des règles permettant d’affecter un nouvel individu à l’un des groupes en fonction de ses variables observées.
Le principe fondamental est de construire des combinaisons linéaires des variables explicatives qui maximisent l’homogénéité au sein de chaque classe, selon la méthode initialement proposée par Fisher en 1936.
Objectifs et domaines d’application
L’analyse discriminante vise à :
- Rechercher des variables discriminantes Zh, qui sont des combinaisons linéaires non corrélées des variables Xj, permettant de séparer au mieux les k classes.
- Affecter une nouvelle observation à une classe donnée en fonction de ses variables observées, notamment via une approche bayésienne.
Cette méthode trouve des applications dans divers domaines :
- Médecine : diagnostic à partir des symptômes d’un patient.
- Finance : évaluation du risque de faillite d’une société ou du risque de crédit d’un client.
- Pétrole : détection de nappes pétrolifères à partir d’analyses de carottes de forage.
- Télédétection : identification automatique de la nature du terrain (forêt, sable, ville, mer) à partir des mesures satellitaires.
- Marketing : prévision de la réponse d’un client à une offre commerciale.
Analyse discriminante descriptive
Considérons un échantillon de n individus, chacun décrit par p variables quantitatives, formant un nuage E dans l’espace Rp. Ce nuage est partitionné en k sous-nuages E1, E2, ..., Ek correspondant aux k classes, avec des centres de gravité g1, g2, ..., gk et des matrices de variance V1, V2, ..., Vk. Le centre de gravité global est noté g et la matrice de variance globale V.
Chaque individu peut être pondéré par un poids pi, rangé dans une matrice diagonale D.
L’analyse factorielle discriminante consiste à chercher de nouvelles variables, appelées variables discriminantes, qui correspondent à des directions dans Rp séparant au mieux les k groupes. Ces variables sont des combinaisons linéaires des variables initiales Xj, non corrélées entre elles.
Géométriquement, pour k=3 classes, le premier facteur discriminant définit un axe dans le nuage de points tel que la variance inter-classes (variance des moyennes de classe projetées) soit maximale. Le second facteur est orthogonal au premier et maximise également la variance inter-classes, et ainsi de suite pour les facteurs suivants.
Propriétés des facteurs discriminants
- Les facteurs discriminants sont les vecteurs propres de la matrice V-1B, où B est la matrice de variance inter-classes.
- Le nombre maximum de facteurs discriminants est k-1, où k est le nombre de classes.
- La part de variance inter-classes expliquée par chaque facteur décroît avec les facteurs successifs.
- Pour deux groupes, un seul facteur suffit, correspondant à l’axe de projection maximisant la séparation entre les classes.
- Pour plus de deux groupes, la projection se fait sur un plan discriminant formé par les deux premiers facteurs, où la dispersion des centroïdes est la mieux représentée.
Analyse discriminante prédictive
Les facteurs discriminants fournissent une représentation optimale des centroïdes des classes dans un espace orthonormé. Pour affecter un nouvel individu x à une classe, on projette x dans cet espace et on choisit la classe dont le centroïde est le plus proche.
La distance utilisée est la distance de Mahalanobis définie par :
d²(x,y) = (x - y)’ W-1 (x - y)
où W est la matrice intra-classes (matrice de variance-covariance des groupes).
On classe x dans le groupe Gi pour lequel la distance au centre gi est minimale :
d²(x,gi) = (x - gi)’ W-1 (x - gi) = x’ W-1 x – 2 gi’ W-1 x + gi’ W-1 gi
Minimiser cette distance revient à maximiser :
2 gi’ W-1 x - gi’ W-1 gi
Le terme gi’ W-1 gi est constant par rapport à x, donc la décision dépend de la maximisation de 2 gi’ W-1 x.
Pour chaque groupe Gi, on définit une fonction discriminante de Fisher :
2 gi’ W-1 x = αi + βi,1 X1 + βi,2 X2 + … + βi,p Xp
Le nouvel individu x est affecté au groupe pour lequel cette fonction est maximale.
Points clés
- L’analyse discriminante sépare des groupes à partir de variables quantitatives et d’une variable qualitative.
- Elle comprend une partie descriptive (représentation des groupes par des variables discriminantes) et une partie prédictive (classification de nouveaux individus).
- Les variables discriminantes sont des combinaisons linéaires non corrélées des variables initiales, optimisant la séparation des classes.
- Le nombre maximal de facteurs discriminants est k-1, avec k le nombre de classes.
- La classification prédictive utilise la distance de Mahalanobis et les fonctions discriminantes de Fisher.
- Chaque individu est affecté au groupe dont la fonction discriminante est la plus élevée.
Commentaires
Aucun commentaire pour le moment. Posez la première question.