Analyse discriminante
Ce matériel couvre l’analyse discriminante, une méthode statistique utilisée pour étudier des données où des individus sont décrits par plusieurs variables quantitatives et répartis en classes définies par une variable qualitative.
D'après le document Analyse discriminante
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Statistique, Analyse de données · PDF · 28 pages · 1924
Afficher l'aperçu du document
Ce matériel couvre l’analyse discriminante, une méthode statistique utilisée pour étudier des données où des individus sont décrits par plusieurs variables quantitatives et répartis en classes définies par une variable qualitative. Il s’adresse principalement aux étudiants et chercheurs en statistique ou en sciences appliquées souhaitant comprendre comment distinguer et classer des groupes à partir de variables observées.
Objectifs de l’analyse discriminante
L’analyse discriminante vise à étudier un tableau individus × variables où chaque individu est décrit par p variables X1, ..., Xp. Ces individus sont répartis en k classes selon les modalités d’une variable qualitative Y.
Les objectifs sont :
- Rechercher des variables discriminantes Zh, qui sont des combinaisons linéaires des variables Xj, non corrélées entre elles, et séparant au mieux les k classes (analyse factorielle discriminante).
- Affecter une nouvelle observation à une des classes en fonction de ses valeurs observées de X (analyse discriminante bayesienne).
Exemple : Qualité du jus de Bordeaux
Un exemple pratique utilise des données météorologiques observées sur 34 années (1924-1957) pour prédire la qualité du jus de Bordeaux. Les variables observées sont :
- TEMPERATURE : somme des températures moyennes journalières
- SOLEIL : durée d’insolation
- CHALEUR : nombre de jours de grande chaleur
- PLUIE : hauteur des pluies
- QUALITE : variable qualitative avec modalités Bon (1), Moyen (2), Médiocre (3)
Analyse univariée
Chaque variable est analysée séparément pour étudier son association avec la qualité :
Température
La relation entre Température et Qualité est étudiée par ANOVA. Le rapport de corrélation η est élevé (0.799) indiquant une forte association. La variance entre groupes est significative (p < 0.001), ce qui montre que la température varie selon la qualité.
Soleil
La variable Soleil présente aussi une association significative avec la qualité (η = 0.786, p < 0.001), confirmée par l’analyse de variance.
Chaleur
Chaleur est également corrélée à la qualité (η = 0.705, p < 0.001), avec une différence notable entre les groupes.
Pluie
La variable Pluie montre une association plus faible mais significative avec la qualité (η = 0.594, p < 0.001).
Analyse factorielle discriminante
L’objectif est de construire des variables discriminantes Z1, Z2, ... qui sont des combinaisons linéaires des variables initiales et qui maximisent la séparation entre les classes.
Recherche de la première variable discriminante
On cherche des coefficients a1j tels que :
p Z1 = a11 X1 + a12 X2 + ... + a1p Xp
Cette variable Z1 est centrée et normalisée pour que sa variance intra-classes soit égale à 1. Elle doit maximiser la statistique F issue de l’analyse de variance de Z1 selon la variable qualitative Y.
Calcul sur les données d’origine
La première variable discriminante s’écrit :
Z1 = 0.009 * Température + 0.007 * Soleil - 0.027 * Chaleur - 0.006 * Pluie - 32.876
Normalisation des variables
Chaque variable Xj est centrée et normalisée par l’écart-type intra-classes :
X1 = (Température - 3157.88) / 7668.456 X2 = (Soleil - 1247.32) / 6522.335 X3 = (Chaleur - 18.82) / 53.689 X4 = (Pluie - 360.44) / 5758.039
Calcul sur les données normalisées
La première variable discriminante standardisée est :
Z1 = 0.750 * X1 + 0.547 * X2 - 0.198 * X3 - 0.445 * X4
Analyse de la variance de Z1
La variable Z1 sépare significativement les groupes de qualité (p < 0.001), confirmant son pouvoir discriminant.
Recherche de la deuxième variable discriminante
On cherche une deuxième variable Z2, centrée et non corrélée à Z1, qui maximise également la séparation entre les classes :
p Z2 = a21 X1 + a22 X2 + ... + a2p Xp
La normalisation impose une variance intra-classes égale à 1 pour Z2.
Analyse de la variance de Z2
La variable Z2 montre une association plus faible avec la qualité (η = 0.349), mais elle apporte une information complémentaire.
Les deux variables discriminantes et le premier plan discriminant
Les variables Z1 et Z2 définissent un plan discriminant où chaque individu est projeté. Les centres de gravité des groupes (moyennes des Z1 et Z2 pour chaque classe) sont représentés dans ce plan.
Les frontières entre groupes sont les médiatrices des segments joignant ces centres de gravité, formant une carte territoriale des qualités.
Classification d’une nouvelle observation
Une nouvelle observation est affectée à la classe dont le centre de gravité est le plus proche dans le plan (Z1, Z2), c’est-à-dire celle pour laquelle la distance euclidienne au centre est minimale.
Exemple de prévision pour l’année 1958
Pour une nouvelle observation avec :
- Température = 3000
- Soleil = 1100
- Chaleur = 20
- Pluie = 300
On calcule les scores discriminants Z1 et Z2 en utilisant les coefficients standardisés et la normalisation, puis on détermine la classe la plus proche.
Glossaire des termes clés
- Analyse discriminante : méthode statistique visant à séparer des groupes à partir de variables quantitatives.
- Variable discriminante : combinaison linéaire des variables initiales qui maximise la séparation entre groupes.
- Variable qualitative : variable catégorielle définissant les classes ou groupes.
- ANOVA (Analyse de variance) : test statistique pour comparer les moyennes entre groupes.
- Coefficient η (eta) : mesure de l’association entre une variable quantitative et une variable qualitative.
- Normalisation : transformation des variables pour avoir moyenne nulle et variance unitaire intra-classes.
- Plan discriminant : espace défini par les variables discriminantes où les individus sont projetés.
- Centre de gravité : moyenne des coordonnées des individus d’un groupe dans le plan discriminant.
- Distance euclidienne : mesure de proximité entre un point et un centre de gravité dans le plan discriminant.
Points clés à retenir
- L’analyse discriminante permet de réduire la dimension des données en variables discriminantes maximisant la séparation des groupes.
- Chaque variable discriminante est une combinaison linéaire des variables initiales, normalisée pour faciliter l’interprétation.
- La première variable discriminante a le plus fort pouvoir de séparation, la deuxième apporte une information complémentaire.
- La classification d’une nouvelle observation se fait en calculant sa position dans le plan discriminant et en l’affectant au groupe le plus proche.
- L’exemple du jus de Bordeaux illustre l’utilisation des variables météorologiques pour prédire la qualité.
Commentaires
Aucun commentaire pour le moment. Posez la première question.