ANALYSE
MULTIDIMENSIONNELLE-
ANALYSE MULTI VARIÉE
Cours de Statistique Avancée
Thuraya Mellah
ESEN-UMA
Introduction
ANALYSE EN
COMPOSANTES
PRINCIPALES (ACP)
I- Objet
• xik avec i:1…I et k:1...K
• Xk variable quantitative
Tableau de données:
• un ensemble d’Individus
• un ensemble de variables
Exemple de dataset
Domaines d’étude
Les termes individu et variable recouvrent des notions différentes
Les questions que l’on se pose sur les individus et celles que l’on se
pose sur les variables ne sont pas de même nature:
On évalue la ressemblance entre
deux individus:
Deux individus se ressemblent
d’autant plus qu’ils possèdent des
valeurs proches pour l’ensemble des
variables.
En ACP, la distance d(i,l) entre deux
individus i et l est définie par :
On évalue la liaison entre deux
variables
En ACP, la liaison entre deux variables
est mesurée par le coefficient de
corrélation linéaire r(k,h)
avec xk et sk la moyenneet l'écart − typede Xk
L’objectif principal de l’ACP est une étude exploratoire.
Deux voies principales d’exploration:
1. Un bilan des ressemblances entre individus.
2. Un bilan de liaisons entre variables
Etude des individus
Diagramme représentant trois situations différentes où 40
individus sont décrits en termes de deux variables: j et k
Dans le bilan des ressemblances/similarité entre individus.
On cherche alors à répondre à des questions du type suivant :
• Quels sont les individus qui se ressemblent ?
• Quels sont ceux qui diffèrent ?
Plus généralement, on souhaite décrire la variabilité des individus. On
cherche alors à mettre en évidence des groupes homogènes d’individus
dans le cadre d’une typologie des individus.
Selon un autre point de vue, on cherche les principales dimensions de
variabilité́ des individus. On recherche des dimensions communes de la
variabilité qui opposent les individus extrêmes et intermédiaires.
Etude des variables
Soient quatres variables ( j, k, l, m); les nuages de points ci-dessous
représentent les relations entre ces variables, prises deux à deux
Face à un très petit nombre de variables, il est possible de tirer des
conclusions des nuages de points ou de la matrice de corrélation qui regroupe
tous les coefficients de corrélation linéaires r (j, k) entre les paires de
variables.
Cependant, lorsque le nombre de variables est important, la matrice de
corrélation regroupe une grande quantité de coefficients de corrélation
(e.g., 190 coefficients pour K = 20 variables).
Il est donc essentiel de disposer d'un outil capable de résumer les relations
principales entre les variables de manière visuelle.
L’ACP a pour objectif de tirer des conclusions des relations linéaires entre
variables en détectant les principales dimensions de la variabilité.
Ces conclusions seront complétées par la définition des variables
synthétiques proposées par la ACP.
Il sera donc plus facile de décrire les données en utilisant quelques variables
synthétiques plutôt que toutes les variables d'origine.
Le bilan des liaisons entre variables.
Les questions sont alors :
• Quelles variables sont corrélées positivement entre elles ?
• Quelles sont celles qui s’opposent (corrélées négativement) ?
• Existe-t-il des groupes de variables corrélées entre elles ?
• Peut-on mettre en évidence une typologie des variables ?
Un autre aspect de l’étude des liaisons entre variables consiste à résumer
l’ensemble des variables par un petit nombre de variables synthétiques
Publicité
appelées ici composantes principales.
Ce point de vue est très lié au précédent : une composante principale peut être
considérée comme le représentant (la synthèse) d’un groupe de variables liées
entre elles.
NB: ACP se concentre sur les relations linéaires entre les variables.
Les liens plus complexes, tels que les relations quadratiques, logarithmiques, ou
encore exponentielles, ne sont pas étudiés dans ACP.
Relations entre les deux études ou bilans
Les bilans ne sont pas indépendants du fait de la dualité inhérente à
l’étude d’un tableau rectangulaire
La structure du tableau peut être analysée à la fois par l’intermédiaire de la
typologie des individus et de la typologie des variables.
On cherche en général à relier ces deux typologies, ainsi on caractérise
les classes d’individus par des variables
•
• un groupe de variables liées entre elles par des individus types
Dans la situation idéale, les deux typologies peuvent être « superposées»:
• chaque groupe de variables caractérise un groupe d’individus,
• et chaque groupe d’individus rassemble les individus types d’un
groupe de variables.
La notion de principale dimension de variabilité des individus rejoint celle
de variable synthétique.
Poids des individus
• On suppose que les individus jouent le même rôle:
On attribue le même poids aux individus
On choisit ces poids tels que la masse totale de ces individus soit égale à 1
à chaque individu on associe alors le poids 1/I .
• On attribue des poids différents aux individus.
Cette situation se présente notamment lorsque les individus représentent
chacun une sous-population ;
On affecte alors à un individu un poids proportionnel à l’effectif de la sous-
population qu’il représente.
Poids des variables
Nous avons accordé jusqu’ici la même importance a priori aux différentes
variables. On est très rarement conduit, dans la pratique, à souhaiter leur
affecter des importances différentes
Cette importance peut être modulée à l’aide d’un coefficient appelé poids de la
variable.
En appelant mk le poids de la variable k, la distance entre deux individus i et l
est définie par :
Transformation des données
• En ACP, le tableau des données est toujours centré
xik − xk
• S’affranchir de l’arbitraire des unités de mesure: standardiser les données
(xik − xk )
sk
Ce faisant, on utilise comme unité de mesure pour la variable k, son écart-
type sk.
Toutes les variables présentent alors la même variabilité et de ce fait la même
influence dans le calcul des distances entre individus.
NB: dans ce qui suit et sauf mention contraire, toutes les variables sont toujours
supposées centrées et réduites.
II- Bilans des Individus et des variables
II-1 Nuages des individus
x
Chaque individu i est décrit par les observations du vecteur
(xik )k:1...K
L’individu est représenté par un point dans l’espace vectoriel à K dimensions:
(Xk )k:1...K
RK
L’ensemble des individus constitue le nuage
N I
Le centre de gravité G du nuage est confondu avec l’origine O (dû au centrage)
• Dans l’espace IRK, la ressemblance entre les individus n’est autre que la
distance euclidienne
• L’ensemble des distances interindividuelles constitue la forme du nuage
N I
• Réaliser un bilan des distances interindividuelles : étudier la forme du nuage
c.à.d découvrir:
• une partition des points: une typologie d’individus
• des directions d’allongement remarquables: les principales
dimensions de variabilité
II-2 Nuages des variables
À chaque variable, est associée une suite de I nombres.
Une variable peut être représentée comme un vecteur de l’espace vectoriel à I
dimensions, noté , dont chaque dimension représente un individu
R I
L’ensemble des extrémités des vecteurs représentant les variables constitue le nuage
Publicité
N K
La norme de chaque vecteur représentant la variable (càd sa longueure) est
égale à son écart type:
|| k ||2 = ∑i
(xik − xk )2 = s2
k
1
I
Dans le cas d'une ACP standardisée ( dite aussi normée), le nuage de
variables est situé dans une hypersphère de rayon 1
N K
Le cosinus de l’angle formé par les vecteurs représentant les deux variables h
et k, est égal au coefficient de corrélation entre ces deux variables:
cos(k, h) = k, h = ∑i
1
I
(
xik − xk
sk
)(
xih − xh
sh
) = r(k, h)
Réaliser un bilan des coefficients de corrélation entre les variables revient
à étudier les angles entre les vecteurs définissant le nuage N K
ACP fournit des variables synthétiques qui résument les variables initiales
Ces variables synthétiques sont la base d’une représentation plane approchée
des variables et de leur angles.
II-3 Ajustement du nuage des individus
ACP a pour objectif de représenter le nuage de points dans un espace de
dimensions réduites de manière «optimale», c.à.d en distordant le moins
possible les distances entre les individus.
Fournir des images planes approchées du nuage situé dans l’espace
RK
N I
Dans la pratique on cherche une suite
{us;s = 1....S}
de S directions priviligiées de , appelées
axes factoriels
RK
us est choisie telque l’inertie du nuage est
maximale
Prises deux à deux, les axes difinissent des
plans factoriels sur lesquels on projette le
nuage
N I
Trouver le plan factoriel P telque:
∑i OH 2
maximum
i
càd minimum
i
∑i iH 2
Définition du plan factoriel P: les
deux vecteurs non linéaires (u1,u2)
sont choisis telque:
• u1 définit le meilleur axe en terme
de maximisation de l’inertie du
nuage NI
• u2, orthogonal à u1, et exprime la
plus grande variabilité du nuage NI,
une fois celle exprimée par u1 est
éliminée
Ainsi la variabilité exprimée par u2 est
la meilleure combinaison
et elle est indépendante de celle
exprimée par u1.
Séquence d'axes pour représenter
NI
Le premier plan (u1, u2), càd le plan
de la meilleure représentation, est
souvent suffisant pour visualiser le
nuage NI.
Lorsque S est supérieur ou égal à 3,
il peut être nécessaire de visualiser le
nuage dans le sous-espace de la
dimension S en utilisant un certain
nombre de représentations planes: la
Publicité
représentation sur (u1, u2) mais
également celle sur (u3, u4) qui est le
plus complémentaire au premier plan.
Dans certaines situations, on peut
choisir d'associer (u2, u3), par
exemple, afin de mettre en évidence
un phénomène particulier qui
apparaît sur ces deux composants.
Comment obtient-on les axes factoriels?
Les composants de la ACP sont obtenus par diagonalisation de la matrice
de corrélation et l’extraction des vecteurs propres et les valeurs propres
associés.
A chaque vecteur propre correspond une valeur propre classées par
ordre décroissant.
us
λs
λs
La valeur propre s’interprété comme l'inertie du nuage NI projetée sur la
composante du rang s ou, en d'autres termes, la «variance expliquée» de
la composante du rang s.
Quand tous les vecteurs propres sont calculés (S = K), l’ACP recrée une
base pour l'espace RK. En ce sens, l’ACP peut être vue comme un
changement de base dans lequel les premiers vecteurs de la nouvelle
base jouent un rôle important.
Remarque
Lorsque les variables sont centrées mais non réduites, la matrice à diagonaliser
serait la matrice de variance – covariance.
II-3 Ajustement du nuage des variables
Ajuster le nuage de variables situé initialement
dans l’espace :
N K
R I
N K
Projeter dans un sous-espace de
dimension plus petite
Trouver une série d’axes orthogonaux
{vs;s = 1....S}
S
Le plan factoriel constitue un sous espace de
projection telque:
•
vii:1,2
maximise
(v1, v2 )
∑
k=1...K (OH )2
k
•
vi1,v2
soient orthogonaux (non corrélés)
∑
v1
Par construction maximise
k=1...K (OH )2
k
La projection de la variable k sur l’axe est égale au
v1
k=1...K (OH )2
k
∑
k
cosθ1
∑
=
k
=
∑
k (cos)2θ1
Ainsi le critère maximise
Les variables initiales sont centrées et réduites, leur projection sur est égale à leur
coefficient de corrélation avec cette variable
k (r)2(k, v1)
v1
Le vecteur caractérise la direction d’inertie maximum et définit une nouvelle
variable.
v1
Rechercher le vecteur qui maximise revient à chercher la
combinaison linéaire la plus liée à l’ensemble des variables, au sens du critère:
Publicité
somme des carrés des corrélation maximum.
est la variable qui synthétise au mieux l’ensemble des variables
initiales: composante principale
v1
k
∑
k (OH )2
Les axes factoriels étant orthogonaux deux à deux: les composantes
principales, sont non corrélées entre elles, résument au mieux l’ensemble des
variables initiales.
Nuage de variable dans l'espace RI
Projections des variables dans le
plan factoriel principal
III- Interprétaion des résultats
III-1 Indicateurs Numériques
1. Pourcentage d’inertie associée avec composante de rang s:
Si ACP est standardisée λs
∑ = K
s=1
K
• Une mesure de la qualité de représentation des données
• Une mesure de l’importance relative de la composante
Inertie projetée
inertie totale
=
λs
K
∑
λs
s=1
2- Qualité de réprésenattion d’un individus ou d’une variable:
Inertie projetée
inertie totale
= cos2θS
3- Individus singuliers: distance entre entre l’individu et le centre de gravité du nuage
4- Contribution de l’individu (ou variable) à la construction de la composante de rang s
Exemple
.
La première composante principale, l’axe principal de variabilité entre les jus
d’orange, sépare les deux jus d’orange Tropicana fr. et Pampryl amb.
D'après le tableau de données, nous pouvons voir que ces jus d'orange sont les
plus extrêmes en termes de descripteur d'odeur et d'amertume: Tropicana fr. est le
plus typique et le moins amer tandis que Pampryl amb. est le moins typique et le
plus amer.
La second composante, c’est-à-dire celle qui sépare les jus d’orange de manière
plus significative une fois que la principale composante de la variabilité a été
supprimé, identifie Tropicana amb., qui est le moins intense en termes d’odeur, et
Pampryl le plus intense
La lecture de ces données est fastidieuse lorsque le nombre d'individus et de
variables est élevé. Pour des raisons pratiques, nous faciliterons la caractérisation
des principales composantes en utilisant plus directement les variables.
Représentation des variables comme aide à l'interprétation du nuage
d'individus: Corrélation entre les variables et les composantes principales
F1 est fortement corrélé positivement avec les variables caractéristique d'odeur et de
douceur et, fortement corrélé négativement avec les variables amer et acide.
Tropicana fr., a la coordonnée la plus élevée sur le composant 1, a des valeurs élevées
pour odour typicality et odour intensity et des valeurs faibles pour les variables acide et
amertume.
De même, nous pouvons examiner les corrélations entre F2 et les variables. On peut
noter que les corrélations sont généralement inférieures (en valeur absolue) à celles de
la première composante principale. Nous verrons que cela est directement lié au
pourcentage d'inertie associé à F2 qui, par construction, est inférieur à celui associé à
F1. Le second composant peut être caractérisé par les variables d'intensité de l'odeur et
de la teneur en pulpe
Pour faciliter l'interprétation de ces résultats, en particulier dans les cas où le nombre
de variables est élevé, il est possible de représenter chaque variable sur un
graphique, en utilisant ses coefficients de corrélation avec F1 et F2 comme
coordonnées
Exemples 2:
ACP avec des variables illustratives qualitatives et quantitatives
et Analyse factorielle aux données mixtes
Exemples 3:
Hierarchical clustering on principal compound (HCPC)
Schéma Géneral de l’ACP: Récapitulatif