Analyse Multidimensionnelle - Analyse Multi Variée

Statistique Avancée · course

Voir tous les documents en mathématiques

ANALYSE

MULTIDIMENSIONNELLE-

ANALYSE MULTI VARIÉE

Cours de Statistique Avancée

Thuraya Mellah

ESEN-UMA

Introduction

ANALYSE EN

COMPOSANTES

PRINCIPALES (ACP)

I- Objet

•  xik avec i:1…I et k:1...K

•  Xk variable quantitative

Tableau de données:

•  un ensemble d’Individus

•  un ensemble de variables

Exemple de dataset

Domaines d’étude

Les termes individu et variable recouvrent des notions différentes

Les questions que l’on se pose sur les individus et celles que l’on se

pose sur les variables ne sont pas de même nature:

On évalue la ressemblance entre

deux individus:

Deux individus se ressemblent

d’autant plus qu’ils possèdent des

valeurs proches pour l’ensemble des

variables.

En ACP, la distance d(i,l) entre deux

individus i et l est définie par :

On évalue la liaison entre deux

variables

En ACP, la liaison entre deux variables

est mesurée par le coefficient de

corrélation linéaire r(k,h)

avec xk et sk la moyenneet l'écart − typede Xk

L’objectif principal de l’ACP est une étude exploratoire.

Deux voies principales d’exploration:

1. Un bilan des ressemblances entre individus.

2.  Un bilan de liaisons entre variables

Etude des individus

Diagramme représentant trois situations différentes où 40

individus sont décrits en termes de deux variables: j et k

Dans le bilan des ressemblances/similarité entre individus.

On cherche alors à répondre à des questions du type suivant :

•  Quels sont les individus qui se ressemblent ?

•  Quels sont ceux qui diffèrent ?

Plus généralement, on souhaite décrire la variabilité des individus. On

cherche alors à mettre en évidence des groupes homogènes d’individus

dans le cadre d’une typologie des individus.

Selon un autre point de vue, on cherche les principales dimensions de

variabilité́ des individus. On recherche des dimensions communes de la

variabilité qui opposent les individus extrêmes et intermédiaires.

Etude des variables

Soient quatres variables ( j, k, l, m); les nuages de points ci-dessous

représentent les relations entre ces variables, prises deux à deux

Face à un très petit nombre de variables, il est possible de tirer des

conclusions des nuages de points ou de la matrice de corrélation qui regroupe

tous les coefficients de corrélation linéaires r (j, k) entre les paires de

variables.

Cependant, lorsque le nombre de variables est important, la matrice de

corrélation regroupe une grande quantité de coefficients de corrélation

(e.g., 190 coefficients pour K = 20 variables).

Il est donc essentiel de disposer d'un outil capable de résumer les relations

principales entre les variables de manière visuelle.

L’ACP a pour objectif de tirer des conclusions des relations linéaires entre

variables en détectant les principales dimensions de la variabilité.

Ces conclusions seront complétées par la définition des variables

synthétiques proposées par la ACP.

Il sera donc plus facile de décrire les données en utilisant quelques variables

synthétiques plutôt que toutes les variables d'origine.

Le bilan des liaisons entre variables.

Les questions sont alors :

•  Quelles variables sont corrélées positivement entre elles ?

•  Quelles sont celles qui s’opposent (corrélées négativement) ?

•  Existe-t-il des groupes de variables corrélées entre elles ?

•  Peut-on mettre en évidence une typologie des variables ?

Un autre aspect de l’étude des liaisons entre variables consiste à résumer

l’ensemble des variables par un petit nombre de variables synthétiques

Publicité

appelées ici composantes principales.

Ce point de vue est très lié au précédent : une composante principale peut être

considérée comme le représentant (la synthèse) d’un groupe de variables liées

entre elles.

NB: ACP se concentre sur les relations linéaires entre les variables.

Les liens plus complexes, tels que les relations quadratiques, logarithmiques, ou

encore exponentielles, ne sont pas étudiés dans ACP.

Relations entre les deux études ou bilans

Les bilans ne sont pas indépendants du fait de la dualité inhérente à

l’étude d’un tableau rectangulaire

La structure du tableau peut être analysée à la fois par l’intermédiaire de la

typologie des individus et de la typologie des variables.

On cherche en général à relier ces deux typologies, ainsi on caractérise

les classes d’individus par des variables

•  un groupe de variables liées entre elles par des individus types

Dans la situation idéale, les deux typologies peuvent être « superposées»:

•  chaque groupe de variables caractérise un groupe d’individus,

•  et chaque groupe d’individus rassemble les individus types d’un

groupe de variables.

La notion de principale dimension de variabilité des individus rejoint celle

de variable synthétique.

Poids des individus

•  On suppose que les individus jouent le même rôle:

On attribue le même poids aux individus

On choisit ces poids tels que la masse totale de ces individus soit égale à 1

à chaque individu on associe alors le poids 1/I .

•  On attribue des poids différents aux individus.

Cette situation se présente notamment lorsque les individus représentent

chacun une sous-population ;

On affecte alors à un individu un poids proportionnel à l’effectif de la sous-

population qu’il représente.

Poids des variables

Nous avons accordé jusqu’ici la même importance a priori aux différentes

variables. On est très rarement conduit, dans la pratique, à souhaiter leur

affecter des importances différentes

Cette importance peut être modulée à l’aide d’un coefficient appelé poids de la

variable.

En appelant mk le poids de la variable k, la distance entre deux individus i et l

est définie par :

Transformation des données

•  En ACP, le tableau des données est toujours centré

xik − xk

•  S’affranchir de l’arbitraire des unités de mesure: standardiser les données

(xik − xk )

sk

Ce faisant, on utilise comme unité de mesure pour la variable k, son écart-

type sk.

Toutes les variables présentent alors la même variabilité et de ce fait la même

influence dans le calcul des distances entre individus.

NB: dans ce qui suit et sauf mention contraire, toutes les variables sont toujours

supposées centrées et réduites.

II- Bilans des Individus et des variables

II-1 Nuages des individus

x

Chaque individu i est décrit par les observations du vecteur

(xik )k:1...K

L’individu est représenté par un point dans l’espace vectoriel à K dimensions:

(Xk )k:1...K

RK

L’ensemble des individus constitue le nuage

N I

Le centre de gravité G du nuage est confondu avec l’origine O (dû au centrage)

•  Dans l’espace IRK, la ressemblance entre les individus n’est autre que la

distance euclidienne

•  L’ensemble des distances interindividuelles constitue la forme du nuage

N I

•  Réaliser un bilan des distances interindividuelles : étudier la forme du nuage

c.à.d découvrir:

•  une partition des points: une typologie d’individus

•  des directions d’allongement remarquables: les principales

dimensions de variabilité

II-2 Nuages des variables

À chaque variable, est associée une suite de I nombres.

Une variable peut être représentée comme un vecteur de l’espace vectoriel à I

dimensions, noté , dont chaque dimension représente un individu

R I

L’ensemble des extrémités des vecteurs représentant les variables constitue le nuage

Publicité

N K

La norme de chaque vecteur représentant la variable (càd sa longueure) est

égale à son écart type:

|| k ||2 = ∑i

(xik − xk )2 = s2

k

1

I

Dans le cas d'une ACP standardisée ( dite aussi normée), le nuage de

variables est situé dans une hypersphère de rayon 1

N K

Le cosinus de l’angle formé par les vecteurs représentant les deux variables h

et k, est égal au coefficient de corrélation entre ces deux variables:

cos(k, h) = k, h = ∑i

1

I

(

xik − xk

sk

)(

xih − xh

sh

) = r(k, h)

Réaliser un bilan des coefficients de corrélation entre les variables revient

à étudier les angles entre les vecteurs définissant le nuage N K

ACP fournit des variables synthétiques qui résument les variables initiales

Ces variables synthétiques sont la base d’une représentation plane approchée

des variables et de leur angles.

II-3 Ajustement du nuage des individus

ACP a pour objectif de représenter le nuage de points dans un espace de

dimensions réduites de manière «optimale», c.à.d en distordant le moins

possible les distances entre les individus.

Fournir des images planes approchées du nuage situé dans l’espace

RK

N I

Dans la pratique on cherche une suite

{us;s = 1....S}

de S directions priviligiées de , appelées

axes factoriels

RK

us est choisie telque l’inertie du nuage est

maximale

Prises deux à deux, les axes difinissent des

plans factoriels sur lesquels on projette le

nuage

N I

Trouver le plan factoriel P telque:

∑i OH 2

maximum

i

càd minimum

i

∑i iH 2

Définition du plan factoriel P: les

deux vecteurs non linéaires (u1,u2)

sont choisis telque:

•  u1 définit le meilleur axe en terme

de maximisation de l’inertie du

nuage NI

•  u2, orthogonal à u1, et exprime la

plus grande variabilité du nuage NI,

une fois celle exprimée par u1 est

éliminée

Ainsi la variabilité exprimée par u2 est

la meilleure combinaison

et elle est indépendante de celle

exprimée par u1.

Séquence d'axes pour représenter

NI

Le premier plan (u1, u2), càd le plan

de la meilleure représentation, est

souvent suffisant pour visualiser le

nuage NI.

Lorsque S est supérieur ou égal à 3,

il peut être nécessaire de visualiser le

nuage dans le sous-espace de la

dimension S en utilisant un certain

nombre de représentations planes: la

Publicité

représentation sur (u1, u2) mais

également celle sur (u3, u4) qui est le

plus complémentaire au premier plan.

Dans certaines situations, on peut

choisir d'associer (u2, u3), par

exemple, afin de mettre en évidence

un phénomène particulier qui

apparaît sur ces deux composants.

Comment obtient-on les axes factoriels?

Les composants de la ACP sont obtenus par diagonalisation de la matrice

de corrélation et l’extraction des vecteurs propres et les valeurs propres

associés.

A chaque vecteur propre correspond une valeur propre classées par

ordre décroissant.

us

λs

λs

La valeur propre s’interprété comme l'inertie du nuage NI projetée sur la

composante du rang s ou, en d'autres termes, la «variance expliquée» de

la composante du rang s.

Quand tous les vecteurs propres sont calculés (S = K), l’ACP recrée une

base pour l'espace RK. En ce sens, l’ACP peut être vue comme un

changement de base dans lequel les premiers vecteurs de la nouvelle

base jouent un rôle important.

Remarque

Lorsque les variables sont centrées mais non réduites, la matrice à diagonaliser

serait la matrice de variance – covariance.

II-3 Ajustement du nuage des variables

Ajuster le nuage de variables situé initialement

dans l’espace :

N K

R I

N K

Projeter dans un sous-espace de

dimension plus petite

Trouver une série d’axes orthogonaux

{vs;s = 1....S}

S

Le plan factoriel constitue un sous espace de

projection telque:

vii:1,2

maximise

(v1, v2 )

k=1...K (OH )2

k

vi1,v2

soient orthogonaux (non corrélés)

v1

Par construction maximise

k=1...K (OH )2

k

La projection de la variable k sur l’axe est égale au

v1

k=1...K (OH )2

k

k

cosθ1

=

k

=

k (cos)2θ1

Ainsi le critère maximise

Les variables initiales sont centrées et réduites, leur projection sur est égale à leur

coefficient de corrélation avec cette variable

k (r)2(k, v1)

v1

Le vecteur caractérise la direction d’inertie maximum et définit une nouvelle

variable.

v1

Rechercher le vecteur qui maximise revient à chercher la

combinaison linéaire la plus liée à l’ensemble des variables, au sens du critère:

Publicité

somme des carrés des corrélation maximum.

est la variable qui synthétise au mieux l’ensemble des variables

initiales: composante principale

v1

k

k (OH )2

Les axes factoriels étant orthogonaux deux à deux: les composantes

principales, sont non corrélées entre elles, résument au mieux l’ensemble des

variables initiales.

Nuage de variable dans l'espace RI

Projections des variables dans le

plan factoriel principal

III- Interprétaion des résultats

III-1 Indicateurs Numériques

1.  Pourcentage d’inertie associée avec composante de rang s:

Si ACP est standardisée λs

∑ = K

s=1

K

•  Une mesure de la qualité de représentation des données

•  Une mesure de l’importance relative de la composante

Inertie projetée

inertie totale

=

λs

K

λs

s=1

2- Qualité de réprésenattion d’un individus ou d’une variable:

Inertie projetée

inertie totale

= cos2θS

3- Individus singuliers: distance entre entre l’individu et le centre de gravité du nuage

4- Contribution de l’individu (ou variable) à la construction de la composante de rang s

Exemple

.

La première composante principale, l’axe principal de variabilité entre les jus

d’orange, sépare les deux jus d’orange Tropicana fr. et Pampryl amb.

D'après le tableau de données, nous pouvons voir que ces jus d'orange sont les

plus extrêmes en termes de descripteur d'odeur et d'amertume: Tropicana fr. est le

plus typique et le moins amer tandis que Pampryl amb. est le moins typique et le

plus amer.

La second composante, c’est-à-dire celle qui sépare les jus d’orange de manière

plus significative une fois que la principale composante de la variabilité a été

supprimé, identifie Tropicana amb., qui est le moins intense en termes d’odeur, et

Pampryl le plus intense

La lecture de ces données est fastidieuse lorsque le nombre d'individus et de

variables est élevé. Pour des raisons pratiques, nous faciliterons la caractérisation

des principales composantes en utilisant plus directement les variables.

Représentation des variables comme aide à l'interprétation du nuage

d'individus: Corrélation entre les variables et les composantes principales

F1 est fortement corrélé positivement avec les variables caractéristique d'odeur et de

douceur et, fortement corrélé négativement avec les variables amer et acide.

Tropicana fr., a la coordonnée la plus élevée sur le composant 1, a des valeurs élevées

pour odour typicality et odour intensity et des valeurs faibles pour les variables acide et

amertume.

De même, nous pouvons examiner les corrélations entre F2 et les variables. On peut

noter que les corrélations sont généralement inférieures (en valeur absolue) à celles de

la première composante principale. Nous verrons que cela est directement lié au

pourcentage d'inertie associé à F2 qui, par construction, est inférieur à celui associé à

F1. Le second composant peut être caractérisé par les variables d'intensité de l'odeur et

de la teneur en pulpe

Pour faciliter l'interprétation de ces résultats, en particulier dans les cas où le nombre

de variables est élevé, il est possible de représenter chaque variable sur un

graphique, en utilisant ses coefficients de corrélation avec F1 et F2 comme

coordonnées

Exemples 2:

ACP avec des variables illustratives qualitatives et quantitatives

et Analyse factorielle aux données mixtes

Exemples 3:

Hierarchical clustering on principal compound (HCPC)

Schéma Géneral de l’ACP: Récapitulatif