Fouille de Données: Analyse en Composantes Principales

Page 1 sur 18Lecteur de document UniversityLib

Fouille de Données: Analyse en Composantes Principales

Data Science · notes

Voir tous les documents en intelligence artificielle et données

Année Universitaire 2021-2022

Mastère

"Business Analytics & Data Science" (BADS)

Atelier

Fouille de données

ZOUAOUI Slim

Sommaire

Analyse en composantes principales

Analyse factorielle de correspondance

Méthodes de classification non supervisées

cran.r-project.org

anaconda.com

Analyse en Composantes Principales (ACP)

OBJECTIFSDESTECHNIQUESDESCRIPTIVES

visent à mettre en évidence des informations présentes mais cachées par le

volume des données

il n’y a pas de variable « cible » à prédire

projection du nuage de points sur un espace de dimension inférieure pour obtenir une

visualisation de l’ensemble des liaisons entre : Individus, Variables… tout en minimisant

la perte d’information

trouver dans l’espace de travail des groupes homogènes d’individus ou de variables

détection d’associations entre des objets

Analyse en composantes principales

L’Analyse en Composantes Principales (ACP) a pour objectif de

résumer un ensemble de données quantitatives. Ces données sont

relatives à un grand nombre d’individus et /ou de variables illustrés

dans un tableau à n lignes (chaque ligne représente un individu de

l’échantillon étudié composé de n observations) et p colonnes. p

étant le nombre de variables quantitatives mesurées sur les n

individus. Elle permet notamment de :

Décrire et représenter le réseau d’interaction entre les variables.

Décrire et représenter les ressemblances entre les individus % à

l’ensemble des variables.

Ainsi par le biais de l’ACP, on va synthétiser l’information fournie

par les p variables et ce en construisant un certain nombre de

variables nouvelles, les composantes principales, qui sont des

combinaisons linéaires des différentes variables initiales.

I - Présentation des données :

Soit X un tableau à n lignes et p colonnes.

1

2

.

.

.

.

.

.

.

.

n-1

n

X1

x11

x12

.

.

.

.

.

.

.

.

x1(n-1)

x1n

X2

x21

x22

.

.

.

.

.

.

.

.

x2(n-1)

x2n

…..

…..

…..

.

.

.

.

.

Publicité

.

.

.

…..

…..

Xp-1

x(p-1)1

x(p-1)2

.

.

.

.

.

.

.

.

x(p-1)(n-1)

x(p-1)n

Xp

xp1

xp2

.

.

.

.

.

.

.

.

xp(n-1)

xpn

Exemple : considérons deux variables X1 et X2 mesurées sur cinq

individus.

Individu

1

2

3

4

5

8,3X1 

;

1X 

X1

1

2

3

4

9

6,8X2 

;

79,2

2X 

X2

5

10

8

8

12

33,2

5

2

3

4

1

Les deux variables étudiées ne sont pas homogènes et de plus, elles

n’ont pas d’importances égales. Afin de remédier à ce problème, on

procède à une transformation des données et ce en déterminant les

variables centrées et réduites et telles que

X

X

~

X

1

X

1

X

1

1X

et

~

X

2

Publicité

2

2

2X

Ainsi, les deux variables ont la même moyenne (égale à 0) et la

même variance (égale à1)

On obtient le tableau suivant :

Individu

1

2

3

4

5

~

1X

-1,005

-0.0646

-0,0287

0,072

1,867

~

2X

-1,543

-0,06

-0,257

-0,257

1,458

Les individus seront représentés dans un nouveau repère dont

l’origine est le centre de gravité du nuage de points. On a procédé

donc à une translation de l’origine du repère passant du point o

au centre de gravité du nuage dont les coordonnées dans l’ancien

repère étaient les moyennes respectives des variables X1 et X2 .

Centrage et réduction des données

Mapping de Rn dans Rk : avec k<=n.

Projection dans un espace 2D d'un problème a n dimensions.

Système d'axes indépendants.

Réduction de la dimensionnalité d'un problème.

Minimisation de la Perte d'information.

Décomposition en valeurs propres.

nouvel espace est une combinaison linéaire de l'espace d'origine.

INTÉRÊTSDEL’ACP

Visualisation

•Représentation assez fidèle des

individus d’une population en 2

dimensions via de nouvelles

variables

Pertinence

de Variables

•Détection des facteurs les plus

pertinents dans une dynamique

observée

Relation

Variable / Variable

•Mesure du taux de dépendance

entre les variables

OBJECTIFS – ÉTUDES DES variables

Ressemblance

•Liaisons

•Liaisons

Linéaires

Informations

•Identiques

Corrélations

•Comportement

des variables

dans l’espace

OBJECTIFS – ÉTUDES DES INDIVIDUS

Typologie

•Groupes

d’individus

homogènes

Ressemblance

•Du point de vue

des variables

Différence

•Du point de vue

des variables

II . 2– La détermination des composantes principales :

X

Y

Si on vous demande de

représenter une bouteille

que dessinerez-vous ?

Publicité

Y

Z

Cette partie consiste à synthétiser les données contenues dans le

tableau des données transformées (centrées et réduites). Pour cela,

on construit un nombre de facteurs nouvelles C1, C2, C3, …et Cp

appelées composantes principales, permettant de saisir l’essentiel du

tableau .

II . 2– La détermination des composantes principales :

;

II.2.1– Analyse de l’espace des individus

;

Exemple : considérons deux variables vitesse d’un microprocesseur et capacité

d’une disque dur mesurées sur cinq ordinateurs. Dans ce cas, on peut représenter

les cinq ordinateurs dans le plan formé par les deux variables VIT et CAP..

Individu

VIT

(GHZ)

CAP

(GB)

1

2

3

4

5

1.3

2.6

3

0.6

2.8

6

40

120

4

60

On a :

VIT 

2.06

VIT 

1.05

CAP 

CAP 

46

47.06

)

B

G

(

é

t

i

c

a

p

a

C

140

120

100

80

60

40

20

0

0

0,5

1

1,5

2

2,5

3

3,5

Vitesse (GHZ)

On constate que les deux variables n’ont pas le même ordre de grandeur. La

différence d’une unité de mesure sur la vitesse n’a pas la même importance que

celle d’une unité de mesure sur la capacité.

II . 2– La détermination des composantes principales :

;

II.2.1– Analyse de l’espace des individus

;

on procède à une transformation des données et ce en déterminant les variables

centrées et réduites et on obtient le tableau

~

X

~

X

Publicité

-0,724

0,514

0,895

-1,390

0,705

Individu

1

2

3

4

5

‐0,850

‐0,127

1,572

‐0,892

0,297

)

B

G

(

é

t

i

c

a

p

a

C

3,0

2,5

2,0

1,5

1,0

0,5

0,0

-2,0

-1,5

-1,0

-0,5

0,0

-0,5

0,5

1,0

1,5

-1,0

-1,5

Vitesse (GHZ)

La seconde étape consiste à synthétiser les données contenues dans le tableau

des données transformées (centrées et réduites). Pour cela, on construit un

nombre de variables nouvelles C1, C2, C3, …et Cp appelées composantes

principales, permettant de saisir l’essentiel du tableau

~

X

II . 2– La détermination des composantes principales :

II.2.1– Analyse de l’espace des individus

Dans cet espace, les n individus forment un nuage de points. L’objet de l’Analyse

en Composantes Principales est de décrire de façon synthétique la dispersion du

nuage de points.

A la première étape, l’ACP détermine l’axe D1 passant par l’origine (le centre de

gravité du nuage) selon lequel la dispersion du nuage de points est maximale.

Cet axe D1 passe au plus près du nuage de points, c'est-à-dire est tel que la

moyenne des carrés des distances entre les n points et l’axe D1 est minimale.

Soit u1 le vecteur directeur normé de D1. u1 est alors le vecteur propre normé

associé à la valeur propre la plus élevée de la matrice de corrélation entre les

variables.

II . 2– La détermination des composantes principales :

Ainsi à la première étape, l’ACP fournit la meilleure représentation

unidimensionnelle possible du nuage de point mais elle s’avère insuffisante pour

décrire complètement le nuage de n points. La dispersion du nuage dans les

directions de l’espace orthogonales à D1 n’est pas décrite par cette étape.

Durant la seconde étape, l’ACP détermine un axe D2 de vecteur directeur normé

u2 orthogonal à u1 passant au plus près du nuage de points. Le vecteur u2 est le

vecteur propre normé de la matrice de corrélation associé à sa deuxième valeur

propre.

On continue ainsi de suite la procédure, afin de compléter la description du nuage

de points donnée par les deux premières étapes.

A l’étape k, l’ACP détermine l’axe Dk passant par l’origine, de vecteur directeur

normé uk orthogonal aux différents vecteurs ul (l=1, 2, 3,…, k-1) selon lequel la

dispersion du nuage de points est maximale. Cet axe Dk passe au plus près du

nuage de points.