Année Universitaire 2021-2022
Mastère
"Business Analytics & Data Science" (BADS)
Atelier
Fouille de données
ZOUAOUI Slim
Sommaire
Analyse en composantes principales
Analyse factorielle de correspondance
Méthodes de classification non supervisées
cran.r-project.org
anaconda.com
Analyse en Composantes Principales (ACP)
OBJECTIFSDESTECHNIQUESDESCRIPTIVES
visent à mettre en évidence des informations présentes mais cachées par le
volume des données
il n’y a pas de variable « cible » à prédire
projection du nuage de points sur un espace de dimension inférieure pour obtenir une
visualisation de l’ensemble des liaisons entre : Individus, Variables… tout en minimisant
la perte d’information
trouver dans l’espace de travail des groupes homogènes d’individus ou de variables
détection d’associations entre des objets
Analyse en composantes principales
L’Analyse en Composantes Principales (ACP) a pour objectif de
résumer un ensemble de données quantitatives. Ces données sont
relatives à un grand nombre d’individus et /ou de variables illustrés
dans un tableau à n lignes (chaque ligne représente un individu de
l’échantillon étudié composé de n observations) et p colonnes. p
étant le nombre de variables quantitatives mesurées sur les n
individus. Elle permet notamment de :
Décrire et représenter le réseau d’interaction entre les variables.
Décrire et représenter les ressemblances entre les individus % à
l’ensemble des variables.
Ainsi par le biais de l’ACP, on va synthétiser l’information fournie
par les p variables et ce en construisant un certain nombre de
variables nouvelles, les composantes principales, qui sont des
combinaisons linéaires des différentes variables initiales.
I - Présentation des données :
Soit X un tableau à n lignes et p colonnes.
1
2
.
.
.
.
.
.
.
.
n-1
n
X1
x11
x12
.
.
.
.
.
.
.
.
x1(n-1)
x1n
X2
x21
x22
.
.
.
.
.
.
.
.
x2(n-1)
x2n
…..
…..
…..
.
.
.
.
.
Publicité
.
.
.
…..
…..
Xp-1
x(p-1)1
x(p-1)2
.
.
.
.
.
.
.
.
x(p-1)(n-1)
x(p-1)n
Xp
xp1
xp2
.
.
.
.
.
.
.
.
xp(n-1)
xpn
Exemple : considérons deux variables X1 et X2 mesurées sur cinq
individus.
Individu
1
2
3
4
5
8,3X1
;
1X
X1
1
2
3
4
9
6,8X2
;
79,2
2X
X2
5
10
8
8
12
33,2
5
2
3
4
1
Les deux variables étudiées ne sont pas homogènes et de plus, elles
n’ont pas d’importances égales. Afin de remédier à ce problème, on
procède à une transformation des données et ce en déterminant les
variables centrées et réduites et telles que
X
X
~
X
1
X
1
X
1
1X
et
~
X
2
Publicité
2
2
2X
Ainsi, les deux variables ont la même moyenne (égale à 0) et la
même variance (égale à1)
On obtient le tableau suivant :
Individu
1
2
3
4
5
~
1X
-1,005
-0.0646
-0,0287
0,072
1,867
~
2X
-1,543
-0,06
-0,257
-0,257
1,458
Les individus seront représentés dans un nouveau repère dont
l’origine est le centre de gravité du nuage de points. On a procédé
donc à une translation de l’origine du repère passant du point o
au centre de gravité du nuage dont les coordonnées dans l’ancien
repère étaient les moyennes respectives des variables X1 et X2 .
Centrage et réduction des données
Mapping de Rn dans Rk : avec k<=n.
Projection dans un espace 2D d'un problème a n dimensions.
Système d'axes indépendants.
Réduction de la dimensionnalité d'un problème.
Minimisation de la Perte d'information.
Décomposition en valeurs propres.
nouvel espace est une combinaison linéaire de l'espace d'origine.
INTÉRÊTSDEL’ACP
Visualisation
•Représentation assez fidèle des
individus d’une population en 2
dimensions via de nouvelles
variables
Pertinence
de Variables
•Détection des facteurs les plus
pertinents dans une dynamique
observée
Relation
Variable / Variable
•Mesure du taux de dépendance
entre les variables
OBJECTIFS – ÉTUDES DES variables
Ressemblance
•Liaisons
•Liaisons
Linéaires
Informations
•Identiques
Corrélations
•Comportement
des variables
dans l’espace
OBJECTIFS – ÉTUDES DES INDIVIDUS
Typologie
•Groupes
d’individus
homogènes
Ressemblance
•Du point de vue
des variables
Différence
•Du point de vue
des variables
II . 2– La détermination des composantes principales :
X
Y
Si on vous demande de
représenter une bouteille
que dessinerez-vous ?
Publicité
Y
Z
Cette partie consiste à synthétiser les données contenues dans le
tableau des données transformées (centrées et réduites). Pour cela,
on construit un nombre de facteurs nouvelles C1, C2, C3, …et Cp
appelées composantes principales, permettant de saisir l’essentiel du
tableau .
II . 2– La détermination des composantes principales :
;
II.2.1– Analyse de l’espace des individus
;
Exemple : considérons deux variables vitesse d’un microprocesseur et capacité
d’une disque dur mesurées sur cinq ordinateurs. Dans ce cas, on peut représenter
les cinq ordinateurs dans le plan formé par les deux variables VIT et CAP..
Individu
VIT
(GHZ)
CAP
(GB)
1
2
3
4
5
1.3
2.6
3
0.6
2.8
6
40
120
4
60
On a :
VIT
2.06
VIT
1.05
CAP
CAP
46
47.06
)
B
G
(
é
t
i
c
a
p
a
C
140
120
100
80
60
40
20
0
0
0,5
1
1,5
2
2,5
3
3,5
Vitesse (GHZ)
On constate que les deux variables n’ont pas le même ordre de grandeur. La
différence d’une unité de mesure sur la vitesse n’a pas la même importance que
celle d’une unité de mesure sur la capacité.
II . 2– La détermination des composantes principales :
;
II.2.1– Analyse de l’espace des individus
;
on procède à une transformation des données et ce en déterminant les variables
centrées et réduites et on obtient le tableau
~
X
~
X
Publicité
-0,724
0,514
0,895
-1,390
0,705
Individu
1
2
3
4
5
‐0,850
‐0,127
1,572
‐0,892
0,297
)
B
G
(
é
t
i
c
a
p
a
C
3,0
2,5
2,0
1,5
1,0
0,5
0,0
-2,0
-1,5
-1,0
-0,5
0,0
-0,5
0,5
1,0
1,5
-1,0
-1,5
Vitesse (GHZ)
La seconde étape consiste à synthétiser les données contenues dans le tableau
des données transformées (centrées et réduites). Pour cela, on construit un
nombre de variables nouvelles C1, C2, C3, …et Cp appelées composantes
principales, permettant de saisir l’essentiel du tableau
~
X
II . 2– La détermination des composantes principales :
II.2.1– Analyse de l’espace des individus
Dans cet espace, les n individus forment un nuage de points. L’objet de l’Analyse
en Composantes Principales est de décrire de façon synthétique la dispersion du
nuage de points.
A la première étape, l’ACP détermine l’axe D1 passant par l’origine (le centre de
gravité du nuage) selon lequel la dispersion du nuage de points est maximale.
Cet axe D1 passe au plus près du nuage de points, c'est-à-dire est tel que la
moyenne des carrés des distances entre les n points et l’axe D1 est minimale.
Soit u1 le vecteur directeur normé de D1. u1 est alors le vecteur propre normé
associé à la valeur propre la plus élevée de la matrice de corrélation entre les
variables.
II . 2– La détermination des composantes principales :
Ainsi à la première étape, l’ACP fournit la meilleure représentation
unidimensionnelle possible du nuage de point mais elle s’avère insuffisante pour
décrire complètement le nuage de n points. La dispersion du nuage dans les
directions de l’espace orthogonales à D1 n’est pas décrite par cette étape.
Durant la seconde étape, l’ACP détermine un axe D2 de vecteur directeur normé
u2 orthogonal à u1 passant au plus près du nuage de points. Le vecteur u2 est le
vecteur propre normé de la matrice de corrélation associé à sa deuxième valeur
propre.
On continue ainsi de suite la procédure, afin de compléter la description du nuage
de points donnée par les deux premières étapes.
A l’étape k, l’ACP détermine l’axe Dk passant par l’origine, de vecteur directeur
normé uk orthogonal aux différents vecteurs ul (l=1, 2, 3,…, k-1) selon lequel la
dispersion du nuage de points est maximale. Cet axe Dk passe au plus près du
nuage de points.