L’analyse de donnØes
PolycopiØ de cours ENSIETA - RØf. : 1463
Arnaud MARTIN
Septembre 2004
Table des matiŁres
1 Introduction
1.1 Domaines d’application . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.4 Les mØthodes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.5 Les logiciels . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.6 Plan . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1
2
2
3
4
6
7
2 Analyses Factorielles
2.1
9
9
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9
2.1.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
2.1.2 Domaines d’application . . . . . . . . . . . . . . . . . . . . . . . . .
9
2.1.3 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.2 Principe gØnØral . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
2.3 Ajustement du nuage des individus dans l’espace des variables . . . . . . . 12
2.3.1 Droite d’ajustement . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
2.3.2 Plan d’ajustement
. . . . . . . . . . . . . . . . . . . . . . . . . . . 13
Sous-espace d’ajustement . . . . . . . . . . . . . . . . . . . . . . . . 14
2.3.3
2.4 Ajustement du nuage des variables dans l’espace des individus . . . . . . . 15
2.5 Relation entre les axes d’inertie et les facteurs des deux nuages . . . . . . . 16
. . . . . . . . . . . . . . . . . . . . . . . . . . 18
2.6 Reconstruction des donnØes
2.7 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
3 Analyse en Composantes Principales
23
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
3.1
3.2 Principe de l’ACP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
3.2.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
3.2.2 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 26
3.2.3 L’analyse des nuages . . . . . . . . . . . . . . . . . . . . . . . . . . 27
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
3.2.4 L’ajustement
3.3 ReprØsentation simultanØe . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.4
3.5 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
i
ii
TABLE DES MATI¨RES
4 Analyse Factorielle des Correspondances
4.1
39
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
4.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2 Principe de l’AFC . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2.1 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 43
4.2.2 La ressemblance entre pro(cid:28)ls . . . . . . . . . . . . . . . . . . . . . . 44
4.2.3 Les nuages des deux pro(cid:28)ls . . . . . . . . . . . . . . . . . . . . . . . 46
4.2.4 L’ajustement des deux nuages . . . . . . . . . . . . . . . . . . . . . 47
4.2.5 ReprØsentation simultanØe . . . . . . . . . . . . . . . . . . . . . . . 49
4.3
InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
4.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
5 Analyse des Correspondances Multiples
5.1
57
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 57
5.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.2 Principe de l’ACM . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.2.1 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 59
5.2.2 L’analyse factorielle des correspondances du tableau disjonctif complet 62
5.2.3 L’analyse factorielle des correspondances du tableau de Burt . . . . 66
5.2.4 Les variables quantitatives . . . . . . . . . . . . . . . . . . . . . . . 67
5.3
InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 67
5.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
6.1
6 Analyse Factorielle Discriminante
73
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
6.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 75
6.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 75
6.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
6.2 Principe de l’AFD . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
6.2.1 La discrimination . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
6.2.2 L’a(cid:27)ectation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
6.3 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85
7 Classi(cid:28)cation
7.1
87
Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87
7.1.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87
7.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88
7.1.3 Les mØthodes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 89
7.2 MØthode des centres mobiles . . . . . . . . . . . . . . . . . . . . . . . . . . 90
TABLE DES MATI¨RES
iii
7.2.1 Principe de l’algorithme . . . . . . . . . . . . . . . . . . . . . . . . 90
7.3 La classi(cid:28)cation hiØrarchique . . . . . . . . . . . . . . . . . . . . . . . . . . 91
7.3.1 Principe de la classi(cid:28)cation hiØrarchique ascendante . . . . . . . . . 92
InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 98
7.3.2
7.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101
Glossaire
101
Indications historiques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 103
Rappel de dØ(cid:28)nitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 105
iv
TABLE DES MATI¨RES
Liste des tableaux
1.1 ReprØsentation des donnØes.
. . . . . . . . . . . . . . . . . . . . . . . . . .
3
3.1 ReprØsentation des donnØes pour l’ACP.
3.2 ReprØsentation des donnØes centrØe-rØduites pour l’ACP.
. . . . . . . . . . . . . . . . . . . 24
. . . . . . . . . . 26
4.1 ReprØsentation des donnØes pour l’AFC.
. . . . . . . . . . . . . . . . . . . 40
4.2 Tableau des frØquences relatives pour l’AFC. . . . . . . . . . . . . . . . . . 41
. . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
4.3 Tableau de contingence.
4.4 Tableau des frØquences observØes.
. . . . . . . . . . . . . . . . . . . . . . . 43
4.5 Les pro(cid:28)l-ligne et pro(cid:28)l-colonne. . . . . . . . . . . . . . . . . . . . . . . . . 44
. . . . . . . . . . 44
4.6 Pro(cid:28)ls-lignes (exprimØs en pourcentages-lignes arrondis).
. . . . . . . 45
4.7 Pro(cid:28)ls-colonnes (exprimØs en pourcentages-colonnes arrondis).
. 58
5.1 ReprØsentation des donnØes sous forme de codage condensØ pour l’ACM.
5.2 ReprØsentation des donnØes sous forme de codage condensØ pour l’ACM.
. 59
5.3 Exemple du vin : tableau initial. . . . . . . . . . . . . . . . . . . . . . . . . 60
5.4 Exemple du vin : tableau disjonctif complet.
. . . . . . . . . . . . . . . . . 61
5.5 ReprØsentation des donnØes sous forme du tableau de Burt. . . . . . . . . . 62
. . . . . . . . . . . . . . 63
5.6 Mise en frØquences du tableau disjonctif complet.
5.7 Les pro(cid:28)l-lignes et pro(cid:28)l-colonnes pour l’ACM. . . . . . . . . . . . . . . . . 64
Publicité
6.1 ReprØsentation des donnØes pour l’AFD.
. . . . . . . . . . . . . . . . . . . 75
7.1 ReprØsentation des donnØes pour la classi(cid:28)cation.
7.2 Relation entre les n(cid:247)uds de l’arbre.
. . . . . . . . . . . . . . 88
. . . . . . . . . . . . . . . . . . . . . . 96
v
vi
LISTE DES TABLEAUX
Table des (cid:28)gures
2.1 Les nuages de points. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
. . . . . . . . . . . . . . . . . . . . . . . . 11
2.2 Les formes de nuages de points.
. . . . . . . . . . . . . . . . . . . . 13
2.3 Le nuage NI et sa droite d’ajustement.
. . . . . . . . . . . . . . . . . . . . 15
2.4 Le nuage NI et sa droite d’ajustement.
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
2.5 SchØma de dualitØ.
. . . . . . . . . . . . . 19
2.6 DØcomposition en valeurs singuliŁres du tableau X.
3.1 Nuage des individus NI dans IRK. . . . . . . . . . . . . . . . . . . . . . . . 27
3.2 Di(cid:27)Ørents types de nuages. . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
3.3 Nuage des variables NK dans IRI.
. . . . . . . . . . . . . . . . . . . . . . . 29
. . . . . . . . . . . . . 30
3.4 Ajustement du nuage NI des individus pour l’ACP.
3.5 Ajustement du nuage NK des variables pour l’ACP.
. . . . . . . . . . . . . 31
3.6 L’e(cid:27)et de taille dans IRI. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
3.7 Forme de dualitØ exprimant le nuage NI en fonction du nuage NK. . . . . . 32
3.8 Forme de dualitØ exprimant le nuage NK en fonction du nuage NI. . . . . . 33
3.9 RØsumØ de l’ACP. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37
4.1 Le nuage NI des pro(cid:28)ls-lignes dans l’espace IRJ .
. . . . . . . . . . . . . . . 46
4.2 Le nuage NJ des pro(cid:28)ls-colonnes dans l’espace IRI.
. . . . . . . . . . . . . 48
4.3 Le schØma de dualitØ pour l’AFC. . . . . . . . . . . . . . . . . . . . . . . . 50
4.4 ReprØsentation simultanØe dans le premier plan sur l’exemple de Cohen. . . 51
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52
4.5
4.6 Relation entre la forme du nuage de points et le tableau.
. . . . . . . . . . 53
4.7 RØsumØ de l’AFC. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55
Inertie et dØpendance.
5.1 Hypertable de contingence pour J = 3.
. . . . . . . . . . . . . . . . . . . . 61
5.2 ReprØsentation du nuage des individus NI dans l’espace IRK. . . . . . . . . 65
5.3 ReprØsentation du nuage des modalitØs NK dans l’espace IRI. . . . . . . . . 66
5.4 SchØma de dualitØ pour l’ACM.
. . . . . . . . . . . . . . . . . . . . . . . . 67
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71
5.5 RØsumØ de l’ACM.
6.1 ReprØsentation du nuage NI des individus partitionnØs dans l’espace IRK. . 77
Illustration de la formule de Huygens. . . . . . . . . . . . . . . . . . . . . . 78
6.2
vii
viii
7.1
7.2
7.3
7.4
7.5
7.6
TABLE DES FIGURES
. . . . . . . . . . . . . . . 91
Illustration de l’algorithme des centres mobiles.
Illustration de l’e(cid:27)et de cha(cid:238)ne.
. . . . . . . . . . . . . . . . . . . . . . . . 93
Illustration de la formule de Huygens. . . . . . . . . . . . . . . . . . . . . . 93
. . . . . . . . . . . . . 94
Illustration d’une inertie intraclasse faible et ØlevØe.
Illustration du passage d’une partition Ps (cid:224) une partition ps(cid:0)1. . . . . . . . 94
Illustration de l’algorithme de classi(cid:28)cation avec avec un nuage de I = 5
individus.
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 96
7.7 Exemple de dendrogramme.
. . . . . . . . . . . . . . . . . . . . . . . . . . 97
7.8 Dendrogramme sur les donnØes de composition du sol. . . . . . . . . . . . . 98
7.9 Courbe des indices sur les donnØes de composition du sol. . . . . . . . . . . 99
. . . . . . . 100
7.10 ReprØsentation d’un sous-nuage Iq dans un plan de projection.
7.11 CaractØrisation de la variance du dip(cid:244)le dans une direction. . . . . . . . . . 100
Chapitre 1
Introduction
Les statistiques peuvent Œtre vues en fonction de l’objectif (cid:28)xØ ; classiquement les mØ-
thodes statistiques sont employØes soit pour explorer les donnØes (nommØe statistique
exploratoire) soit pour prØdire un comportement (nommØe statistique prØdictive ou dØ-
cisionnelle [Goa03] ou encore infØrentielle [Sap90]). La statistique exploratoire s’appuie
sur des techniques descriptives et graphiques. Elle est gØnØralement dØcrite par la statis-
tique descriptive qui regroupe des mØthodes exploratoires simples, uni- ou bidimension-
nelle (moyenne, moments, quantiles, variance, corrØlation, ...) et la statistique exploratoire
multidimensionnelle. L’analyse de donnØes s’inscrit dans ce cadre de la statistique explo-
ratoire multidimensionnelle. Nous verrons que des mØthodes issues de l’analyse de donnØes
peuvent Øgalement servir la statistique prØdictive (cf. chapitre 6).
Les mØthodes d’analyse de donnØes ont commencØes (cid:224) Œtre dØveloppØes dans les an-
nØes 50 poussØes par le dØveloppement de l’informatique et du stockage des donnØes qui
depuis n’a cessØ de cro(cid:238)tre. L’analyse de donnØes a surtout ØtØ dØveloppØe en France par
J.P. BenzØcri [Ben80a], [Ben80b] qui a su par l’analyse des correspondances reprØsenter
les donnØes de maniŁre simple et interprØtable. Il dØcrit l’analyse de donnØes selon cinq
principes, un peu dØsuets aujourd’hui :
- 1er principe : Statistique n’est pas probabilitØ.
- 2Łme principe : Le modŁle doit suivre les donnØes et non l’inverse.
- 3Łme principe : Il convient de traiter simultanØment des informations concernant le
plus grand nombre possible de dimensions.
- 4Łme principe : Pour l’analyse des faits complexes et notamment des faits sociaux,
l’ordinateur est indispensable.
- 5Łme principe : Utiliser un ordinateur implique d’abandonner toutes techniques
con(cid:231)ues avant l’avŁnement du calcul automatique.
Ces cinq principes montrent bien l’approche d’une part de la statistique (cid:224) la di(cid:27)Ørence
des probabilitØs - les modŁles doivent coller aux donnØes - et d’autre part de l’analyse de
donnØes - il faut traiter le plus grand nombre de donnØes simultanØment ce qui implique
l’utilisation de l’ordinateur et ainsi l’utilisation de nouvelles techniques adaptØes.
L’analyse de donnØes fait toujours l’objet de recherche pour s’adapter (cid:224) tout type de
donnØes et faire face (cid:224) des considØrations de traitements en temps rØel en dØpit de la
1
2
CHAPITRE 1. INTRODUCTION
quantitØ de donnØes toujours plus importante. Les mØthodes dØveloppØes (et l’analyse de
donnØes) sont maintenant souvent intØgrØes avec des mØthodes issues de l’informatique et
de l’intelligence arti(cid:28)cielle (apprentissage numØrique et symbolique) dans le data mining
traduit en fran(cid:231)ais par (cid:16)fouille de donnØes(cid:17) ou encore extraction de connaissance (cid:224) partir
de donnØes [HL03].
1.1 Domaines d’application
Aujourd’hui les mØthodes d’analyse de donnØes sont employØes dans un grand nombre
de domaines qu’il est impossible d’ØnumØrer. Actuellement ces mØthodes sont beaucoup
utilisØes en marketing par exemple pour la gestion de la clientŁle (pour proposer de nou-
velles o(cid:27)res ciblØes par exemple). Elles permettent Øgalement l’analyse d’enquŒtes par
exemple par l’interprØtation de sondages (oø de nombreuses donnØes qualitatives doivent
Œtre prises en compte). Nous pouvons Øgalement citer la recherche documentaire qui est
de plus en plus utile notamment avec internet (la di(cid:30)cultØ porte ici sur le type de don-
nØes textuelles ou autres). Le grand nombre de donnØes en mØtØorologie a ØtØ une des
premiŁre motivation pour le dØveloppement des mØthodes d’analyse de donnØes. En fait,
tout domaine scienti(cid:28)que qui doit gØrer de grande quantitØ de donnØes de type variØ ont
recours (cid:224) ces approches (Øcologie, linguistique, Øconomie, etc) ainsi que tout domaine in-
dustriel (assurance, banque, tØlØphonie, etc). Ces approches ont Øgalement ØtØ mis (cid:224) pro(cid:28)t
en traitement du signal et des images, oø elles sont souvent employØes comme prØtraite-
ments (qui peuvent Œtre vus comme des (cid:28)ltres). En ingØnierie mØcanique, elles peuvent
aussi permettre d’extraire des informations intØressantes sans avoir recours (cid:224) des modŁles
parfois alourdis pour tenir compte de toutes les donnØes.
1.2 Les donnØes
Nous considØrons tout d’abord que la population 1 peut Œtre dØcrite par des donnØes de
deux types de caractŁres : qualitatif ou quantitatif. Les caractŁres qualitatifs peuvent Œtre
purs (variables nominales) i.e. que les modalitØs ne possŁdent pas de structure d’ordre
ou ordonnØs (variables ordinales) i.e. que les modalitØs qualitatives sont ordonnØes. Il est
aisØ de comprendre que les donnØes (cid:224) caractŁre qualitatif doivent Œtre adaptØes pour les
mØthodes numØriques.
Les mØthodes d’analyse de donnØes supposent souvent une organisation des donnØes
particuliŁre, naturelle, mais parfois di(cid:30)cile (cid:224) rØaliser selon l’application et les donnØes. Le
choix d’un tableau permet une organisation dans le plan de toutes les donnØes et ainsi de
traiter simultanØment toute l’information. Ainsi la plupart des mØthodes nØcessitent une
organisation des donnØes prØsentØe par le tableau 1.1. Nous verrons au Chapitre 4 que
selon les donnØes ce tableau est quelque peu modi(cid:28)Ø, mais l’idØe de tableau reste prØsente
dans toutes les mØthodes d’analyse de donnØes.
1Les mots en italique sont dØ(cid:28)nis dans le glossaire page 103.
Publicité
1.3. LES OBJECTIFS
3
Variables
k
. . . . . .
. . . . . . K
. . . . . .
...
...
xik
...
...
. . . . . .
1
1
...
...
i
...
...
I
i
s
u
d
v
d
n
I
i
Tab. 1.1 (cid:21) ReprØsentation des donnØes.
Ainsi les observations ou individus ou encore unitØs statistiques sont reprØsentØs en
ligne et sont chacun dØcrits par des variables ou caractŁres. Nous conserverons les nota-
tions du tableau 1.1 dans la suite du document. xik est donc la valeur de la variable k pour
l’individu i avec k = 1; :::; K et i = 1; :::; I. Par abus de notations, pour des considØrations
de simpli(cid:28)cation de celles-ci, I reprØsente (cid:224) la fois le nombre d’individus et l’ensemble des
, de mŒme K reprØsente le nombre de variables et l’ensemble des
1; :::; i; :::; I
individus
g
f
.
1; :::; k; :::; K
variables
g
f
Cette reprØsentation des donnØes peut faciliter la lecture de petits tableau, i.e. lorsqu’il
y a peu de donnØes. Cependant, dŁs lors que la taille du tableau est grand, ou que nous
recherchons des relations entre plus de deux individus ou plus de deux variables, cette
reprØsentation et les techniques simples de la statistique descriptive ne su(cid:30)sent plus.
1.3 Les objectifs
Les objectifs que se sont (cid:28)xØs les chercheurs en analyse de donnØes sont donc de
rØpondre aux problŁmes posØs par des tableaux de grandes dimensions. Les objectifs sont
souvent prØsentØs en fonction du type de mØthodes, ainsi deux objectifs ressortent : la
visualisation des donnØes dans le meilleur espace rØduit et le regroupement dans tout
l’espace.
Les mØthodes de l’analyse de donnØes doivent donc permettre de reprØsenter synthØti-
quement de vastes ensembles numØriques pour faciliter l’opØrateur dans ses dØcisions. En
fait d’ensembles numØriques, les mØthodes d’analyse de donnØes se proposent Øgalement
de traiter des donnØes qualitatives, ce qui en fait des mØthodes capables de considØrer un
grand nombre de problŁmes. Les reprØsentations recherchØes sont bien souvent des reprØ-
sentations graphiques, comme il est di(cid:30)cile de visualiser des points dans des espaces de
dimensions supØrieures (cid:224) deux, nous chercherons (cid:224) reprØsenter ces points dans des plans.
Ces mØthodes ne se limitent pas (cid:224) une reprØsentation des donnØes, ou du moins pour la
rendre plus aisØe, elles cherchent les ressemblances entre les individus et les liaisons entre
les variables. Ces proximitØs entre individus et variables vont permettre (cid:224) l’opØrateur de
4
CHAPITRE 1. INTRODUCTION
dØterminer une typologie des individus et des variables, et ainsi il pourra interprØter ses
donnØes et fournir une synthŁse des rØsultats des analyses. Nous voyons donc que les deux
objectifs prØcØdemment citØs sont trŁs liØs voir indissociables, ce qui entra(cid:238)ne souvent
l’utilisation conjointe de plusieurs mØthodes d’analyse de donnØes.
1.4 Les mØthodes
L’analyse de donnØes regroupe deux familles de mØthodes suivant les deux objectifs
citØs prØcØdemment :
(cid:21) Une partie des mØthodes cherche (cid:224) reprØsenter de grands ensembles de donnØes
par peu de variables i.e. recherche les dimensions pertinentes de ces donnØes. Les
variables ainsi dØterminØes permettent une reprØsentation synthØtique recherchØe.
Parmi ces mØthodes de nombreuses analyses sont issues de l’analyse factorielle, telles
que l’analyse en composantes principales, l’analyse factorielle des correspondances,
l’analyse factorielle des correspondances multiples, ou encore l’analyse canonique.
L’analyse en composantes principales est l’une des mØthodes les plus employØes. Elle
est particuliŁrement adaptØe aux variables quantitatives, continues, a priori corrØ-
lØes entre elles. Une fois les donnØes projetØes dans di(cid:27)Ørents plans, les proximitØs
entre variables s’interprŁtent en termes de corrØlations, tandis que les proximitØs
entre individus s’interprŁtent en termes de similitudes globales des valeurs observØes.
L’analyse factorielle des correspondances (ou analyse des correspondances binaires)
a ØtØ con(cid:231)ue pour l’Øtude des tableaux de contingence obtenus par croisement de
variables qualitatives. Cette analyse permet donc de traiter des variables qualita-
tives et est surtout adaptØe (cid:224) ce type de variables. Dans cette approche, les lignes
et les colonnes ont un r(cid:244)le symØtrique et s’interprŁtent de la mŒme fa(cid:231)on. L’analyse
factorielle des correspondances multiples est une extension de l’analyse factorielle
des correspondances qui ne permet que le croisement de deux variables qualitatives.
Elle est donc adaptØe (cid:224) la description de grands tableaux de variables qualitatives
par exemple pour le traitement d’enquŒtes. L’analyse canonique est trŁs peu utilisØe
en pratique, son intØrŒt porte sur son aspect thØorique. Elle cherche (cid:224) analyser les
relations entre deux groupes de variables de nature di(cid:27)Ørente. De ce fait l’analyse
factorielle des correspondances peut Œtre vu comme analyse canonique particuliŁre
[CDG+89], [LMP95].
(cid:21) Une autre partie des mØthodes cherche (cid:224) classer les donnØes de maniŁre automa-
tique. Ces mØthodes sont complØmentaires avec les prØcØdentes pour synthØtiser et
analyser les donnØes et rØpondre plus particuliŁrement (cid:224) l’objectif (cid:28)xØ de caractØriser
les proximitØs entre individus et celles entre variables. Ces mØthodes de classi(cid:28)ca-
tion sont soit (cid:224) apprentissage supervisØ (i.e. qui nØcessitent une base de donnØes
d’apprentissage - ces mØthodes sont appelØes en statistique les analyses discrimi-
nantes) soit (cid:224) apprentissage non-supervisØe (i.e. qui ne nØcessitent aucune donnØe
prØalable).
(cid:21) Parmi les mØthodes issues de l’analyse discriminante et directement rattachØes (cid:224)
1.4. LES M(cid:201)THODES
5
l’analyse de donnØes il y a l’analyse linØaire discriminante, la rØgression logistique,
les k plus proches voisins ou encore les arbres de dØcision. D’autres mØthodes issues
de l’intelligence arti(cid:28)cielle et du monde de la reconnaissance des formes peuvent
Œtre rattachØes (cid:224) l’analyse discriminante telles que le perceptron multicouche (et
les autres rØseaux de neurones) et les cha(cid:238)nes de Markov [Kun00] ou encore issues
de la thØorie de l’apprentissage statistique telle que les machines (cid:224) vecteurs de
supports [Vap99]. Si ces derniŁres ne sont pas toujours considØrØes comme fai-
sant partie de l’analyse de donnØes, elles sont parfaitement intØgrØes dans le data
mining.
L’analyse linØaire discriminante est aussi appelØe analyse factorielle discriminante
car elle est en fait une analyse en composantes principales supervisØe. Elle dØcrit
les individus en classes (celles-ci sont donnØes par une variable issue de l’appren-
tissage) et ensuite a(cid:27)ecte de nouveaux individus dans ces classes. C’est donc une
mØthode (cid:224) la fois descriptive et prØdictive. Elle permet de traiter aussi bien des
variables quantitatives que qualitatives.
La rØgression logistique consiste (cid:224) exprimer
les probabilitØs a posteriori
d’appartenance (cid:224) une classe p(C=x) comme une fonction de l’observation
[Sap90] [Cel03]. Bien souvent c’est la rØgression linØaire qui est employØe, i.e.
qu’il faut dØterminer les coe(cid:30)cients (cid:12) tels que :
ln
p(C=x)
1
(cid:18)
(cid:0)
p(C=x)
(cid:19)
d
= (cid:12)0 +
(cid:12)ixi:
i=1
X
(1.1)
L’approche des k plus proches voisins repose sur l’idØe simple d’attribuer un nouvel
individu (cid:224) la classe majoritaire parmi ses k plus proches voisins (individus de la
base d’apprentissage les plus proches au sens d’une certaine distance).
Les arbres de dØcision nØcessitent souvent une construction dØlicate et di(cid:30)ci-
lement gØnØralisable si les donnØes d’apprentissage sont peu reprØsentatives de
la rØalitØ. La mØthode CART (Classi(cid:28)cation And Regression Tree) possŁde une
construction d’arbre aux propriØtØs intØressantes pour la segmentation [BFRS93].
(cid:21) Les mØthodes de classi(cid:28)cation automatique ne nØcessitant pas d’apprentissage
o(cid:27)rent un intØrŒt important lorsque les donnØes sont complŁtement inconnues.
Elles permettent ainsi de dØgager des classes qui ne sont pas Øvidentes a priori.
Publicité
Les deux principales mØthodes dØveloppØes sont la mØthode des centres mobiles
(apparentØe (cid:224) la mØthode des k-means ou des nuØes dynamiques (comme un
cas particulier)) et la classi(cid:28)cation hiØrarchique ascendante ou descendante. Nous
pouvons Øgalement citer les approches fondØes sur les graphes et hypergraphes
[Ber72].
La mØthode des centres mobiles consiste (cid:224) associer les individus (cid:224) des centres
de classes choisis alØatoirement, puis (cid:224) recalculer ces centres jusqu’(cid:224) obtenir une
convergence. La di(cid:30)cultØ consiste dans un choix astucieux des centres au dØpart
pour une convergence plus rapide et dans le choix d’une distance appropriØe.
La classi(cid:28)cation hiØrarchique ascendante (resp. descendante) consiste (cid:224) regrouper
6
CHAPITRE 1. INTRODUCTION
les individus selon leur ressemblance (resp. dissemblance). Toute la di(cid:30)cultØ est
dans la dØ(cid:28)nition d’une mesure de ressemblance et de la distance associØe.
1.5 Les logiciels
Les mØthodes d’analyse de donnØes nØes de la recherche universitaire sont depuis
longtemps entrØes dans le monde industriel. Il y a cependant peu de logiciels qui savent
intØgrer ces mØthodes pour une recherche exploratoire aisØe dans les donnØes. Nous citons
ici cinq logiciels :
- SAS :
Ce logiciel est un logiciel de statistique trŁs complet et trŁs performant. Il a d’abord
ØtØ dØveloppØ pour l’environnement Unix, mais est maintenant accessible sous tout
environnement. Il permet une puissance de calcul importante et ainsi est trŁs bien
adaptØ (cid:224) tous traitements statistiques sur des donnØes trŁs volumineuses. Son manque
de convivialitØ et surtout son prix fait qu’il est encore peu employØ dans les entre-
prises qui ne se dØdient pas complŁtement (cid:224) la statistique. De nombreux cours uni-
versitaires de statistique sont proposØs avec ce logiciel qui s’approche d’un langage
(ex. UniversitØ de Rennes 1).
- Splus :
Splus est (cid:224) la fois un langage statistique et graphique interactif interprØtØ et orientØ
objet. C’est donc (cid:224) la fois un logiciel statistique et un langage de programmation.
La particularitØ de ce langage est qu’il permet de mØlanger des commandes peu
ØvoluØes (cid:224) des commandes trŁs ØvoluØes. Il a ØtØ dØveloppØ par Statistical Sciences
autour du langage S, con(cid:231)u par les Bell Laboratories. Depuis, Splus est devenu
propriØtØ de Mathsoft aprŁs le rachat de Statistical Sciences. Il est parfois employØ
pour l’enseignement (ex. UniversitØ Paul Sabatier de Toulouse III).
- R :
Ce logiciel est la version gratuite de Splus. Il est tØlØchargeable sous www.r-project.org
pour tous systŁmes d’exploitation. Il sou(cid:27)re Øgalement de peu de convivialitØ et
semble encore trŁs peu employØ en industrie. De part sa gratuitØ, il est de plus
en plus employØ pour la rØalisation de cours de statistiques (ex. UniversitØ Paul
Sabatier de Toulouse III, UniversitØ de Lyon 1).
- XlStat :
Excel propose une macro payante permettant d’e(cid:27)ectuer quelques mØthodes
d’analyse de donnØes. Elle est cependant trŁs limitØe, utilisable qu’avec Excel sous
Windows et de plus payante. Certaines Øcoles d’ingØnieurs s’en contentent (ex. ENI-
TAB, Bordeaux).
- UniWin Plus :
Statgraphics est un logiciel de statistiques gØnØrales, qui propose un module d’ana-
lyse de donnØes de treize mØthodes. DØveloppØ uniquement pour les environnements
Windows, l’accent est portØ sur les interfaces graphiques. Statgraphics propose un
grand nombre d’analyses statistiques et permet l’utilisation de beaucoup de for-
1.6. PLAN
7
mat de donnØes. Il est commercialisØ par Sigma Plus. Statgraphics est enseignØ par
exemple (cid:224) l’IUT de Vannes.
- Stalab :
Ce logiciel dØveloppØ par M. Jambu [Jam99b], [Jam99a] Øtait initialement prØvu
pour Windows. Sa convivialitØ a permis un essor industriel qui semble s’Œtre rØduit.
Il a ØtØ utilisØ pour l’enseignement en Øcoles d’ingØnieurs (ex. ENSSAT, Lannion).
- SPAD :
Le logiciel SPAD supportØ entre autre par A. Morineau est toujours maintenu (cid:224)
jour avec de nouvelles mØthodes issues de la recherche universitaire. Sa version sous
Windows est conviviale ce qui a poussØ son achat par de plus en plus d’industriels.
Le soucis de coller (cid:224) une rØalitØ industrielle fait qu’il est employØ en enseignement
(ex. IUT de Vannes, ENSIETA).
1.6 Plan
Ce document ne cherche pas (cid:224) prØsenter l’ensemble des mØthodes de l’analyse de don-
nØes dont certaines ont ØtØ ØvoquØes dans la section 1.4. Nous prØsentons ici les idØes des
principales mØthodes, ces clØs et les rØfØrences2 donnØes permettront au lecteur d’appro-
fondir les mØthodes prØsentØes et de comprendre les autres.
Nous commencerons ainsi par l’Øtude de quelques analyses factorielles. Le premier
chapitre prØsente le principe gØnØral des analyses factorielles. Les chapitres 3, 4 et 5
prØsentent respectivement l’analyse en composantes principales, l’analyse factorielle des
correspondances et l’analyse des correspondances multiples. Nous proposons ensuite au
chapitre 6 l’Øtude d’une analyse discriminante : l’analyse factorielle discriminante qui
peut Øgalement Œtre vue comme une analyse factorielle. Dans le cadre des mØthodes de
classi(cid:28)cation non-supervisØe nous prØsentons la classi(cid:28)cation hiØrarchique au chapitre 7.
2Les rØfØrences proposØes ne sont pas exhaustives, il existe un grand nombre d’ouvrages de qualitØ
dans le domaine de l’analyse de donnØes.
8
CHAPITRE 1. INTRODUCTION
Chapitre 2
Analyses Factorielles
2.1
Introduction
Les analyses factorielles constituent la plupart des analyses de donnØes. Elles sont
fondØes sur un principe unique, c’est pour cela que nous pouvons parler de l’analyse
factorielle [EP90]. Ce principe repose sur le fait que les deux nuages de points reprØsentant
respectivement les lignes et les colonnes du tableau ØtudiØ (tableau 1.1) sont construits et
reprØsentØs sur des graphiques. Ces reprØsentations des lignes et des colonnes fortement
liØes entre elles permettent une analyse plus aisØe pour l’opØrateur.
2.1.1 Les objectifs
Les analyses factorielles tentent de rØpondre (cid:224) la question : tenant compte des res-
semblances des individus et des liaisons entre variables, est-il possible de rØsumer toutes
les donnØes par un nombre restreint de valeurs sans perte d’information importante ? En
e(cid:27)et en cherchant (cid:224) rØduire le nombre de variables dØcrivant les donnØes, la quantitØ
d’information ne peut Œtre que rØduite, au mieux maintenue. La motivation de cette rØ-
duction du nombre de valeurs vient du fait que des valeurs peu nombreuses sont plus
faciles (cid:224) reprØsenter gØomØtriquement et graphiquement (un des objectifs de l’analyse de
donnØes).
2.1.2 Domaines d’application
L’ensembles des mØthodes d’analyses factorielles permettent de rØpondre (cid:224) la plupart
des problŁmes posØs par les applications auxquelles se consacre l’analyse de donnØes.
Le choix d’une analyse par rapport (cid:224) une autre se fera en fonction du type de donnØes
(quantitatif, qualitatif, mais aussi textuelle) et de la quantitØ de donnØes. Il est bien sßr
possible lorsque le cas se prØsente d’appliquer une analyse sur les donnØes quantitatives
de la population puis une autre analyse sur les donnØes qualitatives. Ainsi dans le cadre
d’un enquŒte par exemple, une analyse en composantes principales peut faire ressortir les
9
10
CHAPITRE 2. ANALYSES FACTORIELLES
liaisons entre les variables quantitatives, puis une analyse des correspondances multiples
peut donner une reprØsentation des variables qualitatives en fonction de leur modalitØs.
2.1.3 Les donnØes
Dans ce chapitre, nous retenons la reprØsentation des donnØes sous forme de tableau
(tableau 1.1, page 3), et les notations associØes.
2.2 Principe gØnØral
Le principe gØnØral de l’analyse factorielle est fondØ sur une double hypothŁse. Sup-
posons qu’il existe un vecteur colonne u1 (cid:224) K composantes et un vecteur colonne v1 (cid:224)
xk
1 est le vecteur
I composantes tel que le tableau X =
i
transposØ de u1. Ainsi des I + K valeurs des vecteurs u1 et v1, les I:K valeurs de X sont
(cid:9)
retrouvØes. Cette rØduction devient vite intØressante dŁs lors que I et K sont assez grands.
De plus elle n’entra(cid:238)ne aucune perte d’information. Cette hypothŁse est malheureusement
improbable en pratique.
s’Øcrive X = v1ut
1, oø ut
(cid:8)
Exemple 2.2.1 ConsidØrons l’ensemble des notes des ØlŁves de l’ENSIETA durant une
annØe. Le nombre d’ØlŁves est environ de 450, et nous pouvons considØrer qu’ils obtiennent
environ 30 notes chacun. Ainsi le tableau reprØsentant l’ensemble des notes est constituØ de
13 500 valeurs. La rØduction prØsentØe ci-dessus permet de rØduire ce nombre (cid:224) 480 valeurs
sans perte d’information si l’hypothŁse est valide. Pour que l’hypothŁse soit vØri(cid:28)Øe, il
faudrait pouvoir dØduire les notes de l’ensemble des ØlŁves (cid:224) partir de celles d’un seul
ØlŁve et d’un vecteur de pondØration. Ceci signi(cid:28)e que les notes sont dØpendantes les unes
des autres ou encore trŁs fortement corrØlØes.
En pratique, il faut donc chercher une approximation de rang S pour X. C’est-(cid:224)-dire ces
analyses cherchent (cid:224) Øcrire le tableau X tel que :
X = v1ut
1 + v2ut
2 + : : : + vSut
S + E;
(2.1)
oø E est une matrice de I lignes et K colonnes de termes nØgligeables dite matrice
rØsiduelle. Ainsi les I:K valeurs initiales de X sont reconstituØes de fa(cid:231)on satisfaisante par
les S:(I +K) valeurs des S vecteurs vq et uq. Les donnØes sont donc soit considØrØes en tant
qu’individus dØcrits par leurs K variables (cid:224) l’aide des vecteurs uq (cid:224) K composantes, soit
en tant que variables dØcrites par les I individus (cid:224) l’aide des vecteurs vq (cid:224) I composantes.
La rØsolution de ce problŁme passe donc par la considØration des deux nuages de
Publicité
points ou encore des deux reprØsentations gØomØtriques associØes ((cid:28...