L’analyse de donnØes

Programming, Math, etc. · course

L’analyse de donnØes

PolycopiØ de cours ENSIETA - RØf. : 1463

Arnaud MARTIN

Septembre 2004

Table des matiŁres

1 Introduction

1.1 Domaines d’application . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1.4 Les mØthodes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1.5 Les logiciels . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1.6 Plan . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

1

2

2

3

4

6

7

2 Analyses Factorielles

2.1

9

9

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

9

2.1.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

2.1.2 Domaines d’application . . . . . . . . . . . . . . . . . . . . . . . . .

9

2.1.3 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10

2.2 Principe gØnØral . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10

2.3 Ajustement du nuage des individus dans l’espace des variables . . . . . . . 12

2.3.1 Droite d’ajustement . . . . . . . . . . . . . . . . . . . . . . . . . . . 12

2.3.2 Plan d’ajustement

. . . . . . . . . . . . . . . . . . . . . . . . . . . 13

Sous-espace d’ajustement . . . . . . . . . . . . . . . . . . . . . . . . 14

2.3.3

2.4 Ajustement du nuage des variables dans l’espace des individus . . . . . . . 15

2.5 Relation entre les axes d’inertie et les facteurs des deux nuages . . . . . . . 16

. . . . . . . . . . . . . . . . . . . . . . . . . . 18

2.6 Reconstruction des donnØes

2.7 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20

3 Analyse en Composantes Principales

23

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23

3.1

3.2 Principe de l’ACP . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24

3.2.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24

3.2.2 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 26

3.2.3 L’analyse des nuages . . . . . . . . . . . . . . . . . . . . . . . . . . 27

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

3.2.4 L’ajustement

3.3 ReprØsentation simultanØe . . . . . . . . . . . . . . . . . . . . . . . . . . . 31

InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33

3.4

3.5 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35

i

ii

TABLE DES MATI¨RES

4 Analyse Factorielle des Correspondances

4.1

39

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39

4.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 39

4.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40

4.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42

4.2 Principe de l’AFC . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42

4.2.1 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 43

4.2.2 La ressemblance entre pro(cid:28)ls . . . . . . . . . . . . . . . . . . . . . . 44

4.2.3 Les nuages des deux pro(cid:28)ls . . . . . . . . . . . . . . . . . . . . . . . 46

4.2.4 L’ajustement des deux nuages . . . . . . . . . . . . . . . . . . . . . 47

4.2.5 ReprØsentation simultanØe . . . . . . . . . . . . . . . . . . . . . . . 49

4.3

InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50

4.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54

5 Analyse des Correspondances Multiples

5.1

57

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57

5.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 57

5.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57

5.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58

5.2 Principe de l’ACM . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58

5.2.1 La transformation des donnØes . . . . . . . . . . . . . . . . . . . . . 59

5.2.2 L’analyse factorielle des correspondances du tableau disjonctif complet 62

5.2.3 L’analyse factorielle des correspondances du tableau de Burt . . . . 66

5.2.4 Les variables quantitatives . . . . . . . . . . . . . . . . . . . . . . . 67

5.3

InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 67

5.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69

6.1

6 Analyse Factorielle Discriminante

73

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73

6.1.1 Les domaines d’application . . . . . . . . . . . . . . . . . . . . . . . 75

6.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 75

6.1.3 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76

6.2 Principe de l’AFD . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76

6.2.1 La discrimination . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76

6.2.2 L’a(cid:27)ectation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81

6.3 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85

7 Classi(cid:28)cation

7.1

87

Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87

7.1.1 Les objectifs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87

7.1.2 Les donnØes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88

7.1.3 Les mØthodes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 89

7.2 MØthode des centres mobiles . . . . . . . . . . . . . . . . . . . . . . . . . . 90

TABLE DES MATI¨RES

iii

7.2.1 Principe de l’algorithme . . . . . . . . . . . . . . . . . . . . . . . . 90

7.3 La classi(cid:28)cation hiØrarchique . . . . . . . . . . . . . . . . . . . . . . . . . . 91

7.3.1 Principe de la classi(cid:28)cation hiØrarchique ascendante . . . . . . . . . 92

InterprØtation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 98

7.3.2

7.4 Conclusion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101

Glossaire

101

Indications historiques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 103

Rappel de dØ(cid:28)nitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 105

iv

TABLE DES MATI¨RES

Liste des tableaux

1.1 ReprØsentation des donnØes.

. . . . . . . . . . . . . . . . . . . . . . . . . .

3

3.1 ReprØsentation des donnØes pour l’ACP.

3.2 ReprØsentation des donnØes centrØe-rØduites pour l’ACP.

. . . . . . . . . . . . . . . . . . . 24

. . . . . . . . . . 26

4.1 ReprØsentation des donnØes pour l’AFC.

. . . . . . . . . . . . . . . . . . . 40

4.2 Tableau des frØquences relatives pour l’AFC. . . . . . . . . . . . . . . . . . 41

. . . . . . . . . . . . . . . . . . . . . . . . . . . . 43

4.3 Tableau de contingence.

4.4 Tableau des frØquences observØes.

. . . . . . . . . . . . . . . . . . . . . . . 43

4.5 Les pro(cid:28)l-ligne et pro(cid:28)l-colonne. . . . . . . . . . . . . . . . . . . . . . . . . 44

. . . . . . . . . . 44

4.6 Pro(cid:28)ls-lignes (exprimØs en pourcentages-lignes arrondis).

. . . . . . . 45

4.7 Pro(cid:28)ls-colonnes (exprimØs en pourcentages-colonnes arrondis).

. 58

5.1 ReprØsentation des donnØes sous forme de codage condensØ pour l’ACM.

5.2 ReprØsentation des donnØes sous forme de codage condensØ pour l’ACM.

. 59

5.3 Exemple du vin : tableau initial. . . . . . . . . . . . . . . . . . . . . . . . . 60

5.4 Exemple du vin : tableau disjonctif complet.

. . . . . . . . . . . . . . . . . 61

5.5 ReprØsentation des donnØes sous forme du tableau de Burt. . . . . . . . . . 62

. . . . . . . . . . . . . . 63

5.6 Mise en frØquences du tableau disjonctif complet.

5.7 Les pro(cid:28)l-lignes et pro(cid:28)l-colonnes pour l’ACM. . . . . . . . . . . . . . . . . 64

Publicité

6.1 ReprØsentation des donnØes pour l’AFD.

. . . . . . . . . . . . . . . . . . . 75

7.1 ReprØsentation des donnØes pour la classi(cid:28)cation.

7.2 Relation entre les n(cid:247)uds de l’arbre.

. . . . . . . . . . . . . . 88

. . . . . . . . . . . . . . . . . . . . . . 96

v

vi

LISTE DES TABLEAUX

Table des (cid:28)gures

2.1 Les nuages de points. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11

. . . . . . . . . . . . . . . . . . . . . . . . 11

2.2 Les formes de nuages de points.

. . . . . . . . . . . . . . . . . . . . 13

2.3 Le nuage NI et sa droite d’ajustement.

. . . . . . . . . . . . . . . . . . . . 15

2.4 Le nuage NI et sa droite d’ajustement.

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

2.5 SchØma de dualitØ.

. . . . . . . . . . . . . 19

2.6 DØcomposition en valeurs singuliŁres du tableau X.

3.1 Nuage des individus NI dans IRK. . . . . . . . . . . . . . . . . . . . . . . . 27

3.2 Di(cid:27)Ørents types de nuages. . . . . . . . . . . . . . . . . . . . . . . . . . . . 27

3.3 Nuage des variables NK dans IRI.

. . . . . . . . . . . . . . . . . . . . . . . 29

. . . . . . . . . . . . . 30

3.4 Ajustement du nuage NI des individus pour l’ACP.

3.5 Ajustement du nuage NK des variables pour l’ACP.

. . . . . . . . . . . . . 31

3.6 L’e(cid:27)et de taille dans IRI. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32

3.7 Forme de dualitØ exprimant le nuage NI en fonction du nuage NK. . . . . . 32

3.8 Forme de dualitØ exprimant le nuage NK en fonction du nuage NI. . . . . . 33

3.9 RØsumØ de l’ACP. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37

4.1 Le nuage NI des pro(cid:28)ls-lignes dans l’espace IRJ .

. . . . . . . . . . . . . . . 46

4.2 Le nuage NJ des pro(cid:28)ls-colonnes dans l’espace IRI.

. . . . . . . . . . . . . 48

4.3 Le schØma de dualitØ pour l’AFC. . . . . . . . . . . . . . . . . . . . . . . . 50

4.4 ReprØsentation simultanØe dans le premier plan sur l’exemple de Cohen. . . 51

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52

4.5

4.6 Relation entre la forme du nuage de points et le tableau.

. . . . . . . . . . 53

4.7 RØsumØ de l’AFC. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55

Inertie et dØpendance.

5.1 Hypertable de contingence pour J = 3.

. . . . . . . . . . . . . . . . . . . . 61

5.2 ReprØsentation du nuage des individus NI dans l’espace IRK. . . . . . . . . 65

5.3 ReprØsentation du nuage des modalitØs NK dans l’espace IRI. . . . . . . . . 66

5.4 SchØma de dualitØ pour l’ACM.

. . . . . . . . . . . . . . . . . . . . . . . . 67

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71

5.5 RØsumØ de l’ACM.

6.1 ReprØsentation du nuage NI des individus partitionnØs dans l’espace IRK. . 77

Illustration de la formule de Huygens. . . . . . . . . . . . . . . . . . . . . . 78

6.2

vii

viii

7.1

7.2

7.3

7.4

7.5

7.6

TABLE DES FIGURES

. . . . . . . . . . . . . . . 91

Illustration de l’algorithme des centres mobiles.

Illustration de l’e(cid:27)et de cha(cid:238)ne.

. . . . . . . . . . . . . . . . . . . . . . . . 93

Illustration de la formule de Huygens. . . . . . . . . . . . . . . . . . . . . . 93

. . . . . . . . . . . . . 94

Illustration d’une inertie intraclasse faible et ØlevØe.

Illustration du passage d’une partition Ps (cid:224) une partition ps(cid:0)1. . . . . . . . 94

Illustration de l’algorithme de classi(cid:28)cation avec avec un nuage de I = 5

individus.

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 96

7.7 Exemple de dendrogramme.

. . . . . . . . . . . . . . . . . . . . . . . . . . 97

7.8 Dendrogramme sur les donnØes de composition du sol. . . . . . . . . . . . . 98

7.9 Courbe des indices sur les donnØes de composition du sol. . . . . . . . . . . 99

. . . . . . . 100

7.10 ReprØsentation d’un sous-nuage Iq dans un plan de projection.

7.11 CaractØrisation de la variance du dip(cid:244)le dans une direction. . . . . . . . . . 100

Chapitre 1

Introduction

Les statistiques peuvent Œtre vues en fonction de l’objectif (cid:28)xØ ; classiquement les mØ-

thodes statistiques sont employØes soit pour explorer les donnØes (nommØe statistique

exploratoire) soit pour prØdire un comportement (nommØe statistique prØdictive ou dØ-

cisionnelle [Goa03] ou encore infØrentielle [Sap90]). La statistique exploratoire s’appuie

sur des techniques descriptives et graphiques. Elle est gØnØralement dØcrite par la statis-

tique descriptive qui regroupe des mØthodes exploratoires simples, uni- ou bidimension-

nelle (moyenne, moments, quantiles, variance, corrØlation, ...) et la statistique exploratoire

multidimensionnelle. L’analyse de donnØes s’inscrit dans ce cadre de la statistique explo-

ratoire multidimensionnelle. Nous verrons que des mØthodes issues de l’analyse de donnØes

peuvent Øgalement servir la statistique prØdictive (cf. chapitre 6).

Les mØthodes d’analyse de donnØes ont commencØes (cid:224) Œtre dØveloppØes dans les an-

nØes 50 poussØes par le dØveloppement de l’informatique et du stockage des donnØes qui

depuis n’a cessØ de cro(cid:238)tre. L’analyse de donnØes a surtout ØtØ dØveloppØe en France par

J.P. BenzØcri [Ben80a], [Ben80b] qui a su par l’analyse des correspondances reprØsenter

les donnØes de maniŁre simple et interprØtable. Il dØcrit l’analyse de donnØes selon cinq

principes, un peu dØsuets aujourd’hui :

  • 1er principe : Statistique n’est pas probabilitØ.
  • 2Łme principe : Le modŁle doit suivre les donnØes et non l’inverse.
  • 3Łme principe : Il convient de traiter simultanØment des informations concernant le

plus grand nombre possible de dimensions.

  • 4Łme principe : Pour l’analyse des faits complexes et notamment des faits sociaux,

l’ordinateur est indispensable.

  • 5Łme principe : Utiliser un ordinateur implique d’abandonner toutes techniques

con(cid:231)ues avant l’avŁnement du calcul automatique.

Ces cinq principes montrent bien l’approche d’une part de la statistique (cid:224) la di(cid:27)Ørence

des probabilitØs - les modŁles doivent coller aux donnØes - et d’autre part de l’analyse de

donnØes - il faut traiter le plus grand nombre de donnØes simultanØment ce qui implique

l’utilisation de l’ordinateur et ainsi l’utilisation de nouvelles techniques adaptØes.

L’analyse de donnØes fait toujours l’objet de recherche pour s’adapter (cid:224) tout type de

donnØes et faire face (cid:224) des considØrations de traitements en temps rØel en dØpit de la

1

2

CHAPITRE 1. INTRODUCTION

quantitØ de donnØes toujours plus importante. Les mØthodes dØveloppØes (et l’analyse de

donnØes) sont maintenant souvent intØgrØes avec des mØthodes issues de l’informatique et

de l’intelligence arti(cid:28)cielle (apprentissage numØrique et symbolique) dans le data mining

traduit en fran(cid:231)ais par (cid:16)fouille de donnØes(cid:17) ou encore extraction de connaissance (cid:224) partir

de donnØes [HL03].

1.1 Domaines d’application

Aujourd’hui les mØthodes d’analyse de donnØes sont employØes dans un grand nombre

de domaines qu’il est impossible d’ØnumØrer. Actuellement ces mØthodes sont beaucoup

utilisØes en marketing par exemple pour la gestion de la clientŁle (pour proposer de nou-

velles o(cid:27)res ciblØes par exemple). Elles permettent Øgalement l’analyse d’enquŒtes par

exemple par l’interprØtation de sondages (oø de nombreuses donnØes qualitatives doivent

Œtre prises en compte). Nous pouvons Øgalement citer la recherche documentaire qui est

de plus en plus utile notamment avec internet (la di(cid:30)cultØ porte ici sur le type de don-

nØes textuelles ou autres). Le grand nombre de donnØes en mØtØorologie a ØtØ une des

premiŁre motivation pour le dØveloppement des mØthodes d’analyse de donnØes. En fait,

tout domaine scienti(cid:28)que qui doit gØrer de grande quantitØ de donnØes de type variØ ont

recours (cid:224) ces approches (Øcologie, linguistique, Øconomie, etc) ainsi que tout domaine in-

dustriel (assurance, banque, tØlØphonie, etc). Ces approches ont Øgalement ØtØ mis (cid:224) pro(cid:28)t

en traitement du signal et des images, oø elles sont souvent employØes comme prØtraite-

ments (qui peuvent Œtre vus comme des (cid:28)ltres). En ingØnierie mØcanique, elles peuvent

aussi permettre d’extraire des informations intØressantes sans avoir recours (cid:224) des modŁles

parfois alourdis pour tenir compte de toutes les donnØes.

1.2 Les donnØes

Nous considØrons tout d’abord que la population 1 peut Œtre dØcrite par des donnØes de

deux types de caractŁres : qualitatif ou quantitatif. Les caractŁres qualitatifs peuvent Œtre

purs (variables nominales) i.e. que les modalitØs ne possŁdent pas de structure d’ordre

ou ordonnØs (variables ordinales) i.e. que les modalitØs qualitatives sont ordonnØes. Il est

aisØ de comprendre que les donnØes (cid:224) caractŁre qualitatif doivent Œtre adaptØes pour les

mØthodes numØriques.

Les mØthodes d’analyse de donnØes supposent souvent une organisation des donnØes

particuliŁre, naturelle, mais parfois di(cid:30)cile (cid:224) rØaliser selon l’application et les donnØes. Le

choix d’un tableau permet une organisation dans le plan de toutes les donnØes et ainsi de

traiter simultanØment toute l’information. Ainsi la plupart des mØthodes nØcessitent une

organisation des donnØes prØsentØe par le tableau 1.1. Nous verrons au Chapitre 4 que

selon les donnØes ce tableau est quelque peu modi(cid:28)Ø, mais l’idØe de tableau reste prØsente

dans toutes les mØthodes d’analyse de donnØes.

1Les mots en italique sont dØ(cid:28)nis dans le glossaire page 103.

Publicité

1.3. LES OBJECTIFS

3

Variables

k

. . . . . .

. . . . . . K

. . . . . .

...

...

xik

...

...

. . . . . .

1

1

...

...

i

...

...

I

i

s

u

d

v

d

n

I

i

Tab. 1.1 (cid:21) ReprØsentation des donnØes.

Ainsi les observations ou individus ou encore unitØs statistiques sont reprØsentØs en

ligne et sont chacun dØcrits par des variables ou caractŁres. Nous conserverons les nota-

tions du tableau 1.1 dans la suite du document. xik est donc la valeur de la variable k pour

l’individu i avec k = 1; :::; K et i = 1; :::; I. Par abus de notations, pour des considØrations

de simpli(cid:28)cation de celles-ci, I reprØsente (cid:224) la fois le nombre d’individus et l’ensemble des

, de mŒme K reprØsente le nombre de variables et l’ensemble des

1; :::; i; :::; I

individus

g

f

.

1; :::; k; :::; K

variables

g

f

Cette reprØsentation des donnØes peut faciliter la lecture de petits tableau, i.e. lorsqu’il

y a peu de donnØes. Cependant, dŁs lors que la taille du tableau est grand, ou que nous

recherchons des relations entre plus de deux individus ou plus de deux variables, cette

reprØsentation et les techniques simples de la statistique descriptive ne su(cid:30)sent plus.

1.3 Les objectifs

Les objectifs que se sont (cid:28)xØs les chercheurs en analyse de donnØes sont donc de

rØpondre aux problŁmes posØs par des tableaux de grandes dimensions. Les objectifs sont

souvent prØsentØs en fonction du type de mØthodes, ainsi deux objectifs ressortent : la

visualisation des donnØes dans le meilleur espace rØduit et le regroupement dans tout

l’espace.

Les mØthodes de l’analyse de donnØes doivent donc permettre de reprØsenter synthØti-

quement de vastes ensembles numØriques pour faciliter l’opØrateur dans ses dØcisions. En

fait d’ensembles numØriques, les mØthodes d’analyse de donnØes se proposent Øgalement

de traiter des donnØes qualitatives, ce qui en fait des mØthodes capables de considØrer un

grand nombre de problŁmes. Les reprØsentations recherchØes sont bien souvent des reprØ-

sentations graphiques, comme il est di(cid:30)cile de visualiser des points dans des espaces de

dimensions supØrieures (cid:224) deux, nous chercherons (cid:224) reprØsenter ces points dans des plans.

Ces mØthodes ne se limitent pas (cid:224) une reprØsentation des donnØes, ou du moins pour la

rendre plus aisØe, elles cherchent les ressemblances entre les individus et les liaisons entre

les variables. Ces proximitØs entre individus et variables vont permettre (cid:224) l’opØrateur de

4

CHAPITRE 1. INTRODUCTION

dØterminer une typologie des individus et des variables, et ainsi il pourra interprØter ses

donnØes et fournir une synthŁse des rØsultats des analyses. Nous voyons donc que les deux

objectifs prØcØdemment citØs sont trŁs liØs voir indissociables, ce qui entra(cid:238)ne souvent

l’utilisation conjointe de plusieurs mØthodes d’analyse de donnØes.

1.4 Les mØthodes

L’analyse de donnØes regroupe deux familles de mØthodes suivant les deux objectifs

citØs prØcØdemment :

(cid:21) Une partie des mØthodes cherche (cid:224) reprØsenter de grands ensembles de donnØes

par peu de variables i.e. recherche les dimensions pertinentes de ces donnØes. Les

variables ainsi dØterminØes permettent une reprØsentation synthØtique recherchØe.

Parmi ces mØthodes de nombreuses analyses sont issues de l’analyse factorielle, telles

que l’analyse en composantes principales, l’analyse factorielle des correspondances,

l’analyse factorielle des correspondances multiples, ou encore l’analyse canonique.

L’analyse en composantes principales est l’une des mØthodes les plus employØes. Elle

est particuliŁrement adaptØe aux variables quantitatives, continues, a priori corrØ-

lØes entre elles. Une fois les donnØes projetØes dans di(cid:27)Ørents plans, les proximitØs

entre variables s’interprŁtent en termes de corrØlations, tandis que les proximitØs

entre individus s’interprŁtent en termes de similitudes globales des valeurs observØes.

L’analyse factorielle des correspondances (ou analyse des correspondances binaires)

a ØtØ con(cid:231)ue pour l’Øtude des tableaux de contingence obtenus par croisement de

variables qualitatives. Cette analyse permet donc de traiter des variables qualita-

tives et est surtout adaptØe (cid:224) ce type de variables. Dans cette approche, les lignes

et les colonnes ont un r(cid:244)le symØtrique et s’interprŁtent de la mŒme fa(cid:231)on. L’analyse

factorielle des correspondances multiples est une extension de l’analyse factorielle

des correspondances qui ne permet que le croisement de deux variables qualitatives.

Elle est donc adaptØe (cid:224) la description de grands tableaux de variables qualitatives

par exemple pour le traitement d’enquŒtes. L’analyse canonique est trŁs peu utilisØe

en pratique, son intØrŒt porte sur son aspect thØorique. Elle cherche (cid:224) analyser les

relations entre deux groupes de variables de nature di(cid:27)Ørente. De ce fait l’analyse

factorielle des correspondances peut Œtre vu comme analyse canonique particuliŁre

[CDG+89], [LMP95].

(cid:21) Une autre partie des mØthodes cherche (cid:224) classer les donnØes de maniŁre automa-

tique. Ces mØthodes sont complØmentaires avec les prØcØdentes pour synthØtiser et

analyser les donnØes et rØpondre plus particuliŁrement (cid:224) l’objectif (cid:28)xØ de caractØriser

les proximitØs entre individus et celles entre variables. Ces mØthodes de classi(cid:28)ca-

tion sont soit (cid:224) apprentissage supervisØ (i.e. qui nØcessitent une base de donnØes

d’apprentissage - ces mØthodes sont appelØes en statistique les analyses discrimi-

nantes) soit (cid:224) apprentissage non-supervisØe (i.e. qui ne nØcessitent aucune donnØe

prØalable).

(cid:21) Parmi les mØthodes issues de l’analyse discriminante et directement rattachØes (cid:224)

1.4. LES M(cid:201)THODES

5

l’analyse de donnØes il y a l’analyse linØaire discriminante, la rØgression logistique,

les k plus proches voisins ou encore les arbres de dØcision. D’autres mØthodes issues

de l’intelligence arti(cid:28)cielle et du monde de la reconnaissance des formes peuvent

Œtre rattachØes (cid:224) l’analyse discriminante telles que le perceptron multicouche (et

les autres rØseaux de neurones) et les cha(cid:238)nes de Markov [Kun00] ou encore issues

de la thØorie de l’apprentissage statistique telle que les machines (cid:224) vecteurs de

supports [Vap99]. Si ces derniŁres ne sont pas toujours considØrØes comme fai-

sant partie de l’analyse de donnØes, elles sont parfaitement intØgrØes dans le data

mining.

L’analyse linØaire discriminante est aussi appelØe analyse factorielle discriminante

car elle est en fait une analyse en composantes principales supervisØe. Elle dØcrit

les individus en classes (celles-ci sont donnØes par une variable issue de l’appren-

tissage) et ensuite a(cid:27)ecte de nouveaux individus dans ces classes. C’est donc une

mØthode (cid:224) la fois descriptive et prØdictive. Elle permet de traiter aussi bien des

variables quantitatives que qualitatives.

La rØgression logistique consiste (cid:224) exprimer

les probabilitØs a posteriori

d’appartenance (cid:224) une classe p(C=x) comme une fonction de l’observation

[Sap90] [Cel03]. Bien souvent c’est la rØgression linØaire qui est employØe, i.e.

qu’il faut dØterminer les coe(cid:30)cients (cid:12) tels que :

ln

p(C=x)

1

(cid:18)

(cid:0)

p(C=x)

(cid:19)

d

= (cid:12)0 +

(cid:12)ixi:

i=1

X

(1.1)

L’approche des k plus proches voisins repose sur l’idØe simple d’attribuer un nouvel

individu (cid:224) la classe majoritaire parmi ses k plus proches voisins (individus de la

base d’apprentissage les plus proches au sens d’une certaine distance).

Les arbres de dØcision nØcessitent souvent une construction dØlicate et di(cid:30)ci-

lement gØnØralisable si les donnØes d’apprentissage sont peu reprØsentatives de

la rØalitØ. La mØthode CART (Classi(cid:28)cation And Regression Tree) possŁde une

construction d’arbre aux propriØtØs intØressantes pour la segmentation [BFRS93].

(cid:21) Les mØthodes de classi(cid:28)cation automatique ne nØcessitant pas d’apprentissage

o(cid:27)rent un intØrŒt important lorsque les donnØes sont complŁtement inconnues.

Elles permettent ainsi de dØgager des classes qui ne sont pas Øvidentes a priori.

Publicité

Les deux principales mØthodes dØveloppØes sont la mØthode des centres mobiles

(apparentØe (cid:224) la mØthode des k-means ou des nuØes dynamiques (comme un

cas particulier)) et la classi(cid:28)cation hiØrarchique ascendante ou descendante. Nous

pouvons Øgalement citer les approches fondØes sur les graphes et hypergraphes

[Ber72].

La mØthode des centres mobiles consiste (cid:224) associer les individus (cid:224) des centres

de classes choisis alØatoirement, puis (cid:224) recalculer ces centres jusqu’(cid:224) obtenir une

convergence. La di(cid:30)cultØ consiste dans un choix astucieux des centres au dØpart

pour une convergence plus rapide et dans le choix d’une distance appropriØe.

La classi(cid:28)cation hiØrarchique ascendante (resp. descendante) consiste (cid:224) regrouper

6

CHAPITRE 1. INTRODUCTION

les individus selon leur ressemblance (resp. dissemblance). Toute la di(cid:30)cultØ est

dans la dØ(cid:28)nition d’une mesure de ressemblance et de la distance associØe.

1.5 Les logiciels

Les mØthodes d’analyse de donnØes nØes de la recherche universitaire sont depuis

longtemps entrØes dans le monde industriel. Il y a cependant peu de logiciels qui savent

intØgrer ces mØthodes pour une recherche exploratoire aisØe dans les donnØes. Nous citons

ici cinq logiciels :

  • SAS :

Ce logiciel est un logiciel de statistique trŁs complet et trŁs performant. Il a d’abord

ØtØ dØveloppØ pour l’environnement Unix, mais est maintenant accessible sous tout

environnement. Il permet une puissance de calcul importante et ainsi est trŁs bien

adaptØ (cid:224) tous traitements statistiques sur des donnØes trŁs volumineuses. Son manque

de convivialitØ et surtout son prix fait qu’il est encore peu employØ dans les entre-

prises qui ne se dØdient pas complŁtement (cid:224) la statistique. De nombreux cours uni-

versitaires de statistique sont proposØs avec ce logiciel qui s’approche d’un langage

(ex. UniversitØ de Rennes 1).

  • Splus :

Splus est (cid:224) la fois un langage statistique et graphique interactif interprØtØ et orientØ

objet. C’est donc (cid:224) la fois un logiciel statistique et un langage de programmation.

La particularitØ de ce langage est qu’il permet de mØlanger des commandes peu

ØvoluØes (cid:224) des commandes trŁs ØvoluØes. Il a ØtØ dØveloppØ par Statistical Sciences

autour du langage S, con(cid:231)u par les Bell Laboratories. Depuis, Splus est devenu

propriØtØ de Mathsoft aprŁs le rachat de Statistical Sciences. Il est parfois employØ

pour l’enseignement (ex. UniversitØ Paul Sabatier de Toulouse III).

  • R :

Ce logiciel est la version gratuite de Splus. Il est tØlØchargeable sous www.r-project.org

pour tous systŁmes d’exploitation. Il sou(cid:27)re Øgalement de peu de convivialitØ et

semble encore trŁs peu employØ en industrie. De part sa gratuitØ, il est de plus

en plus employØ pour la rØalisation de cours de statistiques (ex. UniversitØ Paul

Sabatier de Toulouse III, UniversitØ de Lyon 1).

  • XlStat :

Excel propose une macro payante permettant d’e(cid:27)ectuer quelques mØthodes

d’analyse de donnØes. Elle est cependant trŁs limitØe, utilisable qu’avec Excel sous

Windows et de plus payante. Certaines Øcoles d’ingØnieurs s’en contentent (ex. ENI-

TAB, Bordeaux).

  • UniWin Plus :

Statgraphics est un logiciel de statistiques gØnØrales, qui propose un module d’ana-

lyse de donnØes de treize mØthodes. DØveloppØ uniquement pour les environnements

Windows, l’accent est portØ sur les interfaces graphiques. Statgraphics propose un

grand nombre d’analyses statistiques et permet l’utilisation de beaucoup de for-

1.6. PLAN

7

mat de donnØes. Il est commercialisØ par Sigma Plus. Statgraphics est enseignØ par

exemple (cid:224) l’IUT de Vannes.

  • Stalab :

Ce logiciel dØveloppØ par M. Jambu [Jam99b], [Jam99a] Øtait initialement prØvu

pour Windows. Sa convivialitØ a permis un essor industriel qui semble s’Œtre rØduit.

Il a ØtØ utilisØ pour l’enseignement en Øcoles d’ingØnieurs (ex. ENSSAT, Lannion).

  • SPAD :

Le logiciel SPAD supportØ entre autre par A. Morineau est toujours maintenu (cid:224)

jour avec de nouvelles mØthodes issues de la recherche universitaire. Sa version sous

Windows est conviviale ce qui a poussØ son achat par de plus en plus d’industriels.

Le soucis de coller (cid:224) une rØalitØ industrielle fait qu’il est employØ en enseignement

(ex. IUT de Vannes, ENSIETA).

1.6 Plan

Ce document ne cherche pas (cid:224) prØsenter l’ensemble des mØthodes de l’analyse de don-

nØes dont certaines ont ØtØ ØvoquØes dans la section 1.4. Nous prØsentons ici les idØes des

principales mØthodes, ces clØs et les rØfØrences2 donnØes permettront au lecteur d’appro-

fondir les mØthodes prØsentØes et de comprendre les autres.

Nous commencerons ainsi par l’Øtude de quelques analyses factorielles. Le premier

chapitre prØsente le principe gØnØral des analyses factorielles. Les chapitres 3, 4 et 5

prØsentent respectivement l’analyse en composantes principales, l’analyse factorielle des

correspondances et l’analyse des correspondances multiples. Nous proposons ensuite au

chapitre 6 l’Øtude d’une analyse discriminante : l’analyse factorielle discriminante qui

peut Øgalement Œtre vue comme une analyse factorielle. Dans le cadre des mØthodes de

classi(cid:28)cation non-supervisØe nous prØsentons la classi(cid:28)cation hiØrarchique au chapitre 7.

2Les rØfØrences proposØes ne sont pas exhaustives, il existe un grand nombre d’ouvrages de qualitØ

dans le domaine de l’analyse de donnØes.

8

CHAPITRE 1. INTRODUCTION

Chapitre 2

Analyses Factorielles

2.1

Introduction

Les analyses factorielles constituent la plupart des analyses de donnØes. Elles sont

fondØes sur un principe unique, c’est pour cela que nous pouvons parler de l’analyse

factorielle [EP90]. Ce principe repose sur le fait que les deux nuages de points reprØsentant

respectivement les lignes et les colonnes du tableau ØtudiØ (tableau 1.1) sont construits et

reprØsentØs sur des graphiques. Ces reprØsentations des lignes et des colonnes fortement

liØes entre elles permettent une analyse plus aisØe pour l’opØrateur.

2.1.1 Les objectifs

Les analyses factorielles tentent de rØpondre (cid:224) la question : tenant compte des res-

semblances des individus et des liaisons entre variables, est-il possible de rØsumer toutes

les donnØes par un nombre restreint de valeurs sans perte d’information importante ? En

e(cid:27)et en cherchant (cid:224) rØduire le nombre de variables dØcrivant les donnØes, la quantitØ

d’information ne peut Œtre que rØduite, au mieux maintenue. La motivation de cette rØ-

duction du nombre de valeurs vient du fait que des valeurs peu nombreuses sont plus

faciles (cid:224) reprØsenter gØomØtriquement et graphiquement (un des objectifs de l’analyse de

donnØes).

2.1.2 Domaines d’application

L’ensembles des mØthodes d’analyses factorielles permettent de rØpondre (cid:224) la plupart

des problŁmes posØs par les applications auxquelles se consacre l’analyse de donnØes.

Le choix d’une analyse par rapport (cid:224) une autre se fera en fonction du type de donnØes

(quantitatif, qualitatif, mais aussi textuelle) et de la quantitØ de donnØes. Il est bien sßr

possible lorsque le cas se prØsente d’appliquer une analyse sur les donnØes quantitatives

de la population puis une autre analyse sur les donnØes qualitatives. Ainsi dans le cadre

d’un enquŒte par exemple, une analyse en composantes principales peut faire ressortir les

9

10

CHAPITRE 2. ANALYSES FACTORIELLES

liaisons entre les variables quantitatives, puis une analyse des correspondances multiples

peut donner une reprØsentation des variables qualitatives en fonction de leur modalitØs.

2.1.3 Les donnØes

Dans ce chapitre, nous retenons la reprØsentation des donnØes sous forme de tableau

(tableau 1.1, page 3), et les notations associØes.

2.2 Principe gØnØral

Le principe gØnØral de l’analyse factorielle est fondØ sur une double hypothŁse. Sup-

posons qu’il existe un vecteur colonne u1 (cid:224) K composantes et un vecteur colonne v1 (cid:224)

xk

1 est le vecteur

I composantes tel que le tableau X =

i

transposØ de u1. Ainsi des I + K valeurs des vecteurs u1 et v1, les I:K valeurs de X sont

(cid:9)

retrouvØes. Cette rØduction devient vite intØressante dŁs lors que I et K sont assez grands.

De plus elle n’entra(cid:238)ne aucune perte d’information. Cette hypothŁse est malheureusement

improbable en pratique.

s’Øcrive X = v1ut

1, oø ut

(cid:8)

Exemple 2.2.1 ConsidØrons l’ensemble des notes des ØlŁves de l’ENSIETA durant une

annØe. Le nombre d’ØlŁves est environ de 450, et nous pouvons considØrer qu’ils obtiennent

environ 30 notes chacun. Ainsi le tableau reprØsentant l’ensemble des notes est constituØ de

13 500 valeurs. La rØduction prØsentØe ci-dessus permet de rØduire ce nombre (cid:224) 480 valeurs

sans perte d’information si l’hypothŁse est valide. Pour que l’hypothŁse soit vØri(cid:28)Øe, il

faudrait pouvoir dØduire les notes de l’ensemble des ØlŁves (cid:224) partir de celles d’un seul

ØlŁve et d’un vecteur de pondØration. Ceci signi(cid:28)e que les notes sont dØpendantes les unes

des autres ou encore trŁs fortement corrØlØes.

En pratique, il faut donc chercher une approximation de rang S pour X. C’est-(cid:224)-dire ces

analyses cherchent (cid:224) Øcrire le tableau X tel que :

X = v1ut

1 + v2ut

2 + : : : + vSut

S + E;

(2.1)

oø E est une matrice de I lignes et K colonnes de termes nØgligeables dite matrice

rØsiduelle. Ainsi les I:K valeurs initiales de X sont reconstituØes de fa(cid:231)on satisfaisante par

les S:(I +K) valeurs des S vecteurs vq et uq. Les donnØes sont donc soit considØrØes en tant

qu’individus dØcrits par leurs K variables (cid:224) l’aide des vecteurs uq (cid:224) K composantes, soit

en tant que variables dØcrites par les I individus (cid:224) l’aide des vecteurs vq (cid:224) I composantes.

La rØsolution de ce problŁme passe donc par la considØration des deux nuages de

Publicité

points ou encore des deux reprØsentations gØomØtriques associØes ((cid:28...