Résumé du Cours de Statistique Descriptive

Springer
Page 1 sur 172Lecteur de document UniversityLib

Résumé du Cours de Statistique Descriptive

Statistics, Programming · course

Voir tous les documents en mathématiques

R(cid:19)esum(cid:19)e du Cours de Statistique

Descriptive

Yves Till(cid:19)e

15 d(cid:19)ecembre 2010

2

Objectif et moyens

Objectifs du cours

– Apprendre les principales techniques de statistique descriptive univariée

et bivariée.

– Être capable de mettre en oeuvre ces techniques de manière appropriée

dans un contexte donné.

– Être capable d’utiliser les commandes de base du Language R. Pouvoir

appliquer les techniques de statistiques descriptives au moyen du language

R.

– Références

Dodge Y.(2003), Premiers pas en statistique, Springer.

Droesbeke J.-J. (1997), Éléments de statistique, Editions de l’Université

libre de Bruxelles/Ellipses.

Moyens

– 2 heures de cours par semaine.

– 2 heures de TP par semaine, répartis en TP théoriques et applications en

Language R.

Le language R

– Shareware : gratuit et installé en 10 minutes.

– Open source (on sait ce qui est réellement calculé).

– Développé par la communauté des chercheurs, contient énormément de

fonctionnalités.

– Possibilité de programmer.

– Désavantage : pas très convivial.

– Manuel :

http://cran.r-project.org/doc/contrib/Paradis-rdebuts_fr.pdf

3

4

Table des matières

1 Variables, données statistiques, tableaux, effectifs

1.1 Définitions fondamentales . . . . . . . . . . . . . . . . . . . . . .

1.1.1 La science statistique

. . . . . . . . . . . . . . . . . . . .

1.1.2 Mesure et variable . . . . . . . . . . . . . . . . . . . . . .

1.1.3 Typologie des variables

. . . . . . . . . . . . . . . . . . .

Série statistique . . . . . . . . . . . . . . . . . . . . . . . .

1.1.4

1.2 Variable qualitative nominale . . . . . . . . . . . . . . . . . . . .

1.2.1 Effectifs, fréquences et tableau statistique . . . . . . . . .

1.2.2 Diagramme en secteurs et diagramme en barres . . . . . .

1.3 Variable qualitative ordinale . . . . . . . . . . . . . . . . . . . . .

1.3.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .

1.3.2 Diagramme en secteurs

. . . . . . . . . . . . . . . . . . .

1.3.3 Diagramme en barres des effectifs . . . . . . . . . . . . . .

1.3.4 Diagramme en barres des effectifs cumulés . . . . . . . . .

1.4 Variable quantitative discrète . . . . . . . . . . . . . . . . . . . .

1.4.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .

1.4.2 Diagramme en bâtonnets des effectifs

. . . . . . . . . . .

1.4.3 Fonction de répartition . . . . . . . . . . . . . . . . . . .

1.5 Variable quantitative continue . . . . . . . . . . . . . . . . . . . .

1.5.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .

1.5.2 Histogramme . . . . . . . . . . . . . . . . . . . . . . . . .

1.5.3 La fonction de répartition . . . . . . . . . . . . . . . . . .

2 Statistique descriptive univariée

2.1 Paramètres de position . . . . . . . . . . . . . . . . . . . . . . . .

2.1.1 Le mode . . . . . . . . . . . . . . . . . . . . . . . . . . . .

2.1.2 La moyenne . . . . . . . . . . . . . . . . . . . . . . . . . .

2.1.3 Remarques sur le signe de sommation

. . . . . . . . .

2.1.4 Moyenne géométrique . . . . . . . . . . . . . . . . . . . .

2.1.5 Moyenne harmonique

. . . . . . . . . . . . . . . . . . . .

2.1.6 Moyenne pondérée . . . . . . . . . . . . . . . . . . . . . .

2.1.7 La médiane . . . . . . . . . . . . . . . . . . . . . . . . . .

2.1.8 Quantiles . . . . . . . . . . . . . . . . . . . . . . . . . . .

2.2 Paramètres de dispersion . . . . . . . . . . . . . . . . . . . . . .

∑

9

9

9

9

9

10

11

11

12

13

13

15

15

16

17

17

18

19

19

19

21

23

27

27

27

27

29

31

31

32

33

35

37

5

6

TABLE DES MATI (cid:18)ERES

2.2.1 L’étendue . . . . . . . . . . . . . . . . . . . . . . . . . . .

2.2.2 La distance interquartile . . . . . . . . . . . . . . . . . . .

2.2.3 La variance . . . . . . . . . . . . . . . . . . . . . . . . . .

2.2.4 L’écart-type . . . . . . . . . . . . . . . . . . . . . . . . . .

2.2.5 L’écart moyen absolu . . . . . . . . . . . . . . . . . . . . .

2.2.6 L’écart médian absolu . . . . . . . . . . . . . . . . . . . .

2.3 Moments

. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

2.4 Paramètres de forme . . . . . . . . . . . . . . . . . . . . . . . . .

2.4.1 Coefficient d’asymétrie de Fisher (skewness) . . . . . . . .

2.4.2 Coefficient d’asymétrie de Yule . . . . . . . . . . . . . . .

2.4.3 Coefficient d’asymétrie de Pearson . . . . . . . . . . . . .

2.5 Paramètre d’aplatissement (kurtosis) . . . . . . . . . . . . . . . .

. . . . . . . . . . . . . . . . . .

2.6 Changement d’origine et d’unité

2.7 Moyennes et variances dans des groupes . . . . . . . . . . . . . .

2.8 Diagramme en tiges et feuilles . . . . . . . . . . . . . . . . . . . .

2.9 La boˆıte à moustaches . . . . . . . . . . . . . . . . . . . . . . . .

3 Statistique descriptive bivariée

3.1 Série statistique bivariée . . . . . . . . . . . . . . . . . . . . . . .

3.2 Deux variables quantitatives . . . . . . . . . . . . . . . . . . . . .

3.2.1 Représentation graphique de deux variables . . . . . . . .

3.2.2 Analyse des variables . . . . . . . . . . . . . . . . . . . . .

3.2.3 Covariance

. . . . . . . . . . . . . . . . . . . . . . . . . .

3.2.4 Corrélation . . . . . . . . . . . . . . . . . . . . . . . . . .

3.2.5 Droite de régression . . . . . . . . . . . . . . . . . . . . .

. . . . . . . . . . . . . . . . .

3.2.6 Résidus et valeurs ajustées

3.2.7

. . . . . . . . . . . . . . .

3.2.8 Décomposition de la variance . . . . . . . . . . . . . . . .

. . . . . . . . . . . . . . . . . . . . .

3.3.1 Données observées . . . . . . . . . . . . . . . . . . . . . .

3.3.2 Tableau de contingence

. . . . . . . . . . . . . . . . . . .

3.3.3 Tableau des fréquences . . . . . . . . . . . . . . . . . . . .

3.3.4 Profils lignes et profils colonnes . . . . . . . . . . . . . . .

3.3.5 Effectifs théoriques et khi-carré . . . . . . . . . . . . . . .

3.3 Deux variables qualitatives

Sommes de carrés et variances

4 Théorie des indices, mesures d’inégalité

4.1 Nombres indices

. . . . . . . . . . . . . . . . . . . . . . . . . . .

4.2 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

4.2.1 Propriétés des indices

. . . . . . . . . . . . . . . . . . . .

4.2.2

Indices synthétiques . . . . . . . . . . . . . . . . . . . . .

4.2.3

Indice de Laspeyres

. . . . . . . . . . . . . . . . . . . . .

4.2.4

Indice de Paasche . . . . . . . . . . . . . . . . . . . . . . .

. . . . . . . . . . . . . . . . . . . . . .

4.2.5 L’indice de Fisher

4.2.6 L’indice de Sidgwick . . . . . . . . . . . . . . . . . . . . .

Indices chaˆınes . . . . . . . . . . . . . . . . . . . . . . . .

4.2.7

. . . . . . . . . . . . . . . . . . . . . . . .

4.3 Mesures de l’inégalité

37

37

37

38

40

40

40

41

41

41

41

42

42

44

45

46

53

53

53

53

55

55

56

57

60

61

62

64

64

64

65

66

67

77

77

77

78

78

78

80

80

81

81

82

TABLE DES MATI (cid:18)ERES

Introduction . . . . . . . . . . . . . . . . . . . . . . . . .

4.3.1

. . . . . . . . . . . . . . . . . . . . . .

4.3.2 Courbe de Lorenz

Indice de Gini . . . . . . . . . . . . . . . . . . . . . . . . .

4.3.3

4.3.4

Indice de Hoover . . . . . . . . . . . . . . . . . . . . . . .

4.3.5 Quintile et Decile share ratio . . . . . . . . . . . . . . . .

Indice de pauvreté . . . . . . . . . . . . . . . . . . . . . .

4.3.6

Indices selon les pays . . . . . . . . . . . . . . . . . . . . .

4.3.7

7

82

82

84

84

84

85

85

5 Calcul des probabilités et variables aléatoires

Événement

5.2 Analyse combinatoire

87

87

5.1 Probabilités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

87

. . . . . . . . . . . . . . . . . . . . . . . . . .

5.1.1

87

. . . . . . . . . . . . . . .

5.1.2 Opérations sur les événements

88

5.1.3 Relations entre les événements

. . . . . . . . . . . . . . .

89

5.1.4 Ensemble des parties d’un ensemble et système complet .

89

5.1.5 Axiomatique des Probabilités . . . . . . . . . . . . . . . .

92

5.1.6 Probabilités conditionnelles et indépendance

. . . . . . .

93

5.1.7 Théoreme des probabilités totales et théoreme de Bayes .

94

. . . . . . . . . . . . . . . . . . . . . . . .

94

Introduction . . . . . . . . . . . . . . . . . . . . . . . . .

5.2.1

94

5.2.2 Permutations (sans répétition)

. . . . . . . . . . . . . . .

95

5.2.3 Permutations avec répétition . . . . . . . . . . . . . . . .

95

5.2.4 Arrangements (sans répétition) . . . . . . . . . . . . . . .

95

5.2.5 Combinaisons . . . . . . . . . . . . . . . . . . . . . . . . .

96

5.3 Variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . .

96

5.3.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . .

97

5.4 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . .

97

5.4.1 Définition, espérance et variance . . . . . . . . . . . . . .

97

5.4.2 Variable indicatrice ou bernoullienne . . . . . . . . . . . .

5.4.3 Variable binomiale . . . . . . . . . . . . . . . . . . . . . .

98

5.4.4 Variable de Poisson . . . . . . . . . . . . . . . . . . . . . 102

5.5 Variable aléatoire continue . . . . . . . . . . . . . . . . . . . . . . 103

5.5.1 Définition, espérance et variance . . . . . . . . . . . . . . 103

5.5.2 Variable uniforme

Publicité

. . . . . . . . . . . . . . . . . . . . . . 105

5.5.3 Variable normale . . . . . . . . . . . . . . . . . . . . . . . 108

5.5.4 Variable normale centrée réduite . . . . . . . . . . . . . . 108

5.5.5 Distribution exponentielle . . . . . . . . . . . . . . . . . . 110

5.6 Distribution bivariée . . . . . . . . . . . . . . . . . . . . . . . . . 110

5.6.1 Cas continu . . . . . . . . . . . . . . . . . . . . . . . . . . 111

. . . . . . . . . . . . . . . . . . . . . . . . . . 112

5.6.2 Cas discret

5.6.3 Remarques

. . . . . . . . . . . . . . . . . . . . . . . . . . 113

Indépendance de deux variables aléatoires . . . . . . . . . 113

5.6.4

5.7 Propriétés des espérances et des variances . . . . . . . . . . . . . 114

5.8 Autres variables aléatoires . . . . . . . . . . . . . . . . . . . . . . 116

5.8.1 Variable khi-carrée . . . . . . . . . . . . . . . . . . . . . . 116

. . . . . . . . . . . . . . . . . . . . . 117

5.8.2 Variable de Student

. . . . . . . . . . . . . . . . . . . . . . 117

5.8.3 Variable de Fisher

8

TABLE DES MATI (cid:18)ERES

5.8.4 Loi normale bivariée . . . . . . . . . . . . . . . . . . . . . 118

6 Séries temporelles, filtres, moyennes mobiles et désaisonnalisation127

6.1 Définitions générales et exemples . . . . . . . . . . . . . . . . . . 127

. . . . . . . . . . . . . . . . . . . . . . . . . . 127

6.1.1 Définitions

6.1.2 Traitement des séries temporelles . . . . . . . . . . . . . . 128

6.1.3 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . 128

6.2 Description de la tendance . . . . . . . . . . . . . . . . . . . . . . 133

6.2.1 Les principaux modèles

. . . . . . . . . . . . . . . . . . . 133

6.2.2 Tendance linéaire . . . . . . . . . . . . . . . . . . . . . . . 134

6.2.3 Tendance quadratique . . . . . . . . . . . . . . . . . . . . 134

6.2.4 Tendance polynomiale d’ordre q

. . . . . . . . . . . . . . 134

. . . . . . . . . . . . . . . . . . . . . 134

6.2.5 Tendance logistique

6.3 Opérateurs de décalage et de différence . . . . . . . . . . . . . . . 136

6.3.1 Opérateurs de décalage

. . . . . . . . . . . . . . . . . . . 136

6.3.2 Opérateur différence . . . . . . . . . . . . . . . . . . . . . 136

. . . . . . . . . . . . . . . . . . . . 138

6.3.3 Différence saisonnière

6.4 Filtres linéaires et moyennes mobiles . . . . . . . . . . . . . . . . 140

6.4.1 Filtres linéaires . . . . . . . . . . . . . . . . . . . . . . . . 140

6.4.2 Moyennes mobiles : définition . . . . . . . . . . . . . . . . 140

. . . . . . . . 141

6.4.3 Moyenne mobile et composante saisonnière

6.5 Moyennes mobiles particulières . . . . . . . . . . . . . . . . . . . 143

6.5.1 Moyenne mobile de Van Hann . . . . . . . . . . . . . . . . 143

6.5.2 Moyenne mobile de Spencer . . . . . . . . . . . . . . . . . 143

6.5.3 Moyenne mobile de Henderson . . . . . . . . . . . . . . . 144

6.5.4 Médianes mobiles . . . . . . . . . . . . . . . . . . . . . . . 145

6.6 Désaisonnalisation . . . . . . . . . . . . . . . . . . . . . . . . . . 145

6.6.1 Méthode additive . . . . . . . . . . . . . . . . . . . . . . . 145

. . . . . . . . . . . . . . . . . . . 145

6.6.2 Méthode multiplicative

6.7 Lissage exponentiel . . . . . . . . . . . . . . . . . . . . . . . . . . 147

6.7.1 Lissage exponentiel simple . . . . . . . . . . . . . . . . . . 147

6.7.2 Lissage exponentiel double . . . . . . . . . . . . . . . . . . 150

7 Tables statistiques

157

Chapitre 1

Variables, données

statistiques, tableaux,

effectifs

1.1 Définitions fondamentales

1.1.1 La science statistique

– Méthode scientifique du traitement des données quantitatives.

– Etymologiquement : science de l’état.

– La statistique s’applique à la plupart des disciplines : agronomie, biologie,

démographie, économie, sociologie, linguistique, psychologie, . . .

1.1.2 Mesure et variable

– On s’intéresse à des unités statistiques ou unités d’observation : par exemple

des individus, des entreprises, des ménages. En sciences humaines, on

s’intéresse dans la plupart des cas à un nombre fini d’unités.

– Sur ces unités, on mesure un caractère ou une variable, le chiffre d’affaires

de l’entreprise, le revenu du ménage, l’âge de la personne, la catégorie so-

cioprofessionnelle d’une personne. On suppose que la variable prend tou-

jours une seule valeur sur chaque unité. Les variables sont désignées par

simplicité par une lettre (X, Y, Z).

– Les valeurs possibles de la variable, sont appelées modalités.

– L’ensemble des valeurs possibles ou des modalités est appelé le domaine

de la variable.

1.1.3 Typologie des variables

– Variable qualitative : La variable est dite qualitative quand les modalités

9

10CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

sont des catégories.

– Variable qualitative nominale : La variable est dite qualitative nominale

quand les modalités ne peuvent pas être ordonnées.

– Variable qualitative ordinale : La variable est dite qualitative ordinale

quand les modalités peuvent être ordonnées. Le fait de pouvoir ou non

ordonner les modalités est parfois discutable. Par exemple : dans les

catégories socioprofessionnelles, on admet d’ordonner les modalités :

‘ouvriers’, ‘employés’, ‘cadres’. Si on ajoute les modalités ‘sans profes-

sion’, ‘enseignant’, ‘artisan’, l’ordre devient beaucoup plus discutable.

– Variable quantitative : Une variable est dite quantitative si toute ses va-

leurs possibles sont numériques.

– Variable quantitative discrete : Une variable est dite discrete, si l’en-

semble des valeurs possibles est dénombrable.

– Variable quantitative continue : Une variable est dite continue, si l’en-

semble des valeurs possibles est continu.

Remarque 1.1 Ces définitions sont à relativiser, l’âge est théoriquement

une variable quantitative continue, mais en pratique, l’âge est mesuré dans le

meilleur des cas au jour près. Toute mesure est limitée en précision !

Exemple 1.1 Les modalités de la variable sexe sont masculin (codé M) et

féminin (codé F). Le domaine de la variable est {M, F }.

Exemple 1.2 Les modalités de la variable nombre d’enfants par famille sont

0,1,2,3,4,5,. . .C’est une variable quantitative discrète.

1.1.4 Série statistique

On appelle série statistique la suite des valeurs prises par une variable X sur

les unités d’observation.

Le nombre d’unités d’observation est noté n.

Les valeurs de la variable X sont notées

x1, . . . , xi, . . . , xn.

Exemple 1.3 On s’intéresse a la variable ‘état-civil’ notée X et a la série sta-

tistique des valeurs prises par X sur 20 personnes. La codification est

célibataire,

C :

M : marié(e),

veuf(ve),

V :

divorcée.

D :

1.2. VARIABLE QUALITATIVE NOMINALE

11

Le domaine de la variable X est {C, M, V, D}. Considérons la série statistique

suivante :

M M D C C M C C C M

C M V M V D C C C M

Ici, n = 20,

x1 = M, x2 = M, x3 = D, x4 = C, x5 = C, . . . ., x20 = M.

1.2 Variable qualitative nominale

1.2.1 Effectifs, fréquences et tableau statistique

Une variable qualitative nominale a des valeurs distinctes qui ne peuvent

pas être ordonnées. On note J le nombre de valeurs distinctes ou modalités.

Les valeurs distinctes sont notées x1, . . . , xj, . . . , xJ . On appelle effectif d’une

modalité ou d’une valeur distincte, le nombre de fois que cette modalité (ou

valeur distincte) apparaˆıt. On note nj l’effectif de la modalité xj. La fréquence

d’une modalité est l’effectif divisé par le nombre d’unités d’observation.

fj =

nj

n

, j = 1, . . . , J.

Exemple 1.4 Avec la série de l’exemple précédent, on obtient le tableau sta-

tistique :

xj

C

M

V

D

nj

9

7

2

2

n = 20

fj

0.45

0.35

0.10

0.10

1

12CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

En langage R

>X=c(’Mari(cid:19)e(e)’,’Mari(cid:19)e(e)’,’Divorc(cid:19)e(e)’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’C(cid:19)elibataire’,

’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’Veuf(ve)’,’Mari(cid:19)e(e)’,

’Veuf(ve)’,’Divorc(cid:19)e(e)’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’)

> T1=table(X)

> V1=c(T1)

> data.frame(Eff=V1,Freq=V1/sum(V1))

C(cid:19)elibataire

Divorc(cid:19)e(e)

Mari(cid:19)e(e)

Veuf(ve)

Eff Freq

9 0.45

2 0.10

7 0.35

2 0.10

1.2.2 Diagramme en secteurs et diagramme en barres

Le tableau statistique d’une variable qualitative nominale peut être représenté

par deux types de graphique. Les effectifs sont représentés par un diagramme

en barres et les fréquences par un diagramme en secteurs (ou camembert ou

piechart en anglais) (voir Figures 1.1 et 1.2).

Figure 1.1 – Diagramme en secteurs des fréquences

En langage R

> pie(T1,radius=1.0)

CélibataireDivorcé(e)Marié(e)Veuf(ve)1.3. VARIABLE QUALITATIVE ORDINALE

13

Figure 1.2 – Diagramme en barres des effectifs

En langage R

>m=max(V1)

>barplot(T1, ylim=c(0,m+1))

1.3 Variable qualitative ordinale

1.3.1 Le tableau statistique

Les valeurs distinctes d’une variable ordinale peuvent être ordonnées, ce

qu’on écrit

x1 ≺ x2 ≺ · · · ≺ xj−1 ≺ xj ≺ · · · ≺ xJ−1 ≺ xJ .

La notation x1 ≺ x2 se lit x1 précède x2.

Si la variable est ordinale, on peut calculer les effectifs cumulés :

j∑

Nj =

nk, j = 1, . . . , J.

k=1

On a N1 = n1 et NJ = n. On peut également calculer les fréquences cumulées

Fj =

Nj

n

j∑

=

fk, j = 1, . . . , J.

k=1

Exemple 1.5 On interroge 50 personnes sur leur dernier diplôme obtenu (va-

riable Y ). La codification a été faite selon le Tableau 1.1. On a obtenu la série

CélibataireDivorcé(e)Marié(e)Veuf(ve)024681014CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

Table 1.1 – Codification de la variable Y

Dernier diplôme obtenu

Sans diplôme

Primaire

Secondaire

Supérieur non-universitaire

Universitaire

xj

Sd

P

Se

Su

U

Table 1.2 – Série statistique de la variable Y

Sd

Se

Su

Sd

Se

Su

Sd

Se

Su

P

P

Sd P

Se

Se

Se

Se

Su U U U U U U U U

P

Se

P

Se

P

Se

P

Se

P

Se

P

Su

U

P

Su

U

P

Su

U

Se

Su

U

Se

Su

Table 1.3 – Tableau statistique complet

xj

Sd

P

Se

Su

U

nj Nj

4

4

15

11

29

14

38

9

12

50

50

fj

Publicité

0.08

0.22

0.28

0.18

0.24

1.00

Fj

0.08

0.30

0.58

0.76

1.00

statistique présentée dans le tableau 1.2. Finalement, on obtient le tableau sta-

tistique complet présenté dans le Tableau 1.3.

En langage R

> YY=c("Sd","Sd","Sd","Sd","P","P","P","P","P","P","P","P","P","P","P",

"Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se",

"Su","Su","Su","Su","Su","Su","Su","Su","Su",

"U","U","U","U","U","U","U","U","U","U","U","U")

YF=factor(YY,levels=c("Sd","P","Se","Su","U"))

T2=table(YF)

V2=c(T2)

> data.frame(Eff=V2,EffCum=cumsum(V2),Freq=V2/sum(V2),FreqCum=cumsum(V2/sum(V2)))

Eff EffCum Freq FreqCum

0.08

4 0.08

4

Sd

1.3. VARIABLE QUALITATIVE ORDINALE

15

11

P

Se 14

9

Su

12

U

15 0.22

29 0.28

38 0.18

50 0.24

0.30

0.58

0.76

1.00

1.3.2 Diagramme en secteurs

Les fréquences d’une variable qualitative ordinale sont représentées au moyen

d’un diagramme en secteurs (voir Figure 1.3).

Figure 1.3 – Diagramme en secteurs des fréquences

En langage R

> pie(T2,radius=1)

1.3.3 Diagramme en barres des effectifs

Les effectifs d’une variable qualitative ordinale sont représentés au moyen

d’un diagramme en barres (voir Figure 1.4).

En langage R

> barplot(T2)

SdPSeSuU16CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

Figure 1.4 – Diagramme en barres des effectifs

1.3.4 Diagramme en barres des effectifs cumulés

Les effectifs cumulés d’une variable qualitative ordinale sont représentés au

moyen d’un diagramme en barres (voir Figure 1.5).

Figure 1.5 – Diagramme en barres des effectifs cumulés

SdPSeSuU02468101214SdPSeSuU010203040501.4. VARIABLE QUANTITATIVE DISCR (cid:18)ETE

17

En langage R

> T3=cumsum(T2)

> barplot(T3)

1.4 Variable quantitative discrète

1.4.1 Le tableau statistique

Une variable discrète a un domaine dénombrable.

Exemple 1.6 Un quartier est composé de 50 ménages, et la variable Z représente

le nombre de personnes par ménage. Les valeurs de la variable sont

1 1 1 1

2 2 2 2

3 3 3 3

4 4 4 4

5 5 5 5

1

3

3

4

5

2

3

3

4

6

2

3

3

4

6

2

3

3

4

6

2

3

3

4

8

2

3

4

5

8

Comme pour les variables qualitatives ordinales, on peut calculer les effectifs,

les effectifs cumulés, les fréquences, les fréquences cumulées. À nouveau, on peut

construire le tableau statistique :

xj nj Nj

5

5

1

14

9

2

29

15

3

39

10

4

45

6

5

48

3

6

2

50

8

50

fj

0.10

0.18

0.30

0.20

0.12

0.06

0.04

1.0

Fj

0.10

0.28

0.58

0.78

0.90

0.96

1.00

En langage R

4,4,4,4,4,4,4,4,4,5,5,5,5,5,5,6,6,6,8,8)

> Z=c(1,1,1,1,1,2,2,2,2,2,2,2,2,2,3,3,3,3,3,3,3,3,3,3,3,3,3,3,3,4,

+

> T4=table(Z)

> T4c=c(T4)

> data.frame(Eff=T4c,EffCum=cumsum(T4c),Freq=T4c/sum(T4c),FreqCum=cumsum(T4c/sum(T4c)))

Eff EffCum Freq FreqCum

18CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

5

1

2

9

3 15

4 10

6

5

3

6

2

8

5 0.10

14 0.18

29 0.30

39 0.20

45 0.12

48 0.06

50 0.04

0.10

0.28

0.58

0.78

0.90

0.96

1.00

1.4.2 Diagramme en bâtonnets des effectifs

Quand la variable est discrète, les effectifs sont représentés par des bâtonnets

(voir Figure 1.6).

Figure 1.6 – Diagramme en bâtonnets des effectifs pour une variable quanti-

tative discrète

En langage R

> plot(T4,type="h",xlab="",ylab="",main="",frame=0,lwd=3)

05101512345681.5. VARIABLE QUANTITATIVE CONTINUE

19

1.4.3 Fonction de répartition

Les fréquences cumulées sont représentées au moyen de la fonction de répartition.

Cette fonction, présentée en Figure 1.7,est définie de R dans [0, 1] et vaut :

F (x) =

0

x < x1

Fj xj ≤ x < xj+1

xJ ≤ x.

1

Figure 1.7 – Fonction de répartition d’une variable quantitative discrète

En langage R

> plot(ecdf(Z),xlab="",ylab="",main="",frame=0)

1.5 Variable quantitative continue

1.5.1 Le tableau statistique

Une variable quantitative continue peut prendre une infinité de valeurs pos-

sibles. Le domaine de la variable est alors R ou un intervalle de R. En pratique,

une mesure est limitée en précision. La taille peut être mesurée en centimètres,

voire en millimètres. On peut alors traiter les variables continues comme des

variables discrètes. Cependant, pour faire des représentations graphiques et

024680.00.20.40.60.81.020CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

construire le tableau statistique, il faut procéder à des regroupements en classes.

Le tableau regroupé en classe est souvent appelé distribution groupée. Si [c−

j ; c+

j [

designe la classe j, on note, de manière générale :

la borne inférieure de la classe j,

la borne supérieure de la classe j,

– c−

j

– c+

j

j + c−

– cj = (c+

− c−

– aj = c+

j

j

– nj l’effectif de la classe j,

– Nj l’effectif cumulé de la classe j,

– fj la fréquence de la classe j,

– Fj la fréquence cumulée de la classe j.

j )/2 le centre de la classe j,

l’amplitude de la classe j,

La répartition en classes des données nécessite de définir a priori le nombre

de classes J et donc l’amplitude de chaque classe. En règle générale, on choisit

au moins cinq classes de même amplitude. Cependant, il existent des formules

qui nous permettent d’établir le nombre de classes et l’intervalle de classe (l’am-

plitude) pour une série statistique de n observations.

– La règle de Sturge : J = 1 + (3.3 log10(n)).

√

– La règle de Yule : J = 2.5 4

n.

L’intervalle de classe est obtenue ensuite de la manière suivante : longueur

de l’intervalle = (xmax − xmin)/J, où xmax (resp. xmin) désigne la plus grande

(resp. la plus petite) valeur observée.

Remarque 1.2 Il faut arrondir le nombre de classe J à l’entier le plus proche.

Par commodité, on peut aussi arrondir la valeur obtenue de l’intervalle de classe.

A partir de la plus petite valeur observée, on obtient les bornes de classes

en additionnant successivement l’intervalle de classe (l’amplitude).

Exemple 1.7 On mesure la taille en centimetres de 50 élèves d’une classe :

152 152

154 154

156 156

157 157

159 159

161 160

162 162

164 164

168 168

170 171

152

154

156

157

160

160

163

165

168

171

153

155

156

158

160

161

164

166

169

171

153

155

156

158

160

Publicité

162

164

167

169

171

1.5. VARIABLE QUANTITATIVE CONTINUE

21

On a les classes de tailles définies préablement comme il suit :

[151, 5; 155, 5[

[155, 5; 159, 5[

[159, 5; 163, 5[

[163, 5; 167, 5[

[167, 5; 171, 5[

On construit le tableau statistique.

[c−

j , c+

j ]

[151, 5; 155, 5[

[155, 5; 159, 5[

[159, 5; 163, 5[

[163, 5; 167, 5[

[167, 5; 171, 5[

nj Nj

10

10

22

12

33

11

40

7

50

10

50

fj

Fj

0.20 0.20

0.24 0.44

0.22 0.66

0.14 0.80

0.20 1.00

1.00

En langage R

> S=c(152,152,152,153,153,154,154,154,155,155,156,156,156,156,156,

+ 157,157,157,158,158,159,159,160,160,160,161,160,160,161,162, +

162,162,163,164,164,164,164,165,166,167,168,168,168,169,169, +

170,171,171,171,171)

> T5=table(cut(S, breaks=c(151,155,159,163,167,171)))

> T5c=c(T5)

> data.frame(Eff=T5c,EffCum=cumsum(T5c),Freq=T5c/sum(T5c),FreqCum=cumsum(T5c/sum(T5c)))

(151,155] 10

(159,163] 11

(167,171] 10

Eff EffCum Freq FreqCum

10 0.20

33 0.22

50 0.20

0.20 (155,159]

0.66 (163,167]

1.00

12

7

22 0.24 0.44

40 0.14 0.80

1.5.2 Histogramme

L’histogramme consiste à représenter les effectifs (resp. les fréquences) des

classes par des rectangles contigus dont la surface (et non la hauteur) représente

l’effectif (resp. la fréquence). Pour un histogramme des effectifs, la hauteur du

rectangle correspondant à la classe j est donc donnée par :

hj =

nj

aj

– On appelle hj la densité d’effectif.

22CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

– L’aire de l’histogramme est égale à l’effectif total n, puisque l’aire de

chaque rectangle est égale à l’effectif de la classe j : aj × hj = nj.

Pour un histogramme des fréquences on a

dj =

fj

aj

– On appelle dj la densité de fréquence.

– L’aire de l’histogramme est égale à 1, puisque l’aire de chaque rectangle

est égale à la fréquence de la classe j : aj × dj = fj.

Figure 1.8 représente l’histogramme des fréquences de l’exemple précedent :

Figure 1.8 – Histogramme des fréquences

En langage R

> hist(S,breaks=c(151.5,155.5,159.5,163.5,167.5,171.5), freq=FALSE,

xlab="",ylab="",main="",xaxt = "n")

> axis(1, c(151.5,155.5,159.5,163.5,167.5,171.5))

Si les deux dernières classes sont agrégées, comme dans la Figure 1.9, la

surface du dernier rectangle est égale à la surface des deux derniers rectangles

de l’histogramme de la Figure 1.8.

En langage R

> hist(S,breaks=c(151.5,155.5,159.5,163.5,171.5),

xlab="",ylab="",main="",xaxt = "n")

> axis(1, c(151.5,155.5,159.5,163.5,171.5))

0.000.020.040.06151.5155.5159.5163.5167.5171.51.5. VARIABLE QUANTITATIVE CONTINUE

23

Figure 1.9 – Histogramme des fréquences avec les deux dernières classes

agrégées

Remarque 1.3 Dans le cas de classes de même amplitude certains auteurs

et logiciels représentent l’histogramme avec les effectifs (resp. les fréquences)

reportés en ordonnée, l’aire de chaque rectangle étant proportionnelle à l’effectif

(resp. la fréquence) de la classe.

1.5.3 La fonction de répartition

La fonction de répartition F (x) est une fonction de R dans [0, 1], qui est

définie par

F (x) =





0

Fj−1 + fj

−

−c

j

1

c+

j

(x − c−

j )

x < c−

1

c−

j

c+

J

≤ x < c+

j

≤ x

0.000.020.040.06151.5155.5159.5163.5171.524CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

Figure 1.10 – Fonction de répartition d’une distribution groupée

0.00.20.40.60.81.0151.5155.5159.5163.5167.5171.51.5. VARIABLE QUANTITATIVE CONTINUE

25

En langage R

> y=c(0,0,cumsum(T5c/sum(T5c)),1)

> x=c(148,151.5,155.5,159.5,163.5,167.5,171.5,175)

> plot(x,y,type="b",xlab="",ylab="",xaxt = "n")

> axis(1, c(151.5,155.5,159.5,163.5,167.5,171.5))

26CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS

Chapitre 2

Statistique descriptive

univariée

2.1 Paramètres de position

2.1.1 Le mode

Le mode est la valeur distincte correspondant à l’effectif le plus élevé ; il est

noté xM .

Si on reprend la variable ‘Etat civil’ , dont le tableau statistique est le sui-

vant :

xj

C

M

V

D

nj

9

7

2

2

n = 20

fj

0.45

0.35

0.10

0.10

1

le mode est C : célibataire.

Remarque 2.1

– Le mode peut être calculé pour tous les types de variable, quantitative et

qualitative.

– Le mode n’est pas nécessairement unique.

– Quand une variable continue est découpée en classes, on peut définir une

classe modale (classe correspondant à l’effectif le plus élevé).

2.1.2 La moyenne

La moyenne ne peut être définie que sur une variable quantitative.

27

28

CHAPITRE 2. STATISTIQUE DESCRIPTIVE UNIVARI (cid:19)EE

La moyenne est la somme des valeurs observées divisée par leur nombre, elle

est notée ¯x :

¯x =

x1 + x2 + · · · + xi + · · · + xn

n

=

1

n

n∑

i=1

xi.

La moyenne peut être calculée à partir des valeurs distinctes et des effectifs

¯x =

1

n

J∑

j=1

njxj.

Exemple 2.1 Les nombres d’enfants de 8 familles sont les suivants 0, 0, 1, 1, 1, 2, 3, 4.

La moyenne est

¯x =

0 + 0 + 1 + 1 + 1 + 2 + 3 + 4

8

=

12

8

= 1.5.

On peut aussi faire les calculs avec les valeurs distinctes et les effectifs. On

considère le tableau :

xj nj

2

0

3

1

1

2

1

3

1

4

8

¯x =

2 × 0 + 3 × 1 + 1 × 2 + 1 × 3 + 1 × 4

8

=

3 + 2 + 3 + 4

8

= 1.5.

Remarque 2.2 La moyenne n’est pas nécessairement une valeur possible.

En langage R

E=c(0,0,1,1,1,2,3,4)

n=length(E)

xb=sum(E)/n

xb

xb=mean(E)

xb

2.1. PARAM (cid:18)ETRES DE POSITION

2.1.3 Remarques sur le signe de sommation

Définition 2.1

n∑

i=1

xi = x1 + x2 + · · · + xn.

29

∑

1. En statistique les xi sont souvent les valeurs observées.

n∑

n∑

2. L’indice est muet :

xi =

xj.

i=1

j=1

3. Quand il n’y a pas de confusion possible, on peut écrire

∑

i xi.

Exemple 2.2

4∑

xi = x1 + x2 + x3 + x4.

xi2 = x32 + x42 + x52.

i = 1 + 2 + 3 = 6.

1.

2.

3.

i=1

5∑

i=3

3∑

i=1

4. On peut utiliser plusieurs sommations emboˆıtées, mais il faut bien distin-

guer les indices :

3∑

2∑

i=1

j=1

xij = x11 + x12

(i = 1)

+ x21 + x22

+ x31 + x32

(i = 2)

(i = 3)

5. On peut exclure une valeur de l’indice.

5∑

i=1

i̸=3

xi = x1 + x2 + x4 + x5.

Propriété 2.1

1. Somme d’une constante

n∑

i=1

a = a + a + · · · + a

}