R(cid:19)esum(cid:19)e du Cours de Statistique
Descriptive
Yves Till(cid:19)e
15 d(cid:19)ecembre 2010
2
Objectif et moyens
Objectifs du cours
– Apprendre les principales techniques de statistique descriptive univariée
et bivariée.
– Être capable de mettre en oeuvre ces techniques de manière appropriée
dans un contexte donné.
– Être capable d’utiliser les commandes de base du Language R. Pouvoir
appliquer les techniques de statistiques descriptives au moyen du language
R.
– Références
Dodge Y.(2003), Premiers pas en statistique, Springer.
Droesbeke J.-J. (1997), Éléments de statistique, Editions de l’Université
libre de Bruxelles/Ellipses.
Moyens
– 2 heures de cours par semaine.
– 2 heures de TP par semaine, répartis en TP théoriques et applications en
Language R.
Le language R
– Shareware : gratuit et installé en 10 minutes.
– Open source (on sait ce qui est réellement calculé).
– Développé par la communauté des chercheurs, contient énormément de
fonctionnalités.
– Possibilité de programmer.
– Désavantage : pas très convivial.
– Manuel :
http://cran.r-project.org/doc/contrib/Paradis-rdebuts_fr.pdf
3
4
Table des matières
1 Variables, données statistiques, tableaux, effectifs
1.1 Définitions fondamentales . . . . . . . . . . . . . . . . . . . . . .
1.1.1 La science statistique
. . . . . . . . . . . . . . . . . . . .
1.1.2 Mesure et variable . . . . . . . . . . . . . . . . . . . . . .
1.1.3 Typologie des variables
. . . . . . . . . . . . . . . . . . .
Série statistique . . . . . . . . . . . . . . . . . . . . . . . .
1.1.4
1.2 Variable qualitative nominale . . . . . . . . . . . . . . . . . . . .
1.2.1 Effectifs, fréquences et tableau statistique . . . . . . . . .
1.2.2 Diagramme en secteurs et diagramme en barres . . . . . .
1.3 Variable qualitative ordinale . . . . . . . . . . . . . . . . . . . . .
1.3.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .
1.3.2 Diagramme en secteurs
. . . . . . . . . . . . . . . . . . .
1.3.3 Diagramme en barres des effectifs . . . . . . . . . . . . . .
1.3.4 Diagramme en barres des effectifs cumulés . . . . . . . . .
1.4 Variable quantitative discrète . . . . . . . . . . . . . . . . . . . .
1.4.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .
1.4.2 Diagramme en bâtonnets des effectifs
. . . . . . . . . . .
1.4.3 Fonction de répartition . . . . . . . . . . . . . . . . . . .
1.5 Variable quantitative continue . . . . . . . . . . . . . . . . . . . .
1.5.1 Le tableau statistique . . . . . . . . . . . . . . . . . . . .
1.5.2 Histogramme . . . . . . . . . . . . . . . . . . . . . . . . .
1.5.3 La fonction de répartition . . . . . . . . . . . . . . . . . .
2 Statistique descriptive univariée
2.1 Paramètres de position . . . . . . . . . . . . . . . . . . . . . . . .
2.1.1 Le mode . . . . . . . . . . . . . . . . . . . . . . . . . . . .
2.1.2 La moyenne . . . . . . . . . . . . . . . . . . . . . . . . . .
2.1.3 Remarques sur le signe de sommation
. . . . . . . . .
2.1.4 Moyenne géométrique . . . . . . . . . . . . . . . . . . . .
2.1.5 Moyenne harmonique
. . . . . . . . . . . . . . . . . . . .
2.1.6 Moyenne pondérée . . . . . . . . . . . . . . . . . . . . . .
2.1.7 La médiane . . . . . . . . . . . . . . . . . . . . . . . . . .
2.1.8 Quantiles . . . . . . . . . . . . . . . . . . . . . . . . . . .
2.2 Paramètres de dispersion . . . . . . . . . . . . . . . . . . . . . .
∑
9
9
9
9
9
10
11
11
12
13
13
15
15
16
17
17
18
19
19
19
21
23
27
27
27
27
29
31
31
32
33
35
37
5
6
TABLE DES MATI (cid:18)ERES
2.2.1 L’étendue . . . . . . . . . . . . . . . . . . . . . . . . . . .
2.2.2 La distance interquartile . . . . . . . . . . . . . . . . . . .
2.2.3 La variance . . . . . . . . . . . . . . . . . . . . . . . . . .
2.2.4 L’écart-type . . . . . . . . . . . . . . . . . . . . . . . . . .
2.2.5 L’écart moyen absolu . . . . . . . . . . . . . . . . . . . . .
2.2.6 L’écart médian absolu . . . . . . . . . . . . . . . . . . . .
2.3 Moments
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
2.4 Paramètres de forme . . . . . . . . . . . . . . . . . . . . . . . . .
2.4.1 Coefficient d’asymétrie de Fisher (skewness) . . . . . . . .
2.4.2 Coefficient d’asymétrie de Yule . . . . . . . . . . . . . . .
2.4.3 Coefficient d’asymétrie de Pearson . . . . . . . . . . . . .
2.5 Paramètre d’aplatissement (kurtosis) . . . . . . . . . . . . . . . .
. . . . . . . . . . . . . . . . . .
2.6 Changement d’origine et d’unité
2.7 Moyennes et variances dans des groupes . . . . . . . . . . . . . .
2.8 Diagramme en tiges et feuilles . . . . . . . . . . . . . . . . . . . .
2.9 La boˆıte à moustaches . . . . . . . . . . . . . . . . . . . . . . . .
3 Statistique descriptive bivariée
3.1 Série statistique bivariée . . . . . . . . . . . . . . . . . . . . . . .
3.2 Deux variables quantitatives . . . . . . . . . . . . . . . . . . . . .
3.2.1 Représentation graphique de deux variables . . . . . . . .
3.2.2 Analyse des variables . . . . . . . . . . . . . . . . . . . . .
3.2.3 Covariance
. . . . . . . . . . . . . . . . . . . . . . . . . .
3.2.4 Corrélation . . . . . . . . . . . . . . . . . . . . . . . . . .
3.2.5 Droite de régression . . . . . . . . . . . . . . . . . . . . .
. . . . . . . . . . . . . . . . .
3.2.6 Résidus et valeurs ajustées
3.2.7
. . . . . . . . . . . . . . .
3.2.8 Décomposition de la variance . . . . . . . . . . . . . . . .
. . . . . . . . . . . . . . . . . . . . .
3.3.1 Données observées . . . . . . . . . . . . . . . . . . . . . .
3.3.2 Tableau de contingence
. . . . . . . . . . . . . . . . . . .
3.3.3 Tableau des fréquences . . . . . . . . . . . . . . . . . . . .
3.3.4 Profils lignes et profils colonnes . . . . . . . . . . . . . . .
3.3.5 Effectifs théoriques et khi-carré . . . . . . . . . . . . . . .
3.3 Deux variables qualitatives
Sommes de carrés et variances
4 Théorie des indices, mesures d’inégalité
4.1 Nombres indices
. . . . . . . . . . . . . . . . . . . . . . . . . . .
4.2 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
4.2.1 Propriétés des indices
. . . . . . . . . . . . . . . . . . . .
4.2.2
Indices synthétiques . . . . . . . . . . . . . . . . . . . . .
4.2.3
Indice de Laspeyres
. . . . . . . . . . . . . . . . . . . . .
4.2.4
Indice de Paasche . . . . . . . . . . . . . . . . . . . . . . .
. . . . . . . . . . . . . . . . . . . . . .
4.2.5 L’indice de Fisher
4.2.6 L’indice de Sidgwick . . . . . . . . . . . . . . . . . . . . .
Indices chaˆınes . . . . . . . . . . . . . . . . . . . . . . . .
4.2.7
. . . . . . . . . . . . . . . . . . . . . . . .
4.3 Mesures de l’inégalité
37
37
37
38
40
40
40
41
41
41
41
42
42
44
45
46
53
53
53
53
55
55
56
57
60
61
62
64
64
64
65
66
67
77
77
77
78
78
78
80
80
81
81
82
TABLE DES MATI (cid:18)ERES
Introduction . . . . . . . . . . . . . . . . . . . . . . . . .
4.3.1
. . . . . . . . . . . . . . . . . . . . . .
4.3.2 Courbe de Lorenz
Indice de Gini . . . . . . . . . . . . . . . . . . . . . . . . .
4.3.3
4.3.4
Indice de Hoover . . . . . . . . . . . . . . . . . . . . . . .
4.3.5 Quintile et Decile share ratio . . . . . . . . . . . . . . . .
Indice de pauvreté . . . . . . . . . . . . . . . . . . . . . .
4.3.6
Indices selon les pays . . . . . . . . . . . . . . . . . . . . .
4.3.7
7
82
82
84
84
84
85
85
5 Calcul des probabilités et variables aléatoires
Événement
5.2 Analyse combinatoire
87
87
5.1 Probabilités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
87
. . . . . . . . . . . . . . . . . . . . . . . . . .
5.1.1
87
. . . . . . . . . . . . . . .
5.1.2 Opérations sur les événements
88
5.1.3 Relations entre les événements
. . . . . . . . . . . . . . .
89
5.1.4 Ensemble des parties d’un ensemble et système complet .
89
5.1.5 Axiomatique des Probabilités . . . . . . . . . . . . . . . .
92
5.1.6 Probabilités conditionnelles et indépendance
. . . . . . .
93
5.1.7 Théoreme des probabilités totales et théoreme de Bayes .
94
. . . . . . . . . . . . . . . . . . . . . . . .
94
Introduction . . . . . . . . . . . . . . . . . . . . . . . . .
5.2.1
94
5.2.2 Permutations (sans répétition)
. . . . . . . . . . . . . . .
95
5.2.3 Permutations avec répétition . . . . . . . . . . . . . . . .
95
5.2.4 Arrangements (sans répétition) . . . . . . . . . . . . . . .
95
5.2.5 Combinaisons . . . . . . . . . . . . . . . . . . . . . . . . .
96
5.3 Variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . .
96
5.3.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . .
97
5.4 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . .
97
5.4.1 Définition, espérance et variance . . . . . . . . . . . . . .
97
5.4.2 Variable indicatrice ou bernoullienne . . . . . . . . . . . .
5.4.3 Variable binomiale . . . . . . . . . . . . . . . . . . . . . .
98
5.4.4 Variable de Poisson . . . . . . . . . . . . . . . . . . . . . 102
5.5 Variable aléatoire continue . . . . . . . . . . . . . . . . . . . . . . 103
5.5.1 Définition, espérance et variance . . . . . . . . . . . . . . 103
5.5.2 Variable uniforme
Publicité
. . . . . . . . . . . . . . . . . . . . . . 105
5.5.3 Variable normale . . . . . . . . . . . . . . . . . . . . . . . 108
5.5.4 Variable normale centrée réduite . . . . . . . . . . . . . . 108
5.5.5 Distribution exponentielle . . . . . . . . . . . . . . . . . . 110
5.6 Distribution bivariée . . . . . . . . . . . . . . . . . . . . . . . . . 110
5.6.1 Cas continu . . . . . . . . . . . . . . . . . . . . . . . . . . 111
. . . . . . . . . . . . . . . . . . . . . . . . . . 112
5.6.2 Cas discret
5.6.3 Remarques
. . . . . . . . . . . . . . . . . . . . . . . . . . 113
Indépendance de deux variables aléatoires . . . . . . . . . 113
5.6.4
5.7 Propriétés des espérances et des variances . . . . . . . . . . . . . 114
5.8 Autres variables aléatoires . . . . . . . . . . . . . . . . . . . . . . 116
5.8.1 Variable khi-carrée . . . . . . . . . . . . . . . . . . . . . . 116
. . . . . . . . . . . . . . . . . . . . . 117
5.8.2 Variable de Student
. . . . . . . . . . . . . . . . . . . . . . 117
5.8.3 Variable de Fisher
8
TABLE DES MATI (cid:18)ERES
5.8.4 Loi normale bivariée . . . . . . . . . . . . . . . . . . . . . 118
6 Séries temporelles, filtres, moyennes mobiles et désaisonnalisation127
6.1 Définitions générales et exemples . . . . . . . . . . . . . . . . . . 127
. . . . . . . . . . . . . . . . . . . . . . . . . . 127
6.1.1 Définitions
6.1.2 Traitement des séries temporelles . . . . . . . . . . . . . . 128
6.1.3 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . 128
6.2 Description de la tendance . . . . . . . . . . . . . . . . . . . . . . 133
6.2.1 Les principaux modèles
. . . . . . . . . . . . . . . . . . . 133
6.2.2 Tendance linéaire . . . . . . . . . . . . . . . . . . . . . . . 134
6.2.3 Tendance quadratique . . . . . . . . . . . . . . . . . . . . 134
6.2.4 Tendance polynomiale d’ordre q
. . . . . . . . . . . . . . 134
. . . . . . . . . . . . . . . . . . . . . 134
6.2.5 Tendance logistique
6.3 Opérateurs de décalage et de différence . . . . . . . . . . . . . . . 136
6.3.1 Opérateurs de décalage
. . . . . . . . . . . . . . . . . . . 136
6.3.2 Opérateur différence . . . . . . . . . . . . . . . . . . . . . 136
. . . . . . . . . . . . . . . . . . . . 138
6.3.3 Différence saisonnière
6.4 Filtres linéaires et moyennes mobiles . . . . . . . . . . . . . . . . 140
6.4.1 Filtres linéaires . . . . . . . . . . . . . . . . . . . . . . . . 140
6.4.2 Moyennes mobiles : définition . . . . . . . . . . . . . . . . 140
. . . . . . . . 141
6.4.3 Moyenne mobile et composante saisonnière
6.5 Moyennes mobiles particulières . . . . . . . . . . . . . . . . . . . 143
6.5.1 Moyenne mobile de Van Hann . . . . . . . . . . . . . . . . 143
6.5.2 Moyenne mobile de Spencer . . . . . . . . . . . . . . . . . 143
6.5.3 Moyenne mobile de Henderson . . . . . . . . . . . . . . . 144
6.5.4 Médianes mobiles . . . . . . . . . . . . . . . . . . . . . . . 145
6.6 Désaisonnalisation . . . . . . . . . . . . . . . . . . . . . . . . . . 145
6.6.1 Méthode additive . . . . . . . . . . . . . . . . . . . . . . . 145
. . . . . . . . . . . . . . . . . . . 145
6.6.2 Méthode multiplicative
6.7 Lissage exponentiel . . . . . . . . . . . . . . . . . . . . . . . . . . 147
6.7.1 Lissage exponentiel simple . . . . . . . . . . . . . . . . . . 147
6.7.2 Lissage exponentiel double . . . . . . . . . . . . . . . . . . 150
7 Tables statistiques
157
Chapitre 1
Variables, données
statistiques, tableaux,
effectifs
1.1 Définitions fondamentales
1.1.1 La science statistique
– Méthode scientifique du traitement des données quantitatives.
– Etymologiquement : science de l’état.
– La statistique s’applique à la plupart des disciplines : agronomie, biologie,
démographie, économie, sociologie, linguistique, psychologie, . . .
1.1.2 Mesure et variable
– On s’intéresse à des unités statistiques ou unités d’observation : par exemple
des individus, des entreprises, des ménages. En sciences humaines, on
s’intéresse dans la plupart des cas à un nombre fini d’unités.
– Sur ces unités, on mesure un caractère ou une variable, le chiffre d’affaires
de l’entreprise, le revenu du ménage, l’âge de la personne, la catégorie so-
cioprofessionnelle d’une personne. On suppose que la variable prend tou-
jours une seule valeur sur chaque unité. Les variables sont désignées par
simplicité par une lettre (X, Y, Z).
– Les valeurs possibles de la variable, sont appelées modalités.
– L’ensemble des valeurs possibles ou des modalités est appelé le domaine
de la variable.
1.1.3 Typologie des variables
– Variable qualitative : La variable est dite qualitative quand les modalités
9
10CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
sont des catégories.
– Variable qualitative nominale : La variable est dite qualitative nominale
quand les modalités ne peuvent pas être ordonnées.
– Variable qualitative ordinale : La variable est dite qualitative ordinale
quand les modalités peuvent être ordonnées. Le fait de pouvoir ou non
ordonner les modalités est parfois discutable. Par exemple : dans les
catégories socioprofessionnelles, on admet d’ordonner les modalités :
‘ouvriers’, ‘employés’, ‘cadres’. Si on ajoute les modalités ‘sans profes-
sion’, ‘enseignant’, ‘artisan’, l’ordre devient beaucoup plus discutable.
– Variable quantitative : Une variable est dite quantitative si toute ses va-
leurs possibles sont numériques.
– Variable quantitative discrete : Une variable est dite discrete, si l’en-
semble des valeurs possibles est dénombrable.
– Variable quantitative continue : Une variable est dite continue, si l’en-
semble des valeurs possibles est continu.
Remarque 1.1 Ces définitions sont à relativiser, l’âge est théoriquement
une variable quantitative continue, mais en pratique, l’âge est mesuré dans le
meilleur des cas au jour près. Toute mesure est limitée en précision !
Exemple 1.1 Les modalités de la variable sexe sont masculin (codé M) et
féminin (codé F). Le domaine de la variable est {M, F }.
Exemple 1.2 Les modalités de la variable nombre d’enfants par famille sont
0,1,2,3,4,5,. . .C’est une variable quantitative discrète.
1.1.4 Série statistique
On appelle série statistique la suite des valeurs prises par une variable X sur
les unités d’observation.
Le nombre d’unités d’observation est noté n.
Les valeurs de la variable X sont notées
x1, . . . , xi, . . . , xn.
Exemple 1.3 On s’intéresse a la variable ‘état-civil’ notée X et a la série sta-
tistique des valeurs prises par X sur 20 personnes. La codification est
célibataire,
C :
M : marié(e),
veuf(ve),
V :
divorcée.
D :
1.2. VARIABLE QUALITATIVE NOMINALE
11
Le domaine de la variable X est {C, M, V, D}. Considérons la série statistique
suivante :
M M D C C M C C C M
C M V M V D C C C M
Ici, n = 20,
x1 = M, x2 = M, x3 = D, x4 = C, x5 = C, . . . ., x20 = M.
1.2 Variable qualitative nominale
1.2.1 Effectifs, fréquences et tableau statistique
Une variable qualitative nominale a des valeurs distinctes qui ne peuvent
pas être ordonnées. On note J le nombre de valeurs distinctes ou modalités.
Les valeurs distinctes sont notées x1, . . . , xj, . . . , xJ . On appelle effectif d’une
modalité ou d’une valeur distincte, le nombre de fois que cette modalité (ou
valeur distincte) apparaˆıt. On note nj l’effectif de la modalité xj. La fréquence
d’une modalité est l’effectif divisé par le nombre d’unités d’observation.
fj =
nj
n
, j = 1, . . . , J.
Exemple 1.4 Avec la série de l’exemple précédent, on obtient le tableau sta-
tistique :
xj
C
M
V
D
nj
9
7
2
2
n = 20
fj
0.45
0.35
0.10
0.10
1
12CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
En langage R
>X=c(’Mari(cid:19)e(e)’,’Mari(cid:19)e(e)’,’Divorc(cid:19)e(e)’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’C(cid:19)elibataire’,
’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’,’Veuf(ve)’,’Mari(cid:19)e(e)’,
’Veuf(ve)’,’Divorc(cid:19)e(e)’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’C(cid:19)elibataire’,’Mari(cid:19)e(e)’)
> T1=table(X)
> V1=c(T1)
> data.frame(Eff=V1,Freq=V1/sum(V1))
C(cid:19)elibataire
Divorc(cid:19)e(e)
Mari(cid:19)e(e)
Veuf(ve)
Eff Freq
9 0.45
2 0.10
7 0.35
2 0.10
1.2.2 Diagramme en secteurs et diagramme en barres
Le tableau statistique d’une variable qualitative nominale peut être représenté
par deux types de graphique. Les effectifs sont représentés par un diagramme
en barres et les fréquences par un diagramme en secteurs (ou camembert ou
piechart en anglais) (voir Figures 1.1 et 1.2).
Figure 1.1 – Diagramme en secteurs des fréquences
En langage R
> pie(T1,radius=1.0)
CélibataireDivorcé(e)Marié(e)Veuf(ve)1.3. VARIABLE QUALITATIVE ORDINALE
13
Figure 1.2 – Diagramme en barres des effectifs
En langage R
>m=max(V1)
>barplot(T1, ylim=c(0,m+1))
1.3 Variable qualitative ordinale
1.3.1 Le tableau statistique
Les valeurs distinctes d’une variable ordinale peuvent être ordonnées, ce
qu’on écrit
x1 ≺ x2 ≺ · · · ≺ xj−1 ≺ xj ≺ · · · ≺ xJ−1 ≺ xJ .
La notation x1 ≺ x2 se lit x1 précède x2.
Si la variable est ordinale, on peut calculer les effectifs cumulés :
j∑
Nj =
nk, j = 1, . . . , J.
k=1
On a N1 = n1 et NJ = n. On peut également calculer les fréquences cumulées
Fj =
Nj
n
j∑
=
fk, j = 1, . . . , J.
k=1
Exemple 1.5 On interroge 50 personnes sur leur dernier diplôme obtenu (va-
riable Y ). La codification a été faite selon le Tableau 1.1. On a obtenu la série
CélibataireDivorcé(e)Marié(e)Veuf(ve)024681014CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
Table 1.1 – Codification de la variable Y
Dernier diplôme obtenu
Sans diplôme
Primaire
Secondaire
Supérieur non-universitaire
Universitaire
xj
Sd
P
Se
Su
U
Table 1.2 – Série statistique de la variable Y
Sd
Se
Su
Sd
Se
Su
Sd
Se
Su
P
P
Sd P
Se
Se
Se
Se
Su U U U U U U U U
P
Se
P
Se
P
Se
P
Se
P
Se
P
Su
U
P
Su
U
P
Su
U
Se
Su
U
Se
Su
Table 1.3 – Tableau statistique complet
xj
Sd
P
Se
Su
U
nj Nj
4
4
15
11
29
14
38
9
12
50
50
fj
Publicité
0.08
0.22
0.28
0.18
0.24
1.00
Fj
0.08
0.30
0.58
0.76
1.00
statistique présentée dans le tableau 1.2. Finalement, on obtient le tableau sta-
tistique complet présenté dans le Tableau 1.3.
En langage R
> YY=c("Sd","Sd","Sd","Sd","P","P","P","P","P","P","P","P","P","P","P",
"Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se","Se",
"Su","Su","Su","Su","Su","Su","Su","Su","Su",
"U","U","U","U","U","U","U","U","U","U","U","U")
YF=factor(YY,levels=c("Sd","P","Se","Su","U"))
T2=table(YF)
V2=c(T2)
> data.frame(Eff=V2,EffCum=cumsum(V2),Freq=V2/sum(V2),FreqCum=cumsum(V2/sum(V2)))
Eff EffCum Freq FreqCum
0.08
4 0.08
4
Sd
1.3. VARIABLE QUALITATIVE ORDINALE
15
11
P
Se 14
9
Su
12
U
15 0.22
29 0.28
38 0.18
50 0.24
0.30
0.58
0.76
1.00
1.3.2 Diagramme en secteurs
Les fréquences d’une variable qualitative ordinale sont représentées au moyen
d’un diagramme en secteurs (voir Figure 1.3).
Figure 1.3 – Diagramme en secteurs des fréquences
En langage R
> pie(T2,radius=1)
1.3.3 Diagramme en barres des effectifs
Les effectifs d’une variable qualitative ordinale sont représentés au moyen
d’un diagramme en barres (voir Figure 1.4).
En langage R
> barplot(T2)
SdPSeSuU16CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
Figure 1.4 – Diagramme en barres des effectifs
1.3.4 Diagramme en barres des effectifs cumulés
Les effectifs cumulés d’une variable qualitative ordinale sont représentés au
moyen d’un diagramme en barres (voir Figure 1.5).
Figure 1.5 – Diagramme en barres des effectifs cumulés
SdPSeSuU02468101214SdPSeSuU010203040501.4. VARIABLE QUANTITATIVE DISCR (cid:18)ETE
17
En langage R
> T3=cumsum(T2)
> barplot(T3)
1.4 Variable quantitative discrète
1.4.1 Le tableau statistique
Une variable discrète a un domaine dénombrable.
Exemple 1.6 Un quartier est composé de 50 ménages, et la variable Z représente
le nombre de personnes par ménage. Les valeurs de la variable sont
1 1 1 1
2 2 2 2
3 3 3 3
4 4 4 4
5 5 5 5
1
3
3
4
5
2
3
3
4
6
2
3
3
4
6
2
3
3
4
6
2
3
3
4
8
2
3
4
5
8
Comme pour les variables qualitatives ordinales, on peut calculer les effectifs,
les effectifs cumulés, les fréquences, les fréquences cumulées. À nouveau, on peut
construire le tableau statistique :
xj nj Nj
5
5
1
14
9
2
29
15
3
39
10
4
45
6
5
48
3
6
2
50
8
50
fj
0.10
0.18
0.30
0.20
0.12
0.06
0.04
1.0
Fj
0.10
0.28
0.58
0.78
0.90
0.96
1.00
En langage R
4,4,4,4,4,4,4,4,4,5,5,5,5,5,5,6,6,6,8,8)
> Z=c(1,1,1,1,1,2,2,2,2,2,2,2,2,2,3,3,3,3,3,3,3,3,3,3,3,3,3,3,3,4,
+
> T4=table(Z)
> T4c=c(T4)
> data.frame(Eff=T4c,EffCum=cumsum(T4c),Freq=T4c/sum(T4c),FreqCum=cumsum(T4c/sum(T4c)))
Eff EffCum Freq FreqCum
18CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
5
1
2
9
3 15
4 10
6
5
3
6
2
8
5 0.10
14 0.18
29 0.30
39 0.20
45 0.12
48 0.06
50 0.04
0.10
0.28
0.58
0.78
0.90
0.96
1.00
1.4.2 Diagramme en bâtonnets des effectifs
Quand la variable est discrète, les effectifs sont représentés par des bâtonnets
(voir Figure 1.6).
Figure 1.6 – Diagramme en bâtonnets des effectifs pour une variable quanti-
tative discrète
En langage R
> plot(T4,type="h",xlab="",ylab="",main="",frame=0,lwd=3)
05101512345681.5. VARIABLE QUANTITATIVE CONTINUE
19
1.4.3 Fonction de répartition
Les fréquences cumulées sont représentées au moyen de la fonction de répartition.
Cette fonction, présentée en Figure 1.7,est définie de R dans [0, 1] et vaut :
F (x) =
0
x < x1
Fj xj ≤ x < xj+1
xJ ≤ x.
1
Figure 1.7 – Fonction de répartition d’une variable quantitative discrète
En langage R
> plot(ecdf(Z),xlab="",ylab="",main="",frame=0)
1.5 Variable quantitative continue
1.5.1 Le tableau statistique
Une variable quantitative continue peut prendre une infinité de valeurs pos-
sibles. Le domaine de la variable est alors R ou un intervalle de R. En pratique,
une mesure est limitée en précision. La taille peut être mesurée en centimètres,
voire en millimètres. On peut alors traiter les variables continues comme des
variables discrètes. Cependant, pour faire des représentations graphiques et
024680.00.20.40.60.81.020CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
construire le tableau statistique, il faut procéder à des regroupements en classes.
Le tableau regroupé en classe est souvent appelé distribution groupée. Si [c−
j ; c+
j [
designe la classe j, on note, de manière générale :
la borne inférieure de la classe j,
la borne supérieure de la classe j,
– c−
j
– c+
j
j + c−
– cj = (c+
− c−
– aj = c+
j
j
– nj l’effectif de la classe j,
– Nj l’effectif cumulé de la classe j,
– fj la fréquence de la classe j,
– Fj la fréquence cumulée de la classe j.
j )/2 le centre de la classe j,
l’amplitude de la classe j,
La répartition en classes des données nécessite de définir a priori le nombre
de classes J et donc l’amplitude de chaque classe. En règle générale, on choisit
au moins cinq classes de même amplitude. Cependant, il existent des formules
qui nous permettent d’établir le nombre de classes et l’intervalle de classe (l’am-
plitude) pour une série statistique de n observations.
– La règle de Sturge : J = 1 + (3.3 log10(n)).
√
– La règle de Yule : J = 2.5 4
n.
L’intervalle de classe est obtenue ensuite de la manière suivante : longueur
de l’intervalle = (xmax − xmin)/J, où xmax (resp. xmin) désigne la plus grande
(resp. la plus petite) valeur observée.
Remarque 1.2 Il faut arrondir le nombre de classe J à l’entier le plus proche.
Par commodité, on peut aussi arrondir la valeur obtenue de l’intervalle de classe.
A partir de la plus petite valeur observée, on obtient les bornes de classes
en additionnant successivement l’intervalle de classe (l’amplitude).
Exemple 1.7 On mesure la taille en centimetres de 50 élèves d’une classe :
152 152
154 154
156 156
157 157
159 159
161 160
162 162
164 164
168 168
170 171
152
154
156
157
160
160
163
165
168
171
153
155
156
158
160
161
164
166
169
171
153
155
156
158
160
Publicité
162
164
167
169
171
1.5. VARIABLE QUANTITATIVE CONTINUE
21
On a les classes de tailles définies préablement comme il suit :
[151, 5; 155, 5[
[155, 5; 159, 5[
[159, 5; 163, 5[
[163, 5; 167, 5[
[167, 5; 171, 5[
On construit le tableau statistique.
[c−
j , c+
j ]
[151, 5; 155, 5[
[155, 5; 159, 5[
[159, 5; 163, 5[
[163, 5; 167, 5[
[167, 5; 171, 5[
nj Nj
10
10
22
12
33
11
40
7
50
10
50
fj
Fj
0.20 0.20
0.24 0.44
0.22 0.66
0.14 0.80
0.20 1.00
1.00
En langage R
> S=c(152,152,152,153,153,154,154,154,155,155,156,156,156,156,156,
+ 157,157,157,158,158,159,159,160,160,160,161,160,160,161,162, +
162,162,163,164,164,164,164,165,166,167,168,168,168,169,169, +
170,171,171,171,171)
> T5=table(cut(S, breaks=c(151,155,159,163,167,171)))
> T5c=c(T5)
> data.frame(Eff=T5c,EffCum=cumsum(T5c),Freq=T5c/sum(T5c),FreqCum=cumsum(T5c/sum(T5c)))
(151,155] 10
(159,163] 11
(167,171] 10
Eff EffCum Freq FreqCum
10 0.20
33 0.22
50 0.20
0.20 (155,159]
0.66 (163,167]
1.00
12
7
22 0.24 0.44
40 0.14 0.80
1.5.2 Histogramme
L’histogramme consiste à représenter les effectifs (resp. les fréquences) des
classes par des rectangles contigus dont la surface (et non la hauteur) représente
l’effectif (resp. la fréquence). Pour un histogramme des effectifs, la hauteur du
rectangle correspondant à la classe j est donc donnée par :
hj =
nj
aj
– On appelle hj la densité d’effectif.
22CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
– L’aire de l’histogramme est égale à l’effectif total n, puisque l’aire de
chaque rectangle est égale à l’effectif de la classe j : aj × hj = nj.
Pour un histogramme des fréquences on a
dj =
fj
aj
– On appelle dj la densité de fréquence.
– L’aire de l’histogramme est égale à 1, puisque l’aire de chaque rectangle
est égale à la fréquence de la classe j : aj × dj = fj.
Figure 1.8 représente l’histogramme des fréquences de l’exemple précedent :
Figure 1.8 – Histogramme des fréquences
En langage R
> hist(S,breaks=c(151.5,155.5,159.5,163.5,167.5,171.5), freq=FALSE,
xlab="",ylab="",main="",xaxt = "n")
> axis(1, c(151.5,155.5,159.5,163.5,167.5,171.5))
Si les deux dernières classes sont agrégées, comme dans la Figure 1.9, la
surface du dernier rectangle est égale à la surface des deux derniers rectangles
de l’histogramme de la Figure 1.8.
En langage R
> hist(S,breaks=c(151.5,155.5,159.5,163.5,171.5),
xlab="",ylab="",main="",xaxt = "n")
> axis(1, c(151.5,155.5,159.5,163.5,171.5))
0.000.020.040.06151.5155.5159.5163.5167.5171.51.5. VARIABLE QUANTITATIVE CONTINUE
23
Figure 1.9 – Histogramme des fréquences avec les deux dernières classes
agrégées
Remarque 1.3 Dans le cas de classes de même amplitude certains auteurs
et logiciels représentent l’histogramme avec les effectifs (resp. les fréquences)
reportés en ordonnée, l’aire de chaque rectangle étant proportionnelle à l’effectif
(resp. la fréquence) de la classe.
1.5.3 La fonction de répartition
La fonction de répartition F (x) est une fonction de R dans [0, 1], qui est
définie par
F (x) =
0
Fj−1 + fj
−
−c
j
1
c+
j
(x − c−
j )
x < c−
1
c−
j
c+
J
≤ x < c+
j
≤ x
0.000.020.040.06151.5155.5159.5163.5171.524CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
Figure 1.10 – Fonction de répartition d’une distribution groupée
0.00.20.40.60.81.0151.5155.5159.5163.5167.5171.51.5. VARIABLE QUANTITATIVE CONTINUE
25
En langage R
> y=c(0,0,cumsum(T5c/sum(T5c)),1)
> x=c(148,151.5,155.5,159.5,163.5,167.5,171.5,175)
> plot(x,y,type="b",xlab="",ylab="",xaxt = "n")
> axis(1, c(151.5,155.5,159.5,163.5,167.5,171.5))
26CHAPITRE 1. VARIABLES, DONN (cid:19)EES STATISTIQUES, TABLEAUX, EFFECTIFS
Chapitre 2
Statistique descriptive
univariée
2.1 Paramètres de position
2.1.1 Le mode
Le mode est la valeur distincte correspondant à l’effectif le plus élevé ; il est
noté xM .
Si on reprend la variable ‘Etat civil’ , dont le tableau statistique est le sui-
vant :
xj
C
M
V
D
nj
9
7
2
2
n = 20
fj
0.45
0.35
0.10
0.10
1
le mode est C : célibataire.
Remarque 2.1
– Le mode peut être calculé pour tous les types de variable, quantitative et
qualitative.
– Le mode n’est pas nécessairement unique.
– Quand une variable continue est découpée en classes, on peut définir une
classe modale (classe correspondant à l’effectif le plus élevé).
2.1.2 La moyenne
La moyenne ne peut être définie que sur une variable quantitative.
27
28
CHAPITRE 2. STATISTIQUE DESCRIPTIVE UNIVARI (cid:19)EE
La moyenne est la somme des valeurs observées divisée par leur nombre, elle
est notée ¯x :
¯x =
x1 + x2 + · · · + xi + · · · + xn
n
=
1
n
n∑
i=1
xi.
La moyenne peut être calculée à partir des valeurs distinctes et des effectifs
¯x =
1
n
J∑
j=1
njxj.
Exemple 2.1 Les nombres d’enfants de 8 familles sont les suivants 0, 0, 1, 1, 1, 2, 3, 4.
La moyenne est
¯x =
0 + 0 + 1 + 1 + 1 + 2 + 3 + 4
8
=
12
8
= 1.5.
On peut aussi faire les calculs avec les valeurs distinctes et les effectifs. On
considère le tableau :
xj nj
2
0
3
1
1
2
1
3
1
4
8
¯x =
2 × 0 + 3 × 1 + 1 × 2 + 1 × 3 + 1 × 4
8
=
3 + 2 + 3 + 4
8
= 1.5.
Remarque 2.2 La moyenne n’est pas nécessairement une valeur possible.
En langage R
E=c(0,0,1,1,1,2,3,4)
n=length(E)
xb=sum(E)/n
xb
xb=mean(E)
xb
2.1. PARAM (cid:18)ETRES DE POSITION
2.1.3 Remarques sur le signe de sommation
Définition 2.1
n∑
i=1
xi = x1 + x2 + · · · + xn.
29
∑
1. En statistique les xi sont souvent les valeurs observées.
n∑
n∑
2. L’indice est muet :
xi =
xj.
i=1
j=1
3. Quand il n’y a pas de confusion possible, on peut écrire
∑
i xi.
Exemple 2.2
4∑
xi = x1 + x2 + x3 + x4.
xi2 = x32 + x42 + x52.
i = 1 + 2 + 3 = 6.
1.
2.
3.
i=1
5∑
i=3
3∑
i=1
4. On peut utiliser plusieurs sommations emboˆıtées, mais il faut bien distin-
guer les indices :
3∑
2∑
i=1
j=1
xij = x11 + x12
(i = 1)
+ x21 + x22
+ x31 + x32
(i = 2)
(i = 3)
5. On peut exclure une valeur de l’indice.
5∑
i=1
i̸=3
xi = x1 + x2 + x4 + x5.
Propriété 2.1
1. Somme d’une constante
n∑
i=1
a = a + a + · · · + a
}