R
.
V E Y S S E Y R E
P O U R
L ’ I
N G É N I E U R
E T
P R O B A B I L I T É S
S T A T I S T I Q U E
AIDE-MÉMOIRE DE L’INGÉNIEUR
2e édition
RENEE VEYSSEYRE
est agrégée de mathématiques et professeur honoraire à l’École centrale de Paris.
Renée Veysseyre
STATISTIQUE ET PROBABILITÉS POUR L’INGÉNIEUR
Cet aide-mémoire rassemble toutes les définitions, lois et formules du calcul des probabilités et de la statistique utiles à l’ingénieur en activité aussi bien qu’à l’étudiant en formation. • La première partie donne les principales définitions, et propose un résumé de tous les résultats que l’on peut obtenir à partir d’un tableau de données. • La deuxième partie donne le vocabulaire du calcul des probabilités et étudie les principales lois discrètes et continues.
• La troisième partie traite des problèmes rencontrés par l’ingénieur dans le domaine de la décision : échantillonnage, estimation et tests d’hypothèse, tests de comparaison, tests d’ajustement, régression. • La quatrième partie propose un résumé de l’analyse
des données.
Cette nouvelle édition a été augmentée d’un chapitre sur la régression multiple.
ISBN 2 10 049994 7
www.dunod.com
2e édition
lims Page I Jeudi, 10. août 2006 11:21 11
Renée Veysseyre
Aide-mémoire Statistique et pour l’ingénieur
probabilités
e 2
édition
lims Page II Jeudi, 10. août 2006 11:21 11
© Dunod, Paris, 2001, 2006 ISBN 2 10 049994 7
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page III — #1
(cid:2)
(cid:2)
TABLE DES MATIÈRES
Principales notations
A Statistique descriptive
1 (cid:129) Représentation graphique et numérique des données
1.1 1.2 1.3
Généralités et principales définitions Séries numériques à une dimension Séries numériques à deux dimensions
B Calcul des probabilités
2 (cid:129) Le modèle probabiliste Introduction Les concepts probabilistes
2.1 2.2 2.3 Mesure de probabilité et espace probabilisé 2.4
Échantillons et sous-populations
3 (cid:129) Probabilité conditionnelle. Indépendance
3.1 3.2 3.3
Définition Principe des probabilités composées Événements indépendants
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
XI
3 3 7 26
33 33 35 40 41
42 42 44 44
III
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page IV — #2
(cid:2)
(cid:2)
3.4 3.5
Indépendance deux à deux et indépendance mutuelle Théorème de Bayes
4 (cid:129) Variables aléatoires réelles
4.1 4.2 4.3 4.4 4.5
Généralités sur les variables aléatoires Fonction de répartition Densité de probabilité Discontinuités d’une fonction de répartition et lois discrètes Loi de probabilité d’une variable aléatoire Y fonction d’une variable aléatoire X Indépendance de deux variables aléatoires
4.6 4.7 Moments d’une variable aléatoire
5 (cid:129) Lois de probabilité discrètes
5.1 5.2 5.3 5.4 5.5 5.6 5.7 5.8 5.9
Définition d’une variable discrète Loi de Dirac Loi uniforme Loi binomiale ou loi des tirages avec remise Loi multinomiale Loi hypergéométrique ou loi du tirage exhaustif Loi de Poisson Lois limites Résumé
6 (cid:129) Lois de probabilité continues
6.1 6.2 6.3 6.4 6.5 6.6 6.7
Généralités Loi uniforme Loi exponentielle Loi gamma Lois bêta de types I et II Loi de Laplace-Gauss ou loi normale Loi log-normale
7 (cid:129) Convolution. Fonctions caractéristiques.
Convergences stochastiques 7.1
Convolution
45 46
49 49 52 54 56
57 58 59
67 67 69 70 71 77 80 83 84 87
89 89 90 92 95 97 100 109
112 112
IV
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page V — #3
(cid:2)
(cid:2)
7.2 7.3 7.4 7.5
Fonction caractéristique Convergence des suites de variables aléatoires Lois des grands nombres Théorème central limite
8 (cid:129) Variables aléatoires simultanées
8.1 8.2 8.3 8.4
Étude d’un couple de variables aléatoires discrètes Étude d’un couple de variables aléatoires continues Extension à des vecteurs aléatoires Application : loi normale multidimensionnelle
9 (cid:129) Processus aléatoires
Définitions Processus équivalents
Continuités Processus stationnaires Exemples de processus aléatoires
9.1 9.2 9.3 Moments 9.4 9.5 9.6 9.7 Martingale 9.8 Mouvement brownien 9.9 Marche au hasard 9.10 Processus et chaînes de Markov 9.11 Processus ponctuels 9.12 Application aux phénomènes d’attente
C Statistique inférentielle
10 (cid:129) Caractéristiques d’un échantillon.
Application aux échantillons gaussiens
10.1 Introduction 10.2 Définition d’un échantillon aléatoire 10.3 Caractéristiques d’un échantillon aléatoire
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
116 120 124 125
127 127 132 139 141
146 147 148 149 149 150 153 154 156 157 158 166 170
179 179 180 181
V
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page VI — #4
(cid:2)
(cid:2)
10.4 Distribution du chi-deux 10.5 Distribution de Fisher-Snedecor 10.6 Distribution de Student 10.7 Cas particulier des échantillons gaussiens
11 (cid:129) Lois des valeurs extrêmes. Échantillons artificiels
11.1 Échantillons ordonnés et statistique d’ordre (k), réalisation de rang k 11.2 Loi de la variable X 11.3 Loi de la variable X (n), plus grande valeur observée 11.4 Loi de la variable X (1), plus petite valeur observée 11.5 Échantillons artificiels et simulation
12 (cid:129) Théorie de l’estimation
12.1 Exposé du problème et exemples 12.2 Définition d’une statistique 12.3 Statistique exhaustive 12.4 Information de Fisher
185 188 190 192
195 195 198 199 202 203
210 210 212 213 218
13 (cid:129) Estimation ponctuelle
220 220 13.1 Définition d’un estimateur 221 13.2 Principales qualités d’un estimateur 227 13.3 Estimateur sans biais de variance minimale 13.4 Précision intrinsèque d’un estimateur et inégalité de Cramer-Rao 228 229 13.5 Méthode du maximum de vraisemblance (MV) 232 13.6 Extension au cas de plusieurs paramètres
14 (cid:129) Estimation par intervalle de confiance 14.1 Définition d’un intervalle de confiance 14.2 Exemples d’intervalles de confiance 14.3 Estimation et intervalle de confiance dans le cas
d’une population d’effectif fini
15 (cid:129) Les tests statistiques
15.1 Notions générales sur les tests statistiques 15.2 Différentes catégories de tests statistiques
235 235 238
253
255 255 263
VI
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page VII — #5
(cid:2)
(cid:2)
15.3 Test entre deux hypothèses simples et méthode de Neyman
et Pearson
15.4 Tests entre deux hypothèses composites 15.5 Principaux tests paramétriques
16 (cid:129) Tests d’ajustement et de comparaison
16.1 Tests d’ajustement 16.2 Tests de comparaison d’échantillons 16.3 Analyse de la variance à simple entrée
264 267 270
277 277 289 299
17 (cid:129) Tests d’indépendance
306 306 17.1 Variables quantitatives 308 17.2 Variables ordinales et corrélation des rangs 17.3 Concordance de p classements 313 17.4 Liaison entre une variable quantitative et une variable qualitative 314 316 17.5 Liaison entre deux variables qualitatives
18 (cid:129) Fiabilité
18.1 Généralités et principales définitions 18.2 Définition mathématique de la fiabilité 18.3 Taux de défaillance 18.4 Fiabilité d’un matériel usagé 18.5 Fiabilité en cas de remplacement préventif 18.6 Espérance de vie 18.7 Exemples de lois de fiabilité 18.8 Fiabilité d’un système en fonction de celle de ses composants
D Analyse des données
19 (cid:129) Introduction à l’analyse des données 19.1 Échantillon d’une variable aléatoire 19.2 Échantillon d’un couple de variables aléatoires
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
321 321 322 324 326 327 328 328 332
337 338 343
VII
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page VIII — #6
(cid:2)
(cid:2)
19.3 Échantillon de p variables aléatoires 19.4 Présentation des principales méthodes
20 (cid:129) Régression linéaire simple
20.1 Introduction 20.2 Mesures de liaison 20.3 Choix des variables 20.4 Modèle théorique de la régression simple 20.5 Ajustement du modèle de régression linéaire
sur des données expérimentales
20.6 Étude de la régression linéaire (aspects descriptifs)
20.7 Étude de la régression linéaire (aspects inférentiels)
20.8 Étude d’une valeur prévisionnelle 20.9 Conclusions
345 348
352 352 353 354 355
357 359
363
371 375
21 (cid:129) Régression multiple. Modèle linéaire général
376 376 21.1 Introduction 377 21.2 Régression entre variables aléatoires 21.3 Modèle linéaire général 382 21.4 Estimations des paramètres du modèle de régression (Y, Xb, s2 In) 385
21.5 Estimation du paramètre b du modèle linéaire 21.6 Tests dans le modèle linéaire 21.7 Intervalle de prévision 21.8 Corrélations 21.9 Fiabilité de la régression
22 (cid:129) Analyse de la variance
22.1 Généralités et but de la théorie 22.2 Analyse de la variance à double entrée 22.3 Analyse de la variance orthogonale à entrées multiples 22.4 Analyse de la variance emboîtée 22.5 Carré latin
387 387 390 390 393
410 410 411 419 422 427
VIII
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page IX — #7
(cid:2)
(cid:2)
Annexes
Analyse combinatoire
Rappels mathématiques
Tables statistiques
Bibliographie
Index
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
Publicité
(cid:2)
(cid:2)
433
436
442
467
471
IX
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page X — #8
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page XI — #9
(cid:2)
(cid:2)
PRINCIPALES NOTATIONS
N N∗
Ensemble des entiers positifs ou nuls (on dit aussi les entiers naturels). Ensemble des entiers strictement positifs (cet ensemble ne contient pas 0). Ensemble des entiers de signes quelconques. Ensemble Z sauf 0. Ensemble des entiers de signes quelconques.
Z Z∗ R R1 Ensemble des entiers positifs ou nuls. R∗ Ensemble des entiers non nuls.
Cardinal d’un ensemble fini (abréviation card) : L’entier naturel qui indique le nombre de ses éléments.
Cardinal d’un ensemble infini : un nombre appelé aleph. 1[a, b] fonction caractéristique de l’ensemble [a, b] égale à 1 pour les points de cet ensemble et à 0, sinon.
Notation de la fonction exponentielle : ea ou exp a (la deuxième notation est utilisée pour éviter d’écrire un exposant trop long).
Notation de la fonction logarithme : ln désigne le logarithme népérien et log le logarithme à base 10 sauf dans le cas de la loi log-normale. Factorielle n! 5 n(n − 1)(n − 2)...2 3 1. Matrice transposée : La matrice tA transposée de la matrice A est obtenue en permutant lignes et colonnes.
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
XI
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page XII — #10
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 1 — #11
(cid:2)
(cid:2)
A
Statistique descriptive
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 2 — #12
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 3 — #13
(cid:2)
(cid:2)
1 (cid:129) REPRÉSENTATION GRAPHIQUE ET NUMÉRIQUE DES DONNÉES
A
E V I T P I R C S E D E U Q I T S I T A T S
1.1 Généralités et principales définitions
Ce premier chapitre donne les définitions et les propriétés des principales no- tions utiles pour comprendre et traiter un problème de statistique. La statistique descriptive a pour but : – de dégager les propriétés essentielles que l’on peut déduire d’une accumu-
lation de données ;
– de donner une image concise et simplifiée de la réalité.
Le résultat d’une observation, d’une mesure, n’est pas égale à la valeur théo- rique calculée ou espérée par l’ingénieur ; la répétition d’une même mesure, réalisée dans des conditions qui semblent identiques, ne conduit pas tou- jours aux mêmes résultats. Ces fluctuations, dues à des causes nombreuses, connues ou inconnues, contrôlées ou non, créent des difficultés aux ingé- nieurs et aux scientifiques. Quel résultat doivent-ils prendre ? Quel degré de confiance peuvent-ils accorder à la décision prise ? Les réponses à une enquête varient d’un individu à un autre ; quelles conclusions valables peut-on tirer d’un sondage ? Les méthodes de la statistique descriptive apportent des ré- ponses à ces problèmes. Pour être soumis à un traitement statistique, un tableau de données doit com- porter au moins une variable de nature aléatoire. Une définition simple du caractère aléatoire d’une variable est qu’elle peut prendre au hasard des valeurs différentes.
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
3
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 4 — #14
1 • Représentation graphique et numérique des données
1.1 Généralités et principales définitions
1.1.1 Population et individus
Ensemble statistique ou population : réunion des individus sur lesquels on étu- die une ou plusieurs propriétés. Unité statistique : chaque individu. Une population doit être correctement définie afin que l’appartenance d’un individu à cette population soit reconnue sans ambiguïté.
Exemple 1.1
Une usine fabrique des tiges métalliques utilisées dans l’assemblage de certaines structures. Pour étudier la résistance à la traction de ces tiges, on mesure cette résistance pour un lot de 100 tiges. Propriété étudiée : la résistance à la traction de tiges métalliques. Population statistique : l’ensemble des 100 tiges ou des 100 mesures. Unité statistique : chacune des tiges ou chacune des 100 mesures.
1.1.2 Caractères et variables statistiques
Caractères
On s’intéresse à certaines particularités ou caractères des individus d’une popu- lation statistique : – un seul caractère étudié, série numérique à une dimension (paragraphe 1.2), (para- – deux caractères étudiés,
série numérique à deux dimensions
graphe 1.3),
– plus de deux caractères, on doit utiliser les techniques de l’analyse multidi-
mensionnelle (voir chapitres 19 et suivants).
Les caractères étudiés peuvent être : – le poids, la taille, le niveau d’études, la catégorie socioprofessionnelle, le
lieu d’habitation..., dans le secteur des sciences humaines,
– le poids, la masse, la composition..., dans le secteur des sciences techniques.
Modalités
Un caractère peut prendre différentes modalités. Ces modalités doivent être incompatibles et exhaustives afin que l’appartenance ou la non-appartenance
4
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 5 — #15
1 • Représentation graphique et numérique des données
1.1 Généralités et principales définitions
d’un individu à une modalité soit définie sans ambiguïté. Un caractère peut être : – quantitatif, les modalités sont mesurables ou repérables, – qualitatif, les modalités ne sont pas mesurables.
Variables statistiques ou aléatoires
Une variable statistique ou aléatoire est un caractère faisant l’objet d’une étude statistique. Elle peut donc être qualitative ou quantitative. Une variable quantitative est appelée : – discrète si elle prend un nombre fini de valeurs souvent entières, – continue si elle prend toutes les valeurs d’un intervalle fini ou infini.
Remarque En toute rigueur, une variable statistique ne peut jamais être continue, le degré de précision des mesures ou des appareils entraînant toujours des discontinuités dans les résultats.
Une variable statistique ou aléatoire est notée par une lettre majuscule X , Y , et les valeurs qu’elle prend par des lettres minuscules x1, x2..., y1, y2...
1.1.3 Échantillon
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
Échantillon : groupe restreint, ou sous-ensemble, issu de la population. Échantillon aléatoire : les résultats recueillis sur ce sous-ensemble doivent pou- voir être étendus, c’est-à-dire inférés, à la population entière. Pour définir un tel échantillon, une méthode consiste à prélever, au hasard, un sous-ensemble d’individus, en utilisant, par exemple, des tables de nombres au hasard (chapitre 11, paragraphe 11.5).
1.1.4 Fréquences absolues, relatives, cumulées
Dans le cas des variables discrètes, on appelle : – Fréquence absolue ni ou effectif, associée à une valeur xi de la variable aléa- toire X , le nombre d’apparitions de cette variable dans la population ou dans l’échantillon.
A
E V I T P I R C S E D E U Q I T S I T A T S
(cid:2)
(cid:2)
5
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 6 — #16
1 • Représentation graphique et numérique des données
1.1 Généralités et principales définitions
– Fréquence relative, associée à la valeur xi de la variable aléatoire X , le nombre
fi 5
ni n
où ni est la fréquence absolue et n le nombre total de données.
– Fréquence cumulée absolue, associée à une valeur xi de la variable, le nombre
d’individus dont la mesure est inférieure ou égale à xi.
i(cid:2)
Ni 5
nk
k51 On définit la fréquence cumulée relative :
Fi 5
i(cid:2)
k51
fk
Exemple 1.2 Défauts relevés sur une pièce de tissu
Un fabricant de tissu essaie une nouvelle machine ; il compte le nombre de défauts sur 75 échantillons de 10 mètres. Il a trouvé les résultats suivants :
Tableau 1.1 – Nombre de défauts sur une pièce de tissus.
Nombre k de défauts
Nombre nk d’échantillons
0
38
1
15
2
11
3
6
4
3
5
2
Nombre d’individus : les 75 échantillons. Fréquence absolue associée à la valeur k, le nombre nk : par exemple, sur les 75 échantillons examinés, 11 présentent k 5 2 défauts, donc si k 5 2, nk 5 11. Fréquence relative associée à la valeur k : le quotient nk
11/75 5 0,146 est la fréquence relative associée à la valeur k 5 2. Fréquence cumulée absolue associée à la valeur k : le nombre d’échantillons ayant au plus k défauts (k compris). 38 1 15 1 11 5 64 est la fréquence cumulée absolue associée à la valeur k 5 2. Fréquence cumulée relative associée à la valeur k, le nombre d’échantillons ayant au plus k défauts (k compris) divisé par n.
/n.
64/75 5 0,853 est la fréquence cumulée relative associée à la valeur k 5 2.
Les fréquences relatives et les fréquences cumulées relatives peuvent être utili- sées pour comparer deux ou plusieurs populations.
6
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 7 — #17
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
Dans le cas d’une distribution continue, les données sont en général regrou- pées en classes (paragraphe 1.2.1). Les fréquences absolues, relatives et cumu- lées sont définies par rapport aux classes et non par rapport aux valeurs de la variable.
1.2 Séries numériques à une dimension
1.2.1 Représentation graphique des données
En présence d’un ensemble de données associées à un seul caractère, on doit : – ranger ces données par valeurs non décroissantes (ou non croissantes) et
déterminer les fréquences absolues, relatives et cumulées,
– visualiser ces données à l’aide d’un diagramme en bâtons pour des variables
discrètes ou d’un histogramme pour des variables continues.
Rangement des données par valeurs non décroissantes
Variables discrètes
Tableau 1.2 – Données discrètes.
Valeurs de la variable
Fréquences absolues
Fréquences relatives
Fréquences cumulées absolues
xi
Publicité
ni
fi
Ni
Fréquences cumulées relatives
i(cid:2)
Fi 5
fk
k51
Exemple 1.3 Défauts relevés sur une pièce de tissu (suite)
On complète le tableau 1.1 en calculant les fréquences relatives fi, toutes les fré- quences absolues cumulées Ni et les fréquences relatives cumulées Fi.
Tableau 1.3 – Étude statistique du nombre de défauts sur une pièce de tissu.
A
E V I T P I R C S E D E U Q I T S I T A T S
Nombre de défauts
0
1
2
3
4
5
ni
38
15
11
6
3
2
fi
Ni
0,506
38
Fi
0,506
0,20
53 5 38 1 15
0,706
0,146
64 5 53 1 11
0,853
0,08
0,04
70 5 64 1 6
73 5 70 1 3
0,933
0,973
0,026
75 5 73 1 2
1
7
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 8 — #18
1 • Représentation graphique et numérique des données
Variables continues
1.2 Séries numériques à une dimension
Les données sont regroupées en k classes. Une classe est définie par ses extrémités ei−1, ei et son effectif ni.
Effectif d’une classe ou fréquence absolue
Le nombre ni de valeurs de la variable X telles que : ei−1 (cid:2) X < ei.
Amplitude d’une classe
La quantité ei − ei−1.
Fréquence cumulée relative
Fi 5
i(cid:2)
k51
fk
avec F1 5 f1. Elle donne la proportion des individus tels que X < ei.
Tableau 1.4 – Données continues.
Classes ei−1 (cid:2) X < ei
Effectifs
Fréquences absolues
Fréquences cumulées
ni
fi
Ni
Exemple 1.4 Essais de fiabilité de dispositifs électroniques
100 dispositifs identiques ont été soumis à un test de fiabilité ; on a noté la durée de vie, en heures, jusqu’à défaillance (fin de l’aptitude du dispositif à remplir la fonction requise).
Tableau 1.5 – Durée de vie de 100 dispositifs identiques.
Durée de vie (en heures)
0 (cid:2) X < 150 150 (cid:2) X < 300 300 (cid:2) X < 450 450 (cid:2) X < 600 600 (cid:2) X < 750 750 (cid:2) X < 900 900 (cid:2) X < 1 050 1 050 (cid:2) X < 1 200 1 200 (cid:2) X < 1 350
Nombre ni de dispositifs (fréquence absolue) 30 15 12 10 8 8 8 6 3
Fréquence relative fi
Fréquence cumulée absolue
Fréquence cumulée relative Fi
0,30 0,15 0,12 0,10 0,08 0,08 0,08 0,06 0,03
30 45 57 67 75 83 91 97 100
0,30 0,45 0,57 0,67 0,75 0,83 0,91 0,97 1
La variable statistique « durée de vie des dispositifs » est une variable continue.
8
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 9 — #19
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
Les classes peuvent être d’égale amplitude ou non ; on choisit, soit le nombre de classes, soit l’amplitude des classes. Dans l’exemple 1.4, les classes sont d’égale amplitude (150 heures). Le nombre de classes ne doit pas être trop petit, perte d’informations, ni trop grand, le regroupement en classes est alors inutile et de plus, certaines classes pourraient avoir des effectifs trop faibles. En général, le nombre de classes est compris entre 5 et 20 ; il dépend du nombre n d’observations et de l’étalement des données. La formule de Sturges donne une valeur approximative du nombre k de classes :
∼ 5 1 1 3,222 log10 n
k
d’où le nombre de classes selon les valeurs de n (tableau 1.6).
Tableau 1.6 – Effectif n de l’échantillon et nombre k de classes.
n (cid:2) 10 10 < n
< 35 5
4
35 (cid:2) n < 70 6
70 (cid:2) n < 90 7
90 (cid:2) n < 150 8
150 (cid:2) n < 300 9
300 (cid:2) n < 620 10
620 (cid:2) n < 1 300 11
La première ligne donne l’effectif de l’échantillon étudié et la deuxième ligne, le nombre correspondant k de classes.
Amplitude des classes
Elle est égale à E/k où E 5 xmax−xmin est l’étendue de la série des observations (si les classes sont d’égale amplitude). Si au contraire, on commence par définir l’amplitude des classes, on ne doit pas choisir cette amplitude trop faible, le nombre de classes est alors trop élevé ni trop grande, le nombre de classes est alors trop petit par rapport à celui que donne la formule de Sturges. Les valeurs d’une classe sont assimilées à la valeur centrale ou centre de la classe égale à : ei−1 1 ei 2 Le regroupement en classes fait perdre aux individus leur caractère propre ainsi que les détails fins des distributions.
Exemple 1.5 Essais de fiabilité de dispositifs électroniques (suite)
30 dispositifs ont une durée de vie comprise entre 0 et 150 heures, on admet que ces 30 dispositifs ont tous une durée de vie égale à 75 heures.
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
A
E V I T P I R C S E D E U Q I T S I T A T S
(cid:2)
(cid:2)
9
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 10 — #20
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
De même, 10 dispositifs ont une durée de vie comprise entre 450 et 600 heures que l’on prend égale à 525 heures.
Le diagramme en feuilles
On décompose une donnée numérique en deux parties : – la tige qui comprend le premier ou les deux premiers chiffres, – la feuille qui comprend les autres chiffres. On écrit les tiges les unes sous les autres et en regard de chaque tige, les feuilles correspondantes ; tiges et feuilles sont séparées par un trait vertical.
Exemple 1.6 Exemple de diagramme en feuilles
Le tableau 1.7 donne le poids en grammes de 25 éprouvettes.
Tableau 1.7 – Poids de 25 éprouvettes.
250 271 284
253 272 285
256 273 286
258 274 287
260 276 288
261 276 290
263 279 290
265 279
270 281
Comme tige, on choisit les deux premiers chiffres de chaque mesure, c’est-à-dire 25, 26, 27, 28 et 29. Les feuilles sont alors constituées du dernier chiffre de la mesure :
25 26 27 28 29
0 0 0 1 0
3 1 1 4 0
6 3 2 5
8 5 3 6
6
9
9
4 7
6 8
Le diagramme indique que le poids moyen se situe entre 270 et 280 g et qu’il doit être voisin de 270 g.
Les différents modes de représentation graphique des données
Les représentations graphiques permettent d’avoir rapidement une vue d’en- semble d’un tableau de données.
Variables discrètes : diagramme en bâtons
En abscisses, on porte les différentes valeurs xi prises par la variable X . Puis, on trace un bâton dont la longueur est proportionnelle à ni ou à fi ; dans le deuxième cas, on peut éventuellement comparer deux séries de données.
10
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
A
E V I T P I R C S E D E U Q I T S I T A T S
“doc” — 2006/8/9 — 11:52 — page 11 — #21
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
Exemple 1.7 Classement de 100 familles en fonction du nombre d’enfants
On a relevé le nombre d’enfants de 100 familles choisies au hasard. Le tableau 1.8 donne les principales caractéristiques de cette étude.
Tableau 1.8 – Statistique sur le nombre d’enfants de 100 familles.
xi ni fi Fi
0
20
0,20
0,20
1
25
0,25
0,45
2
30
0,30
0,75
3
10
0,10
0,85
4
5
5
5
6
3
7
2
Total
100
0,05
0,90
0,05
0,95
0,03
0,98
Publicité
0,02
1
1
xi nombre d’enfants compris entre 0 et 7. ni nombre de familles ayant xi enfants. fi fréquence relative des familles ayant xi enfants. Fi fréquence cumulée des familles ayant au plus xi enfants.
0,3
0,2
0,1
0
0
1
2
3
4
5
6
7
Figure 1.1 – Diagramme en bâtons de la distribution de l’exemple 1.7.
Variables continues ou réparties en classes
Histogramme et propriétés
Un histogramme est constitué de rectangles juxtaposés dont la base corres- pond à l’amplitude de chaque classe et dont la surface est proportionnelle à la fréquence absolue ou relative de cette classe. L’histogramme est un outil statistique facile à utiliser, donnant rapidement une image du comportement d’un procédé industriel et l’allure globale de la
11
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 12 — #22
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
distribution ; il montre l’étalement des données et apporte ainsi des rensei- gnements sur la dispersion et sur les valeurs extrêmes ; il permet de déceler, éventuellement, des valeurs aberrantes.
Polygone de fréquences
Il permet de représenter sous forme de courbe, la distribution des fréquences absolues ou relatives. Il est obtenu en joignant, par des segments de droite, les milieux des côtés supérieurs de chaque rectangle de l’histogramme. Pour fermer ce polygone, on ajoute à chaque extrémité une classe de fréquence nulle.
Exemple 1.8 Étude de la dispersion d’un lot de 400 résistances On a contrôlé 400 résistances dont la valeur nominale est égale à 100 kV et on a regroupé les résultats en classes d’amplitude 2 kV qui représente environ le dixième de la dispersion totale de l’échantillon contrôlé.
Tableau 1.9 – Étude statistique des mesures de la résistance d’un lot de 400 pièces.
Classe
Limites des classes
I
II
III
IV
V
VI
VII
VIII
IX
X
[92, 94[
[94, 96[
[96, 98[
[98, 100[
[100, 102[
[102, 104[
[104, 106[
[106, 108[
[108, 110[
[110, 112[
ni
10
15
40
60
90
70
50
35
20
10
Ni
10
25
65
125
215
285
335
370
390
400
fi
Fi
0,025
0,0375
0,10
0,15
0,225
0,175
0,125
0,0875
0,05
0,025
0,025
0,0625
0,1625
0,3125
0,5375
0,7125
0,8375
0,925
0,975
1
Les classes étant toutes de même amplitude, l’histogramme est facile à tracer ; il suffit de construire des rectangles dont l’aire est proportionnelle à la fréquence des résistances de la classe correspondante.
Courbes de fréquences cumulées
Courbe cumulative croissante : on joint les points ayant pour abscisses la limite supérieure des classes et pour ordonnées les fréquences cumulées croissantes
12
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 13 — #23
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
(cid:2)
(cid:2)
100
90
80
70
60
50
40
30
20
10
1
0 90 92 94 96 98 100 102 104 106 108 110 112 114
Figure 1.2 – Histogramme de la distribution de l’exemple 1.8 et polygone de fréquence.
correspondant à la classe considérée (pour le premier point, on porte la va- leur 0). Elle donne le nombre d’observations inférieures à une valeur quel- conque de la série. Courbe cumulative décroissante : la construction de cette courbe est analogue à la précédente. Les points ont pour abscisses, les limites inférieures des classes et pour ordonnées, les fréquences cumulées décroissantes (pour le dernier point, la valeur est 0). Elle donne le nombre d’observations supérieures à une valeur quelconque de la série.
1
0
1
92 94 96 98 100 102 104 106 108 110 112
Figure 1.3 – Courbe cumulative croissante (trait plein) et courbe cumulative décroissante (trait pointillé) de la distribution de l’exemple 1.8.
A
E V I T P I R C S E D E U Q I T S I T A T S
13
(cid:2)
(cid:2)
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 14 — #24
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
Autres modes de représentations graphiques
On définit des diagrammes à secteurs circulaires et des diagrammes à rectangles horizontaux. Le diagramme à secteurs circulaires consiste en un cercle découpé en secteurs circulaires ; l’aire de chaque secteur, représentant la proportion des différentes composantes d’un tout, est proportionnelle aux fréquences, relatives ou abso- lues. Le diagramme à rectangles horizontaux est défini de façon analogue. Un autre mode de représentation est la boîte à moustaches ou box-plot (voir paragraphe 1.2.2, Quantiles).
1.2.2 Représentation numérique des données
Une série de données peut être résumée par quelques valeurs numériques ap- pelées caractéristiques des séries statistiques, classées en quatre grandes catégo- ries : – les caractéristiques de tendance centrale, – les caractéristiques de dispersion, – les caractéristiques de forme, – les caractéristiques de concentration.
Caractéristiques de tendance centrale
Elles donnent une idée de l’ordre de grandeur des valeurs constituant la série ainsi que la position où semblent se concentrer les valeurs de cette série. Les principales caractéristiques de tendance centrale sont la moyenne arithmétique, la médiane, la médiale, le mode et les quantiles.
Moyenne arithmétique
Définition et calcul
Pour calculer la moyenne arithmétique, deux cas sont à distinguer selon la façon dont les données ont été recueillies. Cas 1 : n données non réparties en classes : n(cid:2)
1 n
x 5
14
(cid:2)
(cid:2)
xi
i51
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 15 — #25
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
(cid:2)
(cid:2)
Cas 2 : n données réparties en k classes, la classe i étant d’effectif absolu ni et d’effectif relatif fi :
x 5
1 n
k(cid:2)
k(cid:2)
nixi 5
fixi
i51
i51
Changement d’origine et changement d’échelle On pose pour toutes les données, yi 5 axi 1 b, a et b étant des constantes ; on obtient :
y 5 a x 1 b
Propriétés – La moyenne arithmétique permet de résumer par un seul nombre la série
statistique.
– Elle prend en compte toutes les valeurs de la série et elle est facile à calculer. – Elle est sensible aux valeurs extrêmes, il est parfois nécessaire de supprimer
des valeurs extrêmes ou « aberrantes ».
La quantité ei 5 xi − x est l’écart de la valeur xi à la moyenne arithmétique. La moyenne arithmétique des écarts ei est nulle.
Médiane Me
Définition et calcul
La médiane est plutôt une moyenne de position. La médiane est la valeur, observée ou possible, dans la série des données classées par ordre croissant (ou décroissant) qui partage cette série en deux parties comprenant exactement le même nombre de données de part et d’autre de M e. Comme pour la moyenne arithmétique, on distingue deux cas. Cas 1 : n données non réparties en classes : – pour une série ayant un nombre impair de données, la médiane est une
valeur observée de la série ;
– pour une série ayant un nombre pair de données, on peut prendre pour valeur médiane, indifféremment l’une ou l’autre des valeurs centrales ou n’importe quelle valeur intermédiaire entre ces deux valeurs, par exemple, la moyenne arithmétique de ces deux valeurs, mais, dans ces conditions, ce n’est pas une valeur observée.
t i l é d
n u
t s e
e é s i r o t u a
n o n e i p o c o t o h p
a L – d o n u D c(cid:2)
A
E V I T P I R C S E D E U Q I T S I T A T S
(cid:2)
(cid:2)
15
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
(cid:2)
“doc” — 2006/8/9 — 11:52 — page 16 — #26
1 • Représentation graphique et numérique des données
1.2 Séries numériques à une dimension
Cas 2 : n données réparties en k classes. La médiane est obtenue : – soit par interpolation linéaire à l’intérieur de la classe centrale, si le nombre
de classes est impair,
– soit en prenant la moyenne des deux classes « centrales », si le nombre de
classes est pair.
Pour faire ce calcul, on suppose implicitement que la distribution est uniforme à l’intérieur de chaque classe.
Propriétés – Le calcul de la médiane est rapide. – La médiane n’est pas influencée par les valeurs extrêmes ou aberrantes. – La médiane est influencée par le nombre des données mais non par leurs
valeurs, elle ne peut donc pas être utilisée en théorie de l’estimation.
– Si la variable statistique est discrète, la médiane peut ne pas exister ; e