Statistique et Probabilités pour l’Ingénieur

Pearson
Page 1 sur 488Lecteur de document UniversityLib

Statistique et Probabilités pour l’Ingénieur

Statistics and Probability for Engineers · textbook

Voir tous les documents en mathématiques

R

.

V E Y S S E Y R E

P O U R

L ’ I

N G É N I E U R

E T

P R O B A B I L I T É S

S T A T I S T I Q U E

AIDE-MÉMOIRE DE L’INGÉNIEUR

2e édition

RENEE VEYSSEYRE

est agrégée de mathématiques et professeur honoraire à l’École centrale de Paris.

Renée Veysseyre

STATISTIQUE ET PROBABILITÉS POUR L’INGÉNIEUR

Cet aide-mémoire rassemble toutes les définitions, lois et formules du calcul des probabilités et de la statistique utiles à l’ingénieur en activité aussi bien qu’à l’étudiant en formation. • La première partie donne les principales définitions, et propose un résumé de tous les résultats que l’on peut obtenir à partir d’un tableau de données. • La deuxième partie donne le vocabulaire du calcul des probabilités et étudie les principales lois discrètes et continues.

• La troisième partie traite des problèmes rencontrés par l’ingénieur dans le domaine de la décision : échantillonnage, estimation et tests d’hypothèse, tests de comparaison, tests d’ajustement, régression. • La quatrième partie propose un résumé de l’analyse

des données.

Cette nouvelle édition a été augmentée d’un chapitre sur la régression multiple.

ISBN 2 10 049994 7

www.dunod.com

2e édition

lims Page I Jeudi, 10. août 2006 11:21 11

Renée Veysseyre

Aide-mémoire Statistique et pour l’ingénieur

probabilités

e 2

édition

lims Page II Jeudi, 10. août 2006 11:21 11

© Dunod, Paris, 2001, 2006 ISBN 2 10 049994 7

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page III — #1

(cid:2)

(cid:2)

TABLE DES MATIÈRES

Principales notations

A Statistique descriptive

1 (cid:129) Représentation graphique et numérique des données

1.1 1.2 1.3

Généralités et principales définitions Séries numériques à une dimension Séries numériques à deux dimensions

B Calcul des probabilités

2 (cid:129) Le modèle probabiliste Introduction Les concepts probabilistes

2.1 2.2 2.3 Mesure de probabilité et espace probabilisé 2.4

Échantillons et sous-populations

3 (cid:129) Probabilité conditionnelle. Indépendance

3.1 3.2 3.3

Définition Principe des probabilités composées Événements indépendants

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

XI

3 3 7 26

33 33 35 40 41

42 42 44 44

III

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page IV — #2

(cid:2)

(cid:2)

3.4 3.5

Indépendance deux à deux et indépendance mutuelle Théorème de Bayes

4 (cid:129) Variables aléatoires réelles

4.1 4.2 4.3 4.4 4.5

Généralités sur les variables aléatoires Fonction de répartition Densité de probabilité Discontinuités d’une fonction de répartition et lois discrètes Loi de probabilité d’une variable aléatoire Y fonction d’une variable aléatoire X Indépendance de deux variables aléatoires

4.6 4.7 Moments d’une variable aléatoire

5 (cid:129) Lois de probabilité discrètes

5.1 5.2 5.3 5.4 5.5 5.6 5.7 5.8 5.9

Définition d’une variable discrète Loi de Dirac Loi uniforme Loi binomiale ou loi des tirages avec remise Loi multinomiale Loi hypergéométrique ou loi du tirage exhaustif Loi de Poisson Lois limites Résumé

6 (cid:129) Lois de probabilité continues

6.1 6.2 6.3 6.4 6.5 6.6 6.7

Généralités Loi uniforme Loi exponentielle Loi gamma Lois bêta de types I et II Loi de Laplace-Gauss ou loi normale Loi log-normale

7 (cid:129) Convolution. Fonctions caractéristiques.

Convergences stochastiques 7.1

Convolution

45 46

49 49 52 54 56

57 58 59

67 67 69 70 71 77 80 83 84 87

89 89 90 92 95 97 100 109

112 112

IV

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page V — #3

(cid:2)

(cid:2)

7.2 7.3 7.4 7.5

Fonction caractéristique Convergence des suites de variables aléatoires Lois des grands nombres Théorème central limite

8 (cid:129) Variables aléatoires simultanées

8.1 8.2 8.3 8.4

Étude d’un couple de variables aléatoires discrètes Étude d’un couple de variables aléatoires continues Extension à des vecteurs aléatoires Application : loi normale multidimensionnelle

9 (cid:129) Processus aléatoires

Définitions Processus équivalents

Continuités Processus stationnaires Exemples de processus aléatoires

9.1 9.2 9.3 Moments 9.4 9.5 9.6 9.7 Martingale 9.8 Mouvement brownien 9.9 Marche au hasard 9.10 Processus et chaînes de Markov 9.11 Processus ponctuels 9.12 Application aux phénomènes d’attente

C Statistique inférentielle

10 (cid:129) Caractéristiques d’un échantillon.

Application aux échantillons gaussiens

10.1 Introduction 10.2 Définition d’un échantillon aléatoire 10.3 Caractéristiques d’un échantillon aléatoire

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

116 120 124 125

127 127 132 139 141

146 147 148 149 149 150 153 154 156 157 158 166 170

179 179 180 181

V

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page VI — #4

(cid:2)

(cid:2)

10.4 Distribution du chi-deux 10.5 Distribution de Fisher-Snedecor 10.6 Distribution de Student 10.7 Cas particulier des échantillons gaussiens

11 (cid:129) Lois des valeurs extrêmes. Échantillons artificiels

11.1 Échantillons ordonnés et statistique d’ordre (k), réalisation de rang k 11.2 Loi de la variable X 11.3 Loi de la variable X (n), plus grande valeur observée 11.4 Loi de la variable X (1), plus petite valeur observée 11.5 Échantillons artificiels et simulation

12 (cid:129) Théorie de l’estimation

12.1 Exposé du problème et exemples 12.2 Définition d’une statistique 12.3 Statistique exhaustive 12.4 Information de Fisher

185 188 190 192

195 195 198 199 202 203

210 210 212 213 218

13 (cid:129) Estimation ponctuelle

220 220 13.1 Définition d’un estimateur 221 13.2 Principales qualités d’un estimateur 227 13.3 Estimateur sans biais de variance minimale 13.4 Précision intrinsèque d’un estimateur et inégalité de Cramer-Rao 228 229 13.5 Méthode du maximum de vraisemblance (MV) 232 13.6 Extension au cas de plusieurs paramètres

14 (cid:129) Estimation par intervalle de confiance 14.1 Définition d’un intervalle de confiance 14.2 Exemples d’intervalles de confiance 14.3 Estimation et intervalle de confiance dans le cas

d’une population d’effectif fini

15 (cid:129) Les tests statistiques

15.1 Notions générales sur les tests statistiques 15.2 Différentes catégories de tests statistiques

235 235 238

253

255 255 263

VI

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page VII — #5

(cid:2)

(cid:2)

15.3 Test entre deux hypothèses simples et méthode de Neyman

et Pearson

15.4 Tests entre deux hypothèses composites 15.5 Principaux tests paramétriques

16 (cid:129) Tests d’ajustement et de comparaison

16.1 Tests d’ajustement 16.2 Tests de comparaison d’échantillons 16.3 Analyse de la variance à simple entrée

264 267 270

277 277 289 299

17 (cid:129) Tests d’indépendance

306 306 17.1 Variables quantitatives 308 17.2 Variables ordinales et corrélation des rangs 17.3 Concordance de p classements 313 17.4 Liaison entre une variable quantitative et une variable qualitative 314 316 17.5 Liaison entre deux variables qualitatives

18 (cid:129) Fiabilité

18.1 Généralités et principales définitions 18.2 Définition mathématique de la fiabilité 18.3 Taux de défaillance 18.4 Fiabilité d’un matériel usagé 18.5 Fiabilité en cas de remplacement préventif 18.6 Espérance de vie 18.7 Exemples de lois de fiabilité 18.8 Fiabilité d’un système en fonction de celle de ses composants

D Analyse des données

19 (cid:129) Introduction à l’analyse des données 19.1 Échantillon d’une variable aléatoire 19.2 Échantillon d’un couple de variables aléatoires

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

321 321 322 324 326 327 328 328 332

337 338 343

VII

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page VIII — #6

(cid:2)

(cid:2)

19.3 Échantillon de p variables aléatoires 19.4 Présentation des principales méthodes

20 (cid:129) Régression linéaire simple

20.1 Introduction 20.2 Mesures de liaison 20.3 Choix des variables 20.4 Modèle théorique de la régression simple 20.5 Ajustement du modèle de régression linéaire

sur des données expérimentales

20.6 Étude de la régression linéaire (aspects descriptifs)

20.7 Étude de la régression linéaire (aspects inférentiels)

20.8 Étude d’une valeur prévisionnelle 20.9 Conclusions

345 348

352 352 353 354 355

357 359

363

371 375

21 (cid:129) Régression multiple. Modèle linéaire général

376 376 21.1 Introduction 377 21.2 Régression entre variables aléatoires 21.3 Modèle linéaire général 382 21.4 Estimations des paramètres du modèle de régression (Y, Xb, s2 In) 385

21.5 Estimation du paramètre b du modèle linéaire 21.6 Tests dans le modèle linéaire 21.7 Intervalle de prévision 21.8 Corrélations 21.9 Fiabilité de la régression

22 (cid:129) Analyse de la variance

22.1 Généralités et but de la théorie 22.2 Analyse de la variance à double entrée 22.3 Analyse de la variance orthogonale à entrées multiples 22.4 Analyse de la variance emboîtée 22.5 Carré latin

387 387 390 390 393

410 410 411 419 422 427

VIII

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page IX — #7

(cid:2)

(cid:2)

Annexes

Analyse combinatoire

Rappels mathématiques

Tables statistiques

Bibliographie

Index

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

Publicité

(cid:2)

(cid:2)

433

436

442

467

471

IX

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page X — #8

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page XI — #9

(cid:2)

(cid:2)

PRINCIPALES NOTATIONS

N N∗

Ensemble des entiers positifs ou nuls (on dit aussi les entiers naturels). Ensemble des entiers strictement positifs (cet ensemble ne contient pas 0). Ensemble des entiers de signes quelconques. Ensemble Z sauf 0. Ensemble des entiers de signes quelconques.

Z Z∗ R R1 Ensemble des entiers positifs ou nuls. R∗ Ensemble des entiers non nuls.

Cardinal d’un ensemble fini (abréviation card) : L’entier naturel qui indique le nombre de ses éléments.

Cardinal d’un ensemble infini : un nombre appelé aleph. 1[a, b] fonction caractéristique de l’ensemble [a, b] égale à 1 pour les points de cet ensemble et à 0, sinon.

Notation de la fonction exponentielle : ea ou exp a (la deuxième notation est utilisée pour éviter d’écrire un exposant trop long).

Notation de la fonction logarithme : ln désigne le logarithme népérien et log le logarithme à base 10 sauf dans le cas de la loi log-normale. Factorielle n! 5 n(n − 1)(n − 2)...2 3 1. Matrice transposée : La matrice tA transposée de la matrice A est obtenue en permutant lignes et colonnes.

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

XI

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page XII — #10

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 1 — #11

(cid:2)

(cid:2)

A

Statistique descriptive

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 2 — #12

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 3 — #13

(cid:2)

(cid:2)

1 (cid:129) REPRÉSENTATION GRAPHIQUE ET NUMÉRIQUE DES DONNÉES

A

E V I T P I R C S E D E U Q I T S I T A T S

1.1 Généralités et principales définitions

Ce premier chapitre donne les définitions et les propriétés des principales no- tions utiles pour comprendre et traiter un problème de statistique. La statistique descriptive a pour but : – de dégager les propriétés essentielles que l’on peut déduire d’une accumu-

lation de données ;

– de donner une image concise et simplifiée de la réalité.

Le résultat d’une observation, d’une mesure, n’est pas égale à la valeur théo- rique calculée ou espérée par l’ingénieur ; la répétition d’une même mesure, réalisée dans des conditions qui semblent identiques, ne conduit pas tou- jours aux mêmes résultats. Ces fluctuations, dues à des causes nombreuses, connues ou inconnues, contrôlées ou non, créent des difficultés aux ingé- nieurs et aux scientifiques. Quel résultat doivent-ils prendre ? Quel degré de confiance peuvent-ils accorder à la décision prise ? Les réponses à une enquête varient d’un individu à un autre ; quelles conclusions valables peut-on tirer d’un sondage ? Les méthodes de la statistique descriptive apportent des ré- ponses à ces problèmes. Pour être soumis à un traitement statistique, un tableau de données doit com- porter au moins une variable de nature aléatoire. Une définition simple du caractère aléatoire d’une variable est qu’elle peut prendre au hasard des valeurs différentes.

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

3

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 4 — #14

1 • Représentation graphique et numérique des données

1.1 Généralités et principales définitions

1.1.1 Population et individus

Ensemble statistique ou population : réunion des individus sur lesquels on étu- die une ou plusieurs propriétés. Unité statistique : chaque individu. Une population doit être correctement définie afin que l’appartenance d’un individu à cette population soit reconnue sans ambiguïté.

Exemple 1.1

Une usine fabrique des tiges métalliques utilisées dans l’assemblage de certaines structures. Pour étudier la résistance à la traction de ces tiges, on mesure cette résistance pour un lot de 100 tiges. Propriété étudiée : la résistance à la traction de tiges métalliques. Population statistique : l’ensemble des 100 tiges ou des 100 mesures. Unité statistique : chacune des tiges ou chacune des 100 mesures.

1.1.2 Caractères et variables statistiques

Caractères

On s’intéresse à certaines particularités ou caractères des individus d’une popu- lation statistique : – un seul caractère étudié, série numérique à une dimension (paragraphe 1.2), (para- – deux caractères étudiés,

série numérique à deux dimensions

graphe 1.3),

– plus de deux caractères, on doit utiliser les techniques de l’analyse multidi-

mensionnelle (voir chapitres 19 et suivants).

Les caractères étudiés peuvent être : – le poids, la taille, le niveau d’études, la catégorie socioprofessionnelle, le

lieu d’habitation..., dans le secteur des sciences humaines,

– le poids, la masse, la composition..., dans le secteur des sciences techniques.

Modalités

Un caractère peut prendre différentes modalités. Ces modalités doivent être incompatibles et exhaustives afin que l’appartenance ou la non-appartenance

4

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 5 — #15

1 • Représentation graphique et numérique des données

1.1 Généralités et principales définitions

d’un individu à une modalité soit définie sans ambiguïté. Un caractère peut être : – quantitatif, les modalités sont mesurables ou repérables, – qualitatif, les modalités ne sont pas mesurables.

Variables statistiques ou aléatoires

Une variable statistique ou aléatoire est un caractère faisant l’objet d’une étude statistique. Elle peut donc être qualitative ou quantitative. Une variable quantitative est appelée : – discrète si elle prend un nombre fini de valeurs souvent entières, – continue si elle prend toutes les valeurs d’un intervalle fini ou infini.

Remarque En toute rigueur, une variable statistique ne peut jamais être continue, le degré de précision des mesures ou des appareils entraînant toujours des discontinuités dans les résultats.

Une variable statistique ou aléatoire est notée par une lettre majuscule X , Y , et les valeurs qu’elle prend par des lettres minuscules x1, x2..., y1, y2...

1.1.3 Échantillon

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

Échantillon : groupe restreint, ou sous-ensemble, issu de la population. Échantillon aléatoire : les résultats recueillis sur ce sous-ensemble doivent pou- voir être étendus, c’est-à-dire inférés, à la population entière. Pour définir un tel échantillon, une méthode consiste à prélever, au hasard, un sous-ensemble d’individus, en utilisant, par exemple, des tables de nombres au hasard (chapitre 11, paragraphe 11.5).

1.1.4 Fréquences absolues, relatives, cumulées

Dans le cas des variables discrètes, on appelle : – Fréquence absolue ni ou effectif, associée à une valeur xi de la variable aléa- toire X , le nombre d’apparitions de cette variable dans la population ou dans l’échantillon.

A

E V I T P I R C S E D E U Q I T S I T A T S

(cid:2)

(cid:2)

5

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 6 — #16

1 • Représentation graphique et numérique des données

1.1 Généralités et principales définitions

– Fréquence relative, associée à la valeur xi de la variable aléatoire X , le nombre

fi 5

ni n

où ni est la fréquence absolue et n le nombre total de données.

– Fréquence cumulée absolue, associée à une valeur xi de la variable, le nombre

d’individus dont la mesure est inférieure ou égale à xi.

i(cid:2)

Ni 5

nk

k51 On définit la fréquence cumulée relative :

Fi 5

i(cid:2)

k51

fk

Exemple 1.2 Défauts relevés sur une pièce de tissu

Un fabricant de tissu essaie une nouvelle machine ; il compte le nombre de défauts sur 75 échantillons de 10 mètres. Il a trouvé les résultats suivants :

Tableau 1.1 – Nombre de défauts sur une pièce de tissus.

Nombre k de défauts

Nombre nk d’échantillons

0

38

1

15

2

11

3

6

4

3

5

2

Nombre d’individus : les 75 échantillons. Fréquence absolue associée à la valeur k, le nombre nk : par exemple, sur les 75 échantillons examinés, 11 présentent k 5 2 défauts, donc si k 5 2, nk 5 11. Fréquence relative associée à la valeur k : le quotient nk

11/75 5 0,146 est la fréquence relative associée à la valeur k 5 2. Fréquence cumulée absolue associée à la valeur k : le nombre d’échantillons ayant au plus k défauts (k compris). 38 1 15 1 11 5 64 est la fréquence cumulée absolue associée à la valeur k 5 2. Fréquence cumulée relative associée à la valeur k, le nombre d’échantillons ayant au plus k défauts (k compris) divisé par n.

/n.

64/75 5 0,853 est la fréquence cumulée relative associée à la valeur k 5 2.

Les fréquences relatives et les fréquences cumulées relatives peuvent être utili- sées pour comparer deux ou plusieurs populations.

6

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 7 — #17

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

Dans le cas d’une distribution continue, les données sont en général regrou- pées en classes (paragraphe 1.2.1). Les fréquences absolues, relatives et cumu- lées sont définies par rapport aux classes et non par rapport aux valeurs de la variable.

1.2 Séries numériques à une dimension

1.2.1 Représentation graphique des données

En présence d’un ensemble de données associées à un seul caractère, on doit : – ranger ces données par valeurs non décroissantes (ou non croissantes) et

déterminer les fréquences absolues, relatives et cumulées,

– visualiser ces données à l’aide d’un diagramme en bâtons pour des variables

discrètes ou d’un histogramme pour des variables continues.

Rangement des données par valeurs non décroissantes

Variables discrètes

Tableau 1.2 – Données discrètes.

Valeurs de la variable

Fréquences absolues

Fréquences relatives

Fréquences cumulées absolues

xi

Publicité

ni

fi

Ni

Fréquences cumulées relatives

i(cid:2)

Fi 5

fk

k51

Exemple 1.3 Défauts relevés sur une pièce de tissu (suite)

On complète le tableau 1.1 en calculant les fréquences relatives fi, toutes les fré- quences absolues cumulées Ni et les fréquences relatives cumulées Fi.

Tableau 1.3 – Étude statistique du nombre de défauts sur une pièce de tissu.

A

E V I T P I R C S E D E U Q I T S I T A T S

Nombre de défauts

0

1

2

3

4

5

ni

38

15

11

6

3

2

fi

Ni

0,506

38

Fi

0,506

0,20

53 5 38 1 15

0,706

0,146

64 5 53 1 11

0,853

0,08

0,04

70 5 64 1 6

73 5 70 1 3

0,933

0,973

0,026

75 5 73 1 2

1

7

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 8 — #18

1 • Représentation graphique et numérique des données

Variables continues

1.2 Séries numériques à une dimension

Les données sont regroupées en k classes. Une classe est définie par ses extrémités ei−1, ei et son effectif ni.

Effectif d’une classe ou fréquence absolue

Le nombre ni de valeurs de la variable X telles que : ei−1 (cid:2) X < ei.

Amplitude d’une classe

La quantité ei − ei−1.

Fréquence cumulée relative

Fi 5

i(cid:2)

k51

fk

avec F1 5 f1. Elle donne la proportion des individus tels que X < ei.

Tableau 1.4 – Données continues.

Classes ei−1 (cid:2) X < ei

Effectifs

Fréquences absolues

Fréquences cumulées

ni

fi

Ni

Exemple 1.4 Essais de fiabilité de dispositifs électroniques

100 dispositifs identiques ont été soumis à un test de fiabilité ; on a noté la durée de vie, en heures, jusqu’à défaillance (fin de l’aptitude du dispositif à remplir la fonction requise).

Tableau 1.5 – Durée de vie de 100 dispositifs identiques.

Durée de vie (en heures)

0 (cid:2) X < 150 150 (cid:2) X < 300 300 (cid:2) X < 450 450 (cid:2) X < 600 600 (cid:2) X < 750 750 (cid:2) X < 900 900 (cid:2) X < 1 050 1 050 (cid:2) X < 1 200 1 200 (cid:2) X < 1 350

Nombre ni de dispositifs (fréquence absolue) 30 15 12 10 8 8 8 6 3

Fréquence relative fi

Fréquence cumulée absolue

Fréquence cumulée relative Fi

0,30 0,15 0,12 0,10 0,08 0,08 0,08 0,06 0,03

30 45 57 67 75 83 91 97 100

0,30 0,45 0,57 0,67 0,75 0,83 0,91 0,97 1

La variable statistique « durée de vie des dispositifs » est une variable continue.

8

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 9 — #19

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

Les classes peuvent être d’égale amplitude ou non ; on choisit, soit le nombre de classes, soit l’amplitude des classes. Dans l’exemple 1.4, les classes sont d’égale amplitude (150 heures). Le nombre de classes ne doit pas être trop petit, perte d’informations, ni trop grand, le regroupement en classes est alors inutile et de plus, certaines classes pourraient avoir des effectifs trop faibles. En général, le nombre de classes est compris entre 5 et 20 ; il dépend du nombre n d’observations et de l’étalement des données. La formule de Sturges donne une valeur approximative du nombre k de classes :

∼ 5 1 1 3,222 log10 n

k

d’où le nombre de classes selon les valeurs de n (tableau 1.6).

Tableau 1.6 – Effectif n de l’échantillon et nombre k de classes.

n (cid:2) 10 10 < n

< 35 5

4

35 (cid:2) n < 70 6

70 (cid:2) n < 90 7

90 (cid:2) n < 150 8

150 (cid:2) n < 300 9

300 (cid:2) n < 620 10

620 (cid:2) n < 1 300 11

La première ligne donne l’effectif de l’échantillon étudié et la deuxième ligne, le nombre correspondant k de classes.

Amplitude des classes

Elle est égale à E/k où E 5 xmax−xmin est l’étendue de la série des observations (si les classes sont d’égale amplitude). Si au contraire, on commence par définir l’amplitude des classes, on ne doit pas choisir cette amplitude trop faible, le nombre de classes est alors trop élevé ni trop grande, le nombre de classes est alors trop petit par rapport à celui que donne la formule de Sturges. Les valeurs d’une classe sont assimilées à la valeur centrale ou centre de la classe égale à : ei−1 1 ei 2 Le regroupement en classes fait perdre aux individus leur caractère propre ainsi que les détails fins des distributions.

Exemple 1.5 Essais de fiabilité de dispositifs électroniques (suite)

30 dispositifs ont une durée de vie comprise entre 0 et 150 heures, on admet que ces 30 dispositifs ont tous une durée de vie égale à 75 heures.

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

A

E V I T P I R C S E D E U Q I T S I T A T S

(cid:2)

(cid:2)

9

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 10 — #20

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

De même, 10 dispositifs ont une durée de vie comprise entre 450 et 600 heures que l’on prend égale à 525 heures.

Le diagramme en feuilles

On décompose une donnée numérique en deux parties : – la tige qui comprend le premier ou les deux premiers chiffres, – la feuille qui comprend les autres chiffres. On écrit les tiges les unes sous les autres et en regard de chaque tige, les feuilles correspondantes ; tiges et feuilles sont séparées par un trait vertical.

Exemple 1.6 Exemple de diagramme en feuilles

Le tableau 1.7 donne le poids en grammes de 25 éprouvettes.

Tableau 1.7 – Poids de 25 éprouvettes.

250 271 284

253 272 285

256 273 286

258 274 287

260 276 288

261 276 290

263 279 290

265 279

270 281

Comme tige, on choisit les deux premiers chiffres de chaque mesure, c’est-à-dire 25, 26, 27, 28 et 29. Les feuilles sont alors constituées du dernier chiffre de la mesure :

25 26 27 28 29

0 0 0 1 0

3 1 1 4 0

6 3 2 5

8 5 3 6

6

9

9

4 7

6 8

Le diagramme indique que le poids moyen se situe entre 270 et 280 g et qu’il doit être voisin de 270 g.

Les différents modes de représentation graphique des données

Les représentations graphiques permettent d’avoir rapidement une vue d’en- semble d’un tableau de données.

Variables discrètes : diagramme en bâtons

En abscisses, on porte les différentes valeurs xi prises par la variable X . Puis, on trace un bâton dont la longueur est proportionnelle à ni ou à fi ; dans le deuxième cas, on peut éventuellement comparer deux séries de données.

10

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

A

E V I T P I R C S E D E U Q I T S I T A T S

“doc” — 2006/8/9 — 11:52 — page 11 — #21

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

Exemple 1.7 Classement de 100 familles en fonction du nombre d’enfants

On a relevé le nombre d’enfants de 100 familles choisies au hasard. Le tableau 1.8 donne les principales caractéristiques de cette étude.

Tableau 1.8 – Statistique sur le nombre d’enfants de 100 familles.

xi ni fi Fi

0

20

0,20

0,20

1

25

0,25

0,45

2

30

0,30

0,75

3

10

0,10

0,85

4

5

5

5

6

3

7

2

Total

100

0,05

0,90

0,05

0,95

0,03

0,98

Publicité

0,02

1

1

xi nombre d’enfants compris entre 0 et 7. ni nombre de familles ayant xi enfants. fi fréquence relative des familles ayant xi enfants. Fi fréquence cumulée des familles ayant au plus xi enfants.

0,3

0,2

0,1

0

0

1

2

3

4

5

6

7

Figure 1.1 – Diagramme en bâtons de la distribution de l’exemple 1.7.

Variables continues ou réparties en classes

Histogramme et propriétés

Un histogramme est constitué de rectangles juxtaposés dont la base corres- pond à l’amplitude de chaque classe et dont la surface est proportionnelle à la fréquence absolue ou relative de cette classe. L’histogramme est un outil statistique facile à utiliser, donnant rapidement une image du comportement d’un procédé industriel et l’allure globale de la

11

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 12 — #22

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

distribution ; il montre l’étalement des données et apporte ainsi des rensei- gnements sur la dispersion et sur les valeurs extrêmes ; il permet de déceler, éventuellement, des valeurs aberrantes.

Polygone de fréquences

Il permet de représenter sous forme de courbe, la distribution des fréquences absolues ou relatives. Il est obtenu en joignant, par des segments de droite, les milieux des côtés supérieurs de chaque rectangle de l’histogramme. Pour fermer ce polygone, on ajoute à chaque extrémité une classe de fréquence nulle.

Exemple 1.8 Étude de la dispersion d’un lot de 400 résistances On a contrôlé 400 résistances dont la valeur nominale est égale à 100 kV et on a regroupé les résultats en classes d’amplitude 2 kV qui représente environ le dixième de la dispersion totale de l’échantillon contrôlé.

Tableau 1.9 – Étude statistique des mesures de la résistance d’un lot de 400 pièces.

Classe

Limites des classes

I

II

III

IV

V

VI

VII

VIII

IX

X

[92, 94[

[94, 96[

[96, 98[

[98, 100[

[100, 102[

[102, 104[

[104, 106[

[106, 108[

[108, 110[

[110, 112[

ni

10

15

40

60

90

70

50

35

20

10

Ni

10

25

65

125

215

285

335

370

390

400

fi

Fi

0,025

0,0375

0,10

0,15

0,225

0,175

0,125

0,0875

0,05

0,025

0,025

0,0625

0,1625

0,3125

0,5375

0,7125

0,8375

0,925

0,975

1

Les classes étant toutes de même amplitude, l’histogramme est facile à tracer ; il suffit de construire des rectangles dont l’aire est proportionnelle à la fréquence des résistances de la classe correspondante.

Courbes de fréquences cumulées

Courbe cumulative croissante : on joint les points ayant pour abscisses la limite supérieure des classes et pour ordonnées les fréquences cumulées croissantes

12

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 13 — #23

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

(cid:2)

(cid:2)

100

90

80

70

60

50

40

30

20

10

1

0 90 92 94 96 98 100 102 104 106 108 110 112 114

Figure 1.2 – Histogramme de la distribution de l’exemple 1.8 et polygone de fréquence.

correspondant à la classe considérée (pour le premier point, on porte la va- leur 0). Elle donne le nombre d’observations inférieures à une valeur quel- conque de la série. Courbe cumulative décroissante : la construction de cette courbe est analogue à la précédente. Les points ont pour abscisses, les limites inférieures des classes et pour ordonnées, les fréquences cumulées décroissantes (pour le dernier point, la valeur est 0). Elle donne le nombre d’observations supérieures à une valeur quelconque de la série.

1

0

1

92 94 96 98 100 102 104 106 108 110 112

Figure 1.3 – Courbe cumulative croissante (trait plein) et courbe cumulative décroissante (trait pointillé) de la distribution de l’exemple 1.8.

A

E V I T P I R C S E D E U Q I T S I T A T S

13

(cid:2)

(cid:2)

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 14 — #24

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

Autres modes de représentations graphiques

On définit des diagrammes à secteurs circulaires et des diagrammes à rectangles horizontaux. Le diagramme à secteurs circulaires consiste en un cercle découpé en secteurs circulaires ; l’aire de chaque secteur, représentant la proportion des différentes composantes d’un tout, est proportionnelle aux fréquences, relatives ou abso- lues. Le diagramme à rectangles horizontaux est défini de façon analogue. Un autre mode de représentation est la boîte à moustaches ou box-plot (voir paragraphe 1.2.2, Quantiles).

1.2.2 Représentation numérique des données

Une série de données peut être résumée par quelques valeurs numériques ap- pelées caractéristiques des séries statistiques, classées en quatre grandes catégo- ries : – les caractéristiques de tendance centrale, – les caractéristiques de dispersion, – les caractéristiques de forme, – les caractéristiques de concentration.

Caractéristiques de tendance centrale

Elles donnent une idée de l’ordre de grandeur des valeurs constituant la série ainsi que la position où semblent se concentrer les valeurs de cette série. Les principales caractéristiques de tendance centrale sont la moyenne arithmétique, la médiane, la médiale, le mode et les quantiles.

Moyenne arithmétique

Définition et calcul

Pour calculer la moyenne arithmétique, deux cas sont à distinguer selon la façon dont les données ont été recueillies. Cas 1 : n données non réparties en classes : n(cid:2)

1 n

x 5

14

(cid:2)

(cid:2)

xi

i51

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 15 — #25

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

(cid:2)

(cid:2)

Cas 2 : n données réparties en k classes, la classe i étant d’effectif absolu ni et d’effectif relatif fi :

x 5

1 n

k(cid:2)

k(cid:2)

nixi 5

fixi

i51

i51

Changement d’origine et changement d’échelle On pose pour toutes les données, yi 5 axi 1 b, a et b étant des constantes ; on obtient :

y 5 a x 1 b

Propriétés – La moyenne arithmétique permet de résumer par un seul nombre la série

statistique.

– Elle prend en compte toutes les valeurs de la série et elle est facile à calculer. – Elle est sensible aux valeurs extrêmes, il est parfois nécessaire de supprimer

des valeurs extrêmes ou « aberrantes ».

La quantité ei 5 xi − x est l’écart de la valeur xi à la moyenne arithmétique. La moyenne arithmétique des écarts ei est nulle.

Médiane Me

Définition et calcul

La médiane est plutôt une moyenne de position. La médiane est la valeur, observée ou possible, dans la série des données classées par ordre croissant (ou décroissant) qui partage cette série en deux parties comprenant exactement le même nombre de données de part et d’autre de M e. Comme pour la moyenne arithmétique, on distingue deux cas. Cas 1 : n données non réparties en classes : – pour une série ayant un nombre impair de données, la médiane est une

valeur observée de la série ;

– pour une série ayant un nombre pair de données, on peut prendre pour valeur médiane, indifféremment l’une ou l’autre des valeurs centrales ou n’importe quelle valeur intermédiaire entre ces deux valeurs, par exemple, la moyenne arithmétique de ces deux valeurs, mais, dans ces conditions, ce n’est pas une valeur observée.

t i l é d

n u

t s e

e é s i r o t u a

n o n e i p o c o t o h p

a L – d o n u D c(cid:2)

A

E V I T P I R C S E D E U Q I T S I T A T S

(cid:2)

(cid:2)

15

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

(cid:2)

“doc” — 2006/8/9 — 11:52 — page 16 — #26

1 • Représentation graphique et numérique des données

1.2 Séries numériques à une dimension

Cas 2 : n données réparties en k classes. La médiane est obtenue : – soit par interpolation linéaire à l’intérieur de la classe centrale, si le nombre

de classes est impair,

– soit en prenant la moyenne des deux classes « centrales », si le nombre de

classes est pair.

Pour faire ce calcul, on suppose implicitement que la distribution est uniforme à l’intérieur de chaque classe.

Propriétés – Le calcul de la médiane est rapide. – La médiane n’est pas influencée par les valeurs extrêmes ou aberrantes. – La médiane est influencée par le nombre des données mais non par leurs

valeurs, elle ne peut donc pas être utilisée en théorie de l’estimation.

– Si la variable statistique est discrète, la médiane peut ne pas exister ; e