Chapitre 3.
Échantillonnage et Estimation de paramètres
Khaled Jabeur
HDR (IHEC de Carthage, Tunisie), Ph.D. (Université Laval, Canada), M.B.A (Université Laval, Canada), Ing. (FST, Tunisie)
Maître de Conférences à l’Institut Supérieur de Gestion (ISG) de Bizerte
Estimer ne coûte presque rien,
Estimer incorrectement coûte cher.
Vieux proverbe chinois
Plan
1.
Introduction
2. Terminologie et définitions
3. Échantillonnage et distributions d’échantillonnage
4. Estimation ponctuelle
5. Estimation par intervalle de confiance
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
2/84
Introduction
Un peu d’histoire …
▪ Dans de nombreux domaines (scientifiques, économiques, épidémiologiques...),
on a besoin de connaître certaines caractéristiques d’une population (ex. Salaire
moyen des jeunes cadres dans les PME, Taux de chômage auprès des jeunes
diplômés, …). Mais, en règle générale, ces caractéristiques sont difficiles à
déterminer à cause du grand effectif des populations concernées. La solution
consiste alors à estimer le paramètre en se basant sur des observations d’un
échantillon de taille plus réduit.
▪ L’idée de décrire une population à partir d’un échantillon réduit n’a été imaginée
que dans la seconde moitié du XVIIIème siècle, notamment par l’école
arithmétique politique anglaise. Ainsi, l’observation d’échantillons permettait
d’éviter la complexité et le coût exorbitants des recensements. Toutefois, ils se
ils ne
sont aperçu rapidement que les résultats manquaient d’exactitude :
les
prenaient en considération ni
fluctuations d’échantillonnage.
la représentativité de l’échantillon, ni
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
3/84
Introduction
Cadre général
▪ Dans le cadre de ce chapitre, deux théories seront abordées :
1. Théorie de l’échantillonnage
2. Théorie de l’estimation
▪ En effet, la question de représentativité de l’échantillon fait partie de la théorie
d’échantillonnage alors que la théorie de l’estimation apporte des éléments de
réponse au problème de fluctuations d’échantillonnage.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
4/84
Introduction
Théorie de l’échantillonnage : Définition
La théorie de l’échantillonnage étudie les liens entre les caractéristiques d’une
population et celles des échantillons prélevés de cette population. En particulier,
cette théorie suppose connaître la loi de probabilité (ainsi que ses paramètres) du
caractère X étudié dans
se propose d'en déduire des
renseignements sur des échantillons extraits de cette population (c’est purement
théorique).
la population et
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
5/84
Introduction
Exemples de questions posées en théorie de l’échantillonnage
Échantillon 1
Échantillon 2
Moyenne échantillon 1
Variance échantillon 1
Moyenne échantillon 2
Variance échantillon 2
Échantillon K
Moyenne échantillon K
Variance échantillon K
Distribution des 𝑥𝑖
2
Distribution des 𝑠𝑖
Existe-t-il un lien entre μX (la moyenne du caractère X dans la population) et les 𝑥𝑖 (les
moyennes du caractère X dans les différents échantillons).
Existe-t-il un lien entre 𝜎𝑋
du caractère X dans les différents échantillons).
2 (la variance du caractère X dans la population) et les 𝑠𝑖
2 (les variances
Existe-t-il un lien entre la distribution de probabilité du caractère X dans la population (loi
normale dans notre exemple) et la distribution de probabilité des 𝑥𝑖 (les moyennes du caractère
X dans les différents échantillons).
Population
Q1 :
Q2 :
Q3 :
⁞
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
6/84
()2,XXXNconnueconnue==121xs2KKxs222xsIntroduction
Théorie de l’estimation : Définition
La théorie de l’estimation suppose inconnus les paramètres d'une population,
mais qui va tenter de déduire des renseignement sur ces paramètres à partir
d'observations faites sur un (ou plusieurs) échantillon(s) extrait(s) de cette
population. En effet, ces observations vont permettre soit de donner une
estimation ponctuelle du paramètre d’intérêt soit de construire un intervalle, dit
de confiance, qui contient
la vraie valeur du paramètre avec une grande
probabilité fixée à priori (c’est purement pratique).
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
7/84
Introduction
Population
Exemple d’illustration de la théorie de l’estimation
Échantillon 1
Échantillon 2
Moyenne échantillon 1
Variance échantillon 1
Moyenne échantillon 2
Variance échantillon 2
Échantillon K
Moyenne échantillon K
Variance échantillon K
Estimation ponctuelle
possible de μX
Estimation ponctuelle
2
possible de 𝜎𝑋
Distribution des 𝑥𝑖
Intervalle de confiance
2 tel que
[L, U] pour 𝜎𝑋
P(L ≤ 𝜎𝑋
2 ≤ U) ≃ 1
2
Distribution des 𝑠𝑖
Intervalle de confiance
[L, U] pour μX tel que
P(L ≤ μX ≤ U) ≃ 1
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
8/84
()2,XXXinconnueinconnue==121xs2KKxs222xsTerminologie et définitions
Terminologie et définitions
▪ Une population se définit comme un ensemble d’éléments (individus,
ayant des
entreprises, dossiers, projets, …) homogènes
caractéristiques communes. On note par N la taille de la population.
c’est-à-dire
▪ Un échantillon est tout sous-ensemble de la population. On note par n la
taille de l’échantillon
▪ Un caractère ou une variable statistique c’est l’aspect que l’on désire étudier
chez un élément (individus, entreprises, dossiers, projets, …) de la population
ou de l’échantillon.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
9/84
Terminologie et définitions
Terminologie et définitions
Pour étudier les caractéristiques d’une population, on dispose de deux
méthodes de collecte de données :
1. La méthode exhaustive ou recensement où chaque individu de la
population est étudié selon le (ou les) caractère(s) d’intérêt.
2. La méthode des sondages ou échantillonnage qui conduit à n’examiner
qu’une fraction (c’est-à-dire un échantillon) de la population.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
10/84
Échantillonnage
Méthodes d’échantillonnage : Définition
Les méthodes d’échantillonnage : Ensemble des méthodes permettant de
réaliser un sondage (de prélever un échantillon de données) au sein
d’une population, de manière à reproduire un échantillon aussi
représentatif que possible de cette population.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
11/84
Échantillonnage
Échantillonnage : Raisons d’être
▪ On effectue l’échantillonnage essentiellement pour
les raisons
suivantes :
1.
2.
3.
4.
Lorsque la population est infinie
Par souci d’économie de coût
Si le test est destructif
Obtenir l’information le plus rapidement possible
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
12/84
Échantillonnage
Échantillonnage : Familles de méthodes
▪ Les méthodes d’échantillonnage peuvent être regroupées en deux
grandes familles :
1.
2.
L’échantillonnage non aléatoire (ou non probabiliste) : L’analyste
utilise son expérience et ses connaissances personnelles pour choisir
feront partie de
parmi
la
l’échantillon et qui, à son avis, représentent adéquatement
population ;
les unités de la population celles qui
aléatoire
: Obtenu par
L’échantillonnage
l’intermédiaire d’un mécanisme probabiliste, de sorte que l’on sache à
l’avance la probabilité (non nulle) qu’un individu quelconque de la
population soit inclus dans l’échantillon.
(ou probabiliste)
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
13/84
Échantillonnage
Méthodes d’échantillonnage
Méthodes probabilistes
(Aléatoires)
Méthodes non probabilistes
(Raisonnées)
Échantillonnage aléatoire simple
Advertisement
Échantillonnage par quota
Échantillonnage Stratifié
Échantillonnage de convenance
Échantillonnage par grappes
Échantillonnage selon le jugement
Échantillonnage systématique
Échantillonnage de boule de neige
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
14/84
Échantillonnage
Méthodes d’échantillonnage aléatoire simple
▪ Dans
le cadre de ce cours on s’intéresse uniquement aux méthodes
d’échantillonnage aléatoire simple.
▪ Définition : Dans une méthode d’échantillonnage aléatoire simple un échantillon
est construit de telle sorte que chaque individu de la population ait la même
probabilité d’être sélectionnée dans l’échantillon. On utilise souvent une table de
nombres aléatoires pour s’assurer que le choix des individus s’effectue vraiment
au hasard. La sélection des individus à inclure dans l’échantillon peut se faire
selon deux procédures :
▪ Procédure non exhaustif : On procède à n tirages successifs au hasard avec
remise, c’est-à-dire que l’individu est remis dans la population après chaque
tirage. Ainsi, avec cette procédure, un individu peut être sélectionné plus
qu’une fois dans l’échantillon;
▪ Procédure exhaustif : On procède à n tirages successifs au hasard sans
remise ou à un tirage simultané de n individus. Ainsi, avec cette procédure,
un individu ne peut être sélectionné qu’au plus une seule fois dans
l’échantillon.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
15/84
Échantillonnage
Échantillon aléatoire simple : Définition mathématique
▪ Soit X une variable aléatoire exprimant un caractère que l’on désire étudier
auprès des individus d’une population. Un échantillon aléatoire simple de taille n
de la variable aléatoire X est une suite de n variables aléatoires X1, X2, …, Xn
indépendantes et identiquement distribuées (i.i.d) que X, soit :
Les n valeurs numériques x1, x2, …, xn prises respectivement par les variables
aléatoires X1, X2, …, Xn s’appellent observations ou réalisations de l’échantillon
aléatoire.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
16/84
()()()221..1..()1..iXiXXiXSiXloialorsinXloiSiEXalorsinEXSiVarXalorsinVarX=======Échantillonnage
▪ Échantillon aléatoire simple : Exemple
Soit une variable aléatoire X exprimant les notes obtenues (sur 20) par des
candidats lors d’un test de sélection à l’entrée d’une Université réputée. Un
échantillon aléatoire de taille 7 de X est une suite de 7 variables aléatoires X1, X2,
X3, X4, X5, X6, X7, indépendantes et identiquement distribuées que X, soit :
Population : Tous les candidats qui ont passé le test
de sélection à l’entrée de cette Université
Tirage de 5 échantillons, chacun de taille 7
Observations
ou
Réalisations
s
é
v
r
e
s
b
o
s
n
o
l
l
i
t
n
a
h
c
É
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
17/84
Échantillon 1:1012.5714.758.56.7511.25Échantillon 2:13.255.753165.51913.75Échantillon 3:41718.251116.7589.5Échantillon 4:1812.7511.59.252.5174.5Échantillon 5:15.51110.252010.2538.751X3X2X5X4X7X6X
Échantillonnage
▪ Échantillon aléatoire simple : Exemple (suite …)
Ainsi, l’échantillon aléatoire X1, X2, X3, X4, X5, X6 et X7 est construit de la manière
suivante :
o Les notes obtenues par les premiers candidats des 5 échantillons (c’est-à-dire
10, 13.25, 4, 18 et 15.5) constituent les valeurs possibles d’une variable
aléatoire X1 ;
o Les notes obtenues par les seconds candidats des 5 échantillons (c’est-à-dire
12.5, 5.75, 17, 12.75 et 11) constituent les valeurs possibles d’une variable
aléatoire X2 ;
o ...
2), alors chaque Xi ~ 𝑁(μX, 𝜎𝑋
De plus, si on suppose, par exemple, que les notes obtenues par tous les candidats qui
ont passé le test de sélection suivent une distribution normale, c’est-à-dire que X ~
2), ∀ 𝑖 = 1. . 𝑛. Notons ici que les 5 échantillons
𝑁(μX, 𝜎𝑋
sont indépendants puisque les notes d'un échantillon n'apportent aucune information
concernant celles de l'autre (les notes de chaque échantillon ont été sélectionnées au
hasard) → les variables aléatoires X1, X2, X3, X4, X5, X6 et X7 sont indépendantes.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
18/84
Échantillonnage
Construction d’un Échantillon aléatoire simple de la v.a. X
Population
X : caractère étudié auprès des individus de la population
Tirage de K échantillons, chacun de taille n
s
é
v
r
e
s
b
o
s
n
o
l
l
i
t
n
a
h
c
é
K
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
19/84
1111112322222123123123Échantillon 1:Échantillon 2:Échantillon :Échantillon :ininjjjjjinKKKKKinxxxxxxxxxxjxxxxxKxxxxx1X3X2XnXiX
Échantillonnage
Échantillon aléatoire simple pour l’estimation des paramètres
▪ Soit X une variable aléatoire représentant un caractère que l’on désire étudier
auprès des individus d’une population. Cette v.a. X est considérée comme
parfaitement connue si on connaît la loi qu’elle suit ainsi que les différents
paramètres (s’ils existent) de cette loi.
▪ Par exemple, si X ~ 𝑁(−2, 4) on peut calculer n’importe quelle probabilité
impliquant la v.a. X. De la même façon, si Y ~ ℬ(5, 0.2) on peut calculer n’importe
quelle probabilité impliquant la v.a. Y.
▪ En pratique, il arrive souvent qu’on connaît partiellement la loi d’une v.a. X,
c’est-à-dire on connaît la nature de la loi (ex. Normale, Binomiale, Poisson, etc.)
2 pour la loi Normale, λ pour
mais on ignore les paramètres de cette loi (ex. μX et 𝜎𝑋
la loi de Poisson, etc.).
Ce sont donc ces paramètres que l’on cherche à estimer.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
20/84
Échantillonnage
Échantillonnage : Définition d’un paramètre
▪ Définition : Un paramètre est toute mesure caractéristique calculée sur la base des
données de la population.
▪ Dans le cadre de ce chapitre, nous allons estimer les trois paramètres suivants :
La moyenne du caractère X dans la population
La variance du caractère X dans la population
La proportion d’individus ayant une certaine caractéristique dans la
population
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
21/84
X2Xp2Notons par le paramètre que l'on désire estimer XXououp=Échantillonnage
Échantillonnage : Définition d’une statistique
▪ Définition 1 : Soient X1, X2, …, Xn un échantillon aléatoires de la v.a. X. Une
statistique est une variable aléatoire définie comme une fonction φ(X1, X2, …, Xn)
ne dépendant que des variables aléatoires X1, X2, …, Xn . Une statistique est
sensée estimer un paramètre inconnu θ.
▪ Définition 2 : Toute statistique መ𝜃 = φ(X1, X2, …, Xn) utilisée pour estimer un
paramètre inconnu θ est appelée estimateur. La réalisation (ou la valeur observée)
d’un estimateur donné, c’est-à-dire φ(x1, x2, …, xn), est appelée une estimation.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
22/84
Échantillonnage
Exemples de paramètres, d’estimateurs et d’estimations
Paramètre
Estimateur possible
Estimation (ou réalisation)
Moyenne échantillonnale (ou empirique)
Variance échantillonnale (ou empirique)
Proportion échantillonnale (ou empirique)
où k est le nombre d’individus
possédant la caractéristique étudiée
dans l’échantillon
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
23/84
()XEX=11niiXXn==11niixxn==2()XVarX=()22111niiSXXn==−−()22111niisxxn==−−p11ˆniiPXn==1'0isilindividuipossèdelacaractéristiqueétudiéeXsinon=ˆkpn=Échantillonnage
La statistique (ou variable aléatoire) 𝑋
Tirages (avec ou sans remise)
de K échantillons, chacun de
taille n
Valeurs observées dans l’échantillon
n
o
i
t
a
l
u
p
o
P
)
s
u
d
i
v
i
d
n
i
N
(
⁞
⁞
⁞
⁞
Advertisement
Moyenne du caractère X
observée dans l’échantillon 1
Moyenne du caractère X
observée dans l’échantillon 2
Moyenne du caractère X
observée dans l’échantillon 3
⁞
Moyenne du caractère X
observée dans l’échantillon j
⁞
Moyenne du caractère X
observée dans l’échantillon K
▪ Les moyennes
ҧ𝑥1,
ҧ𝑥2,
ҧ𝑥3, …,
ҧ𝑥𝐾 constituent des valeurs possibles d’une nouvelle variable
aléatoire, qu’on note ത𝑋, appelée moyenne échantillonnale (ou empirique). Ainsi, la variable
aléatoire ത𝑋 décrit les moyennes du caractère X observées dans les différents échantillons de
taille n qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
24/84
()111111123111Échantillon 1:,,,...,,...,niniixxxxxxxn==()1231Échantillon 1:,,,...,,...,nKKKKKKiniKiKxxxxxxxn==()222222123211Échantillon 2:,,,...,,...,niniixxxxxxxn==()12311Échantillon :,,,...,,...,njjjjjjinijijxxxxxxxn==()333333123311Échantillon 3:,,,...,,...,niniixxxxxxxn==
Échantillonnage
La statistique (ou variable aléatoire) S2
Tirages (avec ou sans remise)
de K échantillons, chacun de
taille n
Valeurs observées dans l’échantillon
n
o
i
t
a
l
u
p
o
P
)
s
u
d
i
v
i
d
n
i
N
(
⁞
⁞
⁞
⁞
Variance du caractère X
observée dans l’échantillon 1
Variance du caractère X
observée dans l’échantillon 2
Variance du caractère X
observée dans l’échantillon 3
⁞
Variance du caractère X
observée dans l’échantillon j
⁞
Variance du caractère
X observée dans
l’échantillon K
▪ Les variances 𝑠1
2, 𝑠3
2 , 𝑠2
2, …, 𝑠𝐾
2 constituent des valeurs possibles d’une nouvelle variable
aléatoire, qu’on note S2, appelée variance échantillonnale (ou empirique). Ainsi,
la variable
aléatoire S2 décrit les variances du caractère X observées dans les différents échantillons de
taille n qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
25/84
()()211111121231111Échantillon 1:,,,...,,...,1niniixxxxxxxsn=−=−()()221231Échantillon 1:,,,...,,...,1nKKKKKKiniKKiKxxxxxxxsn=−=−()()222222221232211Échantillon 2:,,,...,,...,1niniixxxxxxxsn=−=−()()2212311Échantillon :,,,...,,...,1njjjjjjinijjijxxxxxxxsn=−=−()()233333321233311Échantillon 3:,,,...,,...,1niniixxxxxxxsn=−=−
Échantillonnage
La statistique (ou variable aléatoire) 𝑃
Tirages (avec ou sans remise)
de K échantillons, chacun de
taille n
Valeurs observées dans l’échantillon :
n
o
i
t
a
l
u
p
o
P
)
s
u
d
i
v
i
d
n
i
N
(
⁞
⁞
⁞
⁞
Proportion des individus ayant la
caractéristique étudiée dans
l’échantillon 1
Proportion des individus ayant
la caractéristique étudiée dans
l’échantillon 2
Proportion des individus ayant
la caractéristique étudiée dans
l’échantillon 3
⁞
Proportion des individus ayant
la caractéristique étudiée dans
l’échantillon j
⁞
Proportion des individus ayant
la caractéristique étudiée dans
l’échantillon K
▪ Notons que 𝑘𝑗 désigne le nombre d’individus ayant la caractéristique étudiée dans l’échantillon j (j=1..K).
▪
Ƹ𝑝1,
Ƹ𝑝2,
Ƹ𝑝3 , … ,
Ƹ𝑝𝐾 constituent des valeurs possibles d’une nouvelle variable aléatoire,
Les proportions
qu’on note 𝑃, appelée proportion échantillonnale (ou empirique). Ainsi, la variable aléatoire 𝑃 décrit les
proportions des individus ayant la caractéristique étudiée dans les différents échantillons de taille n
qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
26/84
()1111111123111ˆÉchantillon 1:,,,...,,...,niniikxxxxxxpnn===()1231Échantillon 1ˆ:,,,...,,...,nKKKKKKKiniKiKkxxxxxxpnn===()2222222123211ˆÉchantillon 2:,,,...,,...,niniikxxxxxxpnn===()12311ˆÉchantillon :,,,...,,...,njjjjjjjinijikjxxxxxxpnn===()3333333123311ˆÉchantillon 3:,,,...,,...,niniikxxxxxxpnn===1''0jisilindividuideléchantillonjpossèdelacaractéristiqueétudiéexsinon=
Échantillonnage
Distribution d’échantillonnage
▪ Puisque une statistique est une variable aléatoire, alors on pourra s’intéresser à sa
distribution de probabilité, appelé distribution d’échantillonnage.
▪ Dans le cadre de ce chapitre, les distributions d’échantillonnage (ou distribution
de probabilité) des trois statistiques (ou variables aléatoires) suivantes seront
étudiées :
o Distribution d’échantillonnage de la moyenne ത𝑋
o Distribution d’échantillonnage de la variance S2
o Distribution d’échantillonnage de la proportion 𝑃
▪ Ainsi, pour chacune de ces trois statistiques, on calculera tout d’abord l’espérance
et la variance : E( ത𝑋), Var( ത𝑋), E(S2), Var(S2), E( 𝑃) et Var( 𝑃). Ensuite, on discutera de
la nature de la (ou des) loi(s) suivi par chacune de ces trois statistiques.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
27/84
Échantillonnage
Théorème Centrale-Limite (TCL) : Énoncé
▪ Soient X1, X2, …, Xn un échantillon aléatoire de la v.a. X.
Si on pose Sn = X1 + X2 + X3 +…+ Xn alors :
De plus, si n tend vers +∞ (en pratique n ≥ 30 ) alors :
ou d’une façon
équivalente
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
28/84
()()21.2.nXnXESnVarSn==()()2,0,1nXXnXXSNnnSnZNn−=2,nXXSXNnn=Échantillonnage
▪ Exercice d’application du TCL : Soit un lot de 500 chocolats. Le poids d’un
2 = 0.25 g2. Quelle
chocolat est une v.a. d’espérance µX = 5g et de variance σX
est la probabilité qu’une boite de 50 chocolats issus de ce lot ait un poids
total supérieur à 260 g ?
▪ Réponse : Soit S50 = X1 + X2 + …+ X50 la variable aléatoire qui décrit le poids
d’une boite de 50 chocolats où Xi exprime le poids du ième chocolat de cette
2 = 0.25 g2 ), i = 1..50. Puisque n =
boite. On sait que chaque Xi ~ N(µX = 5g, σX
2 = 0.25 x
50 ≥ 30 alors selon le TCL la v.a. S50 ~ N(n x µX = 5x50 =250, n x σX
50 = 12.5). Il est maintenant possible de calculer la probabilité P(S50 ≥ 260),
soit :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
29/84
()()502602502602.830.002312.5PSPZPZ−===Échantillonnage
Distribution d’échantillonnage de la moyenne ത𝑋
▪ Soient X1, X2, …, Xn un échantillon aléatoire de taille n de la v.a. X et ത𝑋 est la
moyenne échantillonnale, alors on a :
(On dit que ത𝑋 est un estimateur sans biais de µX)
▪ Preuve :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
30/84
()()()()1211.2.3.niiXXXXnEXEXVarXVarXnn======()()111111.nniiXXiiEXEXEXnnnn======()()2222111112.nnXiiXiiVarXVarXVarXnnnnn======Échantillonnage
▪ Exercice d’application : Une population est constituée de 4 étudiants en statistique
(le faible effectif n’est pas dû à un manque d’intérêt pour la matière de la part des
étudiants mais au désir de ne pas multiplier inutilement les calculs qui vont suivre !).
Leur professeur s’intéresse au temps hebdomadaire consacré à l’étude des statistiques
par chaque étudiant. Il a obtenu les résultats suivants :
Étudiant
Temps d’étude (en heures)
A
B
C
D
Total
8
3
6
11
28
1. Calculer la moyenne µX et la variance 𝜎𝑋
2 du temps hebdomadaire consacré à
Advertisement
l’étude des statistiques par chaque étudiant (c’est le caractère X étudié) de cette
population de 4 étudiants.
2. Calculer E( ത𝑋) et Var( ത𝑋) sachant que les échantillons sont de taille 2 et que le
tirage a été effectué avec remise.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
31/84
Échantillonnage
▪ Réponse :
Nombre d’échantillons de taille 2 = 16 (Tirage avec remise)
Numéro de
l’échantillon
L’échantillon
Observations de
l’échantillon
Moyenne de
l’échantillon
Numéro de
l’échantillon
L’échantillon
Observations de
l’échantillon
Moyenne de
l’échantillon
1
2
3
4
5
6
7
8
A, A
A, B
A, C
A, D
B, A
B, B
B, C
B, D
8, 8
8, 3
8, 6
8, 11
3, 8
3, 3
3, 6
3, 11
8
5.5
7
9.5
5.5
3
4.5
7
9
10
11
12
13
14
15
16
C, A
C, B
C, C
C, D
D, A
D, B
D, C
D, D
6, 8
6, 3
6, 6
6, 11
11, 8
11, 3
11, 6
11, 11
7
4.5
6
8.5
9.5
7
8.5
11
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
32/84
111836111.()()74NNXiiiiiEXxPXxxN==+++======2222212222()()()()783611498.54NXiiiVarXEXEXxPXx===−==−=+++=−=2.2416nN==Échantillonnage
▪ Réponse (suite …) :
Valeurs
possibles de
la v.a. ത𝑋
Fréquence de
chaque valeur
possible de ത𝑋
Probabilité à associer à
chaque valeur possible de ത𝑋
3
4.5
5.5
6
7
8
8.5
9.5
11
1
2
2
1
4
1
2
2
1
Total
16
0.0625
0.125
0.125
0.0625
0.25
0.0625
0.125
0.125
0.0625
1
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
33/84
2.()()91()()30.06254.50.125...110.06257iiiEXxPXxEX====+++==()922221222()()()()78.5()30.06254.50.125...110.06254953.25494.252iiiVarXEXEXxPXxVarXn==−==−==+++−=−===Échantillonnage
Distribution de probabilité de la statistique 𝑋
(Tirage avec remise ou population infinie)
Taille de
l’échantillon
Loi de X
Variance de X
2
𝜎𝑋
Loi de ത𝑋
Loi réduite
n ≥ 30
Quelconque
connue
inconnue
Quelconque
inconnue
n < 30
Normale
2)
X ~ 𝑁(μX, 𝜎𝑋
connue
inconnue
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
34/84
2,XXXNn2,XsXNn2,XXXNn()0,1XXXNn−()0,1XXNsn−(1)XXtndlSn−−()0,1XXXNn−Échantillonnage
Distribution d’échantillonnage (ou de probabilité ) de la statistique 𝑋
(Tirage sans remise ou population finie)
Taille de
l’échantillon
Loi de X
Variance de X
2
𝜎𝑋
Loi de ത𝑋
Loi réduite
n ≥ 30
Quelconque
connue
inconnue
Quelconque
inconnue
n < 30
Normale
2)
X ~ 𝑁(μX, 𝜎𝑋
connue
inconnue
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
35/84
2,1XXNnXNnN−−2,1XsNnXNnN−−()0,11XXXNNnNn−−−2,1XXNnXNnN−−()0,11XXNsNnNn−−−()0,11XXXNNnNn−−−(1)1XXtndlSNnNn−−−−Échantillonnage
▪ Remarque : Lorsqu’on dispose d’une population de taille N, le nombre
d’échantillons de taille n qu’on peut construire à partir de cette population
varie selon le mode de tirage, soit :
Le nombre d’échantillons lorsqu’on effectue des tirages avec remise
Le nombre d’échantillons lorsqu’on effectue des tirages sans remise
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
36/84
nN=!!()!nNNCnNn==−Échantillonnage
▪ Exemple 1: Supposons que les tailles des individus dans une population (caractère X)
2 = 25 cm2.
suivent une distribution normale de moyenne μX = 170 cm et de variance 𝜎𝑋
On tire avec remise un échantillon de taille 25 de cette population.
Quelle est la probabilité pour que la taille moyenne dans l’échantillon soit supérieure à
172 cm ?
▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et
par conséquent, il nous demande de calculer la probabilité suivante :
Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋
ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
37/84
()172?PX=225,170,125XXXNNn=()()17217017220.0231PXPZPZ−===Échantillonnage
▪ Exemple 2 : Supposons que les tailles des individus dans une population de moyenne
2 inconnue. On tire avec remise un échantillon de taille 36
μX = 185 cm et de variance 𝜎𝑋
de cette population.
Sachant que la variance de cet échantillon s2 = 40 cm2, quelle est la probabilité pour que
la taille moyenne dans l’échantillon soit supérieure à 187 cm ?
▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et
Advertisement
par conséquent, il nous demande de calculer la probabilité suivante :
Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋
ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
38/84
()187?PX=240,185,1.1136XsXNNn=()()1871851871.900.0291.11PXPZPZ−===Échantillonnage
▪ Exemple 3 : Supposons que les tailles des individus dans une population suivent
2
approximativement une loi normale de moyenne μX = 185 cm et de variance 𝜎𝑋
inconnue. On tire avec remise un échantillon de taille 20 de cette population.
Sachant que la variance de cet échantillon s2 = 60 cm2, quelle est la probabilité pour que la
taille moyenne dans l’échantillon soit supérieure à 188 cm ?
▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et
par conséquent, il nous demande de calculer la probabilité suivante :
Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋
ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
39/84
()188?PX=()()119XXTtndltdlSn−=−()()1881851881.730.056020PXPTPT−===Échantillonnage
Distribution d’échantillonnage de la variance S2
▪ Soient X1, X2, …, Xn un échantillon aléatoires de taille n de la v.a. X et S2 la
variance échantillonnale, alors on a :
(On dit que S2 est un estimateur sans biais de 𝜎𝑋
2)
La formule (3) est rarement utilisée en pratique. Toutefois, si la v.a. X suit une loi normale, alors
la formule de Var(S2) peut être estimée par une formule beaucoup plus simple (3bis).
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
40/84
()()()()()()()221224242424411.12.323.1niiXXXSXXnESVarXVarSavecetEXEXnn==−−==−=+==−−4223.()1bisXVarSsiXNormalen−Échantillonnage
▪ Exercice d’application : Reprenons l’exemple de la population de 4 étudiants et
leur temps hebdomadaire consacré à l’étude des statistiques.
Étudiant
Temps d’étude (en heures)
A
B
C
D
Total
8
3
6
11
28
En utilisant des échantillons de taille 2 tirés avec remise, on vous demande de calculer
E(S2) (𝜎𝑋
2 = 8.5 calculée précédemment).
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
41/84
Échantillonnage
▪ Réponse :
Numéro de
l’échantillon
L’échantillon
Observations de
l’échantillon
Variance s2
Numéro de
l’échantillon
L’échantillon
Observations de
l’échantillon
Variance s2
1
2
3
4
5
6
7
8
A, A
A, B
A, C
A, D
B, A
B, B
B, C
B, D
8, 8
8, 3
8, 6
8, 11
3, 8
3, 3
3, 6
3, 11
0
12.5
2
4.5
12.5
0
4.5
32
9
10
11
12
13
14
15
16
C, A
C, B
C, C
C, D
D, A
D, B
D, C
D, D
6, 8
6, 3
6, 6
6, 11
11, 8
11, 3
11, 6
11, 11
2
4.5
0
12.5
4.5
32
12.5
0
Valeurs
possibles de
la v.a. S2
Fréquence des
valeurs
possibles de S2
Probabilité à associer à
chaque valeur possible de
S2
0
2
4.5
12.5
32
Total
4
2
4
4
2
16
0.25
0.125
0.25
0.25
0.125
1
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
42/84
()52212()()00.2520.125...320.1258.5iiiXESxPSx=====+++==Échantillonnage
Distribution d’échantillonnage (ou de probabilité) de la statistique S2
Théorème
Soient X1, X2, …, Xn un échantillon aléatoire de taille n d’une v.a. X qui suit une
2) et S2 est la variance échantillonnale. On a alors la
loi normale 𝑁(μX, 𝜎𝑋
statistique (ou la variable aléatoire) :
suit une loi du Khi-deux à (n-1) dl.
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
43/84
()221XnSY−=Échantillonnage
▪ Exercice d’application : On fait l’hypothèse que la taille (en cm) des étudiants d’une
école de génie est une variable aléatoire normale X de moyenne μX = 175 et de
2 = 100. Un échantillon de taille 51 est sélectionné de cette population.
variance 𝜎𝑋
Quelle est la probabilité que la variance des tailles dans l’échantillon soit d’au plus
égale 112.66.
▪ Réponse : La variable aléatoire qui décrit la variance du caractère X (taille des
étudiants d’une école de génie) dans l’échantillon est la variance échantillonnale S2.
Ainsi, la probabilité qu’on nous demande de calculer est :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
44/84
()()()()()()22221511112.66112.6610056.3351150156.3310.250.75XnSPSPPYavecYdlPY−−===−==−=−=Échantillonnage
Distribution d’échantillonnage (ou de probabilité) de la statistique 𝑃
Distribution d’échantillonnage de 𝑃
Soient X1, X2, …, Xn, un échantillon aléatoire de taille n ayant la loi de Bernoulli
ℬ(p) comme loi mère, c’est-à-dire que Xi ~ ℬ(p) pour tout i=1..n. Si 𝑃 est la
proportion échantillonnale, alors :
Tirage avec
remise
Tirage sans
remise
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
45/84
()()()()()12...ˆ1.ˆ2.11ˆˆ3./1nXXXPnEPpppppNnVarPVarPnnN+++==−−−==−Échantillonnage
Distribution d’échantillonnage (ou de probabilité) de la statistique 𝑃
Distribution d’échantillonnage de 𝑃
Si n ≥ 30, n×p ≥ 5 et n×(1 - p) ≥ 5 alors :
Tirage avec
remise
Tirage sans
remise
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
46/84
(1)ˆ1.,(1)ˆ2.,1ppPNpnppNnPNpnN−−−−Échantillonnage
▪ Exercice d’application : Un fabricant de clous a déterminé que 3% des clous produits
sont défectueux. On étudie un échantillon aléatoire de 300 clous (tirage avec remise).
Quelle est la probabilité que la proportion de clous défectueux dans l’échantillon soit
comprise entre 2% et 3,5% ?
▪ Réponse : la variable aléatoire qui décrit la proportion des clous défectueux dans
l’échantillon est 𝑃. Puisque n = 300 ≥ 30, n×p = 300×0.03 = 9 ≥ 5 et n×(1 - p) = 300 ×
0.97 = 291 ≥ 5, alors on peut déduire la distribution de probabilité de 𝑃 , soit :
▪ Ainsi, la probabilité qu’on nous demande de calculer est :
K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020
47/84
Advertisement
()()()()()()0.020.030.0350.03ˆˆ0.020.0350.0000970.0000971.020.511.020.5111.020.5110.1540....