Chapitre 3: Échantillonnage et Estimation de paramètres

Institut Supérieur de Gestion de Bizerte
1/84
100%
Rendu du PDF...
Page 1 sur 84Lecteur de document UniversityLib

Chapitre 3: Échantillonnage et Estimation de paramètres

Institut Supérieur de Gestion de Bizerte · Probability and Statistical Inference · notes

Browse all mathématiques documents

Chapitre 3.

Échantillonnage et Estimation de paramètres

Khaled Jabeur

HDR (IHEC de Carthage, Tunisie), Ph.D. (Université Laval, Canada), M.B.A (Université Laval, Canada), Ing. (FST, Tunisie)

Maître de Conférences à l’Institut Supérieur de Gestion (ISG) de Bizerte

[email protected]

Estimer ne coûte presque rien,

Estimer incorrectement coûte cher.

Vieux proverbe chinois

Plan

1.

Introduction

2. Terminologie et définitions

3. Échantillonnage et distributions d’échantillonnage

4. Estimation ponctuelle

5. Estimation par intervalle de confiance

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

2/84

Introduction

Un peu d’histoire …

▪ Dans de nombreux domaines (scientifiques, économiques, épidémiologiques...),

on a besoin de connaître certaines caractéristiques d’une population (ex. Salaire

moyen des jeunes cadres dans les PME, Taux de chômage auprès des jeunes

diplômés, …). Mais, en règle générale, ces caractéristiques sont difficiles à

déterminer à cause du grand effectif des populations concernées. La solution

consiste alors à estimer le paramètre en se basant sur des observations d’un

échantillon de taille plus réduit.

▪ L’idée de décrire une population à partir d’un échantillon réduit n’a été imaginée

que dans la seconde moitié du XVIIIème siècle, notamment par l’école

arithmétique politique anglaise. Ainsi, l’observation d’échantillons permettait

d’éviter la complexité et le coût exorbitants des recensements. Toutefois, ils se

ils ne

sont aperçu rapidement que les résultats manquaient d’exactitude :

les

prenaient en considération ni

fluctuations d’échantillonnage.

la représentativité de l’échantillon, ni

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

3/84

Introduction

Cadre général

▪ Dans le cadre de ce chapitre, deux théories seront abordées :

1. Théorie de l’échantillonnage

2. Théorie de l’estimation

▪ En effet, la question de représentativité de l’échantillon fait partie de la théorie

d’échantillonnage alors que la théorie de l’estimation apporte des éléments de

réponse au problème de fluctuations d’échantillonnage.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

4/84

Introduction

Théorie de l’échantillonnage : Définition

La théorie de l’échantillonnage étudie les liens entre les caractéristiques d’une

population et celles des échantillons prélevés de cette population. En particulier,

cette théorie suppose connaître la loi de probabilité (ainsi que ses paramètres) du

caractère X étudié dans

se propose d'en déduire des

renseignements sur des échantillons extraits de cette population (c’est purement

théorique).

la population et

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

5/84

Introduction

Exemples de questions posées en théorie de l’échantillonnage

Échantillon 1

Échantillon 2

Moyenne échantillon 1

Variance échantillon 1

Moyenne échantillon 2

Variance échantillon 2

Échantillon K

Moyenne échantillon K

Variance échantillon K

Distribution des 𝑥𝑖

2

Distribution des 𝑠𝑖

Existe-t-il un lien entre μX (la moyenne du caractère X dans la population) et les 𝑥𝑖 (les

moyennes du caractère X dans les différents échantillons).

Existe-t-il un lien entre 𝜎𝑋

du caractère X dans les différents échantillons).

2 (la variance du caractère X dans la population) et les 𝑠𝑖

2 (les variances

Existe-t-il un lien entre la distribution de probabilité du caractère X dans la population (loi

normale dans notre exemple) et la distribution de probabilité des 𝑥𝑖 (les moyennes du caractère

X dans les différents échantillons).

Population

Q1 :

Q2 :

Q3 :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

6/84

()2,XXXNconnueconnue==121xs2KKxs222xsIntroduction

Théorie de l’estimation : Définition

La théorie de l’estimation suppose inconnus les paramètres d'une population,

mais qui va tenter de déduire des renseignement sur ces paramètres à partir

d'observations faites sur un (ou plusieurs) échantillon(s) extrait(s) de cette

population. En effet, ces observations vont permettre soit de donner une

estimation ponctuelle du paramètre d’intérêt soit de construire un intervalle, dit

de confiance, qui contient

la vraie valeur du paramètre avec une grande

probabilité fixée à priori (c’est purement pratique).

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

7/84

Introduction

Population

Exemple d’illustration de la théorie de l’estimation

Échantillon 1

Échantillon 2

Moyenne échantillon 1

Variance échantillon 1

Moyenne échantillon 2

Variance échantillon 2

Échantillon K

Moyenne échantillon K

Variance échantillon K

Estimation ponctuelle

possible de μX

Estimation ponctuelle

2

possible de 𝜎𝑋

Distribution des 𝑥𝑖

Intervalle de confiance

2 tel que

[L, U] pour 𝜎𝑋

P(L ≤ 𝜎𝑋

2 ≤ U) ≃ 1

2

Distribution des 𝑠𝑖

Intervalle de confiance

[L, U] pour μX tel que

P(L ≤ μX ≤ U) ≃ 1

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

8/84

()2,XXXinconnueinconnue==121xs2KKxs222xsTerminologie et définitions

Terminologie et définitions

▪ Une population se définit comme un ensemble d’éléments (individus,

ayant des

entreprises, dossiers, projets, …) homogènes

caractéristiques communes. On note par N la taille de la population.

c’est-à-dire

▪ Un échantillon est tout sous-ensemble de la population. On note par n la

taille de l’échantillon

▪ Un caractère ou une variable statistique c’est l’aspect que l’on désire étudier

chez un élément (individus, entreprises, dossiers, projets, …) de la population

ou de l’échantillon.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

9/84

Terminologie et définitions

Terminologie et définitions

Pour étudier les caractéristiques d’une population, on dispose de deux

méthodes de collecte de données :

1. La méthode exhaustive ou recensement où chaque individu de la

population est étudié selon le (ou les) caractère(s) d’intérêt.

2. La méthode des sondages ou échantillonnage qui conduit à n’examiner

qu’une fraction (c’est-à-dire un échantillon) de la population.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

10/84

Échantillonnage

Méthodes d’échantillonnage : Définition

Les méthodes d’échantillonnage : Ensemble des méthodes permettant de

réaliser un sondage (de prélever un échantillon de données) au sein

d’une population, de manière à reproduire un échantillon aussi

représentatif que possible de cette population.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

11/84

Échantillonnage

Échantillonnage : Raisons d’être

▪ On effectue l’échantillonnage essentiellement pour

les raisons

suivantes :

1.

2.

3.

4.

Lorsque la population est infinie

Par souci d’économie de coût

Si le test est destructif

Obtenir l’information le plus rapidement possible

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

12/84

Échantillonnage

Échantillonnage : Familles de méthodes

▪ Les méthodes d’échantillonnage peuvent être regroupées en deux

grandes familles :

1.

2.

L’échantillonnage non aléatoire (ou non probabiliste) : L’analyste

utilise son expérience et ses connaissances personnelles pour choisir

feront partie de

parmi

la

l’échantillon et qui, à son avis, représentent adéquatement

population ;

les unités de la population celles qui

aléatoire

: Obtenu par

L’échantillonnage

l’intermédiaire d’un mécanisme probabiliste, de sorte que l’on sache à

l’avance la probabilité (non nulle) qu’un individu quelconque de la

population soit inclus dans l’échantillon.

(ou probabiliste)

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

13/84

Échantillonnage

Méthodes d’échantillonnage

Méthodes probabilistes

(Aléatoires)

Méthodes non probabilistes

(Raisonnées)

Échantillonnage aléatoire simple

Advertisement

Échantillonnage par quota

Échantillonnage Stratifié

Échantillonnage de convenance

Échantillonnage par grappes

Échantillonnage selon le jugement

Échantillonnage systématique

Échantillonnage de boule de neige

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

14/84

Échantillonnage

Méthodes d’échantillonnage aléatoire simple

▪ Dans

le cadre de ce cours on s’intéresse uniquement aux méthodes

d’échantillonnage aléatoire simple.

▪ Définition : Dans une méthode d’échantillonnage aléatoire simple un échantillon

est construit de telle sorte que chaque individu de la population ait la même

probabilité d’être sélectionnée dans l’échantillon. On utilise souvent une table de

nombres aléatoires pour s’assurer que le choix des individus s’effectue vraiment

au hasard. La sélection des individus à inclure dans l’échantillon peut se faire

selon deux procédures :

▪ Procédure non exhaustif : On procède à n tirages successifs au hasard avec

remise, c’est-à-dire que l’individu est remis dans la population après chaque

tirage. Ainsi, avec cette procédure, un individu peut être sélectionné plus

qu’une fois dans l’échantillon;

▪ Procédure exhaustif : On procède à n tirages successifs au hasard sans

remise ou à un tirage simultané de n individus. Ainsi, avec cette procédure,

un individu ne peut être sélectionné qu’au plus une seule fois dans

l’échantillon.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

15/84

Échantillonnage

Échantillon aléatoire simple : Définition mathématique

▪ Soit X une variable aléatoire exprimant un caractère que l’on désire étudier

auprès des individus d’une population. Un échantillon aléatoire simple de taille n

de la variable aléatoire X est une suite de n variables aléatoires X1, X2, …, Xn

indépendantes et identiquement distribuées (i.i.d) que X, soit :

Les n valeurs numériques x1, x2, …, xn prises respectivement par les variables

aléatoires X1, X2, …, Xn s’appellent observations ou réalisations de l’échantillon

aléatoire.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

16/84

()()()221..1..()1..iXiXXiXSiXloialorsinXloiSiEXalorsinEXSiVarXalorsinVarX=======Échantillonnage

▪ Échantillon aléatoire simple : Exemple

Soit une variable aléatoire X exprimant les notes obtenues (sur 20) par des

candidats lors d’un test de sélection à l’entrée d’une Université réputée. Un

échantillon aléatoire de taille 7 de X est une suite de 7 variables aléatoires X1, X2,

X3, X4, X5, X6, X7, indépendantes et identiquement distribuées que X, soit :

Population : Tous les candidats qui ont passé le test

de sélection à l’entrée de cette Université

Tirage de 5 échantillons, chacun de taille 7

Observations

ou

Réalisations

s

é

v

r

e

s

b

o

s

n

o

l

l

i

t

n

a

h

c

É

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

17/84

Échantillon 1:1012.5714.758.56.7511.25Échantillon 2:13.255.753165.51913.75Échantillon 3:41718.251116.7589.5Échantillon 4:1812.7511.59.252.5174.5Échantillon 5:15.51110.252010.2538.751X3X2X5X4X7X6X

Échantillonnage

▪ Échantillon aléatoire simple : Exemple (suite …)

Ainsi, l’échantillon aléatoire X1, X2, X3, X4, X5, X6 et X7 est construit de la manière

suivante :

o Les notes obtenues par les premiers candidats des 5 échantillons (c’est-à-dire

10, 13.25, 4, 18 et 15.5) constituent les valeurs possibles d’une variable

aléatoire X1 ;

o Les notes obtenues par les seconds candidats des 5 échantillons (c’est-à-dire

12.5, 5.75, 17, 12.75 et 11) constituent les valeurs possibles d’une variable

aléatoire X2 ;

o ...

2), alors chaque Xi ~ 𝑁(μX, 𝜎𝑋

De plus, si on suppose, par exemple, que les notes obtenues par tous les candidats qui

ont passé le test de sélection suivent une distribution normale, c’est-à-dire que X ~

2), ∀ 𝑖 = 1. . 𝑛. Notons ici que les 5 échantillons

𝑁(μX, 𝜎𝑋

sont indépendants puisque les notes d'un échantillon n'apportent aucune information

concernant celles de l'autre (les notes de chaque échantillon ont été sélectionnées au

hasard) → les variables aléatoires X1, X2, X3, X4, X5, X6 et X7 sont indépendantes.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

18/84

Échantillonnage

Construction d’un Échantillon aléatoire simple de la v.a. X

Population

X : caractère étudié auprès des individus de la population

Tirage de K échantillons, chacun de taille n

s

é

v

r

e

s

b

o

s

n

o

l

l

i

t

n

a

h

c

é

K

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

19/84

1111112322222123123123Échantillon 1:Échantillon 2:Échantillon :Échantillon :ininjjjjjinKKKKKinxxxxxxxxxxjxxxxxKxxxxx1X3X2XnXiX

Échantillonnage

Échantillon aléatoire simple pour l’estimation des paramètres

▪ Soit X une variable aléatoire représentant un caractère que l’on désire étudier

auprès des individus d’une population. Cette v.a. X est considérée comme

parfaitement connue si on connaît la loi qu’elle suit ainsi que les différents

paramètres (s’ils existent) de cette loi.

▪ Par exemple, si X ~ 𝑁(−2, 4) on peut calculer n’importe quelle probabilité

impliquant la v.a. X. De la même façon, si Y ~ ℬ(5, 0.2) on peut calculer n’importe

quelle probabilité impliquant la v.a. Y.

▪ En pratique, il arrive souvent qu’on connaît partiellement la loi d’une v.a. X,

c’est-à-dire on connaît la nature de la loi (ex. Normale, Binomiale, Poisson, etc.)

2 pour la loi Normale, λ pour

mais on ignore les paramètres de cette loi (ex. μX et 𝜎𝑋

la loi de Poisson, etc.).

Ce sont donc ces paramètres que l’on cherche à estimer.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

20/84

Échantillonnage

Échantillonnage : Définition d’un paramètre

▪ Définition : Un paramètre est toute mesure caractéristique calculée sur la base des

données de la population.

▪ Dans le cadre de ce chapitre, nous allons estimer les trois paramètres suivants :

La moyenne du caractère X dans la population

La variance du caractère X dans la population

La proportion d’individus ayant une certaine caractéristique dans la

population

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

21/84

X2Xp2Notons par le paramètre que l'on désire estimer XXououp=Échantillonnage

Échantillonnage : Définition d’une statistique

▪ Définition 1 : Soient X1, X2, …, Xn un échantillon aléatoires de la v.a. X. Une

statistique est une variable aléatoire définie comme une fonction φ(X1, X2, …, Xn)

ne dépendant que des variables aléatoires X1, X2, …, Xn . Une statistique est

sensée estimer un paramètre inconnu θ.

▪ Définition 2 : Toute statistique መ𝜃 = φ(X1, X2, …, Xn) utilisée pour estimer un

paramètre inconnu θ est appelée estimateur. La réalisation (ou la valeur observée)

d’un estimateur donné, c’est-à-dire φ(x1, x2, …, xn), est appelée une estimation.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

22/84

Échantillonnage

Exemples de paramètres, d’estimateurs et d’estimations

Paramètre

Estimateur possible

Estimation (ou réalisation)

Moyenne échantillonnale (ou empirique)

Variance échantillonnale (ou empirique)

Proportion échantillonnale (ou empirique)

où k est le nombre d’individus

possédant la caractéristique étudiée

dans l’échantillon

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

23/84

()XEX=11niiXXn==11niixxn==2()XVarX=()22111niiSXXn==−−()22111niisxxn==−−p11ˆniiPXn==1'0isilindividuipossèdelacaractéristiqueétudiéeXsinon=ˆkpn=Échantillonnage

La statistique (ou variable aléatoire) 𝑋

Tirages (avec ou sans remise)

de K échantillons, chacun de

taille n

Valeurs observées dans l’échantillon

n

o

i

t

a

l

u

p

o

P

)

s

u

d

i

v

i

d

n

i

N

(

Advertisement

Moyenne du caractère X

observée dans l’échantillon 1

Moyenne du caractère X

observée dans l’échantillon 2

Moyenne du caractère X

observée dans l’échantillon 3

Moyenne du caractère X

observée dans l’échantillon j

Moyenne du caractère X

observée dans l’échantillon K

▪ Les moyennes

ҧ𝑥1,

ҧ𝑥2,

ҧ𝑥3, …,

ҧ𝑥𝐾 constituent des valeurs possibles d’une nouvelle variable

aléatoire, qu’on note ത𝑋, appelée moyenne échantillonnale (ou empirique). Ainsi, la variable

aléatoire ത𝑋 décrit les moyennes du caractère X observées dans les différents échantillons de

taille n qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

24/84

()111111123111Échantillon 1:,,,...,,...,niniixxxxxxxn==()1231Échantillon 1:,,,...,,...,nKKKKKKiniKiKxxxxxxxn==()222222123211Échantillon 2:,,,...,,...,niniixxxxxxxn==()12311Échantillon :,,,...,,...,njjjjjjinijijxxxxxxxn==()333333123311Échantillon 3:,,,...,,...,niniixxxxxxxn==

Échantillonnage

La statistique (ou variable aléatoire) S2

Tirages (avec ou sans remise)

de K échantillons, chacun de

taille n

Valeurs observées dans l’échantillon

n

o

i

t

a

l

u

p

o

P

)

s

u

d

i

v

i

d

n

i

N

(

Variance du caractère X

observée dans l’échantillon 1

Variance du caractère X

observée dans l’échantillon 2

Variance du caractère X

observée dans l’échantillon 3

Variance du caractère X

observée dans l’échantillon j

Variance du caractère

X observée dans

l’échantillon K

▪ Les variances 𝑠1

2, 𝑠3

2 , 𝑠2

2, …, 𝑠𝐾

2 constituent des valeurs possibles d’une nouvelle variable

aléatoire, qu’on note S2, appelée variance échantillonnale (ou empirique). Ainsi,

la variable

aléatoire S2 décrit les variances du caractère X observées dans les différents échantillons de

taille n qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

25/84

()()211111121231111Échantillon 1:,,,...,,...,1niniixxxxxxxsn=−=−()()221231Échantillon 1:,,,...,,...,1nKKKKKKiniKKiKxxxxxxxsn=−=−()()222222221232211Échantillon 2:,,,...,,...,1niniixxxxxxxsn=−=−()()2212311Échantillon :,,,...,,...,1njjjjjjinijjijxxxxxxxsn=−=−()()233333321233311Échantillon 3:,,,...,,...,1niniixxxxxxxsn=−=−

Échantillonnage

La statistique (ou variable aléatoire) ෠𝑃

Tirages (avec ou sans remise)

de K échantillons, chacun de

taille n

Valeurs observées dans l’échantillon :

n

o

i

t

a

l

u

p

o

P

)

s

u

d

i

v

i

d

n

i

N

(

Proportion des individus ayant la

caractéristique étudiée dans

l’échantillon 1

Proportion des individus ayant

la caractéristique étudiée dans

l’échantillon 2

Proportion des individus ayant

la caractéristique étudiée dans

l’échantillon 3

Proportion des individus ayant

la caractéristique étudiée dans

l’échantillon j

Proportion des individus ayant

la caractéristique étudiée dans

l’échantillon K

▪ Notons que 𝑘𝑗 désigne le nombre d’individus ayant la caractéristique étudiée dans l’échantillon j (j=1..K).

Ƹ𝑝1,

Ƹ𝑝2,

Ƹ𝑝3 , … ,

Ƹ𝑝𝐾 constituent des valeurs possibles d’une nouvelle variable aléatoire,

Les proportions

qu’on note ෠𝑃, appelée proportion échantillonnale (ou empirique). Ainsi, la variable aléatoire ෠𝑃 décrit les

proportions des individus ayant la caractéristique étudiée dans les différents échantillons de taille n

qu’on peut construire (avec ou sans remise) à partir d’une population de taille N.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

26/84

()1111111123111ˆÉchantillon 1:,,,...,,...,niniikxxxxxxpnn===()1231Échantillon 1ˆ:,,,...,,...,nKKKKKKKiniKiKkxxxxxxpnn===()2222222123211ˆÉchantillon 2:,,,...,,...,niniikxxxxxxpnn===()12311ˆÉchantillon :,,,...,,...,njjjjjjjinijikjxxxxxxpnn===()3333333123311ˆÉchantillon 3:,,,...,,...,niniikxxxxxxpnn===1''0jisilindividuideléchantillonjpossèdelacaractéristiqueétudiéexsinon=

Échantillonnage

Distribution d’échantillonnage

▪ Puisque une statistique est une variable aléatoire, alors on pourra s’intéresser à sa

distribution de probabilité, appelé distribution d’échantillonnage.

▪ Dans le cadre de ce chapitre, les distributions d’échantillonnage (ou distribution

de probabilité) des trois statistiques (ou variables aléatoires) suivantes seront

étudiées :

o Distribution d’échantillonnage de la moyenne ത𝑋

o Distribution d’échantillonnage de la variance S2

o Distribution d’échantillonnage de la proportion ෠𝑃

▪ Ainsi, pour chacune de ces trois statistiques, on calculera tout d’abord l’espérance

et la variance : E( ത𝑋), Var( ത𝑋), E(S2), Var(S2), E( ෠𝑃) et Var( ෠𝑃). Ensuite, on discutera de

la nature de la (ou des) loi(s) suivi par chacune de ces trois statistiques.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

27/84

Échantillonnage

Théorème Centrale-Limite (TCL) : Énoncé

▪ Soient X1, X2, …, Xn un échantillon aléatoire de la v.a. X.

Si on pose Sn = X1 + X2 + X3 +…+ Xn alors :

De plus, si n tend vers +∞ (en pratique n ≥ 30 ) alors :

ou d’une façon

équivalente

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

28/84

()()21.2.nXnXESnVarSn==()()2,0,1nXXnXXSNnnSnZNn−=2,nXXSXNnn=Échantillonnage

▪ Exercice d’application du TCL : Soit un lot de 500 chocolats. Le poids d’un

2 = 0.25 g2. Quelle

chocolat est une v.a. d’espérance µX = 5g et de variance σX

est la probabilité qu’une boite de 50 chocolats issus de ce lot ait un poids

total supérieur à 260 g ?

▪ Réponse : Soit S50 = X1 + X2 + …+ X50 la variable aléatoire qui décrit le poids

d’une boite de 50 chocolats où Xi exprime le poids du ième chocolat de cette

2 = 0.25 g2 ), i = 1..50. Puisque n =

boite. On sait que chaque Xi ~ N(µX = 5g, σX

2 = 0.25 x

50 ≥ 30 alors selon le TCL la v.a. S50 ~ N(n x µX = 5x50 =250, n x σX

50 = 12.5). Il est maintenant possible de calculer la probabilité P(S50 ≥ 260),

soit :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

29/84

()()502602502602.830.002312.5PSPZPZ−===Échantillonnage

Distribution d’échantillonnage de la moyenne ത𝑋

▪ Soient X1, X2, …, Xn un échantillon aléatoire de taille n de la v.a. X et ത𝑋 est la

moyenne échantillonnale, alors on a :

(On dit que ത𝑋 est un estimateur sans biais de µX)

▪ Preuve :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

30/84

()()()()1211.2.3.niiXXXXnEXEXVarXVarXnn======()()111111.nniiXXiiEXEXEXnnnn======()()2222111112.nnXiiXiiVarXVarXVarXnnnnn======Échantillonnage

▪ Exercice d’application : Une population est constituée de 4 étudiants en statistique

(le faible effectif n’est pas dû à un manque d’intérêt pour la matière de la part des

étudiants mais au désir de ne pas multiplier inutilement les calculs qui vont suivre !).

Leur professeur s’intéresse au temps hebdomadaire consacré à l’étude des statistiques

par chaque étudiant. Il a obtenu les résultats suivants :

Étudiant

Temps d’étude (en heures)

A

B

C

D

Total

8

3

6

11

28

1. Calculer la moyenne µX et la variance 𝜎𝑋

2 du temps hebdomadaire consacré à

Advertisement

l’étude des statistiques par chaque étudiant (c’est le caractère X étudié) de cette

population de 4 étudiants.

2. Calculer E( ത𝑋) et Var( ത𝑋) sachant que les échantillons sont de taille 2 et que le

tirage a été effectué avec remise.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

31/84

Échantillonnage

▪ Réponse :

Nombre d’échantillons de taille 2 = 16 (Tirage avec remise)

Numéro de

l’échantillon

L’échantillon

Observations de

l’échantillon

Moyenne de

l’échantillon

Numéro de

l’échantillon

L’échantillon

Observations de

l’échantillon

Moyenne de

l’échantillon

1

2

3

4

5

6

7

8

A, A

A, B

A, C

A, D

B, A

B, B

B, C

B, D

8, 8

8, 3

8, 6

8, 11

3, 8

3, 3

3, 6

3, 11

8

5.5

7

9.5

5.5

3

4.5

7

9

10

11

12

13

14

15

16

C, A

C, B

C, C

C, D

D, A

D, B

D, C

D, D

6, 8

6, 3

6, 6

6, 11

11, 8

11, 3

11, 6

11, 11

7

4.5

6

8.5

9.5

7

8.5

11

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

32/84

111836111.()()74NNXiiiiiEXxPXxxN==+++======2222212222()()()()783611498.54NXiiiVarXEXEXxPXx===−==−=+++=−=2.2416nN==Échantillonnage

▪ Réponse (suite …) :

Valeurs

possibles de

la v.a. ത𝑋

Fréquence de

chaque valeur

possible de ത𝑋

Probabilité à associer à

chaque valeur possible de ത𝑋

3

4.5

5.5

6

7

8

8.5

9.5

11

1

2

2

1

4

1

2

2

1

Total

16

0.0625

0.125

0.125

0.0625

0.25

0.0625

0.125

0.125

0.0625

1

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

33/84

2.()()91()()30.06254.50.125...110.06257iiiEXxPXxEX====+++==()922221222()()()()78.5()30.06254.50.125...110.06254953.25494.252iiiVarXEXEXxPXxVarXn==−==−==+++−=−===Échantillonnage

Distribution de probabilité de la statistique 𝑋

(Tirage avec remise ou population infinie)

Taille de

l’échantillon

Loi de X

Variance de X

2

𝜎𝑋

Loi de ത𝑋

Loi réduite

n ≥ 30

Quelconque

connue

inconnue

Quelconque

inconnue

n < 30

Normale

2)

X ~ 𝑁(μX, 𝜎𝑋

connue

inconnue

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

34/84

2,XXXNn2,XsXNn2,XXXNn()0,1XXXNn−()0,1XXNsn−(1)XXtndlSn−−()0,1XXXNn−Échantillonnage

Distribution d’échantillonnage (ou de probabilité ) de la statistique 𝑋

(Tirage sans remise ou population finie)

Taille de

l’échantillon

Loi de X

Variance de X

2

𝜎𝑋

Loi de ത𝑋

Loi réduite

n ≥ 30

Quelconque

connue

inconnue

Quelconque

inconnue

n < 30

Normale

2)

X ~ 𝑁(μX, 𝜎𝑋

connue

inconnue

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

35/84

2,1XXNnXNnN−−2,1XsNnXNnN−−()0,11XXXNNnNn−−−2,1XXNnXNnN−−()0,11XXNsNnNn−−−()0,11XXXNNnNn−−−(1)1XXtndlSNnNn−−−−Échantillonnage

▪ Remarque : Lorsqu’on dispose d’une population de taille N, le nombre

d’échantillons de taille n qu’on peut construire à partir de cette population

varie selon le mode de tirage, soit :

Le nombre d’échantillons lorsqu’on effectue des tirages avec remise

Le nombre d’échantillons lorsqu’on effectue des tirages sans remise

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

36/84

nN=!!()!nNNCnNn==−Échantillonnage

▪ Exemple 1: Supposons que les tailles des individus dans une population (caractère X)

2 = 25 cm2.

suivent une distribution normale de moyenne μX = 170 cm et de variance 𝜎𝑋

On tire avec remise un échantillon de taille 25 de cette population.

Quelle est la probabilité pour que la taille moyenne dans l’échantillon soit supérieure à

172 cm ?

▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et

par conséquent, il nous demande de calculer la probabilité suivante :

Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋

ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

37/84

()172?PX=225,170,125XXXNNn=()()17217017220.0231PXPZPZ−===Échantillonnage

▪ Exemple 2 : Supposons que les tailles des individus dans une population de moyenne

2 inconnue. On tire avec remise un échantillon de taille 36

μX = 185 cm et de variance 𝜎𝑋

de cette population.

Sachant que la variance de cet échantillon s2 = 40 cm2, quelle est la probabilité pour que

la taille moyenne dans l’échantillon soit supérieure à 187 cm ?

▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et

Advertisement

par conséquent, il nous demande de calculer la probabilité suivante :

Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋

ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

38/84

()187?PX=240,185,1.1136XsXNNn=()()1871851871.900.0291.11PXPZPZ−===Échantillonnage

▪ Exemple 3 : Supposons que les tailles des individus dans une population suivent

2

approximativement une loi normale de moyenne μX = 185 cm et de variance 𝜎𝑋

inconnue. On tire avec remise un échantillon de taille 20 de cette population.

Sachant que la variance de cet échantillon s2 = 60 cm2, quelle est la probabilité pour que la

taille moyenne dans l’échantillon soit supérieure à 188 cm ?

▪ Réponse : La taille moyenne dans l’échantillon est décrite par la variable aléatoire ത𝑋 et

par conséquent, il nous demande de calculer la probabilité suivante :

Pour calculer cette probabilité, il faut tout d’abord déterminer la loi de probabilité de ത𝑋

ainsi que ses différents paramètres. En effet, selon le premier tableau (page 34), on a :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

39/84

()188?PX=()()119XXTtndltdlSn−=−()()1881851881.730.056020PXPTPT−===Échantillonnage

Distribution d’échantillonnage de la variance S2

▪ Soient X1, X2, …, Xn un échantillon aléatoires de taille n de la v.a. X et S2 la

variance échantillonnale, alors on a :

(On dit que S2 est un estimateur sans biais de 𝜎𝑋

2)

La formule (3) est rarement utilisée en pratique. Toutefois, si la v.a. X suit une loi normale, alors

la formule de Var(S2) peut être estimée par une formule beaucoup plus simple (3bis).

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

40/84

()()()()()()()221224242424411.12.323.1niiXXXSXXnESVarXVarSavecetEXEXnn==−−==−=+==−−4223.()1bisXVarSsiXNormalen−Échantillonnage

▪ Exercice d’application : Reprenons l’exemple de la population de 4 étudiants et

leur temps hebdomadaire consacré à l’étude des statistiques.

Étudiant

Temps d’étude (en heures)

A

B

C

D

Total

8

3

6

11

28

En utilisant des échantillons de taille 2 tirés avec remise, on vous demande de calculer

E(S2) (𝜎𝑋

2 = 8.5 calculée précédemment).

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

41/84

Échantillonnage

▪ Réponse :

Numéro de

l’échantillon

L’échantillon

Observations de

l’échantillon

Variance s2

Numéro de

l’échantillon

L’échantillon

Observations de

l’échantillon

Variance s2

1

2

3

4

5

6

7

8

A, A

A, B

A, C

A, D

B, A

B, B

B, C

B, D

8, 8

8, 3

8, 6

8, 11

3, 8

3, 3

3, 6

3, 11

0

12.5

2

4.5

12.5

0

4.5

32

9

10

11

12

13

14

15

16

C, A

C, B

C, C

C, D

D, A

D, B

D, C

D, D

6, 8

6, 3

6, 6

6, 11

11, 8

11, 3

11, 6

11, 11

2

4.5

0

12.5

4.5

32

12.5

0

Valeurs

possibles de

la v.a. S2

Fréquence des

valeurs

possibles de S2

Probabilité à associer à

chaque valeur possible de

S2

0

2

4.5

12.5

32

Total

4

2

4

4

2

16

0.25

0.125

0.25

0.25

0.125

1

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

42/84

()52212()()00.2520.125...320.1258.5iiiXESxPSx=====+++==Échantillonnage

Distribution d’échantillonnage (ou de probabilité) de la statistique S2

Théorème

Soient X1, X2, …, Xn un échantillon aléatoire de taille n d’une v.a. X qui suit une

2) et S2 est la variance échantillonnale. On a alors la

loi normale 𝑁(μX, 𝜎𝑋

statistique (ou la variable aléatoire) :

suit une loi du Khi-deux à (n-1) dl.

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

43/84

()221XnSY−=Échantillonnage

▪ Exercice d’application : On fait l’hypothèse que la taille (en cm) des étudiants d’une

école de génie est une variable aléatoire normale X de moyenne μX = 175 et de

2 = 100. Un échantillon de taille 51 est sélectionné de cette population.

variance 𝜎𝑋

Quelle est la probabilité que la variance des tailles dans l’échantillon soit d’au plus

égale 112.66.

▪ Réponse : La variable aléatoire qui décrit la variance du caractère X (taille des

étudiants d’une école de génie) dans l’échantillon est la variance échantillonnale S2.

Ainsi, la probabilité qu’on nous demande de calculer est :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

44/84

()()()()()()22221511112.66112.6610056.3351150156.3310.250.75XnSPSPPYavecYdlPY−−===−==−=−=Échantillonnage

Distribution d’échantillonnage (ou de probabilité) de la statistique ෠𝑃

Distribution d’échantillonnage de ෠𝑃

Soient X1, X2, …, Xn, un échantillon aléatoire de taille n ayant la loi de Bernoulli

ℬ(p) comme loi mère, c’est-à-dire que Xi ~ ℬ(p) pour tout i=1..n. Si ෠𝑃 est la

proportion échantillonnale, alors :

Tirage avec

remise

Tirage sans

remise

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

45/84

()()()()()12...ˆ1.ˆ2.11ˆˆ3./1nXXXPnEPpppppNnVarPVarPnnN+++==−−−==−Échantillonnage

Distribution d’échantillonnage (ou de probabilité) de la statistique ෠𝑃

Distribution d’échantillonnage de ෠𝑃

Si n ≥ 30, n×p ≥ 5 et n×(1 - p) ≥ 5 alors :

Tirage avec

remise

Tirage sans

remise

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

46/84

(1)ˆ1.,(1)ˆ2.,1ppPNpnppNnPNpnN−−−−Échantillonnage

▪ Exercice d’application : Un fabricant de clous a déterminé que 3% des clous produits

sont défectueux. On étudie un échantillon aléatoire de 300 clous (tirage avec remise).

Quelle est la probabilité que la proportion de clous défectueux dans l’échantillon soit

comprise entre 2% et 3,5% ?

▪ Réponse : la variable aléatoire qui décrit la proportion des clous défectueux dans

l’échantillon est ෠𝑃. Puisque n = 300 ≥ 30, n×p = 300×0.03 = 9 ≥ 5 et n×(1 - p) = 300 ×

0.97 = 291 ≥ 5, alors on peut déduire la distribution de probabilité de ෠𝑃 , soit :

▪ Ainsi, la probabilité qu’on nous demande de calculer est :

K. Jabeur - Probabilités et Inférence Statistique - Octobre 2020

47/84

Advertisement

()()()()()()0.020.030.0350.03ˆˆ0.020.0350.0000970.0000971.020.511.020.5111.020.5110.1540....