Principes & Méthodes Statistiques: Tests d’Hypothèses

Page 1 sur 8Lecteur de document UniversityLib

Principes & Méthodes Statistiques: Tests d’Hypothèses

Statistical Hypothesis Testing · course

Browse all mathématiques documents

Module de :

Universit de Manouba

Niveau : 2ime Anne

Principes & Mthodes

Statistiques

Chargs de Cours :

O.Oueslati & A. Alleli

& F. Kadhi

Filire : II2

cole Nationale des

A.Univ. : 2017-2018

Sciences de L’Informatique

Semestre I

Tests d’Hypothses

1. A partir des statistiques compil´ees dans le pass´e, on sait que 40% des individus d’une certaine r´egion

ach`etent le savon de,toilette de marque ”Caresse”. On vient de d´eterminer une compagne publicitaire

dans cette r´egion en faveur du savon Caresse, et pour v´erifier l’efficacit´e, on tire un ´echantillion al´eatoir

de 500 personnes de la r´egion, et on leur demande si maintenant elles ach`etent ou non le savon Caresse.

Si 235 personnes r´epondent ”oui”, peut- on conclure que la compagne publicitaire a ´et´e efficace `a un

niveau de signification α = 5%?

Solution:

Xi =

(cid:26) 1 Si l’individu i de notre ´echantillion ach`ete le savon de marque Caresse

0 Sinon

i=1 Xi ∼ B (n = 500, p)

Xi ∼ B (1, p), alors (cid:80)500

Comme n > 30, on peut approximer cette B (n, p) par une loi normale N (np, np (1 − p)), alors :

n p (1 − p)(cid:1)

(cid:80)500

X : Constitue la proportion des individus qui consomment la marque ”caresse” =⇒ X est une fr´equence

(soit not´e f ).

i=1 Xi ∼ N (np, np (1 − p)) =⇒ X ∼ N (cid:0)p, 1

On veut tester :

(cid:26) H0 :

H1 :

la compagne publicitaire n’est pas efficace

la compagne publicitaire est efficace

(cid:26) H0 : p = 0.4

H1 : p > 0.4

Si la campagne publicitaire est efficace alors la proportion des individus qui consomment le savon ”caresse”

va augmenter par rapport `a la proportion calcul´ee dans le pass´e, qui est de 0.4.

P [rejeter H0| H0 est vraie] = α ⇐⇒ P (cid:2)X > fc|p = 0.4(cid:3) = α ⇐⇒ P

(cid:34)

(cid:35)

X−p

(cid:113) p(1−p)

> fc−p

(cid:113) p(1−p)

n

n

= α, soit

zα = fc−p

(cid:113) p(1−p)

n

Donc, la fr´equence critique : fc = p + zα

On rejette H0 si f0 (fr´equence observ´ee est sup´erieure `a la fr´equence critique fc.

(cid:113) p(1−p)

n

(cid:41)

AN. :

f0 = 235

500 = 0.47

fc = 0.4 + 1.65

(cid:113) 0.4×0.6

500 = 0.436

=⇒ f0 > fc : on va rejeter H0, donc la compagne publicitaire

a ´et´e efficace.

2. Pour apaiser un certain type de maux de tˆete, on a l’habitude de traiter les malades avec un m´edicament

A. Une ´etude statistique a montr´e que la dur´ee de disparition de la douleur chez les malades trait´es

avec A ´etait une variable al´eatoire de loi normale N (m0; σ2

0), avec m0 = 30 mn et σ0 = 5 mn. Un

laboratoire pharmaceutique a conu un nouveau m´edicament B et d´esire tester son efficacit´e. Pour cela,

On a administr´e le m´edicament B ´a 12 malades et relev´e les dur´ees de disparition de la douleur suivantes :

On d´ecide de ne commercialiser B que si on est sr ´a 95% qu’il est plus efficace que A.

25 28 20 32 17 24 41 28 25 30 27 24

1. Traduire cette situation au moyen d’un test d’hypoth´eses.

2. Comment classer ce test ?

3. Peut-on lancer la commercialisation du m´edicament B ?

4. Calculer la p-valeur de ce test.

5. ´ecrire et expliquer la commande R qui permet de faire automatiquement ce test.

Solution:

1.

Il s’agit de tester les hypoth´eses : H0 : µ = 30 contre Ha : µ < 30.

1

2. La statistique du test observ´ee (pour n = 12 ≤ 30).

t =

x − µ0

σ/

n

26.75 − 30

12

6.0772/

= −1.8526.

=

La zone de rejet est : {t < t0.05} = {t < −1.7959}.

D´ecision : Puisque t = −1.8526 est inf´erieure ´a −1.7959, l’hypoth´ese nulle est rejet´ee ´a un niveau de

signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne est inf´erieure

´a 30.

3.

la p-value est,

p − value = P (T < −1.8526) = 0.0455

4. t.test(xi,alternative = "less", mu =mu0)

##

One Sample t-test

##

data: xi

t = -1.9, df = 11, p-value = 0.05

alternative hypothesis: true mean is less than 30

95 percent confidence interval:

-Inf 29.9

sample estimates:

mean of x

26.75

##

3. Dans une usine du secteur de l’agroalimentaire, une machine ´a embouteiller est aliment´ee par un r´eservoir

Advertisement

d’eau et par une file d’approvisionnement en bouteilles vides. Pour contrˆoler le bon fonctionnement de

la machine, on veut construire un test d’hypoth´ese bilat´eral qui sera mis en oeuvre toutes les heures.

Pour une production d’une heure, on suppose que la variable al´eatoire X qui ´a toute bouteille, prise

au hasard dans cette production, associe le volume d’eau (en litres) qu’elle contient, est une variable

al´eatoire d’esp´erance m et d’´ecart-type σ inconnus. On consid´ere que la machine est bien r´egl´ee lorsque

le volume d’eau moyen dans une bouteille est 1.5 l. On a pr´elev´e un ´echantillon de n = 100 bouteilles, et

on a obtenu un volume d’eau moyen de x = 1.495 l et un ´ecart-type corrig´e de sc = 0.01 l.

1. Peut-on conclure, au risque 5%, que la machine est bien r´egl´ee ?

2. Reprendre la mˆeme question avec sc = 0.04. Interpr´eter le r´esultat.

Solution:

Soit µ la vraie moyenne de la population.

1. — Il s’agit de tester les hypoth´eses : H0 : µ = 1.5 contre Ha : µ (cid:54)= 1.5.

— La statistique du test observ´ee (pour n = 100 ≥ 30).

z =

=

x − µ0

σ/

n

1.495 − 1.5

100

0.01/

= −5.

— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.

— D´ecision : Puisque z = −5 est inf´erieure ´a −1.96, l’hypoth´ese nulle est rejet´ee ´a un niveau de

signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne est

diff´erente de 1.5.

2. Avec sc = 0.04.

2

— La statistique du test observ´ee (pour n = 100 ≥ 30).

z =

x − µ0

σ/

n

1.495 − 1.5

100

0.04/

= −1.25.

=

— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.

— D´ecision : Puisque z = −1.25 est sup´erieure ´a −1.96, l’hypoth´ese nulle n’est pas rejet´ee ´a un

niveau de signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne

n’est pas diff´erente de 1.5.

4. Supposons que le temps X n´ecessaire aux candidats pour un test ´ecrit pour l’obtention d’un permis de

conduire suit une distribution Normale. Le pr´epos´e au test affirme que selon son exp´erience, la variance

de ce temps est de 64 mn. A priori, on n’a pas la raison particuli´ere de croire que cette variance pourrait

ˆetre plus grande ou plus petite que 64 mn (c’est ´a dire que l’affirmation du pr´epos´e est fausse). Pour

v´erifier son affirmation, on choisit au hasard 25 individus qui ont pass´e ce test, et l’on obtient une variance

corrig´ee s2

Solution:

— Il s’agit de tester H0 : σ2 = 64 contre Ha : σ2 (cid:54)= 64 pour α = 0.05 et 25 degr´es de libert´e,

— La r´egion de rejet est

c = 38.44. Devrait-on rejeter l’affirmation du pr´epos´e au niveau α = 5%.

RR =

(cid:110)

χ2 < χ2

1−α/2,n−1 ou χ2 > χ2

α/2,n−1

(cid:111)

— La valeur observ´ee du TS est,

= (cid:8)χ2 < 12.4012 ou χ2 > 39.3641(cid:9) .

χ2 =

(n − 1)S2

σ2

0

=

(n)(38.44)

64

= 15.0156.

— Puisque la valeur de la statistique de test ne tombe pas dans la r´egion de rejet, nous ne pouvons pas

rejeter H0 au niveau de signification de 5%. Ici, nous avons suppos´e que les 25 mesures suivent la

distribution normale.

5. Soient p1 et p2 les proportion de pi´eces d´efectueuses produites, respectivement, par une machin 1 et une

machine 2. La machine 1 a produit 96 pi´eces dont 12 d´efectueuses. La machine 2 a produit 55 pi´eces dont

10 d´efectueuses. On se pose la question si on peut en conclure que la machine 1 est significativement plus

performante que la machine 2.

1. ´ecrire le test d’hypoth´eses ad´equat pour cette question : pr´eciser les deux hypoth´eses H0 et H1

2. Supposons que H 0 est vraie. Soient T1 et T2 les v.a qui repr´esentent le nombre de pi´eces d´efectueuse

produites, respectivement, par la machine 1 et la machine 2. Construire une statistique U qui permet

de d´ecider le rejet de H0 avec un risque α de se tremper.

3. Si on se permet d’une erreur de 5%, est ce qu’on peut conclure que la machine 1 est plus performante

que la machine 2 ?

4. Calculer la p-valeur de ce test.

5. Quel est le risque d’erreur qu’il faudrait prendre pour rejeter H0 . Conclure.

6. ´ecrire le code R qui permet de r´ealiser ce test.

Solution:

n1= 96

nd1 = 12

p1.hat = nd1/n1

n2 = 55

nd2 = 10

p2.hat = nd2/n2

z = (p1.hat - p2.hat)/ sqrt(p1.hat(1-p1.hat)/n1 + p2.hat(1-p2.hat)/n2)

z

[1] -0.9164

Soient p1 et p2 les proportions et T1 et T2 les v.a qui repr´esentent les nombres, respectivement des pi´eces

d´efectueuses produites par les machines 1 et 2. Les donn´ees : n1 = 12, n2 = 10, ˆp1 = 0.125 et ˆp2 = 0.1818.

3

Il s’agit de tester H0 : p1 − p2 = 0 contre Ha : p1 − p2 < 0.

1.

2. Sous H0 est vraie, la statistique de test est,

z =

p1 − p2

(cid:113) p1q1

n1

+ p2q2

n2

∼ N (0, 1)

La zone de rejet est, z < −zα. La valeur observ´ee de la statistique est,

z =

=

ˆp1 − ˆp2

(cid:113) ˆp1 ˆq1

n1

+ ˆp1 ˆq2

Advertisement

n2

0.125 − 0.1818

(cid:113) (0.125)(1−0.125)

96

+ (0.1818)(1−0.1818)

55

= −0.9164.

3. Pour α = 0.01, z0.01 = 1.6449. Par cons´equent, la r´egion de rejet est z < −1.6449.

4. Puisque la valeur observ´ee de la statistique de test ne tombe pas dans la r´egion de rejet, ´a α = 0.05,

il n’y a pas suffisamment de preuves pour conclure que la machine 1 est plus performante que la

machine 2.

5. La p-valeur de ce test.

p − value = P (Z < −0.9164) = 0.1797

6. Pour pouvoir rejeter H0, il faudrait prendre un risque d’erreur d’au moins ´egale ´a la p−value. Puisque

α = 0.05 < p − value = 0.1797, on accepte l’hypoth´ese nulle.

7. prop.test(c(nd1,nd2),c(n1,n2),alternative="less",correct = FALSE)

##

2-sample test for equality of proportions without

continuity correction

##

data: c(nd1, nd2) out of c(n1, n2)

X-squared = 0.91, df = 1, p-value = 0.2

alternative hypothesis: less

95 percent confidence interval:

-1.00000

0.04516

sample estimates:

prop 1 prop 2

0.1250 0.1818

6. Dans un article de la revue Biometrica, le biologiste Latter donne la longueur (en mm) des oeufs de

Coucou trouv´es dans les nids de deux esp´eces d’oiseaux :

— Dans des nids de petite taille (Roitelet) :

19.8 22.1 21.5 20.9 22.0 21.0 22.3 21.0 20.3 20.9 22.0 22.0 20.8 21.2 21.0

— Dans des nids de taille plus grande (Fauvette) :

22.0 23.9 20.9 23.8 25.0 24.0 23.8 21.7 22.8 23.1 23.5 23.0 23.1 23.0

On se demande si le Coucou adapte la taille de ses oeufs ´a la taille du nid. Soient X1 et X2 les v.a mesurant,

respectivement, la longueur des oeufs dans les nids de Roitelet et ceux dans les nids de Fauvette. On

suppose que X1 ∼ N (m1, σ2

2). On pose

1) et X2 ∼ N (m2, σ2

X 1 =

X 2 =

1

n1

1

n2

n1(cid:88)

i=1

n2(cid:88)

i=1

X1,i; S2

1 =

X2,i; S2

2 =

1

n1

1

n2

n1(cid:88)

i=1

n2(cid:88)

i=1

(X1,i − X 1)2; S2

c,1 =

(X2,i − X 2)2; S2

c,2 =

n1

n1 − 1

S2

1

n2

n2 − 1

S2

2

Soit α = 0.05.

1. Calculer les estimations ponctuelles de la moyenne et de la variance corrig´ee pour chaque ´echantillon.

2. Consid´erons le test H0 : σ2

1 (cid:54)= σ2

2.

1 = σ2

a. Si H0 est vraie, quelle est la loi de F =

2 contre l’hypoth´ese H1 : σ2

S2

c,1

S2

4

c,2

.

b. Calculer f =

s2

c,1

s2

c,2

et f (cid:48) =

s2

c,2

s2

c,1

.

c. Soit F (cid:48) = 1

d. D´ecider si les variances des deux populations ne sont pas diff´erentes significativement au risque α.

F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.

e. ´ecrire et expliquer la commande R qui permet de faire automatiquement ce test.

f. Calculer une estimation de la valeur commune σ2 de σ2

3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose

1 et σ2

2.

S2

c,1,2 =

(n1 − 1)S2

c,1 + (n2 − 1)S2

c,2

n1 + n2 − 2

a. Sous H0 , qu’elle est la lois de T =

X 1−X 2

1/n1+1/n2

.

Advertisement

Sc,1,2

b. D´eterminer tα/2 tel que P (−tα/2 < T < tα/2) = 1 − α.

c. Justifier si on peut rejeter H0 avec une probabilit´e α de se tromper.

d. ´ecrire le code R qui permet de faire automatiquement ce test.

4. Refaire ce probl´eme avec α = 0.02.

Solution:

x1 =c(19.8,22.1,21.5,20.9,22.0,21.0,22.3,21.0,20.3,20.9,22.0,22.0,20.8,21.2,21.0)

x2 =c(22.0,23.9,20.9,23.8,25.0,24.0,23.8,21.7,22.8,23.1,23.5,23.0,23.1,23.0)

1. Les estimations ponctuelles de la moyenne :

m1.hat = mean(x1); m1.hat

[1] 21.25

m2.hat = mean(x2); m2.hat

[1] 23.11

et de la variance corrig´ee pour chaque ´echantillon.

sigma21.hat = var(x1); sigma21.hat

[1] 0.5155

sigma22.hat = var(x2); sigma22.hat

[1] 1.101

2. Consid´erons le test H0 : σ2

S2

S2

a. Si H0 est vraie,F =

c,1

c,2

1 = σ2

2 contre l’hypoth´ese H1 : σ2

1 (cid:54)= σ2

2.

∼ F (n1 − 1, n2 − 1).

b. Calculer f =

s2

c,1

s2

c,2

et f (cid:48) =

s2

c,2

s2

c,1

.

f= sigma21.hat/sigma22.hat; f

[1] 0.4681

f.pr = 1/f; f.pr

[1] 2.136

c. Soit F (cid:48) = 1

F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.

1/Fα(n1 − 1, n2 − 1) = F1−α(n2 − 1, n1 − 1)

n1 = length(x1)

n2= length(x2)

alpha = 0.05

a= 1/qf(alpha/2, n1-1, n2-1)

a

[1] 3.012

d. D´ecider si les variances des deux populations ne sont pas diff´erentes significativement au risque α.

— Il s’agit de tester H0 : σ2

1 = σ2

2 contre Ha : σ2

1 (cid:54)= σ2

2. C’est un test bilat´eral.

5

— Ici, les degr´es de libert´e sont v1 = 15 − 1 = 14 et v2 = 14 − 1 = 13. La statistique de test est

f =

s2

1

s2

2

0.5155

1.1013

= 0.4681.

=

— A partir de la table F , F0.025(14, 13) = 3.0819 et F0.975(14, 13) = (1/F0.025(13, 14)) = 0.332.

— Par cons´equent, la r´egion de rejet est F > 3.0819 ou F < 0.332.

— Puisque la valeur observ´ee de la statistique de test, 0.4681, n’est pas dans la zone de rejet, on

ne rejette pas l’hypoth´ese nulle.

Il existe des preuves que les variances de la population sont ´egales.

e. var.test(x1,x2)

##

F test to compare two variances

##

data: x1 and x2

F = 0.47, num df = 14, denom df = 13, p-value = 0.2

alternative hypothesis: true ratio of variances is not equal to 1

95 percent confidence interval:

0.1519 1.4099

sample estimates:

ratio of variances

0.4681

##

f. Calculer une estimation de la valeur commune σ2 de σ2

1 et σ2

2. Puisque les variances sont ´egales

et les deux ´echantillons sont ind´ependants,

sp.2 = ((n1 -1) sigma21.hat + (n2-1)sigma22.hat)/(n1+n2-2)

S2

p =

(n1 − 1)S2

1 + (n2 − 1)S2

2

n − 1 + n2 − 2

A.N. : =

(15 − 1)0.5155(14 − 1)1.1013

15 + 15 − 2

= 0.7976

3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose

a. Sous H0 ,

S2

c,1,2 =

(n1 − 1)S2

c,1 + (n2 − 1)S2

c,2

n1 + n2 − 2

T =

X 1 − X 2

(cid:112)1/n1 + 1/n2

Sc,1,2

∼ t(n1 + n2 − 2)

b. D´eterminer tα tel que P (−tα/2 < T < tα/2) = 1 − α.

n =n1+n2-2

Advertisement

qt(alpha/2,n)

[1] -2.052

c. Justifier si on peut rejeter H0 avec une probabilit´e α de se tromper.

— On veut tester, H0 : m1 − m2 = 0 contre Ha : m1 − m2 (cid:54)= 0

— La statistique de test est,

T= (m1.hat - m2.hat)/(sqrt(sp.2 *(1/n1 + 1/n2)))

T

[1] -5.607

6

T =

=

X 1 − X 2 − D0

(cid:113) 1

n1

sp

+ 1

n2

21.2533 − 23.1143

(cid:113) 1

15 + 1

0.7976

14

= −5.6074

— Pour α = 0.05, t0.025,29 = −2.0518. Par cons´equent, la r´egion de rejet est t < −2.0518 ou

t > 2.0518.

— Puisque la valeur observ´ee de la statistique de test, T = −5.6074, tombe dans la r´egion de

rejet, il y a assez de preuves pour conclure que les longueurs des nids sont diff´erents pour les

deux groupes.

d. ´ecrire le code R qui permet de faire automatiquement ce test.

x1 and x2

t.test(x1,x2,var.equal = TRUE)

##

Two Sample t-test

##

data:

t = -5.6, df = 27, p-value = 6e-06

alternative hypothesis: true difference in means is not equal to 0

95 percent confidence interval:

-2.542 -1.180

sample estimates:

mean of x mean of y

23.11

##

21.25

4. Refaire ce probl´eme avec α = 0.02.

7. Deux ´echantillons sont dits appari´es si et seulement si ils sont constitu´es de deux mesures successives de

la mˆeme variable sur les mˆemes individus. Afin de mesurer les effets d’un nouveau r´egime amaigrissant,

celui-ci a ´et´e teste sur 15 individus pris au hasard dans une population. Le tableau suivant donne leur

poids en kg avant et apr´es le r´egime :

avant : 70 75 80 60 64 66 70 74 78 80 82 90 101 84 77

apr´es : 68 76 74 58 65 60 70 70 75 79 78 95 103 80 74

On se contentera ici de supposer que les deux ´echantillons sont gaussiens,

1. Le r´egime est-il efficace ?

2. ´ecrire le code R qui permet de faire automatiquement ce test.

Solution:

xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)

xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)

1. — On doit tester l’hypoth´ese, H0 : µD = 0 contre H:µD < 0.

— On calcule d’abord la diff´erence de chaque paire de donn´ee,

d= xap - xav

d

[1] -2 1 -6 -2 1 -6

0 -4 -3 -1 -4

5

2 -4 -3

avant :

apr´es :

Diff´erence -2 1 -6 -2 1 -6 0 -4 -3 -1 -4 5

70 75 80 60 64 66 70 74 78 80 82 90 101 84 77

68 76 74 58 65 60 70 70 75 79 78 95 103 80 74

-4 -3

2

d0=0

n= length(d)

mean.d = mean(d)

mean.d

[1] -1.733

s.d = sd(d)

s.d

[1] 3.081

D’apr´es le tableau, la moyenne des diff´erences est d = −1.7333 et l’´ecart type sd = 3.0814.

7

— La statistique de test est,

t = (mean.d -d0)/(s.d/sqrt(n))

t =

d − d0

n

sd/

−1.7333 − 0

15

3.0814/

= −2.1786

=

— ´a partir la table t, t0.05,14 = −1.7613.

— Puisque la valeur observ´ee de t = −2.1786 < −t0.05,14 = 1.7613, on rejette l’hypoth´ese nulle et

conclure que cet exemple de preuve sugg´ere que le nouveau r´egime et programme d’exercice est

efficace.

2. xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)

xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)

t.test(xap-xav,alternative ="less")

##

One Sample t-test

##

data: xap - xav

t = -2.2, df = 14, p-value = 0.02

alternative hypothesis: true mean is less than 0

95 percent confidence interval:

##

sample estimates:

mean of x

-1.733

##

-Inf -0.332

8