Principes & Méthodes Statistiques: Tests d’Hypothèses

Page 1 sur 8Lecteur de document UniversityLib

Principes & Méthodes Statistiques: Tests d’Hypothèses

Statistical Hypothesis Testing · course

Voir tous les documents en mathématiques

Module de :

Universit de Manouba

Niveau : 2ime Anne

Principes & Mthodes

Statistiques

Chargs de Cours :

O.Oueslati & A. Alleli

& F. Kadhi

Filire : II2

cole Nationale des

A.Univ. : 2017-2018

Sciences de L’Informatique

Semestre I

Tests d’Hypothses

1. A partir des statistiques compilées dans le passé, on sait que 40% des individus d’une certaine région

achètent le savon de,toilette de marque ”Caresse”. On vient de déterminer une compagne publicitaire

dans cette région en faveur du savon Caresse, et pour vérifier l’efficacité, on tire un échantillion aléatoir

de 500 personnes de la région, et on leur demande si maintenant elles achètent ou non le savon Caresse.

Si 235 personnes répondent ”oui”, peut- on conclure que la compagne publicitaire a été efficace à un

niveau de signification α = 5%?

Solution:

Xi =

(cid:26) 1 Si l’individu i de notre échantillion achète le savon de marque Caresse

0 Sinon

i=1 Xi ∼ B (n = 500, p)

Xi ∼ B (1, p), alors (cid:80)500

Comme n > 30, on peut approximer cette B (n, p) par une loi normale N (np, np (1 − p)), alors :

n p (1 − p)(cid:1)

(cid:80)500

X : Constitue la proportion des individus qui consomment la marque ”caresse” =⇒ X est une fréquence

(soit noté f ).

i=1 Xi ∼ N (np, np (1 − p)) =⇒ X ∼ N (cid:0)p, 1

On veut tester :

(cid:26) H0 :

H1 :

la compagne publicitaire n’est pas efficace

la compagne publicitaire est efficace

⇔

(cid:26) H0 : p = 0.4

H1 : p > 0.4

Si la campagne publicitaire est efficace alors la proportion des individus qui consomment le savon ”caresse”

va augmenter par rapport à la proportion calculée dans le passé, qui est de 0.4.

P [rejeter H0| H0 est vraie] = α ⇐⇒ P (cid:2)X > fc|p = 0.4(cid:3) = α ⇐⇒ P

(cid:34)

(cid:35)

X−p

(cid:113) p(1−p)

> fc−p

(cid:113) p(1−p)

n

n

= α, soit

zα = fc−p

(cid:113) p(1−p)

n

Donc, la fréquence critique : fc = p + zα

On rejette H0 si f0 (fréquence observée est supérieure à la fréquence critique fc.

(cid:113) p(1−p)

n

(cid:41)

AN. :

f0 = 235

500 = 0.47

fc = 0.4 + 1.65

(cid:113) 0.4×0.6

500 = 0.436

=⇒ f0 > fc : on va rejeter H0, donc la compagne publicitaire

a été efficace.

2. Pour apaiser un certain type de maux de tête, on a l’habitude de traiter les malades avec un médicament

A. Une étude statistique a montré que la durée de disparition de la douleur chez les malades traités

avec A était une variable aléatoire de loi normale N (m0; σ2

0), avec m0 = 30 mn et σ0 = 5 mn. Un

laboratoire pharmaceutique a conu un nouveau médicament B et désire tester son efficacité. Pour cela,

On a administré le médicament B á 12 malades et relevé les durées de disparition de la douleur suivantes :

On décide de ne commercialiser B que si on est sr á 95% qu’il est plus efficace que A.

25 28 20 32 17 24 41 28 25 30 27 24

1. Traduire cette situation au moyen d’un test d’hypothéses.

2. Comment classer ce test ?

3. Peut-on lancer la commercialisation du médicament B ?

4. Calculer la p-valeur de ce test.

5. écrire et expliquer la commande R qui permet de faire automatiquement ce test.

Solution:

1.

Il s’agit de tester les hypothéses : H0 : µ = 30 contre Ha : µ < 30.

1

2. La statistique du test observée (pour n = 12 ≤ 30).

t =

x − µ0

√

σ/

n

26.75 − 30

12

6.0772/

= −1.8526.

√

=

La zone de rejet est : {t < t0.05} = {t < −1.7959}.

Décision : Puisque t = −1.8526 est inférieure á −1.7959, l’hypothése nulle est rejetée á un niveau de

signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne est inférieure

á 30.

3.

la p-value est,

p − value = P (T < −1.8526) = 0.0455

4. t.test(xi,alternative = "less", mu =mu0)

##

One Sample t-test

##

data: xi

t = -1.9, df = 11, p-value = 0.05

alternative hypothesis: true mean is less than 30

95 percent confidence interval:

-Inf 29.9

sample estimates:

mean of x

26.75

##

3. Dans une usine du secteur de l’agroalimentaire, une machine á embouteiller est alimentée par un réservoir

d’eau et par une file d’approvisionnement en bouteilles vides. Pour contrôler le bon fonctionnement de

la machine, on veut construire un test d’hypothése bilatéral qui sera mis en oeuvre toutes les heures.

Pour une production d’une heure, on suppose que la variable aléatoire X qui á toute bouteille, prise

au hasard dans cette production, associe le volume d’eau (en litres) qu’elle contient, est une variable

aléatoire d’espérance m et d’écart-type σ inconnus. On considére que la machine est bien réglée lorsque

le volume d’eau moyen dans une bouteille est 1.5 l. On a prélevé un échantillon de n = 100 bouteilles, et

on a obtenu un volume d’eau moyen de x = 1.495 l et un écart-type corrigé de sc = 0.01 l.

1. Peut-on conclure, au risque 5%, que la machine est bien réglée ?

2. Reprendre la même question avec sc = 0.04. Interpréter le résultat.

Solution:

Soit µ la vraie moyenne de la population.

1. — Il s’agit de tester les hypothéses : H0 : µ = 1.5 contre Ha : µ (cid:54)= 1.5.

— La statistique du test observée (pour n = 100 ≥ 30).

z =

=

x − µ0

√

σ/

n

1.495 − 1.5

√

100

0.01/

= −5.

— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.

— Décision : Puisque z = −5 est inférieure á −1.96, l’hypothése nulle est rejetée á un niveau de

signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne est

différente de 1.5.

2. Avec sc = 0.04.

2

Publicité

— La statistique du test observée (pour n = 100 ≥ 30).

z =

x − µ0

√

σ/

n

1.495 − 1.5

√

100

0.04/

= −1.25.

=

— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.

— Décision : Puisque z = −1.25 est supérieure á −1.96, l’hypothése nulle n’est pas rejetée á un

niveau de signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne

n’est pas différente de 1.5.

4. Supposons que le temps X nécessaire aux candidats pour un test écrit pour l’obtention d’un permis de

conduire suit une distribution Normale. Le préposé au test affirme que selon son expérience, la variance

de ce temps est de 64 mn. A priori, on n’a pas la raison particuliére de croire que cette variance pourrait

être plus grande ou plus petite que 64 mn (c’est á dire que l’affirmation du préposé est fausse). Pour

vérifier son affirmation, on choisit au hasard 25 individus qui ont passé ce test, et l’on obtient une variance

corrigée s2

Solution:

— Il s’agit de tester H0 : σ2 = 64 contre Ha : σ2 (cid:54)= 64 pour α = 0.05 et 25 degrés de liberté,

— La région de rejet est

c = 38.44. Devrait-on rejeter l’affirmation du préposé au niveau α = 5%.

RR =

(cid:110)

χ2 < χ2

1−α/2,n−1 ou χ2 > χ2

α/2,n−1

(cid:111)

— La valeur observée du TS est,

= (cid:8)χ2 < 12.4012 ou χ2 > 39.3641(cid:9) .

χ2 =

(n − 1)S2

σ2

0

=

(n)(38.44)

64

= 15.0156.

— Puisque la valeur de la statistique de test ne tombe pas dans la région de rejet, nous ne pouvons pas

rejeter H0 au niveau de signification de 5%. Ici, nous avons supposé que les 25 mesures suivent la

distribution normale.

5. Soient p1 et p2 les proportion de piéces défectueuses produites, respectivement, par une machin 1 et une

machine 2. La machine 1 a produit 96 piéces dont 12 défectueuses. La machine 2 a produit 55 piéces dont

10 défectueuses. On se pose la question si on peut en conclure que la machine 1 est significativement plus

performante que la machine 2.

1. écrire le test d’hypothéses adéquat pour cette question : préciser les deux hypothéses H0 et H1

2. Supposons que H 0 est vraie. Soient T1 et T2 les v.a qui représentent le nombre de piéces défectueuse

produites, respectivement, par la machine 1 et la machine 2. Construire une statistique U qui permet

de décider le rejet de H0 avec un risque α de se tremper.

3. Si on se permet d’une erreur de 5%, est ce qu’on peut conclure que la machine 1 est plus performante

que la machine 2 ?

4. Calculer la p-valeur de ce test.

5. Quel est le risque d’erreur qu’il faudrait prendre pour rejeter H0 . Conclure.

6. écrire le code R qui permet de réaliser ce test.

Solution:

n1= 96

nd1 = 12

p1.hat = nd1/n1

n2 = 55

nd2 = 10

p2.hat = nd2/n2

z = (p1.hat - p2.hat)/ sqrt(p1.hat(1-p1.hat)/n1 + p2.hat(1-p2.hat)/n2)

z

[1] -0.9164

Soient p1 et p2 les proportions et T1 et T2 les v.a qui représentent les nombres, respectivement des piéces

défectueuses produites par les machines 1 et 2. Les données : n1 = 12, n2 = 10, ˆp1 = 0.125 et ˆp2 = 0.1818.

3

Il s’agit de tester H0 : p1 − p2 = 0 contre Ha : p1 − p2 < 0.

1.

2. Sous H0 est vraie, la statistique de test est,

z =

p1 − p2

(cid:113) p1q1

n1

+ p2q2

n2

∼ N (0, 1)

La zone de rejet est, z < −zα. La valeur observée de la statistique est,

z =

=

ˆp1 − ˆp2

(cid:113) ˆp1 ˆq1

n1

+ ˆp1 ˆq2

n2

0.125 − 0.1818

(cid:113) (0.125)(1−0.125)

96

+ (0.1818)(1−0.1818)

55

= −0.9164.

3. Pour α = 0.01, z0.01 = 1.6449. Par conséquent, la région de rejet est z < −1.6449.

4. Puisque la valeur observée de la statistique de test ne tombe pas dans la région de rejet, á α = 0.05,

il n’y a pas suffisamment de preuves pour conclure que la machine 1 est plus performante que la

machine 2.

5. La p-valeur de ce test.

p − value = P (Z < −0.9164) = 0.1797

6. Pour pouvoir rejeter H0, il faudrait prendre un risque d’erreur d’au moins égale á la p−value. Puisque

α = 0.05 < p − value = 0.1797, on accepte l’hypothése nulle.

7. prop.test(c(nd1,nd2),c(n1,n2),alternative="less",correct = FALSE)

##

2-sample test for equality of proportions without

continuity correction

##

data: c(nd1, nd2) out of c(n1, n2)

X-squared = 0.91, df = 1, p-value = 0.2

alternative hypothesis: less

95 percent confidence interval:

-1.00000

0.04516

sample estimates:

prop 1 prop 2

0.1250 0.1818

6. Dans un article de la revue Biometrica, le biologiste Latter donne la longueur (en mm) des oeufs de

Coucou trouvés dans les nids de deux espéces d’oiseaux :

— Dans des nids de petite taille (Roitelet) :

19.8 22.1 21.5 20.9 22.0 21.0 22.3 21.0 20.3 20.9 22.0 22.0 20.8 21.2 21.0

— Dans des nids de taille plus grande (Fauvette) :

22.0 23.9 20.9 23.8 25.0 24.0 23.8 21.7 22.8 23.1 23.5 23.0 23.1 23.0

On se demande si le Coucou adapte la taille de ses oeufs á la taille du nid. Soient X1 et X2 les v.a mesurant,

respectivement, la longueur des oeufs dans les nids de Roitelet et ceux dans les nids de Fauvette. On

suppose que X1 ∼ N (m1, σ2

2). On pose

1) et X2 ∼ N (m2, σ2

X 1 =

X 2 =

1

n1

1

n2

n1(cid:88)

i=1

n2(cid:88)

i=1

X1,i; S2

1 =

X2,i; S2

2 =

1

n1

1

n2

n1(cid:88)

i=1

Publicité

n2(cid:88)

i=1

(X1,i − X 1)2; S2

c,1 =

(X2,i − X 2)2; S2

c,2 =

n1

n1 − 1

S2

1

n2

n2 − 1

S2

2

Soit α = 0.05.

1. Calculer les estimations ponctuelles de la moyenne et de la variance corrigée pour chaque échantillon.

2. Considérons le test H0 : σ2

1 (cid:54)= σ2

2.

1 = σ2

a. Si H0 est vraie, quelle est la loi de F =

2 contre l’hypothése H1 : σ2

S2

c,1

S2

4

c,2

.

b. Calculer f =

s2

c,1

s2

c,2

et f (cid:48) =

s2

c,2

s2

c,1

.

c. Soit F (cid:48) = 1

d. Décider si les variances des deux populations ne sont pas différentes significativement au risque α.

F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.

e. écrire et expliquer la commande R qui permet de faire automatiquement ce test.

f. Calculer une estimation de la valeur commune σ2 de σ2

3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose

1 et σ2

2.

S2

c,1,2 =

(n1 − 1)S2

c,1 + (n2 − 1)S2

c,2

n1 + n2 − 2

a. Sous H0 , qu’elle est la lois de T =

X 1−X 2

√

1/n1+1/n2

.

Sc,1,2

b. Déterminer tα/2 tel que P (−tα/2 < T < tα/2) = 1 − α.

c. Justifier si on peut rejeter H0 avec une probabilité α de se tromper.

d. écrire le code R qui permet de faire automatiquement ce test.

4. Refaire ce probléme avec α = 0.02.

Solution:

x1 =c(19.8,22.1,21.5,20.9,22.0,21.0,22.3,21.0,20.3,20.9,22.0,22.0,20.8,21.2,21.0)

x2 =c(22.0,23.9,20.9,23.8,25.0,24.0,23.8,21.7,22.8,23.1,23.5,23.0,23.1,23.0)

1. Les estimations ponctuelles de la moyenne :

m1.hat = mean(x1); m1.hat

[1] 21.25

m2.hat = mean(x2); m2.hat

[1] 23.11

et de la variance corrigée pour chaque échantillon.

sigma21.hat = var(x1); sigma21.hat

[1] 0.5155

sigma22.hat = var(x2); sigma22.hat

[1] 1.101

2. Considérons le test H0 : σ2

S2

S2

a. Si H0 est vraie,F =

c,1

c,2

1 = σ2

2 contre l’hypothése H1 : σ2

1 (cid:54)= σ2

2.

∼ F (n1 − 1, n2 − 1).

b. Calculer f =

s2

c,1

s2

c,2

et f (cid:48) =

s2

c,2

s2

c,1

.

f= sigma21.hat/sigma22.hat; f

[1] 0.4681

f.pr = 1/f; f.pr

[1] 2.136

c. Soit F (cid:48) = 1

F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.

1/Fα(n1 − 1, n2 − 1) = F1−α(n2 − 1, n1 − 1)

n1 = length(x1)

n2= length(x2)

alpha = 0.05

a= 1/qf(alpha/2, n1-1, n2-1)

a

[1] 3.012

d. Décider si les variances des deux populations ne sont pas différentes significativement au risque α.

— Il s’agit de tester H0 : σ2

1 = σ2

2 contre Ha : σ2

1 (cid:54)= σ2

2. C’est un test bilatéral.

5

— Ici, les degrés de liberté sont v1 = 15 − 1 = 14 et v2 = 14 − 1 = 13. La statistique de test est

f =

s2

1

s2

2

0.5155

1.1013

= 0.4681.

=

— A partir de la table F , F0.025(14, 13) = 3.0819 et F0.975(14, 13) = (1/F0.025(13, 14)) = 0.332.

— Par conséquent, la région de rejet est F > 3.0819 ou F < 0.332.

— Puisque la valeur observée de la statistique de test, 0.4681, n’est pas dans la zone de rejet, on

ne rejette pas l’hypothése nulle.

Il existe des preuves que les variances de la population sont égales.

e. var.test(x1,x2)

##

F test to compare two variances

##

data: x1 and x2

F = 0.47, num df = 14, denom df = 13, p-value = 0.2

alternative hypothesis: true ratio of variances is not equal to 1

95 percent confidence interval:

0.1519 1.4099

sample estimates:

ratio of variances

0.4681

##

f. Calculer une estimation de la valeur commune σ2 de σ2

1 et σ2

Publicité

2. Puisque les variances sont égales

et les deux échantillons sont indépendants,

sp.2 = ((n1 -1) sigma21.hat + (n2-1)sigma22.hat)/(n1+n2-2)

S2

p =

(n1 − 1)S2

1 + (n2 − 1)S2

2

n − 1 + n2 − 2

A.N. : =

(15 − 1)0.5155(14 − 1)1.1013

15 + 15 − 2

= 0.7976

3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose

a. Sous H0 ,

S2

c,1,2 =

(n1 − 1)S2

c,1 + (n2 − 1)S2

c,2

n1 + n2 − 2

T =

X 1 − X 2

(cid:112)1/n1 + 1/n2

Sc,1,2

∼ t(n1 + n2 − 2)

b. Déterminer tα tel que P (−tα/2 < T < tα/2) = 1 − α.

n =n1+n2-2

qt(alpha/2,n)

[1] -2.052

c. Justifier si on peut rejeter H0 avec une probabilité α de se tromper.

— On veut tester, H0 : m1 − m2 = 0 contre Ha : m1 − m2 (cid:54)= 0

— La statistique de test est,

T= (m1.hat - m2.hat)/(sqrt(sp.2 *(1/n1 + 1/n2)))

T

[1] -5.607

6

T =

=

X 1 − X 2 − D0

(cid:113) 1

n1

sp

+ 1

n2

21.2533 − 23.1143

√

(cid:113) 1

15 + 1

0.7976

14

= −5.6074

— Pour α = 0.05, t0.025,29 = −2.0518. Par conséquent, la région de rejet est t < −2.0518 ou

t > 2.0518.

— Puisque la valeur observée de la statistique de test, T = −5.6074, tombe dans la région de

rejet, il y a assez de preuves pour conclure que les longueurs des nids sont différents pour les

deux groupes.

d. écrire le code R qui permet de faire automatiquement ce test.

x1 and x2

t.test(x1,x2,var.equal = TRUE)

##

Two Sample t-test

##

data:

t = -5.6, df = 27, p-value = 6e-06

alternative hypothesis: true difference in means is not equal to 0

95 percent confidence interval:

-2.542 -1.180

sample estimates:

mean of x mean of y

23.11

##

21.25

4. Refaire ce probléme avec α = 0.02.

7. Deux échantillons sont dits appariés si et seulement si ils sont constitués de deux mesures successives de

la même variable sur les mêmes individus. Afin de mesurer les effets d’un nouveau régime amaigrissant,

celui-ci a été teste sur 15 individus pris au hasard dans une population. Le tableau suivant donne leur

poids en kg avant et aprés le régime :

avant : 70 75 80 60 64 66 70 74 78 80 82 90 101 84 77

aprés : 68 76 74 58 65 60 70 70 75 79 78 95 103 80 74

On se contentera ici de supposer que les deux échantillons sont gaussiens,

1. Le régime est-il efficace ?

2. écrire le code R qui permet de faire automatiquement ce test.

Solution:

xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)

xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)

1. — On doit tester l’hypothése, H0 : µD = 0 contre H:µD < 0.

— On calcule d’abord la différence de chaque paire de donnée,

d= xap - xav

d

[1] -2 1 -6 -2 1 -6

0 -4 -3 -1 -4

5

2 -4 -3

avant :

aprés :

Différence -2 1 -6 -2 1 -6 0 -4 -3 -1 -4 5

70 75 80 60 64 66 70 74 78 80 82 90 101 84 77

68 76 74 58 65 60 70 70 75 79 78 95 103 80 74

-4 -3

2

d0=0

n= length(d)

mean.d = mean(d)

mean.d

[1] -1.733

s.d = sd(d)

s.d

[1] 3.081

D’aprés le tableau, la moyenne des différences est d = −1.7333 et l’écart type sd = 3.0814.

7

— La statistique de test est,

t = (mean.d -d0)/(s.d/sqrt(n))

t =

d − d0

√

n

sd/

−1.7333 − 0

15

3.0814/

= −2.1786

√

=

— á partir la table t, t0.05,14 = −1.7613.

— Puisque la valeur observée de t = −2.1786 < −t0.05,14 = 1.7613, on rejette l’hypothése nulle et

conclure que cet exemple de preuve suggére que le nouveau régime et programme d’exercice est

efficace.

2. xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)

xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)

t.test(xap-xav,alternative ="less")

##

One Sample t-test

##

data: xap - xav

t = -2.2, df = 14, p-value = 0.02

alternative hypothesis: true mean is less than 0

95 percent confidence interval:

##

sample estimates:

mean of x

-1.733

##

-Inf -0.332

8