Module de :
Universit de Manouba
Niveau : 2ime Anne
Principes & Mthodes
Statistiques
Chargs de Cours :
O.Oueslati & A. Alleli
& F. Kadhi
Filire : II2
cole Nationale des
A.Univ. : 2017-2018
Sciences de L’Informatique
Semestre I
Tests d’Hypothses
1. A partir des statistiques compil´ees dans le pass´e, on sait que 40% des individus d’une certaine r´egion
ach`etent le savon de,toilette de marque ”Caresse”. On vient de d´eterminer une compagne publicitaire
dans cette r´egion en faveur du savon Caresse, et pour v´erifier l’efficacit´e, on tire un ´echantillion al´eatoir
de 500 personnes de la r´egion, et on leur demande si maintenant elles ach`etent ou non le savon Caresse.
Si 235 personnes r´epondent ”oui”, peut- on conclure que la compagne publicitaire a ´et´e efficace `a un
niveau de signification α = 5%?
Solution:
Xi =
(cid:26) 1 Si l’individu i de notre ´echantillion ach`ete le savon de marque Caresse
0 Sinon
i=1 Xi ∼ B (n = 500, p)
Xi ∼ B (1, p), alors (cid:80)500
Comme n > 30, on peut approximer cette B (n, p) par une loi normale N (np, np (1 − p)), alors :
n p (1 − p)(cid:1)
(cid:80)500
X : Constitue la proportion des individus qui consomment la marque ”caresse” =⇒ X est une fr´equence
(soit not´e f ).
i=1 Xi ∼ N (np, np (1 − p)) =⇒ X ∼ N (cid:0)p, 1
On veut tester :
(cid:26) H0 :
H1 :
la compagne publicitaire n’est pas efficace
la compagne publicitaire est efficace
⇔
(cid:26) H0 : p = 0.4
H1 : p > 0.4
Si la campagne publicitaire est efficace alors la proportion des individus qui consomment le savon ”caresse”
va augmenter par rapport `a la proportion calcul´ee dans le pass´e, qui est de 0.4.
P [rejeter H0| H0 est vraie] = α ⇐⇒ P (cid:2)X > fc|p = 0.4(cid:3) = α ⇐⇒ P
(cid:34)
(cid:35)
X−p
(cid:113) p(1−p)
> fc−p
(cid:113) p(1−p)
n
n
= α, soit
zα = fc−p
(cid:113) p(1−p)
n
Donc, la fr´equence critique : fc = p + zα
On rejette H0 si f0 (fr´equence observ´ee est sup´erieure `a la fr´equence critique fc.
(cid:113) p(1−p)
n
(cid:41)
AN. :
f0 = 235
500 = 0.47
fc = 0.4 + 1.65
(cid:113) 0.4×0.6
500 = 0.436
=⇒ f0 > fc : on va rejeter H0, donc la compagne publicitaire
a ´et´e efficace.
2. Pour apaiser un certain type de maux de tˆete, on a l’habitude de traiter les malades avec un m´edicament
A. Une ´etude statistique a montr´e que la dur´ee de disparition de la douleur chez les malades trait´es
avec A ´etait une variable al´eatoire de loi normale N (m0; σ2
0), avec m0 = 30 mn et σ0 = 5 mn. Un
laboratoire pharmaceutique a conu un nouveau m´edicament B et d´esire tester son efficacit´e. Pour cela,
On a administr´e le m´edicament B ´a 12 malades et relev´e les dur´ees de disparition de la douleur suivantes :
On d´ecide de ne commercialiser B que si on est sr ´a 95% qu’il est plus efficace que A.
25 28 20 32 17 24 41 28 25 30 27 24
1. Traduire cette situation au moyen d’un test d’hypoth´eses.
2. Comment classer ce test ?
3. Peut-on lancer la commercialisation du m´edicament B ?
4. Calculer la p-valeur de ce test.
5. ´ecrire et expliquer la commande R qui permet de faire automatiquement ce test.
Solution:
1.
Il s’agit de tester les hypoth´eses : H0 : µ = 30 contre Ha : µ < 30.
1
2. La statistique du test observ´ee (pour n = 12 ≤ 30).
t =
x − µ0
√
σ/
n
26.75 − 30
12
6.0772/
= −1.8526.
√
=
La zone de rejet est : {t < t0.05} = {t < −1.7959}.
D´ecision : Puisque t = −1.8526 est inf´erieure ´a −1.7959, l’hypoth´ese nulle est rejet´ee ´a un niveau de
signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne est inf´erieure
´a 30.
3.
la p-value est,
p − value = P (T < −1.8526) = 0.0455
4. t.test(xi,alternative = "less", mu =mu0)
##
One Sample t-test
##
data: xi
t = -1.9, df = 11, p-value = 0.05
alternative hypothesis: true mean is less than 30
95 percent confidence interval:
-Inf 29.9
sample estimates:
mean of x
26.75
##
3. Dans une usine du secteur de l’agroalimentaire, une machine ´a embouteiller est aliment´ee par un r´eservoir
Advertisement
d’eau et par une file d’approvisionnement en bouteilles vides. Pour contrˆoler le bon fonctionnement de
la machine, on veut construire un test d’hypoth´ese bilat´eral qui sera mis en oeuvre toutes les heures.
Pour une production d’une heure, on suppose que la variable al´eatoire X qui ´a toute bouteille, prise
au hasard dans cette production, associe le volume d’eau (en litres) qu’elle contient, est une variable
al´eatoire d’esp´erance m et d’´ecart-type σ inconnus. On consid´ere que la machine est bien r´egl´ee lorsque
le volume d’eau moyen dans une bouteille est 1.5 l. On a pr´elev´e un ´echantillon de n = 100 bouteilles, et
on a obtenu un volume d’eau moyen de x = 1.495 l et un ´ecart-type corrig´e de sc = 0.01 l.
1. Peut-on conclure, au risque 5%, que la machine est bien r´egl´ee ?
2. Reprendre la mˆeme question avec sc = 0.04. Interpr´eter le r´esultat.
Solution:
Soit µ la vraie moyenne de la population.
1. — Il s’agit de tester les hypoth´eses : H0 : µ = 1.5 contre Ha : µ (cid:54)= 1.5.
— La statistique du test observ´ee (pour n = 100 ≥ 30).
z =
=
x − µ0
√
σ/
n
1.495 − 1.5
√
100
0.01/
= −5.
— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.
— D´ecision : Puisque z = −5 est inf´erieure ´a −1.96, l’hypoth´ese nulle est rejet´ee ´a un niveau de
signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne est
diff´erente de 1.5.
2. Avec sc = 0.04.
2
— La statistique du test observ´ee (pour n = 100 ≥ 30).
z =
x − µ0
√
σ/
n
1.495 − 1.5
√
100
0.04/
= −1.25.
=
— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.
— D´ecision : Puisque z = −1.25 est sup´erieure ´a −1.96, l’hypoth´ese nulle n’est pas rejet´ee ´a un
niveau de signification α = 0.05. Il y a une ´evidence suffisante pour conclure que la vraie moyenne
n’est pas diff´erente de 1.5.
4. Supposons que le temps X n´ecessaire aux candidats pour un test ´ecrit pour l’obtention d’un permis de
conduire suit une distribution Normale. Le pr´epos´e au test affirme que selon son exp´erience, la variance
de ce temps est de 64 mn. A priori, on n’a pas la raison particuli´ere de croire que cette variance pourrait
ˆetre plus grande ou plus petite que 64 mn (c’est ´a dire que l’affirmation du pr´epos´e est fausse). Pour
v´erifier son affirmation, on choisit au hasard 25 individus qui ont pass´e ce test, et l’on obtient une variance
corrig´ee s2
Solution:
— Il s’agit de tester H0 : σ2 = 64 contre Ha : σ2 (cid:54)= 64 pour α = 0.05 et 25 degr´es de libert´e,
— La r´egion de rejet est
c = 38.44. Devrait-on rejeter l’affirmation du pr´epos´e au niveau α = 5%.
RR =
(cid:110)
χ2 < χ2
1−α/2,n−1 ou χ2 > χ2
α/2,n−1
(cid:111)
— La valeur observ´ee du TS est,
= (cid:8)χ2 < 12.4012 ou χ2 > 39.3641(cid:9) .
χ2 =
(n − 1)S2
σ2
0
=
(n)(38.44)
64
= 15.0156.
— Puisque la valeur de la statistique de test ne tombe pas dans la r´egion de rejet, nous ne pouvons pas
rejeter H0 au niveau de signification de 5%. Ici, nous avons suppos´e que les 25 mesures suivent la
distribution normale.
5. Soient p1 et p2 les proportion de pi´eces d´efectueuses produites, respectivement, par une machin 1 et une
machine 2. La machine 1 a produit 96 pi´eces dont 12 d´efectueuses. La machine 2 a produit 55 pi´eces dont
10 d´efectueuses. On se pose la question si on peut en conclure que la machine 1 est significativement plus
performante que la machine 2.
1. ´ecrire le test d’hypoth´eses ad´equat pour cette question : pr´eciser les deux hypoth´eses H0 et H1
2. Supposons que H 0 est vraie. Soient T1 et T2 les v.a qui repr´esentent le nombre de pi´eces d´efectueuse
produites, respectivement, par la machine 1 et la machine 2. Construire une statistique U qui permet
de d´ecider le rejet de H0 avec un risque α de se tremper.
3. Si on se permet d’une erreur de 5%, est ce qu’on peut conclure que la machine 1 est plus performante
que la machine 2 ?
4. Calculer la p-valeur de ce test.
5. Quel est le risque d’erreur qu’il faudrait prendre pour rejeter H0 . Conclure.
6. ´ecrire le code R qui permet de r´ealiser ce test.
Solution:
n1= 96
nd1 = 12
p1.hat = nd1/n1
n2 = 55
nd2 = 10
p2.hat = nd2/n2
z = (p1.hat - p2.hat)/ sqrt(p1.hat(1-p1.hat)/n1 + p2.hat(1-p2.hat)/n2)
z
[1] -0.9164
Soient p1 et p2 les proportions et T1 et T2 les v.a qui repr´esentent les nombres, respectivement des pi´eces
d´efectueuses produites par les machines 1 et 2. Les donn´ees : n1 = 12, n2 = 10, ˆp1 = 0.125 et ˆp2 = 0.1818.
3
Il s’agit de tester H0 : p1 − p2 = 0 contre Ha : p1 − p2 < 0.
1.
2. Sous H0 est vraie, la statistique de test est,
z =
p1 − p2
(cid:113) p1q1
n1
+ p2q2
n2
∼ N (0, 1)
La zone de rejet est, z < −zα. La valeur observ´ee de la statistique est,
z =
=
ˆp1 − ˆp2
(cid:113) ˆp1 ˆq1
n1
+ ˆp1 ˆq2
Advertisement
n2
0.125 − 0.1818
(cid:113) (0.125)(1−0.125)
96
+ (0.1818)(1−0.1818)
55
= −0.9164.
3. Pour α = 0.01, z0.01 = 1.6449. Par cons´equent, la r´egion de rejet est z < −1.6449.
4. Puisque la valeur observ´ee de la statistique de test ne tombe pas dans la r´egion de rejet, ´a α = 0.05,
il n’y a pas suffisamment de preuves pour conclure que la machine 1 est plus performante que la
machine 2.
5. La p-valeur de ce test.
p − value = P (Z < −0.9164) = 0.1797
6. Pour pouvoir rejeter H0, il faudrait prendre un risque d’erreur d’au moins ´egale ´a la p−value. Puisque
α = 0.05 < p − value = 0.1797, on accepte l’hypoth´ese nulle.
7. prop.test(c(nd1,nd2),c(n1,n2),alternative="less",correct = FALSE)
##
2-sample test for equality of proportions without
continuity correction
##
data: c(nd1, nd2) out of c(n1, n2)
X-squared = 0.91, df = 1, p-value = 0.2
alternative hypothesis: less
95 percent confidence interval:
-1.00000
0.04516
sample estimates:
prop 1 prop 2
0.1250 0.1818
6. Dans un article de la revue Biometrica, le biologiste Latter donne la longueur (en mm) des oeufs de
Coucou trouv´es dans les nids de deux esp´eces d’oiseaux :
— Dans des nids de petite taille (Roitelet) :
19.8 22.1 21.5 20.9 22.0 21.0 22.3 21.0 20.3 20.9 22.0 22.0 20.8 21.2 21.0
— Dans des nids de taille plus grande (Fauvette) :
22.0 23.9 20.9 23.8 25.0 24.0 23.8 21.7 22.8 23.1 23.5 23.0 23.1 23.0
On se demande si le Coucou adapte la taille de ses oeufs ´a la taille du nid. Soient X1 et X2 les v.a mesurant,
respectivement, la longueur des oeufs dans les nids de Roitelet et ceux dans les nids de Fauvette. On
suppose que X1 ∼ N (m1, σ2
2). On pose
1) et X2 ∼ N (m2, σ2
X 1 =
X 2 =
1
n1
1
n2
n1(cid:88)
i=1
n2(cid:88)
i=1
X1,i; S2
1 =
X2,i; S2
2 =
1
n1
1
n2
n1(cid:88)
i=1
n2(cid:88)
i=1
(X1,i − X 1)2; S2
c,1 =
(X2,i − X 2)2; S2
c,2 =
n1
n1 − 1
S2
1
n2
n2 − 1
S2
2
Soit α = 0.05.
1. Calculer les estimations ponctuelles de la moyenne et de la variance corrig´ee pour chaque ´echantillon.
2. Consid´erons le test H0 : σ2
1 (cid:54)= σ2
2.
1 = σ2
a. Si H0 est vraie, quelle est la loi de F =
2 contre l’hypoth´ese H1 : σ2
S2
c,1
S2
4
c,2
.
b. Calculer f =
s2
c,1
s2
c,2
et f (cid:48) =
s2
c,2
s2
c,1
.
c. Soit F (cid:48) = 1
d. D´ecider si les variances des deux populations ne sont pas diff´erentes significativement au risque α.
F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.
e. ´ecrire et expliquer la commande R qui permet de faire automatiquement ce test.
f. Calculer une estimation de la valeur commune σ2 de σ2
3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose
1 et σ2
2.
S2
c,1,2 =
(n1 − 1)S2
c,1 + (n2 − 1)S2
c,2
n1 + n2 − 2
a. Sous H0 , qu’elle est la lois de T =
X 1−X 2
√
1/n1+1/n2
.
Advertisement
Sc,1,2
b. D´eterminer tα/2 tel que P (−tα/2 < T < tα/2) = 1 − α.
c. Justifier si on peut rejeter H0 avec une probabilit´e α de se tromper.
d. ´ecrire le code R qui permet de faire automatiquement ce test.
4. Refaire ce probl´eme avec α = 0.02.
Solution:
x1 =c(19.8,22.1,21.5,20.9,22.0,21.0,22.3,21.0,20.3,20.9,22.0,22.0,20.8,21.2,21.0)
x2 =c(22.0,23.9,20.9,23.8,25.0,24.0,23.8,21.7,22.8,23.1,23.5,23.0,23.1,23.0)
1. Les estimations ponctuelles de la moyenne :
m1.hat = mean(x1); m1.hat
[1] 21.25
m2.hat = mean(x2); m2.hat
[1] 23.11
et de la variance corrig´ee pour chaque ´echantillon.
sigma21.hat = var(x1); sigma21.hat
[1] 0.5155
sigma22.hat = var(x2); sigma22.hat
[1] 1.101
2. Consid´erons le test H0 : σ2
S2
S2
a. Si H0 est vraie,F =
c,1
c,2
1 = σ2
2 contre l’hypoth´ese H1 : σ2
1 (cid:54)= σ2
2.
∼ F (n1 − 1, n2 − 1).
b. Calculer f =
s2
c,1
s2
c,2
et f (cid:48) =
s2
c,2
s2
c,1
.
f= sigma21.hat/sigma22.hat; f
[1] 0.4681
f.pr = 1/f; f.pr
[1] 2.136
c. Soit F (cid:48) = 1
F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.
1/Fα(n1 − 1, n2 − 1) = F1−α(n2 − 1, n1 − 1)
n1 = length(x1)
n2= length(x2)
alpha = 0.05
a= 1/qf(alpha/2, n1-1, n2-1)
a
[1] 3.012
d. D´ecider si les variances des deux populations ne sont pas diff´erentes significativement au risque α.
— Il s’agit de tester H0 : σ2
1 = σ2
2 contre Ha : σ2
1 (cid:54)= σ2
2. C’est un test bilat´eral.
5
— Ici, les degr´es de libert´e sont v1 = 15 − 1 = 14 et v2 = 14 − 1 = 13. La statistique de test est
f =
s2
1
s2
2
0.5155
1.1013
= 0.4681.
=
— A partir de la table F , F0.025(14, 13) = 3.0819 et F0.975(14, 13) = (1/F0.025(13, 14)) = 0.332.
— Par cons´equent, la r´egion de rejet est F > 3.0819 ou F < 0.332.
— Puisque la valeur observ´ee de la statistique de test, 0.4681, n’est pas dans la zone de rejet, on
ne rejette pas l’hypoth´ese nulle.
Il existe des preuves que les variances de la population sont ´egales.
e. var.test(x1,x2)
##
F test to compare two variances
##
data: x1 and x2
F = 0.47, num df = 14, denom df = 13, p-value = 0.2
alternative hypothesis: true ratio of variances is not equal to 1
95 percent confidence interval:
0.1519 1.4099
sample estimates:
ratio of variances
0.4681
##
f. Calculer une estimation de la valeur commune σ2 de σ2
1 et σ2
2. Puisque les variances sont ´egales
et les deux ´echantillons sont ind´ependants,
sp.2 = ((n1 -1) sigma21.hat + (n2-1)sigma22.hat)/(n1+n2-2)
S2
p =
(n1 − 1)S2
1 + (n2 − 1)S2
2
n − 1 + n2 − 2
A.N. : =
(15 − 1)0.5155(14 − 1)1.1013
15 + 15 − 2
= 0.7976
3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose
a. Sous H0 ,
S2
c,1,2 =
(n1 − 1)S2
c,1 + (n2 − 1)S2
c,2
n1 + n2 − 2
T =
X 1 − X 2
(cid:112)1/n1 + 1/n2
Sc,1,2
∼ t(n1 + n2 − 2)
b. D´eterminer tα tel que P (−tα/2 < T < tα/2) = 1 − α.
n =n1+n2-2
Advertisement
qt(alpha/2,n)
[1] -2.052
c. Justifier si on peut rejeter H0 avec une probabilit´e α de se tromper.
— On veut tester, H0 : m1 − m2 = 0 contre Ha : m1 − m2 (cid:54)= 0
— La statistique de test est,
T= (m1.hat - m2.hat)/(sqrt(sp.2 *(1/n1 + 1/n2)))
T
[1] -5.607
6
T =
=
X 1 − X 2 − D0
(cid:113) 1
n1
sp
+ 1
n2
21.2533 − 23.1143
√
(cid:113) 1
15 + 1
0.7976
14
= −5.6074
— Pour α = 0.05, t0.025,29 = −2.0518. Par cons´equent, la r´egion de rejet est t < −2.0518 ou
t > 2.0518.
— Puisque la valeur observ´ee de la statistique de test, T = −5.6074, tombe dans la r´egion de
rejet, il y a assez de preuves pour conclure que les longueurs des nids sont diff´erents pour les
deux groupes.
d. ´ecrire le code R qui permet de faire automatiquement ce test.
x1 and x2
t.test(x1,x2,var.equal = TRUE)
##
Two Sample t-test
##
data:
t = -5.6, df = 27, p-value = 6e-06
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-2.542 -1.180
sample estimates:
mean of x mean of y
23.11
##
21.25
4. Refaire ce probl´eme avec α = 0.02.
7. Deux ´echantillons sont dits appari´es si et seulement si ils sont constitu´es de deux mesures successives de
la mˆeme variable sur les mˆemes individus. Afin de mesurer les effets d’un nouveau r´egime amaigrissant,
celui-ci a ´et´e teste sur 15 individus pris au hasard dans une population. Le tableau suivant donne leur
poids en kg avant et apr´es le r´egime :
avant : 70 75 80 60 64 66 70 74 78 80 82 90 101 84 77
apr´es : 68 76 74 58 65 60 70 70 75 79 78 95 103 80 74
On se contentera ici de supposer que les deux ´echantillons sont gaussiens,
1. Le r´egime est-il efficace ?
2. ´ecrire le code R qui permet de faire automatiquement ce test.
Solution:
xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)
xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)
1. — On doit tester l’hypoth´ese, H0 : µD = 0 contre H:µD < 0.
— On calcule d’abord la diff´erence de chaque paire de donn´ee,
d= xap - xav
d
[1] -2 1 -6 -2 1 -6
0 -4 -3 -1 -4
5
2 -4 -3
avant :
apr´es :
Diff´erence -2 1 -6 -2 1 -6 0 -4 -3 -1 -4 5
70 75 80 60 64 66 70 74 78 80 82 90 101 84 77
68 76 74 58 65 60 70 70 75 79 78 95 103 80 74
-4 -3
2
d0=0
n= length(d)
mean.d = mean(d)
mean.d
[1] -1.733
s.d = sd(d)
s.d
[1] 3.081
D’apr´es le tableau, la moyenne des diff´erences est d = −1.7333 et l’´ecart type sd = 3.0814.
7
— La statistique de test est,
t = (mean.d -d0)/(s.d/sqrt(n))
t =
d − d0
√
n
sd/
−1.7333 − 0
15
3.0814/
= −2.1786
√
=
— ´a partir la table t, t0.05,14 = −1.7613.
— Puisque la valeur observ´ee de t = −2.1786 < −t0.05,14 = 1.7613, on rejette l’hypoth´ese nulle et
conclure que cet exemple de preuve sugg´ere que le nouveau r´egime et programme d’exercice est
efficace.
2. xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)
xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)
t.test(xap-xav,alternative ="less")
##
One Sample t-test
##
data: xap - xav
t = -2.2, df = 14, p-value = 0.02
alternative hypothesis: true mean is less than 0
95 percent confidence interval:
##
sample estimates:
mean of x
-1.733
##
-Inf -0.332
8