Module de :
Universit de Manouba
Niveau : 2ime Anne
Principes & Mthodes
Statistiques
Chargs de Cours :
O.Oueslati & A. Alleli
& F. Kadhi
Filire : II2
cole Nationale des
A.Univ. : 2017-2018
Sciences de L’Informatique
Semestre I
Tests d’Hypothses
1. A partir des statistiques compilées dans le passé, on sait que 40% des individus d’une certaine région
achètent le savon de,toilette de marque ”Caresse”. On vient de déterminer une compagne publicitaire
dans cette région en faveur du savon Caresse, et pour vérifier l’efficacité, on tire un échantillion aléatoir
de 500 personnes de la région, et on leur demande si maintenant elles achètent ou non le savon Caresse.
Si 235 personnes répondent ”oui”, peut- on conclure que la compagne publicitaire a été efficace à un
niveau de signification α = 5%?
Solution:
Xi =
(cid:26) 1 Si l’individu i de notre échantillion achète le savon de marque Caresse
0 Sinon
i=1 Xi ∼ B (n = 500, p)
Xi ∼ B (1, p), alors (cid:80)500
Comme n > 30, on peut approximer cette B (n, p) par une loi normale N (np, np (1 − p)), alors :
n p (1 − p)(cid:1)
(cid:80)500
X : Constitue la proportion des individus qui consomment la marque ”caresse” =⇒ X est une fréquence
(soit noté f ).
i=1 Xi ∼ N (np, np (1 − p)) =⇒ X ∼ N (cid:0)p, 1
On veut tester :
(cid:26) H0 :
H1 :
la compagne publicitaire n’est pas efficace
la compagne publicitaire est efficace
⇔
(cid:26) H0 : p = 0.4
H1 : p > 0.4
Si la campagne publicitaire est efficace alors la proportion des individus qui consomment le savon ”caresse”
va augmenter par rapport à la proportion calculée dans le passé, qui est de 0.4.
P [rejeter H0| H0 est vraie] = α ⇐⇒ P (cid:2)X > fc|p = 0.4(cid:3) = α ⇐⇒ P
(cid:34)
(cid:35)
X−p
(cid:113) p(1−p)
> fc−p
(cid:113) p(1−p)
n
n
= α, soit
zα = fc−p
(cid:113) p(1−p)
n
Donc, la fréquence critique : fc = p + zα
On rejette H0 si f0 (fréquence observée est supérieure à la fréquence critique fc.
(cid:113) p(1−p)
n
(cid:41)
AN. :
f0 = 235
500 = 0.47
fc = 0.4 + 1.65
(cid:113) 0.4×0.6
500 = 0.436
=⇒ f0 > fc : on va rejeter H0, donc la compagne publicitaire
a été efficace.
2. Pour apaiser un certain type de maux de tête, on a l’habitude de traiter les malades avec un médicament
A. Une étude statistique a montré que la durée de disparition de la douleur chez les malades traités
avec A était une variable aléatoire de loi normale N (m0; σ2
0), avec m0 = 30 mn et σ0 = 5 mn. Un
laboratoire pharmaceutique a conu un nouveau médicament B et désire tester son efficacité. Pour cela,
On a administré le médicament B á 12 malades et relevé les durées de disparition de la douleur suivantes :
On décide de ne commercialiser B que si on est sr á 95% qu’il est plus efficace que A.
25 28 20 32 17 24 41 28 25 30 27 24
1. Traduire cette situation au moyen d’un test d’hypothéses.
2. Comment classer ce test ?
3. Peut-on lancer la commercialisation du médicament B ?
4. Calculer la p-valeur de ce test.
5. écrire et expliquer la commande R qui permet de faire automatiquement ce test.
Solution:
1.
Il s’agit de tester les hypothéses : H0 : µ = 30 contre Ha : µ < 30.
1
2. La statistique du test observée (pour n = 12 ≤ 30).
t =
x − µ0
√
σ/
n
26.75 − 30
12
6.0772/
= −1.8526.
√
=
La zone de rejet est : {t < t0.05} = {t < −1.7959}.
Décision : Puisque t = −1.8526 est inférieure á −1.7959, l’hypothése nulle est rejetée á un niveau de
signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne est inférieure
á 30.
3.
la p-value est,
p − value = P (T < −1.8526) = 0.0455
4. t.test(xi,alternative = "less", mu =mu0)
##
One Sample t-test
##
data: xi
t = -1.9, df = 11, p-value = 0.05
alternative hypothesis: true mean is less than 30
95 percent confidence interval:
-Inf 29.9
sample estimates:
mean of x
26.75
##
3. Dans une usine du secteur de l’agroalimentaire, une machine á embouteiller est alimentée par un réservoir
d’eau et par une file d’approvisionnement en bouteilles vides. Pour contrôler le bon fonctionnement de
la machine, on veut construire un test d’hypothése bilatéral qui sera mis en oeuvre toutes les heures.
Pour une production d’une heure, on suppose que la variable aléatoire X qui á toute bouteille, prise
au hasard dans cette production, associe le volume d’eau (en litres) qu’elle contient, est une variable
aléatoire d’espérance m et d’écart-type σ inconnus. On considére que la machine est bien réglée lorsque
le volume d’eau moyen dans une bouteille est 1.5 l. On a prélevé un échantillon de n = 100 bouteilles, et
on a obtenu un volume d’eau moyen de x = 1.495 l et un écart-type corrigé de sc = 0.01 l.
1. Peut-on conclure, au risque 5%, que la machine est bien réglée ?
2. Reprendre la même question avec sc = 0.04. Interpréter le résultat.
Solution:
Soit µ la vraie moyenne de la population.
1. — Il s’agit de tester les hypothéses : H0 : µ = 1.5 contre Ha : µ (cid:54)= 1.5.
— La statistique du test observée (pour n = 100 ≥ 30).
z =
=
x − µ0
√
σ/
n
1.495 − 1.5
√
100
0.01/
= −5.
— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.
— Décision : Puisque z = −5 est inférieure á −1.96, l’hypothése nulle est rejetée á un niveau de
signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne est
différente de 1.5.
2. Avec sc = 0.04.
2
Publicité
— La statistique du test observée (pour n = 100 ≥ 30).
z =
x − µ0
√
σ/
n
1.495 − 1.5
√
100
0.04/
= −1.25.
=
— Zone de rejet est : {|z| > z0.025} = {|z| > 1.96}.
— Décision : Puisque z = −1.25 est supérieure á −1.96, l’hypothése nulle n’est pas rejetée á un
niveau de signification α = 0.05. Il y a une évidence suffisante pour conclure que la vraie moyenne
n’est pas différente de 1.5.
4. Supposons que le temps X nécessaire aux candidats pour un test écrit pour l’obtention d’un permis de
conduire suit une distribution Normale. Le préposé au test affirme que selon son expérience, la variance
de ce temps est de 64 mn. A priori, on n’a pas la raison particuliére de croire que cette variance pourrait
être plus grande ou plus petite que 64 mn (c’est á dire que l’affirmation du préposé est fausse). Pour
vérifier son affirmation, on choisit au hasard 25 individus qui ont passé ce test, et l’on obtient une variance
corrigée s2
Solution:
— Il s’agit de tester H0 : σ2 = 64 contre Ha : σ2 (cid:54)= 64 pour α = 0.05 et 25 degrés de liberté,
— La région de rejet est
c = 38.44. Devrait-on rejeter l’affirmation du préposé au niveau α = 5%.
RR =
(cid:110)
χ2 < χ2
1−α/2,n−1 ou χ2 > χ2
α/2,n−1
(cid:111)
— La valeur observée du TS est,
= (cid:8)χ2 < 12.4012 ou χ2 > 39.3641(cid:9) .
χ2 =
(n − 1)S2
σ2
0
=
(n)(38.44)
64
= 15.0156.
— Puisque la valeur de la statistique de test ne tombe pas dans la région de rejet, nous ne pouvons pas
rejeter H0 au niveau de signification de 5%. Ici, nous avons supposé que les 25 mesures suivent la
distribution normale.
5. Soient p1 et p2 les proportion de piéces défectueuses produites, respectivement, par une machin 1 et une
machine 2. La machine 1 a produit 96 piéces dont 12 défectueuses. La machine 2 a produit 55 piéces dont
10 défectueuses. On se pose la question si on peut en conclure que la machine 1 est significativement plus
performante que la machine 2.
1. écrire le test d’hypothéses adéquat pour cette question : préciser les deux hypothéses H0 et H1
2. Supposons que H 0 est vraie. Soient T1 et T2 les v.a qui représentent le nombre de piéces défectueuse
produites, respectivement, par la machine 1 et la machine 2. Construire une statistique U qui permet
de décider le rejet de H0 avec un risque α de se tremper.
3. Si on se permet d’une erreur de 5%, est ce qu’on peut conclure que la machine 1 est plus performante
que la machine 2 ?
4. Calculer la p-valeur de ce test.
5. Quel est le risque d’erreur qu’il faudrait prendre pour rejeter H0 . Conclure.
6. écrire le code R qui permet de réaliser ce test.
Solution:
n1= 96
nd1 = 12
p1.hat = nd1/n1
n2 = 55
nd2 = 10
p2.hat = nd2/n2
z = (p1.hat - p2.hat)/ sqrt(p1.hat(1-p1.hat)/n1 + p2.hat(1-p2.hat)/n2)
z
[1] -0.9164
Soient p1 et p2 les proportions et T1 et T2 les v.a qui représentent les nombres, respectivement des piéces
défectueuses produites par les machines 1 et 2. Les données : n1 = 12, n2 = 10, ˆp1 = 0.125 et ˆp2 = 0.1818.
3
Il s’agit de tester H0 : p1 − p2 = 0 contre Ha : p1 − p2 < 0.
1.
2. Sous H0 est vraie, la statistique de test est,
z =
p1 − p2
(cid:113) p1q1
n1
+ p2q2
n2
∼ N (0, 1)
La zone de rejet est, z < −zα. La valeur observée de la statistique est,
z =
=
ˆp1 − ˆp2
(cid:113) ˆp1 ˆq1
n1
+ ˆp1 ˆq2
n2
0.125 − 0.1818
(cid:113) (0.125)(1−0.125)
96
+ (0.1818)(1−0.1818)
55
= −0.9164.
3. Pour α = 0.01, z0.01 = 1.6449. Par conséquent, la région de rejet est z < −1.6449.
4. Puisque la valeur observée de la statistique de test ne tombe pas dans la région de rejet, á α = 0.05,
il n’y a pas suffisamment de preuves pour conclure que la machine 1 est plus performante que la
machine 2.
5. La p-valeur de ce test.
p − value = P (Z < −0.9164) = 0.1797
6. Pour pouvoir rejeter H0, il faudrait prendre un risque d’erreur d’au moins égale á la p−value. Puisque
α = 0.05 < p − value = 0.1797, on accepte l’hypothése nulle.
7. prop.test(c(nd1,nd2),c(n1,n2),alternative="less",correct = FALSE)
##
2-sample test for equality of proportions without
continuity correction
##
data: c(nd1, nd2) out of c(n1, n2)
X-squared = 0.91, df = 1, p-value = 0.2
alternative hypothesis: less
95 percent confidence interval:
-1.00000
0.04516
sample estimates:
prop 1 prop 2
0.1250 0.1818
6. Dans un article de la revue Biometrica, le biologiste Latter donne la longueur (en mm) des oeufs de
Coucou trouvés dans les nids de deux espéces d’oiseaux :
— Dans des nids de petite taille (Roitelet) :
19.8 22.1 21.5 20.9 22.0 21.0 22.3 21.0 20.3 20.9 22.0 22.0 20.8 21.2 21.0
— Dans des nids de taille plus grande (Fauvette) :
22.0 23.9 20.9 23.8 25.0 24.0 23.8 21.7 22.8 23.1 23.5 23.0 23.1 23.0
On se demande si le Coucou adapte la taille de ses oeufs á la taille du nid. Soient X1 et X2 les v.a mesurant,
respectivement, la longueur des oeufs dans les nids de Roitelet et ceux dans les nids de Fauvette. On
suppose que X1 ∼ N (m1, σ2
2). On pose
1) et X2 ∼ N (m2, σ2
X 1 =
X 2 =
1
n1
1
n2
n1(cid:88)
i=1
n2(cid:88)
i=1
X1,i; S2
1 =
X2,i; S2
2 =
1
n1
1
n2
n1(cid:88)
i=1
Publicité
n2(cid:88)
i=1
(X1,i − X 1)2; S2
c,1 =
(X2,i − X 2)2; S2
c,2 =
n1
n1 − 1
S2
1
n2
n2 − 1
S2
2
Soit α = 0.05.
1. Calculer les estimations ponctuelles de la moyenne et de la variance corrigée pour chaque échantillon.
2. Considérons le test H0 : σ2
1 (cid:54)= σ2
2.
1 = σ2
a. Si H0 est vraie, quelle est la loi de F =
2 contre l’hypothése H1 : σ2
S2
c,1
S2
4
c,2
.
b. Calculer f =
s2
c,1
s2
c,2
et f (cid:48) =
s2
c,2
s2
c,1
.
c. Soit F (cid:48) = 1
d. Décider si les variances des deux populations ne sont pas différentes significativement au risque α.
F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.
e. écrire et expliquer la commande R qui permet de faire automatiquement ce test.
f. Calculer une estimation de la valeur commune σ2 de σ2
3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose
1 et σ2
2.
S2
c,1,2 =
(n1 − 1)S2
c,1 + (n2 − 1)S2
c,2
n1 + n2 − 2
a. Sous H0 , qu’elle est la lois de T =
X 1−X 2
√
1/n1+1/n2
.
Sc,1,2
b. Déterminer tα/2 tel que P (−tα/2 < T < tα/2) = 1 − α.
c. Justifier si on peut rejeter H0 avec une probabilité α de se tromper.
d. écrire le code R qui permet de faire automatiquement ce test.
4. Refaire ce probléme avec α = 0.02.
Solution:
x1 =c(19.8,22.1,21.5,20.9,22.0,21.0,22.3,21.0,20.3,20.9,22.0,22.0,20.8,21.2,21.0)
x2 =c(22.0,23.9,20.9,23.8,25.0,24.0,23.8,21.7,22.8,23.1,23.5,23.0,23.1,23.0)
1. Les estimations ponctuelles de la moyenne :
m1.hat = mean(x1); m1.hat
[1] 21.25
m2.hat = mean(x2); m2.hat
[1] 23.11
et de la variance corrigée pour chaque échantillon.
sigma21.hat = var(x1); sigma21.hat
[1] 0.5155
sigma22.hat = var(x2); sigma22.hat
[1] 1.101
2. Considérons le test H0 : σ2
S2
S2
a. Si H0 est vraie,F =
c,1
c,2
1 = σ2
2 contre l’hypothése H1 : σ2
1 (cid:54)= σ2
2.
∼ F (n1 − 1, n2 − 1).
b. Calculer f =
s2
c,1
s2
c,2
et f (cid:48) =
s2
c,2
s2
c,1
.
f= sigma21.hat/sigma22.hat; f
[1] 0.4681
f.pr = 1/f; f.pr
[1] 2.136
c. Soit F (cid:48) = 1
F . Trouver a tel que P (F (cid:48) ≥ a) = α/2.
1/Fα(n1 − 1, n2 − 1) = F1−α(n2 − 1, n1 − 1)
n1 = length(x1)
n2= length(x2)
alpha = 0.05
a= 1/qf(alpha/2, n1-1, n2-1)
a
[1] 3.012
d. Décider si les variances des deux populations ne sont pas différentes significativement au risque α.
— Il s’agit de tester H0 : σ2
1 = σ2
2 contre Ha : σ2
1 (cid:54)= σ2
2. C’est un test bilatéral.
5
— Ici, les degrés de liberté sont v1 = 15 − 1 = 14 et v2 = 14 − 1 = 13. La statistique de test est
f =
s2
1
s2
2
0.5155
1.1013
= 0.4681.
=
— A partir de la table F , F0.025(14, 13) = 3.0819 et F0.975(14, 13) = (1/F0.025(13, 14)) = 0.332.
— Par conséquent, la région de rejet est F > 3.0819 ou F < 0.332.
— Puisque la valeur observée de la statistique de test, 0.4681, n’est pas dans la zone de rejet, on
ne rejette pas l’hypothése nulle.
Il existe des preuves que les variances de la population sont égales.
e. var.test(x1,x2)
##
F test to compare two variances
##
data: x1 and x2
F = 0.47, num df = 14, denom df = 13, p-value = 0.2
alternative hypothesis: true ratio of variances is not equal to 1
95 percent confidence interval:
0.1519 1.4099
sample estimates:
ratio of variances
0.4681
##
f. Calculer une estimation de la valeur commune σ2 de σ2
1 et σ2
Publicité
2. Puisque les variances sont égales
et les deux échantillons sont indépendants,
sp.2 = ((n1 -1) sigma21.hat + (n2-1)sigma22.hat)/(n1+n2-2)
S2
p =
(n1 − 1)S2
1 + (n2 − 1)S2
2
n − 1 + n2 − 2
A.N. : =
(15 − 1)0.5155(14 − 1)1.1013
15 + 15 − 2
= 0.7976
3. On veut tester H0 : m1 = m2 contre Ha : m1 (cid:54)= m2 . On pose
a. Sous H0 ,
S2
c,1,2 =
(n1 − 1)S2
c,1 + (n2 − 1)S2
c,2
n1 + n2 − 2
T =
X 1 − X 2
(cid:112)1/n1 + 1/n2
Sc,1,2
∼ t(n1 + n2 − 2)
b. Déterminer tα tel que P (−tα/2 < T < tα/2) = 1 − α.
n =n1+n2-2
qt(alpha/2,n)
[1] -2.052
c. Justifier si on peut rejeter H0 avec une probabilité α de se tromper.
— On veut tester, H0 : m1 − m2 = 0 contre Ha : m1 − m2 (cid:54)= 0
— La statistique de test est,
T= (m1.hat - m2.hat)/(sqrt(sp.2 *(1/n1 + 1/n2)))
T
[1] -5.607
6
T =
=
X 1 − X 2 − D0
(cid:113) 1
n1
sp
+ 1
n2
21.2533 − 23.1143
√
(cid:113) 1
15 + 1
0.7976
14
= −5.6074
— Pour α = 0.05, t0.025,29 = −2.0518. Par conséquent, la région de rejet est t < −2.0518 ou
t > 2.0518.
— Puisque la valeur observée de la statistique de test, T = −5.6074, tombe dans la région de
rejet, il y a assez de preuves pour conclure que les longueurs des nids sont différents pour les
deux groupes.
d. écrire le code R qui permet de faire automatiquement ce test.
x1 and x2
t.test(x1,x2,var.equal = TRUE)
##
Two Sample t-test
##
data:
t = -5.6, df = 27, p-value = 6e-06
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-2.542 -1.180
sample estimates:
mean of x mean of y
23.11
##
21.25
4. Refaire ce probléme avec α = 0.02.
7. Deux échantillons sont dits appariés si et seulement si ils sont constitués de deux mesures successives de
la même variable sur les mêmes individus. Afin de mesurer les effets d’un nouveau régime amaigrissant,
celui-ci a été teste sur 15 individus pris au hasard dans une population. Le tableau suivant donne leur
poids en kg avant et aprés le régime :
avant : 70 75 80 60 64 66 70 74 78 80 82 90 101 84 77
aprés : 68 76 74 58 65 60 70 70 75 79 78 95 103 80 74
On se contentera ici de supposer que les deux échantillons sont gaussiens,
1. Le régime est-il efficace ?
2. écrire le code R qui permet de faire automatiquement ce test.
Solution:
xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)
xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)
1. — On doit tester l’hypothése, H0 : µD = 0 contre H:µD < 0.
— On calcule d’abord la différence de chaque paire de donnée,
d= xap - xav
d
[1] -2 1 -6 -2 1 -6
0 -4 -3 -1 -4
5
2 -4 -3
avant :
aprés :
Différence -2 1 -6 -2 1 -6 0 -4 -3 -1 -4 5
70 75 80 60 64 66 70 74 78 80 82 90 101 84 77
68 76 74 58 65 60 70 70 75 79 78 95 103 80 74
-4 -3
2
d0=0
n= length(d)
mean.d = mean(d)
mean.d
[1] -1.733
s.d = sd(d)
s.d
[1] 3.081
D’aprés le tableau, la moyenne des différences est d = −1.7333 et l’écart type sd = 3.0814.
7
— La statistique de test est,
t = (mean.d -d0)/(s.d/sqrt(n))
t =
d − d0
√
n
sd/
−1.7333 − 0
15
3.0814/
= −2.1786
√
=
— á partir la table t, t0.05,14 = −1.7613.
— Puisque la valeur observée de t = −2.1786 < −t0.05,14 = 1.7613, on rejette l’hypothése nulle et
conclure que cet exemple de preuve suggére que le nouveau régime et programme d’exercice est
efficace.
2. xav = c(70,75,80,60,64,66,70,74,78,80,82,90,101 ,84 ,77)
xap = c(68 ,76 ,74 ,58 ,65 ,60 ,70 ,70 ,75 ,79 ,78 ,95 ,103 ,80 ,74)
t.test(xap-xav,alternative ="less")
##
One Sample t-test
##
data: xap - xav
t = -2.2, df = 14, p-value = 0.02
alternative hypothesis: true mean is less than 0
95 percent confidence interval:
##
sample estimates:
mean of x
-1.733
##
-Inf -0.332
8