Principes & Méthodes Statistiques: Tests d’Hypothèses
Ce matériel couvre les principes fondamentaux et les méthodes statistiques liées aux tests d’hypothèses. Il s’adresse aux étudiants de deuxième année en sciences de l’informatique souhaitant maîtriser les techniques d’inférence statistique pour évaluer des hypothèses à partir de données échantillonnées.
D'après le document Principes & Méthodes Statistiques: Tests d’Hypothèses
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.
Document source
Statistical Hypothesis Testing · PDF · 8 pages · 2017
Afficher l'aperçu du document
Ce matériel couvre les principes fondamentaux et les méthodes statistiques liées aux tests d’hypothèses. Il s’adresse aux étudiants de deuxième année en sciences de l’informatique souhaitant maîtriser les techniques d’inférence statistique pour évaluer des hypothèses à partir de données échantillonnées.
Test d’hypothèse sur une proportion
On considère une situation où, historiquement, 40 % des individus d’une région achètent un savon de marque "Caresse". Après une campagne publicitaire, on interroge un échantillon de 500 personnes, dont 235 répondent qu’elles achètent désormais ce savon. L’objectif est de vérifier, au niveau de signification α = 5 %, si la campagne a augmenté cette proportion.
Définissons la variable aléatoire Xi :
Xi = 1 si l’individu i achète le savon Caresse
Xi = 0 sinon
pour i = 1,...,500
Xi suit une loi binomiale B(n=500, p). Pour n > 30, on peut approximer cette loi par une loi normale :
X ~ N(np, np(1-p))
La fréquence observée est f0 = 235/500 = 0.47. On teste :
- H0 : p = 0.4 (la campagne n’est pas efficace)
- H1 : p > 0.4 (la campagne est efficace)
La fréquence critique fc est donnée par :
fc = p + zα √(p(1-p)/n)
Avec zα = 1.65 (valeur critique pour α=5 % en test unilatéral droit), on calcule :
fc = 0.4 + 1.65 × √(0.4 × 0.6 / 500) = 0.436
Comme f0 = 0.47 > fc, on rejette H0 et conclut que la campagne publicitaire a été efficace.
Test d’hypothèse sur une moyenne avec échantillon petit (test t)
Un médicament A fait disparaître la douleur en moyenne en 30 minutes avec un écart-type de 5 minutes. Un nouveau médicament B est testé sur 12 malades avec les durées suivantes (en minutes) :
25, 28, 20, 32, 17, 24, 41, 28, 25, 30, 27, 24
On souhaite vérifier, au niveau de confiance 95 %, si B est plus efficace (durée moyenne inférieure à 30 minutes).
- Hypothèses :
- H0 : µ = 30
- H1 : µ < 30
t = (x̄ - µ0) / (σ / √n) = (26.75 - 30) / (5 / √12) = -1.8526
p-value = P(T < -1.8526) = 0.0455
t.test(xi, alternative = "less", mu = 30)
Test bilatéral sur une moyenne avec échantillon grand
Dans une usine agroalimentaire, on contrôle le volume moyen d’eau dans des bouteilles. La machine est bien réglée si la moyenne est 1.5 L. Un échantillon de 100 bouteilles donne :
- Moyenne observée : x̄ = 1.495 L
- Écart-type corrigé : sc = 0.01 L
On teste :
- H0 : µ = 1.5
- Ha : µ ≠ 1.5
Statistique de test :
z = (x̄ - µ0) / (sc / √n) = (1.495 - 1.5) / (0.01 / √100) = -5
Zone de rejet : |z| > 1.96 (pour α=5 %)
Décision : |z|=5 > 1.96 donc on rejette H0, la moyenne est différente de 1.5.
Si sc = 0.04 :
z = (1.495 - 1.5) / (0.04 / √100) = -1.25
Comme |z|=1.25 < 1.96, on ne rejette pas H0, la moyenne n’est pas significativement différente de 1.5.
Test sur la variance d’une population
On teste si la variance du temps nécessaire pour un test de permis est égale à 64 mn². Un échantillon de 25 individus donne une variance corrigée s² = 38.44.
Hypothèses :
- H0 : σ² = 64
- Ha : σ² ≠ 64
Statistique de test :
χ² = (n-1) s² / σ0² = 24 × 38.44 / 64 = 15.0156
Région de rejet : χ² < χ²0.975,24 = 12.4012 ou χ² > χ²0.025,24 = 39.3641
Décision : 15.0156 n’est pas dans la région de rejet, on ne rejette pas H0 au niveau 5 %.
Test de comparaison de proportions entre deux machines
Deux machines produisent des pièces défectueuses :
- Machine 1 : 96 pièces, 12 défectueuses (p̂1 = 0.125)
- Machine 2 : 55 pièces, 10 défectueuses (p̂2 = 0.1818)
On teste si la machine 1 est plus performante (moins de pièces défectueuses) :
- H0 : p1 - p2 = 0
- Ha : p1 - p2 < 0
Statistique de test :
z = (p̂1 - p̂2) / √(p̂1(1-p̂1)/n1 + p̂2(1-p̂2)/n2) = (0.125 - 0.1818) / √(0.125×0.875/96 + 0.1818×0.8182/55) = -0.9164
Zone de rejet : z < -1.6449 (α=0.01)
Décision : -0.9164 > -1.6449, on ne rejette pas H0.
p-valeur :
p-value = P(Z < -0.9164) = 0.1797
Commande R :
prop.test(c(12,10), c(96,55), alternative="less", correct=FALSE)
Test de comparaison de moyennes pour deux échantillons indépendants
Longueur des œufs de coucou dans deux types de nids :
- Roitelet (n1=15) : 19.8, 22.1, 21.5, 20.9, 22.0, 21.0, 22.3, 21.0, 20.3, 20.9, 22.0, 22.0, 20.8, 21.2, 21.0
- Fauvette (n2=14) : 22.0, 23.9, 20.9, 23.8, 25.0, 24.0, 23.8, 21.7, 22.8, 23.1, 23.5, 23.0, 23.1, 23.0
- Estimation des moyennes et variances corrigées :
- m̂1 = 21.25, σ̂1² = 0.5155
- m̂2 = 23.11, σ̂2² = 1.101
- Test d’égalité des variances :
- H0 : σ1² = σ2²
- H1 : σ1² ≠ σ2²
- Statistique F = σ̂1² / σ̂2² = 0.4681
- Région de rejet : F < 0.332 ou F > 3.0819 (α=0.05)
- Décision : 0.4681 n’est pas dans la région de rejet, on ne rejette pas H0.
- Commande R :
var.test(x1, x2) - Estimation de la variance commune :
- Test de comparaison des moyennes :
- H0 : m1 = m2
- H1 : m1 ≠ m2
- Statistique t = (m̂1 - m̂2) / √(S_p² (1/n1 + 1/n2)) = (21.25 - 23.11) / √(0.7976 (1/15 + 1/14)) = -5.607
- Zone de rejet : |t| > t0.025,27 = 2.0518
- Décision : |t|=5.607 > 2.0518, on rejette H0, les moyennes sont significativement différentes.
- Commande R :
t.test(x1, x2, var.equal=TRUE) - Reprise du test avec α = 0.02 (non détaillée ici).
S_p² = ((n1-1)σ̂1² + (n2-1)σ̂2²) / (n1 + n2 - 2) = 0.7976
Test sur échantillons appariés
Un régime amaigrissant est testé sur 15 individus, avec poids mesurés avant et après :
- Avant : 70, 75, 80, 60, 64, 66, 70, 74, 78, 80, 82, 90, 101, 84, 77
- Après : 68, 76, 74, 58, 65, 60, 70, 70, 75, 79, 78, 95, 103, 80, 74
- Hypothèses :
- H0 : µD = 0 (pas d’effet)
- H1 : µD < 0 (perte de poids)
- Calcul des différences d = après - avant :
- Moyenne des différences : d̄ = -1.733
- Écart-type : sd = 3.081
- Statistique de test :
- Zone de rejet : t < -t0.05,14 = -1.7613
- Décision : t = -2.1786 < -1.7613, on rejette H0, le régime est efficace.
- Commande R :
d = (-2, 1, -6, -2, 1, -6, 0, -4, -3, -1, -4, 5, 2, -4, -3)
t = (d̄ - 0) / (sd / √n) = -1.733 / (3.081 / √15) = -2.1786
t.test(xap - xav, alternative = "less")
Glossaire des termes clés
- Hypothèse nulle (H0) : hypothèse de départ que l’on cherche à tester, souvent une absence d’effet ou de différence.
- Hypothèse alternative (H1 ou Ha) : hypothèse contraire à H0, indiquant un effet ou une différence.
- Statistique de test : valeur calculée à partir des données permettant de décider de rejeter ou non H0.
- Risque de première espèce (α) : probabilité de rejeter H0 alors qu’elle est vraie (erreur de type I).
- p-valeur : probabilité, sous H0, d’obtenir une statistique de test aussi extrême que celle observée.
- Test unilatéral : test où l’on cherche à détecter une différence dans une seule direction (ex : µ > µ0).
- Test bilatéral : test où l’on cherche à détecter une différence dans les deux directions (ex : µ ≠ µ0).
- Test t de Student : test utilisé pour comparer une moyenne d’échantillon à une moyenne hypothétique lorsque la variance est inconnue et l’échantillon petit.
- Test Z : test basé sur la loi normale utilisé pour les grands échantillons ou lorsque la variance est connue.
- Test F : test utilisé pour comparer deux variances.
- Échantillons appariés : deux échantillons constitués de mesures répétées sur les mêmes individus.
- Variance corrigée : estimation de la variance avec correction du biais (diviser par n-1).
Points clés à retenir
- Les tests d’hypothèses permettent de vérifier des affirmations sur des paramètres inconnus à partir d’échantillons.
- Le choix du test dépend de la nature des données (proportions, moyennes, variances) et de la taille de l’échantillon.
- La statistique de test est comparée à une valeur critique déterminée par le niveau de signification α.
- La p-valeur donne une mesure de la force des preuves contre H0.
- Les tests peuvent être unilatéraux ou bilatéraux selon la question posée.
- Les échantillons appariés nécessitent un traitement spécifique basé sur les différences entre paires.
- Les logiciels statistiques comme R permettent d’automatiser ces tests avec des commandes simples.
Commentaires
Aucun commentaire pour le moment. Posez la première question.