Chapitre III
Data Mining
La Régression linéaire
La Régression linéaire
Simple Multiple
Y = f (X) Y = f(X1,X2,……Xn)
Régression linéaire simple
On a une équation à estimer de type : Yi = 𝒃𝟎 +𝒃𝟏𝑿𝒊 + 𝜺𝒊 , i :1…..n
Variable à expliquer variable explicative terme aléatoire
Modèle estimé :
A partir de l’échantillon observé, on va calculer les valeurs des paramètres inconnus selon la
méthode des MCO (Moindres Carrés Ordinaires) , dont le principe est la minimisation des
sommes des carrés des résidus (min SCR) .
𝒀𝒊̂ = 𝒃𝟎
̂ + 𝒃𝟏
̂ 𝑿𝒊
Soit 𝐞𝐢 : le résidu avec : 𝒆𝒊 = Yi - 𝒀𝒊̂
̂ =
𝒃𝟏
𝒏
∑ 𝒙𝒊𝒚𝒊
𝒊:𝟏
∑ 𝒙𝒊
−𝒏 𝑿̅𝒀̅
𝟐−𝒏 𝑿̅𝟐 =
∑(𝒙𝒊−𝑿̅)(𝒚𝒊−𝒀̅)
∑(𝒙𝒊−𝑿̅)𝟐
𝒃𝟎
̂ = 𝒀̅ - 𝒃𝟏
̂ 𝑿̅
Objectif :
Mettre les données disponibles et utiles selon l’objectif poursuiovi sous forme d’un modèle
linéaire approprié simple ou multiple . Ce modèle est de la forme :
Variable à expliquer = f ( variable explicative ; terme aléatoire) qui synthétise l’ensemble
des données non explicatives dans le modèle. Il regroupe 3 types d’erreurs : erreur de
spécification, erreur de mesure et erreur de fluctuation d’échantillonnage.
Hypothèses des MCO :
H1/ Le modèle est linéaire en Xt .
H2/ Les valeurs 𝐗𝐭 sont observées sans erreur (𝐗𝐭) non aléatoires .
1 MOME 2 2021-2022
Chapitre III
Data Mining
H3/ E (𝜺𝒕) =0 : En moyenne , le modèle est bien spécifié .
H4/ E (𝜺𝒕
𝟐) = 𝝈𝟐 : la variance de l’erreur est constante
Publicité
H5/ E (𝜺𝒕𝜺𝒕′) =0 , avec t ≠ t’ : les erreurs sont non corrélées ou indépendantes
H6/Cov (Xt, 𝜺𝒕) =0 ; l’erreur est indépendante de la variable explicative .
Calcul des variances estimés des paramètres estimés
𝑉(𝑎1̂)̂ =
2
𝜎̂𝜀
∑ (𝑋𝑡−𝑋̅)2 ; 𝑉(𝑎0̂)̂ = 𝜎̂𝜀
2 (
1
𝑛
𝑋̅ 2
+
∑ (𝑋𝑡−𝑋̅)2) ; avec 𝜎̂𝜀
2 =
1
𝑛−2
∑ 𝑒𝑡
2
Une fois le modèle est estimé, on peut réaliser divers tests :
- Test de significativité individuelle des paramètres
- Test de significativité globale du modèle
On peut aussi faire une prévision à l’horizon h , si on a une série chronologique temporelle .
Test de significativité individuelle des paramètres : C’est un test bilatéral
𝐻0: 𝛽𝑖 = 0 ; 𝑙𝑒 𝑝𝑎𝑟𝑎𝑚é𝑡𝑟𝑒 𝑛′𝑒𝑠𝑡 𝑝𝑎𝑠 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓
𝐻1: 𝛽𝑖 ≠ 0: 𝑙𝑒 𝑝𝑎𝑟𝑎𝑚é𝑡𝑟𝑒 𝑒𝑠𝑡 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓
L’hypothèse H1 signifie que la variable Xi contribue à l’explication du modèle au seuil 𝛼 =
5%.
On a : 𝑡𝛽̂𝑖
∗ =
𝛽̂𝑖−𝛽𝑖
𝜎̂𝛽̂
𝑖
→ 𝜏 (n-2) qu’on doit la comparer à la valeur tabulée de Student :
𝑡𝛼
2
(n-2) : si |𝑡𝛽̂𝑖
∗ | > 𝑡𝛼
2
(n-2) : on accepte 𝐻1; 𝑠𝑖𝑜𝑛𝑛 ∶ 𝑜𝑛 𝑎𝑐𝑐𝑒𝑝𝑡𝑒 𝐻1.Ou en terme de P-
value (probabilité critique).
Prévision :
Si on a les données sur XT+h , à l’instant T+h alors on peut calculer la prévision YT+h .
𝑌𝑇+ℎ̂ = 𝑏0
̂ + 𝑏1
̂ 𝑋𝑇+ℎ
Publicité
L’intervalle de confinace pour la prévision de YT+h
IC ( 𝑌𝑇+ℎ̂) = [𝑌𝑇+ℎ̂ ± 𝑡1−𝛼
2
(n − 2)𝜎̂𝜀√1
𝑛
(𝑥𝑇+ℎ − 𝑋̅)2 + 1]
La signigicativité globale du modéle
2 MOME 2 2021-2022
Chapitre III
Data Mining
Exercice :
Soit le modèle estimé : 𝑌̂ = 1176.08 + 0.78 Xt
(0.21) (43.53)
Les valeurs entre parenthèses sont des t de student ou empiriques.
Questions :
1- Calculer le coefficient de détermination R2 et tester la significativité globale du modèle.
On a F* = t2 = (43.53)2 = 1895.3 > 𝐹0.05(1.8) = 5.32 ⇒ accepter H1
2- Pour les années 11 et 12 : on prévoit respectivement : 16800 et 17000. Déterminer la
prévision de Y pour ces deux années et les intervalles de confiance au seuil de 5 %.
𝑌̂11 = 1176.08 + 0.78 (16800) = 13864.24 𝑌̂12 =1176.08 + 0.78 (17000) = 14015.65
Les intervalles de confiance pour la prévision :
On a : 𝜎̂𝜀 = 143.69 ; ∑(𝑥𝑖 − 𝑥̅)2 = 64156000
𝑥̅ = 11280 ; 𝑡𝛼
2
(8)= 2.306
⇒ IC( Y11)= [13864.24 ; 14695.91] et IC( Y12)= [14015.65 ; 14856.51]
3 MOME 2 2021-2022
Chapitre III
Data Mining
Régression linéaire multiple
L’équation à estimer, soit Y = f(X) = f(X1,X2,……Xn)
Avec X : La matrice de variables explicatives (Xi) , avec i :1…..n (s’il s’agit d’une coupe
instantanée ou si on a une série temporelle Xt, t :1…..T).
Par rapport aux hypothèses classiques des MCO , il faut ajouter l’hypothèse de
l’indépendance des variables explicatives⇒ (𝑿′𝑿)−𝟏 ∃ ⇒ |𝑿′𝑿| ≠ 0 cad absence de multi
colinéarité ⇒ aucune variable n’est corrélée avec l’autre .
Ecriture matricielle du modèle : Y = X 𝛽 + 𝜀
Y = 𝛽0 +𝛽1𝑋1 + 𝛽2𝑋2 + ⋯ . . +𝛽𝑘 𝑋𝑘 + 𝜀
Yi = 𝛽0 +𝛽1𝑋1𝑖 + 𝛽2𝑋2𝑖 + ⋯ . . +𝛽𝑘 𝑋𝑘𝑖 + 𝜀𝑖 ; i: 1…..n
Il est à noter que Y et X sont donnés, il faut estimer le vecteur 𝛽.
̂ = (𝑿′𝑿)−𝟏 𝑿′𝒀 ; 𝝈𝜺
𝜷𝑴𝑪𝑶
𝟐̂ = Variance de l’erreur =
𝑺𝑪𝑬
𝒏−𝒌−𝟏
Publicité
𝛽̂
0
𝛽̂
1
. .
𝛽̂
𝑘 )
(
𝑉̂ (𝜷̂) = 𝝈𝜺
𝟐̂ (𝑿′𝑿)−𝟏 = 𝑉̂
Tests en RLM
Toujours partir de l’équation de l’ANOVA :
On peut réaliser un des tests suivants :
Test de significativité des paramètres ,
Test de significativité globale du modèle
{
𝐻0: 𝛽1 = 𝛽2 = ⋯ . 𝛽𝑝 = 0 ; 𝑙𝑒 𝑚𝑜𝑑é𝑙𝑒 𝑛′𝑒𝑠𝑡 𝑝𝑎𝑠 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓
𝐻1: 𝑖𝑙 ∃ 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝛽𝑖 ≠ 0; 𝑖 ∶ 1 … . . 𝑘: 𝑙𝑒 𝑚𝑜𝑑é𝑙𝑒 𝑒𝑠𝑡 𝑔𝑙𝑜𝑏𝑎𝑙𝑒𝑚𝑒𝑛𝑡 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓
⇒ F* =
SCR
k
SCE
n−k−1
→F(k, n-k-1) ; cette valeur tabulée est à comparer avec 𝐹𝛼(k, n −
k − 1) : si F* > 𝐹𝛼(k, n-k-1) : on accepte H1
R2 =
SCR
SCT
SCE
SCT
= 1 -
⇒ Mesurer la qualité de l’ajustement du modèle
4 MOME 2 2021-2022
Chapitre III
Data Mining
Tests sur les Xi = VIF variance Inflation Factor
Solution supprimer une des variables les plus corrélées ou créer une nouvelle variable qui
soit combinaison linéaire des deux autres.
Tests sur les résidus :
Normalité de la densité
Egalité des variances
Absences d’autocorrélation des erreurs d’ordre 1 (DW) ,D’ordre 2 ; Test LM.
Equation de l’ANOVA
ANOVA ; analyse de la variance
MANOVA : analyse de la variance multivariée
Publicité
ANCOVA ‘analyse de la covariance’ est un modèle qui contient des variables indépendantes
à la fois qualitatives et quantitatives.
MANCOVA , ‘analyse de la covariance multivariée’
Equation de l’analyse de la variance et qualité d’un ajustement
On a ∑ 𝑒𝑡 = 0 ,
SCT = SCE + SCR
Analyse de la variance à un seul facteur
Hypothèses :
- Les échantillons sont issus d’une population normale (test paramétrique) .
- Les variances conditionnelles (variances de chaque sous population) sont identiques
(homoscédastisité) .
Les sous échantillons sont indépendants.
Description des données
Soient :
La population P ; A : le facteur à étudier avec p modalités : A1, A2, ……….Ap.
Soit X la variable étudiée de moyenne 𝜇.
La population est divisée en sous population de taille : N1, N2, ……….Np.
5 MOME 2 2021-2022
Chapitre III
Data Mining
Chaque sous population possède les moyennes suivantes :𝜇1, 𝜇2,….. 𝜇𝑝.
n : La taille de l’échantillon .
𝑛1, 𝑛2,….. 𝑛𝑝 : Les échantillons des sous –populations .
∑ 𝑛𝑗= n ; dans chaque échantillon, on calcule les moyennes empiriques :
𝑋1̅̅̅ , 𝑋2̅̅̅ , ……𝑋𝑝̅̅̅̅.
A partir de cette équation, on peut juger la qualité de l’ajustement d’un modèle. Plus la variance
expliquée est proche de la variance totale, meilleur est l’ajustement du nuage de points par la
droite des MCO.
Tableau d’analyse de la variance
Source de variation dl
p-1
Expliquée
n-p
Résidus
n-1
Totale
Somme des carrés Carrés moyens Fisher
CME
SCE
SCR
CMR
SCT
CME/CMR
P-value
6 MOME 2 2021-2022