Chapitre III: Data Mining - La Régression linéaire

Page 1 sur 6Lecteur de document UniversityLib

Chapitre III: Data Mining - La Régression linéaire

Statistics and Data Mining · notes

Voir tous les documents en mathématiques

Chapitre III

Data Mining

La Régression linéaire

La Régression linéaire

Simple Multiple

Y = f (X) Y = f(X1,X2,……Xn)

 Régression linéaire simple

On a une équation à estimer de type : Yi = 𝒃𝟎 +𝒃𝟏𝑿𝒊 + 𝜺𝒊 , i :1…..n

Variable à expliquer variable explicative terme aléatoire

Modèle estimé :

A partir de l’échantillon observé, on va calculer les valeurs des paramètres inconnus selon la

méthode des MCO (Moindres Carrés Ordinaires) , dont le principe est la minimisation des

sommes des carrés des résidus (min SCR) .

𝒀𝒊̂ = 𝒃𝟎

̂ + 𝒃𝟏

̂ 𝑿𝒊

Soit 𝐞𝐢 : le résidu avec : 𝒆𝒊 = Yi - 𝒀𝒊̂

̂ =

𝒃𝟏

𝒏

∑ 𝒙𝒊𝒚𝒊

𝒊:𝟏

∑ 𝒙𝒊

−𝒏 𝑿̅𝒀̅

𝟐−𝒏 𝑿̅𝟐 =

∑(𝒙𝒊−𝑿̅)(𝒚𝒊−𝒀̅)

∑(𝒙𝒊−𝑿̅)𝟐

𝒃𝟎

̂ = 𝒀̅ - 𝒃𝟏

̂ 𝑿̅

Objectif :

Mettre les données disponibles et utiles selon l’objectif poursuiovi sous forme d’un modèle

linéaire approprié simple ou multiple . Ce modèle est de la forme :

Variable à expliquer = f ( variable explicative ; terme aléatoire) qui synthétise l’ensemble

des données non explicatives dans le modèle. Il regroupe 3 types d’erreurs : erreur de

spécification, erreur de mesure et erreur de fluctuation d’échantillonnage.

Hypothèses des MCO :

H1/ Le modèle est linéaire en Xt .

H2/ Les valeurs 𝐗𝐭 sont observées sans erreur (𝐗𝐭) non aléatoires .

1 MOME 2 2021-2022

Chapitre III

Data Mining

H3/ E (𝜺𝒕) =0 : En moyenne , le modèle est bien spécifié .

H4/ E (𝜺𝒕

𝟐) = 𝝈𝟐 : la variance de l’erreur est constante

Publicité

H5/ E (𝜺𝒕𝜺𝒕′) =0 , avec t ≠ t’ : les erreurs sont non corrélées ou indépendantes

H6/Cov (Xt, 𝜺𝒕) =0 ; l’erreur est indépendante de la variable explicative .

Calcul des variances estimés des paramètres estimés

𝑉(𝑎1̂)̂ =

2

𝜎̂𝜀

∑ (𝑋𝑡−𝑋̅)2 ; 𝑉(𝑎0̂)̂ = 𝜎̂𝜀

2 (

1

𝑛

𝑋̅ 2

+

∑ (𝑋𝑡−𝑋̅)2) ; avec 𝜎̂𝜀

2 =

1

𝑛−2

∑ 𝑒𝑡

2

Une fois le modèle est estimé, on peut réaliser divers tests :

  • Test de significativité individuelle des paramètres
  • Test de significativité globale du modèle

On peut aussi faire une prévision à l’horizon h , si on a une série chronologique temporelle .

Test de significativité individuelle des paramètres : C’est un test bilatéral

𝐻0: 𝛽𝑖 = 0 ; 𝑙𝑒 𝑝𝑎𝑟𝑎𝑚é𝑡𝑟𝑒 𝑛′𝑒𝑠𝑡 𝑝𝑎𝑠 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓

𝐻1: 𝛽𝑖 ≠ 0: 𝑙𝑒 𝑝𝑎𝑟𝑎𝑚é𝑡𝑟𝑒 𝑒𝑠𝑡 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓

L’hypothèse H1 signifie que la variable Xi contribue à l’explication du modèle au seuil 𝛼 =

5%.

On a : 𝑡𝛽̂𝑖

∗ =

𝛽̂𝑖−𝛽𝑖

𝜎̂𝛽̂

𝑖

→ 𝜏 (n-2) qu’on doit la comparer à la valeur tabulée de Student :

𝑡𝛼

2

(n-2) : si |𝑡𝛽̂𝑖

∗ | > 𝑡𝛼

2

(n-2) : on accepte 𝐻1; 𝑠𝑖𝑜𝑛𝑛 ∶ 𝑜𝑛 𝑎𝑐𝑐𝑒𝑝𝑡𝑒 𝐻1.Ou en terme de P-

value (probabilité critique).

Prévision :

Si on a les données sur XT+h , à l’instant T+h alors on peut calculer la prévision YT+h .

𝑌𝑇+ℎ̂ = 𝑏0

̂ + 𝑏1

̂ 𝑋𝑇+ℎ

Publicité

L’intervalle de confinace pour la prévision de YT+h

IC ( 𝑌𝑇+ℎ̂) = [𝑌𝑇+ℎ̂ ± 𝑡1−𝛼

2

(n − 2)𝜎̂𝜀√1

𝑛

(𝑥𝑇+ℎ − 𝑋̅)2 + 1]

La signigicativité globale du modéle

2 MOME 2 2021-2022

Chapitre III

Data Mining

Exercice :

Soit le modèle estimé : 𝑌̂ = 1176.08 + 0.78 Xt

(0.21) (43.53)

Les valeurs entre parenthèses sont des t de student ou empiriques.

Questions :

1- Calculer le coefficient de détermination R2 et tester la significativité globale du modèle.

On a F* = t2 = (43.53)2 = 1895.3 > 𝐹0.05(1.8) = 5.32 ⇒ accepter H1

2- Pour les années 11 et 12 : on prévoit respectivement : 16800 et 17000. Déterminer la

prévision de Y pour ces deux années et les intervalles de confiance au seuil de 5 %.

𝑌̂11 = 1176.08 + 0.78 (16800) = 13864.24 𝑌̂12 =1176.08 + 0.78 (17000) = 14015.65

Les intervalles de confiance pour la prévision :

On a : 𝜎̂𝜀 = 143.69 ; ∑(𝑥𝑖 − 𝑥̅)2 = 64156000

𝑥̅ = 11280 ; 𝑡𝛼

2

(8)= 2.306

⇒ IC( Y11)= [13864.24 ; 14695.91] et IC( Y12)= [14015.65 ; 14856.51]

3 MOME 2 2021-2022

Chapitre III

Data Mining

 Régression linéaire multiple

L’équation à estimer, soit Y = f(X) = f(X1,X2,……Xn)

Avec X : La matrice de variables explicatives (Xi) , avec i :1…..n (s’il s’agit d’une coupe

instantanée ou si on a une série temporelle Xt, t :1…..T).

Par rapport aux hypothèses classiques des MCO , il faut ajouter l’hypothèse de

l’indépendance des variables explicatives⇒ (𝑿′𝑿)−𝟏 ∃ ⇒ |𝑿′𝑿| ≠ 0 cad absence de multi

colinéarité ⇒ aucune variable n’est corrélée avec l’autre .

Ecriture matricielle du modèle : Y = X 𝛽 + 𝜀

Y = 𝛽0 +𝛽1𝑋1 + 𝛽2𝑋2 + ⋯ . . +𝛽𝑘 𝑋𝑘 + 𝜀

Yi = 𝛽0 +𝛽1𝑋1𝑖 + 𝛽2𝑋2𝑖 + ⋯ . . +𝛽𝑘 𝑋𝑘𝑖 + 𝜀𝑖 ; i: 1…..n

Il est à noter que Y et X sont donnés, il faut estimer le vecteur 𝛽.

̂ = (𝑿′𝑿)−𝟏 𝑿′𝒀 ; 𝝈𝜺

𝜷𝑴𝑪𝑶

𝟐̂ = Variance de l’erreur =

𝑺𝑪𝑬

𝒏−𝒌−𝟏

Publicité

𝛽̂

0

𝛽̂

1

. .

𝛽̂

𝑘 )

(

𝑉̂ (𝜷̂) = 𝝈𝜺

𝟐̂ (𝑿′𝑿)−𝟏 = 𝑉̂

Tests en RLM

Toujours partir de l’équation de l’ANOVA :

On peut réaliser un des tests suivants :

Test de significativité des paramètres ,

Test de significativité globale du modèle

{

𝐻0: 𝛽1 = 𝛽2 = ⋯ . 𝛽𝑝 = 0 ; 𝑙𝑒 𝑚𝑜𝑑é𝑙𝑒 𝑛′𝑒𝑠𝑡 𝑝𝑎𝑠 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓

𝐻1: 𝑖𝑙 ∃ 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝛽𝑖 ≠ 0; 𝑖 ∶ 1 … . . 𝑘: 𝑙𝑒 𝑚𝑜𝑑é𝑙𝑒 𝑒𝑠𝑡 𝑔𝑙𝑜𝑏𝑎𝑙𝑒𝑚𝑒𝑛𝑡 𝑠𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑞𝑢𝑒𝑚𝑒𝑛𝑡 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑓

⇒ F* =

SCR

k

SCE

n−k−1

→F(k, n-k-1) ; cette valeur tabulée est à comparer avec 𝐹𝛼(k, n −

k − 1) : si F* > 𝐹𝛼(k, n-k-1) : on accepte H1

R2 =

SCR

SCT

SCE

SCT

= 1 -

⇒ Mesurer la qualité de l’ajustement du modèle

4 MOME 2 2021-2022

Chapitre III

Data Mining

Tests sur les Xi = VIF variance Inflation Factor

Solution supprimer une des variables les plus corrélées ou créer une nouvelle variable qui

soit combinaison linéaire des deux autres.

Tests sur les résidus :

Normalité de la densité

Egalité des variances

Absences d’autocorrélation des erreurs d’ordre 1 (DW) ,D’ordre 2 ; Test LM.

 Equation de l’ANOVA

ANOVA ; analyse de la variance

MANOVA : analyse de la variance multivariée

Publicité

ANCOVA ‘analyse de la covariance’ est un modèle qui contient des variables indépendantes

à la fois qualitatives et quantitatives.

MANCOVA , ‘analyse de la covariance multivariée’

Equation de l’analyse de la variance et qualité d’un ajustement

On a ∑ 𝑒𝑡 = 0 ,

SCT = SCE + SCR

Analyse de la variance à un seul facteur

Hypothèses :

  • Les échantillons sont issus d’une population normale (test paramétrique) .
  • Les variances conditionnelles (variances de chaque sous population) sont identiques

(homoscédastisité) .

Les sous échantillons sont indépendants.

Description des données

Soient :

La population P ; A : le facteur à étudier avec p modalités : A1, A2, ……….Ap.

Soit X la variable étudiée de moyenne 𝜇.

La population est divisée en sous population de taille : N1, N2, ……….Np.

5 MOME 2 2021-2022

Chapitre III

Data Mining

Chaque sous population possède les moyennes suivantes :𝜇1, 𝜇2,….. 𝜇𝑝.

n : La taille de l’échantillon .

𝑛1, 𝑛2,….. 𝑛𝑝 : Les échantillons des sous –populations .

∑ 𝑛𝑗= n ; dans chaque échantillon, on calcule les moyennes empiriques :

𝑋1̅̅̅ , 𝑋2̅̅̅ , ……𝑋𝑝̅̅̅̅.

A partir de cette équation, on peut juger la qualité de l’ajustement d’un modèle. Plus la variance

expliquée est proche de la variance totale, meilleur est l’ajustement du nuage de points par la

droite des MCO.

Tableau d’analyse de la variance

Source de variation dl

p-1

Expliquée

n-p

Résidus

n-1

Totale

Somme des carrés Carrés moyens Fisher

CME

SCE

SCR

CMR

SCT

CME/CMR

P-value

6 MOME 2 2021-2022