Simple Linear Regression and Exponential Regression Analysis

Pearson
1/51
100%
Rendu du PDF...
Page 1 sur 51Lecteur de document UniversityLib

Simple Linear Regression and Exponential Regression Analysis

Statistics and Data Analysis · notes

Browse all mathématiques documents

Partie 1 Régression simple

Modèle ?

Représentation des phénomènes

en réalité en vue de comprendre

le fonctionnement,

Marketing direct en ligne:

construire un modèle pour identifier les

clients les plus susceptibles d’acheter des

produits de leur prochain catalogue

Clients identifiés par le modèle comme

ayant peu de chance d’acheter seront

exclu de la prochaine liste d’envoi.

Modèles mathématiques et

statistiques

Modèles

déterministes

Modèles

probabilistes

Modèles mathématiques et

statistiques

Déterministes

Random Error

(aléatoires)

Modèles mathématiques et

statistiques

Exemple:

Ventes d’un produit = frais de

publicité + force de vente + prix +

,,,+ erreur de perturbation

Corrélation et régression linéaire simple

 La corrélation

 La régression linéaire

simple

Introduction

Etude de la relation entre deux variables quantitatives:

Nuage de points:

Y

X

-description de

l’association linéaire:

corrélation, régression

linéaire simple

  • explication /

prédiction d’une

variable à partir de

l’autre: modèle linéaire

simple

La corrélation

Statistique descriptive de la relation entre X et Y: variation

conjointe

1. La covariance

Dans l’échantillon:

Estimation pour la population:

cov(x,y)1nxiyii1nx y cov(x,y)ˆ xy1n1(xii1nx )(yiy )cov(x,y)1n1xiyii1nnn1x y La corrélation

Covariance et nuage de points

< 0

Contribution > 0

> 0

< 0

(xix )0x y (yiy )0La corrélation

2. Le coefficient de corrélation linéaire

« de Pearson »

22yxxyxysssrLa corrélation

2. Le coefficient de corrélation linéaire

Indice de covariance absolu: -1 ≤ r ≤ 1

X2

X2

r = 0.9

X2

X2

r = -0.9

r = -0.5

X1

X2

r = 0.5

r = 0

X2

r = 0

La corrélation

3. Conditions d’utilisation

Homoscédasticité

La variance de Y est

indépendante de X et vice-

versa.

Y

Y

Homoscédasticité

Hétéroscédasticité

X

La corrélation

3. Conditions d’utilisation

Linéarité

La relation est linéaire

Y

Y

Linéarité

Non-linéarité

X

X

La régression linéaire simple

1. Le modèle

On suppose: y = f(x) = a + bx

Modèle: Yi = a + bXi + ei

avec, pour X = xi, Yi : N(a+bxi, )

X = variable explicative

(« indépendante »), contrôlée

Advertisement

Y = variable expliquée

(dépendante ), aléatoire

La régression linéaire simple

2. L’estimation des paramètres

a? b?

Méthode d’estimation: les moindres carrés:

yi

Y

ei

Mi

M’i

y = a+bx

ei = yi - (a + bxi)

minimale

X

xi

ei2ˆ y iLa régression linéaire simple

2. L’estimation des paramètres

Méthode des moindres carrés

On cherche le minimum de

),())((12baEbxayniiiEa2(yi(abxi))(1)0(1)i1nEb2(yi(abxi))(xi)0(2)i1nLa régression linéaire simple

2. L’estimation des paramètres

Méthode des moindres carrés

(1)yi(abxi)i1ni1nnabxii1nny nanbx ay bx La régression linéaire simple

2. L’estimation des paramètres

Méthode des moindres carrés

Si y = a+bx alors

et

On peut alors prédire y pour x compris dans l’intervalle des

valeurs de l’échantillon:

n(cov(x,y)x y )(y bx )nx bn(sx2x 2)0cov(x,y)bsx2bcov(x,y)sx2ˆ b cov(x,y)sx2ˆ a y bx ˆ y iˆ a ˆ b xiLa régression linéaire simple

3. Qualité de l’ajustement

On a supposé: Yi = a + bXi + ei avec

pour X = xi, Yi : N(a+bxi, )

  • distribution normale des erreurs
  • variance identique (homoscédasticité)
  • indépendance:
  • linéarité de la relation

Test a posteriori : étude du nuage de points/ du

graphe des résidus

cov(ei,ej)0La régression linéaire simple

3. Qualité de l’ajustement

Normalité de l’erreur

s

u

d

i

s

é

R

Valeurs prédites

Questions à se poser: structure de l’erreur?

Valeurs extrêmes: ont-elles un sens? Influencent-elles

l’estimation des paramètres?

La régression linéaire simple

3. Qualité de l’ajustement

Homoscédasticité

s

u

d

i

s

é

R

Valeurs prédites

La régression linéaire simple

3. Qualité de l’ajustement

Indépendance entre erreurs, linéarité

s

u

d

i

s

é

R

s

u

d

i

s

é

R

Structure de l’erreur?

Relation non linéaire?

La régression linéaire simple

4. Coefficient de détermination

Décomposition de la variation

Quelle part de la variabilité de Y est expliquée par la relation

linéaire avec X?

Variabilité? Somme des Carrés des Ecarts SCE:

Variance

totale

SCET(yiy )2i1nnsy2La régression linéaire simple

4. Coefficient de détermination

Décomposition de la variation

Y

=

+

SCE Totale

SCE reg.lin. (Expliquée) SCE hors reg.lin. (erreur)

=

+

Y()YYiiN12()YYiiN12()YYiiNi12La régression linéaire simple

4. Coefficient de détermination

La décomposition de la SCE permet d’estimer la part de SCE

de Y expliquée par la régression:

Coefficient de détermination

0 ≤ r2 ≤ 1

Relation avec r?

Advertisement

r2SCEreg.lin.SCETLa régression linéaire simple

4. Coefficient de détermination

Relation entre r et r2

Donc

En particulier, r = 0 <=> r2 = 0

SCEreg.lin.(ˆ y iy )2i1n((abxi)(abx ))2i1nb2(xix )2i1nb2nsx2b2SCExr2b2nsx2nsy2(cov(x,y)sx2)2sx2sy2(cov(x,y))2sx2sy2(r)2La régression linéaire simple

5. Tests

Test de la décomposition de la variation ou analyse de

variance (ANOVA): H0 : a=b = 0

Si F (obs) > Fc (tabulée refuser Ho

Si non accepter Ho

reg.lin.2horsreg.lin.2SCEreg.lin./1SCEhorsreg.lin./(n2):Fn21Test de significativité par variable:

Si T(obs)= coef/écart type estimé

> tc (tabulée) refuser H0

Si non accepter Ho

Ventes en function des frais de

publicité:

pub ventes (Units)

1

2

3

4

5

1

1

2

2

4

Ventes

Publicité

Paramètres Estimés

1111221211510375ˆ.7015555nniiniiiiininiiixyxynxxnˆ.1.7yx01?2.703.10yxRésultats

Parameter Estimates

^

0

Parameter Standard T for H0:

Variable DF Estimate Error Param=0 Prob>|T|

INTERCEP 1 -0.1000 0.6350 -0.157 0.8849

ADVERT 1 0.7000 0.1914 3.656 0.0354

^

1

ˆ.1.7yxRegression Line Fitted

(representation de Y estimée

ou ajustée)

Sales

4

3

2

1

0

0

1

2

3

Advertising

4

5

ˆ.1.7yxExercice

3

S

9

t

a

t

i

s

t

i

q

u

e

s

2. Analyse de regression – relation exponentielle

La fonction exponentielle est très courante en sciences

Par exemple la décroissance d’un bien ...

Si les constantes a et b sont inconnues, on espère pouvoir les

estimer à partir de x et y. Malheureusement l’approche directe

fournit des équations insolubles.

Alors… comment faire????

bxaey2. Analyse de regression – relation exponentielle

Très facile! On transforme l’équation non linéaire en une équation

linéaire. Linéarisation en prenant le logarithme:

4

S

0

t

a

t

i

s

t

i

q

u

e

s

bxaylnlnxyen linéairedevient ln2. Analyse de regression – relation exponentielle

Une population de bactéries décroît exponentiellement:

4

S

1

t

a

t

i

s

Advertisement

t

i

q

u

e

s

t est le temps et  est la vie moyenne de la population. A rapprocher de

la demi-vie t1/2; en fait t1/2 = (ln2) .

/0teNNTemps ti (jours) Population Ni Zi = ln Ni 0 153000 11.94 1 137000 11.83 2 128000 11.76 2. Analyse de regression – relation exponentielle

4

S

2

t

a

t

i

s

t

i

q

u

e

s

ln N0 = 11,93 et (-1/ ) = -0.089 j-1

11,2jours

Opération bactéries12500013000013500014000014500015000015500000.511.522.5Temps (jours)Population Opération bactériesy = -0.089x + 11.93311.711.7511.811.8511.911.9500.511.522.5Temps (jours)Population 4

S

3

t

a

t

i

s

t

i

q

u

e

s

2. Analyse de regression – relation exponentielle

Extrêmement facile mais attention quand même…!!!

L’ajustement par moindres carrés de la droite y = ax+b suppose

que toutes les mesure y1,…,yn soient également incertaines.

2. Analyse de regression – Les autres grands modèles

4

S

4

t

a

t

i

s

t

i

q

u

e

s

4

S

5

t

a

t

i

s

t

i

q

u

e

s

2. Analyse de regression – Et les résidus…?

Attention

• Les points isolés ont un effet indésirables sur la régression

Leur influence doit être testée en les éliminant et en

répétant la régression.

• La différence en y entre un point et la droite de

régression est connue sous le nom de résidu.

La validité de la régression statistique dépend de la

distribution des résidus:

1. Les résidus doivent être normalement distribués

2. Il ne doit pas y avoir de tendance dans la distribution de

variance le long de x.

2. Analyse de regression – Et les résidus…?

ei

4

S

6

t

a

t

i

s

t

i

q

u

e

s

x

2. Analyse de regression – Et les résidus…?

Le fuseau: La variance des résidus n’est pas indépendante des valeurs

de x. Des corrections doivent être apportées (courbe log. log p.e.)

ei

4

Advertisement

S

7

t

a

t

i

s

t

i

q

u

e

s

x

2. Analyse de regression – Et les résidus…?

ei

4

S

8

t

a

t

i

s

t

i

q

u

e

s

x

Bande oblique: Relation entre les résidus et la variable x. Si x

n’est pas dans le modèle, il faudrait l’introduire, ou erreur

importante.

2. Analyse de regression – Et les résidus…?

ei

4

S

9

t

a

t

i

s

t

i

q

u

e

s

x

Bande horizontale: les conditions d’application sont suffisamment respectées

5

S

0

t

a

t

i

s

t

i

q

u

e

s

2. Analyse de regression – Le coefficient de détermination

y

Variation

inexpliquée

Variation

totale

Variation

expliquée

R2 = Variation expliquée / variation totale

x

yiyiyˆ5

S

1

t

a

t

i

s

t

i

q

u

e

s

2. Analyse de regression – Le coefficient de détermination

Somme des carrés

totale (SCtot)

Somme des carrés

des résidus (SCres)

Somme des carrés

de la régression (SCreg)

Variation totale = variation inexpliquée + variation expliquée

R2 = Variation expliquée / variation totale

R2 est le coefficient de détermination, proportion de la variation

de y qui s’explique par la présence de x.

Plus R2 est grand, plus SCres est petit.

222)ˆ( ˆ yyyyyyiiii