La régression logistique

Page 1 sur 63Lecteur de document UniversityLib

La régression logistique

Statistics and Health Research · notes

Browse all mathématiques documents

La r gression logistique

Par Sonia NEJI et Anne-H l ne JIGOREL

Introduction

" La r gression logistique sapplique au cas o :

Y est qualitative 2 modalit s

Xk qualitatives ou quantitatives

" Le plus souvent appliqu e la sant :

Identification des facteurs li s une maladie

Recherche des causes de d c s ou de survie de

patients

Plan

I. Sp cification du mod le

II. Interpr tation des coefficients

III. Estimations et tests des param tres

IV. Ad quation du mod le

V. Application

I. Sp cification du mod le

I.

Sp cification du mod le

Contexte

" Y est une variable binaire

0 en cas de non occurrence de l v nement.

1 si occurrence.

" Y al atoire et Xi non al atoires

" On cherche expliquer la survenue dun

v nement

" On cherche la probabilit de succ s

" On travaille en terme desp rance

I.

Sp cification du mod le

Notations

" On note:

(Y,X1,X2,&,Xk) les variables de la population dont

on extrait un chantillon de n individus i.

(yi,xi) est le vecteur des r alisations de (Yi,Xi)

K variables explicatives

I.

Sp cification du mod le

Contexte

" f ne peut tre une fonction lin aire car Y ne prend que deux valeurs:

5L =5S 5e1,5e2,&,5e5X

I.

Sp cification du mod le

Contexte

" Afin que lesp rance de Y ne prenne que 2 valeurs, une

utilise la fonction logistique :

Ainsi:

0<f(x)<1

et E(Y) =0 ou 1

5S 5e =exp(5e)1+exp(5e)=5]

I.

Sp cification du mod le

Loi de Y

" Y suit une loi de Bernoulli de param tre p

" Application de la transformation logit permet de

travailler sur des valeurs entre [-;+]:

5Y5\5T5V5a 5] =ln(5]15]) = 5 0+ 5 15e5V1+ 5 25e5V2+ +5 5]5e5V5X

II. Interpr tation des

coefficients

II. Interpr tation des coefficients

Cas dune seule variable exog ne binaire

" LOdds (ou cote )

Soit P une probabilit . Son odds est d fini par:

" Par exemple, si un tudiant a 3 chances sur 4

d tre re u, contre 1 chance sur 4 d tre coll , sa

cote est de 3 contre 1 , soit

5B5Q5Q5`5C=5C15C 5B5Q5Q5`=34 14 =3

II. Interpr tation des coefficients

Cas dune seule variable exog ne binaire

" Odds ratio (ou rapport des cotes )

Cest le rapport des cotes des probabilit s davoir

la maladie pour ceux qui ont un sympt me X

dune part et de ceux qui ne lont pas dautre part.

" OR=1, la maladie est ind pendante du sympt me

" OR>1, la maladie est plus fr quente pour les

individus qui ont le sympt me.

" OR<1, la maladie est plus fr quente pour les

individus qui nont pas le sympt me.

II. Interpr tation des coefficients

Cas dune seule variable exog ne binaire

5E56=5C 5L5V=1 |5K=1 15C 5L5V=1 |5K=1 5C 5L5V=1 |5K=0 15C 5L5V=1 |5K=0 =exp(5 0+5 1)exp 5 0 =exp(5 1)

II. Interpr tation des coefficients

Cas dune seule variable exog ne binaire

" X=0 : sympt me absent

" X=1 : sympt me pr sent

" Y=0: la maladie est absente

" Y=1: la maladie est pr sente

" On a donc:

5?5\5T5V5a[5C 5L5V=1 |5K=5e ]= 5 0+ 5 15e

II. Interpr tation des coefficients

Cas dune seule variable exog ne binaire

Avec lestimateur de 1: RC=exp( 1), permet

de comparer les individus qui poss dent le

sympt me X avec ceux qui ne le poss de pas. Pour

Advertisement

cela, on compare le RC 1.

Avec lestimateur de 0: On peut calculer

Cest- -dire la proportion observ e de malades

nayant pas le sympt me.

5C 5L5V=1 |5K=0 =exp(5 0)1+ exp(5 0)

II. Interpr tation des coefficients

Cas dune seule variable exog ne

quantitative

" X une variable quantitative (ex: ge)

" Y=0: la maladie est absente

" Y=1: la maladie est pr sente

" On a encore:

5?5\5T5V5a[5C 5L5V=1 |5K=5e ]= 5 0+ 5 15e

II. Interpr tation des coefficients

Cas dune seule variable exog ne

quantitative

" Avec lestimateur de 1: permet davoir le

lodds ratio quand X1 augmente dune unit :

5E56=exp(5 1)

II. Interpr tation des coefficients

Cas dune seule variable exog ne

quantitative

" Avec lestimateur de 0: permet de connaitre

la proportion de malades dont la valeur de X est

0.

Attention linterpr tation de 0 qui

na pas de sens pour certaines variables

X comme l ge!

II. Interpr tation des coefficients

Synth se: Mod le logistique multiple

" Linterpr tation est semblable celle des

mod les une variable explicative.

" Exemple:

5?5\5T5V5a 5C 5@5N5Y5N5Q5V5R5V=1 |545T5R,5S5b5Z5R = 5 0+ 5 1.545T5R+5 2.5S5b5Z5R 5 0 =1,3982 ,5 1 = 0,4118 5R5a 5 2 =0,6708

II. Interpr tation des coefficients

Synth se: Mod le logistique multiple

" Linterpr tation de 0 na pas de sens

" RC=exp( 1)=1,5068 >1

" Si l ge augmente dune unit , le risque de contracter

la maladie augmente.

" RC=exp( 2)=1,9558 >1

" Le risque de contracter la maladie est plus lev si

lindividu est fumeur.

5?5\5T5V5a 5C 5@5N5Y5N5Q5V5R5V=1 |545T5R,5S5b5Z5R = 5 0+ 5 1.545T5R+5 2.5S5b5Z5R 5 0 =1,3982 ,5 1 = 0,4118 5R5a 5 2 =0,6708

III. Estimation et test du

mod le

III. Estimation et test du mod le

Maximum de vraisemblance

" Estimateurs des param tres sans biais et de

faible variance.

" n variables al atoires Yi iid qui suivent une loi de

B( ).

" La vraisemblance dun n- chantillon y1,y2,&,yn

est d finie comme la probabilit dobserver cet

chantillon.

III. Estimation et test du mod le

Maximum de vraisemblance

" Les variables Yi tant ind pendantes:

L( ,y1&,yn ) =

5 5f5V.(15 )15f5V5[5V=1 5C 5L5V=5f5V =5 5V5f5V.(15 5V)15f5V

III. Estimation et test du mod le

Maximum de vraisemblance

" Avec s( j) tel que s ( j) soient les variances des

estimateurs telles que la matrice de variance

covariance soit de la forme :

III. Estimation et test du mod le

Maximum de vraisemblance

Intervalles de confiance

" Ce test permet de savoir sil y a une relation

entre la variable Xj et Y.

" Si 1 T IC pas de relation

" Si 1 T IC relation entre Xj et Y

5<56=exp[5 5W 5b5 .5`(5 5W) ]

III. Estimation et test du mod le

Test du rapport de vraisemblance

" Compare 2 mod les emboit s:

M1: k param tres

M2: p param tres (p>k)

" Les hypoth ses de test sont:

" La statistique de test est:

(-2.ln(vraisemblance au maximum de M1)] -

(-2.ln(vraisemblance au maximum deM2)]

" Elle suit une loi du Khi-deux p-k degr s de libert s.

5;0:5B5[ 5P5\5V5`5V5a 5@1 (5Z 5Z5R 5^5b5N5Y5V5a 5]5_ 5Q5V5P5a5V5c5R 5^5b5R 5Y5R 2 5Z5N5V5` 5Z5\5V5[5` 5Q5R 5]5N5_5N5Z 5a5_5R5`)5;1:5B5[ 5P5\5V5`5V5a 5@2 5Z5R5V5Y5Y5R5b5_5R 5^5b5N5Y5V5a 5]5_ 5Q5V5P5a5V5c5R

III. Estimation et test du mod le

Test de significativit globale

" Les variables explicatives influencent-elles

simultan ment le risque de survenue de

l v nement?

" On va effectuer un test du rapport de

vraisemblance&

III. Estimation et test du mod le

Test de significativit globale

" M1: Mod le sans variables

Advertisement

" M2: Mod le avec toutes les variables

" On teste:

" Est-ce que M1 est meilleur que M2 (qualit s

pr dictives)?

5;0:5@1 5?5\5T5V5a 5C 5L=1 = 5 0 5;1:5@2 5?5\5T5V5a 5C 5L=1 =5 0+5 15e1+ +5 5]5e5]

III. Estimation et test du mod le

Test de significativit globale

" La statistique de test est:

RV= (-2.ln(vraisemblance au maximum de M1)] -

(-2.ln(vraisemblance au maximum deM2)]

Et suit un Khi-deux p degr s de libert

" Si RV > Dz(p) On rejette H0, le mod le 2

est meilleur que le 1, les variables explicatives

ont simultan ment une influence sur la

probabilit dapparition de l v nement tudi .

III. Estimation et test du mod le

Test de significativit pour une variable

" M1: Mod le sans la variable test e j

" M2: Mod le avec la variable test e j

" On teste:

5;0:5@1 5?5\5T5V5a 5C 5L=1 = 5 0+5 15e1+ +5 5X5e5X5;1:5@2 5?5\5T5V5a 5C 5L=1 =5 0+5 15e1+ +5 5W5e5W+ +5 5X5e5X Cest- -dire : 5;0: 5 5W=05;1:5 5W`0

III. Estimation et test du mod le

Test de significativit pour une variable

" Il y a 2 mani res d crire la statistique de test

Sous une loi Normale:

Sous une loi du Khi-deux:

5H=5 5W 5`(5 5W) ~ 5A(0,1) sous H0 5K = 5 5W 5` 5 5W =5H ~ 5K (1) sous H0

III. Estimation et test du mod le

Test de significativit pour une variable

" Conclusion

Sous une loi Normale:

Si |U| > N(0,1) (=1,96 95%)

Sous une loi du Khi-deux:

Si U > Dz(1)

On rejette HO, le mod le 2 est meilleur que le 1,

le param tre j est significatif, la variable j a

une influence sur la probabilit dapparition de

l v nement, sachant les autres variables du

mod le.

III. Estimation et test du mod le

Modification deffet ou interaction

" On consid re le mod le M2:

" Si 3 est significative, alors X2 modifie leffet de

X1. En effet, dans ce cas:

Si X2=0 -> leffet de X1 est 1

Si X2=1 -> leffet de X1 est 1+ 3

5?5\5T5V5a 5C 5L=1 5K1,5K2 =5 0+ 5 1.5K1+5 2.5K2+5 3.5K1.5K2

III. Estimation et test du mod le

Modification deffet ou interaction

" On teste par le test du rapport de vraisemblance:

" Si on rejette HO Il y a modification deffet

On laisse linteraction dans

le mod le.

" Si on accepte HO On retire linteraction.

5o5 : 575 =5 5o5 :575 `5

III. Estimation et test du mod le

Confusion

" On consid re 2 mod les a et b:

" Effet brut de X1: RCa=exp( 1) de Ma

" Effet de X1 ajust X2: RCb=exp( 1) de Mb

" Il y a confusion si RCa`RCb

5Y5\5T5V5a 5C 5L=1 5K1 =5 0+5 1.5K1 5Y5\5T5V5a 5C 5L=1 5K1,5K2 =5 0+5 1.5K1+5 2.5K2

III. Estimation et test du mod le

Confusion

" Variation relative:

" 10%<k<20%

" Si VR>k X2 est un facteur de confusion

" Si VRdk on v rifie 2 =0. Si oui, on retire X2

de l tude.

5I5E= 5E565O 5E565N 5E565O

IV. Ad quation du mod le

IV. Ad quation du mod le

Principe

" D terminer la qualit dajustement du mod le

aux donn es.

" Si lajustement est correct, les valeurs pr dites

seront proches des valeurs observ es.

IV. Ad quation du mod le

Test de Hosmer et Lemeshow

" Regroupement des probabilit s pr dites par le

mod le en dix groupes (d ciles).

" Pour chaque groupe, on observe l cart entre les

valeurs pr dites et observ es. Limportance de la

distance entre ces valeurs est valu e gr ce une

statistique du Khi-deux 8 ddl qui teste:

5f5V 5;0:575V5`5a5N5[5P5R 5S5N5V5O5Y5R5;1:575V5`5a5N5[5P5R 5Y5R5c 5R

IV. Ad quation du mod le

Tableau de contingence

" Ce tableau permet de connaitre le nombre de bonnes et de mauvaises

pr dictions par rapport un seuil s (fix g n ralement 50%)

Malade (yi=1) Non Malade (yi=0) Total Pr dit malade (5 5 = 1) a c a+c Pr dit non malade (5 5 = 0) b d b+d Total a+b c+d n 5A5O5O=5N+5Q5[ 5A5O5Z=5P+5O5[

IV. Ad quation du mod le

Tableau de contingence

" Nbb: 93+257/431=81,2%

Advertisement

" Nbm: 50+31/431= 18,8%

" Sensibilit : Se: 93/143 = 65%

Sp: 257/288 = 89,2%

Malade (yi=1) Non Malade (yi=0) Total Pr dit malade (5 5 = 1) 93 31 124 Pr dit non malade (5 5 = 0) 50 257 307 Total 143 288 431

IV. Ad quation du mod le

Courbe ROC

" Se en

fonction de 1-Sp

" Laire sous la courbe:

=0,5

Aucune discrimination

]0,5;0,7[ Discrimination faible

[0,7;0,8[ Discrimination acceptable

[0,8;0,9[ Discrimination excellente

[0,9;1]

Discrimination parfaite

V. Application

IV. Application

Description des donn es

" REPRISE : reprise de consommation de drogues avant la fin

pr vue du programme de traitement

(0=non ; 1=oui)

" SITE : site du programme (0=A, 1=B)

" AGE : ge linclusion

" BECK : score de d pression de BECK linclusion

(de 0.0 (normal) 54.0 (d pression)

" IVHX : histoire dutilisation de drogues par voie

intraveineuse linclusion

(1=jamais ; 2=ancienne ; 3=r cente)

" NBTRAIT : nombre de traitements anti-drogue

pr c demment suivis (de 0 40)

" RACE : race (0=blanche, 1=autre)

" DUREE : dur e du traitement attribu e par tirage au sort

linclusion

(0=courte ; 1=longue)

IV. Application

Description des donn es

Variables

moyenne ( cart-type)

Age l'inclusion

Score de d pression de Beck l'inclusion

Nombre de traitements anti-drogue

pr c demment suivis

Variables

Histoire d'utilisation de drogues par voie

intraveineuse l'inclusion

Race

Dur e du traitement

Site du programme de traitement

jamais

ancienne

r cente

blanche

autre

courte

longue

32,38 (6,19)

17,37 (9,33)

4,54 (5,48)

n (%)

223 (38,78)

109 (18,96)

243 (42,26)

430 (74,78)

145 (25,22)

289 (50,26)

286 (49,74)

A

B

400 (69,57)

175 (30,43)

Reprise de consommation de drogues avant la fin

pr vue du programme de traitement

oui

non

428 (74,43)

147 (25,57)

IV. Application

R gression logistique multiple

" Hypoth se de lin arit du logit : il existe une relation lin aire entre le Logit

du risque et la variable X.

" Estimation du 1er mod le :

M1 : logit P = 0+ 1*AGE

IV. Application

R gression logistique multiple

" Estimation du 2 me mod le :

M2 : logit P = 0+ 1AGE(2) + 2AGE(3) + 4*AGE(4)

" Aucune tendance la diminution

" Hypoth se de lin arit du logit non v rifi e Utilisation de la variable AGE

en cat gorielle

IV. Application

R gression logistique multiple

proc logistic data=TP2.donnees descending;

class IVHX (ref='1') / param=ref;

Advertisement

class age1 (ref='1') / param=ref;

model REPRISE = SITE RACE AGE1 BECK IVHX NBTRAIT DUREE;

run;

" Option descending : elle inverse lordre daffichage des modalit s de la variable

d pendante.

" La commande class IVHX(ref='1) / param=ref;

demande SAS de cr er des variables indicatrices pour les variables cat gorielles

IVHX et AGE en prenant comme classe de r f rence le groupe IVHX=1 et AGE=1.

" MODEL var_dep = var_indep </ options>;

IV. Application

IV. Application

IV. Application

R gression logistique multiple

" S lection des variables : Proc dure descendante manuelle

On limine la variable avec la p-value la plus lev

1. On enl ve la variable BECK (p-value=0.8748 qui est la plus lev e)

IV. Application

R gression logistique multiple

2. On r -estime le mod le sans cette variable et on limine la variable avec une p-

value > 0.05 & etc

IV. Application

R gression logistique multiple

" RC (Age 2 VS 1) = 1.152 Avoir entre 28 et 33 ans augmente la probabilit de

reprise de drogue par rapport un individu ayant un ge inf rieur 28 ans.

" RC (DUREE) = 0.625 Un individu qui a une dur e de traitement longue

diminue sa probabilit de reprise de drogue, ajust sur les autres variables

explicatives.

IV. Application

Etude de linteraction entre deux variables

proc logistic data=TP2.donnees descending;

class age1 (ref='1') / param=ref;

model REPRISE = NBTRAIT AGE1 NBTRAIT*AGE1;

run;

" La variable AGE modifie-t-elle leffet de la variable NBTRAIT sur la variable

d pendante REPRISE ?

IV. Application

Etude de linteraction entre deux variables

" On rejette H0, linteraction entre AGE et NBTRAIT est significative.

AGE modifie donc la variable NBTRAIT sur la variable d pendante REPRISE

On garde le terme dinteraction. Il y a modification deffet

IV. Application

Facteur de confusion

" On souhaite d terminer si la dur e du traitement (variable DUREE) modifie leffet

du nombre de traitement anti-drogue suivis (variable NBTRAIT) sur le risque

de reprise de drogue (variable REPRISE).

1. On v rifie que la variable DUREE ne modifie pas leffet de NBTRAIT sur la

variable d pendante REPRISE.

IV. Application

Facteur de confusion

2. On consid re un 1er mod le M1 :

logit P = 0 + 1NBTRAIT + 2DUREE

Et un 2 me mod le M2 :

logit P = 0+ 1*NBTRAIT

IV. Application

Facteur de confusion

3. On calcule la variation relative (1.077 1.078) / (1.077) = 0.0009

La dur e du traitement nest pas un facteur de confusion. Il ne faut pas en tenir

compte dans la mesure dassociation entre le nombre de traitement anti-drogue suivis

et la reprise ou non de drogues.

On retient le mod le M2 :

logit P = 0 + 1*NBTRAIT

IV. Application

Ad quation du mod le

proc logistic data=TP2.donnees descending;

/ attention aux valeurs manquantes/

class IVHX (ref='1') / param=ref ;

class AGE1 (ref='1') / param=ref ;

/cr ation de 2 variables indicatrices pour la variable IVHX/

model REPRISE=IVHX NBTRAIT DUREE AGE1 / lackfit

outroc=croc;

run;

IV. Application

Ad quation du mod le

" On accepte H0 Le mod le est ad quat

IV. Application

Pouvoir discriminant du mod le

/ trac de la courbe ROC/

proc gplot data=croc; /*on utilise la table cr e

pr c demment*/

plot _sensit_*_1mspec_=1 / vaxis=0 to 1 by 0.05;

run;

IV. Application

Pouvoir discriminant du mod le

Conclusion

" Variable endog ne Y binaire.

" Variable exog ne X quantitative ou qualitative

Si quantitative, v rifier lhypoth se de lin arit .

" Les param tres ne sont pas interpr tables

Il faut calculer les RC=exp( k) et les comparer 1

" Les tests sont tous bas s sur la test du rapport de

vraisemblance.

" Ad quation du mod le: On mesure l cart entre les

valeurs pr dites et observ es.