La r gression logistique
Par Sonia NEJI et Anne-H l ne JIGOREL
Introduction
" La r gression logistique sapplique au cas o :
Y est qualitative 2 modalit s
Xk qualitatives ou quantitatives
" Le plus souvent appliqu e la sant :
Identification des facteurs li s une maladie
Recherche des causes de d c s ou de survie de
patients
Plan
I. Sp cification du mod le
II. Interpr tation des coefficients
III. Estimations et tests des param tres
IV. Ad quation du mod le
V. Application
I. Sp cification du mod le
I.
Sp cification du mod le
Contexte
" Y est une variable binaire
0 en cas de non occurrence de l v nement.
1 si occurrence.
" Y al atoire et Xi non al atoires
" On cherche expliquer la survenue dun
v nement
" On cherche la probabilit de succ s
" On travaille en terme desp rance
I.
Sp cification du mod le
Notations
" On note:
(Y,X1,X2,&,Xk) les variables de la population dont
on extrait un chantillon de n individus i.
(yi,xi) est le vecteur des r alisations de (Yi,Xi)
K variables explicatives
I.
Sp cification du mod le
Contexte
" f ne peut tre une fonction lin aire car Y ne prend que deux valeurs:
5L =5S 5e1,5e2,&,5e5X
I.
Sp cification du mod le
Contexte
" Afin que lesp rance de Y ne prenne que 2 valeurs, une
utilise la fonction logistique :
Ainsi:
0<f(x)<1
et E(Y) =0 ou 1
5S 5e =exp(5e)1+exp(5e)=5]
I.
Sp cification du mod le
Loi de Y
" Y suit une loi de Bernoulli de param tre p
" Application de la transformation logit permet de
travailler sur des valeurs entre [-;+]:
5Y5\5T5V5a 5] =ln(5]15]) = 5 0+ 5 15e5V1+ 5 25e5V2+ +5 5]5e5V5X
II. Interpr tation des
coefficients
II. Interpr tation des coefficients
Cas dune seule variable exog ne binaire
" LOdds (ou cote )
Soit P une probabilit . Son odds est d fini par:
" Par exemple, si un tudiant a 3 chances sur 4
d tre re u, contre 1 chance sur 4 d tre coll , sa
cote est de 3 contre 1 , soit
5B5Q5Q5`5C=5C15C 5B5Q5Q5`=34 14 =3
II. Interpr tation des coefficients
Cas dune seule variable exog ne binaire
" Odds ratio (ou rapport des cotes )
Cest le rapport des cotes des probabilit s davoir
la maladie pour ceux qui ont un sympt me X
dune part et de ceux qui ne lont pas dautre part.
" OR=1, la maladie est ind pendante du sympt me
" OR>1, la maladie est plus fr quente pour les
individus qui ont le sympt me.
" OR<1, la maladie est plus fr quente pour les
individus qui nont pas le sympt me.
II. Interpr tation des coefficients
Cas dune seule variable exog ne binaire
5E56=5C 5L5V=1 |5K=1 15C 5L5V=1 |5K=1 5C 5L5V=1 |5K=0 15C 5L5V=1 |5K=0 =exp(5 0+5 1)exp 5 0 =exp(5 1)
II. Interpr tation des coefficients
Cas dune seule variable exog ne binaire
" X=0 : sympt me absent
" X=1 : sympt me pr sent
" Y=0: la maladie est absente
" Y=1: la maladie est pr sente
" On a donc:
5?5\5T5V5a[5C 5L5V=1 |5K=5e ]= 5 0+ 5 15e
II. Interpr tation des coefficients
Cas dune seule variable exog ne binaire
Avec lestimateur de 1: RC=exp( 1), permet
de comparer les individus qui poss dent le
sympt me X avec ceux qui ne le poss de pas. Pour
Publicité
cela, on compare le RC 1.
Avec lestimateur de 0: On peut calculer
Cest- -dire la proportion observ e de malades
nayant pas le sympt me.
5C 5L5V=1 |5K=0 =exp(5 0)1+ exp(5 0)
II. Interpr tation des coefficients
Cas dune seule variable exog ne
quantitative
" X une variable quantitative (ex: ge)
" Y=0: la maladie est absente
" Y=1: la maladie est pr sente
" On a encore:
5?5\5T5V5a[5C 5L5V=1 |5K=5e ]= 5 0+ 5 15e
II. Interpr tation des coefficients
Cas dune seule variable exog ne
quantitative
" Avec lestimateur de 1: permet davoir le
lodds ratio quand X1 augmente dune unit :
5E56=exp(5 1)
II. Interpr tation des coefficients
Cas dune seule variable exog ne
quantitative
" Avec lestimateur de 0: permet de connaitre
la proportion de malades dont la valeur de X est
0.
Attention linterpr tation de 0 qui
na pas de sens pour certaines variables
X comme l ge!
II. Interpr tation des coefficients
Synth se: Mod le logistique multiple
" Linterpr tation est semblable celle des
mod les une variable explicative.
" Exemple:
5?5\5T5V5a 5C 5@5N5Y5N5Q5V5R5V=1 |545T5R,5S5b5Z5R = 5 0+ 5 1.545T5R+5 2.5S5b5Z5R 5 0 =1,3982 ,5 1 = 0,4118 5R5a 5 2 =0,6708
II. Interpr tation des coefficients
Synth se: Mod le logistique multiple
" Linterpr tation de 0 na pas de sens
" RC=exp( 1)=1,5068 >1
" Si l ge augmente dune unit , le risque de contracter
la maladie augmente.
" RC=exp( 2)=1,9558 >1
" Le risque de contracter la maladie est plus lev si
lindividu est fumeur.
5?5\5T5V5a 5C 5@5N5Y5N5Q5V5R5V=1 |545T5R,5S5b5Z5R = 5 0+ 5 1.545T5R+5 2.5S5b5Z5R 5 0 =1,3982 ,5 1 = 0,4118 5R5a 5 2 =0,6708
III. Estimation et test du
mod le
III. Estimation et test du mod le
Maximum de vraisemblance
" Estimateurs des param tres sans biais et de
faible variance.
" n variables al atoires Yi iid qui suivent une loi de
B( ).
" La vraisemblance dun n- chantillon y1,y2,&,yn
est d finie comme la probabilit dobserver cet
chantillon.
III. Estimation et test du mod le
Maximum de vraisemblance
" Les variables Yi tant ind pendantes:
L( ,y1&,yn ) =
5 5f5V.(15 )15f5V5[5V=1 5C 5L5V=5f5V =5 5V5f5V.(15 5V)15f5V
III. Estimation et test du mod le
Maximum de vraisemblance
" Avec s( j) tel que s ( j) soient les variances des
estimateurs telles que la matrice de variance
covariance soit de la forme :
III. Estimation et test du mod le
Maximum de vraisemblance
Intervalles de confiance
" Ce test permet de savoir sil y a une relation
entre la variable Xj et Y.
" Si 1 T IC pas de relation
" Si 1 T IC relation entre Xj et Y
5<56=exp[5 5W 5b5 .5`(5 5W) ]
III. Estimation et test du mod le
Test du rapport de vraisemblance
" Compare 2 mod les emboit s:
M1: k param tres
M2: p param tres (p>k)
" Les hypoth ses de test sont:
" La statistique de test est:
(-2.ln(vraisemblance au maximum de M1)] -
(-2.ln(vraisemblance au maximum deM2)]
" Elle suit une loi du Khi-deux p-k degr s de libert s.
5;0:5B5[ 5P5\5V5`5V5a 5@1 (5Z 5Z5R 5^5b5N5Y5V5a 5]5_ 5Q5V5P5a5V5c5R 5^5b5R 5Y5R 2 5Z5N5V5` 5Z5\5V5[5` 5Q5R 5]5N5_5N5Z 5a5_5R5`)5;1:5B5[ 5P5\5V5`5V5a 5@2 5Z5R5V5Y5Y5R5b5_5R 5^5b5N5Y5V5a 5]5_ 5Q5V5P5a5V5c5R
III. Estimation et test du mod le
Test de significativit globale
" Les variables explicatives influencent-elles
simultan ment le risque de survenue de
l v nement?
" On va effectuer un test du rapport de
vraisemblance&
III. Estimation et test du mod le
Test de significativit globale
" M1: Mod le sans variables
Publicité
" M2: Mod le avec toutes les variables
" On teste:
" Est-ce que M1 est meilleur que M2 (qualit s
pr dictives)?
5;0:5@1 5?5\5T5V5a 5C 5L=1 = 5 0 5;1:5@2 5?5\5T5V5a 5C 5L=1 =5 0+5 15e1+ +5 5]5e5]
III. Estimation et test du mod le
Test de significativit globale
" La statistique de test est:
RV= (-2.ln(vraisemblance au maximum de M1)] -
(-2.ln(vraisemblance au maximum deM2)]
Et suit un Khi-deux p degr s de libert
" Si RV > Dz(p) On rejette H0, le mod le 2
est meilleur que le 1, les variables explicatives
ont simultan ment une influence sur la
probabilit dapparition de l v nement tudi .
III. Estimation et test du mod le
Test de significativit pour une variable
" M1: Mod le sans la variable test e j
" M2: Mod le avec la variable test e j
" On teste:
5;0:5@1 5?5\5T5V5a 5C 5L=1 = 5 0+5 15e1+ +5 5X5e5X5;1:5@2 5?5\5T5V5a 5C 5L=1 =5 0+5 15e1+ +5 5W5e5W+ +5 5X5e5X Cest- -dire : 5;0: 5 5W=05;1:5 5W`0
III. Estimation et test du mod le
Test de significativit pour une variable
" Il y a 2 mani res d crire la statistique de test
Sous une loi Normale:
Sous une loi du Khi-deux:
5H=5 5W 5`(5 5W) ~ 5A(0,1) sous H0 5K = 5 5W 5` 5 5W =5H ~ 5K (1) sous H0
III. Estimation et test du mod le
Test de significativit pour une variable
" Conclusion
Sous une loi Normale:
Si |U| > N(0,1) (=1,96 95%)
Sous une loi du Khi-deux:
Si U > Dz(1)
On rejette HO, le mod le 2 est meilleur que le 1,
le param tre j est significatif, la variable j a
une influence sur la probabilit dapparition de
l v nement, sachant les autres variables du
mod le.
III. Estimation et test du mod le
Modification deffet ou interaction
" On consid re le mod le M2:
" Si 3 est significative, alors X2 modifie leffet de
X1. En effet, dans ce cas:
Si X2=0 -> leffet de X1 est 1
Si X2=1 -> leffet de X1 est 1+ 3
5?5\5T5V5a 5C 5L=1 5K1,5K2 =5 0+ 5 1.5K1+5 2.5K2+5 3.5K1.5K2
III. Estimation et test du mod le
Modification deffet ou interaction
" On teste par le test du rapport de vraisemblance:
" Si on rejette HO Il y a modification deffet
On laisse linteraction dans
le mod le.
" Si on accepte HO On retire linteraction.
5o5 : 575 =5 5o5 :575 `5
III. Estimation et test du mod le
Confusion
" On consid re 2 mod les a et b:
" Effet brut de X1: RCa=exp( 1) de Ma
" Effet de X1 ajust X2: RCb=exp( 1) de Mb
" Il y a confusion si RCa`RCb
5Y5\5T5V5a 5C 5L=1 5K1 =5 0+5 1.5K1 5Y5\5T5V5a 5C 5L=1 5K1,5K2 =5 0+5 1.5K1+5 2.5K2
III. Estimation et test du mod le
Confusion
" Variation relative:
" 10%<k<20%
" Si VR>k X2 est un facteur de confusion
" Si VRdk on v rifie 2 =0. Si oui, on retire X2
de l tude.
5I5E= 5E565O 5E565N 5E565O
IV. Ad quation du mod le
IV. Ad quation du mod le
Principe
" D terminer la qualit dajustement du mod le
aux donn es.
" Si lajustement est correct, les valeurs pr dites
seront proches des valeurs observ es.
IV. Ad quation du mod le
Test de Hosmer et Lemeshow
" Regroupement des probabilit s pr dites par le
mod le en dix groupes (d ciles).
" Pour chaque groupe, on observe l cart entre les
valeurs pr dites et observ es. Limportance de la
distance entre ces valeurs est valu e gr ce une
statistique du Khi-deux 8 ddl qui teste:
5f5V 5;0:575V5`5a5N5[5P5R 5S5N5V5O5Y5R5;1:575V5`5a5N5[5P5R 5Y5R5c 5R
IV. Ad quation du mod le
Tableau de contingence
" Ce tableau permet de connaitre le nombre de bonnes et de mauvaises
pr dictions par rapport un seuil s (fix g n ralement 50%)
Malade (yi=1) Non Malade (yi=0) Total Pr dit malade (5 5 = 1) a c a+c Pr dit non malade (5 5 = 0) b d b+d Total a+b c+d n 5A5O5O=5N+5Q5[ 5A5O5Z=5P+5O5[
IV. Ad quation du mod le
Tableau de contingence
" Nbb: 93+257/431=81,2%
Publicité
" Nbm: 50+31/431= 18,8%
" Sensibilit : Se: 93/143 = 65%
Sp: 257/288 = 89,2%
Malade (yi=1) Non Malade (yi=0) Total Pr dit malade (5 5 = 1) 93 31 124 Pr dit non malade (5 5 = 0) 50 257 307 Total 143 288 431
IV. Ad quation du mod le
Courbe ROC
" Se en
fonction de 1-Sp
" Laire sous la courbe:
=0,5
Aucune discrimination
]0,5;0,7[ Discrimination faible
[0,7;0,8[ Discrimination acceptable
[0,8;0,9[ Discrimination excellente
[0,9;1]
Discrimination parfaite
V. Application
IV. Application
Description des donn es
" REPRISE : reprise de consommation de drogues avant la fin
pr vue du programme de traitement
(0=non ; 1=oui)
" SITE : site du programme (0=A, 1=B)
" AGE : ge linclusion
" BECK : score de d pression de BECK linclusion
(de 0.0 (normal) 54.0 (d pression)
" IVHX : histoire dutilisation de drogues par voie
intraveineuse linclusion
(1=jamais ; 2=ancienne ; 3=r cente)
" NBTRAIT : nombre de traitements anti-drogue
pr c demment suivis (de 0 40)
" RACE : race (0=blanche, 1=autre)
" DUREE : dur e du traitement attribu e par tirage au sort
linclusion
(0=courte ; 1=longue)
IV. Application
Description des donn es
Variables
moyenne ( cart-type)
Age l'inclusion
Score de d pression de Beck l'inclusion
Nombre de traitements anti-drogue
pr c demment suivis
Variables
Histoire d'utilisation de drogues par voie
intraveineuse l'inclusion
Race
Dur e du traitement
Site du programme de traitement
jamais
ancienne
r cente
blanche
autre
courte
longue
32,38 (6,19)
17,37 (9,33)
4,54 (5,48)
n (%)
223 (38,78)
109 (18,96)
243 (42,26)
430 (74,78)
145 (25,22)
289 (50,26)
286 (49,74)
A
B
400 (69,57)
175 (30,43)
Reprise de consommation de drogues avant la fin
pr vue du programme de traitement
oui
non
428 (74,43)
147 (25,57)
IV. Application
R gression logistique multiple
" Hypoth se de lin arit du logit : il existe une relation lin aire entre le Logit
du risque et la variable X.
" Estimation du 1er mod le :
M1 : logit P = 0+ 1*AGE
IV. Application
R gression logistique multiple
" Estimation du 2 me mod le :
M2 : logit P = 0+ 1AGE(2) + 2AGE(3) + 4*AGE(4)
" Aucune tendance la diminution
" Hypoth se de lin arit du logit non v rifi e Utilisation de la variable AGE
en cat gorielle
IV. Application
R gression logistique multiple
proc logistic data=TP2.donnees descending;
class IVHX (ref='1') / param=ref;
Publicité
class age1 (ref='1') / param=ref;
model REPRISE = SITE RACE AGE1 BECK IVHX NBTRAIT DUREE;
run;
" Option descending : elle inverse lordre daffichage des modalit s de la variable
d pendante.
" La commande class IVHX(ref='1) / param=ref;
demande SAS de cr er des variables indicatrices pour les variables cat gorielles
IVHX et AGE en prenant comme classe de r f rence le groupe IVHX=1 et AGE=1.
" MODEL var_dep = var_indep </ options>;
IV. Application
IV. Application
IV. Application
R gression logistique multiple
" S lection des variables : Proc dure descendante manuelle
On limine la variable avec la p-value la plus lev
1. On enl ve la variable BECK (p-value=0.8748 qui est la plus lev e)
IV. Application
R gression logistique multiple
2. On r -estime le mod le sans cette variable et on limine la variable avec une p-
value > 0.05 & etc
IV. Application
R gression logistique multiple
" RC (Age 2 VS 1) = 1.152 Avoir entre 28 et 33 ans augmente la probabilit de
reprise de drogue par rapport un individu ayant un ge inf rieur 28 ans.
" RC (DUREE) = 0.625 Un individu qui a une dur e de traitement longue
diminue sa probabilit de reprise de drogue, ajust sur les autres variables
explicatives.
IV. Application
Etude de linteraction entre deux variables
proc logistic data=TP2.donnees descending;
class age1 (ref='1') / param=ref;
model REPRISE = NBTRAIT AGE1 NBTRAIT*AGE1;
run;
" La variable AGE modifie-t-elle leffet de la variable NBTRAIT sur la variable
d pendante REPRISE ?
IV. Application
Etude de linteraction entre deux variables
" On rejette H0, linteraction entre AGE et NBTRAIT est significative.
AGE modifie donc la variable NBTRAIT sur la variable d pendante REPRISE
On garde le terme dinteraction. Il y a modification deffet
IV. Application
Facteur de confusion
" On souhaite d terminer si la dur e du traitement (variable DUREE) modifie leffet
du nombre de traitement anti-drogue suivis (variable NBTRAIT) sur le risque
de reprise de drogue (variable REPRISE).
1. On v rifie que la variable DUREE ne modifie pas leffet de NBTRAIT sur la
variable d pendante REPRISE.
IV. Application
Facteur de confusion
2. On consid re un 1er mod le M1 :
logit P = 0 + 1NBTRAIT + 2DUREE
Et un 2 me mod le M2 :
logit P = 0+ 1*NBTRAIT
IV. Application
Facteur de confusion
3. On calcule la variation relative (1.077 1.078) / (1.077) = 0.0009
La dur e du traitement nest pas un facteur de confusion. Il ne faut pas en tenir
compte dans la mesure dassociation entre le nombre de traitement anti-drogue suivis
et la reprise ou non de drogues.
On retient le mod le M2 :
logit P = 0 + 1*NBTRAIT
IV. Application
Ad quation du mod le
proc logistic data=TP2.donnees descending;
/ attention aux valeurs manquantes/
class IVHX (ref='1') / param=ref ;
class AGE1 (ref='1') / param=ref ;
/cr ation de 2 variables indicatrices pour la variable IVHX/
model REPRISE=IVHX NBTRAIT DUREE AGE1 / lackfit
outroc=croc;
run;
IV. Application
Ad quation du mod le
" On accepte H0 Le mod le est ad quat
IV. Application
Pouvoir discriminant du mod le
/ trac de la courbe ROC/
proc gplot data=croc; /*on utilise la table cr e
pr c demment*/
plot _sensit_*_1mspec_=1 / vaxis=0 to 1 by 0.05;
run;
IV. Application
Pouvoir discriminant du mod le
Conclusion
" Variable endog ne Y binaire.
" Variable exog ne X quantitative ou qualitative
Si quantitative, v rifier lhypoth se de lin arit .
" Les param tres ne sont pas interpr tables
Il faut calculer les RC=exp( k) et les comparer 1
" Les tests sont tous bas s sur la test du rapport de
vraisemblance.
" Ad quation du mod le: On mesure l cart entre les
valeurs pr dites et observ es.