M2 - MP2L
Machine Deep Learning
Approches probabilistes
Eléments de correction en bleu
Exercice 2 : Approches probabilistes
Soit une population d'individus qui consiste en un échantillon composé d'ouvriers, de
médecins et d'employés des télécoms. On décrit les individus par un attribut logique
répondeur qui vaut vrai si l'individu possède un répondeur téléphonique et faux sinon. On
souhaite répartir les individus en trois classes ouvrier, médecin et télécom. On dispose des
informations suivantes :
classe k
P(k)
P(répondeur/k)
télécom médecin ouvrier
0.3
0.9
0.5
0.45
0.2
1
Notations :
est la population, D est l'ensemble des descriptions, une observation est décrite par d (vecteur des
valeurs des attributs), et l'ensemble des classes est {1,...,c}. On rappelle qu’une fonction C: D
{1,...,c} est appelée fonction de classement ou procédure de classification.
Sur cet exemple, nous avons supposé que l'ensemble est probabilisé. P est la probabilité définie sur
la population . On peut alors définir les probabilités et notations suivantes :
On note P(d) la probabilité qu'un élément de ait d pour description.
On note P(k) la probabilité qu'un élément de soit de classe k.
On note P(d/k) la probabilité qu'un élément de classe k ait d pour description.
On note P(k/d) la probabilité qu'un élément ayant d pour description soit de classe k.
L’objectif est de déterminer une fonction de classement. Plusieurs règles de choix d’une telle
fonction existent, en voici trois :
Règle majoritaire : ``attribuer à chaque description la classe majoritaire'',
Règle du maximum de vraisemblance : ``si j'observe d, je choisis la classe pour
laquelle cette observation est la plus probable'', c'est-à-dire celle pour laquelle P(d/k)
est maximum.
Règle de Bayes.
1
1. Exprimez, dans le cas général, la règle majoritaire et la règle du maximum de
vraisemblance sous forme de fonctions de classement notées respectivement Cmajoritaire
et Cvraisemblance. Vous utiliserez les notations introduites ci-dessus.
Règle majoritaire : Cmaj associe à tout élément d de D la classe k de {1,...,c} telle que P(k)
soit maximum.
Cmaj:
D C
d k / i C P(k) P(i)
Règle du maximum de vraisemblance : Cvraisemblance associe à tout élément d de D la classe k de
Publicité
{1,...,c} telle que P(d/k) soit maximum.
Cvraisemblance: D C
d k / i C P(d/k) P(d/i)
On voit que cette fonction de classement est plus fine que la précédente et qu'elle
correspond davantage à ce que l'on attend intuitivement. Son principal défaut
apparaît dans l'exemple suivant : supposons que l'ensemble Cl soit composé des trois
classes employé des Télécom, médecins, ouvriers et que la probabilité pour qu'un
employé des télécom ait un répondeur soit égale à 1. La règle du maximum de
vraisemblance associerait alors la classe employé des Télécom à tout individu
possédant un répondeur, ceci sans tenir compte des proportions des différentes classes
à l'intérieur de la population.
2. Quel est le défaut principal de la règle majoritaire ?
Le défaut principal de cette règle est qu'elle ne fait jouer aucun rôle à la description.
Cette fonction de classement ne peut être en général que très grossière.
3. Décrire sur l’exemple donné chacune des deux fonctions Cmajoritaire, Cvraisemblance. Vous
préciserez les ensembles de départ et d’arrivée de chacune de ces fonctions de
classement.
Règle majoritaire : Cmaj associe à tout élément d de D la classe k de {1,...,c} telle que P(k)
soit maximum.
Max (P(télécom),P(médecin),P(ouvrier))=Max(0.2,0.3,0.5)=0.5=P(ouvrier)
Cmaoritairej: {rep, rep } {télécom, médecin, ouvrier}
d ouvrier
que d soit répondeur ou répondeur
Règle du maximum de vraisemblance : Cvraisemblance associe à tout élément d de D la classe k
de {1,...,c} telle que P(d/k) soit maximum.
Max (P(répondeur/télécom), P(répondeur/(médecin), P(répondeur/ouvrier)) =
Max(1,0.9,0.45) = P(répondeur/télécom)
Max (P(répondeur/télécom), P(répondeur/(médecin), P(répondeur/ouvrier)) =
Max(0,0.1,0.55) = P(répondeur/ouvrier)
Cvraisemblance j: {rep, rep } {télécom, médecin, ouvrier}
répondeur télécom
répondeur ouvrier
2
4. Dans le cas général, rappelez la règle de Bayes, et la fonction de classement
correspondante (notée CBayes). Vous rappellerez également la formule de Bayes qui
permet de modifier une distribution a priori, en une distribution a posteriori tenant
compte des données d’apprentissage. Que suffit-il alors de maximiser ?
Règle de Bayes : CBayes associe à tout élément d de D la classe k de {1,...,c} telle que P(k/d)
soit maximum. Soit encore en utilisant la formule de Bayes et en remarquant que P(d) est
constant, on associe à d la classe k telle que P(d/k)P(k) soit maximum.
Règle de Bayes :
CBayes :
D C
d k / i C P(k /d) P(i/d)
Formule de Bayes :
Ce qui s’écrit encore :
kP(
Publicité
/d)
kP(
/d)
P(d/
)k)P(
k
P(d)
k
)k)P(
P(d/
C
1i
P(d/
)kP()k
i
i
5. Dans quel cas la règle de Bayes se ramène-t-elle à la règle du maximum de
vraisemblance ?
On peut facilement vérifier que la règle de Bayes se ramène à la règle du maximum de
vraisemblance lorsque les classes sont équiprobables. Dans ce cas, on a :
P(k) constante =1/( nb total de classes)
Comme P(d) est constante, on a :
Maximiser l’un (P(k/d)) revient à maximiser l’autre (P(d/k)).
kP(
/d)
P(d/
)k)P(
k
P(d)
6. Décrire sur l’exemple donné la fonction CBayes.
Règle de Bayes : CBayes associe à tout élément d de D la classe k de {1,...,c} telle que P(k/d)
soit maximum. Soit encore en utilisant la formule de Bayes et en remarquant que P(d) est
constante, on associe à d la classe k telle que P(d/k)P(k) soit maximum.
Règle de Bayes :
CBayes : {rep, rep } {télécom, médecin, ouvrier}
k / i C P(k /d) P(i/d)
d
Formule de Bayes :
P(télécom/répondeur)=P(répondeur/télécom)*P(télécom) / P(répondeur)
kP(
/d)
Publicité
P(d/
)k)P(
k
P(d)
3
Inutile de calculer P(rép.) et P(rép) (soit (P(d)), il suffit de remarquer qu’elles sont constantes, on maximise
alors P(d/k)P(k).
Pour mémoire, voici comment se calculent P(rép.) et P(rép) :
P(rép.)=P(télécom)P(rép/télécom) + P(médecin)P(rép/médecin)+ P(ouvrier)P(rép./ouvrier)
P(rép)=P(télécom)P(rép/télécom)+P(médecin)P(rép/médecin)+P(ouvrier)P(rép/ouvrier)
P(répondeur/télécom)P(télécom)=10.2=0.2
P(répondeur/médecin)P(médecin)=0.90.3=0.27
P(répondeur/ouvrier)P(ouvrier)=0.450.5=0.225
Le max est 0.27= P(répondeur/médecin)*P(médecin)
P(répondeur/télécom)P(télécom)=00.2=0
P(répondeur/médecin)P(médecin)=0.10.3=0.03
P(répondeur/ouvrier)P(ouvrier)=0.550.5=0.275
Le max est 0.275= P(répondeur/ouvrier)*P(ouvrier)
D’où :
CBayes : {rep, rep } {télécom, médecin, ouvrier}
médecin
ouvrier
Rep
rep
On peut définir la probabilité d'erreur d'une fonction de classement de la façon suivante : soit
C une fonction de classement, l'erreur E(d) (ou probabilité d'erreur) pour une description d est
la probabilité qu'un élément de la population de description d soit mal classé par C, l'erreur
E(C) d'une fonction de classement est la moyenne pondérée des erreurs sur les descriptions d.
E(C)=
d D
E(d)P(d).
7. Calculer les erreurs pour les trois procédures de classification trouvées précédemment.
Rappel : Soit C une fonction de classement, l'erreur E(d) pour une description d est la
probabilité qu'un élément de la population de description d soit mal classé par C, i.e.
E(d) = P(Y C / d).
Y représente la classe réelle
L'erreur de classification E(C) d'une fonction de classement est la moyenne pondérée des
erreurs sur les descriptions d, i.e.
E(C)=
d D
E(d)P(d).
Calculons par exemple l’erreur de Cvraisemblance : E(Cvraisemblance)
Cvraisemblance: D C
répondeur télécom
répondeur ouvrier
Publicité
On note : T : Telecom O : Ouvrier
M : Médecin
E(Cvraisemblance) = E(rep)P(rep) + E(rep)P(rep)
4
E(rep) = P(Y Cvraisemblance) / rep)= P(Y T) / rep)=P (M ou O /rep)= 1-P(T/rep)
E(rep) = P(Y Cvraisemblance) / rep)= P(Y O) / rep)=P (M ou T /rep)= 1-P(O/rep)
On a alors :
E(Cvraisemblance)
= E(rep)P(rep) + E(rep)P(rep)
= (1-P(T/rep))P(rep) + (1-P(O/rep))P(rep)
= P(rep) + P(rep) -P(T/rep)P(rep) -P(O/rep))P(rep)
= 1 -P(T/rep)P(rep) -P(O/rep))P(rep)
=1 – [P(rep/T).P(T).P(rep) /P(rep)] – [P(rep/O)P(O)P(rep) /P(rep)]
formule de Bayes
= 1 – [P(rep/T).P(T)] – [P(rep/O)P(O)]
= 1 – [1 x 0.2] – [0.55 x 0.5] = 1-0.2-0.275= 0,525
Vous pouvez calculer de façon analogue E(CBayes) et E(Cmaj).
Calculons par exemple l’erreur de Cmaj : E(Cmaj )
Cmaj: {rep, rep } {télécom, médecin, ouvrier}
d ouvrier
On note : T : Telecom O : Ouvrier
M : Médecin
L’estimation de l’erreur est immédiate, car la classe prédite est indépendante de la
description d :
E(Cmaj) = P( Y Cmaj)=P(Y O) =P (M ou T)= 1-P(O) = 1- 0.5= 0.5
Ce résultat peut bien sûr être retrouvé avec la formule :
E(Cmaj) = E(rep)P(rep) + E(rep)P(rep)
Voici les details :
E(rep) = P(Y Cmaj / rep)= P(Y O) / rep)=P (M ou T /rep)= 1-P(O/rep)
E(rep) = P(Y Cmaj / rep)= P(Y O) / rep)=P (M ou T /rep)= 1-P(O/rep)
On a alors :
E(Cmaj) = E(rep)P(rep) + E(rep)P(rep)
= (1-P(O/rep))P(rep) + (1-P(O/rep))P(rep)
= P(rep) + P(rep) -P(O/rep)P(rep) -P(O/rep))P(rep)
= 1 -P(O/rep)P(rep) -P(O/rep)P(rep)
=1 –P(O)= 1-0,5=0,5
Si vous passez par la formule de Bayes, vous obtiendrez :
= 1 -P(O/rep)P(rep) -P(O/rep)P(rep)
= 1 – [P(rep/O).P(O)] – [P(rep/O)P(O)]
= 1 – P(O) . [P(rep/O)+ P(rep/O)]
=1 –P(O)= 1-0,5=0,5
5