M2 - MP2L: Probabilistic Approaches

Page 1 sur 5Lecteur de document UniversityLib

M2 - MP2L: Probabilistic Approaches

Machine Learning · exam

Voir tous les documents en intelligence artificielle et données

M2 - MP2L

Machine Deep Learning

Approches probabilistes

Eléments de correction en bleu

Exercice 2 : Approches probabilistes

Soit une population  d'individus qui consiste en un échantillon composé d'ouvriers, de

médecins et d'employés des télécoms. On décrit les individus par un attribut logique

répondeur qui vaut vrai si l'individu possède un répondeur téléphonique et faux sinon. On

souhaite répartir les individus en trois classes ouvrier, médecin et télécom. On dispose des

informations suivantes :

classe k

P(k)

P(répondeur/k)

télécom médecin ouvrier

0.3

0.9

0.5

0.45

0.2

1

Notations :

 est la population, D est l'ensemble des descriptions, une observation est décrite par d (vecteur des

valeurs des attributs), et l'ensemble des classes est {1,...,c}. On rappelle qu’une fonction C: D 

{1,...,c} est appelée fonction de classement ou procédure de classification.

Sur cet exemple, nous avons supposé que l'ensemble  est probabilisé. P est la probabilité définie sur

la population . On peut alors définir les probabilités et notations suivantes :

 On note P(d) la probabilité qu'un élément de  ait d pour description.

 On note P(k) la probabilité qu'un élément de  soit de classe k.

 On note P(d/k) la probabilité qu'un élément de classe k ait d pour description.

 On note P(k/d) la probabilité qu'un élément ayant d pour description soit de classe k.

L’objectif est de déterminer une fonction de classement. Plusieurs règles de choix d’une telle

fonction existent, en voici trois :

 Règle majoritaire : ``attribuer à chaque description la classe majoritaire'',

 Règle du maximum de vraisemblance : ``si j'observe d, je choisis la classe pour

laquelle cette observation est la plus probable'', c'est-à-dire celle pour laquelle P(d/k)

est maximum.

 Règle de Bayes.

1

1. Exprimez, dans le cas général, la règle majoritaire et la règle du maximum de

vraisemblance sous forme de fonctions de classement notées respectivement Cmajoritaire

et Cvraisemblance. Vous utiliserez les notations introduites ci-dessus.

Règle majoritaire : Cmaj associe à tout élément d de D la classe k de {1,...,c} telle que P(k)

soit maximum.

Cmaj:

D  C

d  k /  i C P(k)  P(i)

Règle du maximum de vraisemblance : Cvraisemblance associe à tout élément d de D la classe k de

Publicité

{1,...,c} telle que P(d/k) soit maximum.

Cvraisemblance: D  C

d  k / i C P(d/k)  P(d/i)

On voit que cette fonction de classement est plus fine que la précédente et qu'elle

correspond davantage à ce que l'on attend intuitivement. Son principal défaut

apparaît dans l'exemple suivant : supposons que l'ensemble Cl soit composé des trois

classes employé des Télécom, médecins, ouvriers et que la probabilité pour qu'un

employé des télécom ait un répondeur soit égale à 1. La règle du maximum de

vraisemblance associerait alors la classe employé des Télécom à tout individu

possédant un répondeur, ceci sans tenir compte des proportions des différentes classes

à l'intérieur de la population.

2. Quel est le défaut principal de la règle majoritaire ?

Le défaut principal de cette règle est qu'elle ne fait jouer aucun rôle à la description.

Cette fonction de classement ne peut être en général que très grossière.

3. Décrire sur l’exemple donné chacune des deux fonctions Cmajoritaire, Cvraisemblance. Vous

préciserez les ensembles de départ et d’arrivée de chacune de ces fonctions de

classement.

 Règle majoritaire : Cmaj associe à tout élément d de D la classe k de {1,...,c} telle que P(k)

soit maximum.

Max (P(télécom),P(médecin),P(ouvrier))=Max(0.2,0.3,0.5)=0.5=P(ouvrier)

Cmaoritairej: {rep,  rep }  {télécom, médecin, ouvrier}

d  ouvrier

que d soit répondeur ou  répondeur

 Règle du maximum de vraisemblance : Cvraisemblance associe à tout élément d de D la classe k

de {1,...,c} telle que P(d/k) soit maximum.

Max (P(répondeur/télécom), P(répondeur/(médecin), P(répondeur/ouvrier)) =

Max(1,0.9,0.45) = P(répondeur/télécom)

Max (P(répondeur/télécom), P(répondeur/(médecin), P(répondeur/ouvrier)) =

Max(0,0.1,0.55) = P(répondeur/ouvrier)

Cvraisemblance j: {rep,  rep }  {télécom, médecin, ouvrier}

répondeur télécom

répondeur ouvrier

2

4. Dans le cas général, rappelez la règle de Bayes, et la fonction de classement

correspondante (notée CBayes). Vous rappellerez également la formule de Bayes qui

permet de modifier une distribution a priori, en une distribution a posteriori tenant

compte des données d’apprentissage. Que suffit-il alors de maximiser ?

Règle de Bayes : CBayes associe à tout élément d de D la classe k de {1,...,c} telle que P(k/d)

soit maximum. Soit encore en utilisant la formule de Bayes et en remarquant que P(d) est

constant, on associe à d la classe k telle que P(d/k)P(k) soit maximum.

Règle de Bayes :

CBayes :

D  C

d  k / i C P(k /d)  P(i/d)

Formule de Bayes :

Ce qui s’écrit encore :

kP(

Publicité

/d)

kP(

/d)

P(d/

)k)P(

k

P(d)

k

)k)P(

P(d/

C

1i

P(d/

)kP()k

i

i

5. Dans quel cas la règle de Bayes se ramène-t-elle à la règle du maximum de

vraisemblance ?

On peut facilement vérifier que la règle de Bayes se ramène à la règle du maximum de

vraisemblance lorsque les classes sont équiprobables. Dans ce cas, on a :

P(k) constante =1/( nb total de classes)

Comme P(d) est constante, on a :

Maximiser l’un (P(k/d)) revient à maximiser l’autre (P(d/k)).

kP(

/d)

P(d/

)k)P(

k

P(d)

6. Décrire sur l’exemple donné la fonction CBayes.

 Règle de Bayes : CBayes associe à tout élément d de D la classe k de {1,...,c} telle que P(k/d)

soit maximum. Soit encore en utilisant la formule de Bayes et en remarquant que P(d) est

constante, on associe à d la classe k telle que P(d/k)P(k) soit maximum.

Règle de Bayes :

CBayes : {rep,  rep }  {télécom, médecin, ouvrier}

 k / i C P(k /d)  P(i/d)

d

Formule de Bayes :

P(télécom/répondeur)=P(répondeur/télécom)*P(télécom) / P(répondeur)

kP(

/d)

Publicité

P(d/

)k)P(

k

P(d)

3

Inutile de calculer P(rép.) et P(rép) (soit (P(d)), il suffit de remarquer qu’elles sont constantes, on maximise

alors P(d/k)P(k).

Pour mémoire, voici comment se calculent P(rép.) et P(rép) :

P(rép.)=P(télécom)P(rép/télécom) + P(médecin)P(rép/médecin)+ P(ouvrier)P(rép./ouvrier)

P(rép)=P(télécom)P(rép/télécom)+P(médecin)P(rép/médecin)+P(ouvrier)P(rép/ouvrier)

P(répondeur/télécom)P(télécom)=10.2=0.2

P(répondeur/médecin)P(médecin)=0.90.3=0.27

P(répondeur/ouvrier)P(ouvrier)=0.450.5=0.225

Le max est 0.27= P(répondeur/médecin)*P(médecin)

P(répondeur/télécom)P(télécom)=00.2=0

P(répondeur/médecin)P(médecin)=0.10.3=0.03

P(répondeur/ouvrier)P(ouvrier)=0.550.5=0.275

Le max est 0.275= P(répondeur/ouvrier)*P(ouvrier)

D’où :

CBayes : {rep,  rep }  {télécom, médecin, ouvrier}

 médecin

 ouvrier

Rep

rep

On peut définir la probabilité d'erreur d'une fonction de classement de la façon suivante : soit

C une fonction de classement, l'erreur E(d) (ou probabilité d'erreur) pour une description d est

la probabilité qu'un élément de la population  de description d soit mal classé par C, l'erreur

E(C) d'une fonction de classement est la moyenne pondérée des erreurs sur les descriptions d.

E(C)=

d  D

E(d)P(d).

7. Calculer les erreurs pour les trois procédures de classification trouvées précédemment.

Rappel : Soit C une fonction de classement, l'erreur E(d) pour une description d est la

probabilité qu'un élément de la population  de description d soit mal classé par C, i.e.

E(d) = P(Y  C / d).

Y représente la classe réelle

L'erreur de classification E(C) d'une fonction de classement est la moyenne pondérée des

erreurs sur les descriptions d, i.e.

E(C)=

d  D

E(d)P(d).

Calculons par exemple l’erreur de Cvraisemblance : E(Cvraisemblance)

Cvraisemblance: D  C

répondeur télécom

répondeur ouvrier

Publicité

On note : T : Telecom O : Ouvrier

M : Médecin

E(Cvraisemblance) = E(rep)P(rep) + E(rep)P(rep)

4

E(rep) = P(Y  Cvraisemblance) / rep)= P(Y  T) / rep)=P (M ou O /rep)= 1-P(T/rep)

E(rep) = P(Y  Cvraisemblance) / rep)= P(Y  O) / rep)=P (M ou T /rep)= 1-P(O/rep)

On a alors :

E(Cvraisemblance)

= E(rep)P(rep) + E(rep)P(rep)

= (1-P(T/rep))P(rep) + (1-P(O/rep))P(rep)

= P(rep) + P(rep) -P(T/rep)P(rep) -P(O/rep))P(rep)

= 1 -P(T/rep)P(rep) -P(O/rep))P(rep)

=1 – [P(rep/T).P(T).P(rep) /P(rep)] – [P(rep/O)P(O)P(rep) /P(rep)]

formule de Bayes

= 1 – [P(rep/T).P(T)] – [P(rep/O)P(O)]

= 1 – [1 x 0.2] – [0.55 x 0.5] = 1-0.2-0.275= 0,525

Vous pouvez calculer de façon analogue E(CBayes) et E(Cmaj).

Calculons par exemple l’erreur de Cmaj : E(Cmaj )

Cmaj: {rep,  rep }  {télécom, médecin, ouvrier}

d  ouvrier

On note : T : Telecom O : Ouvrier

M : Médecin

L’estimation de l’erreur est immédiate, car la classe prédite est indépendante de la

description d :

E(Cmaj) = P( Y  Cmaj)=P(Y  O) =P (M ou T)= 1-P(O) = 1- 0.5= 0.5

Ce résultat peut bien sûr être retrouvé avec la formule :

E(Cmaj) = E(rep)P(rep) + E(rep)P(rep)

Voici les details :

E(rep) = P(Y  Cmaj / rep)= P(Y  O) / rep)=P (M ou T /rep)= 1-P(O/rep)

E(rep) = P(Y  Cmaj / rep)= P(Y  O) / rep)=P (M ou T /rep)= 1-P(O/rep)

On a alors :

E(Cmaj) = E(rep)P(rep) + E(rep)P(rep)

= (1-P(O/rep))P(rep) + (1-P(O/rep))P(rep)

= P(rep) + P(rep) -P(O/rep)P(rep) -P(O/rep))P(rep)

= 1 -P(O/rep)P(rep) -P(O/rep)P(rep)

=1 –P(O)= 1-0,5=0,5

Si vous passez par la formule de Bayes, vous obtiendrez :

= 1 -P(O/rep)P(rep) -P(O/rep)P(rep)

= 1 – [P(rep/O).P(O)] – [P(rep/O)P(O)]

= 1 – P(O) . [P(rep/O)+ P(rep/O)]

=1 –P(O)= 1-0,5=0,5

5