Machine Deep Learning Course - MP2L

Page 1 sur 14Lecteur de document UniversityLib

Machine Deep Learning Course - MP2L

Machine Learning and Deep Learning · lab

Voir tous les documents en intelligence artificielle et données

Machine Deep Learning

M2-MP2L

Machine Learning

Deep Learning

MASTÈRE PROFESSIONNEL

EN LOGICIELS LIBRES - MP2L

Amel Borgi

PLAN DU COURS

 Chap 1 : Introduction

 Chap 2 : Notions de base

 Chap 3 : Apprentissage supervisé

 Approches numériques

Les arbres de décisions

 Chap 4 : Apprentissage non supervisé

K-means

Les règles d’association

 Chap 5 : Les réseaux de neurones – Deep

learning

2

1

Machine Deep Learning

M2-MP2L

Chap.3 :

Apprentissage supervisé

3.1. Approches numériques

PLAN : Apprentissage supervisé

3.1. Approches numériques

 De l’approche statistique

La régression

 De l’approche probabiliste

Règle de décision bayésienne

Règle du maximum de vraisemblance

k-plus proches voisins

4

2

Machine Deep Learning

M2-MP2L

De l’approche statistique

5

De l’approche statistique

 Exemples représentés par des points dans un espace

de dimension p (nb d’attributs).

 Les généralisations sont le plus souvent représentées par

des surfaces de décision dans cet espace : hyperplans,

polynômes d’un certain degré, ...

 Quelques méthodes :

 La régression

 L’analyse discriminante

 à but descriptif

 à but décisionnel

6

3

Machine Deep Learning

M2-MP2L

La régression linéaire

 Objectif : prédire une variable Y (variable expliquée) à l’aide

d’un ensemble de variables X1, X2 , ..., Xp (variables explicatives)

Toutes ces variables sont quantitatives continues

 Déterminer une fonction f telle que f(X1, X2 , ..., Xp ) soit aussi

proche que possible de Y

Y

yi

yi*

y

Modèle linéaire : f est une droite

f(X) = aX+b

notée : Y*= aX+b

Méthode des moindres carrés

pour estimer a et b à partir des

données d’apprentissage

[Saporta 90]

x

xi

X

7

La régression linéaire simple

 Sur cet exemple, les données sont décrites par un unique

attribut X, et par la variable à prédire y, toutes deux continues.

 On dispose de n observations

qui constituent la base

d’apprentissage :

{(x1,y1), (x2,y2), …, (xn,yn)}

Y

yi

yi*

y

Publicité

Pour l’observation xi :

yi : classe connue

yi * : classe prédite par la droite

des moindres carrés

x

xi

X

8

4

Machine Deep Learning

M2-MP2L

Statistiques : rappels (1/3)

 A la base de toute étude statistique, il y a une population,

formée d'individus sur lesquels on observe des attributs ou

variables.

 Echantillon de taille n : données recueillies sur n individus.

 Soit un échantillon :

 Moyenne empirique :

 Variance :

 écart-type :

 Proposition :

Statistiques : rappels (2/3)

 L’écart-type de l'échantillon est la racine carrée de

la variance.

 Les notions de variance et d'écart-type servent à

quantifier la dispersion d'un échantillon autour de

sa moyenne.

 L'avantage de l'écart-type sur la variance est qu'il

s'exprime, comme la moyenne, dans la même unité

que les données.

9

10

5

Machine Deep Learning

M2-MP2L

Statistiques : rappels (3/3)

 Cas de 2 variables quantitatives x et y mesurées sur n

individus : (xi,yi); i=1, …, n .

On peut considérer l'échantillon bidimensionnel comme

un nuage de n points dans IR2.

 Définition : On appelle covariance de x et y, et on note

cxy la quantité :

 Définition : On appelle coefficient de corrélation linéaire

de x et y, et on note rxy , la quantité :

11

Régression linéaire simple (1/3)

 Cas de 2 variables quantitatives x et y mesurées sur n

individus : (xi,yi); i=1, …, n

 x : variable explicative y : variable à expliquer

 "Expliquer" : exprimer une dépendance fonctionnelle de

y comme fonction de x, de manière à prévoir la valeur de

y connaissant celle de x.

 On cherchera plutôt, dans une famille fixée de fonctions,

quelle est celle pour laquelle les yi sont les plus proches

des f(xi).

 Proximité mesurée comme une

erreur quadratique moyenne EQ :

régression au sens des moindres carrés

12

6

Machine Deep Learning

M2-MP2L

Régression linéaire simple (2/3)

 Régression linéaire simple : chercher f parmi les droites.

 On cherche à ajuster au nuage des points (xi, yi)

une droite d’équation y*= x + de telle sorte que

n

1i

(

y

i

2*)

y

i

soit minimal.

 Déterminez et

13

Régression linéaire simple (3/3)

 Soient x et y deux échantillons recueillis sur une même

population, de taille n. Notons la fonction EQ(a, b) de

IR2 dans IR+ définie par :

Si (la var. x n'est pas constante), la fonction

EQ(a, b) admet un minimum pour :

Publicité

La valeur de ce minimum est :

 L'erreur quadratique minimale est d'autant plus faible

que la corrélation est forte.

14

7

Machine Deep Learning

M2-MP2L

La régression logistique

 Même objectif que la régression linéaire :

 prédire une variable Y (variable expliquée) à

l’aide d’un ensemble de variables X1, X2 , ...,

Xp (variables explicatives)

 Mais la régression logistique s’applique

au cas où:

 Y est qualitative à 2 modalités

 Xk qualitatives ou quantitatives

15

La régression logistique

 Le plus souvent appliquée à la santé:

 Identification des facteurs liés à une

maladie

 Recherche des causes de décès ou de

survie de patients

 Pour celles et ceux qui souhaitent aller

plus loin, consultez le document :

La régression logistique.pdf

(par Sonia NEJI et Anne-Hélène JIGOREL)

16

8

Machine Deep Learning

M2-MP2L

De l’approche probabiliste

17

L’apprentissage supervisé : Rappel et notations

Population P

• Xi variables prédictives : les attributs

• y variable à prédire : la classe

p

Population P

W W’

c

c(p)(X1(p),..., Xp(p))

Espace de

Représentation

R

y

y(p)

Ensemble des

classes C

f ?

(fonction de classement

ou classifieur)

[Zighed et al. 92]

18

9

Machine Deep Learning

M2-MP2L

De l’approche probabiliste

La théorie bayésienne de la décision

 Règle de décision bayésienne :

associer à chaque nouvel individu à classer la classe

la plus probable.

 Fonction de classement définie par :

f : R

c(p)=X

C

yj / pour tout y dans C

P(yj /X) >= P(y/X)

 P(yj /X) est une probabilité a posteriori : doit être estimée

19

De l’approche probabiliste

 Règle de décision majoritaire :

f : R

c(p)=X

C

yj / pour tout y dans C

P(yj ) >= P(y)

 Règle du maximum de vraisemblance :

f : R

c(p)=X

C

yj / pour tout y dans C

P(X/yj ) >= P(X/y)

20

10

Machine Deep Learning

Publicité

M2-MP2L

De l’approche probabiliste

La théorie bayésienne de la décision

Formule de Bayes :

Probabilités a posteriori

Probabilités

conditionnelles

yP(

j

/X)

P(X/

)y)P(

y

j

j

P(X)

Probabilités a priori

yP(

j

/X)

)y)P(y

j

j

P(X/

C

 Le problème revient donc à déterminer P(X/yj)

)yP()y

i

i

P(X/

1i

pour chaque classe yj, j=1...C.

P(X/yj)=P(X1=v1,X2=v2, ….,Xp=vp / yj)

De l’approche probabiliste

 P(X) peut s’écrire :

yP(

j

/X)

P(X) =

P(X/

)y)P(

y

j

j

C

P(X/

)yP()y

i

i

1i

avec l’hypothèse que l’ensemble des classes {y1,y2,...,yC}

constitue un système complet d’événements, en d’autres

termes que chaque individu de la population appartient

nécessairement à une classe et une seule.

 En général, cette hypothèse est supposée être vérifiée

dans le cadre d’un problème d’apprentissage supervisé.

21

22

11

Machine Deep Learning

M2-MP2L

De l’approche probabiliste

P(X/yj) échantillonnée par expérience

Deux types de solutions possibles :

 On se donne a priori des lois de probabilités

paramétrées et on estime les paramètres en utilisant

l’ensemble d’apprentissage : méthodes paramétriques.

 On cherche à interpoler la fonction de décision

à partir de l’ensemble d’apprentissage

Pas d’hypothèse spécifique sur la famille de loi

de probabilités : méthodes non paramétriques

[Caraux et al. 96] [Fukunaga 72] [Saporta 90]

23

De l’approche probabiliste

 Dans ce cours, nous nous intéressons aux

méthodes non paramétriques

 Principe simple : reconstituer directement par des

techniques d’interpolation les probabilités

recherchées à partir des exemples de l’ensemble

Publicité

d’apprentissage, et ce sans aucune connaissance sur

la distribution de probabilités sous-jacente.

 Très nombreuses méthodes non paramétriques :

 la discrimination par boules

 la méthode des k plus proches voisins

 les classifieurs bayésiens simples

 ...

24

12

Machine Deep Learning

M2-MP2L

La méthode des k plus proches voisins

 Introduite par Cover et Hart en 1967.

 Connaît un essor important : apprentissage fondé sur

les « instances »

(instance-based learning) [Aha et al. 91] [Dasarathy 90].

Règle de décision des k-ppv

 examiner les k plus proches voisins, au sens d’une

métrique à préciser, du nouvel individu à classer dans

l’ensemble d’apprentissage.

 affecter au nouvel exemple la classe de la majorité.

25

La méthode des k plus proches voisins

Estimation de la probabilité a posteriori

(pas grand sens si k est faible)

Déterminer les k-ppv du point X représentatif du nouvel

individu à classer, dans R1R2 … Rp

(p : nombre d’attributs, Ri domaine de variation de Xi)

 Parmi ces k ppv de X, on compte le nombre kj

d’exemples de l’ensemble d’apprentissage de classe yj

 On estime alors directement P(yj /X) par :

k

 C

On a : =k

yP(

yP(

/X)

/X)

k

i

k

 C

k

i

j

j

j

j

1i

1i

26

13

Machine Deep Learning

M2-MP2L

La méthode des k plus proches voisins

 Phase d’apprentissage :

 mémoriser les exemples

 choisir une distance

 la partie calculatoire est différée

à la phase de reconnaissance

 Phase de reconnaissance :

 examiner les k plus proches voisins du nouvel individu à classer

 affecter au nouvel exemple la classe de la majorité.

Inconvénient des k-ppv : nécessité, coûteuse, de mémoriser

tous les exemples d’apprentissage et de comparer chaque

nouvel individu à classer à tous ces exemples.

27

Des approches statistiques

et probabilistes

 Contraintes difficilement interprétables

par l’utilisateur

 La régression suppose un modèle

linéaire sous-jacent

 Hypothèses sur les lois de probabilités

des variables étudiées en analyse discriminante

 Analyse en composantes principales difficile

à interpréter, ...

 Problème de l’intelligibilité

 En général, difficile d’expliquer la décision.

28

14