Machine Deep Learning
M2-MP2L
Machine Learning
Deep Learning
MASTÈRE PROFESSIONNEL
EN LOGICIELS LIBRES - MP2L
Amel Borgi
PLAN DU COURS
Chap 1 : Introduction
Chap 2 : Notions de base
Chap 3 : Apprentissage supervisé
Approches numériques
Les arbres de décisions
Chap 4 : Apprentissage non supervisé
K-means
Les règles d’association
Chap 5 : Les réseaux de neurones – Deep
learning
2
1
Machine Deep Learning
M2-MP2L
Chap.3 :
Apprentissage supervisé
3.1. Approches numériques
PLAN : Apprentissage supervisé
3.1. Approches numériques
De l’approche statistique
La régression
De l’approche probabiliste
Règle de décision bayésienne
Règle du maximum de vraisemblance
k-plus proches voisins
4
2
Machine Deep Learning
M2-MP2L
De l’approche statistique
5
De l’approche statistique
Exemples représentés par des points dans un espace
de dimension p (nb d’attributs).
Les généralisations sont le plus souvent représentées par
des surfaces de décision dans cet espace : hyperplans,
polynômes d’un certain degré, ...
Quelques méthodes :
La régression
L’analyse discriminante
à but descriptif
à but décisionnel
6
3
Machine Deep Learning
M2-MP2L
La régression linéaire
Objectif : prédire une variable Y (variable expliquée) à l’aide
d’un ensemble de variables X1, X2 , ..., Xp (variables explicatives)
Toutes ces variables sont quantitatives continues
Déterminer une fonction f telle que f(X1, X2 , ..., Xp ) soit aussi
proche que possible de Y
Y
yi
yi*
y
Modèle linéaire : f est une droite
f(X) = aX+b
notée : Y*= aX+b
Méthode des moindres carrés
pour estimer a et b à partir des
données d’apprentissage
[Saporta 90]
x
xi
X
7
La régression linéaire simple
Sur cet exemple, les données sont décrites par un unique
attribut X, et par la variable à prédire y, toutes deux continues.
On dispose de n observations
qui constituent la base
d’apprentissage :
{(x1,y1), (x2,y2), …, (xn,yn)}
Y
yi
yi*
y
Publicité
Pour l’observation xi :
yi : classe connue
yi * : classe prédite par la droite
des moindres carrés
x
xi
X
8
4
Machine Deep Learning
M2-MP2L
Statistiques : rappels (1/3)
A la base de toute étude statistique, il y a une population,
formée d'individus sur lesquels on observe des attributs ou
variables.
Echantillon de taille n : données recueillies sur n individus.
Soit un échantillon :
Moyenne empirique :
Variance :
écart-type :
Proposition :
Statistiques : rappels (2/3)
L’écart-type de l'échantillon est la racine carrée de
la variance.
Les notions de variance et d'écart-type servent à
quantifier la dispersion d'un échantillon autour de
sa moyenne.
L'avantage de l'écart-type sur la variance est qu'il
s'exprime, comme la moyenne, dans la même unité
que les données.
9
10
5
Machine Deep Learning
M2-MP2L
Statistiques : rappels (3/3)
Cas de 2 variables quantitatives x et y mesurées sur n
individus : (xi,yi); i=1, …, n .
On peut considérer l'échantillon bidimensionnel comme
un nuage de n points dans IR2.
Définition : On appelle covariance de x et y, et on note
cxy la quantité :
Définition : On appelle coefficient de corrélation linéaire
de x et y, et on note rxy , la quantité :
11
Régression linéaire simple (1/3)
Cas de 2 variables quantitatives x et y mesurées sur n
individus : (xi,yi); i=1, …, n
x : variable explicative y : variable à expliquer
"Expliquer" : exprimer une dépendance fonctionnelle de
y comme fonction de x, de manière à prévoir la valeur de
y connaissant celle de x.
On cherchera plutôt, dans une famille fixée de fonctions,
quelle est celle pour laquelle les yi sont les plus proches
des f(xi).
Proximité mesurée comme une
erreur quadratique moyenne EQ :
régression au sens des moindres carrés
12
6
Machine Deep Learning
M2-MP2L
Régression linéaire simple (2/3)
Régression linéaire simple : chercher f parmi les droites.
On cherche à ajuster au nuage des points (xi, yi)
une droite d’équation y*= x + de telle sorte que
n
1i
(
y
i
2*)
y
i
soit minimal.
Déterminez et
13
Régression linéaire simple (3/3)
Soient x et y deux échantillons recueillis sur une même
population, de taille n. Notons la fonction EQ(a, b) de
IR2 dans IR+ définie par :
Si (la var. x n'est pas constante), la fonction
EQ(a, b) admet un minimum pour :
Publicité
La valeur de ce minimum est :
L'erreur quadratique minimale est d'autant plus faible
que la corrélation est forte.
14
7
Machine Deep Learning
M2-MP2L
La régression logistique
Même objectif que la régression linéaire :
prédire une variable Y (variable expliquée) à
l’aide d’un ensemble de variables X1, X2 , ...,
Xp (variables explicatives)
Mais la régression logistique s’applique
au cas où:
Y est qualitative à 2 modalités
Xk qualitatives ou quantitatives
15
La régression logistique
Le plus souvent appliquée à la santé:
Identification des facteurs liés à une
maladie
Recherche des causes de décès ou de
survie de patients
Pour celles et ceux qui souhaitent aller
plus loin, consultez le document :
La régression logistique.pdf
(par Sonia NEJI et Anne-Hélène JIGOREL)
16
8
Machine Deep Learning
M2-MP2L
De l’approche probabiliste
17
L’apprentissage supervisé : Rappel et notations
Population P
• Xi variables prédictives : les attributs
• y variable à prédire : la classe
p
Population P
W W’
c
c(p)(X1(p),..., Xp(p))
Espace de
Représentation
R
y
y(p)
Ensemble des
classes C
f ?
(fonction de classement
ou classifieur)
[Zighed et al. 92]
18
9
Machine Deep Learning
M2-MP2L
De l’approche probabiliste
La théorie bayésienne de la décision
Règle de décision bayésienne :
associer à chaque nouvel individu à classer la classe
la plus probable.
Fonction de classement définie par :
f : R
c(p)=X
C
yj / pour tout y dans C
P(yj /X) >= P(y/X)
P(yj /X) est une probabilité a posteriori : doit être estimée
19
De l’approche probabiliste
Règle de décision majoritaire :
f : R
c(p)=X
C
yj / pour tout y dans C
P(yj ) >= P(y)
Règle du maximum de vraisemblance :
f : R
c(p)=X
C
yj / pour tout y dans C
P(X/yj ) >= P(X/y)
20
10
Machine Deep Learning
Publicité
M2-MP2L
De l’approche probabiliste
La théorie bayésienne de la décision
Formule de Bayes :
Probabilités a posteriori
Probabilités
conditionnelles
yP(
j
/X)
P(X/
)y)P(
y
j
j
P(X)
Probabilités a priori
yP(
j
/X)
)y)P(y
j
j
P(X/
C
Le problème revient donc à déterminer P(X/yj)
)yP()y
i
i
P(X/
1i
pour chaque classe yj, j=1...C.
P(X/yj)=P(X1=v1,X2=v2, ….,Xp=vp / yj)
De l’approche probabiliste
P(X) peut s’écrire :
yP(
j
/X)
P(X) =
P(X/
)y)P(
y
j
j
C
P(X/
)yP()y
i
i
1i
avec l’hypothèse que l’ensemble des classes {y1,y2,...,yC}
constitue un système complet d’événements, en d’autres
termes que chaque individu de la population appartient
nécessairement à une classe et une seule.
En général, cette hypothèse est supposée être vérifiée
dans le cadre d’un problème d’apprentissage supervisé.
21
22
11
Machine Deep Learning
M2-MP2L
De l’approche probabiliste
P(X/yj) échantillonnée par expérience
Deux types de solutions possibles :
On se donne a priori des lois de probabilités
paramétrées et on estime les paramètres en utilisant
l’ensemble d’apprentissage : méthodes paramétriques.
On cherche à interpoler la fonction de décision
à partir de l’ensemble d’apprentissage
Pas d’hypothèse spécifique sur la famille de loi
de probabilités : méthodes non paramétriques
[Caraux et al. 96] [Fukunaga 72] [Saporta 90]
23
De l’approche probabiliste
Dans ce cours, nous nous intéressons aux
méthodes non paramétriques
Principe simple : reconstituer directement par des
techniques d’interpolation les probabilités
recherchées à partir des exemples de l’ensemble
Publicité
d’apprentissage, et ce sans aucune connaissance sur
la distribution de probabilités sous-jacente.
Très nombreuses méthodes non paramétriques :
la discrimination par boules
la méthode des k plus proches voisins
les classifieurs bayésiens simples
...
24
12
Machine Deep Learning
M2-MP2L
La méthode des k plus proches voisins
Introduite par Cover et Hart en 1967.
Connaît un essor important : apprentissage fondé sur
les « instances »
(instance-based learning) [Aha et al. 91] [Dasarathy 90].
Règle de décision des k-ppv
examiner les k plus proches voisins, au sens d’une
métrique à préciser, du nouvel individu à classer dans
l’ensemble d’apprentissage.
affecter au nouvel exemple la classe de la majorité.
25
La méthode des k plus proches voisins
Estimation de la probabilité a posteriori
(pas grand sens si k est faible)
Déterminer les k-ppv du point X représentatif du nouvel
individu à classer, dans R1R2 … Rp
(p : nombre d’attributs, Ri domaine de variation de Xi)
Parmi ces k ppv de X, on compte le nombre kj
d’exemples de l’ensemble d’apprentissage de classe yj
On estime alors directement P(yj /X) par :
k
C
On a : =k
yP(
yP(
/X)
/X)
k
i
k
C
k
i
j
j
j
j
1i
1i
26
13
Machine Deep Learning
M2-MP2L
La méthode des k plus proches voisins
Phase d’apprentissage :
mémoriser les exemples
choisir une distance
la partie calculatoire est différée
à la phase de reconnaissance
Phase de reconnaissance :
examiner les k plus proches voisins du nouvel individu à classer
affecter au nouvel exemple la classe de la majorité.
Inconvénient des k-ppv : nécessité, coûteuse, de mémoriser
tous les exemples d’apprentissage et de comparer chaque
nouvel individu à classer à tous ces exemples.
27
Des approches statistiques
et probabilistes
Contraintes difficilement interprétables
par l’utilisateur
La régression suppose un modèle
linéaire sous-jacent
Hypothèses sur les lois de probabilités
des variables étudiées en analyse discriminante
Analyse en composantes principales difficile
à interpréter, ...
Problème de l’intelligibilité
En général, difficile d’expliquer la décision.
28
14