Machine Deep Learning
M2-MP2L
Machine Learning
Deep Learning
MAST RE PROFESSIONNEL
EN LOGICIELS LIBRES - MP2L
Amel Borgi
Chapitre 2 :
Notions de base
1
Machine Deep Learning
M2-MP2L
PLAN DU COURS
n Chap 1 : Introduction
n Chap 2 : Notions de base
n Chap 3 : Apprentissage supervis
Approches num riques
Les arbres de d cisions
n Chap 4 : Apprentissage non supervis
K-means
Les r gles dassociation
n Chap 5 : Les r seaux de neurones Deep
learning
PLAN : Chap 2 : Notions de base
n Tendances de lapprentissage artificiel
Apprentissage supervis
Apprentissage non supervis
Apprentissage semi supervis
Apprentissage par renforcement
n Evaluation de lapprentissage
n Sur-apprentissage
3
4
2
Machine Deep Learning
M2-MP2L
Tendances de
lapprentissage artificiel
5
Tendances de lapprentissage
artificiel
Deux tendances principales de lapprentissage :
o celle issue des statistiques :
apprentissage num rique
o celle issue de lIA :
R gression
lin aire
apprentissage symbolique
6
3
Machine Deep Learning
M2-MP2L
Tendances de lapprentissage
artificiel
Deux tendances principales de lapprentissage :
o celle issue des statistiques :
apprentissage num rique
o celle issue de lIA :
apprentissage symbolique
Arbre de
d cision
7
Tendances de lapprentissage
artificiel
Les algorithmes dapprentissage peuvent diff rer par
le type de donn es utilis es et de connaissances
produites , leur repr sentation et leurs strat gies
dapprentissage
Exemples :
les arbres de d cision,
les formalismes logiques,
les r gles de production,
les r seaux bay siens,
les fonctions lin aires, ...
8
4
Machine Deep Learning
M2-MP2L
Tendances de lapprentissage
artificiel
n Apprentissage supervis
n Apprentissage non supervis
nApprentissage semi supervis
n Apprentissage par renforcement
9
Lapprentissage
supervis
10
5
Machine Deep Learning
M2-MP2L
Lapprentissage supervis
n On dispose dun ensemble de donn es
tiquet es par un expert ou de classe connue
la base dapprentissage
n Objectif de lapprentissage supervis :
construire partir de la base dapprentissage
des fonctions de classement
n Fonction de classement
reconna t un attribut particulier (la classe)
partir de la description dun objet.
11
Exemple : Phase dapprentissage
n Construction du
mod le pr dictif
partir des donn es
dapprentissage
Variables
explicatives
Variable expliquer
ou classe
Sepal
length
Sepal
width
Petal
length
Petal
width
Iris type
5.4
4.6
6.1
7.7
3.9
3.4
2.9
3.0
1.7
1.4
4.7
6.1
0.4
0.3
1.4
2.3
Setosa
Setosa
Versicolour
Virginica
Exemples
Base
dapprentissage
Mod le
pr dictif
12
6
Machine Deep Learning
M2-MP2L
Exemple : phase de reconnaissance
Nouvel exemple de
classe inconnue
Sepal
length
Sepal
width
Petal
length
Petal
width
4.9
3.1
1.2
0.6
Mod le
Publicité
pr dictif
Classe : Setosa
(classe pr dite par le
mod le pr dictif)
13
Lapprentissage supervis
La phase dapprentissage
fonction de classement
= classifieur
= mod le pr dictif
Apprentissage
Fonction de
classement f
Base dapprentissage
La phase de reconnaissance
Fonction de
classement f
14
7
W
Machine Deep Learning
M2-MP2L
Lapprentissage supervis : un exemple
La r gression lin aire simple
Extrait de la base dapprentissage
Lapprentissage supervis : un exemple
La r gression lin aire simple
La phase dapprentissage : construction de la droite de
r gression lin aire (cette approche sera vue plus loin
dans le cours)
15
16
8
Machine Deep Learning
M2-MP2L
Lapprentissage supervis : un exemple
La r gression lin aire simple
La phase de reconnaissance : on veut pr dire le prix dun
appartement de surface connue x1. Ce prix est la valeur
pr dite par la droite de r gression, ici y1.
y1
x1
17
Lapprentissage supervis : un exemple
Larbre de d cision Donn es Iris
Attribute Information:
1. sepal length in cm
2. sepal width in cm
3. petal length in cm
4. petal width in cm
5. class:
-- Iris Setosa
-- Iris Versicolour
-- Iris Virginica
Extrait de la base dapprentissage
5.1,3.5,1.4,0.2,Iris-setosa
4.9,3.0,1.4,0.2,Iris-setosa
4.7,3.2,1.3,0.2,Iris-setosa
4.6,3.1,1.5,0.2,Iris-setosa
6.4,3.2,4.5,1.5,Iris-versicolor
6.9,3.1,4.9,1.5,Iris-versicolor
5.5,2.3,4.0,1.3,Iris-versicolor
6.5,2.8,4.6,1.5,Iris-versicolor
6.8,3.2,5.9,2.3,Iris-virginica
6.7,3.3,5.7,2.5,Iris-virginica
6.7,3.0,5.2,2.3,Iris-virginica
6.3,2.5,5.0,1.9,Iris-virginica
18
9
Machine Deep Learning
M2-MP2L
Lapprentissage supervis : un exemple
Larbre de d cision
La phase dapprentissage : construction de larbre
de d cision (cette approche sera vue plus loin dans le
cours)
Petal.Le
19
20
Lapprentissage supervis : un exemple
Larbre de d cision
La phase de reconnaissance : pr diction de lesp ce
dune nouvelle fleur dIris I1 partir de sa description
I1
Petal.Le
I1
sepal length : 5.9
sepal width: 3.5
petal length: 5.8
petal width: 1.8
La classe pr dite
est setosa
10
Machine Deep Learning
M2-MP2L
Lapprentissage supervis
Population P
" Xi variables pr dictives : les attributs
" y variable pr dire : la classe
Population P
W W
y
Avec nos exemples ?
" Prix des appartements
" Iris
y(p )
Ensemble des
classes C
c( p )=(X1(p ),..., Xp(p ))
Espace de
Repr sentation
R
f ?
(fonction de classement
ou classifieur)
21
Lapprentissage supervis :
ex. Iris de Fisher
Population P
X1= sepal length, D1= [4.3, 7.9]
X2= sepal width, D2= [2.0, 4.4 ]
X3= petal length, D3= [1.0, 6.9 ]
X4= petal width, D4= [0.1, 2.5]
: des iris
" Xi variables pr dictives : 4 attributs
" y variable pr dire : la classe (3 esp ces dIris)
p
Population P
des iris
:
y
y(p )
C = {Setosa,
c( p )=(X1(p ),..., X4(p ))
Espace de
Repr sentation
R = D1xD2xD3xD4
f ?
(fonction de classement
ou classifieur)
Versicolour, Virginica}
22
11
c
p
c
Machine Deep Learning
M2-MP2L
Lapprentissage supervis
n Si y est une fonction continue
R gression
Estimation de densit
n Si y est une fonction discr te
Classement / discrimination
(en anglais on parle de classification !)
n Si y est une fonction binaire (bool enne)
Apprentissage de concepts
23
24
Lapprentissage supervis :
Exemples de m thodes
n k plus proches voisins
n R seaux de neurones
n S parateurs Vastes Marges (SVM)
n Arbres de d cisions
Publicité
n Espace des versions
n Approches probabilistes
n Analyse discriminante
n Syst mes dInf rence Floue
n &
12
Machine Deep Learning
M2-MP2L
Lapprentissage
non supervis
25
Lapprentissage non supervis
n On dispose dun ensemble de donn es ou
dobservations {O1, O2, &, Om}
(contrairement au cas de lapprentissage supervis , les
donn es ne sont pas tiquet es par une classe).
n Objectif :
Comme seules les observations {O1, O2, &, Om} sont
disponibles, on cherche des r gularit s sous-jacentes.
En extraire des sous-ensembles homog nes
D crire comment les donn es sont organis es
Trouver des relations entre les donn es
26
13
Machine Deep Learning
M2-MP2L
Lapprentissage non supervis
On distingue essentiellement deux familles
dapproches :
n Classification automatique
Clustering
Classification hi rarchique
n D couverte automatique
27
Lapprentissage non supervis
n Lunivers num rique
En 2007 : ~ 281 exaoctets (281 milliards de
gigaoctets = 2,81.1020)
En 2011 : ~3.1021
En 2019 : ~ 50 zettaoctets
Surtout des images et des vid os
Comment organiser cette masse
norme de donn es ?
28
14
Machine Deep Learning
M2-MP2L
Lapprentissage non supervis
Classification automatique
n Organiser un ensemble de formes en
groupes contrast s
n Comprimer les donn es en y d couvrant une
structure
Afin
de comprendre les donn es
29
Lapprentissage non supervis
Classification / Clustering
On dispose dune masse de donn es indiff renci es,
et lon d sire savoir si elles poss dent une quelconque
structure de groupes.
Regrouper en classes des objets en se basant
sur des similarit s entre eux.
Maximiser la similarit intra-classes
et minimiser la similarit inter-classes
30
15
Machine Deep Learning
M2-MP2L
Lapprentissage non supervis
Classification / Clustering
Masse de donn es
indiff renci es
R sultat du clustering :
3 clusters (ou classes)
d tect s
Lapprentissage non supervis
Classification hi rarchique
La classification hi rarchique consiste fournir
un ensemble de partitions des donn es
dapprentissage en classes de moins en moins
fines obtenues par regroupements successifs
de parties.
31
32
16
Machine Deep Learning
M2-MP2L
Lapprentissage non supervis
Extrait de la
classification
taxinomique de Linn
Embranchements
Classe
Ordre
Famille
...
...
...
Genre
Esp ces
...
...
...
...
...
...
...
...
33
Lapprentissage non supervis
La d couverte automatique
n Trouver les lois les plus simples possibles pour
expliquer des ph nom nes naturels ou des
invariants dans les bases de donn es.
D couvrir de nouvelles relations dans les donn es.
n Exemple : Un pg de d couverte automatique pourrait
retrouver la loi dOhm (U = RI) partir de mesures sur
lintensit du courant, la valeur de la r sistance lectrique et
la tension. Mieux il pourrait tablir des lois inconnues ou mal
connues en fouillant de grosses bases de donn es.
34
17
Machine Deep Learning
M2-MP2L
Lapprentissage non supervis
Les r gles dassociation
n Consiste d terminer les valeurs qui sont
associ es.
n Exemple type : d termination des articles qui se
retrouvent ensemble sur un m me ticket de
supermarch
Int ressant pour identifier des opportunit s
de vente crois e et concevoir des
groupements attractifs de produit.
N cessite de tr s grands jeux de donn es
35
M thodes dapprentissage non
supervis
n Seules les observations sont disponibles, on cherche
des r gularit s sous-jacentes :
Sous forme dune fonction : r gression
Sous forme de nuages de points : clustering
(e.g. K-means)
Sous forme dune classification hi rarchique
(Clustering Hierarchique Ascendant (AHC), Clustering
Descendant (e.g.Cobweb )
Sous forme dune base de r gles (e.g. extraction de
r gles, algorithme A Priori)
&
36
18
Machine Deep Learning
M2-MP2L
Lapprentissage
semi-supervis
37
Apprentissage semi-supervis
n Parmi les observations {x1, x2, &, xm} seulement
un petit nombre dentre elles ont un label yi
n Lobjectif est le m me que pour lapprentissage
supervis mais on aimerait tirer profit des
observations non labellis es.
n Exemple : pour la discrimination de
pages Web, le nombre dexemples
Publicité
peut tre tr s grand mais leur
associer un label est co teux.
38
19
Machine Deep Learning
M2-MP2L
Lapprentissage
par renforcement
39
Apprentissage par renforcement
n Etant donn s : un agent, un environnement
dans lequel certaines actions induisent des
r compenses,
n Lapprentissage par renforcement cest
lensemble des m thodes et algorithmes
permettant un agent dapprendre se
comporter dans un environnement, afin dobtenir
le plus de r compenses possible sur le long
terme.
40
20
Machine Deep Learning
M2-MP2L
Apprentissage par renforcement
Les donn es dapprentissage
n Une s quence de perceptions,
dactions et de r compenses :
(st, at, rt)t = 1,
Avec un renforcement rt
rt peut sanctionner des
actions tr s ant rieures t
Environnement
Perception
( tat)
R compense
Action
Le probl me : inf rer une application : situation per ue
action
afin de maximiser un gain sur le long terme
41
Apprentissage par renforcement
n Difficile pour deux raisons principales
signaux de renforcement pauvres
d lai s parant le signal de renforcement des
d cisions qui y ont conduit
environnement incertain et inconnu
42
21
Machine Deep Learning
M2-MP2L
Apprentissage par renforcement
n Applications
commande des syst mes,
robotique,
informatique,
des actions quotidiennes dans la vie,
jeux,
...
Agent
Environnement
R compense lg terme
Robot aspirateur
Appartement
Degr de propret la fin
Agent n gociant
Ens. dagents
acheteurs/vendeurs
Gain obtenu
Prog. de jeu d chec
chiquier+autre joueur
Gain de la partie
Routeurs
R seau informatique
Nb de paquets achemin s
Evaluation de
lapprentissage
43
44
22
Machine Deep Learning
M2-MP2L
Evaluation
n Objectif : valuer et valider le r sultat de
lapprentissage.
n La validation d pend de la nature de la t che
et du probl me consid r .
n Deux modes de validation :
Statistique
Par expertise
45
Validation
n Objectif de la validation statistique :
obtenir des informations qui permettront de juger le
r sultat obtenu, ou d'estimer la qualit ou les biais
des donn es dapprentissage.
Utilise des chantillons de test
Utilise des mesures d valuation du r sultat
(performance, qualit , &)
46
23
Machine Deep Learning
M2-MP2L
Validation
n Le crit re de succ s d pend la fois du domaine
tudi et de lobjectif de lapprentissage
n Pour certains domaines d'application (le
diagnostic m dical, par exemple), il est essentiel
que le mod le produit soit compr hensible. Il y a
donc une premi re validation du mod le produit
par l'expert, celle-ci peut tre compl t e par une
validation statistique sur des bases de cas
existantes.
47
Apprentissage non supervis
n Validation essentiellement du ressort de l'expert.
n Ex. Clustering : lalgorithme de clustering construit des
groupes homog nes
Le niveau dhomog n it peut tre estim par la
similarit inter-classes et intra-classes
Mais seul un expert peut juger de la pertinence des
groupes constitu s.
n Ex. R gles dassociations : des mesures permettent
destimer la qualit des r gles. L'expert du domaine
jugera de leur pertinence : l'algorithme fournit des r gles
porteuses d'information, mais peut galement produire
des r gles triviales et sans int r t.
48
24
Machine Deep Learning
M2-MP2L
Apprentissage supervis
Quel crit re de performance ?
n La base dapprentissage est un chantillon de m
exemples de classes connue
W ={(xi,yi)}1..m
n Chaque exemple xi comporte p attributs : (Xi
1,&, Xi
p)
xi: ii me exemple (ou instance, vecteur)
yi: ii me tiquette (ou attribut de d cision, classe)
n But : trouver le mod le ou fonction de classement f(x)
qui soit le plus proche de y
49
Apprentissage supervis
Quel crit re de performance ?
On cherche une fonction de classement f qui minimise un
crit re&
Crit re na f : minimiser lerreur empirique
err
emp
=
1
m
m
=
1
i
(
xf
(
i
)
i
)
y
Publicité
m : nombre dexemples
dapprentissage
Une fois le mod le f construit, on lutilise pour pr dire la
classe des exemples dapprentissage, on compare alors
la classe r elle (yi)) la classe pr dite (f(xi)).
Erreur empirique = Taux derreur en resubstitution
50
25
Machine Deep Learning
M2-MP2L
Apprentissage supervis
Quel crit re de performance ?
On cherche une fonction de classement f qui minimise un
crit re&
Crit re id al : mesurer lerreur de pr diction
err pred
=
Pr[
xf
)(
y
]
Plusieurs approches pour estimer
cette probabilit
51
Apprentissage supervis
Evaluation de lerreur de pr diction
n Lerreur de pr diction peut tre estim e par lerreur
empirique.
=
Pr[
err pred
xf
)(
y
]
estim e par
err
emp
=
1
m
m
=
1
i
(
xf
(
i
)
i
)
y
n Cette estimation est grossi re : cest un taux trop
optimiste.
Un des objectifs de lapprentissage tant de minimiser lerreur, le
classifieur a de fortes chances d tre meilleur sur l chantillon
dapprentissage que sur de nouveaux exemples qui ne lui ont
jamais t pr sent s.
n Lerreur empirique nest pas un bon estimateur de lerreur
de pr diction.
52
26
Machine Deep Learning
M2-MP2L
Apprentissage supervis
Evaluation de lerreur de pr diction
Sch ma apprentissage-validation
n D composer les donn es en deux ensembles
disjoints :
Ensemble d'apprentissage : permet de
g n rer le mod le
Ensemble de test : permet d' valuer l'erreur
r elle du mod le sur un ensemble
ind pendant (calcul du taux derreur sur
lensemble de test)
53
Apprentissage supervis
Evaluation de lerreur de pr diction
n Validation crois e ou cross-validation
M thode d valuation de lerreur de pr diction
R ponse au probl me de la trop grande
d pendance vis- -vis de lensemble de test
Cette technique proc de une r p tition du
sch ma apprentissage/validation sur diff rentes
fractions constitu es partir des donn es
initiales.
54
27
Machine Deep Learning
M2-MP2L
Apprentissage supervis
Evaluation de lerreur de pr diction
n Validation crois e ou cross-validation
Taux derreur
(sch ma apprentissage validation)
e1
e2
e3
e4
Estimation du taux derreur r el
par la moyenne :
4
ie
=i
1
4
Apprentissage supervis
: sur-apprentissage
55
56
28
Machine Deep Learning
M2-MP2L
Pr cision vs. G n ralisation
n Grand dilemme de lapprentissage supervis .
n Pr cision : cart entre une valeur mesur e
ou pr dite et une valeur r elle.
o Apprendre avec trop de pr cision conduit
un sur-apprentissage .
o Accro t le risque de mod liser le bruit et de faire
co ncider le mod le avec la base dapprentissage
o R duit le pouvoir de pr diction dun exemple inconnu
o Apprendre avec trop peu de pr cision conduit
une sur-g n ralisation
57
Sur-apprentissage
Ph nom ne typique lors dun sur-apprentissage :
Le taux de pr diction augmente sur
la base dapprentissage
Le taux de pr diction commence baisser
sur les exemples inconnus
pr cision
Sur-apprentissage
partir de cette zone
Pr cision sur les donn es
dapprentissage
Pr cision sur les donn es
inconnues
temps
58
29
Machine Deep Learning
M2-MP2L
Conclusion
Points cl s pour effectuer une
t che dapprentissage
n Avant lapprentissage, bien choisir
L chantillon dapprentissage
La repr sentation des donn es
Le type de mod le (et lalgorithme)
Le crit re (nombre derreurs, erreur empirique...)
Autres crit res : intelligibilit des r sultats, co ts
n Apr s lapprentissage
Interpr ter le mod le
L valuer
59
60
30