Machine Deep Learning

Page 1 sur 30Lecteur de document UniversityLib

Machine Deep Learning

Artificial Intelligence and Machine Learning · course

Voir tous les documents en intelligence artificielle et données

Machine Deep Learning

M2-MP2L

Machine Learning Deep Learning

MASTÈRE PROFESSIONNEL EN LOGICIELS LIBRES - MP2L

Amel Borgi

Chapitre 2 : Notions de base

1

Machine Deep Learning

M2-MP2L

PLAN DU COURS  Chap 1 : Introduction

 Chap 2 : Notions de base

 Chap 3 : Apprentissage supervisé

 Approches numériques Les arbres de décisions

 Chap 4 : Apprentissage non supervisé

K-means Les règles d’association

 Chap 5 : Les réseaux de neurones – Deep

learning

PLAN : Chap 2 : Notions de base

 Tendances de l’apprentissage artificiel

Apprentissage supervisé Apprentissage non supervisé Apprentissage semi supervisé Apprentissage par renforcement  Evaluation de l’apprentissage

 Sur-apprentissage

3

4

2

Machine Deep Learning

M2-MP2L

Tendances de l’apprentissage artificiel

5

Tendances de l’apprentissage artificiel

 Deux tendances principales de l’apprentissage :

 celle issue des statistiques :

apprentissage numérique

 celle issue de l’IA :

Régression linéaire

apprentissage symbolique

[Cornuéjols et al. 2018]

6

3

Machine Deep Learning

M2-MP2L

Tendances de l’apprentissage artificiel

 Deux tendances principales de l’apprentissage :

 celle issue des statistiques :

apprentissage numérique

 celle issue de l’IA :

apprentissage symbolique

Arbre de décision

7

Tendances de l’apprentissage artificiel

Les algorithmes d’apprentissage peuvent différer par le type de données utilisées et de connaissances « produites », leur représentation et leurs stratégies d’apprentissage [Michalski et al. 83] [Carbonell et al. 84] [Kodratoff et al. 91] [Mitchell 97]

Exemples :

 les arbres de décision,  les formalismes logiques,  les règles de production,  les réseaux bayésiens,  les fonctions linéaires, ...

8

4

Machine Deep Learning

M2-MP2L

Tendances de l’apprentissage artificiel

 Apprentissage supervisé

 Apprentissage non supervisé

Apprentissage semi supervisé

 Apprentissage par renforcement

9

L’apprentissage supervisé

10

5

Machine Deep Learning

M2-MP2L

L’apprentissage supervisé

 On dispose d’un ensemble de données

étiquetées par un expert ou de classe connue  la base d’apprentissage

 Objectif de l’apprentissage supervisé :

construire à partir de la base d’apprentissage des fonctions de classement

 Fonction de classement

reconnaît un attribut particulier (la classe) à partir de la description d’un objet.

11

Exemple : Phase d’apprentissage

 Construction du

modèle prédictif à partir des données d’apprentissage

Variables explicatives

Variable à expliquer ou classe

Sepal length

Sepal width

Petal length

Petal width

Iris type

5.4

4.6

6.1

7.7

3.9

3.4

2.9

3.0

1.7

1.4

4.7

6.1

0.4

0.3

1.4

2.3

Setosa

Setosa

Versicolour

Virginica

Exemples

Base d’apprentissage

Modèle prédictif

12

6

Machine Deep Learning

M2-MP2L

Exemple : phase de reconnaissance

Nouvel exemple de classe inconnue

Sepal length

Sepal width

Petal length

Petal width

4.9

3.1

1.2

0.6

Modèle prédictif

Classe : Setosa

(classe prédite par le modèle prédictif)

13

L’apprentissage supervisé

 La phase d’apprentissage

fonction de classement = classifieur = modèle prédictif

Apprentissage

Fonction de classement f

Base d’apprentissage

 La phase de reconnaissance

Fonction de classement f

14

7

W Machine Deep Learning

M2-MP2L

L’apprentissage supervisé : un exemple La régression linéaire simple

Extrait de la base d’apprentissage

L’apprentissage supervisé : un exemple La régression linéaire simple

 La phase d’apprentissage : construction de la droite de régression linéaire (cette approche sera vue plus loin dans le cours)

15

16

8

Machine Deep Learning

M2-MP2L

L’apprentissage supervisé : un exemple La régression linéaire simple  La phase de reconnaissance : on veut prédire le prix d’un appartement de surface connue x1. Ce prix est la valeur prédite par la droite de régression, ici y1.

Publicité

y1

x1

17

L’apprentissage supervisé : un exemple L’arbre de décision – Données Iris

Attribute Information: 1. sepal length in cm 2. sepal width in cm 3. petal length in cm 4. petal width in cm 5. class: -- Iris Setosa -- Iris Versicolour -- Iris Virginica

Extrait de la base d’apprentissage

5.1,3.5,1.4,0.2,Iris-setosa 4.9,3.0,1.4,0.2,Iris-setosa 4.7,3.2,1.3,0.2,Iris-setosa 4.6,3.1,1.5,0.2,Iris-setosa 6.4,3.2,4.5,1.5,Iris-versicolor 6.9,3.1,4.9,1.5,Iris-versicolor 5.5,2.3,4.0,1.3,Iris-versicolor 6.5,2.8,4.6,1.5,Iris-versicolor 6.8,3.2,5.9,2.3,Iris-virginica 6.7,3.3,5.7,2.5,Iris-virginica 6.7,3.0,5.2,2.3,Iris-virginica 6.3,2.5,5.0,1.9,Iris-virginica

18

9

Machine Deep Learning

M2-MP2L

L’apprentissage supervisé : un exemple L’arbre de décision

 La phase d’apprentissage : construction de l’arbre de décision (cette approche sera vue plus loin dans le cours)

Petal.Le

19

20

L’apprentissage supervisé : un exemple L’arbre de décision

 La phase de reconnaissance : prédiction de l’espèce d’une nouvelle fleur d’Iris I1 à partir de sa description

I1 Petal.Le

I1 sepal length : 5.9 sepal width: 3.5 petal length: 5.8 petal width: 1.8

La classe prédite est setosa

10

Machine Deep Learning

M2-MP2L

L’apprentissage supervisé

Population P

• Xi variables prédictives : les attributs • y variable à prédire : la classe

Population P

W W

’

y

Avec nos exemples ?

• Prix des appartements • Iris

y(p ) Ensemble des classes C

c( p )=(X1(p ),..., Xp(p )) Espace de Représentation R

f ? (fonction de classement

ou classifieur)

[Zighed et al. 92]

21

L’apprentissage supervisé : ex. Iris de Fisher Population P

X1= sepal length, D1= [4.3, 7.9] X2= sepal width, D2= [2.0, 4.4 ] X3= petal length, D3= [1.0, 6.9 ] X4= petal width, D4= [0.1, 2.5]

: des iris

• Xi variables prédictives : 4 attributs • y variable à prédire : la classe (3 espèces d’Iris)

p

Population P des iris

:

y

y(p ) C = {Setosa,

c( p )=(X1(p ),..., X4(p )) Espace de Représentation R = D1xD2xD3xD4

f ? (fonction de classement

ou classifieur)

Versicolour, Virginica}

22

11

c p c Machine Deep Learning

M2-MP2L

L’apprentissage supervisé

 Si y est une fonction continue

Régression Estimation de densité

 Si y est une fonction discrète

Classement / discrimination (en anglais on parle de classification !)

 Si y est une fonction binaire (booléenne)

Apprentissage de concepts

23

24

L’apprentissage supervisé : Exemples de méthodes

 k plus proches voisins [Cover et al. 67] [Aha et al.91]

 Réseaux de neurones [Dreyfus et al.,02]

 Séparateurs à Vastes Marges (SVM) [Vapnik, 95]

 Arbres de décisions [Breiman et al. 84] [Quinlan 86, 93]

 Espace des versions [Mitchell, 82]

 Approches probabilistes [Saporta 2006][Cornuejols et al. 2018]

 Analyse discriminante [Saporta 2006]

 Systèmes d’Inférence Floue [Ishibuchi et al.92]

 …

12

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé

25

L’apprentissage non supervisé

 On dispose d’un ensemble de données ou d’observations {O1, O2, …, Om} (contrairement au cas de l’apprentissage supervisé, les données ne sont pas étiquetées par une classe).

 Objectif :

Comme seules les observations {O1, O2, …, Om} sont disponibles, on cherche des régularités sous-jacentes.

 En extraire des sous-ensembles homogènes  Décrire comment les données sont organisées  Trouver des relations entre les données

26

13

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé

On distingue essentiellement deux familles d’approches :

 Classification automatique

 Clustering

 Classification hiérarchique

 Découverte automatique

27

L’apprentissage non supervisé

 L’univers numérique

 En 2007 : ~ 281 exaoctets (281 milliards de

gigaoctets = 2,81.1020)

 En 2011 : ~3.1021 En 2019 : ~ 50 zettaoctets Surtout des images et des vidéos

Comment organiser cette masse énorme de données ?

28

14

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé Classification automatique

 Organiser un ensemble de « formes » en

groupes contrastés

 Comprimer les données en y découvrant une

structure

Afin

de « comprendre » les données

[Cornuejols et al. 2018]

29

L’apprentissage non supervisé Classification / Clustering

On dispose d’une masse de données indifférenciées, et l’on désire savoir si elles possèdent une quelconque structure de groupes.

 Regrouper en classes des objets en se basant

sur des similarités entre eux.

 Maximiser la similarité intra-classes et minimiser la similarité inter-classes

30

15

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé Classification / Clustering

Masse de données indifférenciées

Résultat du clustering : 3 clusters (ou classes) détectés

L’apprentissage non supervisé Classification hiérarchique

La classification hiérarchique consiste à fournir un ensemble de partitions des données d’apprentissage en classes de moins en moins fines obtenues par regroupements successifs de parties.

31

32

16

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé

Extrait de la classification taxinomique de Linné

Embranchements

Classe

Ordre

Famille

...

...

...

Genre

Espèces

...

...

...

Publicité

...

...

...

...

...

33

L’apprentissage non supervisé

La découverte automatique

 Trouver les lois les plus simples possibles pour expliquer des phénomènes naturels ou des invariants dans les bases de données.

 Découvrir de nouvelles relations dans les données.

 Exemple : Un pg de découverte automatique pourrait retrouver la loi d’Ohm (U = RI) à partir de mesures sur l’intensité du courant, la valeur de la résistance électrique et la tension. Mieux il pourrait établir des lois inconnues ou mal connues en fouillant de grosses bases de données.

34

17

Machine Deep Learning

M2-MP2L

L’apprentissage non supervisé Les règles d’association

 Consiste à déterminer les valeurs qui sont

associées.

 Exemple type : détermination des articles qui se

retrouvent ensemble sur un même ticket de supermarché

 Intéressant pour identifier des opportunités

de vente croisée et concevoir des groupements attractifs de produit.

 Nécessite de très grands jeux de données

35

Méthodes d’apprentissage non supervisé  Seules les observations sont disponibles, on cherche

des régularités sous-jacentes :

 Sous forme d’une fonction : régression

 Sous forme de nuages de points : clustering

(e.g. K-means)

 Sous forme d’une classification hiérarchique

(Clustering Hierarchique Ascendant (AHC), Clustering Descendant (e.g.Cobweb [Doug Fisher,1987])

 Sous forme d’une base de règles (e.g. extraction de

règles, algorithme A Priori)

 …

[Cornuéjols et al. 2018] [Saporta 90]

36

18

Machine Deep Learning

M2-MP2L

L’apprentissage semi-supervisé

37

Apprentissage semi-supervisé

 Parmi les observations {x1, x2, …, xm} seulement

un petit nombre d’entre elles ont un label yi

 L’objectif est le même que pour l’apprentissage

supervisé mais on aimerait tirer profit des observations non labellisées.

 Exemple : pour la discrimination de pages Web, le nombre d’exemples peut être très grand mais leur associer un label est coûteux.

38

19

Machine Deep Learning

M2-MP2L

L’apprentissage par renforcement

39

Apprentissage par renforcement

 Etant donnés : un agent, un environnement dans lequel certaines actions induisent des récompenses,

 L’apprentissage par renforcement c’est

l’ensemble des méthodes et algorithmes permettant à un agent d’apprendre à se comporter dans un environnement, afin d’obtenir le plus de récompenses possible sur le long terme.

40

20

Machine Deep Learning

M2-MP2L

Apprentissage par renforcement

Les données d’apprentissage  Une séquence de perceptions, d’actions et de récompenses :

(st, at, rt)t = 1, ¥  Avec un renforcement rt  rt peut sanctionner des

actions très antérieures à t

Environnement

Perception (état)

Récompense

Action

Le problème : inférer une application : situation perçue

action

afin de maximiser un gain sur le long terme

[Sutton et al. 98] [Cornuéjols et al. 03 ; www.lri.fr/~antoine/]

41

Apprentissage par renforcement

 Difficile pour deux raisons principales  signaux de renforcement pauvres  délai séparant le signal de renforcement des

décisions qui y ont conduit

 environnement incertain et inconnu

42

21

Machine Deep Learning

M2-MP2L

Apprentissage par renforcement  Applications

 commande des systèmes,  robotique,  informatique,  des actions quotidiennes dans la vie,  jeux,  ...

Agent

Environnement

Récompense à lg terme

Robot aspirateur

Appartement

Degré de propreté à la fin

Agent négociant

Ens. d’agents acheteurs/vendeurs

Gain obtenu

Prog. de jeu d’échec

Échiquier+autre joueur

Gain de la partie

Routeurs

Réseau informatique

Nb de paquets acheminés

Evaluation de l’apprentissage

43

44

22

Machine Deep Learning

M2-MP2L

Evaluation

 Objectif : évaluer et valider le résultat de

l’apprentissage.

 La validation dépend de la nature de la tâche

et du problème considéré.

 Deux modes de validation :

 Statistique

 Par expertise

45

Validation

 Objectif de la validation statistique :

obtenir des informations qui permettront de juger le résultat obtenu, ou d'estimer la qualité ou les biais des données d’apprentissage.

 Utilise des échantillons de test

 Utilise des mesures d’évaluation du résultat

(performance, qualité, …)

46

23

Machine Deep Learning

M2-MP2L

Validation

 Le critère de succès dépend à la fois du domaine

étudié et de l’objectif de l’apprentissage

 Pour certains domaines d'application (le

diagnostic médical, par exemple), il est essentiel que le modèle produit soit compréhensible. Il y a donc une première validation du modèle produit par l'expert, celle-ci peut être complétée par une validation statistique sur des bases de cas existantes.

47

Apprentissage non supervisé

 Validation essentiellement du ressort de l'expert.

 Ex. Clustering : l’algorithme de clustering construit des

groupes homogènes

 Le niveau d’homogénéité peut être estimé par la

similarité inter-classes et intra-classes

 Mais seul un expert peut juger de la pertinence des

groupes constitués.

 Ex. Règles d’associations : des mesures permettent d’estimer la qualité des règles. L'expert du domaine jugera de leur pertinence : l'algorithme fournit des règles porteuses d'information, mais peut également produire des règles triviales et sans intérêt.

48

24

Machine Deep Learning

M2-MP2L

Apprentissage supervisé

Quel critère de performance ?

 La base d’apprentissage est un échantillon de m

exemples de classes connue

W ={(xi,yi)}1..m

Publicité

 Chaque exemple xi comporte p attributs : (Xi

1,…, Xi

p)

xi: iième exemple (ou instance, vecteur) yi: iième étiquette (ou attribut de décision, classe)

 But : trouver le modèle ou fonction de classement f(x)

qui soit le plus proche de y

49

Apprentissage supervisé Quel critère de performance ?

On cherche une fonction de classement f qui minimise un critère…

 Critère naïf : minimiser l’erreur empirique

err

emp

=

1 m

m

= 1

i

(

xf (

i

)

i

)

y

m : nombre d’exemples d’apprentissage

Une fois le modèle f construit, on l’utilise pour prédire la classe des exemples d’apprentissage, on compare alors la classe réelle (yi)) à la classe prédite (f(xi)).

Erreur empirique = Taux d’erreur en resubstitution

50

25

„ Machine Deep Learning

M2-MP2L

Apprentissage supervisé Quel critère de performance ?

On cherche une fonction de classement f qui minimise un critère…

 Critère idéal : mesurer l’erreur de prédiction

err pred

=

Pr[

xf )(

y

]

 Plusieurs approches pour estimer

cette probabilité

51

Apprentissage supervisé Evaluation de l’erreur de prédiction

 L’erreur de prédiction peut être estimée par l’erreur

empirique. = Pr[

err pred

xf )(

y

]

estimée par

err

emp

=

1 m

m

= 1

i

(

xf (

i

)

i

)

y

 Cette estimation est grossière : c’est un taux trop

optimiste.

 Un des objectifs de l’apprentissage étant de minimiser l’erreur, le classifieur a de fortes chances d’être meilleur sur l’échantillon d’apprentissage que sur de nouveaux exemples qui ne lui ont jamais été présentés.

 L’erreur empirique n’est pas un bon estimateur de l’erreur

de prédiction.

52

26

„ „ „ Machine Deep Learning

M2-MP2L

Apprentissage supervisé

Evaluation de l’erreur de prédiction

Schéma apprentissage-validation

 Décomposer les données en deux ensembles

disjoints :

Ensemble d'apprentissage : permet de

générer le modèle

Ensemble de test : permet d'évaluer l'erreur

réelle du modèle sur un ensemble indépendant (calcul du taux d’erreur sur l’ensemble de test)

53

Apprentissage supervisé Evaluation de l’erreur de prédiction

 Validation croisée ou cross-validation

 Méthode d’évaluation de l’erreur de prédiction

 Réponse au problème de la trop grande

dépendance vis-à-vis de l’ensemble de test

 Cette technique procède à une répétition du

schéma apprentissage/validation sur différentes fractions constituées à partir des données initiales.

54

27

Machine Deep Learning

M2-MP2L

Apprentissage supervisé Evaluation de l’erreur de prédiction

 Validation croisée ou cross-validation Taux d’erreur (schéma apprentissage validation)

e1

e2

e3 e4

Estimation du taux d’erreur réel par la moyenne :

4

ie =i 1 4

Apprentissage supervisé : sur-apprentissage

55

56

28

Machine Deep Learning

M2-MP2L

Précision vs. Généralisation

 Grand dilemme de l’apprentissage supervisé.

 Précision : écart entre une valeur mesurée

ou prédite et une valeur réelle.

 Apprendre avec trop de précision conduit à

un « sur-apprentissage ».

 Accroît le risque de modéliser le bruit et de faire

coïncider le modèle avec la base d’apprentissage  Réduit le pouvoir de prédiction d’un exemple inconnu

 Apprendre avec trop peu de précision conduit

à une « sur-généralisation »

57

Sur-apprentissage Phénomène typique lors d’un sur-apprentissage :

 Le taux de prédiction augmente sur

la base d’apprentissage

 Le taux de prédiction commence à baisser

sur les exemples inconnus

précision

Sur-apprentissage à partir de cette zone

Précision sur les données d’apprentissage

Précision sur les données inconnues

temps

58

29

Machine Deep Learning

M2-MP2L

Conclusion

Points clés pour effectuer une tâche d’apprentissage

 Avant l’apprentissage, bien choisir

 L’échantillon d’apprentissage  La représentation des données  Le type de modèle (et l’algorithme)  Le critère (nombre d’erreurs, erreur empirique...)  Autres critères : intelligibilité des résultats, coûts

 Après l’apprentissage  Interpréter le modèle  L’évaluer

59

60

30