Data Mining
2013/2014
Prof. Chiraz Ben Abdelkader
TP#2
Plan:
Lundi 30 Septembre, 2013
1) Application des méthodes simples de PCS sur la base de données « jouer tennis »
Introduction à la base de données
a.
b. Méthode ZeroR
c. Méthode OneR
d. Méthode NaiveBayes
1. Application des méthodes simples de PCS sur Bdd « jouer tennis »
a) La base de données « jouer tennis »
Les Attributs ( x = x1, x2, x3, x4 )
No.
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
Ciel
Ensoleillé
Ensoleillé
Couvert
Pluie
Pluie
Pluie
Couvert
Ensoleillé
Ensoleillé
Pluie
Ensoleillé
Couvert
Couvert
Pluie
Ensoleillé
Pluie
Couvert
Pluie
Publicité
Ensoleillé
Couvert
Température
Chaude
Chaude
Chaude
Tiède
Fraiche
Fraiche
Fraiche
Tiède
Fraiche
Tiède
Tiède
Tiède
Chaude
Tiède
Tiède
Tiède
Fraiche
Tiède
Tiède
Fraiche
Humidité
Élevée
Élevée
Élevée
Élevée
Normale
Normale
Normale
Élevée
Normale
Normale
Normale
Élevée
Normale
Élevée
Élevée
Élevée
Élevée
Normale
Normale
Élevée
Vent
Faible
Fort
Faible
Faible
Faible
Fort
Fort
Faible
Faible
Faible
Publicité
Fort
Fort
Faible
Fort
Faible
Faible
Fort
Faible
Fort
Faible
classe (y)
Jouer
Non
Non
Oui
Oui
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Non
Oui
Non
Oui
Pour pouvoir travailler avec ce Bdd sur Weka, vous devez tout d’abord
télécharger le fichier intitulé jouer_tennis.txt, ensuite créer un fichier
jouer_tennis.arff (le format ARFF est le format lisible par Weka).
Quelques remarques générales concernant ce Bdd :
o On a 4 attributs (tous nominals) et 2 classes.
o Les classes : Y = { oui, non }
o Taille du domaine des attributs : |D| = 3 . 3 . 2 . 2 = 36
Dans la suite de cet exercice, on va induire des classeurs avec des méthodes
différentes, tout en utilisant les exemplaires au-dessus comme suit :
o Echantillon de training, Xtrain : exemplaires 1-14
o Echantillon de test, Xtest : exemplaires 15 - 20
b) ZeroR
Version 1 : Taux de classification correcte est : ___________
Version 2 :
o Induction du classeur ; la classe la plus fréquente selon Xtrain : _____
o Taux de classification correcte sur Xtest : _________
Résultats avec Weka (Version 2) : _____________
c) OneR
Induction du classeur :
(résultats dans le tableau au-dessous)
o Tout d’abord, on construit 4 classeurs, chacun basé sur un seul
attribut. Pour cela, on doit estimer les probabilités Pr[y|xi,Xtrain]
pour toutes les valeurs différentes de y et de xi.
Publicité
o Ensuite, on calcule le taux de classification correcte de chaque
classeur sur Xtest
o Finalement, on choisit le classeur basé sur l’attribut : ____________
Taux de classification correcte du classeur final sur Xtest : ______________
Résultats avec Weka (attribut choisit et taux de classif) : _______________
Pr [y | xi, Xtrain]
jouer =
jouer =
non
oui
nombre d’
exemplaire
s dans Xtrain
ayant la
valeur xi
Décision du
classeur
basé sur le
ieme
attribut
Taux de
classificat
ion
correcte
sur Xtrain
Attributs
nom
valeur
(xi)
Ciel
(i=1)
Températ
ure
(i=2)
Humidité
(i = 3)
Vent
(i=4)
Ensoleillé
Couvert
Pluie
Chaude
Tiède
Fraiche
Élevée
Normale
Publicité
Fort
Faible
d) Naïve Bayes
Induction du classeur :
(résultats dans le tableau au-dessous)
o On doit estimer les probabilités Pr [y|Xtrain] et Pr [xi|y,Xtrain] pour
toutes les valeurs différentes de y et de xi.
Taux de classification correcte du classeur sur Xtest : ______________
Résultats avec Weka (taux de classif. correcte) : _______________
classe: jouer = oui
nombre total
d’exemplaires
Pr [y |Xtrain]
nombre
d’exemplaires
ayant valeur xi
Pr [xi |
y, Xtrain]
classe : jouer = non
nombre total
d’exemplaires
Pr [y |Xtrain]
nombre
d’exemplaires
ayant valeur xi
Pr [xi |
y, Xtrain]
nom
d’attribut
Ciel
(i=1)
Températ
ure
(i=2)
Humidité
(i = 3)
Vent
(i=4)
valeur
d’attribut
(xi)
Ensoleillé
Couvert
Pluie
Chaude
Tiède
Fraiche
Élevée
Normale
Fort
Faible