Data Mining
2013/2014
Prof. Chiraz Ben Abdelkader
TP#2
Plan:
Lundi 30 Septembre, 2013
1) Application des méthodes simples de PCS sur la base de données « jouer tennis »
2) Classification de textes avec méthode de Naïve Bayes
1. Application des méthodes simples de PCS sur Bdd « jouer tennis »
a) La base des données « jouer tennis »
Les Attributs ( x = x1, x2, x3, x4 )
Température Humidité
No. Ciel
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
Ensoleillé Chaude
Ensoleillé Chaude
Chaude
Couvert
Tiède
Pluie
Fraiche
Pluie
Fraiche
Pluie
Couvert
Fraiche
Ensoleillé Tiède
Fraiche
Ensoleillé
Pluie
Tiède
Ensoleillé Tiède
Tiède
Couvert
Chaude
Couvert
Pluie
Tiède
Ensoleillé Tiède
Tiède
Pluie
Fraiche
Couvert
Pluie
Tiède
Ensoleillé Tiède
Couvert
Fraiche
Vent
Faible
Publicité
Fort
Faible
Faible
Faible
Fort
Fort
Faible
Faible
Faible
Fort
Fort
Faible
Fort
Faible
Faible
Fort
Faible
Fort
Faible
classe (y)
Jouer
Non
Non
Oui
Oui
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Oui
Non
Non
Oui
Non
Oui
Élevée
Élevée
Élevée
Élevée
Normale
Normale
Normale
Élevée
Normale
Normale
Normale
Élevée
Normale
Élevée
Élevée
Élevée
Élevée
Normale
Normale
Élevée
Pour pouvoir travailler avec ce Bdd sur Weka, vous devez tout d’abord
télécharger le fichier intitulé jouer_tennis.txt, ensuite créer un fichier
jouer_tennis.arff (le format ARFF est le format lisible par Weka).
Quelques remarques générales concernant ce Bdd :
o On a 4 attributs (tous nominals) et 2 classes.
o Les classes : Y = { oui, non }
o Le domaine des attributs : |D| = 3 . 3 . 2 . 2 = 36
Dans la suite de cet exercice, on va induire des classeurs avec des méthodes
Publicité
différentes, tout en utilisant les exemplaires au-dessus comme suit :
o Echantillon de training, Xtrain : exemplaires 1-14
o Echantillon de test, Xtest : exemplaires 15 - 20
b) ZeroR
Version 1 : Taux de classification correcte est : ___________
Version 2 :
o
o Taux de classification correcte sur Xtest : _________
Induction du classeur ; la classe la plus fréquente selon Xtrain : _____
Résultats avec Weka (Version 2) : _____________
c) OneR
Induction du classeur : (résultats dans le tableau au-dessous)
o Tout d’abord, on construit 4 classeurs, chacun basé sur un seul
attribut. Pour cela, on doit estimer les probabilités Pr[y|xi,Xtrain]
pour toutes les valeurs différentes de y et de xi.
o Ensuite, on calcule le taux de classification correcte de chaque
classeur sur Xtest
o Finalement, on choisit le classeur basé sur l’attribut : ____________
Taux de classification correcte du classeur final sur Xtest : ______________
Résultats avec Weka (attribut choisit et taux de classif) : _______________
Attributs (xi)
nom
valeur
Pr [y | xi, Xtrain]
jouer =
oui
jouer =
non
nombre d’
exemplaire
s dans Xtrain
ayant la
valeur xi
Décision du
classeur
basé sur le
ieme
attribut
Taux de
classificat
ion
correcte
sur Xtest
Ciel
(i=1)
Ensoleillé
Couvert
Pluie
Chaude
Tiède
Fraiche
Élevée
Normale
Fort
Faible
Températ
ure
(i=2)
Humidité
(i = 3)
Vent
(i=4)
Le meilleur classeur est basé sur l’attribut :
d) Naïve Bayes
Induction du classeur : (résultats dans le tableau au-dessous)
o On doit estimer les probabilités Pr [y|Xtrain] et Pr [xi|y,Xtrain] pour
toutes les valeurs différentes de y et de xi.
Publicité
Taux de classification correcte du classeur sur Xtest : ______________
Résultats avec Weka (taux de classif. correcte) : _______________
classe: jouer = oui
classe : jouer = non
nombre total
d’exemplaires
Pr [y |Xtrain]
nombre total
d’exemplaires
Pr [y |Xtrain]
nombre
d’exemplaires
ayant valeur xi
Pr [xi |
y, Xtrain]
nombre
d’exemplaires
ayant valeur xi
Pr [xi |
y, Xtrain]
nom
d’attribut
Ciel
(i=1)
Températ
ure
(i=2)
Humidité
(i = 3)
Vent
(i=4)
valeur
d’attribut
(xi)
Ensoleillé
Couvert
Pluie
Chaude
Tiède
Fraiche
Élevée
Normale
Fort
Faible
2. Classification de textes avec méthode de Naïve Bayes
On va travailler seulement avec Weka dans cette partie.
Ouvrir une base de données :
o Télécharger le fichier intitulé toy.news-train.arff a partir de mon Google
Drive, sous le dossier « TP » . Ouvrir-le dans Weka.
o Question : combien y a-t-il d’attributs ? quels sont les types des attributs?
de classes ?
On va maintenant convertir les textes dans cet Bdd à des attributs binaires,
comme on a discuté en cours.
o Cliquer sur l’onglet « Preprocess », ensuite cliquer sur le bouton « Choose »
au-dessous de « Filter » , puis sélectionner les titres suivants : filters
unsupervised attribute String2WordVector
o Vous devez noter un changement dans la partie bas-gauche de la fenêtre ;
combien y a-t-il de nouveaux attributs ? quel sont ces attributs ?
Ouvrir une autre base de données :
o refaire les mêmes étapes au-dessus avec le fichier intitule « ReutersCorn-
small-train.arff »
Application du classeur Naïve Bayes :
o Cliquer sur l’onglet « Classify », ensuite cliquer sur le bouton « Choose »
au-dessous de « Classifier » , puis sélectionner les titres suivants :
classifiers bayes NaiveBayes