Data Mining

Programming, Math, etc. · course

Data Mining

2013/2014

Prof. Chiraz Ben Abdelkader

TP#2

Plan:

Lundi 30 Septembre, 2013

1) Application des méthodes simples de PCS sur la base de données « jouer tennis »

2) Classification de textes avec méthode de Naïve Bayes

1. Application des méthodes simples de PCS sur Bdd « jouer tennis »

a) La base des données « jouer tennis »

Les Attributs ( x = x1, x2, x3, x4 )

Température Humidité

No. Ciel

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

Ensoleillé Chaude

Ensoleillé Chaude

Chaude

Couvert

Tiède

Pluie

Fraiche

Pluie

Fraiche

Pluie

Couvert

Fraiche

Ensoleillé Tiède

Fraiche

Ensoleillé

Pluie

Tiède

Ensoleillé Tiède

Tiède

Couvert

Chaude

Couvert

Pluie

Tiède

Ensoleillé Tiède

Tiède

Pluie

Fraiche

Couvert

Pluie

Tiède

Ensoleillé Tiède

Couvert

Fraiche

Vent

Faible

Publicité

Fort

Faible

Faible

Faible

Fort

Fort

Faible

Faible

Faible

Fort

Fort

Faible

Fort

Faible

Faible

Fort

Faible

Fort

Faible

classe (y)

Jouer

Non

Non

Oui

Oui

Oui

Non

Oui

Non

Oui

Non

Oui

Non

Oui

Non

Oui

Non

Non

Oui

Non

Oui

Élevée

Élevée

Élevée

Élevée

Normale

Normale

Normale

Élevée

Normale

Normale

Normale

Élevée

Normale

Élevée

Élevée

Élevée

Élevée

Normale

Normale

Élevée

 Pour pouvoir travailler avec ce Bdd sur Weka, vous devez tout d’abord

télécharger le fichier intitulé jouer_tennis.txt, ensuite créer un fichier

jouer_tennis.arff (le format ARFF est le format lisible par Weka).

 Quelques remarques générales concernant ce Bdd :

o On a 4 attributs (tous nominals) et 2 classes.

o Les classes : Y = { oui, non }

o Le domaine des attributs : |D| = 3 . 3 . 2 . 2 = 36

 Dans la suite de cet exercice, on va induire des classeurs avec des méthodes

Publicité

différentes, tout en utilisant les exemplaires au-dessus comme suit :

o Echantillon de training, Xtrain : exemplaires 1-14

o Echantillon de test, Xtest : exemplaires 15 - 20

b) ZeroR

 Version 1 : Taux de classification correcte est : ___________

 Version 2 :

o

o Taux de classification correcte sur Xtest : _________

Induction du classeur ; la classe la plus fréquente selon Xtrain : _____

 Résultats avec Weka (Version 2) : _____________

c) OneR

Induction du classeur : (résultats dans le tableau au-dessous)

o Tout d’abord, on construit 4 classeurs, chacun basé sur un seul

attribut. Pour cela, on doit estimer les probabilités Pr[y|xi,Xtrain]

pour toutes les valeurs différentes de y et de xi.

o Ensuite, on calcule le taux de classification correcte de chaque

classeur sur Xtest

o Finalement, on choisit le classeur basé sur l’attribut : ____________

 Taux de classification correcte du classeur final sur Xtest : ______________

 Résultats avec Weka (attribut choisit et taux de classif) : _______________

Attributs (xi)

nom

valeur

Pr [y | xi, Xtrain]

jouer =

oui

jouer =

non

nombre d’

exemplaire

s dans Xtrain

ayant la

valeur xi

Décision du

classeur

basé sur le

ieme

attribut

Taux de

classificat

ion

correcte

sur Xtest

Ciel

(i=1)

Ensoleillé

Couvert

Pluie

Chaude

Tiède

Fraiche

Élevée

Normale

Fort

Faible

Températ

ure

(i=2)

Humidité

(i = 3)

Vent

(i=4)

Le meilleur classeur est basé sur l’attribut :

d) Naïve Bayes

Induction du classeur : (résultats dans le tableau au-dessous)

o On doit estimer les probabilités Pr [y|Xtrain] et Pr [xi|y,Xtrain] pour

toutes les valeurs différentes de y et de xi.

Publicité

 Taux de classification correcte du classeur sur Xtest : ______________

 Résultats avec Weka (taux de classif. correcte) : _______________

classe: jouer = oui

classe : jouer = non

nombre total

d’exemplaires

Pr [y |Xtrain]

nombre total

d’exemplaires

Pr [y |Xtrain]

nombre

d’exemplaires

ayant valeur xi

Pr [xi |

y, Xtrain]

nombre

d’exemplaires

ayant valeur xi

Pr [xi |

y, Xtrain]

nom

d’attribut

Ciel

(i=1)

Températ

ure

(i=2)

Humidité

(i = 3)

Vent

(i=4)

valeur

d’attribut

(xi)

Ensoleillé

Couvert

Pluie

Chaude

Tiède

Fraiche

Élevée

Normale

Fort

Faible

2. Classification de textes avec méthode de Naïve Bayes

 On va travailler seulement avec Weka dans cette partie.

 Ouvrir une base de données :

o Télécharger le fichier intitulé toy.news-train.arff a partir de mon Google

Drive, sous le dossier « TP » . Ouvrir-le dans Weka.

o Question : combien y a-t-il d’attributs ? quels sont les types des attributs?

de classes ?

On va maintenant convertir les textes dans cet Bdd à des attributs binaires,

comme on a discuté en cours.

o Cliquer sur l’onglet « Preprocess », ensuite cliquer sur le bouton « Choose »

au-dessous de « Filter » , puis sélectionner les titres suivants : filters 

unsupervised  attribute String2WordVector

o Vous devez noter un changement dans la partie bas-gauche de la fenêtre ;

combien y a-t-il de nouveaux attributs ? quel sont ces attributs ?

 Ouvrir une autre base de données :

o refaire les mêmes étapes au-dessus avec le fichier intitule « ReutersCorn-

small-train.arff »

 Application du classeur Naïve Bayes :

o Cliquer sur l’onglet « Classify », ensuite cliquer sur le bouton « Choose »

au-dessous de « Classifier » , puis sélectionner les titres suivants :

classifiers  bayes  NaiveBayes