Data Mining
2013/2014
Prof. Chiraz Ben Abdelkader
TP#1 Lundi 23 Septembre, 2013
Introduction et Objectifs
- WEKA est un logiciel libre, écrit en Java, et regroupant un grand nombre
d’algorithmes d’apprentissage artificiel et de prétraitement de données. On va utiliser WEKA pour tous les travaux pratiques du cours data mining .
- Pour plus d’informations sur le logiciel Weka, voir les documents sous le
dossier intitulé Weka dans le Google Drive (supports-cours).
1. Ouverture de WEKA
- Installation : le logiciel WEKA peut être facilement installé à partir de son site
officiel à l’Université Waikato en Nouvelle Zélande (version actuelle : 3.6.10)
http://www.cs.waikato.ac.nz/~ml/weka
- Lancez WEKA. Dans la fenêtre « Weka GUI chooser » qui s’est ouverte, cliquez
sur le bouton « Explorer ». Une fenêtre « Weka Explorer » doit s’ouvrir. C’est elle qui nous servira d’interface principale dans ce TP.
- La fenêtre Weka Explorer contient 6 onglets tout en haut : Preprocess, Classify,
Cluster, Associate, Select Attributes, Visualize .
Dans ce TP, on va utiliser seulement les deux premiers onglets :
onglet Preprocess : pour lecture, prétraitement, et visualisation des données.
onglet Classify : pour le traitement des données avec des techniques de
classification.
2. Obtenir les Données
- Bases de données : Dans ce premier TP, vous allez vous familiariser avec
l’utilisation de WEKA à partir de deux bases de données de petite taille:
- Iris : une base de données véritable, très célèbre au monde des
statistiques, comportant des exemples de fleurs d’iris décrites par plusieurs attributs et appartenant à différentes catégories (classes) d’iris.
Weather : une base de données artificielle.
- Le format de fichier ARFF : WEKA utilise le format de fichier ARFF pour
Publicité
lire et enregistrer des données. Il s’agit de fichiers texte avec un format bien précis, un peu comme le format XML. Un fichier ARFF contient une liste
d’exemples auxquels sont associés des valeurs d’attributs, et un entête qui définit le type des attributs. WEKA peut lire autres types de fichiers de données, tel que le format CSV, comme on verra dans les prochains TPs.
Ouverture des fichiers ARFF dans Weka :
- Vous trouverez les bases de données Iris et Weather dans des fichiers
ARFF ( iris.arff et weather.numeric.arff, respectivement) sur vos ordinateurs, normalement sous le dossier ou vous avez installé WEKA : C:/programmes/Weka-3.6/data/
- Pour ouvrir un fichier ARFF, cliquez sur le bouton " Open file…", allez
dans le dossier contenant le fichier, puis cliquez sur l’icône du fichier.
- Ouvrir le fichier également dans un éditeur standard (par ex. Notepad),
pour vous familiariser avec la structure générale du format ARFF.
3. Comprendre les Données (visualisation simple)
- Chaque fois qu’on ouvre un fichier de données dans le « Weka Explorer »,
certaines informations vont apparaître dans la fenêtre, permettant de se faire une idée générale de la répartition et organisation de ces données :
En haut à gauche : nombre d’exemples ( instances ), nombre d’attributs.
En bas à gauche : le nom de chaque attribut ; en cliquant sur un attribut,
des informations concernant cet attribut vont apparaitre dans la zone droite de la fenêtre…
- En haut à droite : des informations sur l’attribut qu’on a sélectionné : son
nom, son type, ses différentes valeurs, nombre de valeurs manquantes. ( Name, Type, Missing, Distinct, Unique )
- En bas à droite : la répartition des différentes classes en fonction de
l’attribut sélectionné. (voir Question 3 au-dessous)
- Recopier le fichier ARFF dans un répertoire de votre choix, puis modifier-le
dans Notepad: supprimer quelques lignes, changer quelques valeurs d’attributs, changer le type d’un attribut; puis re-ouvrir le fichier modifié dans WEKA, et observer la différence…
Questions
Combien y a-t-il d’instances (exemples) ? d’attributs ?
Quels sont les noms des attributs et leurs types ?
Combien y a-t-il de classes (c.a.d. nombre de valeurs de l’attribut
intitulé classe ) ? quel est le nom de chaque classe ?
- Quels sont les valeurs minimale et maximale de l’attribut :
Publicité
a. petalwidth ? (iris.arff)
b. temperature ? (weather.arff)
- Combien y a-t-il d’instances de la catégorie :
a. iris-virginica ? (iris.arff)
b. yes ? (weather.arff)
Combien y a-t-il de valeurs manquantes ?
Que fait le bouton « Visualize all » ?
4. Traitement des Données (Etape Fouille - Apprentissage Artificiel)
Nous allons maintenant tester une méthode d’apprentissage sur ces données.
Pour cela, tout d’abord cliquez sur l’onglet « Classify » dans la barre du haut de
la fenêtre « Weka Explorer ».
- Ensuite choisissez une méthode d’apprentissage en cliquant sur le bouton
« Choose ». Allez dans le répertoire weka classifiers, puis choisissez, à tour de rôle, chacun des méthodes d’apprentissage suivantes:
ZeroR : rules ZeroR
OneR : rules OneR
Naive Bayes simple : bayes NaiveBayesSimple
- Choisir l’ensemble de test ( sous « Test Options » ) : il y a 4 options
« Use training set » : utilise l’échantillon d’apprentissage aussi comme
échantillon de test.
- « Supplied test set » : obtient l’échantillon de test d’un autre fichier de
données.
- « Percentage split » : découpe de l’échantillon d’apprentissage selon un
pourcentage spécifiée.
« Cross validation » : utilisation de la méthode de validation croisée.
- Choisir le nom de l’attribut classificateur :
Sélectionner un attribut dans le drop-down menu au-dessous de la zone
Publicité
« Test Options » .
- Par défaut, WEKA sélectionne l’attribut nommé « classe », s’il existe
dans la base de données.
- Lancer l’exécution de la méthode d’apprentissage en cliquant sur le bouton
« Start » .
- Les résultats seront affichés dans la zone droite de la fenêtre (sous « Classifier
Output » ).
Analyse/visualisation des résultats :
- à partir de la zone intitulée « Result list » (en bas à gauche de la fenêtre)
de résultat, cliquez avec le bouton droit de la souris, puis sélectionner « Visualize classifier errors » du menu. Une nouvelle fenêtre intitulée « Weka Classifier Visualize » va ainsi apparaitre. Maximiser cette fenêtre pour mieux comprendre ces résultats.
- A la gauche de la fenêtre, on peut voir un graphe 2D, dont les
coordonnées sont sélectionnées à partir du menu en haut de la fenêtre. Les instances mal-classes sont affiches en des carrées, et les instances correctement classées sont affichées en X.
Questions
1) Quel est le taux de classification correcte pour chaque méthode de
classification ? Quelle est la méthode la plus précise?
2) L’attribut choisi par OneR est-il le même que celui que vous aviez
sélectionné en visualisant les données ?
3) Est-ce que les instances mal-classées sont les mêmes d’une méthode a
l’autre ?
4) Comparer les résultats de la méthode NaiveBayes en utilisant la première
et troisième options pour l’ensemble de test (sous « Test options » ) .
a. Quelle option vous a donné un meilleur taux de classification ?
b. Essayez de donner une explication plausible pour ce résultat.
5. Exploration libre d’une nouvelle base de données
- Ouvrir et explorer une nouvelle base de données à partir du dossier Weka/data
sur vos ordinateur, ou du dossier Weka / data dans le Google drive des supports-cours/
Base de Données « Jouer Tennis »