Étude sur l’indice de masse corporelle

Page 1 sur 2Lecteur de document UniversityLib

Étude sur l’indice de masse corporelle

Statistical Analysis in Pediatrics · lab

Data Mining

2013/2014

Prof. Chiraz Ben Abdelkader

TP#1 Lundi 23 Septembre, 2013

Introduction et Objectifs

  • WEKA est un logiciel libre, écrit en Java, et regroupant un grand nombre

d’algorithmes d’apprentissage artificiel et de prétraitement de données. On va utiliser WEKA pour tous les travaux pratiques du cours data mining .

  • Pour plus d’informations sur le logiciel Weka, voir les documents sous le

dossier intitulé Weka dans le Google Drive (supports-cours).

1. Ouverture de WEKA

  • Installation : le logiciel WEKA peut être facilement installé à partir de son site

officiel à l’Université Waikato en Nouvelle Zélande (version actuelle : 3.6.10)

http://www.cs.waikato.ac.nz/~ml/weka

  • Lancez WEKA. Dans la fenêtre « Weka GUI chooser » qui s’est ouverte, cliquez

sur le bouton « Explorer ». Une fenêtre « Weka Explorer » doit s’ouvrir. C’est elle qui nous servira d’interface principale dans ce TP.

  • La fenêtre Weka Explorer contient 6 onglets tout en haut : Preprocess, Classify,

Cluster, Associate, Select Attributes, Visualize .

Dans ce TP, on va utiliser seulement les deux premiers onglets :

  • onglet Preprocess : pour lecture, prétraitement, et visualisation des données.

  • onglet Classify : pour le traitement des données avec des techniques de

classification.

2. Obtenir les Données

  • Bases de données : Dans ce premier TP, vous allez vous familiariser avec

l’utilisation de WEKA à partir de deux bases de données de petite taille:

  • Iris : une base de données véritable, très célèbre au monde des

statistiques, comportant des exemples de fleurs d’iris décrites par plusieurs attributs et appartenant à différentes catégories (classes) d’iris.

  • Weather : une base de données artificielle.

    • Le format de fichier ARFF : WEKA utilise le format de fichier ARFF pour

Publicité

lire et enregistrer des données. Il s’agit de fichiers texte avec un format bien précis, un peu comme le format XML. Un fichier ARFF contient une liste

d’exemples auxquels sont associés des valeurs d’attributs, et un entête qui définit le type des attributs. WEKA peut lire autres types de fichiers de données, tel que le format CSV, comme on verra dans les prochains TPs.

  • Ouverture des fichiers ARFF dans Weka :

    • Vous trouverez les bases de données Iris et Weather dans des fichiers

ARFF ( iris.arff et weather.numeric.arff, respectivement) sur vos ordinateurs, normalement sous le dossier ou vous avez installé WEKA : C:/programmes/Weka-3.6/data/

  • Pour ouvrir un fichier ARFF, cliquez sur le bouton " Open file…", allez

dans le dossier contenant le fichier, puis cliquez sur l’icône du fichier.

  • Ouvrir le fichier également dans un éditeur standard (par ex. Notepad),

pour vous familiariser avec la structure générale du format ARFF.

3. Comprendre les Données (visualisation simple)

  • Chaque fois qu’on ouvre un fichier de données dans le « Weka Explorer »,

certaines informations vont apparaître dans la fenêtre, permettant de se faire une idée générale de la répartition et organisation de ces données :

  • En haut à gauche : nombre d’exemples ( instances ), nombre d’attributs.

  • En bas à gauche : le nom de chaque attribut ; en cliquant sur un attribut,

des informations concernant cet attribut vont apparaitre dans la zone droite de la fenêtre…

  • En haut à droite : des informations sur l’attribut qu’on a sélectionné : son

nom, son type, ses différentes valeurs, nombre de valeurs manquantes. ( Name, Type, Missing, Distinct, Unique )

  • En bas à droite : la répartition des différentes classes en fonction de

l’attribut sélectionné. (voir Question 3 au-dessous)

  • Recopier le fichier ARFF dans un répertoire de votre choix, puis modifier-le

dans Notepad: supprimer quelques lignes, changer quelques valeurs d’attributs, changer le type d’un attribut; puis re-ouvrir le fichier modifié dans WEKA, et observer la différence…

Questions

  1. Combien y a-t-il d’instances (exemples) ? d’attributs ?

  2. Quels sont les noms des attributs et leurs types ?

  3. Combien y a-t-il de classes (c.a.d. nombre de valeurs de l’attribut

intitulé classe ) ? quel est le nom de chaque classe ?

  1. Quels sont les valeurs minimale et maximale de l’attribut :

Publicité

a. petalwidth ? (iris.arff)

b. temperature ? (weather.arff)

  1. Combien y a-t-il d’instances de la catégorie :

a. iris-virginica ? (iris.arff)

b. yes ? (weather.arff)

  1. Combien y a-t-il de valeurs manquantes ?

  2. Que fait le bouton « Visualize all » ?

4. Traitement des Données (Etape Fouille - Apprentissage Artificiel)

  • Nous allons maintenant tester une méthode d’apprentissage sur ces données.

  • Pour cela, tout d’abord cliquez sur l’onglet « Classify » dans la barre du haut de

la fenêtre « Weka Explorer ».

  • Ensuite choisissez une méthode d’apprentissage en cliquant sur le bouton

« Choose ». Allez dans le répertoire wekaclassifiers, puis choisissez, à tour de rôle, chacun des méthodes d’apprentissage suivantes:

  • ZeroR : rules  ZeroR

  • OneR : rules  OneR

  • Naive Bayes simple : bayes  NaiveBayesSimple

    • Choisir l’ensemble de test ( sous « Test Options » ) : il y a 4 options
  • « Use training set » : utilise l’échantillon d’apprentissage aussi comme

échantillon de test.

  • « Supplied test set » : obtient l’échantillon de test d’un autre fichier de

données.

  • « Percentage split » : découpe de l’échantillon d’apprentissage selon un

pourcentage spécifiée.

  • « Cross validation » : utilisation de la méthode de validation croisée.

    • Choisir le nom de l’attribut classificateur :
  • Sélectionner un attribut dans le drop-down menu au-dessous de la zone

Publicité

« Test Options » .

  • Par défaut, WEKA sélectionne l’attribut nommé « classe », s’il existe

dans la base de données.

  • Lancer l’exécution de la méthode d’apprentissage en cliquant sur le bouton

« Start » .

  • Les résultats seront affichés dans la zone droite de la fenêtre (sous « Classifier

Output » ).

  • Analyse/visualisation des résultats :

    • à partir de la zone intitulée « Result list » (en bas à gauche de la fenêtre)

de résultat, cliquez avec le bouton droit de la souris, puis sélectionner « Visualize classifier errors » du menu. Une nouvelle fenêtre intitulée « Weka Classifier Visualize » va ainsi apparaitre. Maximiser cette fenêtre pour mieux comprendre ces résultats.

  • A la gauche de la fenêtre, on peut voir un graphe 2D, dont les

coordonnées sont sélectionnées à partir du menu en haut de la fenêtre. Les instances mal-classes sont affiches en des carrées, et les instances correctement classées sont affichées en X.

Questions

1) Quel est le taux de classification correcte pour chaque méthode de

classification ? Quelle est la méthode la plus précise?

2) L’attribut choisi par OneR est-il le même que celui que vous aviez

sélectionné en visualisant les données ?

3) Est-ce que les instances mal-classées sont les mêmes d’une méthode a

l’autre ?

4) Comparer les résultats de la méthode NaiveBayes en utilisant la première

et troisième options pour l’ensemble de test (sous « Test options » ) .

a. Quelle option vous a donné un meilleur taux de classification ?

b. Essayez de donner une explication plausible pour ce résultat.

5. Exploration libre d’une nouvelle base de données

  • Ouvrir et explorer une nouvelle base de données à partir du dossier Weka/data

sur vos ordinateur, ou du dossier Weka / data dans le Google drive des supports-cours/

Base de Données « Jouer Tennis »