Data Mining

Ce document présente des exercices pratiques de fouille de données (Data Mining) destinés aux étudiants en informatique ou en sciences des données. Il couvre l'application de méthodes simples de classification sur une base de données « jouer tennis » et la classification de textes à l'aide de la méthode Naïve Bayes avec l'outil Weka.

D'après le document Data Mining

Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Data Mining

Document source

Data Mining

Programming, Math, etc. · PDF · 4 pages · 2013

Afficher l'aperçu du document

Consulter le document original →

Ce document présente des exercices pratiques de fouille de données (Data Mining) destinés aux étudiants en informatique ou en sciences des données. Il couvre l'application de méthodes simples de classification sur une base de données « jouer tennis » et la classification de textes à l'aide de la méthode Naïve Bayes avec l'outil Weka.

Application des méthodes simples de PCS sur la base de données « jouer tennis »

Présentation de la base de données « jouer tennis »

La base de données contient 20 exemples décrits par 4 attributs nominaux :

  • Ciel : Ensoleillé, Couvert, Pluie
  • Température : Chaude, Tiède, Fraîche
  • Humidité : Élevée, Normale
  • Vent : Fort, Faible

La variable cible (classe) est jouer avec deux valeurs possibles : oui ou non.

Le domaine des attributs est de taille |D| = 3 × 3 × 2 × 2 = 36.

Pour les exercices, les données sont divisées en :

  • Échantillon d'entraînement (Xtrain) : exemples 1 à 14
  • Échantillon de test (Xtest) : exemples 15 à 20

Pour utiliser cette base dans Weka, il faut convertir le fichier jouer_tennis.txt en format ARFF (jouer_tennis.arff).

ZeroR

ZeroR est une méthode de classification très simple qui prédit toujours la classe la plus fréquente dans l'échantillon d'entraînement.

Version 1 : Le taux de classification correcte est à calculer sur Xtrain.

Version 2 :

  • Induction du classeur : la classe la plus fréquente selon Xtrain est _______ (à déterminer).
  • Taux de classification correcte sur Xtest : _______ (à calculer).

Les résultats obtenus avec Weka (Version 2) doivent être comparés aux calculs manuels.

OneR

OneR construit un classifieur simple basé sur un seul attribut. La démarche est la suivante :

  1. Pour chaque attribut xi (i=1 à 4), estimer les probabilités Pr[y | xi, Xtrain] pour toutes les valeurs possibles de y et xi.
  2. Construire un classifieur basé sur chaque attribut en décidant, pour chaque valeur xi, la classe y la plus probable.
  3. Calculer le taux de classification correcte de chaque classifieur sur Xtest.
  4. Choisir le classifieur basé sur l'attribut qui donne le meilleur taux.

Exemple de tableau à compléter pour chaque attribut :

Attribut (xi) Valeur Pr[jouer=oui | xi, Xtrain] Pr[jouer=non | xi, Xtrain] Nombre d'exemplaires dans Xtrain Décision du classifieur Taux de classification correcte sur Xtest
Ciel Ensoleillé
Ciel Couvert
Ciel Pluie

Le meilleur classifieur est basé sur l'attribut : ________.

Taux de classification correcte du classifieur final sur Xtest : ________.

Résultats obtenus avec Weka (attribut choisi et taux de classification) : ________.

Naïve Bayes

La méthode Naïve Bayes induit un classifieur probabiliste en estimant :

  • Les probabilités a priori Pr[y | Xtrain] pour chaque classe y.
  • Les probabilités conditionnelles Pr[xi | y, Xtrain] pour chaque valeur d'attribut xi et chaque classe y.

Le classifieur prédit la classe y qui maximise :

Pr[y | X] ∝ Pr[y | Xtrain] × ∏ Pr[xi | y, Xtrain]

Exemple de tableau à compléter :

Classe Nombre total d'exemplaires Pr[y | Xtrain] Attribut Valeur xi Nombre d'exemplaires avec xi Pr[xi | y, Xtrain]
jouer = oui Ciel Ensoleillé
jouer = non Ciel Ensoleillé

Taux de classification correcte du classifieur Naïve Bayes sur Xtest : ________.

Résultats obtenus avec Weka : ________.

Classification de textes avec la méthode Naïve Bayes

Cette partie utilise exclusivement l'outil Weka pour la classification de textes.

Chargement et exploration des bases de données

  • Télécharger et ouvrir dans Weka le fichier toy.news-train.arff.
  • Identifier le nombre d'attributs, leurs types et la classe cible.

Ensuite, les textes sont convertis en attributs binaires :

  1. Dans l'onglet « Preprocess », cliquer sur « Choose » sous « Filter ».
  2. Sélectionner : filters → unsupervised → attribute → String2WordVector.
  3. Observer le changement dans la liste des attributs et noter le nombre et les noms des nouveaux attributs.

Application sur une autre base de données

  • Répéter les mêmes étapes avec le fichier ReutersCorn-small-train.arff.

Utilisation du classifieur Naïve Bayes

  1. Dans l'onglet « Classify », cliquer sur « Choose » sous « Classifier ».
  2. Sélectionner : classifiers → bayes → NaiveBayes.
  3. Appliquer le classifieur sur les données transformées.

Glossaire des termes clés

  • Attribut nominal : variable qualitative prenant un nombre fini de valeurs distinctes.
  • Classe : variable cible à prédire dans un problème de classification.
  • Échantillon d'entraînement (Xtrain) : sous-ensemble des données utilisé pour construire le modèle.
  • Échantillon de test (Xtest) : sous-ensemble des données utilisé pour évaluer la performance du modèle.
  • ZeroR : classifieur simple qui prédit toujours la classe la plus fréquente.
  • OneR : classifieur basé sur un seul attribut, choisissant la classe la plus fréquente pour chaque valeur d'attribut.
  • Naïve Bayes : classifieur probabiliste basé sur le théorème de Bayes avec hypothèse d'indépendance conditionnelle entre attributs.
  • Pr[y | Xtrain] : probabilité a priori de la classe y dans l'échantillon d'entraînement.
  • Pr[xi | y, Xtrain] : probabilité conditionnelle de la valeur xi de l'attribut i sachant la classe y.
  • String2WordVector : filtre Weka qui convertit des chaînes de caractères en vecteurs d'attributs binaires représentant la présence ou l'absence de mots.

Points clés à retenir

  • Les méthodes simples comme ZeroR et OneR permettent d'obtenir des baselines pour la classification.
  • OneR sélectionne l'attribut le plus discriminant en fonction du taux de classification correcte sur l'échantillon de test.
  • Naïve Bayes utilise des probabilités a priori et conditionnelles pour prédire la classe avec une hypothèse d'indépendance entre attributs.
  • La conversion de textes en vecteurs binaires est une étape essentielle pour appliquer des classifieurs classiques sur des données textuelles.
  • Weka facilite l'application de ces méthodes avec des interfaces graphiques et des filtres adaptés.

Partager

Commentaires

Aucun commentaire pour le moment. Posez la première question.

Les commentaires sont relus avant publication. Votre e-mail n'est jamais affiché.

← Toutes les révisions