Data Mining
Ce document présente des exercices pratiques de fouille de données (Data Mining) destinés aux étudiants en informatique ou en sciences des données. Il couvre l'application de méthodes simples de classification sur une base de données « jouer tennis » et la classification de textes à l'aide de la méthode Naïve Bayes avec l'outil Weka.
D'après le document Data Mining
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Programming, Math, etc. · PDF · 4 pages · 2013
Afficher l'aperçu du document
Ce document présente des exercices pratiques de fouille de données (Data Mining) destinés aux étudiants en informatique ou en sciences des données. Il couvre l'application de méthodes simples de classification sur une base de données « jouer tennis » et la classification de textes à l'aide de la méthode Naïve Bayes avec l'outil Weka.
Application des méthodes simples de PCS sur la base de données « jouer tennis »
Présentation de la base de données « jouer tennis »
La base de données contient 20 exemples décrits par 4 attributs nominaux :
- Ciel : Ensoleillé, Couvert, Pluie
- Température : Chaude, Tiède, Fraîche
- Humidité : Élevée, Normale
- Vent : Fort, Faible
La variable cible (classe) est jouer avec deux valeurs possibles : oui ou non.
Le domaine des attributs est de taille |D| = 3 × 3 × 2 × 2 = 36.
Pour les exercices, les données sont divisées en :
- Échantillon d'entraînement (Xtrain) : exemples 1 à 14
- Échantillon de test (Xtest) : exemples 15 à 20
Pour utiliser cette base dans Weka, il faut convertir le fichier jouer_tennis.txt en format ARFF (jouer_tennis.arff).
ZeroR
ZeroR est une méthode de classification très simple qui prédit toujours la classe la plus fréquente dans l'échantillon d'entraînement.
Version 1 : Le taux de classification correcte est à calculer sur Xtrain.
Version 2 :
- Induction du classeur : la classe la plus fréquente selon Xtrain est _______ (à déterminer).
- Taux de classification correcte sur Xtest : _______ (à calculer).
Les résultats obtenus avec Weka (Version 2) doivent être comparés aux calculs manuels.
OneR
OneR construit un classifieur simple basé sur un seul attribut. La démarche est la suivante :
- Pour chaque attribut xi (i=1 à 4), estimer les probabilités Pr[y | xi, Xtrain] pour toutes les valeurs possibles de y et xi.
- Construire un classifieur basé sur chaque attribut en décidant, pour chaque valeur xi, la classe y la plus probable.
- Calculer le taux de classification correcte de chaque classifieur sur Xtest.
- Choisir le classifieur basé sur l'attribut qui donne le meilleur taux.
Exemple de tableau à compléter pour chaque attribut :
| Attribut (xi) | Valeur | Pr[jouer=oui | xi, Xtrain] | Pr[jouer=non | xi, Xtrain] | Nombre d'exemplaires dans Xtrain | Décision du classifieur | Taux de classification correcte sur Xtest |
|---|---|---|---|---|---|---|
| Ciel | Ensoleillé | |||||
| Ciel | Couvert | |||||
| Ciel | Pluie |
Le meilleur classifieur est basé sur l'attribut : ________.
Taux de classification correcte du classifieur final sur Xtest : ________.
Résultats obtenus avec Weka (attribut choisi et taux de classification) : ________.
Naïve Bayes
La méthode Naïve Bayes induit un classifieur probabiliste en estimant :
- Les probabilités a priori Pr[y | Xtrain] pour chaque classe y.
- Les probabilités conditionnelles Pr[xi | y, Xtrain] pour chaque valeur d'attribut xi et chaque classe y.
Le classifieur prédit la classe y qui maximise :
Pr[y | X] ∝ Pr[y | Xtrain] × ∏ Pr[xi | y, Xtrain]
Exemple de tableau à compléter :
| Classe | Nombre total d'exemplaires | Pr[y | Xtrain] | Attribut | Valeur xi | Nombre d'exemplaires avec xi | Pr[xi | y, Xtrain] |
|---|---|---|---|---|---|---|
| jouer = oui | Ciel | Ensoleillé | ||||
| jouer = non | Ciel | Ensoleillé |
Taux de classification correcte du classifieur Naïve Bayes sur Xtest : ________.
Résultats obtenus avec Weka : ________.
Classification de textes avec la méthode Naïve Bayes
Cette partie utilise exclusivement l'outil Weka pour la classification de textes.
Chargement et exploration des bases de données
- Télécharger et ouvrir dans Weka le fichier
toy.news-train.arff. - Identifier le nombre d'attributs, leurs types et la classe cible.
Ensuite, les textes sont convertis en attributs binaires :
- Dans l'onglet « Preprocess », cliquer sur « Choose » sous « Filter ».
- Sélectionner :
filters → unsupervised → attribute → String2WordVector. - Observer le changement dans la liste des attributs et noter le nombre et les noms des nouveaux attributs.
Application sur une autre base de données
- Répéter les mêmes étapes avec le fichier
ReutersCorn-small-train.arff.
Utilisation du classifieur Naïve Bayes
- Dans l'onglet « Classify », cliquer sur « Choose » sous « Classifier ».
- Sélectionner :
classifiers → bayes → NaiveBayes. - Appliquer le classifieur sur les données transformées.
Glossaire des termes clés
- Attribut nominal : variable qualitative prenant un nombre fini de valeurs distinctes.
- Classe : variable cible à prédire dans un problème de classification.
- Échantillon d'entraînement (Xtrain) : sous-ensemble des données utilisé pour construire le modèle.
- Échantillon de test (Xtest) : sous-ensemble des données utilisé pour évaluer la performance du modèle.
- ZeroR : classifieur simple qui prédit toujours la classe la plus fréquente.
- OneR : classifieur basé sur un seul attribut, choisissant la classe la plus fréquente pour chaque valeur d'attribut.
- Naïve Bayes : classifieur probabiliste basé sur le théorème de Bayes avec hypothèse d'indépendance conditionnelle entre attributs.
- Pr[y | Xtrain] : probabilité a priori de la classe y dans l'échantillon d'entraînement.
- Pr[xi | y, Xtrain] : probabilité conditionnelle de la valeur xi de l'attribut i sachant la classe y.
- String2WordVector : filtre Weka qui convertit des chaînes de caractères en vecteurs d'attributs binaires représentant la présence ou l'absence de mots.
Points clés à retenir
- Les méthodes simples comme ZeroR et OneR permettent d'obtenir des baselines pour la classification.
- OneR sélectionne l'attribut le plus discriminant en fonction du taux de classification correcte sur l'échantillon de test.
- Naïve Bayes utilise des probabilités a priori et conditionnelles pour prédire la classe avec une hypothèse d'indépendance entre attributs.
- La conversion de textes en vecteurs binaires est une étape essentielle pour appliquer des classifieurs classiques sur des données textuelles.
- Weka facilite l'application de ces méthodes avec des interfaces graphiques et des filtres adaptés.
Commentaires
Aucun commentaire pour le moment. Posez la première question.