Fouille de données
Ce document présente les notions fondamentales de la fouille de données, destinées aux étudiants et professionnels souhaitant comprendre les principes, les méthodes et les applications de cette discipline. Il s'agit d'un guide pratique et théorique pour apprendre à manipuler, analyser et extraire de l'information utile à partir de grands ensembles de données.
D'après le document Fouille de données
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Programming, Math, etc. · PDF · 256 pages · 2011
Afficher l'aperçu du document
Ce document présente les notions fondamentales de la fouille de données, destinées aux étudiants et professionnels souhaitant comprendre les principes, les méthodes et les applications de cette discipline. Il s'agit d'un guide pratique et théorique pour apprendre à manipuler, analyser et extraire de l'information utile à partir de grands ensembles de données.
Introduction à la fouille de données
La fouille de données consiste à rechercher et extraire des informations utiles et inconnues à partir de grands volumes de données stockées dans des bases ou entrepôts de données. Son développement récent est lié à plusieurs facteurs : la puissance de calcul désormais accessible, l'augmentation massive des volumes de données, la disponibilité de réseaux mondiaux à haut débit, et l'intérêt commercial croissant pour l'optimisation des processus industriels, commerciaux et logistiques.
La fouille de données a une importance économique majeure car elle permet d'optimiser la gestion des ressources humaines et matérielles. Elle est utilisée dans divers domaines :
- Décision d'octroi de crédits en fonction du profil du demandeur et des expériences passées.
- Optimisation des réservations dans les transports et l'hôtellerie.
- Organisation des rayonnages en supermarché en regroupant les produits fréquemment achetés ensemble, par exemple : « les clients qui achètent le produit X en fin de semaine, pendant l'été, achètent généralement aussi le produit Y ».
- Ciblage des campagnes publicitaires et promotions.
- Diagnostic médical basé sur des symptômes et caractéristiques démographiques.
- Analyse du génome et bio-informatique.
- Classification d'objets en astronomie.
- Commerce électronique et recommandations de produits.
- Analyse des pratiques commerciales et leur impact sur les ventes.
- Moteurs de recherche sur Internet (fouille du web).
- Extraction d'information depuis des textes (fouille de textes).
- Analyse de l'évolution temporelle des données (fouille de séquences).
Le processus complet de fouille de données comprend plusieurs étapes :
- Collecte et organisation des données dans une base.
- Nettoyage des données : gestion des attributs sans valeur ou bruités, normalisation.
- Sélection des attributs utiles.
- Extraction d'information (Knowledge Discovery in Databases, KDD).
- Visualisation des données : histogrammes, diagrammes, arbres, visualisation 3D, exploration interactive.
- Évaluation des résultats de l'extraction.
Ce cours se concentre principalement sur la phase d'extraction d'information (phase 4), ainsi que sur les phases de nettoyage, sélection et visualisation.
Qu’est-ce qu’une donnée ?
Notations
Une donnée est une entité décrite par un ensemble d'attributs. On note :
- X : ensemble des données ou exemples.
- A : ensemble des attributs décrivant chaque donnée.
- a ∈ A : un attribut.
- V_a : ensemble des valeurs possibles pour l'attribut a.
- D = V_a1 × V_a2 × ... × V_aP : espace des données, produit cartésien des ensembles de valeurs des P attributs.
- x ∈ X ⊂ D : une donnée, élément de l'ensemble des données.
Chaque attribut correspond à un axe dans un espace euclidien de dimension P, où P est le nombre d'attributs.
Les différentes natures d’attributs
Une donnée est un enregistrement (ou instance, individu, tuple) caractérisé par plusieurs attributs. Un attribut peut être :
- Qualitatif : valeurs non numériques sur lesquelles on ne peut pas faire de moyenne (ex. couleur, marque de voiture).
- Quantitatif : valeurs numériques (entiers, réels) sur lesquelles on peut appliquer des opérations arithmétiques (ex. salaire, surface).
- Composé : un attribut peut être un enregistrement lui-même (ex. date composée de jour, mois, année).
Il est important de noter que :
- Un attribut quantitatif n'est pas forcément numérique (ex. une date).
- Un attribut numérique n'est pas forcément quantitatif (ex. un code postal).
Les différentes natures de valeur d’attribut
Les valeurs d'attribut peuvent être classées selon leur nature :
- Attribut nominal : valeurs non ordonnées, sans relation d'ordre (ex. bleu, vert). On ne peut pas comparer ou ordonner ces valeurs.
- Attribut ordinal : valeurs ordonnées, comparables mais arbitraires (ex. température en °C, où 20°C est plus chaud que 18°C, mais les rapports ne sont pas forcément significatifs).
- Attribut à valeur absolue : valeurs ordonnées et non arbitraires, où les opérations arithmétiques ont un sens (ex. nombre d'enfants).
Ces distinctions impliquent que les opérations arithmétiques ne sont pas toujours licites sur tous les types d'attributs. Par exemple, on ne peut pas soustraire deux couleurs, mais on peut soustraire deux températures. Il est crucial de respecter la nature des attributs lors des analyses.
Un principe fondamental est l'indépendance des résultats d'analyse par rapport aux unités de mesure. Par exemple, l'information extraite ne doit pas changer si une longueur est exprimée en millimètres, mètres ou années-lumière.
Le bruit
Les données peuvent contenir des valeurs inconnues ou invalides, on parle alors de données bruitées. Éliminer toutes les données avec des valeurs manquantes peut vider la base de données. La collecte de données fiables est un défi pratique important. En fouille de données, il faut donc apprendre à traiter les données imparfaites sans supposer que toutes les valeurs sont connues ou valides.
Différentes tâches d’extraction d’information
Un exemple typique est la classification supervisée, où chaque donnée est associée à une étiquette (par exemple une couleur). Le but est de prédire l’étiquette d’une nouvelle donnée à partir d’un ensemble d’exemples étiquetés.
Géométriquement, cela revient à séparer les points selon leur étiquette. Si deux classes sont linéairement séparables, un hyperplan suffit à les distinguer. Sinon, il faut utiliser des objets géométriques plus complexes.
Les données peuvent être bruitées, ce qui signifie que certaines données sont mal classées ou mal mesurées, rendant la séparation difficile.
Les approches pour résoudre ces problèmes incluent :
- Construction d’un modèle arborescent (arbres de décision) ou de règles interprétables (chapitres 3 et 6).
- Estimation directe de la classe par des méthodes probabilistes (classifieur bayésien, chapitre 4) ou par cas (plus proches voisins, chapitre 5).
- Modèles non interprétables mais puissants comme les réseaux de neurones (chapitre 7) ou les machines à vecteurs supports (chapitre 8).
- Sélection de variables pertinentes (chapitre 9).
- Combinaison et amélioration des classifieurs (chapitre 10).
Glossaire des termes clés
- Attribut : caractéristique ou variable décrivant une donnée.
- Donnée : enregistrement ou instance décrite par un ensemble d’attributs.
- Attribut qualitatif : attribut dont les valeurs ne sont pas numériques, sans moyenne possible.
- Attribut quantitatif : attribut numérique sur lequel on peut effectuer des opérations arithmétiques.
- Attribut nominal : attribut qualitatif avec valeurs non ordonnées.
- Attribut ordinal : attribut qualitatif avec valeurs ordonnées mais arbitraires.
- Attribut à valeur absolue : attribut quantitatif avec valeurs non arbitraires.
- Bruit : données comportant des valeurs inconnues ou invalides.
- Classification supervisée : tâche consistant à prédire l’étiquette d’une donnée à partir d’exemples étiquetés.
- Hyperplan : objet géométrique de dimension P-1 dans un espace à P dimensions, utilisé pour séparer des classes.
- KDD (Knowledge Discovery in Databases) : processus d’extraction de connaissances à partir de bases de données.
- Nettoyage des données : étape de traitement des données pour gérer les valeurs manquantes, invalides ou bruitées.
- Sélection d’attributs : choix des attributs les plus pertinents pour l’analyse.
Points clés à retenir
- La fouille de données vise à extraire des informations utiles et inconnues à partir de grands ensembles de données.
- Les données sont décrites par des attributs de nature qualitative ou quantitative, avec des distinctions importantes selon la nature des valeurs (nominal, ordinal, absolu).
- Le traitement des données bruitées est essentiel, car les données réelles contiennent souvent des valeurs manquantes ou erronées.
- La classification supervisée est un problème central, consistant à prédire une étiquette à partir d’exemples connus.
- Différentes méthodes existent, allant des modèles interprétables (arbres, règles) aux modèles complexes (réseaux de neurones, machines à vecteurs supports).
- Il est crucial de respecter la nature des attributs et le principe d’indépendance vis-à-vis des unités de mesure pour garantir la validité des analyses.
- La fouille de données est un art qui combine connaissances théoriques, pratique informatique et interprétation critique des résultats.
Commentaires
Aucun commentaire pour le moment. Posez la première question.