Notes de Cours : Data Mining
Ce document présente une introduction complète au data mining, destinée aux étudiants et professionnels souhaitant comprendre les fondements, les motivations, les applications et les types de données exploitées dans ce domaine. Il s’appuie sur une étude de cas concrète pour illustrer les différentes approches analytiques. Motivation : Pourquoi le data mining ?
D'après le document Notes de Cours : Data Mining
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.
Document source
Programming, Math, etc. · PDF · 5 pages · 2013
Afficher l'aperçu du document
Ce document présente une introduction complète au data mining, destinée aux étudiants et professionnels souhaitant comprendre les fondements, les motivations, les applications et les types de données exploitées dans ce domaine. Il s’appuie sur une étude de cas concrète pour illustrer les différentes approches analytiques.
Motivation : Pourquoi le data mining ?
Le data mining répond à un besoin crucial face à l’explosion des données numériques, phénomène souvent appelé « Big Data ». Aujourd’hui, des outils de collecte automatique et des bases de données massives génèrent des volumes gigantesques d’informations stockées dans des entrepôts de données. Par exemple :
- 2,5 exabytes (10^18 bytes) de nouvelles données numériques sont créés chaque jour ;
- Le volume total des données numériques dans le monde était estimé en 2013 à 1 200 exabytes, doublant tous les 20 mois ;
- 90 % des données numériques existantes ont été créées au cours des deux dernières années seulement.
Ce phénomène récent est caractérisé par trois « V » : Volume, Vélocité (rapidité de création des données) et Variété (diversité des types de données).
Malgré cette abondance, les données brutes ne sont pas utiles sans un traitement intelligent. Le data mining permet d’explorer ces masses de données pour découvrir des connaissances implicites, cachées et potentiellement utiles.
Définition : Qu’est-ce que le data mining ?
Le data mining est un ensemble de techniques d’exploration systématique et automatique de grandes bases de données ou entrepôts de données (data warehouses). Il vise à découvrir et extraire des connaissances sous forme de modèles statistiques. Ces connaissances sont des informations intéressantes, non triviales, implicites, inconnues auparavant et potentiellement utiles, telles que :
- des motifs (patterns) ;
- des tendances ;
- des relations ;
- des classifications ;
- des groupements.
Le terme original était « Knowledge Discovery in Databases » (KDD), soit la découverte de connaissances dans des bases de données.
Le data mining se situe à l’intersection de plusieurs disciplines : statistique, algorithmique, intelligence artificielle, apprentissage automatique et bases de données.
Étude de cas
Considérons l’exemple d’un éditeur vendant cinq types de magazines : sport, voiture, maison, musique et bandes dessinées (BD). Il souhaite mieux connaître ses clients pour découvrir de nouveaux marchés ou augmenter ses ventes.
Quelques questions qu’il peut se poser :
- Q1 : Combien de personnes ont pris un abonnement à un magazine de sport cette année ?
- Q2 : A-t-on vendu plus d'abonnements de magazines de sport cette année que l'année dernière ?
- Q3 : Est-ce que les acheteurs de magazines de BD sont aussi amateurs de sport ?
- Q4 : Quelles sont les caractéristiques principales des lecteurs de magazines de voiture ?
- Q5 : Peut-on prévoir les pertes de clients et anticiper des mesures pour les diminuer ?
Ces questions impliquent différents types d’analyse :
- Q1 et Q2 : Réponse par des requêtes SQL simples, basées sur des calculs ou regroupements d’enregistrements.
- Q3 : Réponse par une estimation statistique de la probabilité de la règle « si amateur de BD alors amateur de sport » (techniques statistiques traditionnelles).
- Q4 et Q5 : Questions plus ouvertes, nécessitant la découverte de règles et modèles, où les techniques de data mining sont particulièrement adaptées.
Applications du data mining
Le data mining trouve des applications dans de nombreux domaines :
- Assurances :
- Analyse des risques (caractérisation des clients à hauts risques) ;
- Automatisation du traitement des demandes (diagnostic des dégâts, détermination automatique des indemnités).
- Attribution automatisée de prêts, support à la décision de crédit ;
- Détection de fraude ;
- Trading boursier.
- Marketing ciblé ;
- Profilage des consommateurs et modèles d’achats (Customer Modeling, CRM) ;
- Optimisation de la constitution des rayonnages.
- Aide au diagnostic ;
- Découverte de nouveaux médicaments (drug discovery).
Quelques exemples récents :
- La campagne de réélection d’Obama en 2012 a utilisé le data mining.
- Google Flu Trends suit la grippe à partir des recherches en ligne.
- Des entreprises comme Target ont détecté des comportements clients avant même leurs proches (exemple d’une adolescente enceinte).
- Google peut prédire le succès d’un film avant sa sortie grâce à l’analyse des données de recherche.
Types de données exploitées
Le data mining peut exploiter une grande variété de données :
- Transactions :
- Tickets de caisse (liste d’articles) ;
- Factures (produits et clients) ;
- Communications téléphoniques (interlocuteurs, durée, lieux) ;
- Connexions informatiques (fichiers log des routeurs).
- Bases de données d’entreprises :
- Factures, commandes, suivi clients ;
- Données de gestion interne et externe.
- Durée, date/heure, interlocuteurs des communications ;
- Abonnements ;
- Utilisation des services annexes.
- Contenu des pages web ;
- Liens entre pages ;
- Historique des connexions ;
- Activités sur réseaux sociaux (ex. : 12 téraoctets de tweets et 2,7 milliards de « j’aime » et commentaires Facebook par jour).
- Photos de corps célestes (télescopes) ;
- Photos pour usage militaire, cartographie, météo, recherche scientifique.
- RFID, GPS pour localisation géographique des personnes et produits.
Ces données sont généralement stockées sur des bases d’entreprises, serveurs web, réservoirs publics (ex. Library of Congress) ou dans des universités pour la recherche scientifique.
Glossaire des termes clés
- Big Data : Phénomène d’explosion des volumes de données numériques caractérisé par le volume, la vélocité et la variété.
- Data mining (fouille de données) : Ensemble de techniques pour explorer automatiquement de grandes bases de données afin d’en extraire des connaissances utiles.
- KDD (Knowledge Discovery in Databases) : Découverte de connaissances dans des bases de données, terme originel du data mining.
- Pattern : Motif ou modèle récurrent découvert dans les données.
- CRM (Customer Relationship Management) : Gestion de la relation client, utilisant des modèles pour mieux cibler les consommateurs.
- Entrepôt de données (Data Warehouse) : Base de données centralisée regroupant des données provenant de différentes sources pour analyse.
- Requête SQL : Instruction permettant d’interroger une base de données relationnelle pour extraire des informations.
- Analyse statistique : Méthodes pour estimer des probabilités et tester des hypothèses à partir des données.
- Apprentissage automatique : Branche de l’intelligence artificielle qui permet aux systèmes d’apprendre à partir des données sans être explicitement programmés.
Points clés à retenir
- Le data mining est indispensable pour exploiter la masse croissante de données numériques et en extraire des connaissances cachées.
- Il combine des techniques issues de la statistique, de l’algorithmique, de l’intelligence artificielle et des bases de données.
- Les questions simples peuvent être traitées par des requêtes SQL, tandis que les questions complexes nécessitent des méthodes de data mining.
- Les applications du data mining couvrent de nombreux secteurs : assurances, finance, commerce, médecine, sciences, web et gouvernement.
- Les données exploitées sont très variées, allant des transactions commerciales aux données web, en passant par les capteurs et les images satellites.
Commentaires
Aucun commentaire pour le moment. Posez la première question.