Notes de Cours : Data Mining

Programming, Math, etc. · course

Notes de Cours : Data Mining Séance 1, 09 Septembre 2013 Prof. Chiraz Ben Abdelkader, ENSI

Plan:

1) Introduction/Motivation: Pourquoi le data mining ? 2) Qu’est-ce que le data mining ? 3) Etude de cas ("case study") 4) Applications du data mining 5) Types de données exploitées

Références: [1] Notes de cours, Prof. Philippe Preux, Chapitre 1 http://www.grappa.univ-lille3.fr/~ppreux/Documents/notes-de-cours-de-fouille-de- donnees.pdf [2] Notes de cours, Prof. Bernard ESPINASSE http://www.lsis.org/espinasseb/Supports/DWDM-2009/6-IntroFouille-2009-4p.pdf http://www.lsis.org/espinasseb/Supports/DWDM-2009/7-ProcessusFouille-2009-4p.pdf [3] Marius Fieschi, Faculté de Médecine de Marseille http://cybertim.timone.univ-mrs.fr/enseignement/doc- enseignement/informatique/introdatawarehouse/docpeda_fichier

(Les références sont tous disponibles en fichiers pdf sur mon Google Drive, que vous pouvez accéder à partir du Google groupe « officiel » de la classe)

1) Motivation: Pourquoi le data mining ?

 L’explosion des données : (Data Deluge !)

o Les outils de collecte automatique des données et les bases de

données conduisent à d’énormes masses de données stockées dans des entrepôts.

o 2,5 exabytes (1018 bytes) de nouvelles données numériques sont

crées par jour !

o Le volume de toutes les données numériques du monde est estimé en 2013 à 1,200 exabytes. En plus, il se double chaque les 20 mois ! o 90% de toutes les données numériques qui existent aujourd’hui ont été

créées seulement dans les deux dernières années !

o Ce phénomène est assez récent (depuis 10-15 ans) et il s’appelle le Big Data. On parle notamment de trois caractéristiques principales du Big Data, qui sont: Volume, Vélocité, et Variété.

 Submergés par les données, mais manque de connaissance: toutes ces données ne servent à rien sans traitement intelligent qui nous aide à comprendre le contenu implicite de ces données.

 Solution : le data mining (fouille de données), qui nous permet d’explorer cette montagne de données, pour découvrir des connaissances utiles implicites, cachées la dedans …

2) Définition: Qu’est-ce que le data mining?

Le data mining est un ensemble de techniques pour l'exploration systématique et automatique de grandes bases de données ou entrepôts de données (data warehouses), permettant la découverte et l’extraction de connaissances sous la forme de modèles statistiques. Ces connaissances sont de l’information intéressante (non triviale, implicite, non connue précédemment, et potentiellement utile), comme des "patterns", des tendances, des relations, des classifications, des groupements, etc.

Le nom original du data mining était Knowledge Discovery in Databases (KDD), c’est à dire "la découverte de connaissances dans des bases de données".

Le data mining est à la rencontre de plusieurs disciplines, notamment : la statistique, l’algorithmique, IA, apprentissage artificiel, et bases de données.

3) Etude de Cas

Commenté [CBA1]:

(Exemple issue du livre de P. Adriaans et D. Zantige, « Data Mining », 1996)

Publicité

Un éditeur vend 5 sortes de magazines: sport, voiture, maison, musique et BD (bandes dessinées). Il souhaite mieux étudier ses clients pour découvrir de nouveaux marchés ou vendre plus de magazines à ses clients habituels.

Quelques questions qu'il peut se poser :

 Q1 : Combien de personnes ont pris un abonnement à un magazine de

sport cette année ?

 Q2 : A-t-on vendu plus d'abonnements de magazines de sport cette

année que l'année dernière ?

 Q3 : Est-ce que les acheteurs de magazines de BD sont aussi amateurs

de sport ?

 Q4 : Quelles sont les caractéristiques principales de mes lecteurs de

magazines de voiture ?

 Q5 : Peut-on prévoir les pertes de clients et prévoir des mesures pour les

diminuer ?

Ces questions sont de natures différentes; ils mettent en jeu des processus d’analyse différents :

Q1 & Q2 : Réponse par simples requêtes SQL : les données recherchées sont que le résultat d'un calcul simple sur un ou des groupes d'enregistrements.

Q3: Réponse formulée par une valeur estimant la probabilité de la règle "si amateur de BD alors amateur de sport" (techniques du statistique traditionnelle)

Q4 & Q5 : des questions beaucoup plus ouvertes; il s’agit de trouver une règle et non plus de la vérifier ou de l'utiliser. Les techniques du data mining sont exactement idéales pour ce type de questions.

4) Applications du data mining

 Les principaux domaines d'applications du DM :

 Domaine des assurances :

o analyse des risques (caractérisation des clients à hauts risques, ..) o automatisation du traitement des demandes (diagnostic des

dégâts et détermination automatique du montant des indemnités)

 Services financiers (banques, etc.) :

o Attribution de prêts automatisés, support à la décision de crédit o Détection de fraude o Stock trading

Publicité

 Business (sociétés télécom, hyper-marchés, etc.) :

o marketing ciblé o profils de consommateurs et modèles d’achats

(Customer Modeling, Customer Relationship Management (CRM))

o constitution des rayonnages

 Medicine:

o Aide a la diagnostic o Découverte de nouveaux médicaments (drug discovery)

 Science: astronomie, biologie, météorologie, etc.  Web: moteurs de recherche, e-commerce, détection de spam, online

advertising, sentiment analysis, opinion mining, etc.

 Gouvernement: surveillance (Big Brother), anti-terrorisme, investigation &

détection de crimes, etc.

Voir aussi:

http://www.kdnuggets.com/polls/2012/where-applied-analytics-data-mining.html

 Quelques applications intéressantes et récentes:

 Obama utilise le data mining pour sa campagne de réélection 2012 http://edition.cnn.com/2012/11/07/tech/web/obama-campaign-tech- team/index.html

 Google suivi de la grippe (Google Flu Trends):

http://www.google.org/flutrends/intl/fr/about/how.html

 Actualités: “How Target Figured Out A Teen Girl Was Pregnant Before Her

Father Did”, Forbes Magasine, 16 Fevrier, 2012 http://www.forbes.com/sites/kashmirhill/2012/02/16/how-target-figured-out- a-teen-girl-was-pregnant-before-her-father-did/

 Actualités: “Big Data Gets Bigger: Now Google Trends Can Predict The

Market”, Forbes Magasine, 23 Avril, 2013

http://www.forbes.com/sites/davidleinweber/2013/04/26/big-data-gets- bigger-now-google-trends-can-predict-the-market/

 Actualités: “Google can predict a movie's success before release”, 6 Juin,

2013 http://www.theverge.com/2013/6/6/4402808/google-box-office-prediction- using-search-data

Publicité

5) Types de Données Exploitées (disponibles pour l’analyse DM) :

 Transactions

o Tickets de caisse (liste d’articles) o Factures (produits et clients) o Communications téléphoniques (interlocuteurs, durée, lieux) o Connexions informatiques (dans les fichiers « log » des routers)

 Bases des données des entreprises

o Factures o Commandes o Suivi avec les clients

(en général, des données sur tout ce qui concerne la gestion interne et externe de l’entreprise…)

 Téléphones portables

o durée, date/temps, interlocuteurs de toutes les communications o abonnements o utilisation des services annexes

Toutes ces données sont bien sur stockées dans les bases de données des sociétés télécom.

 Web / Internet

o contenu des pages web o liens entre les pages web o historique des connexions

Toutes ces données sont stockes dans des serveurs Web partout dans le monde.

Les activités des utilisateurs Web sur les réseaux sociaux fait une

grande partie du contenu dynamique des pages Web. Par exemple, 12 terabytes de tweets et 2.7 milliards "j’aime" et "commentaires" sur Facebook sont crées par jour !

 Satellites et astronomie

o photos de corps célestes (télescopes) o photos pour la militaire, cartographie, météo, recherche scientifique

 Capteurs intelligents comme les RFID et GPS

o

localisation géographique des personnes et des produits

 etc.

Alors généralement, ces données brutes sont stockées sur des bases de données d’entreprises ou de sociétés privées, sur des serveurs Web, sur des réservoirs de données publiques, comme celui du Library of Congress (gouvernement Américain) ou ceux dans de grandes universités pour la recherche scientifiques.