Théorie du Data Mining : Algorithmes, Cloud et Intégration des Données

Page 1 sur 26Lecteur de document UniversityLib

Théorie du Data Mining : Algorithmes, Cloud et Intégration des Données

Programming, Math, etc. · textbook

1

2

  • Liste des références a consulter (et a lire véritablement!)
  • Disponibles en fichiers pdf sur mon Google Drive, qu’on peut accéder a partir du

Google groupe « officiel » de la classe

3

Techniques automatiques: donc on parle d’algorithmes et de logiciels; et donc

l’informatique est un outil fondamental pour le DM. Il n’y a pas de data mining

manuel.

C’est quoi une connaissance? Ca touche a la philosophique, mais de point de vue

informatique, une définition pratique nous suffira: c’est une sorte de vue d’ensemble,

résumé d’information, modèle ou description générale, …

Les processeurs sont devenu assez forts, la mémoire/stockage de plus en plus non

chère.

Cloud computing: l'accès via un réseau de télécommunications, à la demande et en

libre-service, à des ressources informatiques (soit des logiciels soit du hardware)

partagées et configurables. [définition de NIST, selon Wikipedia]

Définition: Entrepôts de données (data warehouse) : est une base de données

regroupant une partie ou l'ensemble des données fonctionnelles d'une entreprise. Il

entre dans le cadre de l'informatique décisionnelle ; son but est de fournir un

ensemble de données servant de référence unique, utilisée pour la prise de décisions

dans l'entreprise par le biais de statistiques et de rapports réalisés via des outils de

4

reporting. D'un point de vue technique, il sert surtout à 'délester' les bases de

données opérationnelles des requêtes pouvant nuire à leurs performances.

[Wikipedia]

4

Les techniques de data mining fait appel a plusieurs autres disciplines scientifiques.

Source de la figure:

Publicité

http://cybertim.timone.univ-mrs.fr/enseignement/doc-

enseignement/informatique/introdatawarehouse/docpeda_fichier

5

6

Le processus global de fouille de données comprend trois étapes principales.

Phase 1 : préparation et organisation des données convenablement pour l’étape

suivante

  • faut tout d’abord se familiariser avec le domaine de l’application, pour mieux

comprendre les semantics des données …

  • nettoyage des données: supprimer/corriger les valeurs invalides ou inconsistantes

(a cause d’erreurs de saisi par exemple), remplir certaines valeurs manquantes, …

  • on exige un format bien structuré, tel qu’une base de données SQL ou des fichiers

xml, pour que le traitement de « fouille » dans l’étape suivante soit facile/simple et

rapide/efficace …

Phase 2:

  • fait appel a des techniques de statistiques et de machine learning (apprentissage

artificiel)

  • étape au cœur du processus DM
  • qualité des résultats: est ce que le modèle est fiable, compréhensible pour

l’utilisateur, bonne performance vis-a-avis l’application, …

7

Phase 3: il y a deux manières principales d'utiliser le modèle obtenu :

1) Voir les résultats du modèle sur les données

• objectif: analyse, pour mieux comprendre le système d’où viennent les

données

2) Appliquer le modèle pour prédire sur de nouvelles données

• objectif: afin de recommander des actions

exemple : accorder un crédit, analyse de risque, détection de fraude...

7

Source de la figure:

Publicité

http://www.lsis.org/espinasseb/Supports/DWDM-2009/6-IntroFouille-2009-4p.pdf

8

Source de la figure:

http://cybertim.timone.univ-mrs.fr/enseignement/doc-

enseignement/informatique/introdatawarehouse/docpeda_fichier

9

10

Dans ce cours nous allons nous concentrer essentiellement sur l’ étape No 2 du

processus de data mining:

-on va étudier quelques méthodes typique d’extraction de connaissances a partir de

données déjà prétraités et bien préparées.

-on finira avec l’étude de quelques applications réelles du DM

Mais tout d’abord et avant tout, nous allons discuter en détail le input/output

prévus/attendus pour cette étape:

  • Input: quels types de données peut-on utiliser? Qu’est ce qu’une donnée?
  • Output: quels types de connaissances peut on extraire?

We begin by looking at the interface of the mining process, that is :

1)

2) The different kinds of output that might be produced

the different forms the input might take, and

11

  • On parle ici des données non pas brutes, mais des données prétraitées, préparées

pour l’extraction de connaissances …

  • On se rappelle :
  • que les données brutes sont typiquement stockées dans des bases de données

d’entreprises, le Web, des réservoirs de données publiques comme celui du Library of

Congress (Librairie Nationale du gouvernement Américain) ou ceux dans de grandes

universités pour la recherche scientifiques, etc.

  • et que les données brutes sont prétraites dans la première étape du processus

global de data mining, pour obtenir des données dans un format bien structurée et

Publicité

homogène.

  • Evidemment la représentation de l’ensemble X dépend du moyen de stockage et les

types des attributs.

  • Comme vous le saviez du cours Algèbre Linéaire, une matrice (un ensemble de

vecteurs) a une interprétation géométrique utile, ou les exemplaires sont des points

et les attributs sont des dimensions dans l’espace Euclidien.

12

  • Selon la representation (codage) de X, on appelle une exemplaire une instance, un

vecteur, ou un point

12

Les caractéristiques des données (valeurs d’attributs)

13

Pas de notion d’ordre entre les valeurs

14

15

16

17

Les types de connaissances extraites correspondent a différentes taches d’extraction

de connaissances.

18

19

20

21

22

23