1
2
- Liste des références a consulter (et a lire véritablement!)
- Disponibles en fichiers pdf sur mon Google Drive, qu’on peut accéder a partir du
Google groupe « officiel » de la classe
3
Techniques automatiques: donc on parle d’algorithmes et de logiciels; et donc
l’informatique est un outil fondamental pour le DM. Il n’y a pas de data mining
manuel.
C’est quoi une connaissance? Ca touche a la philosophique, mais de point de vue
informatique, une définition pratique nous suffira: c’est une sorte de vue d’ensemble,
résumé d’information, modèle ou description générale, …
Les processeurs sont devenu assez forts, la mémoire/stockage de plus en plus non
chère.
Cloud computing: l'accès via un réseau de télécommunications, à la demande et en
libre-service, à des ressources informatiques (soit des logiciels soit du hardware)
partagées et configurables. [définition de NIST, selon Wikipedia]
Définition: Entrepôts de données (data warehouse) : est une base de données
regroupant une partie ou l'ensemble des données fonctionnelles d'une entreprise. Il
entre dans le cadre de l'informatique décisionnelle ; son but est de fournir un
ensemble de données servant de référence unique, utilisée pour la prise de décisions
dans l'entreprise par le biais de statistiques et de rapports réalisés via des outils de
4
reporting. D'un point de vue technique, il sert surtout à 'délester' les bases de
données opérationnelles des requêtes pouvant nuire à leurs performances.
[Wikipedia]
4
Les techniques de data mining fait appel a plusieurs autres disciplines scientifiques.
Source de la figure:
Publicité
http://cybertim.timone.univ-mrs.fr/enseignement/doc-
enseignement/informatique/introdatawarehouse/docpeda_fichier
5
6
Le processus global de fouille de données comprend trois étapes principales.
Phase 1 : préparation et organisation des données convenablement pour l’étape
suivante
- faut tout d’abord se familiariser avec le domaine de l’application, pour mieux
comprendre les semantics des données …
- nettoyage des données: supprimer/corriger les valeurs invalides ou inconsistantes
(a cause d’erreurs de saisi par exemple), remplir certaines valeurs manquantes, …
- on exige un format bien structuré, tel qu’une base de données SQL ou des fichiers
xml, pour que le traitement de « fouille » dans l’étape suivante soit facile/simple et
rapide/efficace …
Phase 2:
- fait appel a des techniques de statistiques et de machine learning (apprentissage
artificiel)
- étape au cœur du processus DM
- qualité des résultats: est ce que le modèle est fiable, compréhensible pour
l’utilisateur, bonne performance vis-a-avis l’application, …
7
Phase 3: il y a deux manières principales d'utiliser le modèle obtenu :
1) Voir les résultats du modèle sur les données
• objectif: analyse, pour mieux comprendre le système d’où viennent les
données
2) Appliquer le modèle pour prédire sur de nouvelles données
• objectif: afin de recommander des actions
exemple : accorder un crédit, analyse de risque, détection de fraude...
7
Source de la figure:
Publicité
http://www.lsis.org/espinasseb/Supports/DWDM-2009/6-IntroFouille-2009-4p.pdf
8
Source de la figure:
http://cybertim.timone.univ-mrs.fr/enseignement/doc-
enseignement/informatique/introdatawarehouse/docpeda_fichier
9
10
Dans ce cours nous allons nous concentrer essentiellement sur l’ étape No 2 du
processus de data mining:
-on va étudier quelques méthodes typique d’extraction de connaissances a partir de
données déjà prétraités et bien préparées.
-on finira avec l’étude de quelques applications réelles du DM
Mais tout d’abord et avant tout, nous allons discuter en détail le input/output
prévus/attendus pour cette étape:
- Input: quels types de données peut-on utiliser? Qu’est ce qu’une donnée?
- Output: quels types de connaissances peut on extraire?
We begin by looking at the interface of the mining process, that is :
1)
2) The different kinds of output that might be produced
the different forms the input might take, and
11
- On parle ici des données non pas brutes, mais des données prétraitées, préparées
pour l’extraction de connaissances …
- On se rappelle :
- que les données brutes sont typiquement stockées dans des bases de données
d’entreprises, le Web, des réservoirs de données publiques comme celui du Library of
Congress (Librairie Nationale du gouvernement Américain) ou ceux dans de grandes
universités pour la recherche scientifiques, etc.
- et que les données brutes sont prétraites dans la première étape du processus
global de data mining, pour obtenir des données dans un format bien structurée et
Publicité
homogène.
- Evidemment la représentation de l’ensemble X dépend du moyen de stockage et les
types des attributs.
- Comme vous le saviez du cours Algèbre Linéaire, une matrice (un ensemble de
vecteurs) a une interprétation géométrique utile, ou les exemplaires sont des points
et les attributs sont des dimensions dans l’espace Euclidien.
12
- Selon la representation (codage) de X, on appelle une exemplaire une instance, un
vecteur, ou un point
12
Les caractéristiques des données (valeurs d’attributs)
13
Pas de notion d’ordre entre les valeurs
14
15
16
17
Les types de connaissances extraites correspondent a différentes taches d’extraction
de connaissances.
18
19
20
21
22
23