Année Universitaire 2021-2022
Mastère "Business Analytics & Data Science" (BADS)
Atelier
Fouille de données
ZOUAOUI Slim
Définition
Introduction
Le Fouille de données est un nouveau champ situé au croisement
de la statistique et des technologies de l’information (bases de
données, intelligence artificielle, apprentissage etc.) dont le but
est de découvrir des structures dans de vastes ensembles de
données. La métaphore du Fouille de données signifie qu’il y a
des trésors ou pépites cachés sous des montagnes de données que
l’on peut découvrir avec des outils spécialisés.
2
Définition
Introduction
C’est l’ensemble des algorithmes, méthodes et technologies
inspirés de plusieurs autres disciplines, pouvant servir à
remplacer ou à aider l’expert humain ou le décideur dans un
domaine spécifique dans le cadre de prise de décision, et ce
en fouillant dans des bases de données décisionnelles des
corrélations, des associations, des comportements homogènes,
des formules de lien entre indicateurs, des spécification par
rapport à une thématique bien déterminée, etc.
33
L’organisation du flux d’informations
4
Domaines d’application
Détection d'usage frauduleux de cartes bancaires.
Gestion du risque lié à l'attribution de prêts par le
scoring.
Découverte de relations cachées entre les indicateurs
financiers.
Détection de règles de comportement boursier par
l'analyses des données du marché.
Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.
Publicité
Aide à la décision de paiement.
Identification des clients susceptibles de partir à la
concurrence.
5
Domaines d’application
Détection d’associations des comportements
d’achats.
Découverte des caractéristiques de clients.
Identification des clients susceptibles de partir à la
concurrence..
Classifications des clients .
Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.
Aide à la décision de paiement.
6
Domaines d’application
Détection d’associations des demandes de
remboursements
Identification de clients potentiels de nouvelles
polices d'assurances.
Détection d'association de comportements
pour la découverte de clients à risque.
Détection de comportement frauduleux.
Prendre un client à un concurrent.
Faire monter en gamme un client que l’on
détient déjà.
7
Domaines d’application
Diagnostique assisté par ordinateur (CAD) par
l'apprentissage de systèmes experts
Explication ou prédiction de la réponse d'un patient
à un traitement
Mettre en évidence des facteurs de risque ou de
rémission dans certaines maladies.
Choisir le traitement le plus approprié pronostic des
infarctus et des cancers (décès, survie)
Prédire le temps de rétablissement après une opération, en fonction des données concernant le patient (âge, poids, taille, fumeur, métier, antécédents médicaux, etc.) et le praticien (nb d’opérations pratiquées, nb d’années d’expérience, etc.)
8
Publicité
Méthodologie de travail
1- KDD / ECD : • Knowledge Discovery in Databases / Extraction de Connaissances à partir de Données • Un processus pour la fouille de données qui a bien répondu aux besoins d’entreprises, et qui est devenu rapidement très populaire. • Des motifs valides, utiles et exploitables à partir des grandes quantités de données
2- SEMMA : • Sample, Explore, Modify, Model, Assess • L’Institut SAS définit le data mining comme le processus utilisé pour révéler des informations précieuses et des relations complexes qui existent dans de grandes quantités de données (BIG DATA, OPEN DATA). • SAS divise la fouille de données en cinq étapes représentées par l’acronyme SEMMA
3- CRISP-DM : • CRoss-Industry Standard Process for Data Mining • Une méthode mise à l'épreuve sur le terrain permettant d'orienter les travaux de Data mining . • Processus de data mining qui décrit une approche communément utilisée par les experts pour résoudre les problèmes qui se posent à eux.
9
Méthodologie de travail
10
Méthodologie de travail
11
Méthodologie de travail
12
I. Connaissance du métier
Connaitre les spécificités du métier
Déterminer les objectifs d'affaires
Résoudre un problème spécifique
Evaluer la situation actuelle
Convertir en un problème de data Science
Exemle :
Quels types de clients sont intéressés par chacun de nos produits?
Quels sont les profils typiques de nos clients?
Élaborer un plan de projet
13
II. Connaissance des données
Collecte de données initiales
Sélection des données d’étude (Interne et Externe)
Identifier les données pertinentes pour la description du problème
Vérification de la qualité des données
Description et audit des données
Exploration des données
14
III. Préparation des données
Prétraitement et le nettoyage des données
Remplissez les valeurs manquantes
Identifier les données extrêmes
Identifier, supprimer ou remplacer les valeurs aberrantes
Manipulation des données
Résoudre la redondance causée par l'intégration des données Corriger les données incohérentes
Publicité
Transformer les données
Convertir des mesures différentes de données dans un échelle Standardiser les données Recoder les données
15
IV. Analyse et Modélisation des données
Choisir la/les méthodes adéquates pour une analyse statistique d’un projet Data Science
une variable à la fois : statistique à une dimension, (analyse unidimensionnelle)
deux variables à la fois : statistique à deux dimensions, (analyse bidimensionnelle)
plus de deux variables à la fois : statistique multidimensionnelle (analyse multidimensionnelle - Data Mining) .
16
V. Evaluation et déploiement
Evaluation et tests des résultats
Evaluation de l’utilité et la fiabilité des résultats
Est-ce que les résultats d’analyses répond aux objectifs métier?
Tous les objectifs importants doivent être atteints
Quelles sont les perspectives suite à la réalisation de ce projet Data
Science
17
Méthodologie de travail : exemple
18
19
20
21
22
Deux familles de techniques
23
Deux familles de techniques
Fouille de données
Machine Learning
24
Types d’applications
25
Sommaire
Analyse en composantes principales
Analyse factorielle de correspondance
Méthodes de classification non supervisées
26