Business Analytics & Data Science - Data Mining Workshop

Page 1 sur 26Lecteur de document UniversityLib

Business Analytics & Data Science - Data Mining Workshop

Data Mining, Business Analytics, Decision Making · notes

Voir tous les documents en intelligence artificielle et données

Ann e Universitaire 2021-2022

Mast re

"Business Analytics & Data Science" (BADS)

Atelier

Fouille de donn es

ZOUAOUI Slim

D finition

Introduction

Le Fouille de donn es est un nouveau champ situ au croisement

de la statistique et des technologies de linformation (bases de

donn es, intelligence artificielle, apprentissage etc.) dont le but

est de d couvrir des structures dans de vastes ensembles de

donn es. La m taphore du Fouille de donn es signifie quil y a

des tr sors ou p pites cach s sous des montagnes de donn es que

lon peut d couvrir avec des outils sp cialis s.

2

D finition

Introduction

Cest lensemble des algorithmes, m thodes et technologies

inspir s de plusieurs autres disciplines, pouvant servir

remplacer ou aider lexpert humain ou le d cideur dans un

domaine sp cifique dans le cadre de prise de d cision, et ce

en fouillant dans des bases de donn es d cisionnelles des

corr lations, des associations, des comportements homog nes,

des formules de lien entre indicateurs, des sp cification par

rapport une th matique bien d termin e, etc.

33

Lorganisation du flux dinformations

4

Domaines dapplication

D tection d'usage frauduleux de cartes bancaires.

Gestion du risque li l'attribution de pr ts par le

scoring.

D couverte de relations cach es entre les indicateurs

financiers.

D tection de r gles de comportement boursier par

Publicité

l'analyses des donn es du march .

Utilisation du score de risque pour proposer le

montant de cr dit le plus adapt chaque client.

Aide la d cision de paiement.

Identification des clients susceptibles de partir la

concurrence.

5

Domaines dapplication

D tection dassociations des comportements

dachats.

D couverte des caract ristiques de clients.

Identification des clients susceptibles de partir la

concurrence..

Classifications des clients .

Utilisation du score de risque pour proposer le

montant de cr dit le plus adapt chaque client.

Aide la d cision de paiement.

6

Domaines dapplication

D tection dassociations des demandes de

remboursements

Identification de clients potentiels de nouvelles

polices d'assurances.

D tection d'association de comportements

pour la d couverte de clients risque.

D tection de comportement frauduleux.

Prendre un client un concurrent.

Faire monter en gamme un client que lon

d tient d j .

7

Domaines dapplication

Diagnostique assist par ordinateur (CAD) par

l'apprentissage de syst mes experts

Explication ou pr diction de la r ponse d'un patient

un traitement

Mettre en vidence des facteurs de risque ou de

Publicité

r mission dans certaines maladies.

Choisir le traitement le plus appropri pronostic des

infarctus et des cancers (d c s, survie)

Pr dire le temps de r tablissement apr s une

op ration, en fonction des donn es concernant le

patient ( ge, poids, taille, fumeur, m tier, ant c dents

m dicaux, etc.) et le praticien (nb dop rations

pratiqu es, nb dann es dexp rience, etc.)

8

M thodologie de travail

1- KDD / ECD :

" Knowledge Discovery in Databases / Extraction de Connaissances partir de Donn es

" Un processus pour la fouille de donn es qui a bien r pondu aux besoins dentreprises, et qui

est devenu rapidement tr s populaire.

" Des motifs valides, utiles et exploitables partir des grandes quantit s de donn es

2- SEMMA :

" Sample, Explore, Modify, Model, Assess

" LInstitut SAS d finit le data mining comme le processus utilis pour r v ler des

informations pr cieuses et des relations complexes qui existent dans de grandes quantit s de

donn es (BIG DATA, OPEN DATA).

" SAS divise la fouille de donn es en cinq tapes repr sent es par lacronyme SEMMA

3- CRISP-DM :

" CRoss-Industry Standard Process for Data Mining

" Une m thode mise l' preuve sur le terrain permettant d'orienter les travaux de Data mining .

" Processus de data mining qui d crit une approche commun ment utilis e par les experts pour

r soudre les probl mes qui se posent eux.

9

M thodologie de travail

10

M thodologie de travail

11

M thodologie de travail

12

I. Connaissance du m tier

Connaitre les sp cificit s du m tier

D terminer les objectifs d'affaires

Publicité

R soudre un probl me sp cifique

Evaluer la situation actuelle

Convertir en un probl me de data Science

Exemle :

Quels types de clients sont int ress s par chacun de nos produits?

Quels sont les profils typiques de nos clients?

laborer un plan de projet

13

II. Connaissance des donn es

Collecte de donn es initiales

S lection des donn es d tude (Interne et Externe)

Identifier les donn es pertinentes pour la description du probl me

V rification de la qualit des donn es

Description et audit des donn es

Exploration des donn es

14

III. Pr paration des donn es

Pr traitement et le nettoyage des donn es

Remplissez les valeurs manquantes

Identifier les donn es extr mes

Identifier, supprimer ou remplacer les valeurs aberrantes

Manipulation des donn es

R soudre la redondance caus e par l'int gration des donn es

Corriger les donn es incoh rentes

Transformer les donn es

Convertir des mesures diff rentes de donn es dans un chelle

Standardiser les donn es

Recoder les donn es

15

IV. Analyse et Mod lisation

des donn es

Choisir la/les m thodes ad quates pour

une analyse statistique dun projet Data Science

n une variable la fois : statistique une dimension,

(analyse unidimensionnelle)

n deux variables la fois : statistique deux dimensions,

Publicité

(analyse bidimensionnelle)

n plus de deux variables la fois : statistique multidimensionnelle

(analyse multidimensionnelle - Data Mining) .

16

V. Evaluation et d ploiement

Evaluation et tests des r sultats

Evaluation de lutilit et la fiabilit des r sultats

Est-ce que les r sultats danalyses r pond aux objectifs m tier?

Tous les objectifs importants doivent tre atteints

Quelles sont les perspectives suite la r alisation de ce projet Data

Science

17

M thodologie de travail : exemple

18

19

20

21

22

Deux familles de techniques

23

Deux familles de techniques

Fouille de donn es

Machine Learning

24

Types dapplications

25

Sommaire

Analyse en composantes principales

Analyse factorielle de correspondance

M thodes de classification non supervis es

26