Management et Gestion de Projet

Page 1 sur 26Lecteur de document UniversityLib

Management et Gestion de Projet

Project Management and Team Leadership · course

Voir tous les documents en gestion et économie

Année Universitaire 2021-2022

Mastère "Business Analytics & Data Science" (BADS)

Atelier

Fouille de données

ZOUAOUI Slim

Définition

Introduction

Le Fouille de données est un nouveau champ situé au croisement

de la statistique et des technologies de l’information (bases de

données, intelligence artificielle, apprentissage etc.) dont le but

est de découvrir des structures dans de vastes ensembles de

données. La métaphore du Fouille de données signifie qu’il y a

des trésors ou pépites cachés sous des montagnes de données que

l’on peut découvrir avec des outils spécialisés.

2

Définition

Introduction

C’est l’ensemble des algorithmes, méthodes et technologies

inspirés de plusieurs autres disciplines, pouvant servir à

remplacer ou à aider l’expert humain ou le décideur dans un

domaine spécifique dans le cadre de prise de décision, et ce

en fouillant dans des bases de données décisionnelles des

corrélations, des associations, des comportements homogènes,

des formules de lien entre indicateurs, des spécification par

rapport à une thématique bien déterminée, etc.

33

L’organisation du flux d’informations

4

Domaines d’application

Détection d'usage frauduleux de cartes bancaires.

Gestion du risque lié à l'attribution de prêts par le

scoring.

Découverte de relations cachées entre les indicateurs

financiers.

Détection de règles de comportement boursier par

l'analyses des données du marché.

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

Publicité

Aide à la décision de paiement.

Identification des clients susceptibles de partir à la

concurrence.

5

Domaines d’application

Détection d’associations des comportements

d’achats.

Découverte des caractéristiques de clients.

Identification des clients susceptibles de partir à la

concurrence..

Classifications des clients .

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

Aide à la décision de paiement.

6

Domaines d’application

Détection d’associations des demandes de

remboursements

Identification de clients potentiels de nouvelles

polices d'assurances.

Détection d'association de comportements

pour la découverte de clients à risque.

Détection de comportement frauduleux.

Prendre un client à un concurrent.

Faire monter en gamme un client que l’on

détient déjà.

7

Domaines d’application

Diagnostique assisté par ordinateur (CAD) par

l'apprentissage de systèmes experts

Explication ou prédiction de la réponse d'un patient

à un traitement

Mettre en évidence des facteurs de risque ou de

rémission dans certaines maladies.

Choisir le traitement le plus approprié pronostic des

infarctus et des cancers (décès, survie)

Prédire le temps de rétablissement après une opération, en fonction des données concernant le patient (âge, poids, taille, fumeur, métier, antécédents médicaux, etc.) et le praticien (nb d’opérations pratiquées, nb d’années d’expérience, etc.)

8

Publicité

Méthodologie de travail

1- KDD / ECD : • Knowledge Discovery in Databases / Extraction de Connaissances à partir de Données • Un processus pour la fouille de données qui a bien répondu aux besoins d’entreprises, et qui est devenu rapidement très populaire. • Des motifs valides, utiles et exploitables à partir des grandes quantités de données

2- SEMMA : • Sample, Explore, Modify, Model, Assess • L’Institut SAS définit le data mining comme le processus utilisé pour révéler des informations précieuses et des relations complexes qui existent dans de grandes quantités de données (BIG DATA, OPEN DATA). • SAS divise la fouille de données en cinq étapes représentées par l’acronyme SEMMA

3- CRISP-DM : • CRoss-Industry Standard Process for Data Mining • Une méthode mise à l'épreuve sur le terrain permettant d'orienter les travaux de Data mining . • Processus de data mining qui décrit une approche communément utilisée par les experts pour résoudre les problèmes qui se posent à eux.

9

Méthodologie de travail

10

Méthodologie de travail

11

Méthodologie de travail

12

I. Connaissance du métier

 Connaitre les spécificités du métier

 Déterminer les objectifs d'affaires

 Résoudre un problème spécifique

 Evaluer la situation actuelle

 Convertir en un problème de data Science

Exemle :

Quels types de clients sont intéressés par chacun de nos produits?

Quels sont les profils typiques de nos clients?

 Élaborer un plan de projet

13

II. Connaissance des données

 Collecte de données initiales

 Sélection des données d’étude (Interne et Externe)

 Identifier les données pertinentes pour la description du problème

 Vérification de la qualité des données

 Description et audit des données

 Exploration des données

14

III. Préparation des données

 Prétraitement et le nettoyage des données

 Remplissez les valeurs manquantes

 Identifier les données extrêmes

 Identifier, supprimer ou remplacer les valeurs aberrantes

 Manipulation des données

 Résoudre la redondance causée par l'intégration des données  Corriger les données incohérentes

Publicité

 Transformer les données

 Convertir des mesures différentes de données dans un échelle  Standardiser les données  Recoder les données

15

IV. Analyse et Modélisation des données

Choisir la/les méthodes adéquates pour une analyse statistique d’un projet Data Science

 une variable à la fois : statistique à une dimension, (analyse unidimensionnelle)

 deux variables à la fois : statistique à deux dimensions, (analyse bidimensionnelle)

 plus de deux variables à la fois : statistique multidimensionnelle (analyse multidimensionnelle - Data Mining) .

16

V. Evaluation et déploiement

 Evaluation et tests des résultats

 Evaluation de l’utilité et la fiabilité des résultats

 Est-ce que les résultats d’analyses répond aux objectifs métier?

 Tous les objectifs importants doivent être atteints

 Quelles sont les perspectives suite à la réalisation de ce projet Data

Science

17

Méthodologie de travail : exemple

18

19

20

21

22

Deux familles de techniques

23

Deux familles de techniques

Fouille de données

Machine Learning

24

Types d’applications

25

Sommaire

Analyse en composantes principales

Analyse factorielle de correspondance

Méthodes de classification non supervisées

26