Introduction to Data Mining

1/25
100%

04 Tile

Introduction au Data Mining

Année Universitaire 2019-2020 S. Zouaoui & W. Barhoumi

Notes:

04 Tile

Introduction Définition

Picture 2

Datamining est un nouveau champ situé au croisement de la statistique et des technologies de l’information (bases de données, intelligence artificielle, apprentissage…). Le but est de découvrir des structures dans de vastes ensembles de données. La métaphore du Datamining signifie qu’il y a des trésors ou pépites cachés sous des montagnes de données que l’on peut découvrir avec des outils spécialisés.

Notes:

04 Tile

Introduction Définition

Picture 2

C’est l’ensemble des algorithmes, méthodes et technologies inspirés de plusieurs autres disciplines, pouvant servir à remplacer ou à aider l’expert humain ou le décideur dans un domaine spécifique dans le cadre de prise de décision, et ce en fouillant dans des bases de données décisionnelles des corrélations, des associations, des comportements homogènes, des formules de lien entre indicateurs, des spécification par rapport à une thématique bien déterminée….

Notes:

04 Tile

Introduction

Picture 2 Aspect pluridisciplinaire

Notes:

04 Tile

L’organisation du flux d’informations

Picture 2

Notes:

04 Tile

Publicité

Domaines d’application Détection d’usage frauduleux de cartes bancaires.

Gestion du risque lié à l’attribution de prêts par le scoring.

Découverte de relations cachées entre les indicateurs financiers.

Détection de règles de comportement boursier par l’analyses des données du marché.

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

 Aide à la décision de paiement.

 Identification des clients susceptibles de partir à la concurrence.

Picture 17

Notes:

04 Tile

Domaines d’application Détection d’associations des comportements d’achats.

Découverte des caractéristiques de clients.

 Identification des clients susceptibles de partir à la concurrence.

Classifications des clients.

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

 Aide à la décision de paiement.

Picture 2

Notes:

04 Tile

Domaines d’application

 Détection d’associations des demandes de remboursements,

Identification de clients potentiels de nouvelles polices d’assurances.

 Détection d’association de comportements pour la découverte de clients à risque.

 Détection de comportement frauduleux.

 Faire monter en gamme un client que l’on détient déjà.

Picture 2

Notes:

04 Tile

Domaines d’application

 Diagnostic assisté par ordinateur (CAD) par l’apprentissage de systèmes experts

 Explication ou prédiction de la réponse d’un patient à un traitement.

 Mettre en évidence des facteurs de risque ou de rémission dans certaines maladies.

 Choisir le traitement le plus approprié pronostic des infarctus et des cancers (décès, survie).

 Prédire le temps de rétablissement après une opération, en fonction des données concernant le patient (âge, poids, taille, fumeur, métier, antécédents médicaux…) et le praticien (nombre d’opérations pratiquées, nb d’années d’expérience….).

Picture 2

Notes:

04 Tile

Préparation des données

1- Données existantes ou à constituer : • Fichiers : information contenue dans un ou plusieurs fichiers indépendants. • BD relationnelles : information contenue dans plusieurs fichiers unis par une ‘clé’. • Base de données Transactionnelles.

2- Nettoyage : • Doublons, erreurs de saisie, valeurs aberrantes. • Données manquantes, informations manquantes (ignorer l’observation, la remplacer par la valeur moyenne, valeur moyenne sur la classe, régression…).

Publicité

3- Data Warehouses : Entrepôt de données collectées de sources multiples souvent hétérogènes. • Les données sont enregistrées, nettoyées, transformées et intégrées. • Habituellement modélisé par une structure de donnée multidimensionnelles (cube). Les cubes sont bien adaptés aux requêtes rapides et à l’analyse des données : On-Line Analytical Processing (OLAP).

Notes:

04 Tile

Méthodologies de travail

Méthodologie 1 : KDD / ECD Knowledge Discovery in Databases / Extraction de Connaissances à partir de Données • Un processus pour la fouille de données qui a bien répondu aux besoins d’entreprises, et qui est devenu rapidement très populaire. • Des motifs valides, utiles et exploitables à partir des grandes quantités de données.

Méthodologie 2 : SEMMA Sample, Explore, Modify, Model, Assess • L’Institut SAS définit le data mining comme le processus utilisé pour révéler des informations précieuses et des relations complexes qui existent dans de grandes quantités de données (BIG DATA, OPEN DATA). • SAS divise la fouille de données en cinq étapes représentées par l’acronyme SEMMA.

Méthodologie 3 : CRISP-DM CRoss-Industry Standard Process for Data Mining • Une méthode mise à l’épreuve sur le terrain permettant d'orienter les travaux de Data mining. • Processus de data mining qui décrit une approche communément utilisée par les experts pour résoudre les problèmes qui se posent à eux.

Notes:

04 Tile

Méthodologies de travail

Picture 2

Notes:

04 Tile

Méthodologies de travail

Picture 2

Notes:

04 Tile

Méthodologies de travail

Picture 2

Picture 3

Notes:

04 Tile

Méthodologies de travail : Exemple détaillé

Publicité

Picture 4

Picture 5

Picture 6

Notes:

Picture 2

Picture 3

Picture 2

Picture 2

Picture 4

Picture 5

Picture 6

Picture 7

Picture 8

Picture 2

Picture 3

04 Tile

Deux familles de techniques

Picture 2

Notes:

04 Tile

Deux familles de techniques

Picture 2

Notes:

Publicité

04 Tile

Types d’applications

Picture 2

Notes:

04 Tile

Machine Learning : Types d’apprentissage

Image 1 Le Machine Learning (apprentissage automatique) est une technologie essentielle de l’intelligence artificielle.

Elle permet aux ordinateurs d’apprendre de façon autonome.

Notes:

04 Tile

Méthodes Prédictives = Apprentissage Supervisé Idée de l’apprentissage supervisé : Apprendre à prendre des décisions, effectuer une tâche, à partir d'exemples (Expert).

Picture 5

Picture 7

Picture 9 chien chat chien ou chat ?

Le deep learning fait référence à une classe d'algorithmes d'apprentissage supervisé : Ils sont basés sur l'utilisation d'un type spécifique de classificateurs : les réseaux de neurones

Notes:

04 Tile

Méthodes Descriptives = Apprentissage Non Supervisé Idée de l’apprentissage non supervisé : l’apprentissage par la machine se fait de façon totalement autonome (Pas d’Expert).

Des données sont communiquées à la machine sans lui fournir les exemples de résultats attendus en sortie.

L’apprentissage par renforcement consiste à laisser l’algorithme apprendre de ses propres erreurs afin d’apprendre à prendre les bonnes décisions : - Si il se trompe, on ‘pénalise’, - Si il prend la bonne décision, on ‘récompense’.

Notes:

Page 1 sur 25Lecteur de document UniversityLib

Introduction to Data Mining

Data Science and Machine Learning · lab

Voir tous les documents en intelligence artificielle et données

04 Tile

Introduction au Data Mining

Année Universitaire 2019-2020 S. Zouaoui & W. Barhoumi

Notes:

04 Tile

Introduction Définition

Picture 2

Datamining est un nouveau champ situé au croisement de la statistique et des technologies de l’information (bases de données, intelligence artificielle, apprentissage…). Le but est de découvrir des structures dans de vastes ensembles de données. La métaphore du Datamining signifie qu’il y a des trésors ou pépites cachés sous des montagnes de données que l’on peut découvrir avec des outils spécialisés.

Notes:

04 Tile

Introduction Définition

Picture 2

C’est l’ensemble des algorithmes, méthodes et technologies inspirés de plusieurs autres disciplines, pouvant servir à remplacer ou à aider l’expert humain ou le décideur dans un domaine spécifique dans le cadre de prise de décision, et ce en fouillant dans des bases de données décisionnelles des corrélations, des associations, des comportements homogènes, des formules de lien entre indicateurs, des spécification par rapport à une thématique bien déterminée….

Notes:

04 Tile

Introduction

Picture 2 Aspect pluridisciplinaire

Notes:

04 Tile

L’organisation du flux d’informations

Picture 2

Notes:

04 Tile

Publicité

Domaines d’application Détection d’usage frauduleux de cartes bancaires.

Gestion du risque lié à l’attribution de prêts par le scoring.

Découverte de relations cachées entre les indicateurs financiers.

Détection de règles de comportement boursier par l’analyses des données du marché.

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

 Aide à la décision de paiement.

 Identification des clients susceptibles de partir à la concurrence.

Picture 17

Notes:

04 Tile

Domaines d’application Détection d’associations des comportements d’achats.

Découverte des caractéristiques de clients.

 Identification des clients susceptibles de partir à la concurrence.

Classifications des clients.

Utilisation du score de risque pour proposer le montant de crédit le plus adapté à chaque client.

 Aide à la décision de paiement.

Picture 2

Notes:

04 Tile

Domaines d’application

 Détection d’associations des demandes de remboursements,

Identification de clients potentiels de nouvelles polices d’assurances.

 Détection d’association de comportements pour la découverte de clients à risque.

 Détection de comportement frauduleux.

 Faire monter en gamme un client que l’on détient déjà.

Picture 2

Notes:

04 Tile

Domaines d’application

 Diagnostic assisté par ordinateur (CAD) par l’apprentissage de systèmes experts

 Explication ou prédiction de la réponse d’un patient à un traitement.

 Mettre en évidence des facteurs de risque ou de rémission dans certaines maladies.

 Choisir le traitement le plus approprié pronostic des infarctus et des cancers (décès, survie).

 Prédire le temps de rétablissement après une opération, en fonction des données concernant le patient (âge, poids, taille, fumeur, métier, antécédents médicaux…) et le praticien (nombre d’opérations pratiquées, nb d’années d’expérience….).

Picture 2

Notes:

04 Tile

Préparation des données

1- Données existantes ou à constituer : • Fichiers : information contenue dans un ou plusieurs fichiers indépendants. • BD relationnelles : information contenue dans plusieurs fichiers unis par une ‘clé’. • Base de données Transactionnelles.

2- Nettoyage : • Doublons, erreurs de saisie, valeurs aberrantes. • Données manquantes, informations manquantes (ignorer l’observation, la remplacer par la valeur moyenne, valeur moyenne sur la classe, régression…).

Publicité

3- Data Warehouses : Entrepôt de données collectées de sources multiples souvent hétérogènes. • Les données sont enregistrées, nettoyées, transformées et intégrées. • Habituellement modélisé par une structure de donnée multidimensionnelles (cube). Les cubes sont bien adaptés aux requêtes rapides et à l’analyse des données : On-Line Analytical Processing (OLAP).

Notes:

04 Tile

Méthodologies de travail

Méthodologie 1 : KDD / ECD Knowledge Discovery in Databases / Extraction de Connaissances à partir de Données • Un processus pour la fouille de données qui a bien répondu aux besoins d’entreprises, et qui est devenu rapidement très populaire. • Des motifs valides, utiles et exploitables à partir des grandes quantités de données.

Méthodologie 2 : SEMMA Sample, Explore, Modify, Model, Assess • L’Institut SAS définit le data mining comme le processus utilisé pour révéler des informations précieuses et des relations complexes qui existent dans de grandes quantités de données (BIG DATA, OPEN DATA). • SAS divise la fouille de données en cinq étapes représentées par l’acronyme SEMMA.

Méthodologie 3 : CRISP-DM CRoss-Industry Standard Process for Data Mining • Une méthode mise à l’épreuve sur le terrain permettant d'orienter les travaux de Data mining. • Processus de data mining qui décrit une approche communément utilisée par les experts pour résoudre les problèmes qui se posent à eux.

Notes:

04 Tile

Méthodologies de travail

Picture 2

Notes:

04 Tile

Méthodologies de travail

Picture 2

Notes:

04 Tile

Méthodologies de travail

Picture 2

Picture 3

Notes:

04 Tile

Méthodologies de travail : Exemple détaillé

Publicité

Picture 4

Picture 5

Picture 6

Notes:

Picture 2

Picture 3

Picture 2

Picture 2

Picture 4

Picture 5

Picture 6

Picture 7

Picture 8

Picture 2

Picture 3

04 Tile

Deux familles de techniques

Picture 2

Notes:

04 Tile

Deux familles de techniques

Picture 2

Notes:

Publicité

04 Tile

Types d’applications

Picture 2

Notes:

04 Tile

Machine Learning : Types d’apprentissage

Image 1 Le Machine Learning (apprentissage automatique) est une technologie essentielle de l’intelligence artificielle.

Elle permet aux ordinateurs d’apprendre de façon autonome.

Notes:

04 Tile

Méthodes Prédictives = Apprentissage Supervisé Idée de l’apprentissage supervisé : Apprendre à prendre des décisions, effectuer une tâche, à partir d'exemples (Expert).

Picture 5

Picture 7

Picture 9 chien chat chien ou chat ?

Le deep learning fait référence à une classe d'algorithmes d'apprentissage supervisé : Ils sont basés sur l'utilisation d'un type spécifique de classificateurs : les réseaux de neurones

Notes:

04 Tile

Méthodes Descriptives = Apprentissage Non Supervisé Idée de l’apprentissage non supervisé : l’apprentissage par la machine se fait de façon totalement autonome (Pas d’Expert).

Des données sont communiquées à la machine sans lui fournir les exemples de résultats attendus en sortie.

L’apprentissage par renforcement consiste à laisser l’algorithme apprendre de ses propres erreurs afin d’apprendre à prendre les bonnes décisions : - Si il se trompe, on ‘pénalise’, - Si il prend la bonne décision, on ‘récompense’.

Notes: