Ministère de l’Enseignement Supérieur , de la Recherche Scientifique et
Data Mining
de la Technologie
Université virtuelle de Tunis
Chapitre I :
DM :
Démarche et méthodes
Elaboré par : Dr . ESSADIK Emna
2éme Année Master Professionnel en Optimisation
et Modernisation de l'Entreprise
1 MOME 2021-2022
Data Mining
Etapes d’une étude DM
a) Définition des objectifs
( Choix du sujet, Définir la population cible, unité(s) statistiques à étudier, citére(s) d’étude,
spécification de résultats attendus).
b) Inventaire de données existantes
(Recensement de données utiles et accessibles).
c) Collecte de données (construction de la base de données)
(construction de données sélectionnées et jugées comme utiles à l’étude dans un tableau et la
saisie sur Excel).
d) Exploration et préparation de données
e) Segmentation de la population
(Classer l’échantillon observé en groupes homogènes selon les critères de l’étude)
Partition de modèles = clustering = classification automatique
f) Elaboration et validation des modèles prédictifs.
g) Synthèse de modèles prédictifs.
h) Itération des étapes prédictives.
Exploration et préparation de données
Dans ce paragraphe, on va présenter les différentes méthodes liées à cette étape cruciale de DM.
Certes, on a déjà montré que les données peuvent être quantitatives ( discrètes , continues),
qualitatives ( nominales, ordinales ) ; parfois textuelles « Text Mining ».
Certaines données nécessitent la transformation avant le traitement.
Conversion de données
Type de départ
Continu
Type d’arrivée
Discret
Opération
Principe
Discrétisation Découpage de l’ensemble des valeurs
Discret ou qualitatif
Continu
ACM
en tranches
Elle fournit des facteurs continus à
partir des données de départ
Examen de la distribution des variables
Il s’agit de l’étape préliminaire de DataMining . On commence par l’analyse univariée des
données ⇒
Détecter d’éventuelles anomalies dans
la distribution (valeurs extrêmes ou
manquantes).
Avoir une idée sur les grandeurs utiles dans la suite de l’analyse.
2 MOME 2021-2022
Voir comment discrétiser les variables continues .
Analyse univariée
Data Mining
Les variables qualitatives ou quantitatives discrètes ⇒ Tri à plat (les fréquences ,
indicateurs de position …).
Les Variables continues ⇒ Boite à moustaches ( Mode, valeur minimale, médiane
,Q1 : premier quartile et Q3 : troisième quartile ).
Q1 / F(Q1) = 0.25 et F(Q3) = 0.75 , médiane / F(Me) =0.5
On peut aussi calculer les déciles (d1 et d9).d1/ F(d1) =0.1 et d9/ F(d9) = 0.9
F(x) : fonction de répartition de x ou des fréquences cumulées.
Box plot / Boite à moustaches
NB : Il faut s’assurer de l’homogénéité des données et qu’ils ne contiennent pas de valeur
erronée ou absence d’information saisie.
Puis, on passe à l’analyse statistique bivariée des données ⇒
Détecter l’incohérence entre les variables.
Trouver les liaisons entre els variables cibles et les variables explicatives , leurs
interactions de façon à éliminer les variables sans aucune influence sur la variable cible.
Détecter la liaison entre les variables explicatives entre elles, qui sont à éviter dans
certaines techniques.
Détection de valeurs manquantes ou rares
Cette étape s’applique à tout modèle.
Les valeurs rares : Elles déséquilibrent les analyses (surtout factorielles). Elles se voient
accorder une importance plus grande qu’elles n’ont. ⇒
Supprimer les observations concernées
Remplacer la valeur rare par une valeur plus fréquente quand cette substitution
a un sens dans le contexte étudié.
3 MOME 2021-2022
Data Mining
Les valeurs manquantes : Les méthodes statistiques ne peuvent par traiter une base de données
manquante ( valeurs vides / manquantes) . Ces valeurs manquantes sont dues aux variables
déclaratives , lorsque la saisie est facultative et n’a pas été effectuée par les enquêteurs .
Solutions :
1. Ne pas utiliser la variable concernée si sa contribution à l’analyse du problème n’est pas
essentielle ou la remplacer par une variable proche (proxy) qui est sans valeur
manquante.
2. Remplacer la valeur manquante par une valeur déterminée (statistiquement) ou selon
les connaissances de données disponibles ou par une source externe.
3. Traitement de la valeur manquante comme une valeur à part entière, contenant une
certaine information.
Les deux dernières solutions sont à éviter pour toute variable ayant un taux de valeurs
manquantes supérieur à 15 ou 20 %.
La solution N°2 correspond à l’imputation ⇒ utiliser la valeur la plus fréquente ( si on a une
variable qualitative ) et la moyenne arithmétique ou la médiane sinon .
Remarque :
Cette méthode est dangereuse car , les individus à valeurs manquantes sont généralement des
individus atypiques ( présentent un risque supérieur à la moyenne et dissimule les
informations) que les individus moyens .
On distingue deux types d’imputation :
Simple : Remplacer chaque valeur manquante par une valeur présumée.
Multiple : Remplacer chaque valeur manquante par plusieurs valeurs possibles (soient
5), à obtenir plusieurs tables de données complètes sans valeurs manquantes, à effectuer
les analyses statistiques souhaitées sur chacune de ses tables puis à combiner les
résultats obtenus en un ensemble de paramètres estimés avec les écarts types .
Détection des valeurs aberrantes
Une valeur aberrante = valeur erronée correspondant à une mauvaise mesure, à une erreur de
calcul , à un erreur de saisie ou fausse déclaration .
Exemples :
- Les fichiers commerciaux peuvent contenir de nombreuses valeurs aberrantes : dates
incohérentes, dates de naissance inconnues ( date de souscription supérieure à la date
de naissance du client.)
- Clients déclarés « particuliers » ou ils sont « professionnels » ⇒ un impact sur les
données .
- Les montants sont saisis en dinars alors qu’ils doivent être en MD.
- Le code genre peut prendre 2 valeurs (pour la codification du régime prévoyance ou
de la couverture maladie).
4 MOME 2021-2022
Data Mining
- Des numéros de téléphone inexistants ( le client souhaite ne pas être contacté ou il est
sur la liste rouge…).
Grace à l’outil statistique (tri à plat) , on peut les détecter.
Solutions :
1. Supprimer les observations concernées si le nombre est faible ou si ces observations ne
doivent pas figurer dans l’échantillon.
2. Conserver les observations et écarter la variable du reste des observations si elle n’est
pas jugée importante ou remplacer pat une variable proche mais sans valeur aberrante.
3. Conserver les observations et la variable, remplacer la valeur aberrante par une autre
valeur supposée être la plus proche possible des valeurs réelles (imputation de valeurs
manquantes).
4. Conserver les observations et la variable et utiliser telle quelle la variable, en tolérant
une petite marge d’erreur dans les résultats des modèles.
On a alors un problème de choix de solutions valides.
Détection des valeurs extrêmes
Ce n’est pas une valeur aberrante, mais elle correspond à un profil particulier, des catégories
particulières d’individus …
→ C’est un profil rare, intéressant à détecter, si on le supprime de l’échantillon, on appauvrit
l’échantillon et le modèle. (Exemple : cas risque impayé ou fraude. )
Une valeur extrême peut influencer : les méthodes de recherche des patterns , l’AFD,
régression logistique .
Tests de normalité
Utiles pour l’AFD de Fisher ou la régression linéaire .
Certes la loi normale de Laplace Gauss caractérise divers domaines ( biologie, pharmacie, ….),
de plus selon le théorème central limite , la majorité des lois (Poisson , Bernoulli, Binomiale
Advertisement
…) y convergent .
⇒ Utiliser les coefficients d’aplatissement ou d’asymétrie ( de Kurtosis)
⇒ Tetser {
𝐻0: 𝐿𝑒𝑠 𝑣𝑎𝑟𝑖𝑎𝑏𝑙𝑒𝑠 𝑜𝑏𝑠𝑒𝑟𝑣é𝑒𝑠 𝑠𝑢𝑖𝑣𝑒𝑛𝑡 𝑢𝑛𝑒 𝑙𝑜𝑖 𝑛𝑜𝑟𝑚𝑎𝑙𝑒
𝐻1: 𝐿𝑒𝑠 𝑣𝑎𝑟𝑖𝑎𝑏𝑙𝑒𝑠 𝑜𝑏𝑠𝑒𝑟𝑣é𝑒𝑠 𝑛𝑒 𝑠𝑢𝑖𝑣𝑒𝑛𝑡 𝑝𝑎𝑠 𝑢𝑛𝑒 𝑙𝑜𝑖 𝑛𝑜𝑟𝑚𝑎𝑙𝑒
⇒ Règle de décision :
Si la P-value ou la probabilité est < 5 % ⇒ accepter H1
Sinon ⇒ accepter H0.
On peut aussi réaliser le test de Jarque-Bera : il ne teste pas directement la normalité des erreurs
mais teste le fait que le coefficient d’asymétrie et d’aplatissement sont calculés sur les données
qui suivent une loi normale.
5 MOME 2021-2022
Data Mining
Tester {
𝐻0: 𝐶𝑜𝑒𝑓𝑓𝑖𝑐𝑖𝑒𝑛𝑡 𝑑′𝑎𝑠𝑡𝑚é𝑡𝑟𝑖𝑒 = 0 𝑒𝑡 𝑐𝑜𝑒𝑓𝑓𝑖𝑐𝑖𝑒𝑛𝑡 𝑑′𝑎𝑝𝑝𝑙𝑡𝑖𝑠𝑠𝑒𝑚𝑒𝑛𝑡 = 3
𝐻1: 𝐶𝑜𝑒𝑓𝑓𝑖𝑐𝑖𝑒𝑛𝑡 𝑑′𝑎𝑠𝑡𝑚é𝑡𝑟𝑖𝑒 ≠ 0 𝑜𝑢 𝑐𝑜𝑒𝑓𝑓𝑖𝑐𝑖𝑒𝑛𝑡 𝑑′𝑎𝑝𝑝𝑙𝑡𝑖𝑠𝑠𝑒𝑚𝑒𝑛𝑡 ≠ 3
Tous ces divers tests sont fournis par les logiciels .
Test d’homoscédasticité
Utiles en AFD et en régression logistique .
Tester {
𝐻0: 𝜎1
2 = 𝜎2
𝐻1: 𝑖𝑙 ∃ 𝜎𝑗
2 = ⋯ … . 𝜎𝑛=
2 0 (homoscédasticité)
2 ≠ 0: ℎé𝑡é𝑟𝑜𝑠𝑐é𝑑𝑎𝑠𝑡𝑖𝑐𝑖𝑡é
Les tests à réaliser : exemple de Bartlett .
Détection de valeurs les plus discriminantes
Il faut écarter les valeurs les moins discriminantes (faible corrélation)..
Nb : Si la variable cible et les variables explicatives sont quantitatives ⇒ Coefficient de
corrélation de Pearson- Spearman .
Si on a quantitative-qualitative ⇒ Test d’égalité de la moyenne : « analyse de la variance
à un facteur ».
Si on a n variables explicatives ⇒ « analyse de la variance à n facteurs »
Variables explicatives qualitatives , discrètes découpées en classes
On se base sur le test d’indépendance des variables : « test de 𝜒2 » pour ces variables.
Pour les variables explicatives ordinales, on utilise le tau de Kendall. : 𝝉 : il ne s’agit pas de
coefficient de corrélation , mais c’est la différence entre :
Probabilité pour que les données observées X et Y soient dans le même ordre.
Probabilité pour que les données observées X et Y soient dans des ordres différentes.
Variables explicatives continues
On applique ANOVA si les variables explicatives sont continues ( si les hypothèses de
normalités sont vérifiées) .
Sinon , on applique des test non paramétriques : Wilcoxon-Mann-Whiting ( variable cible-
binaire ) ; si nombre ≥ 2 ⇒ 𝑇𝑒𝑠𝑡 de Kruskall-Wallis .
R2 tend vers 1 ⇒ la liaison est forte entre la variable qualitative cible et la variable continue
testée.
6 MOME 2021-2022
Data Mining
NB : avant de réaliser un test il faut commencer par écarter les observations hors norme ou
extrêmes ( ils biaisent les résultats) .
Si R2 et 𝝌𝟐 sont grandes , la liaison est forte . On doit classer les variables explicatives dans une
liste par valeurs décroissantes des indicateurs précédents afin de faire paraitre les prédictives
en tête de liste .
⇒ Classer les variables explicatives dans une liste par valeur décroissante.
Si à cause d’un effet de monotonie sur la cible , on n’a pas pu sélectionner , on ajoute d’autres
tests , ( arbre de décision, ou AF…).
Transformation de variables
Exemple :
la normalisation (AFD) : cad :approximation par une loi normale ; utiliser Logarithme
.népérien .
La discrétisation : le découpage en classes variables continues.
Remplacer les variables d’origine par les facteurs (ACP).
Création d’indicateurs.
Choix des tranches de valeurs continues
Il s’agit de l’étape de discrétisation :
Inutile avant un arbre de décision.
Utile à réaliser avant une ACM ou une classification par agrégation de similarités.
Utile en préliminaire d’une régression logistique
⇒ Découpage en classes de variables explicatives continues s’examine pour chaque variable
en regardant si le phénomène à prédire est fonction linéaire ou non monotone ( croissante
ou décroissante ) de la variable explicative .
S’il s’agit de réponse monotone non linéaire et fonction de X ⇒ conserve une fonction
continue mais modéliser f(x) au lieu de x ( avec f fonction monotone).
S’il s’agit de réponse non monotone⇒ transformation plus profonde de la variable
explicative et la discrétiser ⇒ découper en classes ou « tranches » pour modéliser par
régression logistique ou analyse discriminante .
7 MOME 2021-2022
Data Mining
Détection de multicolinéarité :
L’étape de la détermination de relations linéaires entre les variables explicatives est nécessaire
en Analyse Discriminante, régression logistique et en régression linéaire.
Le problème consiste à détecter un problème de multicolinéarité. Les outils utilisés sont :
Le coefficient de corrélation simple (détection de corrélation des variables 2 à 2)
La matrice de variance-covariance).
FIV « Variance Inflation Factor » : (coefficient varie entre 0.1 et 0.2) .
Echantillonnage
Il s’agit d’un processus de sélection d’objets ou d’individus à étudier, à partir d’une population
plus importante. Le sous-ensemble d’objets ou d’individus constitue l’échantillon . Le choix
des unités qui constituent le sous-ensemble peut être effectué par différentes méthodes
(échantillonnage).
Méthodes d’échantillonnage
Aléatoires non aléatoires
Simple Stratifié Par grappes A plusieurs degrés
i. Aléatoire Simple
On tire au sort, successivement, “n” sujets à partir de la base du sondage. Chaque sujet a la
même chance d’être inclus dans l’échantillon.
8 MOME 2021-2022
Méthode : On numérote tous les sujets, ( on peut utiliser une table de nombres aléatoires ) , on
sélectionne le sujet correspondant au nombre tiré.
Tous les échantillons sont possibles avec la même probabilité.
Data Mining
Echantillon avec remise .
Echantillon sans remise.
Remarques :
Tirage avec remise : Risque d’interroger plusieurs fois la même personne au lieu
d’unités différentes.
Si le taux de sondage f=n/N est inférieur à 0.05 (0.10 selon la précision souhaitée),
l’échantillon sans remise peut être assimilé à un échantillon avec remise
Le tirage systématique
Méthode encore plus simple : il existe un intervalle, un écart entre chaque sujet (classement de
la population dans un ordre non numérique).
numéroter les unités de 1 à N.
calculer le « pas » de sondage k = N / n.
choisir « au hasard » un départ d entier compris entre 1 et k.
l’échantillon est formé des unités identifiées par les numéros les plus proches de d, d+k,
d+2.k, …, d+(n-1).k
Exemple :
Numéroter de 1 à N les sujets dans la base de sondage (N : taille totale de la
population). Ex : Vous avez N = 400 sujets dans votre base.
Déterminer l’intervalle d’échantillonnage K (pas de sondage) en divisant le nombre de
sujets (N) par la taille de l’échantillon. Ex : On choisit 100 sujets sur la base de 400
donc K = 400/100 = 4.
Choisir le 1er sujet à inclure dans l’échantillon (nombre entre 1 et K). Ex : on choisit
d’inclure à partir du 2ème sujet, ce sera le 1er sujet de notre échantillon.
On inclut chaque Kème sujet après le premier sujet inclus. Ex : On a choisi le 2ème puis
le 6ème, puis 10ème…
ii. Echantillonnage Stratifié :
On divise la population en groupes homogènes (strates), puis on sélectionne à partir de chaque
strate des échantillons indépendants.
9 MOME 2021-2022
Data Mining
Méthode d’échantillonnage aléatoire stratifié
N2
n2
n1
Nj
nj
Nk
nk
N1
Strate1 Strate2………………….. Strate j …………………. Strate k
𝑘
N = ∑ N𝑗
𝑗:1
Advertisement
; n =∑ n𝑗
𝑘
𝑗:1
N : la taille de la population ; n : taille de l’échantillon
N𝑗 : taille de la strate N°j ; n𝑗 : taille de l’échantillon extrait de la strate j .
iii. Echantillonnage par grappe :
On divise la population en sous-groupes (ou grappes), puis on sélectionne aléatoirement des
groupes de sujets plutôt que les sujets eux-mêmes. Ces grappes choisies seront exploitées
totalement .
La taille de l’échantillon correspond à la somme des tailles des grappes sélectionnées.
iv. Echantillonnage A plusieurs degrés
Il ressemble à l’échantillonnage par grappe sauf qu’ici on prélève un échantillon à partir de la
grappe. On a au moins 2 degrés car le 1er correspond à la grappe 1 et le 2ème à la sous unité.
o Avantage :
Réduit les coûts et pas besoin de disposer de la liste complète.
o
Permet de contrôler la taille de l’échantillon, notamment par stratification.
Inconvénient : perte de précision.
Ex : Niveau 1 : ville, niveau 2 : établissement de santé, niveau 3 : médecin.
Méthode d’échantillonnage aléatoire à plusieurs degrés
N
nn
Nnn
n
10 MOME 2021-2022
Data Mining
Les techniques de DM
Cible, une variable à expliquer : variable privilégiée.
Pour le second type de méthodes, on peut préciser selon la …..type de variables utilisées .
Classification des techniques
Type
Techniques
descriptives
Famille
Modèles
géométriques
Sous-famille
Analyse factorielle
Méthode
ACP
( variables continues)
AFC ; ACM
(variables qualitatives et binaires)
Analyse typologique Méthodes de partitionnement
Techniques
prédictives
Modèles
combinatoires
Modèles à base de
règles logiques
Modèles à base de
règles logiques
Modèles à base de
fonctions
mathématiques
Analyse typologique
+ réduction de
dimensions
Détection de liens
Arbres de décision
(centres mobiles, k-means, nuées
dynamiques…).
Méthodes hiérarchiques
(ascendantes, descendantes) .
Classification neuronale
( réseaux de Kohenen).
Classification par agrégation de
similarités
(variables qualitatives)
Recherche d’associations
Recherche de séquences similaires
Arbres de décision
(variable à expliquer quantitative ou
qualitative)
Réseaux de neurones Régression linéaire, ANOVA,
Modèles
paramétriques ou
semi-paramétriques
MANOVA, ANCOVA, MANCOVA,
modèle linéaire général, GLM,
régression PLS (variable à expliquer
continue ).
Analyse discriminante de Fisher,
régression logistique, régression
logistique PLS (variable à expliquer
qualitative ).
Modèle log-linéaire (variable à
expliquer = comptage= nombre
d’individus prenant une combinaison
donnée de modalités de variables
qualitatives) .
Modèle linéaire généralisé GLZ ,
modèle additif généralisé GAM (
variable à expliquer continue,
discrète ou qualitative) .
Prédiction sans
modèle
Analyse probabiliste K – plus proches voisins (k-NN) .
11 MOME 2021-2022
Techniques prédictives
Data Mining
1
Qualitative
(facteur)
ANOVA,
arbres de
décision,
SVR.
n
Qualitatives
(facteurs)
ANOVA, arbres
de décision,
SVR, réseaux de
neurones.
Explicative
1
quantitative
n
quantitatives
A expliquer
1
quantitative
n
quantitatives
1
qualitative
Régression
linéaire
simple ;
Régression
robuste, arbre
de décision ;
SVR (Support
Vector
Regression)
Régression
PLS 2
Régression
linéaire
multiple,
Régression
robuste,
Régression PLS,
réseaux de
neurones , SVR.
Advertisement
Régression PLS
2, réseaux de
neurones.
MANOVA
Analyse
discriminante
de Fisher,
Régression
logistique ,
arbres de
décision, SVM
.
Analyse
discriminante de
Fisher,
Régression
logistique PLS,
arbres de
décision, SVM,
réseaux de
neurones.
Régression
logistique,
Analyse
discriminante
DISQUAL,
Arbres de
décision,
SVM.
n qualitatives
1
quantitative
Asymétrique
1 discrète
1
qualitative
Ordinale
n qualitatives
/ quantitatives
(représentant des
mesures répétées
d’une même
variable)
GLZ (
régressions
Gamma et log-
normale)
GLZ (
régressions de
poisson et log-
normale)
Régression
logistique
ordinale
Modèles
linéaires
généralisés à
mesures
répétées
Réseaux de
neurones
GLZ (
régressions
Gamma et log-
normale)
GLZ (
régressions de
poisson et log-
normale)
Régression
logistique
ordinale
Modèles
linéaires
généralisés à
mesures
répétées
GLZ (
régressions
Gamma et log-
normale)
GLZ (
régressions de
poisson et log-
normale)
Régression
logistique
ordinale
Modèles
linéaires
généralisés à
mesures
répétées
réseaux de
neurones,
MANOVA.
Régression
logistique,
Analyse
discriminante
DISQUAL,
Arbres de
décision,
réseaux de
neurones ,
SVM.
Réseaux de
neurones
GLZ (
régressions
Gamma et log-
normale)
GLZ (
régressions de
poisson et log-
normale)
Régression
logistique
ordinale
Modèles
linéaires
généralisés à
mesures
répétées
Mélange
ANOVA,
GLM univarié
,
arbres de
décision,
SVR, réseaux
de neurones.
MANCOVA,
GLM
univarié,
réseaux de
neurones.
Régression
logistique,
Arbres de
décision,
réseaux de
neurones ,
SVM.
Réseaux de
neurones
Advertisement
GLZ (
régressions
Gamma et
log-normale)
GLZ (
régressions de
poisson et log-
normale)
Régression
logistique
ordinale
Modèles
linéaires
généralisés à
mesures
répétées
12 MOME 2021-2022
Data Mining
Comparatif de techniques
Techniques
Absence d’hypothèses
sur le problème à
résoudre
Traitement de la base
de données
Traitement de
données hétérogènes
ou lacunaires
Classification
Méthodes des centres
mobiles et ses
variantes
Classification
hiérarchique
Non
(nombre de classes et des
centres fixés)
Oui (mais les classes au
niveau n sont déterminés
par ceux du niveau n-1).
Non
Oui
Oui
Non (on ne peut traiter
pas plus des milliers
d’observations)
Oui
Dépend de
l’implémentation
Variables numériques
et sans valeurs
manquantes
Oui ( possibilité de
traiter de variables non
quantitatives avec une
distance ).
Les variables non
binaires doivent être
transformées
Variables qualitatives
Classification
Neuronale
Classification
Par agrégation (ou
similarités)
Arbres de décision
Réseau de neurones
perceptrons
Réseaux à fonction
radiale de base
Analyse
discriminante
Analyse
discriminante sur
coordonnées
factorielles d’une
ACM
Régression linéaire
PLS
Régression
logistique ; modèle
linéaire généralisé
Classement et prédiction
Classification
hiérarchique
(arbre à l’envers)
Oui (fixer le nombre de
neurones cachées)
Non
Non
Comme les perceptrons Oui
Non
( relations linéaires entre
les variables et les
hypothèses sur les lois
conditionnelles x/y).
Oui
Oui
Oui
Non
Oui
Oui
Oui (sur une machine
assez puissante, si n
est assez grand).
Parfois , il faut
discrétiser les
variables continues
Les variables non
binaires doivent être
transformées
Les variables non
binaires doivent être
transformées
Variables numériques
et sans valeurs
manquantes
Oui (Variables
numériques et sans
valeurs manquantes
sont traitées comme
des valeurs à part
entière).
Variables numériques
et sans valeurs
manquantes
Oui ( découper en
classes continues avec
des valeurs
manquantes).
Recherche
d’associations
Séquences similaires Oui
Oui
Associations
Dépend du
paramétrage
Oui (idem)
Oui
Oui
13 MOME 2021-2022