Data Mining: Correction de la série 1

Data Mining · lab

Browse all intelligence artificielle et données documents

Chapitre II

Data Mining

Correction de la série 1

Exercice 2

1- Le centre de gravité du nuage de points G.

𝑋̅ = 18.75 ; 𝑌̅ = 16 ⇒ G = {18.75 ; 16 }

2- La distance euclidienne entre les deux vecteurs X et Y.

d(X ,Y) = √∑(𝑥𝑖 − 𝑦𝑖)2 = √(22 − 20)2 + (1 − 0)2+(42 − 36)2 + (10 − 8)2 =

√4 + 1 + 36 + 4 = √45= 6.71

3- Calcul de l’inertie par rapport au nuage de points.

Advertisement

IG = ∑ 𝑚𝑖𝑑2 (𝑋𝑖 ,G) ; avec 𝑚𝑖 = masse ou le poids = 1/ni

IG= ¼ ( ( 22-18.75)2+(1-18.75)2 + (42-18.75)2+(10-18.75)2) + ¼ ((20-16)2 + (0-

16)2+(36-16)2 +(8-16)2) = 419.687

4- Calcul de l’inertie par rapport au vecteur X.

IX = ∑ 𝑚𝑖𝑑2 (𝑋𝑖 ,X) = ¼ ( ( 22-22)2+(1-1)2 + (42-42)2+(10-10)2) + ¼ ((20-22)2 + (0-

1)2+(36-42)2 +(8-10)2) = 11.25

Exercice 3

Normalisation des valeurs

 Selon Min-Max

X norm=

Advertisement

𝑥 −𝑥𝑚𝑖𝑛

𝑥𝑚𝑎𝑥−𝑥𝑚𝑖𝑛

; AN : 𝑥𝑚𝑖𝑛 = 200 ; 𝑥𝑚𝑎𝑥 = 1000 ⇒ X norm = {0;

1

8

;

1

4

;

1

Advertisement

2

; 1}

 Z de normalisation des scores : Z =

𝑥 −𝑥̅

𝜎𝑥

; Cad : Centrer et réduire la variable ; il faut

alors calculer la moyenne arithmétique et l’écart type de la distribution : 𝑋̅ = 500 ;

𝜎𝑥 = 31 ; Z = {−0,948; −0,632; −0,316; 0,316; 1,581}

 Le critère de l’écart par rapport à la moyenne : |𝑥 − 𝑥̅|

X norm= {300; 200; 100; 100; 500}

Advertisement

 Echelle décimale :

La plus grande valeur dans cet ensemble = 1000 = 103 ; Alors il faut diviser les différentes

valeurs par 103.

Remarque : , si on avait comme grand valeur un nombre de 6 chiffres alors on divise par 106.

X norm= {0.2; 0.3; 0.4; 0.3; 1}

1 MOME 2 2021-2022