Analyse de Données Marketing

Institut des Hautes Études Commerciales
Page 1 sur 6Lecteur de document UniversityLib

Analyse de Données Marketing

Institut des Hautes Études Commerciales · Programming, Math, Data Analysis · exam

Voir tous les documents en gestion et économie

Institut des Hautes Etudes Commerciales. Carthage

Filières : M2 _ Masters Pro IMVS Matière : Analyse de Données Marketing Enseignant : Adel Jalel Chekki

2H

Partie I : (4 points)

Dans un graphique récapitulatif, expliciter les modalités d’usage des méthodes multivariées d’analyse de données que vous connaissez.

Correction examen principal, Janvier 2017

Partie II : (4 points) Dans une étude qui a porté sur l’observation de 11 ménagères dans l’usage mensuel des dérivés de céréales et de légumineuses dans la cuisine tunisienne, on a relevé les données suivantes :

. 1 2 3 4 5 6 7 8 9 10 11

8

9

L4

L2

L3

C1 C2 C3 C4 L1 8 8.04 9.14 7.46 6.58 10 10 10 8 6.95 8.14 6.77 5.76 8 8 8 7.58 8.74 12.74 7.71 13 13 13 8 8.81 8.77 7.11 8.84 9 9 8 8.33 9.26 7.81 8.47 11 11 11 8 9.96 8.10 8.84 7.04 14 14 14 6 6 8 7.24 6.13 6.08 5.25 4 19 4.26 3.10 5.39 12.50 4 8 10.84 9.13 8.15 5.56 12 12 12 8 4.82 7.26 6.42 7.91 7 7 8 5.68 4.74 5.73 6.89 5 5

7 5

6 4

 Les dérivés des céréales : C1 (Couscous) ; C2 (riz); C3 (pâtes) ; C4 (autres : mhammes, dchich, etc.)  Les légumineuses : L1 (pois chiches); L2 (petits pois) ; L3 (haricots) ; L4 (autres : lentilles, fenugrec ou helba, fève, etc.).

Questions :

1. Calculer la moyenne et la variance des variables C1, C4, L1, L4.

 Les moyennes sont toutes les mêmes pour les C d'un côté et les L de l'autre.

C1 : 9.000000 ; C4 : 9.000000 / L1 : 7.500909 L4 : 7.500909

 Les variances aussi (on calcule la moyenne des carrés moins le carré de la moyenne)

C1 : 10.00 ; C4 : 10.00 / L1 : 3.75239 ; L4 : 3.748408

2. Calculer les coefficients de corrélation des couples (C1, L1) et (C4, L4). Que constate-t-on ?

On obtient encore des résultats uniformes :

 Corrélation C1/L1= 0.816420516  Corrélation C4/L4 = 0.816521437

3. Tracer la représentation des couples (C1,L1) et (C4,L4) sur un graphique où on met les x en abscisse

et les y en ordonnées. Commenter.

L1

5.68

4.26

7.24

6.95

4.82

8.81

8.04

8.33

10.84

9.96

7.58

0

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

L4

Publicité

12 11 10 9 8 7 6 5 4 3 2 1 0

14 13 12 11 10 9 8 7 6 5 4 3 2 1 0

0

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

On constate que les variables sont très différentes les unes des autres.

 Le couple C1/L1 est linéaire, à part un point ; on a des données qui épousent l’allure d’une ligne (r = 0.81) et

corrélées.

 Le couple C4/L4 marque une indépendance totale de l'abscisse par rapport à l'ordonnée (à part encore 1 point)

malgré le même r fort que le C1/L1.

Toutes ces courbes montrent à quel point il faut se méfier de l'interprétation des moyennes, variances et corrélation. Un r fort n'est pas synonyme toujours de corrélation.

Partie III : (12 points) On étudie les consommations annuelles, exprimées en millions de dinars, de 8 denrées alimentaires (les variables), les individus étant 8 catégories socio-professionnelles. Les données sont des moyennes par CSP :

PAO PAA HUG HUO PAT LEC ARM PLP 167 AGRI 162 SAAG 119 PRIN 87 CSUP CMOY 103 111 EMPL 130 OUVR 138 INAC

23 12 56 111 77 66 52 74

163 141 69 63 68 72 76 117

6 15 41 39 30 28 16 20

6 4 13 18 11 10 7 12

8 12 5 3 4 6 7 8

41 40 39 27 32 34 43 53

1 2 6 11 5 4 3 7

INVIVIDUS : AGRI = Exploitants agricoles SAAG= Salariés agricoles PRIN = Professions indépendantes CSUP = Cadres supérieurs CMOY= Cadres moyens EMPL= Employés OUVR = Ouvriers INAC = Inactifs

VARIABLES : PAO = Pain ordinaire PAA = Autre pain HUG = Huiles de Graines HUO= Huiles d’Olives PAT= Pates, céréales et dérivés LEC=Légumes secs ARM = Agrumes PLP= Plats préparés

Questions : 1) Quelle est la méthode d'analyse utilisée ici ? Pourquoi utilise-t-on cette méthode ?

Il s’agit d’une analyse en composantes principales (ACP). On l’utilise pour décrire la structure d’une population décrite au travers de plusieurs variables quantitatives.

2) Compte tenu des tableaux présentés en annexes, est-on en droit d’utiliser cette méthode ? Justifiez.

Oui on est en droit d’utiliser cette méthode, car dans la matrice des corrélations il y a un grand nombre de coefficients de coorélation (25 sur 28) qui sont supérieur ou inférieur à 0.5

3) Comment procède-t-on pour centrer une variable ? Quel est l’intérêt dans le cadre de cette étude ? Pour centrer une variable on retranche la moyenne des valeurs originelles de la variable. Cette procédure est utile pour ramener à la même grandeur des échelles de même nature et de grandeurs différentes. Ici ce n’est pas utile car toutes les valeurs sont de la même nature et de la même grandeur.

4) Comment procède-t-on pour réduire une variable ? Quel est l’intérêt dans le cadre de cette étude ?

Pour réduire une variable on divise sa valeur centrée par son écart type. Cette procédure est utile pour ramener à la même nature des échelles de mesure de natures différentes. Ici ce n’est pas utile car toutes les valeurs sont de la même nature et de la même grandeur.

5) Quelle position (centrage, réduction) devrions-nous adopter dans le cadre de cette étude ? Pourquoi ?

Dans le cadre de cette étude on peut ne pas centrer et réduire les variables, car elles sont de la même nature et de la même grandeur

6) Dans le tableau 1, on lit – 0,8386 à l'intersection de la colonne « HUG » et de la ligne « LEC ». Que signifie-t-elle ?

Ici il y a eu une petite erreur. Ma vue ma joué un sale tour en suivant la colonne HUG. La bonne valeur à l’intersection de « HUG » et « LEC » est de 0.79. Par conséquent, j’accepte les 3 réponses suivantes

- 0,8386 est le coefficient de corrélation linéaire entre « HUG » et « LEC ». Ce coefficient est fort et négatif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans sens contraire.

 0.79 est le coefficient de corrélation linéaire entre « HUG » et « LEC ». Ce coefficient est fort et positif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans le même sens. - 0,8386 est le coefficient de corrélation linéaire entre « HUO » et « LEC ». Ce coefficient est fort et négatif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans sens contraire.

7) Les coordonnées de l’individu « AGRI » sur l’Axe 1 sont de -3.37158. Reproduisez les calculs qui ont permis d’obtenir

cette coordonnée.

Publicité

PAO

127.125

PAA

4.875

HUG

96.125

HUO

58.875

PAT

38.625

LEC

6.625

ARM

10.125

PLP

24.375

681.359375

8.859375

1316.609375 858.109375

54.234375

6.984375

17.359375

131.234375

26.1028614

2.97647022 36.2851123

29.293504

7.3643992

2.6427968

4.16645833

11.4557573

1.5276103

-1.3018776 1.84304239

-1.2246742

0.32249746

0.52028214

-0.9900495

-1.603997

MOY

VAR

E.T.

AGRI (C .R.)

Coordonnées AGRI sur Axe 1 =

AGRI (CR)

X

1.5276103

-1.3018776

1.84304239

-1.2246742

0.32249746

0.52028214

-0.9900495

-1.603997

. Axe 1 -.391311 PAO 0.348674 PAA -.349193 HUG HUO 0.373625 -.246371 PAT -.364822 LEC 0.373052 ARM 0.361676 PLP

-.391311 x 1.5276103 + -1.3018776x0.348674+ 1.84304239 x-.349193 + etc. = -3.37157956

8) À partir des documents figurant en annexes, commentez globalement les résultats de cette analyse.

Nombre d’axes à retenir : Le critère de Kaiser nous conduit à sélectionner un seul axe, qui retient 77% de l’inertie totale. L’axe 2 retient tout de même 11% de l’inertie, ce qui n’est pas négligeable, et qui conduit à un taux d’inertie expliquée de 89%, ce qui est un très bon résultat. Il peut être donc intéressant de l’étudier aussi. Interprétation des axes L’interprétation des axes factoriels se fait séquentiellement, pour chaque axe et chaque nuage de points, en regardant les contributions à la formation des axes. Axe 1 : Variables : 

L’axe 1 oppose les individus consommant du pain ordinaire, des légumes secs et de l’huile de graine à ceux qui consomment de l’huile d’olive, des pains spéciaux (autres pains), des agrumes et des plats préparés. L’axe 1, et donc la première composante principale, mesure la répartition entre aliments ordinaires bon marchés et aliments plus recherchés.

Publicité

Individus: 

Le premier axe met donc en opposition quant à leurs habitudes alimentaires les agriculteurs et les cadres supérieurs.

 Toutes les catégories socio-professionnelles sont assez bien représentées sur l’axe à l’exception ouvrier et

surtout des inactifs.

Synthèse: 

L’axe 1 reflète l’opposition qui existe entre les catégories socio-professionnelles dans leur alimentation, opposant les CSP modestes qui consomment des produits basiques aux catégories favorisées qui consomment des produits plus recherchés.

Axe 2 : Variables : 

L’axe 2 est défini essentiellement par la variable PAT. la deuxième composante principale peut être considérée comme essentiellement liée à la consommation des Pates, céréales et dérivés. Les autres variables, à l’exception de PAA (pains spéciaux) sont assez mal représentées sur l’axe (tableau 5). La deuxième composante principale n’explique donc qu’un aspect très particulier de la consommation alimentaire.

Individus :   Synthèse 

Le deuxième axe est caractéristique des inactifs (expliquant =75% de l’inertie de l’axe). Les autres catégories socio-professionnelles sont mal représentées sur l’axe.

L’axe 2 reflète donc la particularité des inactifs quant à leur alimentation, fortement composée de pates et céréales (un retour aux données d’origine vient confirmer cette conclusion).

Tableau 1:

PAO PAA HUG HUO PAT LEC ARM PLP Tableau 2 :

PAO 1.0000 -.7737 0.9262 -.9058 0.6564 0.8886 -.8334 -.8558

PAA -.7737 1.0000 -.6040 0.9044 -.3329 -.6734 0.9588 0.7712

Matrice des Corrélations

HUG 0.9262 -.6040 1.0000 -.7502 0.5171 0.7917 -.6690 -.8280

HUO -.9058 0.9044 -.7502 1.0000 -.4186 -.8386 0.9239 0.7198 Valeurs propres

PAT 0.6564 -.3329 0.5171 -.4186 1.0000 0.6029 -.4099 -.5540

LEC 0.8886 -.6734 0.7917 -.8386 0.6029 1.0000 -.8245 -.7509

Valeurs 1 6.20794684 2 0.87968139 3 0.41596112 4 0.30645467

Pourcentage Pourc. cumulé 0.7760 0.8860 0.9379 0.9763

0.7760 0.1100 0.0520 0.0383

Annexes :

ARM -.8334 0.9588 -.6690 0.9239 -.4099 -.8245 1.0000 0.8344

PLP -.8558 0.7712 -.8280 0.7198 -.5540 -.7509 0.8344 1.0000

5 0.16844150 6 0.01806771 7 0.00344677 8 0.00000000

0.0211 0.0023 0.0004 0.0000

0.9973 0.9996 1.0000 1.0000

Axe 2

Axe 3

Vecteurs propres Axe 4

Tableau 3 . Axe 7 Axe 1 -.397748 0.106920 0.728963 0.137823 0.161714 0.119350 0.294045 -.391311 PAO -.117773 -.423079 0.440585 0.319950 0.217909 -.520704 -.265442 0.348674 PAA -.180130 -.253923 -.028883 0.245716 0.464752 0.201682 0.680632 -.349193 HUG 0.575000 -.033345 0.422866 -.345605 -.396545 0.260309 0.073482 HUO 0.373625 -.073992 0.175725 0.107747 0.743826 -.135449 -.093428 -.557660 -.246371 PAT 0.184942 0.313107 0.012735 -.364822 -.669192 0.128021 0.032401 0.518889 LEC -.158952 -.016265 0.765903 0.373052 0.325980 0.254250 0.063706 0.271532 ARM 0.218851 -.224966 -.161692 0.361676 PLP

0.708103 0.332914 0.360245

-.050227

Axe 5

Axe 6

Axe 8

Tableau 4

Coordonnées et qualité de représentation des individus

AGRI SAAG PRIN CSUP CMOY EMPL OUVR INAC

Axe1 -3.37158 -3.52171 1.47203 4.35879 1.71808 0.80653 -0.89910 -0.56304

Qlt2

Axe2

Qlt1 -0.24582 0.88444 0.00470 -0.44740 0.89806 0.01449 0.05851 0.57460 0.00091 0.17611 0.94182 0.00154 -0.85665 0.75288 0.18717 -0.80853 0.42778 0.42990 -0.18304 0.36060 0.01495 2.30681 0.05552 0.93193

Tableau 5

Coordonnées des variables sur les axes (corrélations entre les composantes principales et les variables initiales)

Axe 1 -0.97498 0.86875 -0.87004 0.93092 -0.61385 -0.90898

PAO PAA HUG HUO PAT LEC ARM 0.92949 PLP

0.90114

Axe 2 0.12927 0.41323 0.18916 0.24415 0.69764 0.12007 0.30574 -0.04711

Graphique 1

Graphique 2