Institut des Hautes Etudes Commerciales. Carthage
Filières : M2 _ Masters Pro IMVS Matière : Analyse de Données Marketing Enseignant : Adel Jalel Chekki
2H
Partie I : (4 points)
Dans un graphique récapitulatif, expliciter les modalités d’usage des méthodes multivariées d’analyse de données que vous connaissez.
Correction examen principal, Janvier 2017
Partie II : (4 points) Dans une étude qui a porté sur l’observation de 11 ménagères dans l’usage mensuel des dérivés de céréales et de légumineuses dans la cuisine tunisienne, on a relevé les données suivantes :
. 1 2 3 4 5 6 7 8 9 10 11
8
9
L4
L2
L3
C1 C2 C3 C4 L1 8 8.04 9.14 7.46 6.58 10 10 10 8 6.95 8.14 6.77 5.76 8 8 8 7.58 8.74 12.74 7.71 13 13 13 8 8.81 8.77 7.11 8.84 9 9 8 8.33 9.26 7.81 8.47 11 11 11 8 9.96 8.10 8.84 7.04 14 14 14 6 6 8 7.24 6.13 6.08 5.25 4 19 4.26 3.10 5.39 12.50 4 8 10.84 9.13 8.15 5.56 12 12 12 8 4.82 7.26 6.42 7.91 7 7 8 5.68 4.74 5.73 6.89 5 5
7 5
6 4
Les dérivés des céréales : C1 (Couscous) ; C2 (riz); C3 (pâtes) ; C4 (autres : mhammes, dchich, etc.) Les légumineuses : L1 (pois chiches); L2 (petits pois) ; L3 (haricots) ; L4 (autres : lentilles, fenugrec ou helba, fève, etc.).
Questions :
1. Calculer la moyenne et la variance des variables C1, C4, L1, L4.
Les moyennes sont toutes les mêmes pour les C d'un côté et les L de l'autre.
C1 : 9.000000 ; C4 : 9.000000 / L1 : 7.500909 L4 : 7.500909
Les variances aussi (on calcule la moyenne des carrés moins le carré de la moyenne)
C1 : 10.00 ; C4 : 10.00 / L1 : 3.75239 ; L4 : 3.748408
2. Calculer les coefficients de corrélation des couples (C1, L1) et (C4, L4). Que constate-t-on ?
On obtient encore des résultats uniformes :
Corrélation C1/L1= 0.816420516 Corrélation C4/L4 = 0.816521437
3. Tracer la représentation des couples (C1,L1) et (C4,L4) sur un graphique où on met les x en abscisse
et les y en ordonnées. Commenter.
L1
5.68
4.26
7.24
6.95
4.82
8.81
8.04
8.33
10.84
9.96
7.58
0
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
L4
Publicité
12 11 10 9 8 7 6 5 4 3 2 1 0
14 13 12 11 10 9 8 7 6 5 4 3 2 1 0
0
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
On constate que les variables sont très différentes les unes des autres.
Le couple C1/L1 est linéaire, à part un point ; on a des données qui épousent l’allure d’une ligne (r = 0.81) et
corrélées.
Le couple C4/L4 marque une indépendance totale de l'abscisse par rapport à l'ordonnée (à part encore 1 point)
malgré le même r fort que le C1/L1.
Toutes ces courbes montrent à quel point il faut se méfier de l'interprétation des moyennes, variances et corrélation. Un r fort n'est pas synonyme toujours de corrélation.
Partie III : (12 points) On étudie les consommations annuelles, exprimées en millions de dinars, de 8 denrées alimentaires (les variables), les individus étant 8 catégories socio-professionnelles. Les données sont des moyennes par CSP :
PAO PAA HUG HUO PAT LEC ARM PLP 167 AGRI 162 SAAG 119 PRIN 87 CSUP CMOY 103 111 EMPL 130 OUVR 138 INAC
23 12 56 111 77 66 52 74
163 141 69 63 68 72 76 117
6 15 41 39 30 28 16 20
6 4 13 18 11 10 7 12
8 12 5 3 4 6 7 8
41 40 39 27 32 34 43 53
1 2 6 11 5 4 3 7
INVIVIDUS : AGRI = Exploitants agricoles SAAG= Salariés agricoles PRIN = Professions indépendantes CSUP = Cadres supérieurs CMOY= Cadres moyens EMPL= Employés OUVR = Ouvriers INAC = Inactifs
VARIABLES : PAO = Pain ordinaire PAA = Autre pain HUG = Huiles de Graines HUO= Huiles d’Olives PAT= Pates, céréales et dérivés LEC=Légumes secs ARM = Agrumes PLP= Plats préparés
Questions : 1) Quelle est la méthode d'analyse utilisée ici ? Pourquoi utilise-t-on cette méthode ?
Il s’agit d’une analyse en composantes principales (ACP). On l’utilise pour décrire la structure d’une population décrite au travers de plusieurs variables quantitatives.
2) Compte tenu des tableaux présentés en annexes, est-on en droit d’utiliser cette méthode ? Justifiez.
Oui on est en droit d’utiliser cette méthode, car dans la matrice des corrélations il y a un grand nombre de coefficients de coorélation (25 sur 28) qui sont supérieur ou inférieur à 0.5
3) Comment procède-t-on pour centrer une variable ? Quel est l’intérêt dans le cadre de cette étude ? Pour centrer une variable on retranche la moyenne des valeurs originelles de la variable. Cette procédure est utile pour ramener à la même grandeur des échelles de même nature et de grandeurs différentes. Ici ce n’est pas utile car toutes les valeurs sont de la même nature et de la même grandeur.
4) Comment procède-t-on pour réduire une variable ? Quel est l’intérêt dans le cadre de cette étude ?
Pour réduire une variable on divise sa valeur centrée par son écart type. Cette procédure est utile pour ramener à la même nature des échelles de mesure de natures différentes. Ici ce n’est pas utile car toutes les valeurs sont de la même nature et de la même grandeur.
5) Quelle position (centrage, réduction) devrions-nous adopter dans le cadre de cette étude ? Pourquoi ?
Dans le cadre de cette étude on peut ne pas centrer et réduire les variables, car elles sont de la même nature et de la même grandeur
6) Dans le tableau 1, on lit – 0,8386 à l'intersection de la colonne « HUG » et de la ligne « LEC ». Que signifie-t-elle ?
Ici il y a eu une petite erreur. Ma vue ma joué un sale tour en suivant la colonne HUG. La bonne valeur à l’intersection de « HUG » et « LEC » est de 0.79. Par conséquent, j’accepte les 3 réponses suivantes
- 0,8386 est le coefficient de corrélation linéaire entre « HUG » et « LEC ». Ce coefficient est fort et négatif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans sens contraire.
0.79 est le coefficient de corrélation linéaire entre « HUG » et « LEC ». Ce coefficient est fort et positif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans le même sens. - 0,8386 est le coefficient de corrélation linéaire entre « HUO » et « LEC ». Ce coefficient est fort et négatif. Cela veut dire que les deux variables sont fortement dépendantes et évoluent dans sens contraire.
7) Les coordonnées de l’individu « AGRI » sur l’Axe 1 sont de -3.37158. Reproduisez les calculs qui ont permis d’obtenir
cette coordonnée.
Publicité
PAO
127.125
PAA
4.875
HUG
96.125
HUO
58.875
PAT
38.625
LEC
6.625
ARM
10.125
PLP
24.375
681.359375
8.859375
1316.609375 858.109375
54.234375
6.984375
17.359375
131.234375
26.1028614
2.97647022 36.2851123
29.293504
7.3643992
2.6427968
4.16645833
11.4557573
1.5276103
-1.3018776 1.84304239
-1.2246742
0.32249746
0.52028214
-0.9900495
-1.603997
MOY
VAR
E.T.
AGRI (C .R.)
Coordonnées AGRI sur Axe 1 =
AGRI (CR)
X
1.5276103
-1.3018776
1.84304239
-1.2246742
0.32249746
0.52028214
-0.9900495
-1.603997
. Axe 1 -.391311 PAO 0.348674 PAA -.349193 HUG HUO 0.373625 -.246371 PAT -.364822 LEC 0.373052 ARM 0.361676 PLP
-.391311 x 1.5276103 + -1.3018776x0.348674+ 1.84304239 x-.349193 + etc. = -3.37157956
8) À partir des documents figurant en annexes, commentez globalement les résultats de cette analyse.
Nombre d’axes à retenir : Le critère de Kaiser nous conduit à sélectionner un seul axe, qui retient 77% de l’inertie totale. L’axe 2 retient tout de même 11% de l’inertie, ce qui n’est pas négligeable, et qui conduit à un taux d’inertie expliquée de 89%, ce qui est un très bon résultat. Il peut être donc intéressant de l’étudier aussi. Interprétation des axes L’interprétation des axes factoriels se fait séquentiellement, pour chaque axe et chaque nuage de points, en regardant les contributions à la formation des axes. Axe 1 : Variables :
L’axe 1 oppose les individus consommant du pain ordinaire, des légumes secs et de l’huile de graine à ceux qui consomment de l’huile d’olive, des pains spéciaux (autres pains), des agrumes et des plats préparés. L’axe 1, et donc la première composante principale, mesure la répartition entre aliments ordinaires bon marchés et aliments plus recherchés.
Publicité
Individus:
Le premier axe met donc en opposition quant à leurs habitudes alimentaires les agriculteurs et les cadres supérieurs.
Toutes les catégories socio-professionnelles sont assez bien représentées sur l’axe à l’exception ouvrier et
surtout des inactifs.
Synthèse:
L’axe 1 reflète l’opposition qui existe entre les catégories socio-professionnelles dans leur alimentation, opposant les CSP modestes qui consomment des produits basiques aux catégories favorisées qui consomment des produits plus recherchés.
Axe 2 : Variables :
L’axe 2 est défini essentiellement par la variable PAT. la deuxième composante principale peut être considérée comme essentiellement liée à la consommation des Pates, céréales et dérivés. Les autres variables, à l’exception de PAA (pains spéciaux) sont assez mal représentées sur l’axe (tableau 5). La deuxième composante principale n’explique donc qu’un aspect très particulier de la consommation alimentaire.
Individus : Synthèse
Le deuxième axe est caractéristique des inactifs (expliquant =75% de l’inertie de l’axe). Les autres catégories socio-professionnelles sont mal représentées sur l’axe.
L’axe 2 reflète donc la particularité des inactifs quant à leur alimentation, fortement composée de pates et céréales (un retour aux données d’origine vient confirmer cette conclusion).
Tableau 1:
PAO PAA HUG HUO PAT LEC ARM PLP Tableau 2 :
PAO 1.0000 -.7737 0.9262 -.9058 0.6564 0.8886 -.8334 -.8558
PAA -.7737 1.0000 -.6040 0.9044 -.3329 -.6734 0.9588 0.7712
Matrice des Corrélations
HUG 0.9262 -.6040 1.0000 -.7502 0.5171 0.7917 -.6690 -.8280
HUO -.9058 0.9044 -.7502 1.0000 -.4186 -.8386 0.9239 0.7198 Valeurs propres
PAT 0.6564 -.3329 0.5171 -.4186 1.0000 0.6029 -.4099 -.5540
LEC 0.8886 -.6734 0.7917 -.8386 0.6029 1.0000 -.8245 -.7509
Valeurs 1 6.20794684 2 0.87968139 3 0.41596112 4 0.30645467
Pourcentage Pourc. cumulé 0.7760 0.8860 0.9379 0.9763
0.7760 0.1100 0.0520 0.0383
Annexes :
ARM -.8334 0.9588 -.6690 0.9239 -.4099 -.8245 1.0000 0.8344
PLP -.8558 0.7712 -.8280 0.7198 -.5540 -.7509 0.8344 1.0000
5 0.16844150 6 0.01806771 7 0.00344677 8 0.00000000
0.0211 0.0023 0.0004 0.0000
0.9973 0.9996 1.0000 1.0000
Axe 2
Axe 3
Vecteurs propres Axe 4
Tableau 3 . Axe 7 Axe 1 -.397748 0.106920 0.728963 0.137823 0.161714 0.119350 0.294045 -.391311 PAO -.117773 -.423079 0.440585 0.319950 0.217909 -.520704 -.265442 0.348674 PAA -.180130 -.253923 -.028883 0.245716 0.464752 0.201682 0.680632 -.349193 HUG 0.575000 -.033345 0.422866 -.345605 -.396545 0.260309 0.073482 HUO 0.373625 -.073992 0.175725 0.107747 0.743826 -.135449 -.093428 -.557660 -.246371 PAT 0.184942 0.313107 0.012735 -.364822 -.669192 0.128021 0.032401 0.518889 LEC -.158952 -.016265 0.765903 0.373052 0.325980 0.254250 0.063706 0.271532 ARM 0.218851 -.224966 -.161692 0.361676 PLP
0.708103 0.332914 0.360245
-.050227
Axe 5
Axe 6
Axe 8
Tableau 4
Coordonnées et qualité de représentation des individus
AGRI SAAG PRIN CSUP CMOY EMPL OUVR INAC
Axe1 -3.37158 -3.52171 1.47203 4.35879 1.71808 0.80653 -0.89910 -0.56304
Qlt2
Axe2
Qlt1 -0.24582 0.88444 0.00470 -0.44740 0.89806 0.01449 0.05851 0.57460 0.00091 0.17611 0.94182 0.00154 -0.85665 0.75288 0.18717 -0.80853 0.42778 0.42990 -0.18304 0.36060 0.01495 2.30681 0.05552 0.93193
Tableau 5
Coordonnées des variables sur les axes (corrélations entre les composantes principales et les variables initiales)
Axe 1 -0.97498 0.86875 -0.87004 0.93092 -0.61385 -0.90898
PAO PAA HUG HUO PAT LEC ARM 0.92949 PLP
0.90114
Axe 2 0.12927 0.41323 0.18916 0.24415 0.69764 0.12007 0.30574 -0.04711
Graphique 1
Graphique 2