Analyse de données avec SPSS
CHAPITRE II-
ELABORATION D’UNE BASE DE DONNEES SPSS : « DATA SET SPSS »
INTRODUCTION
Après la phase d’administration du questionnaire (travail sur terrain) qui génère une quantité considérable de données, vient une étape difficile et critique de l’étude ; c’est celle de la saisie informatique des données dans un support unique.
Les données d’une enquête devront être représentées sous forme d’une matrice (tableau à double entrées) où les lignes représentent les individus (personnes interviewées), et les colonnes sont les réponses de ces personnes aux questions posées lors de l’enquête. Chaque cellule du tableau représente la réponse de l’individu i à la question j.
Les réponses sont appelées des « variables » puisqu’elles varient d’un individu { l’autre. En plus, une question peut être transformée (encodée) en une ou plusieurs « variables » cela dépend de la nature de la question.
Sous SPSS, cette étape se traduit par l’élaboration d’un fichier base de données « Data Set SPSS » qui doit se faire en trois temps :
Un premier pour la préparation du fichier « base de données SPSS
» ;
Un deuxième pour la saisie des données, et
Un troisième pour les opérations de modification des propriétés des
variables.
I. PREPARATION DU FICHIER « BASE DE DONNEES SPSS »
La préparation du fichier « base de données SPSS » passe par deux étapes. Une première pour la définition et l’encodage des variables. Puis une
23
Analyse de données avec SPSS
deuxième pour la préparation des paramètres du fichier « base de données ».
1. Définition des variables et Encodage des questions
La phase de définition des variables et l’encodage permet la transformation des questions pour les rendre compatibles avec les traitements offerts par le logiciel SPSS. Elle comprend essentiellement deux tâches :
La première consiste à définir les noms des variables de la matrice.
La seconde définit des codes simples (généralement numériques)
pour les différentes modalités de chaque variable.
En résumé, pour chaque question je définis une ou plusieurs variables que je dois nommer. En suite pour chaque variable je dois définir les modalités qui représentent les réponses possibles à chaque question. Ces modalités seront codées (par exemple par un code numérique ou autre).
Pour des commodités pratiques, il est conseillé d’utiliser une copie vierge du questionnaire sur laquelle seront indiqués : le numéro de la variable, son code-nom « nom de variable », et l’encodage des réponses (modalités).
une autre commodité pratique consiste à numéroter les questionnaires remplis selon une suite arithmétique (1,2 3…).
L’encodage des modalités, dépend de la nature des questions selon les modes suivants :
a. Questions à réponse unique
(dichotomiques ou multichotomiques)
Les questions dichotomiques et multichotomiques sont celles qui offrent une liste de réponses (deux ou plus) pour lesquelles le répondant est contraint de ne choisir qu’une seule.
Pour les questions dichotomiques (répondre par oui ou non) les codes utilisés sont généralement « 1 » pour la réponse « oui » et « 0 » pour la réponse « non »
24
Analyse de données avec SPSS
En ce qui concerne les questions multichotomiques (à choix multiples à une réponse) chaque réponse aura un code unique (généralement numérique) selon une suite ordonnée ; 1, 2, 3….
b. Questions à choix multiples à plusieurs réponses possibles
Durant les études nous pouvons poser des questions qui offrent à l’interviewé la possibilité de choisir parmi une liste d’alternatives un ou plusieurs choix. Dans ce cas il faudra considérer chaque alternative comme étant une question fermée séparée.
Une alternative acceptée par l’enquêté (cochée) sous entend la réponse « oui » et par conséquent le code « 1 » lui sera affecté. Au contraire une réponse ignorée (non cochée) sous-tend la réponse « non », on lui accorde le code « 0 »
BN : bien entendu cet éclatement d’une seule et même question en autant de variables (colonnes dans la matrice de données) que de possibilités sera inversé (réponses regroupées) par la fonctionnalité « réponse multiple » (voir section III du présent chapitre).
c. Questions à échelles
A travers ces questions on donne la possibilité au prospect de juger ou évaluer le niveau d’acceptation concernant une marque ou un critère bien déterminé.
Exemple 1 :
Pour l’affirmation suivante : « les services proposés par nos boutiques répondent parfaitement à vos attentes » êtes-vous : Pas du tout d’accord (1) ; pas d’accord (2) ; plutôt d’accord (3) ; d’accord (4) ; tout { fait d’accord (5).
Exemple 2 :
Comment trouvez-vous la qualité de nos services ? : Pas du tout satisfaisant (1) ; pas satisfaisant (2) ; plutôt satisfaisant (3) ; satisfaisant (4) ; tout à fait satisfaisant (5).
25
Analyse de données avec SPSS
d. Questions de classement
Elle permet au sondé de classer les différentes propositions dans l’ordre de ses préférences. Pour ce type de question chaque alternative (critère) sera mise dans une colonne séparée (chaque alternative forme une variable), puis le code affecté à chaque critère (variable) ne sera autre que l’ordre de préférence du sondé (qui varie de 1 à n).
Exemple :
Classez par ordre de préférence vos critères de choix d’une marque de shampoing :
Prix Assortiment Emballage Qualité des produits
Cette question se traduira en quatre variables (quatre colonnes dans la matrice de données) où pour chaque colonne les réponses possibles sont : de 1 (le plus préféré) à 4 (le moins préféré)
e. Question de notation
Cette question permet de noter une liste de critères ou marques selon un barème (sur 5 ou 10 par exemple). Dans ce cas la note représente le code.
les questions personnelles (ou comme
NB : l’encodage doit comprendre toutes les questions posées, y compris indiqué dans beaucoup d’enquêtes « fiche signalétique »). Je constate souvent cet oubli chez les étudiants, ça leur cause des difficultés lors de l’analyse notamment au niveau du croisement.
26
Analyse de données avec SPSS
2. Définition des paramètres du fichier « Base de données SPSS »
l’encodage,
le poste Après avoir terminé d’ordinateur pour préparer sa maquette de travail. Il accède au logiciel, ouvre une nouvelle requête, passe à la fenêtre principale Variable View (Section I chapitre 1).
l’étudiant passe devant
Il obtient l’affichage suivant :
La définition des paramètres du fichier consiste à remplir pour chaque variable une dixaine de champs d’information
a. Name
Sous la colonne intitulée Name, on indique le nom de la variable. Seuls les caractères alphabétiques et numériques sont acceptés. À l’exception du tiret bas (_), les caractères spéciaux tels que l’espace ou la virgule par exemple ne sont pas autorisés. En plus, dans des versions antérieures le nom ne doit pas comporter plus que huit caractères. Les versions postérieures à SPSS 16.0 acceptent jusqu’{ 64 caractères.
Pour le choix du nom de la variable, il est préférable d’utiliser un code simple et rappelant rapidement la question posée.
Exemple :
Pour la question « combien de fois par semaine visitez-vous la bibliothèque ? » ; il est possible d’utiliser le nom: visit_biblio
Une fois le nom saisi, on tape Enter pour valider cette entrée. Les propriétés par défaut de la variable sont alors inscrites :
27
Analyse de données avec SPSS
b. Type
Le champ Type permet de spécifier le type de données pour chaque variable. Le type numérique Numeric s’affiche par défaut. Pour le changer, il suffit de cliquer sur le champs Numeric , puis sur le rectangle gris qui apparait. La fenêtre Variable Type apparait et permet de choisir le type de variable désiré.
Le type Comma ou Dot peut être utilisé lorsque le code numérique comporte plusieurs chiffres et l’on veut séparer chaque trois chiffres par des points ou des virgules.
Le type String est choisit pour un codage alphabétique.
Publicité
c. Width-Decimals
Le champ width définit le nombre de caractères autorisé pour la saisie des données. Les Decimals définissent pour les données numériques, le nombre des décimales après la virgule. Les valeurs 8 et 2 sont introduites par défaut.
La modification de ces valeurs peut se faire directement sur les champs width et Decimals ou à travers la fenêtre de définition du type de la variable.
28
Analyse de données avec SPSS
d. Label ou étiquelle
Le Label (étiquette) permet de faire un descriptif de la variable surtout que le champ du nom n’accorde pas ce confort. En plus, la phrase inscrite dans ce champ remplacera le nom de la variable dans les tableaux et graphiques lors de la génération des résultats. Elle apparait également dans la liste des variables lors de l’analyse, ce qui facilité la sélection.
e. Values
Ce champ permet d’introduire les modalités (codes) de la variable.
Exemple :
Pour la question « combien de fois par semaine visitez-vous la bibliothèque ? »
Une à deux fois par semaine (codée 1) Trois à 5 fois par semaine (codée 2) Tous les jours (codée 3)
Pour introduire ces valeurs :
i.
ii.
iii.
iv.
v.
vi.
cliquer sur la case de Values,
cliquer sur l’icône grise où sont inscrits trois points (...)
lorsque la fenêtre Value Labels s’affiche, inscrire le code numérique (le chiffre 1 par exemple) dans le champ Value et la réponse correspondante (Une à deux fois par semaine) dans le Label,
valider en cliquant sur Add,
répéter ces étapes pour les réponses 2 et 3,
cliquer sur OK pour valider et quitter.
29
Analyse de données avec SPSS
f. Missing
Cette fonctionnalité peut être utile dans le cas où l’on veut distinguer entre une personne qui a refusé de répondre ou parce que la question ne lui concerne pas. Une valeur par défaut sera alors introduite par exemple 999.
g. Columns
Ce champ définit la largeur de la colonne pour la variable en question. Les valeurs 8 pour type numérique et 12 pour type caractères sont sélectionnées par défaut.
30
Analyse de données avec SPSS
h. Align
L'alignement du texte dans la colonne (Left : à gauche; Right : à droite; Center : centré).
i. Measure
Le champ Measure, permet de définir l'échelle de mesure des données saisies.
La mesure Scale désigne une variable numérique avec échelle (continue ou discrète). Ordinal désigne une échelle ordinale : existence d’un ordre de préférence dans les réponses (quantitatives discrètes ou qualitatives ordonnées). La mesure Nominal est choisie pour les variables qualitatives sans ordre de préférence telle que le genre ou la région…
j. Rôle
Cette option s’occupe de la préparation des données : analyse les données, identifie les corrections, supprime les champs problématiques ou inutiles, dérive de nouveaux attributs si nécessaire et améliore les performances grâce { des techniques d’analyse intelligentes.
Il est possible d’utiliser le mode complètement automatique, le laissant choisir et appliquer les corrections ou le mode interactif qui prévoit les modifications avant qu’elles ne soient effectuées.
Le rôle d'un champ indique comment il est utilisé lors de la création de modèles, par exemple, s'il s'agit d'un champ d'entrée (variable indépendante) ou d'un champ cible (sortie ou cible pour le modèle).
31
Analyse de données avec SPSS
II. SAISIE DES DONNEES
1. Préparer la saisie
La saisie des données consiste à introduire les réponses des interviewés dans la base de données préparée.
Pour ce faire, il faut passer à la fenêtre Data View (en bas à gauche) pour l’affichage des données.
Remarque : Il est impératif de numéroter (de 1 à n) tous les questionnaires remplis avant toute saisie. Cette opération bien qu’elle soit très simple, s’avère d’une grande importance pour corriger les erreurs de saisie qui sont fréquentes notamment pour les grands échantillons.
La saisie des données s’opère par questionnaire rempli. Chaque questionnaire (ou individu interviewé) occupe une ligne dans la matrice des données.
La saisie doit obligatoirement respecter la numérotation des questionnaires. En effet, le numéro de la ligne des réponses doit correspondre au numéro du questionnaire saisi.
2. Exemples de saisie
Nous présentons ci-après quelques exemples de saisie de réponses.
Exemple1 : Classement des critères selon la préférence
La proposition : Classez par ordre de préférence vos critères de choix d’une marque de shampoing.
Prix Assortiment Emballage Qualité des produits
La réponse de l’interviewé est comme suit : La qualité des produits en première position ; par la suite le prix ; en troisième lieux l’emballage et l’assortiment en dernière position.
32
Analyse de données avec SPSS
Les réponses saisies pour l’individu en question seront dans l’ordre des colonnes : 2 pour le prix ; 4 pour l’assortiment ; 3 pour l’emballage et 1 pour la qualité des produits
Exemple 2 : Combien de fois par semaine visitez-vous la bibliothèque ? Une à deux fois par semaine (codée 1) Trois à 5 fois par semaine (codée 2) Tous les jours (codée 3)
Les réponses de deux interviewés (codés 1 et 2) sont comme suit : La première personne a répondu « trois à 5 fois » alors que la deuxième a répondu « tous les jours ».
Les réponses saisies seront 2 et 3 respectivement pour les lignes 1 et 2.
Exemple 3 : « noter de 1 à 10 les propositions suivantes (1 totalement fausses ; 10 parfaitement correcte) Projet 1 : (note accordée 7/10) Projet 2 : (note accordée 8/10) Projet 3 : (note accordée 6/10) Projet 4 : (note accordée 7/10)
33
Analyse de données avec SPSS
Exemple 4 : à quel titre avez-vous collaborez avec l’ISET ?
Travail de recherche ☑ Organisation ou participation à des séminaires ☑ Stages et Projets de Fin d’Etudes Autres (à préciser) : …………………………………….
Formation continue
Remarque : Pour la réponse « autre », chaque fois qu’une nouvelle réponse apparait, il est possible de l’introduire en tant que nouvelle variable. Dans ce cas, passer au mode affichage des variables, placer le curseur dans l’endroit souhaité choisir le menu édit puis insert variable.
34
Analyse de données avec SPSS
À la fin de l’opération de saisie, nous disposons de la matrice des données.
35
Analyse de données avec SPSS
III. MODIFICATION DES
Publicité
PROPRIETES DES VARIABLES.
Dans des situations particulières, nous sommes parfois amenés à changer les propriétés des variables voir même créer de nouvelles variables issues des variables initiales.
Sans prétendre faire le tour de toutes les possibilités de modifications, cette section du chapitre tente d’exposer quelques exemples.
1. Définir une variable multiple
Comme nous l’avons avancé lors de l’encodage, les questions à plusieurs choix sont éclatées en autant de variables que d’alternatives. Ce qui donnerait des résultats séparés (des tableaux et graphiques séparés pour chaque réponse de la même question). Or, toutes ces variables représentent une seule et unique question, nous pouvons avoir besoin de voir tous les résultats dans un seul tableau. Nous définissons alors une variable à réponses multiples.
Pour l’illustration, considérons l’exemple suivant :
Exemple : à quel titre avez-vous collaborez avec l’ISET ?
Travail de recherche Organisation ou participation à des séminaires Autres (à préciser) : …………………………………….
Formation continue Stages et Projets de Fin d’Etudes
La procédure de définition de la variable multiple est comme suit :
i.
Sélectionner le menu Analyse choisir Multiple Response puis Define Variable Sets ;
36
Analyse de données avec SPSS
La fenêtre Define Multiple Response Set s’affiche
ii.
iii.
iv.
v.
Dans la liste initiale des variables (à gauche) placer les variables de la réponse multiple dans la zone au centre Variable in Set:
Ensuite, dans le champ Counted Value saisir le chiffre 1 (code de la réponse « oui »)
Saisir le nom de la nouvelle variable (par exemple : collaboration)
Cliquer sur Add pour valider, puis Close pour sortir.
37
Analyse de données avec SPSS
NB : après validation, la variable multiple n’apparait pas dans la liste des variables initiales. Pour afficher le tableau des réponses il suffit de reprendre le menu Analyse Multiple Response Fréquencies
2. Calcul d’une nouvelle variable
(à partir d’une formule)
Pour certaines études, il est parfois nécessaire de définir selon des formules bien déterminées, une ou plusieurs nouvelles variables calculées en fonction des variables initiales.
a. Exemple : motivation des étudiants1 (1)
Les questions posées durant l’enquête sont relatives à 7 types de motivation. Le questionnaire comprend 14 items répartis sur les types de motivation2 codés
Les sept types de motivation et les items sont codés :
MIC : Motivation intrinsèque liée à la connaissance : Les deux items
correspondants sont codés MIC1 et MIC2 ;
MIA : Motivation intrinsèque liée à l'accomplissement, les items
MIA1 et MIA2 ;
MIS : Motivation intrinsèque liée à la stimulation, les items MIS1 et
MIS2 ;
MIED : Motivation extrinsèque de type régulation identifiée, les
items MEID1 et MEID2 ;
MEIN : Motivation extrinsèque de type régulation introjectée, les
items MEIN1 et MEIN2 ;
MERE : Motivation extrinsèque de type régulation externe, MERE 1
et MERE2)
AMOT : Amotivation, AMOT1 et AMOT2.
Les réponses étaient portées sur une échelle de Likert en sept points allant de (1) « Pas du tout d’accord » { (7) « Tout { fait d’accord ».
L’étude vise le calcul d’un Index général de motivation (IGM) pour chaque individu enquêté. La formule est la suivante :
1 Exemple tiré d’une étude du degré de motivation des étudiants Tunisiens { adhérer { un cours utilisant des technologies de communication 2 Inspirées de l’Échelle de Motivation dans les Études (EME), développée par Vallerand et al. (1989).
38
Analyse de données avec SPSS
IGM = 2*(MIS+MIC+MIA)/3 +MEID – (MERE+MEIN)/2+2*AMOT)
b. Variables à calculer
Pour les besoins de l’étude, il est nécessaire de définir la variable qui détermine l’indice général de motivation pour chaque étudiant.
Cette opération doit se dérouler en deux temps :
i.
Définir les sept sous échelles : il s’agit de définir sept nouvelles variables correspondant chacune à un type de motivation. Chaque nouvelle variable est définie par la moyenne des deux items qui la composent ;
ii.
calculer l’IGM selon la formule avancée.
c. Illustration sous SPSS
i.
Accéder au menu Transform, puis Compute Variable.
Cette commande permet de créer une nouvelle variable à partir des variables initiales.
ii.
La fenêtre compute variable s’affiche, ce qui permet de calculer les différents types de motivation. (illustration pour l’item MIC) :
saisir dans Target Variable le nom de la nouvelle variable à calculer (MIC) ;
dans la liste des formules à droite sélectionner Mean (moyenne) et
cliquer sur la flèche bleue (à droite des boutons numérique)
saisir la formule par le déplacement des MIC1 et MIC2 dans la case Numeric Expression (utiliser les flèche en bleu) ; la formule devient MEAN(MIC1;MIC2) ;
39
Analyse de données avec SPSS
Valider par OK, et répéter la même opération pour les six autres
variables.
iii.
Calcul de l’Index Général de Motivation (IGM)
Publicité
Il suffit de suivre la même procédure en saisissant la formule de calcul de l’IGM.
En revenant à la fenêtre affichage des variables, on remarque bien les nouvelles variables et leurs valeurs.
40
Analyse de données avec SPSS
3. Regroupement des valeurs en classes (mise en classes)
Autre modification possible sur le regroupement en classes. Cette opération consiste à effectuer un recodage de la variable.
les variables de données est
Il est possible d’écraser l’ancienne variable Transform Recode Into Same Variable. Ou définir une nouvelle variable et préserver l’ancienne. Transform Recode Into Different Variable.
a. Exemple : motivation des étudiants
(2)
fournit
dernier
En reprenant l’exemple de l’Index Général de motivation calculé (IGM ; 2, a), niveau ce d’autodétermination3 . Plus l’IGM est élevé, plus l’étudiant est auto- déterminé dans son apprentissage. Plus il est faible, l’étudiant adopte un comportement non auto-déterminé.
parcimonieuse
une mesure
du
3 Blais, Sabourin, Boucher et Vallerand, 1990 ; Fortier et al., 1995 ; Grolnick et Ryan, 1987 ; Vallerand et Bissonnette, 1992.
41
Analyse de données avec SPSS
Théoriquement l’IGM peut varier entre -18 et +18. On se propose alors de définir des classes (intervalles) regroupant les étudiants dans les différents niveaux d’autodétermination.
Par exemple : (ceci n’est qu’une hypothèse)
Comportement très fortement non autodéterminé : -18 ≤ IGM < -11 Comportement fortement non autodéterminé : -11 ≤ IGM < -4 Comportement moyennement autodéterminé : -4 ≤ IGM ≤+4 Comportement fortement autodéterminé : 4 < IGM ≤ 11 Comportement très fortement autodéterminé : 11 < IGM ≤ 18
b. Illustration sur SPSS
i.
Accéder à la fenêtre Recode Into Different Variable
ii.
Dans la liste des variables à gauche, sélectionner la variable IGM et la déplacer dans (remarquez qu’un point d’interrogation apparait devant la variable) ;
la case centrale
iii.
A droite de la fenêtre saisir le nom de la nouvelle variable Name (par exemple : auto_Deter) et si l’on souhaite le Label. Cliquer sur Change.
42
Analyse de données avec SPSS
iv.
v.
Pour entrer les valeurs de la nouvelle variable cliquer sur Old and New Values ; Une nouvelle fenêtre s’affiche.
Sélectionner le champ Range pour saisir les deux valeurs extrêmes du premier intervalle.
vi. Dans la case New Value (à droite) saisir 1 pour Value puis valider
par Add.
43
Analyse de données avec SPSS
vii.
Répéter la même opération pour tous les intervalles et valider l’opération en cliquant sur Continue ; puis OK.
4. Agrégation des données
Souvent appliquée après une ACP4, ou pour le traçage d’une carte perceptuelle lors d’une étude de positionnement, l’agrégation des données permet de créer une nouvelle base de données et calculer les moyennes observées pour différentes modalités d’une variable qualitative.
a. Exemple 1
Lors d’une étude d’un groupe d’étudiants, nous cherchons à tracer une représentation graphique qui montre la dispersion des d’étudiants dans un plan composé de deux variables créées { partir d’une ACP.
Nous souhaitons faire le regroupement des étudiants par niveau d’étude.
L’agrégation des données permettra de regrouper dans une nouvelle base de données, les étudiants par niveau d’étude, puis de calculer une valeur moyenne pour chaque niveau sur chacune des deux variables.
b. Illustration sur SPSS
L’opération se conduira comme suit :
4 Analyse en Composante Principale, à voir en détail au chapitre 5
44
Analyse de données avec SPSS
i.
Dans le menu Données accéder au sous menu Agréger,
ii.
dans la boite de dialogue Agréger les données, utiliser la variable niveau comme critère d’agrégation et les facteurs comme variables agrégées,
iii.
cocher l’option Créer un nouveau fichier… et valider,
45
Analyse de données avec SPSS
NB : le logiciel accorde automatiquement le nom aggr.sav pour le nouveau fichier et le place dans le dossier Documents. Cliquer sur Fichier si l’on veut modifier le nom et/ou l’emplacement.
iv.
Accéder au nouveau fichier et sélectionner Dispersion/points ou Scatter/Dot,
v.
dans la nouvelle fenêtre choisir Dispersion simple puis Définir,
vi.
vii.
viii.
Dans la boite de dialogue, placer chaque variable dans le champ approprié et cliquer sur l’icône Options,
cocher l’option Afficher le diagramme avec les étiquettes des observations,
la validation permet d’afficher le diagramme dispersion dans les résultats.
46
Analyse de données avec SPSS
47