Corrigé
Analyse multidimensionnelle sur les performances des athlètes
Ce corrigé présente l'analyse en composantes principales des performances d'athlètes. Il détaille la standardisation des données, le calcul de la première valeur propre (4,124), la sélection des axes selon Kaiser et le coude, ainsi que l'interprétation des dimensions factorielles.
D'après le document Analyse multidimensionnelle sur les performances des athlètes
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Multivariate Data Analysis in Sports Performance · PDF · 5 pages
Afficher l'aperçu du document
Ce devoir porte sur une analyse multidimensionnelle appliquée aux performances d’athlètes lors de deux événements sportifs. Il s'agit d'un exercice qui teste la compréhension des techniques d’analyse en composantes principales (ACP), la manipulation des données standardisées, l’interprétation des valeurs propres, la sélection des axes factoriels, ainsi que l’interprétation des cartes factorielles des variables et des individus.
Standardisation des données
La standardisation des données est nécessaire car les variables mesurées (par exemple, temps au 100 m, distance au saut en longueur, poids du lancer de disque) ont des unités et des échelles différentes. Sans standardisation, les variables avec des échelles plus grandes domineraient l’analyse, faussant ainsi les résultats. La standardisation consiste à centrer chaque variable en soustrayant sa moyenne et à réduire en dividant par son écart-type, ce qui permet de donner à chaque variable une variance égale à 1.
Après standardisation, les nouvelles données suivent une loi normale centrée réduite (moyenne 0, variance 1) si les données initiales sont normales. Cette transformation permet d’équilibrer l’influence de chaque variable dans l’analyse.
Réponse : Il faut standardiser les données pour équilibrer l’influence des variables de différentes unités et échelles. Les nouvelles données standardisées suivent une loi normale centrée réduite (moyenne 0, variance 1).
Calcul des valeurs propres manquantes
Le calcul de la valeur propre de la première dimension s'appuie sur la propriété de la somme des variances.
| Dimension | Valeur propre | % Variance | % Variance cumulée |
|---|---|---|---|
| Dim.1 | ? | ? | ? |
| Dim.2 | 1.839 | 18.39 | 59.6 |
| Dim.3 | 1.239 | 12.39 | 72.0 |
| Dim.4 | 0.819 | 8.19 | 80.2 |
| Dim.5 | 0.702 | 7.02 | 87.2 |
| Dim.6 | 0.423 | 4.23 | 91.5 |
| Dim.7 | 0.303 | 3.03 | 94.5 |
| Dim.8 | 0.274 | 2.74 | 97.2 |
| Dim.9 | 0.155 | 1.55 | 98.8 |
| Dim.10 | 0.122 | 1.22 | 100.0 |
La somme des valeurs propres est égale au nombre de variables, ici 10. La somme des valeurs propres données (Dim.2 à Dim.10) est :
1.839 + 1.239 + 0.819 + 0.702 + 0.423 + 0.303 + 0.274 + 0.155 + 0.122 = 5.876
Donc, la valeur propre de Dim.1 est :
10 - 5.876 = 4.124
Le pourcentage de variance expliquée par Dim.1 est donc :
(4.124 / 10) × 100 = 41.24 %
La variance cumulée à Dim.1 est donc 41.24 %, et à Dim.2, 59.6 % (donné). Cela correspond.
Signification d’une valeur propre : La valeur propre associée à un axe factoriel i mesure la quantité de variance totale des données expliquée par cet axe. Plus la valeur propre est grande, plus l’axe explique une part importante de la variance des données.
Réponse : La valeur propre de Dim.1 est 4.124, expliquant 41.24 % de la variance. Une valeur propre mesure la variance expliquée par l’axe factoriel correspondant.
Sélection du nombre d’axes factoriels
Le choix du nombre d'axes dépend de la règle retenue, principalement Kaiser ou le coude d'Eboulis.
Méthode de Kaiser : Elle consiste à retenir les axes dont la valeur propre est supérieure à 1. D’après le tableau, les valeurs propres supérieures à 1 sont :
- Dim.1 : 4.124
- Dim.2 : 1.839
- Dim.3 : 1.239
Les autres valeurs propres sont inférieures à 1. Donc, selon Kaiser, on retient 3 axes.
Méthode du coude : Cette méthode consiste à tracer les valeurs propres en fonction des dimensions et à repérer le point où la pente de la courbe change brutalement (le "coude"). Ici, la variance cumulée à Dim.2 est 59.6 %, et à Dim.3 72.0 %. Le coude semble se situer après la deuxième dimension, car la chute entre Dim.1 et Dim.2 est importante, puis la décroissance ralentit.
Donc, la méthode du coude suggère de retenir 2 axes.
Méthode utilisée par l’énoncé : L’énoncé indique clairement dans le tableau que la variance cumulée à Dim.2 est 59.6 %, ce qui correspond à la retenue de deux axes. De plus, les descriptions détaillées sont données pour Dim.1 et Dim.2, ce qui montre que l’analyse se concentre sur ces deux dimensions. Cela indique que la méthode du coude est utilisée.
Réponse : Selon Kaiser, on retient 3 axes (valeurs propres > 1). Selon la méthode du coude, on retient 2 axes. L’énoncé utilise la méthode du coude, car il met l’accent sur les deux premières dimensions et leur variance cumulée.
Positionnement et interprétation des variables
L'analyse des coordonnées et des contributions permet d'attribuer une signification physique aux dimensions retenues.
| Variable | Dim.1 | Dim.2 |
|---|---|---|
| X100m | -0.851 | -0.179 |
| Long.jump | 0.794 | 0.281 |
| Shot.put | 0.734 | 0.085 |
| High.jump | 0.610 | -0.465 |
| X400m | -0.702 | 0.290 |
| X110m.hurdle | -0.764 | -0.025 |
| Discus | 0.743 | 0.050 |
| Pole.vault | -0.217 | 0.807 |
| Javeline | 0.428 | 0.386 |
| X1500m | 0.004 | 0.784 |
Sur Dim.1, les variables liées aux épreuves de vitesse (X100m, X400m, X110m.hurdle) ont des corrélations négatives fortes, tandis que les épreuves de lancer et saut (Long.jump, Shot.put, Discus, High.jump) ont des corrélations positives fortes. Cela suggère que Dim.1 oppose les performances de vitesse aux performances de force et saut.
Sur Dim.2, les variables Pole.vault (0.807) et X1500m (0.784) ont des corrélations positives élevées, tandis que High.jump a une corrélation négative modérée (-0.465). Cela pourrait indiquer que Dim.2 oppose les performances d’endurance et de saut à la perche aux performances de saut vertical.
Les contributions des variables confirment cela : Dim.1 est fortement influencée par X100m (17.54 %), Long.jump (15.29 %), Shot.put (13.06 %), X110m.hurdle (14.16 %), Discus (13.39 %), et X400m (11.94 %), tandis que Dim.2 est dominée par Pole.vault (35.46 %) et X1500m (33.47 %), avec une contribution notable de High.jump (11.77 %).
Interprétation des axes :
- Dim.1 : Axe de performance opposant vitesse (temps courts négatifs) et puissance/saut (valeurs positives).
- Dim.2 : Axe opposant les épreuves d’endurance et saut à la perche (valeurs positives) au saut vertical (valeur négative).
Réponse : Le premier axe oppose les performances de vitesse aux performances de force et saut. Le second axe oppose les performances d’endurance et saut à la perche au saut vertical. Ces axes ont un sens sportif clair.
Analyse de la position des individus
L'étude de la carte des individus nécessite leurs projections, absentes de la source.
Le document ne fournit pas explicitement les coordonnées des individus sur la carte factorielle, ni leur représentation graphique. Sans ces informations, il est impossible de commenter précisément leur positionnement ou de déterminer la formation de groupes.
Réponse : Les coordonnées des individus ne sont pas fournies, il est donc impossible de commenter leur positionnement ou de former des groupes à partir des données disponibles.
Identification et typologie des groupes
La caractérisation des groupes requiert une classification automatique ou une analyse visuelle préalable.
Comme pour la question précédente, le document ne donne pas d’informations sur la classification ou la segmentation des individus en groupes. Sans données sur les coordonnées des individus ou une analyse de regroupement, cette question ne peut pas être traitée.
Réponse : Les données nécessaires pour identifier les groupes d’individus et leurs caractéristiques ne sont pas fournies dans le document.
Méthode et synthèse
Ce devoir récompense la maîtrise des techniques d’analyse en composantes principales, notamment :
- La standardisation des données pour équilibrer les échelles et unités.
- Le calcul et l’interprétation des valeurs propres pour mesurer la variance expliquée par chaque axe.
- La sélection du nombre d’axes à retenir selon des critères objectifs comme la méthode de Kaiser ou la méthode du coude.
- L’interprétation des coordonnées et contributions des variables pour donner un sens aux axes factoriels.
- La capacité à reconnaître les limites des données fournies, notamment l’absence d’informations sur les individus empêchant l’analyse de groupes.
Les erreurs pénalisées seraient notamment :
- Ne pas standardiser les données avant l’analyse.
- Confondre la signification des valeurs propres ou mal calculer leur somme.
- Choisir un nombre d’axes sans justification claire ou sans utiliser les critères proposés.
- Interpréter les axes sans tenir compte des signes et des contributions des variables.
- Tenter de répondre à des questions sans disposer des données nécessaires.