Corrigé
Analyse multidimensionnelle des performances des athlètes
Corrigé complet d'un exercice d'analyse en composantes principales (ACP) sur des données de décathlon. Il détaille la standardisation, le calcul des valeurs propres manquantes, le choix du nombre d'axes factoriels et l'interprétation sportive des dimensions.
D'après le document Analyse multidimensionnelle des performances des athlètes
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Sports Performance Analysis · PDF · 5 pages
Afficher l'aperçu du document
Ce devoir porte sur l’analyse multidimensionnelle des performances des athlètes lors de deux événements sportifs, à partir d’un jeu de données décrivant 10 variables mesurées sur plusieurs athlètes. Il s’agit d’un exercice d’analyse en composantes principales (ACP) visant à tester la compréhension des méthodes statistiques multivariées, l’interprétation des résultats et la capacité à justifier les choix méthodologiques.
Exercice 1 - Standardisation des données et loi des nouvelles données
La standardisation des données est indispensable en analyse en composantes principales lorsque les variables sont mesurées dans des unités ou sur des échelles différentes.
Les variables mesurées (par exemple, temps au 100m, longueur au saut en longueur, poids du lancer de disque, etc.) ont des unités très variées : le 100m est en secondes, le saut en longueur en mètres, le lancer de poids en mètres, etc. Si on réalise une analyse sans standardiser, les variables ayant la plus grande variance ou la plus grande échelle domineront la construction des axes factoriels.
La standardisation consiste à centrer chaque variable (soustraire la moyenne) et à la réduire (diviser par son écart-type). Ainsi, chaque variable a une moyenne nulle et une variance égale à 1, ce qui donne à chaque variable la même importance dans l’analyse.
Après standardisation, les nouvelles données suivent une loi centrée réduite (moyenne 0, variance 1). Si les données initiales étaient distribuées selon une loi normale, chaque nouvelle variable suit une loi normale centrée réduite N(0, 1).
Réponse : Il faut standardiser les données pour éviter que les variables à grande variance dominent l’analyse. Les nouvelles données sont centrées réduites, donc chaque variable suit une loi centrée réduite de moyenne 0 et de variance 1.
Exercice 2 - Valeurs propres et leur signification
Pour déterminer la valeur propre manquante de la première dimension, on utilise la propriété de la somme des valeurs propres en ACP normée.
Le tableau des valeurs propres (eigenvalues) et pourcentages de variance expliquée est donné partiellement :
| Dimension | Valeur propre | % variance | % variance cumulée |
|---|---|---|---|
| Dim.1 | ? | ? | ? |
| Dim.2 | 1.839 | 18.39 | 59.6 |
| Dim.3 | 1.239 | 12.39 | 72.0 |
| Dim.4 | 0.819 | 8.19 | 80.2 |
| Dim.5 | 0.702 | 7.02 | 87.2 |
| Dim.6 | 0.423 | 4.23 | 91.5 |
| Dim.7 | 0.303 | 3.03 | 94.5 |
| Dim.8 | 0.274 | 2.74 | 97.2 |
| Dim.9 | 0.155 | 1.55 | 98.8 |
| Dim.10 | 0.122 | 1.22 | 100.0 |
En ACP centrée réduite, la somme des valeurs propres est égale au nombre total de variables, soit 10 ici.
Pour trouver la valeur propre de Dim.1, on calcule d'abord la somme des valeurs propres connues de Dim.2 à Dim.10 :
1.839 + 1.239 + 0.819 + 0.702 + 0.423 + 0.303 + 0.274 + 0.155 + 0.122 = 5.876
Donc, valeur propre Dim.1 = 10 - 5.876 = 4.124
Pour le pourcentage de variance expliquée par Dim.1 :
% variance Dim.1 = (4.124 / 10) × 100 = 41.24%
La variance cumulée à Dim.1 est de 41.24%. À la Dim.2, elle atteint 41.24% + 18.39% = 59.63% (ce qui correspond au 59.6% arrondi figurant dans le tableau).
Signification d’une valeur propre : La valeur propre associée à un axe factoriel i mesure la quantité de variance (l'inertie) expliquée par cet axe. Plus la valeur propre est élevée, plus l’axe synthétise une part importante de l’information contenue dans le jeu de données initial.
Réponse : La valeur propre de Dim.1 est 4.124, expliquant 41.24% de la variance. La valeur propre d’un axe mesure la variance expliquée par cet axe.
Exercice 3 - Choix du nombre d’axes factoriels
Le choix du nombre de composantes à retenir repose sur des règles empiriques adaptées à la structure de la variance expliquée.
- Méthode de Kaiser : On conserve uniquement les axes dont la valeur propre est strictement supérieure à 1 (c'est-à-dire les axes qui expliquent plus d'information qu'une variable individuelle standardisée).
- Méthode du coude (scree plot) : On observe le graphique de décroissance des valeurs propres et on retient les axes situés avant le point d'inflexion (« coude ») où la baisse devient faible et régulière.
L'évaluation des valeurs propres supérieures à 1 donne :
- Dim.1 : 4.124 > 1
- Dim.2 : 1.839 > 1
- Dim.3 : 1.239 > 1
- Dim.4 : 0.819 < 1
Selon la méthode de Kaiser, on retient 3 axes factoriels.
Selon la méthode du coude, la baisse est marquée entre Dim.1 (4.124) et Dim.2 (1.839), puis entre Dim.2 et Dim.3 (1.239), à partir de quoi la pente s'adoucit considérablement. Le coude se situe après la deuxième dimension, ce qui conduit à retenir 2 axes.
L'énoncé se concentre principalement sur la description des dimensions 1 et 2 et indique une variance cumulée de 59.6% sur ces deux premiers axes, ce qui montre que c'est la méthode du coude (ou un critère de restitution de l'ordre de 60% de la variance) qui a été appliquée.
Réponse :
- Méthode de Kaiser : 3 axes retenus.
- Méthode du coude : 2 axes retenus.
- L’énoncé privilégie l'analyse sur 2 axes (méthode du coude), car il restitue près de 60% de l'information cumulée sur les deux premières dimensions.
Exercice 4 - Interprétation des axes et positionnement des variables
L'analyse des corrélations entre les variables initiales et les axes factoriels permet d'attribuer une signification physique et sportive aux deux dimensions.
Corrélations des variables avec la Dimension 1 :
- Long.jump : +0.794
- Discus : +0.743
- Shot.put : +0.734
- High.jump : +0.610
- Javeline : +0.428
- X400m : -0.702
- X110m.hurdle : -0.764
- X100m : -0.851
Les épreuves de saut et de lancer présentent une corrélation positive forte avec Dim.1. Inversement, les épreuves de course chronométrées (100m, 110m haies, 400m) ont une corrélation fortement négative. En athlétisme, un temps plus court au 100m correspond à une meilleure performance ; le signe négatif indique donc qu'un score élevé sur Dim.1 caractérise un athlète performant à la fois en vitesse et en explosivité/force.
La Dimension 1 oppose ainsi le profil « explosivité / force / vitesse » aux performances plus faibles sur ces épreuves.
Corrélations des variables avec la Dimension 2 :
- Pole.vault : +0.807
- X1500m : +0.784
- High.jump : -0.465
La Dimension 2 est fortement portée par le saut à la perche (+0.807, contribution de 35.46%) et le 1500m (+0.784, contribution de 33.47%). Elle oppose les athlètes performants en endurance (1500m) et à la perche à ceux ayant de meilleures performances au saut en hauteur (-0.465).
Réponse : La Dimension 1 représente un axe général de performance explosive (vitesse, sauts et lancers). La Dimension 2 représente un axe d'endurance et de technicité spécifique (1500m et saut à la perche vs saut en hauteur).
Exercice 5 - Positionnement des individus et formation de groupes
Le regroupement des individus sur le plan factoriel repose sur la proximité de leurs coordonnées le long des axes principaux.
En ACP, deux individus proches sur le premier plan factoriel partagent des profils de performance similaires sur l'ensemble des 10 épreuves du décathlon.
Bien que le document extrait ne comporte pas le graphique de la carte des individus ni leurs coordonnées chiffrées, la typologie des variables permet d'anticiper la structure des groupes.
On peut s'attendre à observer une séparation entre les décathloniens complets (forts sur Dim.1) et les spécialistes d'épreuves spécifiques (par exemple les profils plus endurants positionnés haut sur Dim.2).
Réponse : La formation de groupes est conceptuellement possible en fonction du positionnement des athlètes sur les deux axes, opposant les profils complets/explosifs aux athlètes plus typés endurance ou technique.
Exercice 6 - Identification des groupes et caractéristiques
L'identification précise des clusters d'athlètes nécessite les données individuelles non transmises dans l'extrait.
Sans la carte factorielle des individus ni les tables de coordonnées (scores factoriels de chaque athlète), il est impossible d'attribuer des individus précis à des groupes spécifiques.
Réponse : Les données relatives aux individus étant absentes du sujet extrait, cette question ne peut pas recevoir de réponse factuelle détaillée.
Méthode - Techniques récompensées et erreurs pénalisées
Ce devoir permet d'évaluer la maîtrise pratique de l'analyse en composantes principales sur un jeu de données réelles.
Les éléments valorisés dans la correction sont :
- La justification théorique et pratique de la standardisation (centrage-réduction).
- La maitrise des propriétés des valeurs propres (somme égale au nombre de variables N=10).
- La capacité à distinguer et appliquer les critères de sélection des axes (Kaiser vs coude).
- L'interprétation correcte des corrélations variables-facteurs en tenant compte du sens des variables (temps de course vs distances/hauteurs).
- La constatation rigoureuse de l'absence de données individuelles sans invention de résultats.
Les erreurs à éviter absolument sont :
- Omettre d'expliquer l'impact des différences d'unités sur la variance.
- Faire une erreur de calcul sur la somme des valeurs propres.
- Confondre la règle de Kaiser (valeur propre > 1) avec le pourcentage de variance expliquée.
- Mésinterpréter le signe des corrélations pour les temps de course (où une valeur faible signifie une meilleure performance).
- Fabriquer des conclusions sur les individus sans support de données dans l'énoncé.