Estimation des densités de probabilité
Ce document présente les principales méthodes d’estimation des densités de probabilité, destinées aux étudiants en statistique ou apprentissage automatique. Il détaille les approches paramétriques et non paramétriques, ainsi que des techniques spécifiques comme l’histogramme, les k-plus proches voisins, la méthode des noyaux et l’estimation par fonctions orthogonales.
D'après le document Estimation des densités de probabilité
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Statistiques, Apprentissage Machine · PDF · 4 pages · 2014
Afficher l'aperçu du document
Ce document présente les principales méthodes d’estimation des densités de probabilité, destinées aux étudiants en statistique ou apprentissage automatique. Il détaille les approches paramétriques et non paramétriques, ainsi que des techniques spécifiques comme l’histogramme, les k-plus proches voisins, la méthode des noyaux et l’estimation par fonctions orthogonales.
Introduction à l’estimation des densités de probabilité
L’estimation des densités de probabilité vise à déterminer la fonction de densité f d’une variable aléatoire X à partir d’un échantillon (X1, X2, …, XN). Cette fonction est souvent inconnue et doit être estimée pour diverses applications, notamment en classification statistique où la vraisemblance et les probabilités a priori sont nécessaires mais rarement connues.
Deux grandes familles de méthodes existent :
- Méthodes paramétriques : on suppose que la densité appartient à une famille paramétrable (exemple : gaussiennes) et on ajuste les paramètres pour minimiser l’erreur.
- Méthodes non paramétriques : on estime la densité directement à partir des données sans hypothèse forte sur la forme de la densité, ce qui est utile pour des distributions complexes ou multimodales.
Méthodes non paramétriques
Ces méthodes estiment la densité dans le voisinage local d’un point x, en utilisant un paramètre de lissage qui détermine l’étendue du voisinage. Ce paramètre peut être :
- Le nombre de points K dans le voisinage (méthode des k-plus proches voisins, KNN).
- La largeur h du voisinage (méthode des noyaux ou fenêtres de Parzen).
On note (X1, X2, …, XN) un échantillon de réalisations de la variable aléatoire X de densité inconnue f. L’objectif est d’estimer f à partir de ces observations.
Méthode de l’histogramme
Cette méthode consiste à diviser l’espace d’observation en intervalles (ou cases) de largeur constante hN. Pour un intervalle k, on compte le nombre de points Nk qui s’y trouvent. L’estimation de la densité dans cet intervalle est donnée par :
fˆN(x) = Nk / (N × hN) pour x ∈ Ik
où Ik = [a + k hN, a + (k+1) hN[ est le kème intervalle.
Convergence : Pour que l’estimateur converge vers la vraie densité en moyenne quadratique intégrée, il faut que :
- NhN → +∞
- hN → 0
En pratique, on choisit souvent hN proportionnel à N^(-1/3).
Importance du choix du pas hN
Le paramètre hN contrôle le compromis biais-variance :
- Un hN trop petit produit un estimateur très bruité, sensible aux fluctuations aléatoires.
- Un hN trop grand lisse excessivement la densité, masquant des caractéristiques importantes comme la multimodalité.
Méthode des k-plus proches voisins (KNN)
Cette méthode fixe un entier k(N) entre 1 et N, puis pour chaque point x, on cherche le plus petit intervalle centré sur x contenant k(N) points de l’échantillon. L’estimation de la densité en x est alors :
fˆN(x) = k(N) / (N × volume(Ix,r))
où Ix,r est l’intervalle centré en x de rayon r contenant k(N) points.
La méthode adapte automatiquement la taille du voisinage selon la densité locale des points.
Méthode des noyaux (Kernel Density Estimation, KDE)
La méthode des noyaux estime la densité en sommant les contributions pondérées des points xi autour de x, avec un noyau K et un paramètre de lissage hN :
fˆN(x) = (1 / (N × hN)) × ∑_{i=1}^N K((x - Xi) / hN)
Le noyau K est une fonction de densité symétrique centrée en 0, vérifiant :
- ∫ K(u) du = 1
- ∫ u^j K(u) du = 0 pour j = 1, ..., k (ordre du noyau)
Le noyau est nécessairement une fonction paire (symétrique).
Exemples de noyaux d’ordre 2
| Noyau | Formule K(u) |
|---|---|
| Uniforme | K(u) = 1/2 si |u| ≤ 1, 0 sinon |
| Triangle | K(u) = 1 - |u| si |u| ≤ 1, 0 sinon |
| Epanechnikov | K(u) = 3/4 (1 - u^2) si |u| ≤ 1, 0 sinon |
| Gaussien | K(u) = (1 / √(2π)) × exp(-u^2 / 2) pour tout u |
Importance du paramètre de lissage hN
La largeur hN du noyau détermine le degré de lissage :
- Un hN trop petit rend l’estimation sensible au bruit.
- Un hN trop grand fait perdre les caractéristiques essentielles de la densité, comme la bimodalité.
En général, la largeur du noyau a un impact plus important que la forme du noyau.
Estimation par les fonctions orthogonales
Cette méthode consiste à représenter la densité f comme une série dans une base de fonctions orthogonales (par exemple trigonométriques) :
f(x) = ∑_{m=0}^∞ a_m e_m(x)où (e_m) sont des fonctions orthogonales connues et (a_m) les coefficients de Fourier de f.
En pratique, on tronque la série à un ordre k :
f_k(x) = ∑_{m=0}^k a_m e_m(x)
Les coefficients a_m sont estimés à partir de l’échantillon :
â_m = (1 / N) × ∑_{i=1}^N e_m(X_i)
L’estimation de f devient alors :
fˆ_N(x) = ∑_{m=0}^k â_m e_m(x)
Exemple de base orthogonale trigonométrique sur [-π, π]
- e_0(x) = 1 / √(2π)
- e_{2i-1}(x) = cos(i x) / √π, i ≥ 1
- e_{2i}(x) = sin(i x) / √π, i ≥ 1
Glossaire des termes clés
- Densité de probabilité f : fonction décrivant la répartition d’une variable aléatoire continue.
- Paramètre de lissage (hN) : paramètre contrôlant la taille du voisinage dans les méthodes non paramétriques.
- Histogramme : méthode d’estimation consistant à compter les points dans des intervalles fixes.
- K-plus proches voisins (KNN) : méthode qui fixe le nombre de points dans le voisinage et adapte la taille du voisinage en conséquence.
- Fenêtres de Parzen / Méthode des noyaux : méthode d’estimation utilisant une fonction noyau centrée sur chaque point de l’échantillon.
- Noyau K : fonction de densité symétrique utilisée pour pondérer les points dans la méthode des noyaux.
- Fonctions orthogonales : famille de fonctions mutuellement orthogonales utilisée pour représenter une densité sous forme de série.
- Coefficient de Fourier a_m : coefficient associé à la fonction orthogonale e_m dans la décomposition de la densité.
Points clés à retenir
- L’estimation des densités peut être paramétrique (modèle fixé) ou non paramétrique (modèle libre).
- Les méthodes non paramétriques sont adaptées aux distributions complexes et multimodales.
- Le choix du paramètre de lissage (hN ou k) est crucial pour obtenir une bonne estimation.
- La méthode des noyaux est une généralisation de l’histogramme avec un lissage plus souple.
- L’estimation par fonctions orthogonales permet de représenter la densité comme une série et d’estimer ses coefficients.
Commentaires
Aucun commentaire pour le moment. Posez la première question.