Méthodes Paramétriques
Ce document présente les méthodes paramétriques d'estimation en statistique, particulièrement adaptées aux étudiants en sciences des données, statistique ou apprentissage automatique.
D'après le document Méthodes Paramétriques
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Statistics, Maximum Likelihood Estimation · PDF · 2 pages · 2014
Afficher l'aperçu du document
Ce document présente les méthodes paramétriques d'estimation en statistique, particulièrement adaptées aux étudiants en sciences des données, statistique ou apprentissage automatique. Il détaille la démarche du maximum de vraisemblance (MV) et du maximum a posteriori (MAP) dans le cadre de familles de distributions paramétrées, avec un focus sur les lois normales unidimensionnelles et multidimensionnelles.
Méthodes paramétriques
On considère que la densité de probabilité recherchée appartient à une famille paramétrée par un vecteur de paramètres q. Cette dépendance s’écrit alors p(x | q) au lieu de p(x). L’échantillon X = (x1, x2, ..., xN) est issu de variables indépendantes et identiquement distribuées (i.i.d.), ce qui permet d’écrire la vraisemblance globale comme le produit des densités individuelles :
p(X | q) = ∏(i=1 à N) p(xi | q)
Cette fonction de q est appelée la vraisemblance (likelihood) de q par rapport à l’échantillon X.
Cas simple : loi normale unidimensionnelle
Considérons la famille paramétrée candidate des lois normales 1D, caractérisée par le vecteur de paramètres q = (m, s²) où m est la moyenne et s² la variance. La densité s’écrit :
p(x | m, s²) = (1 / √(2π s²)) * exp(- (x - m)² / (2 s²))
La vraisemblance de l’échantillon est :
L(q) = ∏(i=1 à N) p(xi | q)
Il est souvent plus simple de travailler avec le logarithme de la vraisemblance (log-vraisemblance) :
l(q) = ln L(q) = ∑(i=1 à N) ln p(xi | q)
= - (N/2) ln(2π) - (N/2) ln s² - (1/(2 s²)) ∑(i=1 à N) (xi - m)²
Estimation par maximum de vraisemblance (MV)
L’estimation q̂ qui maximise la vraisemblance est celle qui maximise aussi la log-vraisemblance, car le logarithme est une fonction strictement croissante. Pour trouver q̂ = (m̂, ŝ²), on dérive l(q) par rapport à m et s² et on pose les dérivées égales à zéro :
∂l/∂m = (1 / s²) ∑(i=1 à N) (xi - m) = 0
∂l/∂s² = - (N / (2 s²)) + (1 / (2 s^4)) ∑(i=1 à N) (xi - m)² = 0En résolvant, on obtient :
m̂ = (1 / N) ∑(i=1 à N) xi
ŝ² = (1 / N) ∑(i=1 à N) (xi - m̂)²
Remarque : L’estimation de m est non biaisée, c’est-à-dire que son espérance vaut la vraie moyenne. En revanche, l’estimation de s² est biaisée. Une estimation non biaisée de la variance est donnée par :
ŝ²_non_biaisée = (1 / (N - 1)) ∑(i=1 à N) (xi - m̂)²
Exemple d’application
Soit un échantillon X = {2, 3, 4, 5, 6}. Calculons l’estimation MV de m et s² :
- m̂ = (2 + 3 + 4 + 5 + 6) / 5 = 20 / 5 = 4
- ŝ² = (1/5) [ (2-4)² + (3-4)² + (4-4)² + (5-4)² + (6-4)² ] = (1/5)(4 + 1 + 0 + 1 + 4) = 10 / 5 = 2
Estimation non biaisée de la variance :
ŝ²_non_biaisée = (1/4) * 10 = 2.5
Lois normales multidimensionnelles
Considérons maintenant X dans ℝ^d. La famille paramétrée candidate est celle des lois normales multidimensionnelles, caractérisée par :
- le vecteur moyenne m ∈ ℝ^d
- la matrice de covariance S ∈ ℝ^(d×d), symétrique définie positive
La densité s’écrit :
p(x | m, S) = (1 / ((2π)^(d/2) |S|^(1/2))) * exp(- (1/2) (x - m)^T S^(-1) (x - m))Le maximum de vraisemblance est donné par :
m̂ = (1 / N) ∑(i=1 à N) xi
Ŝ = (1 / N) ∑(i=1 à N) (xi - m̂)(xi - m̂)^T
Comme en dimension unidimensionnelle, l’estimation de m est non biaisée, tandis que celle de la matrice de covariance Ŝ est biaisée (mais asymptotiquement non biaisée). Une estimation non biaisée de la matrice de covariance est :
Ŝ_non_biaisée = (1 / (N - 1)) ∑(i=1 à N) (xi - m̂)(xi - m̂)^T
Exemple d’application
Soit un échantillon de N=3 vecteurs en ℝ² :
- x1 = (1, 2)
- x2 = (2, 3)
- x3 = (3, 4)
Calcul de la moyenne :
m̂ = (1/3) * (x1 + x2 + x3) = (1/3) * ( (1,2) + (2,3) + (3,4) ) = (1/3) * (6,9) = (2,3)
Calcul de la matrice de covariance :
Ŝ = (1/3) * [ (x1 - m̂)(x1 - m̂)^T + (x2 - m̂)(x2 - m̂)^T + (x3 - m̂)(x3 - m̂)^T ]
Calcul des termes :
- (x1 - m̂) = (1 - 2, 2 - 3) = (-1, -1)
- (x2 - m̂) = (0, 0)
- (x3 - m̂) = (1, 1)
Donc :
(x1 - m̂)(x1 - m̂)^T = [ [-1], [-1] ] * [ -1, -1 ] = [[1, 1], [1, 1]]
(x2 - m̂)(x2 - m̂)^T = [[0, 0], [0, 0]]
(x3 - m̂)(x3 - m̂)^T = [[1, 1], [1, 1]]
Somme :
[[1,1],[1,1]] + [[0,0],[0,0]] + [[1,1],[1,1]] = [[2,2],[2,2]]
Enfin :
Ŝ = (1/3) * [[2,2],[2,2]] = [[2/3, 2/3], [2/3, 2/3]]
Maximum a posteriori (MAP)
Si la densité a priori p(q) sur les paramètres q est connue, il est préférable de choisir la solution qui maximise la probabilité a posteriori :
q̂_MAP = arg max_q p(q | X) = arg max_q p(X | q) p(q)
Cette approche incorpore une information préalable sur les paramètres, ce qui peut améliorer l’estimation, notamment en cas de petits échantillons ou de modèles complexes.
Glossaire des termes clés
- Famille paramétrée : ensemble de distributions de probabilité caractérisées par un vecteur de paramètres q.
- Vraisemblance (likelihood) : fonction L(q) = p(X | q) représentant la probabilité de l’échantillon X pour un paramètre q donné.
- Log-vraisemblance : logarithme de la vraisemblance, souvent utilisé pour simplifier les calculs.
- Maximum de vraisemblance (MV) : méthode d’estimation des paramètres qui maximise la vraisemblance.
- Estimation non biaisée : estimation dont l’espérance est égale à la vraie valeur du paramètre.
- Variance biaisée/non biaisée : la variance estimée par MV est biaisée, une correction est nécessaire pour obtenir une estimation non biaisée.
- Lois normales multidimensionnelles : lois normales définies sur ℝ^d, caractérisées par une moyenne vectorielle et une matrice de covariance.
- Maximum a posteriori (MAP) : méthode d’estimation qui maximise la probabilité a posteriori, combinant vraisemblance et connaissance a priori.
Points clés à retenir
- Les méthodes paramétriques supposent que la densité appartient à une famille paramétrée.
- Le maximum de vraisemblance est une méthode classique d’estimation des paramètres.
- Pour la loi normale unidimensionnelle, la moyenne MV est non biaisée, mais la variance MV est biaisée.
- En dimension multidimensionnelle, la moyenne et la matrice de covariance sont estimées par MV, avec la même remarque sur le biais de la covariance.
- Le maximum a posteriori (MAP) intègre une information a priori sur les paramètres pour améliorer l’estimation.
Commentaires
Aucun commentaire pour le moment. Posez la première question.