Aide Mémoire de Probabilité
1 Probabilités ensemblistes
• Ω ensemble des résultats possibles
• A tribu : stable par union et stable par complémentaire
– si Ω dénombrable alors A = P(Ω) ensemble des parties de Ω – si Ω non dénombrable ⊂ Rk alors A = B(Rk) tribu de Borel de Rk
• P fonction probabilité :
P : A → [0, 1] A (cid:55)→ P(A)
• (Ω, A, P) espace de probabilité
• Probabilité uniforme (cas fini) :
• Axiomatique de Kolmogorov :
P : P(Ω) → [0, 1]
A (cid:55)→ P(A) = Card(A) Card(Ω)
1. P(Ω) = 1 2. P (∪i∈I Ai) = (cid:80)
en particulier P(A ∪ B) = P(A) + P(B) si A et B sont disjoints
i∈I P(Ai) si les Ai sont disjoints deux à deux.
⇒ raisonnement sur les ensembles disjoints (notamment partition) puis pas-
sage aux probabilités
• Dénombrement :
– Nombre d’arrangements de k éléments parmi N
(N −k)! = N × (N − 1) × ... × (N − k + 1)
N = (N )k = N !
∗ Ak ∗ tous différents = sans remise ∗ ordre est important ∗ ex: tiercé
– Nombre de combinaisons de k éléments parmi N
N
k
N ! k!(N −k)!
k! =
N = (cid:0)N
(cid:1) = Ak ∗ C k ∗ tous différents = sans remise ∗ ordre n’est pas important ∗ ex: loto
– Nombre de permutations de k éléments : n! = Ak k
1
• Reconnaître le modèle avec ou sans remise
– Modèle avec remise (multi-nominal)
∗ Ω = {suites ordonnées de k boules parmi N avec répétition (avec
remise)} = {(x1, ..., xk) ∈ {1, ..., N }k}
∗ Card(Ω) = N k ∗ La probabilité à chaque tirage/lancé est toujours la même entre les N
possibilités : pi, ∀i ∈ N
∗ ex1: k lancées d’une pièce truquée N = 2 avec p1 = p et p2 = 1 − p
⇒ loi Binomial de paramètres k et p.
∗ ex2 : k lancées de dés de N faces avec p = 1
N si équilibré
– Modèle sans remise = tous différents
∗ Ω = {suites ordonnées de k boules parmi N sans répétition (tous
différents)} = {(x1, ..., xk) ∈ {1, ..., N }k | ∀i (cid:54)= j, xi (cid:54)= xj}
∗ Card(Ω) = Ak N ∗ La probabilité change à chaque tirage/lancé étant donné qu’il n’y a pas
de remise =⇒ modèle plus complexe.
∗ ex: tirer k cartes sans remise dans un jeu de N cartes; sélectionner k
étudiants dans une promo de N ∗ ex: N = 2 : loi hypergéométrique ∗ Si N est très grand : modèle sans remise = modèle avec remise (la non
remise ne modifie quasiment pas la probabilité)
La définition de Ω est un point critique des problèmes :
• Souvent considérer un ordre dans les tirages, les lancées alors qu’il n’en existe
pas forcément et ensuite considérer les différents cas (permutations,....).
• Souvent ne pas considérer la couleur des boules ou d’autres caractéristiques dans Ω et les considérer toutes distinctes (même si elles ont la même couleur) pour obtenir une loi de probabilité uniforme : P(A) = Card(A) Card(Ω) . Dans un second temps, on dénombre les combinaisons, arrangements ou permutations.
2 Probabilités conditionnelles
• P(A|B) =
P(A ∩ B) P(B) ⇒ P(A|B)P(B) = P(B|A)P(A)
• Probabilités totales : si Bi partition de Ω (cid:88)
P(A) =
P(A|Bi)P(Bi)
=
i∈I (cid:88)
i∈I
P(A ∩ Bi)
• A et B sont indépendants ⇐⇒ P(A ∩ B) = P(A) × P(B)
P(B)(cid:54)=0
⇐⇒ P(A|B) = P(A)
• (Ai)i∈I mutuellement indépendants ⇐⇒ ∀J ⊂ I, P(∩i∈J Ai) = (cid:81) i∈J P(Ai) • mutuellement indépendants =⇒ deux à deux indépendants (réciproque fausse)
2
3 Variables aléatoires réelles
Ajout d’une notion d’ordre (d’une mesure) dans Ω X : Ω → R
ω (cid:55)→ X(ω) = x
(Ω, A, P) avec X =⇒ (R, B(R), PX)
4 façon différentes et équivalentes de définir une variable aléatoire réelle X :
1. Fonction densité de X
• discret : n’admet pas de densité.
On définit la loi en donnant la valeur de la probabilité en chaque point : {(xi, P(X = xi))}i∈I =⇒ diagramme en bâtons.
• continu :
fX : R → R+
x (cid:55)→ fX (x)
fonction intégrable :
(cid:90)
R
fX (x)dx = 1
• Support de la loi de X : ensemble des valeurs de R sur lesquelles fX est
non nulle : DX = Supp(X) = {x ∈ R, fX (x) > 0}. On note 1DX (x) = 1 si x ∈ DX et = 0 sinon, la fonction support.
• on note : X ∈ DX presque sûrement (p.s.) ou presque partout (p.p.) si
P(X ∈ DX ) = 1.
2. Fonction de répartition de X :
FX : R → [0, 1]
x (cid:55)→ FX (x) = PX(] − ∞; x]) = P(X (cid:54) x)
• discret : FX (x) =
• continu : FX (x) =
(cid:88)
xi(cid:54)x (cid:90) x
P(X = xi).
(cid:90) x
fX (x)dx =
−∞
−∞ c’est l’intégrale de fX , elle est croissante. ⇒ P(a (cid:54) X (cid:54) b) = FX (b) − FX (a) ⇒ P(X = a) = 0, ∀a ∈ R ⇒ FX (−∞) = 0 et FX (+∞) = 1
Publicité
fX (x)1DX (x)dx =
(cid:90)
]−∞,x]∩DX
fX (x)dx
3. Fonction quantile de X :
←− F X :]0, 1[ → R ←− F X (p) = inf{x ∈ R|FX (x) > p} X quand celle-ci ex-
p (cid:55)→
c’est grosso-modo l’inverse de la fonction de répartition, F −1 iste. =⇒ la médiane est la valeur de x telle que F (x) = 1/2.
4. Fonction caractéristique de X :
=⇒ ϕ(k)
X (0) = ikE(X k)
ϕX : R → C t
(cid:55)→ ϕX (t) = E(eitX )
• Espérance de X = moyenne de X; c’est un réel: E(X) ∈ R
– discret : E(X) = (cid:80) – continue: E(X) = (cid:82) – P(A) = E(1A) =⇒ P(X > t) = E(1]t;+∞[)
i∈I xiP(X = xi) R xfX (x)dx
3
• Linéarité sur les intégrales =⇒ linéarité sur les espérance :
– E(aX + b) = aE(X) + b
– E(X + Y ) = E(X) + E(Y )
• Changement de variable : Y = g(X)
– E(Y ) =
(cid:90)
R
g(x)fX (x)dx
– Si g convexe alors g(E(X)) (cid:54) E(g(X)) – ∀y ∈ R, FY (y) = P(X ∈ g−1(] − ∞; y])) – Si g bijective telle que g(cid:48)(x) (cid:54)= 0 alors ∀y ∈ R, fY (y) = |(g−1)(cid:48)(y)|fX (g−1(y))
• Variance de X : moyenne de l’écart à la moyenne au carré; c’est un réel positif :
V ar(X) ∈ R+ V ar(X) = E((X − E(X))2) = E(X 2) − (E(X))2 = −ϕ(cid:48)(cid:48) Si V ar(X) = 0 alors X est un variable aléatoire constante.
X (0) + (ϕ(cid:48)
X (0))2
• Écart type de X : σX = (cid:112)V ar(X) ⇒ mêmes unité que les valeurs de X.
• Moment non centré d’ordre p de X : mp = E(X p) = ϕ(p) • Moment centré d’ordre p de X : µp = E((X − E(X))p) ∈ R • Inégalité de Tchebychev : P (|X − E(X)| (cid:62) a) (cid:54) V ar(X)
X (0) ip
a2
∈ R
Lois classiques à connaître et reconnaître :
• Lois discrètes :
– Loi Uniforme sur {1, ..., n}
– Loi de Bernoulli de paramètre p ∈ [0, 1] (1 lancé à pile ou face) – Loi Binomiale de paramètres n ∈ N∗ et p ∈]0, 1[ (n lancés à pile ou face) – Loi Géométrique de paramètre p ∈]0, 1[
– Loi de Poisson de paramètre λ > 0
• Lois continues :
– Loi Uniforme sur l’intervalle [a, b]
– Loi Exponentielle de paramètre λ > 0 – Loi Normale (loi Gaussienne) de paramètres (µ, σ2)
4
4 Vecteurs aléatoires réelles
Simple généralisation des définitions pour d variables aléatoires réelles. Notions nouvelles uniquement à propos de la (in)dépendance entre lois : covariance... X = (X1, ..., Xd) : (Ω, A) → (Rd, B(Rd))
loi jointe
ω (cid:55)→ X(ω) = (X1(ω), ..., Xd(ω))
Simple généralisation des définitions :
• Probabilité d’un événement :
PX(A) = P(X1,...,Xd)(A1 × ... × Ad) = P(X1 ∈ A1, ..., Xd ∈ Ad)
• Fonction de répartition de X :
FX : Rd → [0, 1]
t
(cid:55)→ FX(t) = F(X1,...,Xd)(t1, ..., td) = P(X1 (cid:54) t1, ..., Xd (cid:54) td)
• Fonction de densité de X : fX : Rd → R+
t
(cid:55)→ fX(t1, ..., td) =
avec
(cid:90)
Rd
et DX support de X.
FX(t1, ..., td) =
(cid:90) t1
fX(t1, ..., td)dt1...dtd =
fX(t)dt=1
FX(t1, ..., td)
∂d ∂t1...∂td (cid:90)
DX
(cid:90) td
...
−∞
−∞
(cid:90)
A
fX(t1, ..., td)dt1...dtd
(cid:90)
A
fX(t)1DX dt =
(cid:90)
A∩DX
fX(t)dt
PX(A) =
fX(t)dt =
• Fonction caractéristique de X :
φX : Rd → C t
(cid:55)→ φX(t1, ..., td) = E(ei(cid:104)t,X(cid:105))
• Espérance de X : E(X) = (E(X1), ..., E(Xd)) ∈ Rd
• i-ème loi marginale de X : projection/intégration de X sur sa i-ème composante :
– fXi (x) =
(cid:90)
Rd−1
Dans R2 : fX (x) =
(cid:90)
R
f(X,Y )(x, y)dy
fX(x1, ..., xi−1, x, xi+1, ...xd)dx1...dxi−1dxi+1...dxd
– FXi (ti) = FX(+∞, ..., ti, ..., +∞) (écriture non formelle)
– ϕXi(ti) = φX(0, ..., 0, ti, 0..., 0)
Publicité
• X et Y sont indépendantes ⇐⇒ P(X ∈ A, Y ∈ B) = P(X ∈ A) × P(Y ∈ B),
∀A, B
continue⇐⇒ f(X,Y )(x, y) = fX (x)fY (y), discret⇐⇒ P(X = xi, Y = yi) = P(X = xi)P(Y = yi),
∀(x, y) ∈ R2
∀(xi, yj)
X et Y sont des v.a.r. indépendantes =⇒
=⇒ généralisation au vecteur de dimension d.
E(XY ) = E(X)E(Y ) V ar(X + Y ) = V ar(X) + V ar(Y ) ∀t ∈ R, ϕX+Y (t) = ϕX (t)ϕY (t) ∀t, s ∈ R, ϕ(X,Y )(t, s) = ϕX (t)ϕY (s)
5
• Changement de variable : Y = g(X)
Si g bijective de classe C1 ainsi que sont inverse et |Jg−1(y)| (cid:54)= 0 alors
fY (y) = |Jg−1(y)|fX (g−1(y))1g(DX )(y)
cas où (U, V ) = g(X, Y )
f(U,V )(u, v) = |Jg−1(u, v)|f(X,Y )(g−1(u, v))1g(D(X,Y ))(u, v)
cas de Z = X + Y , fX+Y (z) = (cid:82) f(X,Y )(u − v, v)dv
• Covariance du couple (X, Y ) : Cov(X, Y ) = E((X − E(X))(Y − E(Y )))
Cov(X, X) = V ar(X) Cov(X, Y ) = Cov(Y, X) Cov(X, Y ) = E(XY ) − E(X)E(Y ) Cov(X, a) = 0, ∀a ∈ R Forme bilinéaire en X, Y : Cov(aX + b, cY + d) = acCov(X, Y ) V ar(X ± Y ) = V ar(X) + V ar(Y ) ± Cov(X, Y ) V ar(aX + bY + c) = a2V ar(X) + b2V ar(Y ) + 2abCov(X, Y ) Matrice de covariance de X = (X1, ..., Xd) : Cov(X) = (Cov(Xi, Xj))1(cid:54)i,j(cid:54)d
• Coefficient de corrélation (linéaire) de X et Y (X et Y de carré intégrable):
ρXY =
Cov(X, Y ) (cid:112)V ar(X)V ar(Y )
ρXY = 0 : X et Y sont non corrélées |ρXY | (cid:54) 1 |ρXY | = 1 ⇐⇒ X et Y sont colinéaires (relation affine entre X et Y )
5 Lois et espérance conditionnelle
Conditionnement par rapport à une variable aléatoire
(cid:54)=
Conditionnement par rapport à un événement (valeur d’une variable aléatoire)
• Loi conditionnelle sachant un événement
– Loi conditionnelle de Y sachant X = xi (cas discret) :
∀xi, ∀yi, PY |X=xi (yi) = P(Y = yi|X = xi) =
P(Y = yi, X = xi) P(X = xi)
Théorème des probabilités totales :
P(X = xi) =
(cid:88)
j
P(X = xi|Y = yi)P(Y = yi)
– Loi conditionnelle de Y sachant X = x (cas continu) :
∀x, ∀y, fY |X=x(y) = fY (y|X = x) =
f(X,Y )(x, y) fX (x)
6
• Espérance conditionnelle sachant un événement :
– Espérance conditionnelle de la v.a. g(X, Y ) sachant X = xi (cas discret) :
E(g(X, Y )|X = xi) =
(cid:88)
j
g(xi, yj)P(Y = yi|X = xi)
– Espérance conditionnelle de la v.a. g(X, Y ) sachant X = x (cas continu) :
E(g(X, Y )|X = x) =
(cid:90)
R
g(xi, yj)fY |X=x(y)dy
• Espérance conditionnelle de la v.a. Y sachant la v.a. X, E(Y |X) :
E(Y |X = x) = g(x) =⇒ E(Y |X) = g(X)
g = E(Y |X) : X → R
x (cid:55)→ g(x) = E(Y |X = x)
Attention !! E(Y ) ∈ R mais E(Y |X) est une v.a. qui dépend de la v.a. X (c-à-d la fonction g(X)).
• Variance conditionnelle de la v.a. Y sachant la v.a. X, V ar(Y |X) :
V ar(Y |X = x) = h(x) =⇒ V ar(Y |X) = h(X)
De même V ar(Y ) ∈ R mais V ar(Y |X) est une v.a. fonction de la v.a. X, h(X).
• Les lois conditionnelles coïncident avec les lois marginales
• Théorème de l’espérance totale : si Y intégrable alors
E(Y ) = E(E(Y |X))
• Théorème de la variance totale : si Y de carré intégrable alors
V ar(Y ) = E(V ar(Y |X)) + V ar(E(Y |X))
• ∀ fonctions g bornée et h tel que h(Y ) intégrable, on :
E(g(X)h(Y )|X) = g(X)E(h(Y )|X)
=⇒ E(g(X)|X) = g(X)
7
6 Vecteurs aléatoires gaussiens
• X = (X1, ..., Xd) vecteur aléatoire gaussien Nd(m, Γ) avec m vecteur es-
pérance (vecteur moyenne) et Γ matrice de covariance des Xi : Γij = Cov(Xi, Xj) Γ est une matrice symétrique semi-défini positive Γ = (Cov(Xi, Xj))i,j
• Γ diagonale =⇒ les Xi sont non corrélées (Cov(Xi, Xj) = 0, ∀i (cid:54)= j)
• X = (X1, ..., Xd) ∼ Nd(m, Γ) =⇒ ∀i = 1...d, Xi ∼ N (mi, Γii)
La réciproque est fausse sauf si les Xi sont indépendants
•
X ∼ Nd(m, Γ) Y = a + P X avec a ∈ Rk et P ∈ Mk×d(R)
(cid:27)
⇒ Y ∼ Nk(a+P m, P ΓP T )
• X1, ..., Xn indépendants ⇒ X1, ..., Xn non corrélées
La réciproque est fausse sauf si X = (X1, ..., Xn) est un vecteur gaussien
7 Convergences des variables aléatoires
• (Xi)i∈N indépendantes identiquement distribuées (i.i.d.)
⇐⇒ indépendantes et toutes de même loi que X : L(X) = L(Xi), ∀i
• une v.a. est X intégrable ⇐⇒ E(|X|) < +∞
• une v.a. est X de carre intégrable ⇐⇒ E(X 2) < +∞
• Convergence presque sûre ou convergence forte :
Xn
p.s. −−→ X ⇐⇒ P
(cid:18)(cid:26)
ω ∈ Ω :
lim n→+∞
Xn(ω) = X(ω)
= 1
(cid:27)(cid:19)
• Convergence en probabilité :
Xn
P−→ X ⇐⇒ ∀(cid:15),
lim n→+∞
P (|Xn − X| (cid:62) (cid:15)) = 0
De plus :
Xn Yn
Publicité
P−→ X P−→ Y
(cid:41)
=⇒
• Convergence dans Lp :
g(Xn) P−→ g(X), ∀g continue aXn + bYn ZXn
P−→ ZX, ∀Z v.a.r. finie p.s.
P−→ aX + bY, ∀a, b ∈ R
Lp −−→ X ⇐⇒ lim
Xn
E (|Xn − X|p) = 0
n→+∞
Convergence en moyenne quadratique (c-à-d dans L2) :
Xn
m.q. −−−→ X ⇐⇒ lim
n→+∞
E (cid:0)|Xn − X|2(cid:1) = 0
De plus :
lim n→+∞ lim n→+∞
E(Xn) = m V ar(Xn) = 0
(cid:41)
8
=⇒ Xn
m.q. −−−→ m (v.a. constante)
• Convergence en loi (la plus faible, la plus utilisée) :
Xn
L−→ X ⇐⇒ lim n→+∞
FXn (t) = FX (t)
⇐⇒ lim
E(g(Xn)) = E(g(X)), ∀g bornée, continue
n→+∞
⇐⇒ lim
n→+∞
ϕXn(t) = ϕX (t)
Convergence des lois mais pas des variables aléatoires : . Une v.a. discrète/continue peut converger en loi vers un v.a. continue/discrète Xn + Yn XnYn
L−→ X (cid:59) Xn − X L−→ 0
L−→ X L−→ a
L−→ X + a
P−→ aX
De plus :
Xn Yn
=⇒
Xn
(cid:40)
(cid:41)
• Dominance des convergences :
Xn
Lp −−→ X =⇒ Xn
Xn Lq −−→ X (q (cid:54) p) =⇒ Xn
p.s. −−→ X =⇒
L1 −−→ X =⇒
Xn
P−→ X =⇒ Xn
L−→ X
• Loi faible des Grands Nombres (LfGN)
(Xi)i∈N i.i.d.(L(X) = L(Xi)) X intégrable
(cid:27)
=⇒
Sn n
=
1 n
n (cid:88)
i=1
Xi
P−→ E(X)
• Loi Forte des Grands Nombres (LFGN)
(Xi)i∈N i.i.d.(L(X) = L(Xi)) X intégrable
(cid:27)
=⇒
Sn n
=
1 n
n (cid:88)
i=1
Xi
p.s. −−→ E(X)
• Théorème Central Limite (TCL)
Soit Sn = (cid:80)n
i=1 Xi
(Xi)i∈N i.i.d.(L(X) = L(Xi)) X de carré intégrable
(cid:27)
=⇒
Sn − nE(X) (cid:112)nV ar(X)
L−→ N (0, 1)
(Xi)i∈N i.i.d.(L(X) = L(Xi)) Sn√ n
L−→ S
(cid:41)
=⇒
E(X) = 0 E(X 2) < ∞ S = N (0, 1)
• Astuce :
∀X v.a.r. et ∀x ∈ R, 1{X(cid:54)x} ∼ B(p) avec p = P(X (cid:54) x) = FX (x), donc E(1{X(cid:54)x}) = p et V ar(1{X(cid:54)x}) = p(1 − p)
9