Aide Mémoire de Probabilité

Mathematics, Probability Theory · course

Voir tous les documents en mathématiques

Aide Mémoire de Probabilité

1 Probabilités ensemblistes

• Ω ensemble des résultats possibles

• A tribu : stable par union et stable par complémentaire

– si Ω dénombrable alors A = P(Ω) ensemble des parties de Ω – si Ω non dénombrable ⊂ Rk alors A = B(Rk) tribu de Borel de Rk

• P fonction probabilité :

P : A → [0, 1] A (cid:55)→ P(A)

• (Ω, A, P) espace de probabilité

• Probabilité uniforme (cas fini) :

• Axiomatique de Kolmogorov :

P : P(Ω) → [0, 1]

A (cid:55)→ P(A) = Card(A) Card(Ω)

1. P(Ω) = 1 2. P (∪i∈I Ai) = (cid:80)

en particulier P(A ∪ B) = P(A) + P(B) si A et B sont disjoints

i∈I P(Ai) si les Ai sont disjoints deux à deux.

⇒ raisonnement sur les ensembles disjoints (notamment partition) puis pas-

sage aux probabilités

• Dénombrement :

– Nombre d’arrangements de k éléments parmi N

(N −k)! = N × (N − 1) × ... × (N − k + 1)

N = (N )k = N !

∗ Ak ∗ tous différents = sans remise ∗ ordre est important ∗ ex: tiercé

– Nombre de combinaisons de k éléments parmi N

N

k

N ! k!(N −k)!

k! =

N = (cid:0)N

(cid:1) = Ak ∗ C k ∗ tous différents = sans remise ∗ ordre n’est pas important ∗ ex: loto

– Nombre de permutations de k éléments : n! = Ak k

1

• Reconnaître le modèle avec ou sans remise

– Modèle avec remise (multi-nominal)

∗ Ω = {suites ordonnées de k boules parmi N avec répétition (avec

remise)} = {(x1, ..., xk) ∈ {1, ..., N }k}

∗ Card(Ω) = N k ∗ La probabilité à chaque tirage/lancé est toujours la même entre les N

possibilités : pi, ∀i ∈ N

∗ ex1: k lancées d’une pièce truquée N = 2 avec p1 = p et p2 = 1 − p

⇒ loi Binomial de paramètres k et p.

∗ ex2 : k lancées de dés de N faces avec p = 1

N si équilibré

– Modèle sans remise = tous différents

∗ Ω = {suites ordonnées de k boules parmi N sans répétition (tous

différents)} = {(x1, ..., xk) ∈ {1, ..., N }k | ∀i (cid:54)= j, xi (cid:54)= xj}

∗ Card(Ω) = Ak N ∗ La probabilité change à chaque tirage/lancé étant donné qu’il n’y a pas

de remise =⇒ modèle plus complexe.

∗ ex: tirer k cartes sans remise dans un jeu de N cartes; sélectionner k

étudiants dans une promo de N ∗ ex: N = 2 : loi hypergéométrique ∗ Si N est très grand : modèle sans remise = modèle avec remise (la non

remise ne modifie quasiment pas la probabilité)

La définition de Ω est un point critique des problèmes :

• Souvent considérer un ordre dans les tirages, les lancées alors qu’il n’en existe

pas forcément et ensuite considérer les différents cas (permutations,....).

• Souvent ne pas considérer la couleur des boules ou d’autres caractéristiques dans Ω et les considérer toutes distinctes (même si elles ont la même couleur) pour obtenir une loi de probabilité uniforme : P(A) = Card(A) Card(Ω) . Dans un second temps, on dénombre les combinaisons, arrangements ou permutations.

2 Probabilités conditionnelles

• P(A|B) =

P(A ∩ B) P(B) ⇒ P(A|B)P(B) = P(B|A)P(A)

• Probabilités totales : si Bi partition de Ω (cid:88)

P(A) =

P(A|Bi)P(Bi)

=

i∈I (cid:88)

i∈I

P(A ∩ Bi)

• A et B sont indépendants ⇐⇒ P(A ∩ B) = P(A) × P(B)

P(B)(cid:54)=0

⇐⇒ P(A|B) = P(A)

• (Ai)i∈I mutuellement indépendants ⇐⇒ ∀J ⊂ I, P(∩i∈J Ai) = (cid:81) i∈J P(Ai) • mutuellement indépendants =⇒ deux à deux indépendants (réciproque fausse)

2

3 Variables aléatoires réelles

Ajout d’une notion d’ordre (d’une mesure) dans Ω X : Ω → R

ω (cid:55)→ X(ω) = x

(Ω, A, P) avec X =⇒ (R, B(R), PX)

4 façon différentes et équivalentes de définir une variable aléatoire réelle X :

1. Fonction densité de X

• discret : n’admet pas de densité.

On définit la loi en donnant la valeur de la probabilité en chaque point : {(xi, P(X = xi))}i∈I =⇒ diagramme en bâtons.

• continu :

fX : R → R+

x (cid:55)→ fX (x)

fonction intégrable :

(cid:90)

R

fX (x)dx = 1

• Support de la loi de X : ensemble des valeurs de R sur lesquelles fX est

non nulle : DX = Supp(X) = {x ∈ R, fX (x) > 0}. On note 1DX (x) = 1 si x ∈ DX et = 0 sinon, la fonction support.

• on note : X ∈ DX presque sûrement (p.s.) ou presque partout (p.p.) si

P(X ∈ DX ) = 1.

2. Fonction de répartition de X :

FX : R → [0, 1]

x (cid:55)→ FX (x) = PX(] − ∞; x]) = P(X (cid:54) x)

• discret : FX (x) =

• continu : FX (x) =

(cid:88)

xi(cid:54)x (cid:90) x

P(X = xi).

(cid:90) x

fX (x)dx =

−∞

−∞ c’est l’intégrale de fX , elle est croissante. ⇒ P(a (cid:54) X (cid:54) b) = FX (b) − FX (a) ⇒ P(X = a) = 0, ∀a ∈ R ⇒ FX (−∞) = 0 et FX (+∞) = 1

Publicité

fX (x)1DX (x)dx =

(cid:90)

]−∞,x]∩DX

fX (x)dx

3. Fonction quantile de X :

←− F X :]0, 1[ → R ←− F X (p) = inf{x ∈ R|FX (x) > p} X quand celle-ci ex-

p (cid:55)→

c’est grosso-modo l’inverse de la fonction de répartition, F −1 iste. =⇒ la médiane est la valeur de x telle que F (x) = 1/2.

4. Fonction caractéristique de X :

=⇒ ϕ(k)

X (0) = ikE(X k)

ϕX : R → C t

(cid:55)→ ϕX (t) = E(eitX )

• Espérance de X = moyenne de X; c’est un réel: E(X) ∈ R

– discret : E(X) = (cid:80) – continue: E(X) = (cid:82) – P(A) = E(1A) =⇒ P(X > t) = E(1]t;+∞[)

i∈I xiP(X = xi) R xfX (x)dx

3

• Linéarité sur les intégrales =⇒ linéarité sur les espérance :

– E(aX + b) = aE(X) + b

– E(X + Y ) = E(X) + E(Y )

• Changement de variable : Y = g(X)

– E(Y ) =

(cid:90)

R

g(x)fX (x)dx

– Si g convexe alors g(E(X)) (cid:54) E(g(X)) – ∀y ∈ R, FY (y) = P(X ∈ g−1(] − ∞; y])) – Si g bijective telle que g(cid:48)(x) (cid:54)= 0 alors ∀y ∈ R, fY (y) = |(g−1)(cid:48)(y)|fX (g−1(y))

• Variance de X : moyenne de l’écart à la moyenne au carré; c’est un réel positif :

V ar(X) ∈ R+ V ar(X) = E((X − E(X))2) = E(X 2) − (E(X))2 = −ϕ(cid:48)(cid:48) Si V ar(X) = 0 alors X est un variable aléatoire constante.

X (0) + (ϕ(cid:48)

X (0))2

• Écart type de X : σX = (cid:112)V ar(X) ⇒ mêmes unité que les valeurs de X.

• Moment non centré d’ordre p de X : mp = E(X p) = ϕ(p) • Moment centré d’ordre p de X : µp = E((X − E(X))p) ∈ R • Inégalité de Tchebychev : P (|X − E(X)| (cid:62) a) (cid:54) V ar(X)

X (0) ip

a2

∈ R

Lois classiques à connaître et reconnaître :

• Lois discrètes :

– Loi Uniforme sur {1, ..., n}

– Loi de Bernoulli de paramètre p ∈ [0, 1] (1 lancé à pile ou face) – Loi Binomiale de paramètres n ∈ N∗ et p ∈]0, 1[ (n lancés à pile ou face) – Loi Géométrique de paramètre p ∈]0, 1[

– Loi de Poisson de paramètre λ > 0

• Lois continues :

– Loi Uniforme sur l’intervalle [a, b]

– Loi Exponentielle de paramètre λ > 0 – Loi Normale (loi Gaussienne) de paramètres (µ, σ2)

4

4 Vecteurs aléatoires réelles

Simple généralisation des définitions pour d variables aléatoires réelles. Notions nouvelles uniquement à propos de la (in)dépendance entre lois : covariance... X = (X1, ..., Xd) : (Ω, A) → (Rd, B(Rd))

loi jointe

ω (cid:55)→ X(ω) = (X1(ω), ..., Xd(ω))

Simple généralisation des définitions :

• Probabilité d’un événement :

PX(A) = P(X1,...,Xd)(A1 × ... × Ad) = P(X1 ∈ A1, ..., Xd ∈ Ad)

• Fonction de répartition de X :

FX : Rd → [0, 1]

t

(cid:55)→ FX(t) = F(X1,...,Xd)(t1, ..., td) = P(X1 (cid:54) t1, ..., Xd (cid:54) td)

• Fonction de densité de X : fX : Rd → R+

t

(cid:55)→ fX(t1, ..., td) =

avec

(cid:90)

Rd

et DX support de X.

FX(t1, ..., td) =

(cid:90) t1

fX(t1, ..., td)dt1...dtd =

fX(t)dt=1

FX(t1, ..., td)

∂d ∂t1...∂td (cid:90)

DX

(cid:90) td

...

−∞

−∞

(cid:90)

A

fX(t1, ..., td)dt1...dtd

(cid:90)

A

fX(t)1DX dt =

(cid:90)

A∩DX

fX(t)dt

PX(A) =

fX(t)dt =

• Fonction caractéristique de X :

φX : Rd → C t

(cid:55)→ φX(t1, ..., td) = E(ei(cid:104)t,X(cid:105))

• Espérance de X : E(X) = (E(X1), ..., E(Xd)) ∈ Rd

• i-ème loi marginale de X : projection/intégration de X sur sa i-ème composante :

– fXi (x) =

(cid:90)

Rd−1

Dans R2 : fX (x) =

(cid:90)

R

f(X,Y )(x, y)dy

fX(x1, ..., xi−1, x, xi+1, ...xd)dx1...dxi−1dxi+1...dxd

– FXi (ti) = FX(+∞, ..., ti, ..., +∞) (écriture non formelle)

– ϕXi(ti) = φX(0, ..., 0, ti, 0..., 0)

Publicité

• X et Y sont indépendantes ⇐⇒ P(X ∈ A, Y ∈ B) = P(X ∈ A) × P(Y ∈ B),

∀A, B

continue⇐⇒ f(X,Y )(x, y) = fX (x)fY (y), discret⇐⇒ P(X = xi, Y = yi) = P(X = xi)P(Y = yi),

∀(x, y) ∈ R2

∀(xi, yj)

X et Y sont des v.a.r. indépendantes =⇒

   =⇒ généralisation au vecteur de dimension d.

E(XY ) = E(X)E(Y ) V ar(X + Y ) = V ar(X) + V ar(Y ) ∀t ∈ R, ϕX+Y (t) = ϕX (t)ϕY (t) ∀t, s ∈ R, ϕ(X,Y )(t, s) = ϕX (t)ϕY (s)

5

• Changement de variable : Y = g(X)

Si g bijective de classe C1 ainsi que sont inverse et |Jg−1(y)| (cid:54)= 0 alors

fY (y) = |Jg−1(y)|fX (g−1(y))1g(DX )(y)

cas où (U, V ) = g(X, Y )

f(U,V )(u, v) = |Jg−1(u, v)|f(X,Y )(g−1(u, v))1g(D(X,Y ))(u, v)

cas de Z = X + Y , fX+Y (z) = (cid:82) f(X,Y )(u − v, v)dv

• Covariance du couple (X, Y ) : Cov(X, Y ) = E((X − E(X))(Y − E(Y )))

Cov(X, X) = V ar(X) Cov(X, Y ) = Cov(Y, X) Cov(X, Y ) = E(XY ) − E(X)E(Y ) Cov(X, a) = 0, ∀a ∈ R Forme bilinéaire en X, Y : Cov(aX + b, cY + d) = acCov(X, Y ) V ar(X ± Y ) = V ar(X) + V ar(Y ) ± Cov(X, Y ) V ar(aX + bY + c) = a2V ar(X) + b2V ar(Y ) + 2abCov(X, Y ) Matrice de covariance de X = (X1, ..., Xd) : Cov(X) = (Cov(Xi, Xj))1(cid:54)i,j(cid:54)d

• Coefficient de corrélation (linéaire) de X et Y (X et Y de carré intégrable):

ρXY =

Cov(X, Y ) (cid:112)V ar(X)V ar(Y )

ρXY = 0 : X et Y sont non corrélées |ρXY | (cid:54) 1 |ρXY | = 1 ⇐⇒ X et Y sont colinéaires (relation affine entre X et Y )

5 Lois et espérance conditionnelle

Conditionnement par rapport à une variable aléatoire

(cid:54)=

Conditionnement par rapport à un événement (valeur d’une variable aléatoire)

• Loi conditionnelle sachant un événement

– Loi conditionnelle de Y sachant X = xi (cas discret) :

∀xi, ∀yi, PY |X=xi (yi) = P(Y = yi|X = xi) =

P(Y = yi, X = xi) P(X = xi)

Théorème des probabilités totales :

P(X = xi) =

(cid:88)

j

P(X = xi|Y = yi)P(Y = yi)

– Loi conditionnelle de Y sachant X = x (cas continu) :

∀x, ∀y, fY |X=x(y) = fY (y|X = x) =

f(X,Y )(x, y) fX (x)

6

• Espérance conditionnelle sachant un événement :

– Espérance conditionnelle de la v.a. g(X, Y ) sachant X = xi (cas discret) :

E(g(X, Y )|X = xi) =

(cid:88)

j

g(xi, yj)P(Y = yi|X = xi)

– Espérance conditionnelle de la v.a. g(X, Y ) sachant X = x (cas continu) :

E(g(X, Y )|X = x) =

(cid:90)

R

g(xi, yj)fY |X=x(y)dy

• Espérance conditionnelle de la v.a. Y sachant la v.a. X, E(Y |X) :

E(Y |X = x) = g(x) =⇒ E(Y |X) = g(X)

g = E(Y |X) : X → R

x (cid:55)→ g(x) = E(Y |X = x)

Attention !! E(Y ) ∈ R mais E(Y |X) est une v.a. qui dépend de la v.a. X (c-à-d la fonction g(X)).

• Variance conditionnelle de la v.a. Y sachant la v.a. X, V ar(Y |X) :

V ar(Y |X = x) = h(x) =⇒ V ar(Y |X) = h(X)

De même V ar(Y ) ∈ R mais V ar(Y |X) est une v.a. fonction de la v.a. X, h(X).

• Les lois conditionnelles coïncident avec les lois marginales

• Théorème de l’espérance totale : si Y intégrable alors

E(Y ) = E(E(Y |X))

• Théorème de la variance totale : si Y de carré intégrable alors

V ar(Y ) = E(V ar(Y |X)) + V ar(E(Y |X))

• ∀ fonctions g bornée et h tel que h(Y ) intégrable, on :

E(g(X)h(Y )|X) = g(X)E(h(Y )|X)

=⇒ E(g(X)|X) = g(X)

7

6 Vecteurs aléatoires gaussiens

• X = (X1, ..., Xd) vecteur aléatoire gaussien Nd(m, Γ) avec m vecteur es-

pérance (vecteur moyenne) et Γ matrice de covariance des Xi : Γij = Cov(Xi, Xj) Γ est une matrice symétrique semi-défini positive Γ = (Cov(Xi, Xj))i,j

• Γ diagonale =⇒ les Xi sont non corrélées (Cov(Xi, Xj) = 0, ∀i (cid:54)= j)

• X = (X1, ..., Xd) ∼ Nd(m, Γ) =⇒ ∀i = 1...d, Xi ∼ N (mi, Γii)

La réciproque est fausse sauf si les Xi sont indépendants

•

X ∼ Nd(m, Γ) Y = a + P X avec a ∈ Rk et P ∈ Mk×d(R)

(cid:27)

⇒ Y ∼ Nk(a+P m, P ΓP T )

• X1, ..., Xn indépendants ⇒ X1, ..., Xn non corrélées

La réciproque est fausse sauf si X = (X1, ..., Xn) est un vecteur gaussien

7 Convergences des variables aléatoires

• (Xi)i∈N indépendantes identiquement distribuées (i.i.d.)

⇐⇒ indépendantes et toutes de même loi que X : L(X) = L(Xi), ∀i

• une v.a. est X intégrable ⇐⇒ E(|X|) < +∞

• une v.a. est X de carre intégrable ⇐⇒ E(X 2) < +∞

• Convergence presque sûre ou convergence forte :

Xn

p.s. −−→ X ⇐⇒ P

(cid:18)(cid:26)

ω ∈ Ω :

lim n→+∞

Xn(ω) = X(ω)

= 1

(cid:27)(cid:19)

• Convergence en probabilité :

Xn

P−→ X ⇐⇒ ∀(cid:15),

lim n→+∞

P (|Xn − X| (cid:62) (cid:15)) = 0

De plus :

Xn Yn

Publicité

P−→ X P−→ Y

(cid:41)

=⇒

 



• Convergence dans Lp :

g(Xn) P−→ g(X), ∀g continue aXn + bYn ZXn

P−→ ZX, ∀Z v.a.r. finie p.s.

P−→ aX + bY, ∀a, b ∈ R

Lp −−→ X ⇐⇒ lim

Xn

E (|Xn − X|p) = 0

n→+∞

Convergence en moyenne quadratique (c-à-d dans L2) :

Xn

m.q. −−−→ X ⇐⇒ lim

n→+∞

E (cid:0)|Xn − X|2(cid:1) = 0

De plus :

lim n→+∞ lim n→+∞

E(Xn) = m V ar(Xn) = 0

(cid:41)

8

=⇒ Xn

m.q. −−−→ m (v.a. constante)

• Convergence en loi (la plus faible, la plus utilisée) :

Xn

L−→ X ⇐⇒ lim n→+∞

FXn (t) = FX (t)

⇐⇒ lim

E(g(Xn)) = E(g(X)), ∀g bornée, continue

n→+∞

⇐⇒ lim

n→+∞

ϕXn(t) = ϕX (t)

Convergence des lois mais pas des variables aléatoires : . Une v.a. discrète/continue peut converger en loi vers un v.a. continue/discrète Xn + Yn XnYn

L−→ X (cid:59) Xn − X L−→ 0

L−→ X L−→ a

L−→ X + a

P−→ aX

De plus :

Xn Yn

=⇒

Xn

(cid:40)

(cid:41)

• Dominance des convergences :

Xn

Lp −−→ X =⇒ Xn

Xn Lq −−→ X (q (cid:54) p) =⇒ Xn

p.s. −−→ X =⇒

L1 −−→ X =⇒

Xn

P−→ X =⇒ Xn

L−→ X

• Loi faible des Grands Nombres (LfGN)

(Xi)i∈N i.i.d.(L(X) = L(Xi)) X intégrable

(cid:27)

=⇒

Sn n

=

1 n

n (cid:88)

i=1

Xi

P−→ E(X)

• Loi Forte des Grands Nombres (LFGN)

(Xi)i∈N i.i.d.(L(X) = L(Xi)) X intégrable

(cid:27)

=⇒

Sn n

=

1 n

n (cid:88)

i=1

Xi

p.s. −−→ E(X)

• Théorème Central Limite (TCL)

Soit Sn = (cid:80)n

i=1 Xi

(Xi)i∈N i.i.d.(L(X) = L(Xi)) X de carré intégrable

(cid:27)

=⇒

Sn − nE(X) (cid:112)nV ar(X)

L−→ N (0, 1)

(Xi)i∈N i.i.d.(L(X) = L(Xi)) Sn√ n

L−→ S

(cid:41)

=⇒

 

E(X) = 0 E(X 2) < ∞ S = N (0, 1)

• Astuce :

∀X v.a.r. et ∀x ∈ R, 1{X(cid:54)x} ∼ B(p) avec p = P(X (cid:54) x) = FX (x), donc E(1{X(cid:54)x}) = p et V ar(1{X(cid:54)x}) = p(1 − p)

9