Chapitre 6: Réseaux Bayésiens
Ce matériel couvre les concepts fondamentaux des réseaux bayésiens, un outil puissant pour représenter et raisonner sur des connaissances probabilistes à partir d’informations incomplètes.
D'après le document Chapitre 6: Réseaux Bayésiens
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Probabilistic graphical models, Bayesian networks · PDF · 30 pages · 2016
Afficher l'aperçu du document
Ce matériel couvre les concepts fondamentaux des réseaux bayésiens, un outil puissant pour représenter et raisonner sur des connaissances probabilistes à partir d’informations incomplètes. Destiné aux étudiants en informatique, intelligence artificielle ou statistique, il présente la structure, les propriétés, les applications, ainsi que les méthodes d’inférence et de décision associées aux réseaux bayésiens.
Introduction aux réseaux bayésiens
Les réseaux bayésiens (RB) sont des modèles graphiques probabilistes introduits par Judea Pearl dans les années 1980. Ils permettent de représenter des connaissances incertaines et d’effectuer un raisonnement probabiliste à partir d’informations partielles. Ces modèles sont largement utilisés dans divers domaines tels que la bio-informatique, la gestion du risque, le marketing, la sécurité informatique ou le transport.
Un réseau bayésien est un graphe orienté acyclique (DAG) où chaque nœud représente une variable aléatoire, et chaque arc symbolise une relation d’influence directe (cause à effet) entre variables.
Modèles graphiques probabilistes
Les modèles graphiques probabilistes se divisent en deux grandes catégories :
- Graphes dirigés (comme les réseaux bayésiens) : ils modélisent des relations causales et sont acycliques.
- Graphes non dirigés : utilisés dans d’autres contextes probabilistes.
Les réseaux bayésiens sont des DAG connexes, souvent sous forme d’arbres simples ou polytree (arbres multiples). Ils sont essentiels pour acquérir, représenter et utiliser des connaissances probabilistes.
Graphe causal et indépendances conditionnelles
Dans un réseau bayésien, un arc représente une influence directe d’une variable sur une autre. Par exemple, la variable "Décembre" (D) influence directement la variable "Température" (T), ce qui signifie que D est parent de T et qu’il existe une dépendance entre D et T.
Pour une chaîne de variables A, B, C, trois configurations principales d’indépendance conditionnelle existent :
- Head-to-Tail (A → C → B) : A et B sont indépendants conditionnellement à C. Si C est connu, A n’influence pas B.
- Tail-to-Tail (A ← C → B) : A et B sont indépendants conditionnellement à C. Par exemple, si on sait qu’il a plu (C), alors l’état de la pelouse voisine (B) est indépendant de l’état de ma pelouse (A).
- Head-to-Head (A → C ← B) : A et B sont indépendants mais deviennent dépendants conditionnellement à C. Par exemple, les maladies (A) et incendies (B) sont indépendants, mais si la productivité (C) diminue, cela affecte la croyance sur A et B.
Plus généralement, dans un réseau bayésien, toute variable est indépendante de ses non-descendants conditionnellement à ses parents.
Composante quantitative : distributions de probabilités
Chaque nœud du réseau est associé à une distribution de probabilité conditionnelle (CPT) qui quantifie l’influence des parents sur la variable. Pour une variable discrète A :
- Si A est une racine (sans parent), on donne la distribution de probabilité a priori P(A) telle que ∑ P(a) = 1.
- Sinon, on donne la distribution conditionnelle P(A | parents(A)) telle que ∑ P(a | uA) = 1.
Par exemple, dans un modèle de prévision météo à Paris, les variables sont :
- M : mois de l’année (Janvier à Décembre)
- MO : moment de la journée (matin, après-midi, soir/nuit)
- TP : type de temps (ensoleillé, nuageux, pluvieux)
- TE : température (entier de -20 à 40)
Les distributions sont définies ainsi :
- P(M = m) = 1/12 pour chaque mois m
- P(MO = moment) selon la durée du moment dans la journée
- P(TP = tp | M = m) pour chaque combinaison de mois et type de temps (36 valeurs)
- P(TE = te | M = m, MO = mo, TP = tp) pour chaque combinaison possible (6 588 valeurs)
Inférence bayésienne
L’inférence bayésienne consiste à calculer la probabilité a posteriori d’une variable requête R en fonction des observations C (évidences). On partitionne l’ensemble des variables en :
- R : variable recherchée
- C : variables observées (connues)
- I : variables inconnues restantes
La question posée est alors P(R | C).
Exemple d’inférence
Quelle est la probabilité qu’il fasse 12 degrés à Paris le matin en décembre ?
- R = {TE = 12}
- C = {M = "décembre", MO = "matin"}
- I = {TP}
On calcule :
P(TE = 12 | M = "décembre", MO = "matin")
La distribution jointe se décompose selon la règle de chaîne :
p(x1, ..., xn) = ∏ P(xi | parents(xi))
Exemple détaillé : Modèle sur le tabagisme et le cancer
Variables :
- A : âge (adolescent, adulte)
- G : genre (féminin, masculin)
- F : fumer (non, légère, autres)
- C : cancer (oui, non)
Probabilités a priori :
- P(A) : 0.6 adolescent, 0.4 adulte
- P(G) : 0.5 féminin, 0.5 masculin
Probabilités conditionnelles :
- P(F | A, G) : tableau donné (par exemple, P(F = légère | A = adolescent, G = féminin) = 0.2)
- P(C | F) : probabilité de cancer selon le tabagisme (ex. P(C = oui | F = légère) = 0.12)
La probabilité jointe s’écrit :
p(A, G, F, C) = P(A) . P(G) . P(F | A, G) . P(C | F)
Exemple de calcul :
P(Cancer = oui) = ∑ p(A, G, F, C = oui) = 0.2336
P(Cancer = non) = 0.7664
Inférence avec évidence
Si une variable est observée (évidence), par exemple Fumer = légère, on calcule la probabilité conditionnelle :
P(Cancer = oui | Fumer = légère) = P(Cancer = oui, Fumer = légère) / P(Fumer = légère)
Avec :
- P(Cancer = oui, Fumer = légère) = 0.0312
- P(Fumer = légère) = 0.26
Donc :
P(Cancer = oui | Fumer = légère) = 0.0312 / 0.26 = 0.12
Simplification des calculs et élimination des variables
Le calcul direct des probabilités jointes peut être très coûteux, exponentiel en fonction du nombre de variables inconnues. Pour simplifier :
- On met en facteur les probabilités identiques dans les sommes.
- On somme uniquement sur les variables pertinentes, c’est-à-dire les ancêtres des variables requête ou observation.
L’algorithme d’élimination des variables consiste à :
- Identifier les variables non pertinentes (non ancêtres) et les éliminer.
- Décomposer la probabilité jointe en facteurs conditionnels selon la structure du réseau.
- Effectuer les sommes partielles en réorganisant les expressions pour réduire le coût de calcul.
Après simplification, le nombre de probabilités à calculer peut être réduit drastiquement (exemple : de 744 à 6).
Décision et diagrammes d’influence
Les réseaux bayésiens peuvent être augmentés en diagrammes d’influence pour modéliser des décisions. Ces diagrammes contiennent :
- Des nœuds de chance (variables aléatoires quantifiées par des CPT)
- Des nœuds de décision (non quantifiés)
- Des nœuds d’utilité (représentant la fonction d’utilité)
Les arcs représentent :
- Influence conditionnelle entre nœuds de chance
- Influence d’information (décision prise en connaissant certaines variables)
- Effet des décisions sur les probabilités des nœuds chance suivants
Exemple de diagnostic médical
Un médecin doit décider de traiter un patient suspecté d’une maladie D. La maladie D cause un état pathologique P, qui provoque un symptôme S. Le médecin observe S, puis décide de traiter (T) ou non. La fonction d’utilité U dépend de la décision T, de la présence de D et de P.
Le réseau bayésien modélise ces relations et permet d’évaluer la meilleure décision en fonction des observations.
Exercices proposés
- Modéliser un réseau bayésien avec les variables FN (froid en Norvège), ZO (cage ouverte au Zoo), CP (cygne sur la pelouse), SA (prix du saumon augmenté).
- Calculer la probabilité d’un cygne sur la pelouse sachant que la cage est ouverte.
- Calculer la probabilité que la cage ne soit pas ouverte sachant qu’il ne fait pas froid.
- Modéliser un réseau bayésien pour le port de lunettes selon le genre et calculer le pourcentage de femmes parmi les porteurs de lunettes.
Glossaire des termes clés
- Réseau bayésien (RB) : Modèle graphique probabiliste sous forme de graphe orienté acyclique représentant des variables aléatoires et leurs dépendances conditionnelles.
- Variable aléatoire : Élément du réseau représentant une caractéristique incertaine pouvant prendre plusieurs valeurs.
- Distribution de probabilité conditionnelle (CPT) : Tableau associant à chaque variable la probabilité de ses valeurs conditionnellement à ses parents.
- Évidence : Variable dont la valeur est connue avec certitude dans un contexte d’inférence.
- Indépendance conditionnelle : Propriété selon laquelle deux variables sont indépendantes une fois qu’une troisième variable est connue.
- Ancêtre : Variable qui influence directement ou indirectement une autre variable dans le réseau.
- Inférence bayésienne : Calcul des probabilités a posteriori des variables en fonction des observations.
- Diagramme d’influence : Extension des réseaux bayésiens intégrant des décisions et des utilités pour modéliser des problèmes de décision.
- Algorithme d’élimination des variables : Méthode pour simplifier le calcul des probabilités en supprimant les variables non pertinentes.
Points clés à retenir
- Les réseaux bayésiens représentent efficacement les connaissances incertaines et permettent un raisonnement probabiliste.
- Chaque nœud est associé à une distribution conditionnelle dépendant de ses parents.
- L’inférence bayésienne calcule les probabilités a posteriori en tenant compte des observations.
- La simplification des calculs repose sur l’élimination des variables non pertinentes et la mise en facteur des probabilités.
- Les diagrammes d’influence étendent les réseaux bayésiens pour intégrer la prise de décision.
- Les indépendances conditionnelles sont fondamentales pour réduire la complexité du modèle.
Commentaires
Aucun commentaire pour le moment. Posez la première question.