DEVOIR DE SURVEILLANCE
MODULE : NATURAL LANGUAGE
PROCESSING
NIVEAU : MASTER BADS 2
DURÉE : 1H30
RESPONSABLE : WAEL OUARDA DOCUMENTS AUTORISÉS
Partie I – Web Scraping des données (3 points)
Afin de mettre en place d’une API web de détection des fausses annonces, nous avons eu recours à
l’intelligence artificielle pour réduire le panique social sur les réseaux sociaux durant les situations de
pandémie en Tunisie. La première étape consiste à collecter à partir des réseaux sociaux un corpus
textuel pour la conception et la mise en place d’un système à base de Machine Learning qui aidera à
détecter les fausses annonces.
1. Quelles sont les bibliothèques que vous pouvez utiliser pour collecter ce corpus textuel. (1 point)
2. Quelles sont les paramètres à vérifier après la collecte de la base de données pour valider
l’échantillon sur laquelle vous allez baser votre étude. Expliquer. (2 points)
Partie II- Prétraitement des données (7 points)
Publicité
Selon la méthodologie CRIS d’analyse de données, nous comptons commencer par le prétraitement des
données textuelles collectées.
1. Citer 6 exemples de problèmes des données collectées dans la partie I ; (1.5 points)
2. Quelles sont les bibliothèques à utiliser pour faire face à ces problèmes en donnant la différence
dans l’utilisation de ces bibliothèques. (1.5 points)
3. Voici une partie de la base collectée
0
1
2
3
Annonces
Hello ? are you here my freind ! I am looking for help
pleeeeeeeease
Fausse
Urgent ! We are in very serious problem
Tunisie is the most beautiful cpuntry hahaha
Publicité
Vraie
Lets work together for more benefits my dear colleague Vraie
Type
Fausse
a. Appliquer un processus de prétraitement de votre choix en utilisant les bibliothèques de la
question (2) pour prétraiter le texte collecté et donner un nouveau tableau contenant les
nouvelles annonces. NB : On ne va pas exclure dans notre étude les stop words qui feront partie
de notre étude. (3 points)
b. Quelles ont les problèmes qui apparaissent après le prétraitement du corpus textuel (1 point)
Partie III- Représentation des données (7 points)
Une fois le texte a été prétraité, nous allons passer à la phase de « word embedding ». Nous
allons utiliser la technique statistique TF-IDF pour faire la représentation des données
textuelles.
1. Expliquer le principe de TF-IDF en donnant son expression expliquée (1 point)
2. Appliquer cette technique pour calculer les TF-IDF de chaque mot dans cette nouvelle
base textuelle prétraitée. (6 points)
Publicité
Partie IV- Classification des annonces textuelles (3 points)
1/2
On suppose que la représentation de ce corpus textuel a donné ce dataset.
X Y Z Type
0
1 1
2 1
3 0
4
-1
5 1
6 0
-1 Fausse
-1 0
1 Vraie
0
Publicité
1
0 Fausse
-1 0 Fausse
-1 Fausse
-1
1 Vraie
1
0 Fausse
0
1. Appliquer l’algorithme Naive Bayes pour créer un modèle de classification des fausses
annonces sur cette base de données (2 points)
2. Voici une nouvelle annonce X={-1,1,0}, veuillez prédire est ce que X est une vraie ou fausse
annonce selon le modèle bayésien établi. (1 point)
2/2