Devoir de Surveillance - Natural Language Processing

Page 1 sur 2Lecteur de document UniversityLib

Devoir de Surveillance - Natural Language Processing

Programming, Machine Learning, Data Preprocessing, Text Classification · exam

Browse all intelligence artificielle et données documents

DEVOIR DE SURVEILLANCE

MODULE : NATURAL LANGUAGE

PROCESSING

NIVEAU : MASTER BADS 2

DURÉE : 1H30

RESPONSABLE : WAEL OUARDA DOCUMENTS AUTORISÉS

Partie I – Web Scraping des données (3 points)

Afin de mettre en place d’une API web de détection des fausses annonces, nous avons eu recours à

l’intelligence artificielle pour réduire le panique social sur les réseaux sociaux durant les situations de

pandémie en Tunisie. La première étape consiste à collecter à partir des réseaux sociaux un corpus

textuel pour la conception et la mise en place d’un système à base de Machine Learning qui aidera à

détecter les fausses annonces.

1. Quelles sont les bibliothèques que vous pouvez utiliser pour collecter ce corpus textuel. (1 point)

2. Quelles sont les paramètres à vérifier après la collecte de la base de données pour valider

l’échantillon sur laquelle vous allez baser votre étude. Expliquer. (2 points)

Partie II- Prétraitement des données (7 points)

Advertisement

Selon la méthodologie CRIS d’analyse de données, nous comptons commencer par le prétraitement des

données textuelles collectées.

1. Citer 6 exemples de problèmes des données collectées dans la partie I ; (1.5 points)

2. Quelles sont les bibliothèques à utiliser pour faire face à ces problèmes en donnant la différence

dans l’utilisation de ces bibliothèques. (1.5 points)

3. Voici une partie de la base collectée

0

1

2

3

Annonces

Hello ? are you here my freind ! I am looking for help

pleeeeeeeease  

Fausse

Urgent ! We are in very serious problem

Tunisie is the most beautiful cpuntry hahaha

Advertisement

Vraie

Lets work together for more benefits my dear colleague Vraie

Type

Fausse

a. Appliquer un processus de prétraitement de votre choix en utilisant les bibliothèques de la

question (2) pour prétraiter le texte collecté et donner un nouveau tableau contenant les

nouvelles annonces. NB : On ne va pas exclure dans notre étude les stop words qui feront partie

de notre étude. (3 points)

b. Quelles ont les problèmes qui apparaissent après le prétraitement du corpus textuel (1 point)

Partie III- Représentation des données (7 points)

Une fois le texte a été prétraité, nous allons passer à la phase de « word embedding ». Nous

allons utiliser la technique statistique TF-IDF pour faire la représentation des données

textuelles.

1. Expliquer le principe de TF-IDF en donnant son expression expliquée (1 point)

2. Appliquer cette technique pour calculer les TF-IDF de chaque mot dans cette nouvelle

base textuelle prétraitée. (6 points)

Advertisement

Partie IV- Classification des annonces textuelles (3 points)

1/2

On suppose que la représentation de ce corpus textuel a donné ce dataset.

X Y Z Type

0

1 1

2 1

3 0

4

-1

5 1

6 0

-1 Fausse

-1 0

1 Vraie

0

Advertisement

1

0 Fausse

-1 0 Fausse

-1 Fausse

-1

1 Vraie

1

0 Fausse

0

1. Appliquer l’algorithme Naive Bayes pour créer un modèle de classification des fausses

annonces sur cette base de données (2 points)

2. Voici une nouvelle annonce X={-1,1,0}, veuillez prédire est ce que X est une vraie ou fausse

annonce selon le modèle bayésien établi. (1 point)

2/2