Big Data - Session 2021 Exam

Big Data · exam

Browse all intelligence artificielle et données documents

UVT

MASTER BADS-M 1

Exam: Big Data - Session 2021

Durée: 1h30

1Dans quelle langage Spark est développé ?

Java

b. Scala

Apache Spark a des API faites en

Java

b. Scala

C.

Python

d. R

Python

C.

d. Tout ce qui précède

3. Lequel des éléments suivants n'est pas un composant de l'Ecosystème Spark?

C. Mlib

Sqoop

b. GraphX

4. Lequel des éléments suivants n'est pas une fonctionnalité de Spark?

a.

Prend en charge le calcul en

mémoire

b. Tolérance aux pannes

5. Queln'est pas un composant sur le dessus de Spark Core?

a. Spark RDD

b.

Spark Streaming

c. C'est rentable (cost efficient)

d. Compatible avec d'autres systèmes

de stockage de fichiers

.

MLlib

d. Aucune de ces réponses

6.

En plus du flux de travaux de traitement, que fournit toutes les fonctionnalités de Spark?

a. Apprentissage automatique

b. Traitement graphique

Le traitement par lots

C.

d. Tout ce qui précède

7. Spark est-il inclus dans toutes les distributions majeures de Hadoop?

a. Oui

b. Non

8.

Laquelle des affirmations suivantes n'est pas vraie pour Hadoop et Spark?

a. Les deux sont des plateformes de traitement de données

b.

Les deux sont des environnements informatiques en cluster

Les deux ont leur propre système de fichiers

Les deux utilisent des APl open source pour établir des liens entre différents outils

d.

9 Laquelle des affirmations suivantes est vraie pour Spark SQL?

a.

C'est le noyau de Spark

b. Fournit une plate-forme d'exécution pour toutes les applications Spark

C.l permet aux utilisateurs d'exécuter des requêtes SQL / HQL par-dessus de Spark.

d.

Permet une puissante interactivité et analyse de données sur les données live streaming

1/8

10. Laquelle des affirmations suivantes est vraie pour Spark Core?

a. C'est le noyau de Spark

b.

1 permet aux utilisateurs d'exécuter des requêtes SQL/HQL sur le dessus de Spark.

C Cest la bibliothèque d'apprentissage automatique évolutive qui offre des gains d'efficacité

d. Améliore coñsidérablement les performances de l'algorithme itératif.

11. Laquelle des affirmations suivantes est vraie pour Spark MLlib?

a.

Fournit une plate-forme d'exécution pour toutes les applications Spark

b. Cest la bibliothèque d'apprentissage automatique évolutive qui offre des gains d'efficacité

C.

Permet une puissante interactivité et analyse de données sur les données live streaming

d. Tout ce qui précède

12. Laquelle des affirmations suivantes est vraie pour RDD?

a. Nous pouvons faire fonctionner les RDD Spark en parallèle avec une APl de bas niveau

b. Les RDD sont similaires à la table dans une base de données relationnelle

permet le traitement d'une grande quantité de données structurées

la un moteur d'optimisation intégré

d.

C.

13. Les RDD sont tolérants aux pannes et immuables

a. Vrai

b.

FauX

14. Quand Apache Spark évalue-t-il le RDD?

a. A l'action

b. Lors de la transformation

C.

Sur la transformation et l'action

15. La tolérance aux pannes dans RDD est obtenue en utilisant

Immutable nature de l' RDD

a.

b. DAG (Directed Acyclic Graph)

Lazy-evaluation

C.

d. Aucune de ces réponses

16. Lequel des éléments suivants est un module de traitement de données structurées?

a.

Advertisement

Graphx

b. MLlib

C.Spark sQL

Spark R

17. Laquelie des propositions suivantes est la structure de données fondamentale de Spark

a. RDD

b. DataFrame

C. Dataset

d. Aucune de ces réponses

18. Laquelle des affirmations suivantes est fausse à propos de Hadoop?

a. C'est un framework distribué

b. Le principal algorithme utilisé est Map Reduce

C.

d. Tout est vrai

l fonctionne avec du matériel de base

19. Le Framework Hadoop est écrit en

a. Python

Java

b.

C. C++

d. Scala

20. Laquelle des fonctions suivantes est utilisée pour lire les données dans PIG?

a. WRITE

b. READ

LOAD

2/8

21. Laquelle parmi les suivantes est la manière d'exécuter le script Pig

Embedded Script

a.

b. Grunt Shell

Script File

Tout ce qui précède

d.

22. Lequel des éléments suivants est un opérateur de diagnostic dans Pig

a. DUMP

b. DESCRIBE

EXPLAIN

C.

d. Tout ce qui précède

23. Lequel des éléments suivants est des opérateurs relationnels dans Pig

a. DUMP

b. DISTINCT

c.

DESCRIBE

d. Tout ce qui précède

24. Dans 'Architecture Hadoop, quel est le but principal de Pig?

a. Déplacer des données vers HDFS

b. Fournir un langage de script de haut niveau en plus de MR

C. Exécuter des workflows

d. Déplacer des données de streaming vers HDFS

Soit le script suivant

1

4

2

www'l) AS releaseTime;

ratings = LOAD '/user/maria_dev/ml-100k/u.data' AS (userlD:int, movielD:int, rating:int, ratingTime:int);

metadata = LOAD '/user/maria_dev/m-100k/u.item' USING PigStoragel'|') AS (maovielD:int, movieTitle:chararray,

releaseDate:chararray, videoRealese:chararray, imdblink:chararray);

namelookup FOREACH metadata GENERATE movielD, movieTitle, ToUnixTime(ToDate(releaseDate, 'dd-MMM

ratingsByMovie GROUP ratings BY movielD;

avgRatings = FOREACH ratingsByMovie GENERATE group as movielD, AVG{ratings.rating) as avgRating;

fiveStarMovies = FILTER avgRatings BY avgRating> 4.0;

fiveStarsWithData = JOIN fiveStarMovies BY movielD, namelookup BY movielD;

15 oldestFiveStarMovies ORDER fiveStarsWithData BY namelookup:releaseTime;

13

11

12

14

10

16

17 DUMP oldestFivestarMovies;

25. Que dois-je écrire pour charger les données dans ratings?

a.

b.

C.

d.

ratingTime:int);

ratings = LOAD '/user/maria_dev/ml-100k/u.data' AS (useriD:int, movielD:int, rating:int, ratingTime:int);

ratings = CHARGE '/user/maria_dev/ml-100k/u.data' IN (useriD:int, movielD:int, rating:int,

ratings = LOAD /user/maria_dev/ml-100k/u.data' IN (userlD:int, movielD:int, rating:int, ratingTime.int);

ratings CHARGE '/user/maria_dev/ml-100k/u.data' AS (userlD:int, movielD:int, rating:int,

ratingTime:int);

3/8

26 Spark utilise

loRI4

log4

a.

b.

pour la journalisation(log)

C.

d.

log4i

log4

27. Lorsqu'une requête Hive rejoint 3 tables, combien de travaux MapReduce seront démarrés?

b.

1

28. A quoi sert Hive?

2

3

Advertisement

d.

Un moteur Hadoop query

b.

Un MapReduce wrapper

C.Une interface Hadoop SQL

d. Tout ce qui précède

29. Laquelle des affrmations sulvantes est vraie pour Hive?

a.

Hive est la base de données de Hadoop

Hive prend en charge la vérification de schéma

b.

c.Hive n'autorise pas les mises à jour au niveau des lignes

d.

Hive peut remplacer un système OLTP

30. Lequel des éléments suivants est une jointure dans Hive?

a. Join

b.

Full outer join

31 Relevez la bonne déclaration

.

d.

Right outer join

Tout ce qui précède

a.

Hive n'est pas une base de données relationnelle, mais un moteur de requête qui prend en

charge les parties de SQL

b. Hive est une base de données relationnelle avec support sQ

Pig est une base de données relationnelle avec support SQL

d.

Aucune de ces réponses

32. Dans quelle mesure Apache Spark peut-il potentiellement exécuter des programmes de traitement par

lots lorsqu'il est traité en mémoire par rapport à MapReduce?

a

b.

10 fois plus rapide

20 fois plus rapide

33. Quel type de données Hadoop peut traiter

a. Structuré

b. Semi structuré

100 fois plus rapide

200 fois plus rapide

d.

C Non structuré

d. Tout ce qui précède

34. Laquelle des raisons suivantes a fait que Spark est plus rapide que MapReduce?

a. Le calcul en mémoire

b.

c.

d. Aucune de ces réponses

Prise en charge de différentes APl de langage comme Scala, Java, Python et R

Les RDD sont immuables et tolérants aux pannes

35. Lequel des énoncés suivants est vrai pour RDD ?

a. RDD est un paradigme de

programmation

b. RDD est une collection immuable

d'objets

C. C'est une base de données

d Aucune de ces réponses

36. Lequel des éléments sunvants n'est pas une fonction du contexte Spark dans Apache Spark ?

a.

Point d'entrée vers Spark sQL

b.

Pour accéder à divers services

/8

Big Data

Pour définir la configuration

d. Pour obtenir l'état actuel de Spark Application

37. Quelles sont les fonctionnalités de Spark RDD?

Calcul en mémoire

b. Evaluations paresseuses (Lazy

evaluations)

C.

d.

Tolérance aux pannes

Tout ce qui précède

38. Lequel des énoncés suivants n'est pas une transformation?

a.

b.

Flatmap

Map

39. Lequel des énoncés suivants n'est pas une action ?

a.

b.

collect()

take(n)

C. Reduce

d. Filter

topl)

C.

d. map

40 Lequel des énoncés suivants est vrai à propos de DataFrame?

a.

b.

Les DataFrames fournissent une APl plus conviviale que les RDD.

L'API DataFrame dispose d'une sécurité de type à la compilation

C.Les deux ci-dessus

41. Lequel des éléments suivants est le point d'entrée de Spark Application

a.

SparkSession

Advertisement

b.

SparkContext

C. Aucun des deux

42. Lequel des éléments suivants est le point d'entrée de Spark SQL ?

a. SparkSession

b.

SparkContext

43. L'API principale pour le Machine Learning pour Spark est une API basée sur.

a. DataFrame

b. Dataset

RDD

C.

d. Tout ce qui précède

C.

OLT TP

d. Un langage de script

44. Qu'est-ce que Hive?

.

Un système d'entrepôt de données

open source

Base de données relationnelle

b.

45. La clause utilisée pour limiter le nombre de lignes renvoy(cid:23)es

a. Rownum

b. Restrict

par une requête est

C. Maxrow

d. Limit

46. Les résultats d'une requête Hive peuvent être stockés

Fichier local

a.

b. Fichier HDFS

C.

d.

Les deux ci-dessus

Ne peut pas être stocké

5/8

Big Data

47. Le principal avantage de la création d'une partition de table est

a. Utilisation efficace de la mémoire

de stockage

Performances de requête plus

b.

rapides

Moins de RAM requise par

namenode

d. Syntaxe de requète plus simple

48. Ce que Hive ne peut pas offrir

Stockage des données dans des

tableaux et des colonnes

b. Traitement des transactions en

ligne

Gestion des données de date et

d'heure

d. Partitionnement des données

stockées

49. Chaque base de données créée dans Hive est stockée comme

a

Un fichier

b Un répertoire

Un bloc HDFS

Un fichier jar

S0 Lorsqu'une requête Hive fait la jointure de 3 tables, combien de MapReduce seront démarrés?

a

b. 1

2

d.

3

51. Soulignez la bonne déclaration

aHive n'est pas une base de données relationnelle, mais un moteur de requête qui prend en

b.

c.

charge les parties de SQL

Hive est une base de données relationnelle avec support SQL

Pig est une base de données relationnelle avec prise en charge SQL

d. Aucune de ces réponses

Soit le script suivant:

def loadMovieNames():

movieNames

{}

with open("ml-100k/u.item") as :

for line in f

fields line.split("|)

movieNameslint(fields[0]]= fields[1]

return movieNames

def parselnputfline):

fields = line.split()

return (int(fields[1}), (float(cid:27)fields[2]), 1.0))

iname

"main_"

6/8

9

10

11

12

13

14

15

Big Data

Advertisement

16

17

18

19

20

21

22

23

24

25

26

27

28

29

30

31

32

33

34

35

36

conf SparkConf().setAppName("WorstMovies")

movieNames = loadMovieNames()

movieRatings = lines.map(parselnput)

movie2[0], movie1[1] +movie2[1]))

ratingTotalsAndCount movieRatings.xxxoxxxxox(lambda movie1, movie2: ( movie1[0]+

popularTotalsAndCount = ratingTotalsAndCount.filter(lambda x: x{1][1]> 10)

averageRatings popularTotalsAndCount.mapValues(lambda totalAndCount

totalAndCount[0]/ totalAndCount[1)

sortedMovies averageRatings.sortBy(lambda x: x{1])

results sortedMovies.take(10)

for result in results:

print(movieNames[result[0]], result[1])

52. Quelle(s) est/sont la/les librairies qu'il faut importer (ligne 1)?

a.

Pyspark

b.SparkConf

53. Que dois-je écrire ligne 17 pour définir?

sc SparkContext(conf = conf)

a.

b. sc SparkContext()

C.

SparkContext

C.sc SparkContext(configuration = conf)

d.

sc SparkContext(conf)

54. Que dois-je écrire ligne 21 pour charger le fichier de données « u.data » se trouvant dans

«hdfs:///user/maria_dev/ml-100k/» ?

a.

b.

C.lines = sc.load("hdfs:///user/maria_dev/ml-100k/""u.data")

lines = sc.load("hdfs:///user/maria_dev/m-100k/u.data")

lines = sc.textFile("hdfs:///user/maria_dev/ml-100Ok/u.data")

lines= sc.textFile("hdfs:///user/maria_dev/mi-100k/""u.data")

d.

55. Quelle méthode doit-je invoquer ligne

reduceByKey

a.

b.

reduce

56. A quoi sert Hive?

a.

b.

Moteur de requête Hadoop

Enveloppe MapReduce

reduceByValue

C.

Interface Hadoop SQL

d. Tout ce qui précède

57. Quel des éléments suivants est une base de données orientée colonne qui s'exécute au-dessus de HOFS

a. Hive

b. Sqoop

C. H8ase

d.

Flume

7/8

Big Data

58. Quelle base de données est la mieux adaptée pour gérer les données en petits volumes.

a.

Base de données relationnelle

b. Base de données NoSQL

C.

Les deux

d. Aucun des deux

59. Lequel des éléments suivants est un type de base de données NoSQL ?

sQL

a.

b. Bases de données documentaires

C.

JSON

d. Tous les éléments mentionnés

60. Laquelle des raisons suivantes est fausse pour laquelle NoSQL est devenu une solution populaire pour

certaines organisations?

Meilleure évolutivité

b. Capacité améliorée de garder les données cohérentes

C.Accès plus rapide aux données que les systèmes de gestion de bases de données relationnelles (SGBDR)

d. Permet plus facilement de conserver les données sur plusieurs serveur

8/8