UVT
MASTER BADS-M 1
Exam: Big Data - Session 2021
Durée: 1h30
1Dans quelle langage Spark est développé ?
Java
b. Scala
Apache Spark a des API faites en
Java
b. Scala
C.
Python
d. R
Python
C.
d. Tout ce qui précède
3. Lequel des éléments suivants n'est pas un composant de l'Ecosystème Spark?
C. Mlib
Sqoop
b. GraphX
4. Lequel des éléments suivants n'est pas une fonctionnalité de Spark?
a.
Prend en charge le calcul en
mémoire
b. Tolérance aux pannes
5. Queln'est pas un composant sur le dessus de Spark Core?
a. Spark RDD
b.
Spark Streaming
c. C'est rentable (cost efficient)
d. Compatible avec d'autres systèmes
de stockage de fichiers
.
MLlib
d. Aucune de ces réponses
6.
En plus du flux de travaux de traitement, que fournit toutes les fonctionnalités de Spark?
a. Apprentissage automatique
b. Traitement graphique
Le traitement par lots
C.
d. Tout ce qui précède
7. Spark est-il inclus dans toutes les distributions majeures de Hadoop?
a. Oui
b. Non
8.
Laquelle des affirmations suivantes n'est pas vraie pour Hadoop et Spark?
a. Les deux sont des plateformes de traitement de données
b.
Les deux sont des environnements informatiques en cluster
Les deux ont leur propre système de fichiers
Les deux utilisent des APl open source pour établir des liens entre différents outils
d.
9 Laquelle des affirmations suivantes est vraie pour Spark SQL?
a.
C'est le noyau de Spark
b. Fournit une plate-forme d'exécution pour toutes les applications Spark
C.l permet aux utilisateurs d'exécuter des requêtes SQL / HQL par-dessus de Spark.
d.
Permet une puissante interactivité et analyse de données sur les données live streaming
1/8
10. Laquelle des affirmations suivantes est vraie pour Spark Core?
a. C'est le noyau de Spark
b.
1 permet aux utilisateurs d'exécuter des requêtes SQL/HQL sur le dessus de Spark.
C Cest la bibliothèque d'apprentissage automatique évolutive qui offre des gains d'efficacité
d. Améliore coñsidérablement les performances de l'algorithme itératif.
11. Laquelle des affirmations suivantes est vraie pour Spark MLlib?
a.
Fournit une plate-forme d'exécution pour toutes les applications Spark
b. Cest la bibliothèque d'apprentissage automatique évolutive qui offre des gains d'efficacité
C.
Permet une puissante interactivité et analyse de données sur les données live streaming
d. Tout ce qui précède
12. Laquelle des affirmations suivantes est vraie pour RDD?
a. Nous pouvons faire fonctionner les RDD Spark en parallèle avec une APl de bas niveau
b. Les RDD sont similaires à la table dans une base de données relationnelle
permet le traitement d'une grande quantité de données structurées
la un moteur d'optimisation intégré
d.
C.
13. Les RDD sont tolérants aux pannes et immuables
a. Vrai
b.
FauX
14. Quand Apache Spark évalue-t-il le RDD?
a. A l'action
b. Lors de la transformation
C.
Sur la transformation et l'action
15. La tolérance aux pannes dans RDD est obtenue en utilisant
Immutable nature de l' RDD
a.
b. DAG (Directed Acyclic Graph)
Lazy-evaluation
C.
d. Aucune de ces réponses
16. Lequel des éléments suivants est un module de traitement de données structurées?
a.
Publicité
Graphx
b. MLlib
C.Spark sQL
Spark R
17. Laquelie des propositions suivantes est la structure de données fondamentale de Spark
a. RDD
b. DataFrame
C. Dataset
d. Aucune de ces réponses
18. Laquelle des affirmations suivantes est fausse à propos de Hadoop?
a. C'est un framework distribué
b. Le principal algorithme utilisé est Map Reduce
C.
d. Tout est vrai
l fonctionne avec du matériel de base
19. Le Framework Hadoop est écrit en
a. Python
Java
b.
C. C++
d. Scala
20. Laquelle des fonctions suivantes est utilisée pour lire les données dans PIG?
a. WRITE
b. READ
LOAD
2/8
21. Laquelle parmi les suivantes est la manière d'exécuter le script Pig
Embedded Script
a.
b. Grunt Shell
Script File
Tout ce qui précède
d.
22. Lequel des éléments suivants est un opérateur de diagnostic dans Pig
a. DUMP
b. DESCRIBE
EXPLAIN
C.
d. Tout ce qui précède
23. Lequel des éléments suivants est des opérateurs relationnels dans Pig
a. DUMP
b. DISTINCT
c.
DESCRIBE
d. Tout ce qui précède
24. Dans 'Architecture Hadoop, quel est le but principal de Pig?
a. Déplacer des données vers HDFS
b. Fournir un langage de script de haut niveau en plus de MR
C. Exécuter des workflows
d. Déplacer des données de streaming vers HDFS
Soit le script suivant
1
4
2
www'l) AS releaseTime;
ratings = LOAD '/user/maria_dev/ml-100k/u.data' AS (userlD:int, movielD:int, rating:int, ratingTime:int);
metadata = LOAD '/user/maria_dev/m-100k/u.item' USING PigStoragel'|') AS (maovielD:int, movieTitle:chararray,
releaseDate:chararray, videoRealese:chararray, imdblink:chararray);
namelookup FOREACH metadata GENERATE movielD, movieTitle, ToUnixTime(ToDate(releaseDate, 'dd-MMM
ratingsByMovie GROUP ratings BY movielD;
avgRatings = FOREACH ratingsByMovie GENERATE group as movielD, AVG{ratings.rating) as avgRating;
fiveStarMovies = FILTER avgRatings BY avgRating> 4.0;
fiveStarsWithData = JOIN fiveStarMovies BY movielD, namelookup BY movielD;
15 oldestFiveStarMovies ORDER fiveStarsWithData BY namelookup:releaseTime;
13
11
12
14
10
16
17 DUMP oldestFivestarMovies;
25. Que dois-je écrire pour charger les données dans ratings?
a.
b.
C.
d.
ratingTime:int);
ratings = LOAD '/user/maria_dev/ml-100k/u.data' AS (useriD:int, movielD:int, rating:int, ratingTime:int);
ratings = CHARGE '/user/maria_dev/ml-100k/u.data' IN (useriD:int, movielD:int, rating:int,
ratings = LOAD /user/maria_dev/ml-100k/u.data' IN (userlD:int, movielD:int, rating:int, ratingTime.int);
ratings CHARGE '/user/maria_dev/ml-100k/u.data' AS (userlD:int, movielD:int, rating:int,
ratingTime:int);
3/8
26 Spark utilise
loRI4
log4
a.
b.
pour la journalisation(log)
C.
d.
log4i
log4
27. Lorsqu'une requête Hive rejoint 3 tables, combien de travaux MapReduce seront démarrés?
b.
1
28. A quoi sert Hive?
2
3
Publicité
d.
Un moteur Hadoop query
b.
Un MapReduce wrapper
C.Une interface Hadoop SQL
d. Tout ce qui précède
29. Laquelle des affrmations sulvantes est vraie pour Hive?
a.
Hive est la base de données de Hadoop
Hive prend en charge la vérification de schéma
b.
c.Hive n'autorise pas les mises à jour au niveau des lignes
d.
Hive peut remplacer un système OLTP
30. Lequel des éléments suivants est une jointure dans Hive?
a. Join
b.
Full outer join
31 Relevez la bonne déclaration
.
d.
Right outer join
Tout ce qui précède
a.
Hive n'est pas une base de données relationnelle, mais un moteur de requête qui prend en
charge les parties de SQL
b. Hive est une base de données relationnelle avec support sQ
Pig est une base de données relationnelle avec support SQL
d.
Aucune de ces réponses
32. Dans quelle mesure Apache Spark peut-il potentiellement exécuter des programmes de traitement par
lots lorsqu'il est traité en mémoire par rapport à MapReduce?
a
b.
10 fois plus rapide
20 fois plus rapide
33. Quel type de données Hadoop peut traiter
a. Structuré
b. Semi structuré
100 fois plus rapide
200 fois plus rapide
d.
C Non structuré
d. Tout ce qui précède
34. Laquelle des raisons suivantes a fait que Spark est plus rapide que MapReduce?
a. Le calcul en mémoire
b.
c.
d. Aucune de ces réponses
Prise en charge de différentes APl de langage comme Scala, Java, Python et R
Les RDD sont immuables et tolérants aux pannes
35. Lequel des énoncés suivants est vrai pour RDD ?
a. RDD est un paradigme de
programmation
b. RDD est une collection immuable
d'objets
C. C'est une base de données
d Aucune de ces réponses
36. Lequel des éléments sunvants n'est pas une fonction du contexte Spark dans Apache Spark ?
a.
Point d'entrée vers Spark sQL
b.
Pour accéder à divers services
/8
Big Data
Pour définir la configuration
d. Pour obtenir l'état actuel de Spark Application
37. Quelles sont les fonctionnalités de Spark RDD?
Calcul en mémoire
b. Evaluations paresseuses (Lazy
evaluations)
C.
d.
Tolérance aux pannes
Tout ce qui précède
38. Lequel des énoncés suivants n'est pas une transformation?
a.
b.
Flatmap
Map
39. Lequel des énoncés suivants n'est pas une action ?
a.
b.
collect()
take(n)
C. Reduce
d. Filter
topl)
C.
d. map
40 Lequel des énoncés suivants est vrai à propos de DataFrame?
a.
b.
Les DataFrames fournissent une APl plus conviviale que les RDD.
L'API DataFrame dispose d'une sécurité de type à la compilation
C.Les deux ci-dessus
41. Lequel des éléments suivants est le point d'entrée de Spark Application
a.
SparkSession
Publicité
b.
SparkContext
C. Aucun des deux
42. Lequel des éléments suivants est le point d'entrée de Spark SQL ?
a. SparkSession
b.
SparkContext
43. L'API principale pour le Machine Learning pour Spark est une API basée sur.
a. DataFrame
b. Dataset
RDD
C.
d. Tout ce qui précède
C.
OLT TP
d. Un langage de script
44. Qu'est-ce que Hive?
.
Un système d'entrepôt de données
open source
Base de données relationnelle
b.
45. La clause utilisée pour limiter le nombre de lignes renvoy(cid:23)es
a. Rownum
b. Restrict
par une requête est
C. Maxrow
d. Limit
46. Les résultats d'une requête Hive peuvent être stockés
Fichier local
a.
b. Fichier HDFS
C.
d.
Les deux ci-dessus
Ne peut pas être stocké
5/8
Big Data
47. Le principal avantage de la création d'une partition de table est
a. Utilisation efficace de la mémoire
de stockage
Performances de requête plus
b.
rapides
Moins de RAM requise par
namenode
d. Syntaxe de requète plus simple
48. Ce que Hive ne peut pas offrir
Stockage des données dans des
tableaux et des colonnes
b. Traitement des transactions en
ligne
Gestion des données de date et
d'heure
d. Partitionnement des données
stockées
49. Chaque base de données créée dans Hive est stockée comme
a
Un fichier
b Un répertoire
Un bloc HDFS
Un fichier jar
S0 Lorsqu'une requête Hive fait la jointure de 3 tables, combien de MapReduce seront démarrés?
a
b. 1
2
d.
3
51. Soulignez la bonne déclaration
aHive n'est pas une base de données relationnelle, mais un moteur de requête qui prend en
b.
c.
charge les parties de SQL
Hive est une base de données relationnelle avec support SQL
Pig est une base de données relationnelle avec prise en charge SQL
d. Aucune de ces réponses
Soit le script suivant:
def loadMovieNames():
movieNames
{}
with open("ml-100k/u.item") as :
for line in f
fields line.split("|)
movieNameslint(fields[0]]= fields[1]
return movieNames
def parselnputfline):
fields = line.split()
return (int(fields[1}), (float(cid:27)fields[2]), 1.0))
iname
"main_"
6/8
9
10
11
12
13
14
15
Big Data
Publicité
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
conf SparkConf().setAppName("WorstMovies")
movieNames = loadMovieNames()
movieRatings = lines.map(parselnput)
movie2[0], movie1[1] +movie2[1]))
ratingTotalsAndCount movieRatings.xxxoxxxxox(lambda movie1, movie2: ( movie1[0]+
popularTotalsAndCount = ratingTotalsAndCount.filter(lambda x: x{1][1]> 10)
averageRatings popularTotalsAndCount.mapValues(lambda totalAndCount
totalAndCount[0]/ totalAndCount[1)
sortedMovies averageRatings.sortBy(lambda x: x{1])
results sortedMovies.take(10)
for result in results:
print(movieNames[result[0]], result[1])
52. Quelle(s) est/sont la/les librairies qu'il faut importer (ligne 1)?
a.
Pyspark
b.SparkConf
53. Que dois-je écrire ligne 17 pour définir?
sc SparkContext(conf = conf)
a.
b. sc SparkContext()
C.
SparkContext
C.sc SparkContext(configuration = conf)
d.
sc SparkContext(conf)
54. Que dois-je écrire ligne 21 pour charger le fichier de données « u.data » se trouvant dans
«hdfs:///user/maria_dev/ml-100k/» ?
a.
b.
C.lines = sc.load("hdfs:///user/maria_dev/ml-100k/""u.data")
lines = sc.load("hdfs:///user/maria_dev/m-100k/u.data")
lines = sc.textFile("hdfs:///user/maria_dev/ml-100Ok/u.data")
lines= sc.textFile("hdfs:///user/maria_dev/mi-100k/""u.data")
d.
55. Quelle méthode doit-je invoquer ligne
reduceByKey
a.
b.
reduce
56. A quoi sert Hive?
a.
b.
Moteur de requête Hadoop
Enveloppe MapReduce
reduceByValue
C.
Interface Hadoop SQL
d. Tout ce qui précède
57. Quel des éléments suivants est une base de données orientée colonne qui s'exécute au-dessus de HOFS
a. Hive
b. Sqoop
C. H8ase
d.
Flume
7/8
Big Data
58. Quelle base de données est la mieux adaptée pour gérer les données en petits volumes.
a.
Base de données relationnelle
b. Base de données NoSQL
C.
Les deux
d. Aucun des deux
59. Lequel des éléments suivants est un type de base de données NoSQL ?
sQL
a.
b. Bases de données documentaires
C.
JSON
d. Tous les éléments mentionnés
60. Laquelle des raisons suivantes est fausse pour laquelle NoSQL est devenu une solution populaire pour
certaines organisations?
Meilleure évolutivité
b. Capacité améliorée de garder les données cohérentes
C.Accès plus rapide aux données que les systèmes de gestion de bases de données relationnelles (SGBDR)
d. Permet plus facilement de conserver les données sur plusieurs serveur
8/8