Cours de « Big Data "
1
P R É S E N T É P A R M O U R A L I O .
P R O M O T I O N M 1 M P 2 L
A N N É E U N I V E R S I T A I R E 2 0 1 9 / 2 0
Sommaire
2
Introduction au Big Data
Présentation de Hadoop
Hadoop Distributed File System (HDFS)
MapReduce
Evolution du Big Data
Cas d’utilisation
Introduction au Big Data
3
Qu’est-ce que le Big Data?
Ses Caractéristiques,
Ses Uses Cases,
Ses domaines d’applications.
Introduction au Big Data
4
Propriété intrinsèque de la donnée:
elle pousse
90% des données au monde ont été créées au cours
de la dernière décennie.
80% des données aujourd'hui sont non structurées.
Introduction au Big Data
5
20% uniquement des données disponibles peuvent
être traitées par les systèmes traditionnels.
Les dirigeants d’entreprises ne peuvent pas avoir
accès aux données dont ils ont besoin.
83% décideurs citent le BI et l’analyse de données
dans leur business plan.
Introduction au Big Data
6
Un monde continuellement interconnecté et instrumentalisé
Caractéristiques du Big Data
7
4V = Volume, Velocity, Variety, Veracity
Publicité
Caractéristiques du Big Data
8
Banalisation du matériel permettant de nouvelles
Analyses
*plate-forme de calcul à faible coût
1 pétaoctet grappe Hadoop pour environ 1
-
million $
- L'architecture Hadoop
• Optimisé pour les volumes de données élevés
(HDFS) et MapReduce
- Défaillance du matériel est prévue et gérée
Unité de mesure de stockage
9
Domaines d’application
10
Large Analyse & Techniques de télémétrie.
Unité de mesure de stockage
11
Les 5 Uses Cases du Big Data
12
Plateforme de Big Data:
13
Plateforme de Big Data: BigInsights (IBM)
14
Présentation de Hadoop
15
Pourquoi? Quand? Où?
Comparé aux systèmes de Gestion des BDr.
Architecture de Hadoop
HDFS
MapReduce
Hadoop Common
Ecosystem of related projects
Pig, Hive, Jaql
Other projects
Importance de Hadoop
16
«Nous croyons que plus de la moitié des données
du monde sera stockée dans Apache Hadoop
Publicité
durant les cinq ans à venir »
Améliorations du Hardware à travers les années
17
Vitesse CPU
1990 – 44 MIPS at 40 MHz
2010 – 147,600 MIPS at 3.3 GHz
RAM Memory
1990 – 640K conventional memory (256K extended memory
recommended)
2010 – 8-32GB (and more)
Disk Capacity
1990 – 20MB
2010 – 1TB
Améliorations du Hardware Sauf…
18
Disk Latency ( vitesse de lecture et d’écriture ) - pas
beaucoup d'améliorations dans les 7-10 dernières
années , actuellement environ 70 - 80MB / sec
Parallel Data Processing est la réponse!
19
Nous avons travaillé longtemps avec:
- GRID computing - propage la charge de traitement –
- Distributed workload - difficile pour gérer les
applications , les frais sont lourds.
- Parallel databases - DB2 DPF , Teradata , Netezza ,
etc ( distribue les données )
Parallel Data Processing est la réponse!
20
Distributed computing : plusieurs ordinateurs
apparaissent comme un super-ordinateur pour
communiquer les uns avec les autres par envoi de
messages , fonctionnent ensemble pour atteindre
un but commun
Parallel Data Processing est la réponse!
21
Challenges du Distributed computing :
Hétérogénéité
Extensibilité
Sécurité
Evolutivité
Publicité
Concurrence
La tolérance aux pannes
What is Hadoop?
22
Apache framework est un environnement open
source fiable, évolutif et distribué pour le calcul
de quantité massive de données
Masque détails et la complexité du système sous-jacent de
l'utilisateur
Développé en Java
What is Hadoop?
23
Consiste en 3 Sous projets:
− Hadoop Common
− MapReduce
− Hadoop Distributed File System (HDFS)
Conçu pour du matériel de base hétérogène
Nouvelle façon de stocker et traiter les données
Apporte le traitement aux données
Les principes de conception de Hadoop
Optimisé pour gérer :
24
Quantités massives de données à travers le parallélisme
Variété de données ( structurées , non structurées , semi-
structurées )
Utilisation de matériel de base peu coûteux
Fiabilité fournie par la réplication
Attention
25
Hadoop est pas pour tous les types de travaux:
Pas pour traiter les transactions (accès aléatoire )
Pas bon quand le travail ne peut pas être parallélisé
Pas bon pour l'accès aux données à faible latence
Pas bon pour le traitement de beaucoup de petits
fichiers
Pas bon pour les calculs intensifs avec peu de données
Qui Utilise Hadoop?
26
Evolution de Hadoop
27
Publicité
Eco-système de Hadoop
28
Hadoop est étendu par un éco-système open source:
Apache Hadoop
29
Flexible,
Supporte un large processing de données
– Inspiré par la technologie Google (MapReduce, GFS,
BigTable, …)
– Initié par Yahoo
– Well-suited to batch-oriented, read-intensive
applications
– Supporte une large varieté de données
Apache Hadoop
30
Permet aux applications de travailler avec des milliers
de nœuds et des pétaoctets parallèlement et avec coût
modéré.
– CPU + disks = “node”
– “Nodes” peuvent être combinés en clusters
– de nouveaux “nodes” peuvent être ajoutés selon
besoin sans changement de:
• Data formats
• comment les données sont chargées
• comment les jobs sont écrites
Two Key Aspects of Hadoop
MapReduce framework
31
– Comment Hadoop comprend et affecte le travail aux nodes (
machines )
Hadoop Distributed File System = HDFS
– Où Hadoop stocke les données
– Un système de fichiers qui couvre tous les «nodes» d'un cluster
Hadoop
Il relie les systèmes de fichiers sur de nombreux «nodes »
locaux pour en faire un grand système de fichiers