Cours de Big Data

Big Data and Distributed Computing · notes

Voir tous les documents en intelligence artificielle et données

Cours de « Big Data "

1

P R É S E N T É P A R M O U R A L I O .

P R O M O T I O N M 1 M P 2 L

A N N É E U N I V E R S I T A I R E 2 0 1 9 / 2 0

Sommaire

2

 Introduction au Big Data

 Présentation de Hadoop

 Hadoop Distributed File System (HDFS)

 MapReduce

 Evolution du Big Data

 Cas d’utilisation

Introduction au Big Data

3

 Qu’est-ce que le Big Data?

 Ses Caractéristiques,

 Ses Uses Cases,

 Ses domaines d’applications.

Introduction au Big Data

4

 Propriété intrinsèque de la donnée:

 elle pousse

 90% des données au monde ont été créées au cours

de la dernière décennie.

 80% des données aujourd'hui sont non structurées.

Introduction au Big Data

5

 20% uniquement des données disponibles peuvent

être traitées par les systèmes traditionnels.

 Les dirigeants d’entreprises ne peuvent pas avoir

accès aux données dont ils ont besoin.

 83% décideurs citent le BI et l’analyse de données

dans leur business plan.

Introduction au Big Data

6

Un monde continuellement interconnecté et instrumentalisé

Caractéristiques du Big Data

7

 4V = Volume, Velocity, Variety, Veracity

Publicité

Caractéristiques du Big Data

8

Banalisation du matériel permettant de nouvelles

Analyses

*plate-forme de calcul à faible coût

1 pétaoctet grappe Hadoop pour environ 1

-

million $

  • L'architecture Hadoop

• Optimisé pour les volumes de données élevés

 (HDFS) et MapReduce

  • Défaillance du matériel est prévue et gérée

Unité de mesure de stockage

9

Domaines d’application

10

Large Analyse & Techniques de télémétrie.

Unité de mesure de stockage

11

Les 5 Uses Cases du Big Data

12

Plateforme de Big Data:

13

Plateforme de Big Data: BigInsights (IBM)

14

Présentation de Hadoop

15

 Pourquoi? Quand? Où?

 Comparé aux systèmes de Gestion des BDr.

 Architecture de Hadoop

 HDFS

 MapReduce

 Hadoop Common

 Ecosystem of related projects

 Pig, Hive, Jaql

 Other projects

Importance de Hadoop

16

 «Nous croyons que plus de la moitié des données

du monde sera stockée dans Apache Hadoop

Publicité

durant les cinq ans à venir »

Améliorations du Hardware à travers les années

17

 Vitesse CPU

 1990 – 44 MIPS at 40 MHz

 2010 – 147,600 MIPS at 3.3 GHz

 RAM Memory

 1990 – 640K conventional memory (256K extended memory

recommended)

 2010 – 8-32GB (and more)

 Disk Capacity

 1990 – 20MB

 2010 – 1TB

Améliorations du Hardware Sauf…

18

 Disk Latency ( vitesse de lecture et d’écriture ) - pas

beaucoup d'améliorations dans les 7-10 dernières

années , actuellement environ 70 - 80MB / sec

Parallel Data Processing est la réponse!

19

Nous avons travaillé longtemps avec:

  • GRID computing - propage la charge de traitement –
  • Distributed workload - difficile pour gérer les

applications , les frais sont lourds.

  • Parallel databases - DB2 DPF , Teradata , Netezza ,

etc ( distribue les données )

Parallel Data Processing est la réponse!

20

 Distributed computing : plusieurs ordinateurs

apparaissent comme un super-ordinateur pour

communiquer les uns avec les autres par envoi de

messages , fonctionnent ensemble pour atteindre

un but commun

Parallel Data Processing est la réponse!

21

 Challenges du Distributed computing :

 Hétérogénéité

 Extensibilité

 Sécurité

 Evolutivité

Publicité

 Concurrence

 La tolérance aux pannes

What is Hadoop?

22

 Apache framework est un environnement open

source fiable, évolutif et distribué pour le calcul

de quantité massive de données

 Masque détails et la complexité du système sous-jacent de

l'utilisateur

 Développé en Java

What is Hadoop?

23

 Consiste en 3 Sous projets:

− Hadoop Common

− MapReduce

− Hadoop Distributed File System (HDFS)

 Conçu pour du matériel de base hétérogène

 Nouvelle façon de stocker et traiter les données

 Apporte le traitement aux données

Les principes de conception de Hadoop

 Optimisé pour gérer :

24

 Quantités massives de données à travers le parallélisme

 Variété de données ( structurées , non structurées , semi-

structurées )

 Utilisation de matériel de base peu coûteux

 Fiabilité fournie par la réplication

Attention

25

Hadoop est pas pour tous les types de travaux:

 Pas pour traiter les transactions (accès aléatoire )

 Pas bon quand le travail ne peut pas être parallélisé

 Pas bon pour l'accès aux données à faible latence

 Pas bon pour le traitement de beaucoup de petits

fichiers

 Pas bon pour les calculs intensifs avec peu de données

Qui Utilise Hadoop?

26

Evolution de Hadoop

27

Publicité

Eco-système de Hadoop

28

Hadoop est étendu par un éco-système open source:

Apache Hadoop

29

 Flexible,

 Supporte un large processing de données

– Inspiré par la technologie Google (MapReduce, GFS,

BigTable, …)

– Initié par Yahoo

– Well-suited to batch-oriented, read-intensive

applications

– Supporte une large varieté de données

Apache Hadoop

30

Permet aux applications de travailler avec des milliers

de nœuds et des pétaoctets parallèlement et avec coût

modéré.

– CPU + disks = “node”

– “Nodes” peuvent être combinés en clusters

– de nouveaux “nodes” peuvent être ajoutés selon

besoin sans changement de:

• Data formats

• comment les données sont chargées

• comment les jobs sont écrites

Two Key Aspects of Hadoop

 MapReduce framework

31

– Comment Hadoop comprend et affecte le travail aux nodes (

machines )

 Hadoop Distributed File System = HDFS

– Où Hadoop stocke les données

– Un système de fichiers qui couvre tous les «nodes» d'un cluster

Hadoop

 Il relie les systèmes de fichiers sur de nombreux «nodes »

locaux pour en faire un grand système de fichiers