Cours Big Data - 2019
Ce laboratoire présente une introduction complète au Big Data, ses caractéristiques, ses enjeux et ses applications. Il permet de comprendre les concepts fondamentaux du Big Data, notamment les 5 dimensions clés (5Vs), ainsi que les technologies associées comme Hadoop et MapReduce.
D'après le document Cours Big Data - 2019
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source
Data Science and Big Data Technologies · PDF · 52 pages · 2019
Afficher l'aperçu du document
Ce laboratoire présente une introduction complète au Big Data, ses caractéristiques, ses enjeux et ses applications. Il permet de comprendre les concepts fondamentaux du Big Data, notamment les 5 dimensions clés (5Vs), ainsi que les technologies associées comme Hadoop et mapreduce-6e20911580">MapReduce. Ce TP est destiné aux étudiants souhaitant acquérir une vision globale du Big Data, ses défis techniques et ses usages dans différents secteurs. Aucun matériel spécifique n’est requis, mais une connaissance de base en informatique et en gestion de données est recommandée.
Objectifs
- Comprendre la définition et les enjeux du Big Data.
- Identifier les cinq dimensions principales du Big Data (5Vs).
- Connaître les méthodes de traitement et d’analyse des données massives.
- Découvrir les cas d’utilisation du Big Data dans divers domaines.
- Appréhender les technologies clés comme Hadoop, MapReduce et les bases NoSQL.
Prérequis et installation
- Connaissances de base en bases de données et systèmes distribués.
- Notions élémentaires de programmation et de traitement de données.
- Accès à un environnement informatique avec un système capable d’exécuter des outils Big Data (non détaillé dans ce TP).
- Lecture préalable des concepts de systèmes de fichiers distribués et de traitement parallèle est un plus.
Introduction au Big Data : définition et contexte
Le Big Data désigne l’ensemble des technologies, architectures, outils et procédures permettant de traiter et analyser de très grandes quantités de données hétérogènes et changeantes, souvent à un rythme très rapide. Ce concept a émergé autour de 2012 face à la croissance exponentielle des volumes de données générées par les entreprises et les individus, rendant les outils classiques insuffisants.
Le Big Data vise à extraire des informations pertinentes à un coût accessible, en captant et analysant des données variées, structurées ou non, provenant de multiples sources.
Un exemple simple illustre la problématique : un fichier de 1 To peut nécessiter plus de 3 heures pour être lu et traité sur un seul serveur. En divisant ce fichier en 100 blocs et en utilisant un traitement parallèle, le temps de lecture et de calcul peut être réduit à moins de 2 minutes et 1 minute respectivement.
Les cinq dimensions du Big Data (5Vs)
Le Big Data se caractérise par cinq dimensions principales :
- Volume : Les données à traiter atteignent des tailles énormes, souvent en téraoctets voire pétaoctets. Par exemple, 4,4 zettaoctets correspondent à 4,4 trillions de gigaoctets.
- Variété : Les données sont très diverses : structurées (bases de données, feuilles de calcul) et non structurées (textes, images, vidéos, données issues de capteurs, médias sociaux, etc.).
- Vélocité : La vitesse à laquelle les données sont générées et doivent être traitées, souvent en temps réel, comme dans le cas des données de streaming ou des capteurs embarqués dans les voitures modernes.
- Véracité : La qualité et la fiabilité des données, qui peuvent être bruitées ou imprécises. La mauvaise qualité des données peut coûter des millions de dollars par an à l’économie.
- Valeur : Le Big Data doit apporter une valeur ajoutée stratégique, en générant de nouvelles connaissances utiles pour l’entreprise ou les clients.
Des dimensions supplémentaires comme la variabilité et la visualisation sont parfois ajoutées, portant le nombre de « V » à 7 voire 10 selon les sources.
Gestion des données massives : méthodes et technologies
Pour gérer les volumes et la complexité des données, le Big Data repose sur plusieurs principes :
- Distribution des données : Les données sont divisées en petits blocs répartis sur plusieurs nœuds ou machines dans un cluster, via un système de fichiers distribué (DFS).
- Traitement parallèle : Chaque nœud traite sa partie des données simultanément. Le résultat final est obtenu par agrégation des résultats partiels. MapReduce est un algorithme clé pour ce traitement distribué.
- Tolérance aux pannes : Les données sont répliquées sur plusieurs machines pour garantir leur disponibilité même en cas de panne d’un serveur.
- Utilisation de matériel standard : Le Big Data privilégie des serveurs standards plutôt que des équipements spécialisés coûteux, réduisant ainsi les coûts d’infrastructure.
- Scalabilité : Il est facile d’ajouter des nœuds supplémentaires au cluster pour augmenter la capacité de stockage et de traitement.
Cas d’utilisation du Big Data
Le Big Data trouve des applications dans de nombreux domaines :
- Santé : Analyse des données patients pour comparer l’efficacité des traitements, prévoir les épidémies, déployer des systèmes d’aide à la décision clinique et assurer la télésurveillance des maladies chroniques.
- Marketing : Analyse prédictive des comportements d’achat, analyse des sentiments sur les réseaux sociaux pour gérer l’e-réputation, et optimisation de l’aménagement des magasins grâce à l’analyse des déplacements et habitudes des clients.
- Politique : Analyse des opinions publiques pour les campagnes électorales, avec des investissements massifs dans les projets Big Data par le gouvernement américain.
- Sport : Collecte de données biométriques via capteurs intégrés aux équipements des joueurs, analyse vidéo des déplacements sur le terrain, permettant d’améliorer la stratégie et la gestion des joueurs.
- Sécurité publique : Analyse avancée de vidéosurveillance pour la reconnaissance faciale, la détection d’objets ou de véhicules non autorisés, et la sécurité des espaces publics.
Principaux acteurs et technologies du Big Data
Les grandes entreprises du web ont été pionnières dans le traitement des données massives :
- Google : Développement du système de fichiers GFS et de l’algorithme MapReduce pour le traitement distribué.
- Yahoo : Création de Hadoop, une plateforme Java open source inspirée de GFS et MapReduce.
- Facebook : Cassandra, base de données NoSQL distribuée.
- Twitter : Hive et Storm pour l’analyse et le traitement des données massives.
- LinkedIn : SenseiDB et Voldemort, bases de données distribuées pour de très grosses volumétries.
Ces technologies sont souvent intégrées dans des solutions open source, soutenues par la fondation Apache et utilisées par des acteurs majeurs comme IBM, Oracle ou Microsoft.
Conclusion
Nous sommes à l’ère de la production massive de données, générées par les applications, les réseaux de capteurs, les transactions, les médias et les individus. Le stockage seul ne suffit plus, car le temps d’accès augmente avec la quantité de données. Le Big Data propose des solutions basées sur la distribution et le traitement parallèle pour analyser efficacement ces données. Hadoop est la plateforme la plus répandue pour ces traitements, et constitue la base des technologies Big Data actuelles.
Commentaires
Aucun commentaire pour le moment. Posez la première question.