Introduction aux Big Data
Cette introduction aux Big Data présente les concepts fondamentaux et les enjeux liés à la gestion des données massives. Elle s'inscrit dans un cours de management des systèmes d'information et vise à familiariser les étudiants avec les caractéristiques, les défis et les approches traditionnelles et innovantes pour exploiter ces données.
D'après le document Introduction aux Big Data
Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.
Document source
Information Systems and Data Management · PDF · 17 pages · 2016
Afficher l'aperçu du document
Cette introduction aux Big Data présente les concepts fondamentaux et les enjeux liés à la gestion des données massives. Elle s'inscrit dans un cours de management des systèmes d'information et vise à familiariser les étudiants avec les caractéristiques, les défis et les approches traditionnelles et innovantes pour exploiter ces données.
Les faits marquants des Big Data
Chaque jour, nous générons environ 2,5 trillions d’octets de données. Plus de 90 % des données mondiales ont été créées au cours des deux dernières années, et 90 % de ces données sont non structurées. Ces données proviennent de sources variées telles que les capteurs climatiques, les messages sur les réseaux sociaux, les images et vidéos en ligne, les enregistrements transactionnels d’achats en ligne, ou encore les signaux GPS des téléphones mobiles. Ces ensembles de données sont qualifiés de Big Data ou données massives.
Les intérêts et usages des Big Data
Les Big Data jouent un rôle crucial dans la prise de décision en entreprise. Pourtant, 83 % des chefs d’entreprise prennent des décisions basées sur des informations en lesquelles ils n’ont pas confiance ou auxquelles ils n’ont pas accès. De plus, 60 % des directeurs des systèmes d’information (DSI) considèrent que l’informatique décisionnelle et analytique est essentielle pour améliorer la compétitivité. Les PDG cherchent à améliorer la capture et la compréhension des informations pour accélérer leurs décisions.
Les sources de données multiples, issues de sites web, bases de données, téléphones ou serveurs, permettent de :
- Détecter les sentiments et réactions des clients
- Identifier des conditions critiques dans les hôpitaux pour intervenir à temps
- Prédire des modèles météorologiques pour optimiser l’usage des éoliennes
- Prendre des décisions risquées basées sur des données transactionnelles en temps réel
- Identifier des criminels ou menaces à partir de vidéos, sons et flux de données
- Étudier les réactions des étudiants pour prédire leur réussite scolaire
Les défis des Big Data
Les principaux défis liés aux Big Data sont :
- Réunir un grand volume de données variées pour découvrir de nouvelles idées
- Capturer des données créées rapidement
- Stocker toutes ces données de manière fiable et économique
- Traiter ces données efficacement pour en extraire de la valeur
Les 5 V du Big Data
Les données massives se caractérisent par cinq dimensions essentielles, appelées les 5 V :
- Volume : quantité massive de données, souvent en téraoctets, comprenant enregistrements, archives, transactions, tables et fichiers.
- Variété : diversité des formats et types de données, incluant données structurées, non structurées, multi-facteurs et probabilistes.
- Vitesse : rapidité d’arrivée et de traitement des données, pouvant concerner des flux en temps réel ou des traitements par lots.
- Véracité : fiabilité et qualité des données, qui peuvent être affectées par des erreurs, des sources peu fiables ou des incohérences.
- Valeur : capacité à transformer les données en informations exploitables et en valeur stratégique pour l’entreprise.
Volume
Le coût du stockage des données a fortement diminué ces dernières décennies, passant de 100 000 $ par Go en 1980 à 0,10 $ par Go en 2013. Cependant, les infrastructures fiables comme les réseaux de stockage SAN peuvent rester coûteuses. Il est donc nécessaire de choisir quelles données stocker, en tenant compte de leur sensibilité et de leur utilité. Par exemple, les logs peuvent sembler inutiles mais s’avèrent souvent très précieux. La question centrale est de déterminer quelles données méritent d’être conservées : transactions, logs, données métier, données utilisateurs, données médicales ou sociales. Aucune donnée n’est inutile, certaines n’ont simplement pas encore trouvé d’usage.
Variété
Les données doivent souvent respecter un format prédéfini pour être stockées dans des bases ou entrepôts de données. Pourtant, la majorité des données existantes sont non structurées ou semi-structurées. On trouve ainsi des données sous plusieurs formats et types. Par exemple, dans un centre d’appel, une discussion peut être stockée sous forme textuelle pour analyser le contenu, mais aussi sous forme d’enregistrement audio pour interpréter le ton de voix. Certaines données paraissent obsolètes mais sont utiles pour certaines décisions complexes, comme le transport de marchandises où plusieurs facteurs (GPS, plan de livraison, circulation, chargement, niveau d’essence) doivent être pris en compte.
Vitesse
La vitesse concerne la rapidité d’arrivée des données et leur traitement. Les données doivent parfois être stockées dès leur arrivée, ce qui peut représenter plusieurs téraoctets par jour. Un exemple concret est la recommandation personnalisée dans le commerce en ligne : savoir non seulement quel article un client a acheté, mais aussi combien de temps il a passé à le consulter, permet d’envoyer un email promotionnel au moment opportun. Ne pas traiter ces données en temps réel peut entraîner une perte d’informations précieuses.
Véracité
La véracité fait référence à la qualité et à la fiabilité des données. Avec l’augmentation du volume, la qualité peut se dégrader à cause d’abréviations, de fautes de frappe, de déformations ou de sources peu fiables. Les solutions Big Data doivent compenser ces défauts en s’appuyant sur la masse de données disponibles. Cela nécessite une grande rigueur dans la collecte, le recoupement, le croisement et l’enrichissement des données afin de réduire l’incertitude et de respecter les cadres légaux, garantissant ainsi la confiance, la sécurité et l’intégrité des données.
Valeur
Le V le plus important est la valeur. Il s’agit de transformer toutes les données en informations exploitables. Sans valeur, les données sont inutiles. L’objectif est d’atteindre des buts stratégiques en créant de la valeur pour les clients et pour l’entreprise dans tous les domaines d’activité.
Approches traditionnelles et Big Data
L’approche traditionnelle est guidée par les besoins métier. Le responsable métier définit les questions à poser, puis l’informatique conçoit une solution avec des structures et fonctionnalités adaptées. Le responsable métier exécute ensuite les requêtes pour répondre à ces questions de manière répétitive. Cette approche convient aux données structurées, aux processus répétitifs, aux sources stables et aux besoins bien définis.
En revanche, l’approche Big Data est orientée par les sources d’information disponibles, qui guident la découverte créative. Le responsable métier et l’équipe IT identifient les sources de données, puis explorent les données et leurs relations pour formuler de nouvelles questions. L’IT fournit une plateforme permettant cette exploration créative de toutes les données disponibles, intégrant parfois des technologies traditionnelles.
Il ne s’agit pas de choisir entre approche classique et Big Data, mais plutôt de les faire fonctionner ensemble. L’entrepôt de données traditionnel et la plateforme Big Data doivent être intégrés pour exploiter au mieux les sources traditionnelles et nouvelles.
Différences entre approche traditionnelle et Big Data
| Approche Traditionnelle | Approche Big Data |
|---|---|
| Analyse structurée et répétée | Analyse itérative et exploratoire |
| Responsables métier déterminent les questions à poser | Responsables métier explorent la plateforme pour définir les questions |
| Responsables IT structurent les données pour répondre aux questions | Responsables IT fournissent une plateforme pour la découverte créative |
Points clés
- Les Big Data désignent des ensembles massifs de données, souvent non structurées, générées à grande vitesse et provenant de sources variées.
- Les 5 V (Volume, Variété, Vitesse, Véracité, Valeur) caractérisent les données massives et leurs défis.
- Le stockage et le traitement des Big Data nécessitent des choix stratégiques pour gérer coûts, fiabilité et utilité des données.
- L’approche traditionnelle est adaptée aux données structurées et besoins bien définis, tandis que l’approche Big Data favorise l’exploration créative des données multiples et variées.
- Il est essentiel d’intégrer les deux approches pour exploiter pleinement le potentiel des données dans l’entreprise.
Commentaires
Aucun commentaire pour le moment. Posez la première question.