Entrepôt de données - Introduction

Cette leçon introduit le concept d'entrepôt de données (ED) dans le cadre d'un cours de Master ICA. Elle présente la modélisation dimensionnelle d’un entrepôt de données, illustrée par un cas pratique d’une grande entreprise souhaitant consolider ses informations de ventes issues de systèmes hétérogènes.

D'après le document Entrepôt de données - Introduction

Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Document source

Entrepôt de données - Introduction

Data Warehousing and Dimensional Modeling · PDF · 8 pages

Afficher l'aperçu du document

Consulter le document original →

Cette leçon introduit le concept d'entrepôt de données (ED) dans le cadre d'un cours de Master ICA. Elle présente la modélisation dimensionnelle d’un entrepôt de données, illustrée par un cas pratique d’une grande entreprise souhaitant consolider ses informations de ventes issues de systèmes hétérogènes. L’objectif est de comprendre la structure des données, leur organisation en schéma en étoile, la notion de cube de données, ainsi que les opérations d’analyse multidimensionnelle et d’agrégation.

Modélisation de base de l’entrepôt de données

Une grande entreprise disposant de plusieurs succursales souhaite regrouper chaque nuit les données de ventes du jour dans un entrepôt de données. Ces données proviennent de systèmes d’information complexes, composés d’applications et bases de données variées et hétérogènes concernant les produits, les clients et le personnel.

La modélisation de base repose sur une table principale appelée table de faits, qui enregistre chaque vente par :

  • date
  • code produit
  • code vendeur
  • code client
  • montant de la vente (indicateur à mesurer)

La clé primaire de cette table est multiple, composée des quatre premiers éléments (date, code produit, code vendeur, code client). Cette table VENTE permet de calculer des sommes de chiffre d’affaires selon différentes dimensions.

Chaque élément de la clé multiple renvoie à une table de dimension contenant des attributs détaillés. Par exemple, la table PRODUIT contient :

  • code produit
  • libellé du produit
  • code famille de produit
  • libellé famille

De même, il existe des tables de dimension pour le vendeur, le client et le temps (date) :

  • VENDEUR : code vendeur, nom, code et nom du service de vente
  • CLIENT : code client, nom, type de client
  • TEMPS : date, nom du jour, numéro de semaine, mois, année

La jonction entre la table de faits et ces tables de dimensions forme un schéma en étoile, caractéristique de la modélisation dimensionnelle utilisée dans les entrepôts de données.

Le cube de données et les dimensions

Le schéma en étoile peut être représenté sous forme d’un cube de données. Dans l’exemple, le cube est un hypercube à quatre dimensions : produit, client, vendeur et date.

Un cube de données à trois dimensions peut être visualisé comme un tableau à trois axes, par exemple vendeur, produit et jour. Lorsque le nombre de dimensions dépasse trois, on parle d’hypercube, mais on continue à utiliser le terme « cube » par simplification.

Un exemple simple est un tableau à deux dimensions affichant le chiffre d’affaires total par vendeur et par produit, toutes dates et clients confondus. Par exemple, le vendeur Dupont a vendu pour 10 500 € de skis sur la période considérée.

Les coupes dans le cube de données

Pour analyser un hypercube à quatre dimensions, on réalise des coupes (slice and dice) en fixant la valeur d’une ou plusieurs dimensions afin d’obtenir des sous-cubes à trois ou deux dimensions plus facilement exploitables.

Par exemple, en fixant la date, on obtient un cube à trois dimensions (produit, client, vendeur) appelé cube D. On peut alors réaliser des coupes supplémentaires sur ce cube D en fixant une autre dimension, ce qui donne des tableaux à deux dimensions :

  • (client, vendeur)
  • (produit, vendeur)
  • (client, produit)

Au total, à partir des différentes combinaisons, on peut obtenir six types de tableaux à deux dimensions, en fonction des dimensions conservées :

  • (client, vendeur), (produit, vendeur), (client, produit)
  • (client, date), (produit, date), (vendeur, date)

Les agrégats

Pour faciliter la présentation des données dans des tableaux de bord, il est souvent nécessaire d’agréger les données, c’est-à-dire de sommer les valeurs sur certaines dimensions. Par exemple, le tableau vendeur-produit peut présenter le montant cumulé des ventes pour tous les clients et toutes les dates confondues.

La création de tables d’agrégats, qui enregistrent ces sommes pré-calculées, permet d’accélérer les requêtes. Cependant, cela complique le modèle dimensionnel et augmente l’espace de stockage nécessaire.

Un exemple de table d’agrégat peut contenir :

  • code produit
  • code vendeur
  • montant cumulé des ventes par produit et vendeur, toutes dates et clients confondus

Analyse multidimensionnelle

Les dimensions produit et vendeur sont hiérarchiques : un produit appartient à une famille de produits, un vendeur à un service de vente. Cette hiérarchie permet de réaliser des analyses ascendantes (agrégation vers des niveaux supérieurs) ou descendantes (détail vers des niveaux inférieurs).

Par exemple, on peut passer d’un tableau détaillé vendeur-produit à un tableau agrégé famille de produits - service de vente, en sommant les ventes selon ces regroupements.

Cette capacité à naviguer entre différents niveaux de détail dans les dimensions est appelée analyse multidimensionnelle.

Le cube de données permet ainsi de représenter de nombreuses possibilités de sommations, par exemple :

  • Montant de la vente par produit ou famille de produits
  • Montant de la vente par vendeur ou service de vente
  • Montant de la vente par client
  • Montant de la vente toutes dates confondues, ou par jour, semaine, mois

Points clés

  • La table de faits contient les indicateurs mesurés (montant de la vente) et une clé multiple définissant les dimensions (date, produit, vendeur, client).
  • Les tables de dimensions contiennent les attributs descriptifs liés à chaque élément de la clé multiple.
  • Le schéma en étoile organise la table de faits au centre et les tables de dimensions autour.
  • Le cube de données est une représentation multidimensionnelle des données permettant des analyses selon plusieurs axes.
  • Les coupes (slice and dice) permettent de fixer certaines dimensions pour obtenir des vues à 2 ou 3 dimensions exploitables.
  • Les tables d’agrégats pré-calculent des sommes pour accélérer les requêtes, au prix d’un modèle plus complexe et d’un stockage accru.
  • Les dimensions hiérarchiques permettent l’analyse ascendante et descendante, composantes essentielles de l’analyse multidimensionnelle.

Partager

Commentaires

Aucun commentaire pour le moment. Posez la première question.

Les commentaires sont relus avant publication. Votre e-mail n'est jamais affiché.

← Toutes les révisions