Ministère de l’Enseignement Supérieur et de la Recherche Scientifique
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise
Informatique décisionnelle et Entrepôts de données
Belhassen Guettat
Attention !
Ce produit pédagogique numérisé est la propriété exclusive de l'UVT. Il est strictement interdit de la reproduire à des fins commerciales. Seul le téléchargement ou impression pour un usage personnel (1 copie par utilisateur) est permis.
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Semaine 12 : Informatique décisionnelle et Entrepôts de données
Description
Après des années d'investissements majeurs pour mettre en place des plateformes technologiques qui supportent les processus d'affaires et consolident des structures opérationnelles intégrées et efficaces, les organisations sont maintenant capables d'emmagasiner une quantité considérable de données sur les clients, les transactions d'affaire, les produits, les employés, les partenaires, les compétiteurs, etc.
Or, comment extraire de cette imposante masse de données tous les secrets qui s'y cachent et dont la connaissance servirait entre autres à appuyer la prise de décision juste à temps et reposant sur des informations fiables? Voilà ce qui constitue l'objet d'étude de l'intelligence d'affaire, ou BI (« business intelligence ») : une réponse aux besoins actuels d'information pour la prise de décision par l'utilisation intensive des technologies de l'information. L'intelligence d'affaires vise à extraire de l'information à partir des données internes (saisies par les systèmes opérationnels de l'entreprise) et externes. Pour être en mesure de déceler cette information cachée, il faut premièrement enregistrer les données dans des structures appropriées aux entrepôts de données. Ensuite, il faut analyser ces données à l'aide de techniques statistiques et multidimensionnelles appropriées et de logiciels spécialisés qui aideront l'analyste dans sa démarche. Le cours est organisé selon trois thématiques.
Objectifs Spécifiques
- Clarifier le concept de projet d'intelligence d'affaires ou BI « business intelligence »; - Examiner le rôle des technologies de l'information pour la mise en œuvre d'un projet
-
d'intelligence d'affaires; Fournir aux étudiants un aperçu des technologies, des techniques, des outils et des méthodologies disponibles pour la mise en œuvre, avec succès, d'un projet d'intelligence d'affaires pour les organisations;
- Développer les habiletés de construction d'un entrepôt de données et d'analyse des
données.
Ressources Disponibles pour les Apprenants
Support de cours (Acétates).
- - Diapositives para‐pédagogiques (supplément). - Documents à lire et à synthétiser. -
Études de cas.
2
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
1. DEFINITION
L’informatique décisionnelle est un système qui met à disposition des utilisateurs une collection de données orientées sujet, intégrées, non volatiles et historisées, organisées pour le support d'un processus d'aide à la décision. [Bill IMMON in "Using the DataWarehouse"].
Ce n’est pas une application, un ou une boite à outils, un progiciel tout fait il est spécifique à l’entreprise. Le terme Informatique Décisionnelle est utilisé dans son sens générique et désigne indifféremment un datawarehouse, datamart, datamining, entrepôt de données, SIAD, infocentre ou EIS.
2. EVOLUTION DU CONCEPT
Avant les années 90, on travaillait avec les SIAD (Systèmes Interactifs d’Aide à la Décision),
dénomination qui à gardé une connotation technique et aux mains de spécialistes.
Au début des années 90, l’infocentre était une base de données laissée à la disposition plus ou moins
libre des utilisateurs. Souvent non structurée et non gérée, cette base est très vite devenue inutilisable ;
ce système qui a été conçu pour le top management, a été jugé trop rigide et difficilement adaptables
aux besoins changeant du management.
1993 - La technologie OLAP et ses variantes est apparu et 93 et s’est très vite développée, beaucoup
d’éditeurs ont proposé une gamme d’outils performants.
1997 : La généralisation des ERP, qui ne peut traiter les besoins décisionnel, à fait prendre conscient aux entreprise à la quantité importante de données inexploitées produite par l’ERP.
3. LES DIFFERENCES PAR RAPPORT A L’INFORMATIQUE OPERANTE
L’informatique opérante (ou de production) est caractérisée par le traitement transactionnel dit OLTP (On‐Line Transactional Processing) et est définie plus précisément par les 12 règles énoncées par E. F. CODD dans les années 1980. L’informatique décisionnelle est caractérisée par l’analyse OLAP (On Line Analytical Processing) et est définie plus précisément par les 12 règles énoncées par W. H. IMMON en 1993.
3
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Les différences par rapport a l’informatique opérante
Exemple : ERP Opérante
Transactions - nombreuses - petites - maîtrisées
OLTP On -Line Transactional Processing
Pas d’historisation (temps implicite)
Pas d’agrégation
OLAP On -Line Analytical Processing
Décisionnelle
Analyse - Simulation
Requêtes - peu nombreuses - lourdes - non maîtrisées
Historisation (temps explicite)
Agrégation
Planche 26 - L’informat ique décisionnelle au service du management
Les problèmes classiques de l’informatique Lorsqu’on a voulu rapprocher les différentes données de l’entreprise, la principale difficulté qui est apparue est la non cohérence globale de ces données. Car chaque utilisateur à historiquement défini ses données pour ses propres besoins, qu'il a naturellement implémenté dans ses bases de données et ses applications.
Exemple : le Chiffre d’Affaires n’est certainement pas défini de la même manière par la Direction Commerciale qui souhaite rapidement en avoir une estimation ne serait‐ce que pour évaluer par exemple l’impact d’une campagne publicitaire. A l’inverse la Direction Financière aura le souci de précision et de respect des règles comptables et n’aura en conséquence pas la même définition ni les mêmes règles de calcul. La vision transversale exigée en décisionnel fait ressortir ces différents points de vue, d'où ce problème d'incohérence.
Les problèmes classiques de l’informatique
Hétérogénéité - des plateformes - de la définition des données - de la mise à jour
DG
DCM
DAF
DRH
Achats
Prod
AQ
DSI
SAV
Données CA Client Fournisseur ...
Plateformes Mainframe Base Appli
déf. 1 déf. 1
déf. 2 déf. 2 déf. 1
déf. 3
déf. 2
IBM DB2 X,Y
Oracle Z
Oracle U
T
Planche 27 - L’informat ique décisionnelle au service du management
déf. 4
Hétérogénéité (cid:215) Redondance (cid:215) Incohérence
4
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Une autre difficulté est apparu, elle relève de la différence de nature des informations demandées en décisionnel. Par exemple : "un client signe un contrat", le modèle de données opérationnel correspondant peut se représenter comme suit : Client ……
SIGNE ... Contrat.
Mais ce modèle n'est pas assez riche pour pouvoir répondre aux besoins décisionnels. Pour permettre l'analyse et la simulation on voudra d'une part segmenter à un ou plusieurs niveaux les notions de clients et de contrats d'ou la notion importante de nomenclature ou sont inverse l'agrégation et d'autre part observer l'évolution dans le temps des différentes données, d'où l'autre notion importante d'historisation. On distingue trois types d’historisation :
La datation d’événements ; La mémorisation de changements d’états (un client change d’adresse, de catégorie) ;
(cid:131) (cid:131) (cid:131) Une évolution des changements de structure (modification du référentiel, notion de
périmètre, une agence change de secteur, etc.).
Pour reprendre l'exemple précédent : à la place de "un client signe un contrat", en décisionnel l'on
préférera : "Pour un type de contrat, un segment de clientèle et une période il a été signé X Euros".
Une modélisation différente
Le décisionnel nécessite un autre type de modélisation
Opérante
Contrat
A été signé
Client
Décisionnelle
Type de contrat
A été signé
Segment clientèle
Période Montant
Planche 28 - L’informat ique décisionnelle au service du management
La troisième difficulté est apparue lorsqu’on a voulu des analyses et des simulations utilisables et partageables par tous.
La quatrième difficulté, qui est moins apparente, est le temps consacré à la confection de ces fichiers et
documents : extraction des données, élaboration des macros sur les tableurs, analyse, présentation, etc.
Pour résoudre ces difficultés, le premier réflexe à été de modifier les applications opérationnelles. Mais cette opération dégrade les performances et, pour répondre a de nouveaux besoins de pilotage, la répétition de ce type d'opération, perturbe les utilisateurs. Enfin, en introduisant dans les bases de nouvelles données, non volatiles, non rafraîchies issues de l'historisation, les besoins
Publicité
5
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
décisionnels greffés dans les applications opérationnelles, augmentent la volumétrie des bases ce qui contribue également à dégrader les performances.
L’apparition du concept de Datawarehouse (entrepôt de données) et de la technologie OLAP a en partie résolu les difficultés citées précédemment.
4. LES TYPES D’OUTILS
Les types d’outils
Présentation (clients)
Requêteur - TBB Datamining - Textmining Arbre de décision
Administration
Référentiel des méta-données Fédérer les référentiels opérationnels Maintenance, sécurité
Rela- tionnelle
et/ou
Multi- dimen.
Bases
ROLAP - MOLAP - HOLAP DOLAP - VOLAP Une combinaison d’1 ou +
Extraction Transformation Loading
Extraire de toute plateforme Nettoyer, calculer, formater Charger dans toute base
Planche 29 - L’informat ique décisionnelle au service du management
On distingue 4 types d'outils :
(cid:131)
(cid:131)
Les ETL (Extraction ‐ Transformation ‐ Loading) outils d'alimentation des bases de données qui extraient, normalisent et transforment les données qui seront stockées. Les outils base de données qui stockent les données (brutes, agrégées ou historisées) selon des axes d'analyse définis afin de répondre le plus efficacement aux requêtes utilisateurs sans perturber les systèmes opérationnels. Deux types de bases sont employés, les bases de données relationnelles et les bases de données multidimensionnelles. Les outils d'aide à la décision qui permettent l'extraction et la présentation aisée des informations par les utilisateurs. Les outils "DataMining" permettent une exploration en ligne des bases afin d'en extraire une information exploitable par les décideurs. Les outils d'administration permettant de gérer caractéristiques des données (référentiel), modéliser les données (conception), etc. Outres les outils dédiés au décisionnel, des évolutions sont également à prévoir dans le domaine des
les droits d'accès (sécurité),
les
(cid:131)
(cid:131)
applications progiciels packagées. En effet, des modules adaptés aux problématiques décisionnelles
apparaissent dans les offres progicielles. Des éditeurs comme Comshare, Hyperion, ou SAS sont
positionnés sur ce créneau, suivis désormais par les principaux acteurs du monde des progiciels
6
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
intégrés, comme SAP, Oracle ou Baan. Même si l'idée du progiciel décisionnel "clé en main" apparaît
illusoire, ceux-ci devraient permettre progressivement aux entreprises de se concentrer sur la
construction des parties les plus stratégiques de leur système décisionnel, en s'appuyant sur des
progiciels pour tous les autres domaines.
L’attitude des éditeurs d’ERP ERP = Enterprise Resources Planning (Progiciel de Gestion Intégré)
SIS de SAP R/3
FIS
Compta, Finance s
SAP R/3
HIS
Ressources h umaine s
LIS
Lo gistique (ach ats, vente s, ...)
L’approche progiciel consiste souvent à tirer le datawarehouse vers sa propre base de données « propriétaire »
BW de SAP R/3
BW
Compta , Fi nances
SAP R/3
BW
Ressou rce s humaines
240 cubes BW !
BW
Log istique (achats, ve ntes, ...)
Planche 30 - L’informat ique décisionnelle au service du management
Les outils d’alimentation
Parallèlement à l'apparition des offres progicielles, émergent des solutions facilitant l'extraction de
données issues d'un progiciel. L'éditeur ETI, par exemple, propose des interfaces d'extraction des
données à partir de progiciels tels que SAP. Dans la même logique, apparaissent des logiciels
permettant d'exploiter facilement des données externes. Comshare propose des agents capables
d'extraire et de mettre en valeur des informations issues de Reuter ou du Dow Jones. Microstrategy, de
son côté, a signé un accord avec Source Informatics, fournisseur de données dans le secteur
pharmaceutique, pour faciliter l'intégration de ces données à celles d'une base de données
décisionnelle. Ainsi, acquérir des données, quelle que soit leur origine, devrait devenir avec le temps
une tâche de plus en plus simple sur un plan technique, permettant de se focaliser au maximum sur les
aspects fonctionnels.
7
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Principaux outils ETL (Extraction Transformation Loading)
Editeur
Outil
Ardent Software
DataStage
CA‐Ingres
Infopump
OpenIngres replicator
Carleton
Passport
ETI
Hummingbird
Extract
Génio
IBM
Data propagator relational
Information Builder
Copy manager
Informatica
PowerMart
Informix
Oracle
Praxis
Prism
PowerCenter
Comprehensive replication
Datamart Builder
Oracle V7 option replication
Omni replicator
Warehouse Manager
Sagent Technology
Sagent Datamart
Software AG
SourcePoint
Sybase
Vality
Replication server
Integrity Data Reengineering
8
Publicité
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
5. DE L’ETL A L’EAI (Entreprise Application Interface)
Par ailleurs les EAI, outils d’interfaçage entre applications, ont des fonctionnalités proche des ETL et certains outils proposent les deux fonctions : ETL et EAI. Exemples les outils français : Synopsis, Net.EAI (Mediapps) Dataexchanger (CrossDataBase Technology).
5.1. Les Outils de stockage
Les bases relationnelles
Rela- tionnelle
Peu chère, technique mature et ouverte mais : • Nécessité d’indexer • Parfois dé-normaliser (accepter les redondances) • Malgré tous des performances parfois ...
la-men-ta-bles
Planche 31 - L’informat ique décisionnelle au service du management
Le Relationnel inadapté
Les bases de données relationnelles et leurs outils, établis pour des systèmes OLTP, ont dans un premier temps été jugés inadaptés aux besoins de l'OLAP et cela pour les raisons suivantes
Gestion inefficace des relations à n entités.
Le modèle relationnel est basé sur un modèle physique à 2 dimensions (les tables). Lorsqu'on veut traiter des données multidimensionnelles, cela se traduit par un nombre de tables important qu'il faut relier avec des jointures. On arrive alors rapidement à des requêtes complexes (qui dit complexe, dit beaucoup de chances de se tromper) avec des performances catastrophiques. Pour essayer de résoudre ce problème, le premier réflexe a été de dénormaliser (introduire des redondances) afin de réduction le nombre de jointure et faciliter le calcul des agrégats nécessaires. Mais la dénormalisation (qui demande souvent des traitements complexes pour garantir la cohérence des données redondantes) conduit à des grosses tables (avec beaucoup de lignes et beaucoup de colonnes) qui occupent beaucoup (trop) d'espace disque et de mémoire (espace occupée par la redondance des données, par les index supplémentaires, par les
9
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
colonnes vides qui ne seront renseignées que dans certains cas). Ce qui conduit aussi à des performances dégradées ! Fonctions d'analyse insuffisantes.
Avec le SQL et même si vous êtes très fort, vous aurez du mal à :
‐ Sommer ou effectuer la moyenne de certains champs pour certaines lignes et pas pour d'autres dans la même requête;
‐ Créer des expressions faisant référence à une ensemble de lignes d'une même table (ex: pour chaque magasin, différence du chiffre d'affaires par rapport à la moyenne de la région);
‐ Sommer ou détailler selon les lignes sélectionnées dans la même requête.
5.2. Les outils frontaux (Query, Infocentre...) ont tendance pour combler cette lacune à faire des calculs sur le poste client.
Ce qui évidemment peut avoir des conséquences désastreuses pour le réseau (qui voit plusieurs méga‐octets lui passer dessus), pour le PC (qui finit très souvent par jeter l'éponge), pour l'utilisateur (qui à force de patienter finit par rejoindre une secte Zen), pour le directeur informatique (qui lorsqu'il a dépensé tout son budget dans des méga‐parallélo‐processeurs massivement extra‐ chères finit par se faire licencier). Face à ce constat (qui n'est pas exhaustif), des éditeurs ont créé les bases multidimensionnelles pour se libérer du relationnel.
6. LES BASES DE DONNEES MULTIDIMENSIONNELLES
6.1. Définition
Une base de données multidimensionnelle peut être visualisée comme une ensemble de cubes
de données, contenant eux même d'autres cubes; chaque face du cube représentant une dimension.
Chaque dimension représente une catégorie de données, comme un type de produit, un lieu, le temps,
etc. Les dimensions peuvent être hiérarchisées (Région, département, ville...). On parle alors d'attributs
(ou « membres ») hiérarchisés de la dimension. Chaque cellule de la structure multidimensionnelle
représente la consolidation d'une donnée numérique (montant des ventes, quantité de produits vendus,
marge moyenne...) pour l'intersection entre chaque attribut de chaque dimension. Cette consolidation
peut être simple (somme, moyenne) ou complexe (fonctions statistiques, financières...). Les données
consolidées sont appelées 'mesures'.
10
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
6.2. Structure physique des bases multidimensionnelles
Les données dans une base multidimensionnelle sont dynamiquement structurées et
compressées de façon à optimiser l'utilisation de place disque. Par exemple, les données 'denses' (qui
existent pour un grand nombre de dimensions) sont stockées séparément des données 'dispersées' (qui
ont un grand nombre de cellules vides). Cette optimisation de l'espace permet de gérer de grandes
quantités de données et de travailler le plus souvent avec des index gardés en mémoire. La constitution
de la base de données se fait selon le processus suivant :
(cid:131) Extraction des données provenant de SGBD (hiérarchiques, réseau ou relationnels) ou de
fichiers;
(cid:131) Décomposition des données en dimensions, attributs et mesures, (cid:131) Calculs des consolidations, (cid:131) Chargement de l'hyper‐cube selon la structure dimensionnelle fixée.
Le format d'une base de données dimensionnelle est « propriétaire » (propre à chaque éditeur). Il
n'existe aucun standard, ni « théorique », ni de fait.
Les bases multidimensionnelles
Multi-
dimen. = MOLAP
Performantes mais : • Structure figée • Accès détail difficile • Sélection complexes difficile • Tout est propriétaire
Planche 32 - L’informat ique décisionnelle au service du management
6.3. L’Hypercube une structure figée
Un hyper-cube est une structure figée qui doit le plus souvent être entièrement reconstruite à
chaque modification, même minime, de la structure dimensionnelle. Il n'est pas possible de relier des
hyper-cubes entre eux. Il s'agit donc de structures non seulement figées mais également fermées.
11
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Accès au niveau de détail difficile
Il n'est généralement pas possible d'accéder au niveau de détail le plus fin (opérationnel) ce qui peut
être parfois nécessaire dans un processus d'analyse (recherche de valeurs d'exceptions...). Il faut alors
passer sur un outil SQL pour aller chercher cette information.
Sélections complexes difficiles à réaliser
Il n'est pas possible de réaliser des sélections complexes sur un hyper-cube (on est, dans ce domaine,
loin de la richesse sémantique du SQL).
Tout est propriétaire !
Rien n'est standard : ni la structure physique, ni l'interface d'interrogation. C'est cher ! Le manque de
souplesse et l'absence de gestion des métadonnées sont les deux principaux freins à l'utilisation des
bases multidimensionnelles traditionnelles. En effet, ces deux caractéristiques sont incompatibles avec
une informatique décisionnelle à l'échelle d'une entreprise. Dans le cadre d'un Datawarehouse, il
semble difficile de concilier l'existence et la gestion dynamique d'un référentiel avec la création de
gros hypercubes relativement figés.
6.4. L’Hypercube relationnel ou le compromis
Leur principe est de stocker les données dans une base relationnelle, mais avec une structure
adaptée aux données multidimensionnelles. Des annonces sont faites en ce moment par Sybase et
Oracle. Ces deux éditeurs fourniront également des outils pour manipuler ces structures
multidimensionnelles, avec une interface proche de celle des bases multidimensionnelles. Bien
entendu, tout cela sera de format propriétaire, et l'on risque de tomber dans les même travers qu'avec
les bases multidimensionnelles. L'avantage résidera dans la possibilité d'utiliser les outils de
conception propres au relationnel.
L'OLAP Relationnel
12
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
Des outils comme DSS/SERVER de MicroStrategy ou AXSYS d'Information Advantage ont pour
principe de proposer un outil client aussi riche que ceux des bases multidimensionnelles, un moteur
OLAP capable de générer dynamiquement des requêtes SQL à partir d'une interrogation
multidimensionnelle et de la connaissance des méta-data.
Il s'agit d'un système complexe, mis en œuvre dans des projets d'envergure. L'accès rapide aux
données ne peut être assuré qu'en utilisant les plus récentes techniques d'optimisation des requêtes
relationnelles (partitionnement des bases; parallélisation des traitements...). Les coûts sont alors à
l'échelle de l'ambition des projets, tant au niveau logiciel (middleware, OLAP Engine) que matériel
(machines multiprocesseurs ...).
7. LES OUTILS DE RESTITUTION
7.1. Les outils clients (analyse et présentation)
Les outils d'interrogations ont aujourd'hui les caractéristiques suivantes :
Interface toujours graphique
(cid:131) (cid:131) Navigation : « drill down » et le « slice and dice » implémentés (cid:131) Gestion des alertes et seuils se fait par codage couleurs (cid:131) Temps de réponses sont très courts (le plus souvent immédiat) et constants Il n'existe aucun standard d'interrogation, le SQL n'est pas implémenté. Des défauts bien
embarrassants. Les bases de données multidimensionnelles sont rapides et faciles à utiliser mais on
leur fait quelques reproches : outils d'administration insuffisants et beaucoup moins riches que ceux
des bases relationnelles.
7.2. Le Datamining
C’est l’exploration des données par les techniques statistiques (régression, analyse en composantes
principales …). Les utilisations sont diverses comme :
Publicité
(cid:131) (cid:131)
Le micro‐marketing : augmenter le taux de réponse d’un mailing L’analyse de risque : banques et assurances
13
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
La grande distribution : corrélation des achats
(cid:131) 7.3. Le Textmining
Une variante du datamining pour analyser des questionnaires en texte libre. Utilisé pour extraire
du « qualitatif » d’un texte brut. Par exemple : déterminer l’état de satisfaction ou l’opinion d’un client
ou d’un usager répondant à un questionnaire.
La méthode se déroule en plusieurs étapes :
lemmatisation (retrouver la racine des termes) ; lexicométrie (compter les termes « intéressants ») ;
(cid:131) (cid:131) (cid:131) numérisation et associations.
Exemple d’outil de textmining : Text Navigator d’IBM, StatLab de SLP Software
7.4. Les arbres de décisions
Exemple : à chaque nœud de l’arbre, l'outil propose lui‐même la variable la plus discriminante
selon l'objectif à atteindre.
100 % de la population
âge
80 % de la population
20 % de la population
CSP
80 % des 20%
20 % des 20%
Exemple d’outil : Scénario de Cognos ‐ Business Miner de B.O. ‐ Alice d ’Isoft
8. LES OUTILS D’ADMINISTRATION
8.1. Le référentiel des données
Théoriquement, on peut imaginer faire l'administration des données de manière manuelle : en allant regarder où se trouve les données, en comparant les structures, en les modifiant, en les mettant à jour, etc. Pratiquement, cela devient vite difficilement gérable et un outil s'avère rapidement nécessaire.
14
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
La problématique doit être considérée sous deux angles : l'aspect organisationnel et l'aspect technique. L'erreur classique consiste à choisir un outil avant que les procédures soient définies. Acheter une solution clé en main est très risqué : en effet, les fonctionnalités de l'outil vont alors conditionner l'organisation du projet. Or l'administration de données n'est pas un problème technique, c'est un problème fonctionnel voir même de stratégie d'entreprise.
L'outil doit jouer le rôle de fédérateur des référentiels opérationnels. Il doit savoir communiquer avec l'ensemble des dictionnaires et permettre de gérer les caractéristiques autours des données décisionnelles (informations de contrôle et de service nécessaires pour assurer la cohérence et la maintenance, etc.).
Une initiative coordonnées par le Meta Group a abouti à la création en 1995 de la Metadata Coalition (à l'origine : Arbor Software, BO, Cognos, ETI et Texas Instrument ‐ maintenant il y a plus de 30 membres). Ce groupement de professionnels vise à standardiser les échanges de métadonnées entre les différents outils. Les premiers travaux ont conduit à la spécification d'une norme décrivant un protocole d'échange de métadonnées : Meta Data Interchange Specification (MDIS). Grâce à ces travaux, les outils permettent progressivement de gagner en productivité pour des tâches que les équipes informatiques ne pouvaient mettre en place jusqu'à présent que de manière personnalisée. Cette évolution est particulièrement nette dans le domaine de l'administration, qu'il s'agisse d'administration fonctionnelle ou technique.
lors de
l'apparition d'une nouvelle technologie,
les besoins en terme Comme souvent d'administration sont sous‐estimés voire ignorés. Ils apparaissent a posteriori quand, face à un système qu'elle a du mal à maîtriser, l'équipe concernée découvre les coûts induits par l'insuffisante industrialisation de l'administration et de l'exploitation. Aujourd'hui, certaines entreprises ont dépassé ce stade et la demande pour ce type de solution explose. Pour cette raison, le marché de l'administration est, dans un contexte d'Informatique Décisionnelle, actuellement le plus petit mais aussi celui dont la croissance estimée est la plus forte (Selon le Gartner Group, le marché de l'administration aura une croissance annuelle de 114 % d'ici 1999). En réponse à cette demande, un certain nombre d'éditeurs, parmi lesquels Bull, Hewlett Packard, IBM, Informix, Oracle, Platinum, SAS ou encore Software AG, sont positionnés sur ce marché. Leurs solutions adressent des problèmes tels que la gestion des métadonnées, la sécurité, l'automatisation complète de la phase d'alimentation et la gestion des optimisations. Les opportunités d'amélioration sont nombreuses. Il est donc probable que des offres issues de petites sociétés innovantes apparaissent sur ce créneau.
15
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
9. ARCHITECTURE TYPE D’UN SYSTEME DECISIONNEL
Des données opérationnelles à l'information décisionnelle on distingue 4 étapes : la collecte des
données, l'intégration, la diffusion et la présentation de l'information.
La collecte : c'est la capture et l'extraction sélective des données opérationnelles sources, ce n'est pas
une réplication car il y a « nettoyage » et transformation des données afin de réduire les incohérences.
La fonction collecte doit être non destructive et non perturbatrice vis à vis des applications
opérationnelles.
L'intégration : c'est la concentration, l'homogénéisation technique et l'unification sémantique des données.
La diffusion : c'est la répartition par domaine ou métier, l'adaptation des structures aux requêtes aux communications et au contrôle d'accès.
La présentation : ce sont les masques de restitution, la gestion des dialogues, la personnalisation. C'est malheureusement ce que les concepteurs voient en premier, mais la qualité de la présentation ‐ la décoration ‐ ne compensera jamais la mauvaise qualité de la structure des données. Ce processus, complété par une fonction d'administration, induisent la structure de base de l'informatique décisionnelle présentée par la figure suivante :
Architecture type d’un système décisionnel
Présentation (clients)
Référentiel
Administration
ODS
Rela- tionnelle
Multi- dimen.
Bases
Extraction Transformation Loading
- Requêtes - Tableau de Bord - Analyse - Simulation
Décisions Décisions
autre
Informatique opérante (les processus métier)
Bases SAP, Oracle +
Planche 34 - L’informat ique décisionnelle au service du management
C'est à partir des besoins et de cette structure de base que s'établit l'architecture définitive.
16
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
La base de collecte et d'intégration : l'ODS (Operational Data Store) est de type base de données relationnelle. Ce sas de transit a pour vocation d'historiser les données élémentaires dans un format assez proche du système source avec un minimum de transformations et d'agrégations, pour :
(cid:131) minimiser les perturbations du système de production opérationnel (performances et
exploitation) favoriser la justification a posteriori des résultats agrégés
(cid:131) (cid:131) et préserver des possibilités de re‐engineering.
L'ODS permet de reconstruire tout ou partie du datawarehouse final, par exemple en cas de modification du référentiel (restructuration du réseau commercial, des filières produits, ...)
Il peut y avoir une ou deux bases pour la diffusion et la présentation, celles‐ci sont soit centralisées dans un serveur soit décentralisées sur les postes clients. Les bases sont de type relationnelle ou multidimensionnelle, le cas le plus souple consiste disposer d'une base relationnelle et d'une base multidimensionnelle (architecture hybride ‐ HOLAP), la technologie OLAP d'analyse des données est la plus employée (On‐Line Analytical Processing = système d'analyse des données en ligne ‐ précisions techniques en annexe).
Les bénéfices de la mise en place d’un datawarehouse Le principal bénéfice de la mise en place d’un datawarehouse est une meilleure exploitation des
informations détenues au sein de l’entreprise. Rassembler les données dans un entrepôt de données
permet d’étudier en profondeur l’évolution des différents départements ou produits de l'entreprise
permettant ainsi aux managers de prendre des décisions fondées sur une vue d’ensemble du système
plutôt que sur des estimations liées à des données incomplètes.
L’argument financier plaide aussi en faveur de la mise en place d’un datawarehouse. En effet, le coût de maintenance de nombreux systèmes de prise de décision individuels peut être extrêmement élevé en comparaison de la mise en place d’une application plus centralisée de datawarehouse, plus abordable en termes de supports et de maintenance.
10. COMMENT CONSTRUIRE UN SYSTEME DECISIONNEL ?
Le coût d'implémentation d'un entrepôt de données, véritablement transversal et fédérateur de
l'ensemble des systèmes d'une entreprise, dépasse la plupart du temps tout réalisme en termes de
budget. Il est donc souvent nécessaire de construire un plan d'urbanisation d'ensemble, une cible qui
donne un fil directeur pour assurer une possibilité de convergence à terme, tout en développant
17
Enseignant : Belhassen Guettat
Université Virtuelle de Tunis
Systèmes d'Information Pour L’Entreprise Informatique décisionnelle et Entrepôts de données
l'entrepôt de données progressivement et « par appartement ». II s'agit ici de respecter une maxime de
bon sens :
La seule règle d'or du datawarehouse s'applique aussi bien :
PENSER GRAND MAIS COMMENCER PETIT
(cid:131) au matériel : puissance et coûts évoluent rapidement et mieux vaut miser sur les possibilités
d'extension du matériel (scalability) capable d'évoluer au rythme de la croissance de l'entrepôt de données
(cid:131) au logiciel : avec une "large" modélisation des données pour préserver l'avenir et une réalisation par étapes pour délivrer des résultats tangibles à court ou moyen terme (cid:131) et au projet lui‐même : un projet pilote, un datamart, sont autant d'assurances de mieux jauger l'ampleur du projet global (mieux estimer les enveloppes budgétaires, les résultats attendus, les difficultés liées à la transversalité, les délais, les impacts sur l'organisation et les utilisateurs, etc ...)
La démarche standard se présente sous forme d'un processus itératif à cycles très courts avec un rôle proactif de la maîtrise d'ouvrage : chaque itération enrichit la solution tout en respectant plus ou moins six étapes principales.
Comment construire un système décisionnel ?
Cycle Itératif Incrémental
Reproduire ce que fait l’utilisateur (Excel, …)
Voir GRAND Commencer PETIT
Plus on passe de temps sur le modèle meilleur sera le résultat
Plus on passe de temps sur la qualité des données meilleur sera le résultat
-6- Validation
-5- Modélisation
4- Analyse des sources
-1- Inventaire des requêtes
-2-Élabora