Informatique Décisionnelle et Entrepôts de Données

Page 1 sur 28Lecteur de document UniversityLib

Informatique Décisionnelle et Entrepôts de Données

Business Intelligence and Data Warehousing · notes

Voir tous les documents en intelligence artificielle et données

Ministère de l’Enseignement Supérieur et de la Recherche Scientifique

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise

Informatique décisionnelle et Entrepôts de données

Belhassen Guettat

Attention !

Ce produit pédagogique numérisé est la propriété exclusive de l'UVT. Il est strictement interdit de la reproduire à des fins commerciales. Seul le téléchargement ou impression pour un usage personnel  (1 copie par utilisateur) est permis.

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Semaine 12 : Informatique décisionnelle et Entrepôts de données

Description

Après des années d'investissements  majeurs pour mettre en place des plateformes technologiques qui  supportent  les  processus  d'affaires  et  consolident  des  structures  opérationnelles  intégrées  et efficaces,  les  organisations  sont  maintenant  capables  d'emmagasiner  une  quantité  considérable  de données  sur  les  clients,  les  transactions  d'affaire,  les  produits,  les  employés,  les  partenaires,  les compétiteurs, etc.

Or, comment extraire de cette imposante masse de données tous les secrets qui s'y cachent et dont la connaissance servirait entre autres à appuyer la prise de décision juste à temps et reposant sur des informations fiables? Voilà ce qui constitue l'objet d'étude de l'intelligence d'affaire, ou BI (« business intelligence  »)  :  une  réponse  aux  besoins  actuels  d'information  pour  la  prise  de  décision  par l'utilisation  intensive  des  technologies  de  l'information.  L'intelligence  d'affaires  vise  à  extraire  de l'information à partir des données internes (saisies par les systèmes opérationnels de l'entreprise) et externes. Pour être en mesure de déceler cette information cachée, il faut premièrement enregistrer les données dans des structures appropriées aux entrepôts de données. Ensuite, il faut analyser ces données  à  l'aide  de  techniques  statistiques  et  multidimensionnelles  appropriées  et  de  logiciels spécialisés qui aideront l'analyste dans sa démarche. Le cours est organisé selon trois thématiques.

Objectifs Spécifiques

- Clarifier le concept de projet d'intelligence d'affaires ou BI « business intelligence »; - Examiner  le  rôle  des  technologies  de  l'information  pour  la  mise  en  œuvre  d'un  projet

-

d'intelligence d'affaires; Fournir  aux  étudiants  un  aperçu  des  technologies,  des  techniques,  des  outils  et  des méthodologies  disponibles  pour  la  mise  en  œuvre,  avec  succès,  d'un  projet  d'intelligence d'affaires pour les organisations;

- Développer  les  habiletés  de  construction  d'un  entrepôt  de  données  et  d'analyse  des

données.

Ressources Disponibles pour les Apprenants

Support de cours (Acétates).

- - Diapositives para‐pédagogiques (supplément). - Documents à lire et à synthétiser. -

Études de cas.

2

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

1. DEFINITION

L’informatique décisionnelle est un système qui met à disposition des utilisateurs une collection de données  orientées  sujet,  intégrées,  non  volatiles  et  historisées,  organisées  pour  le  support  d'un processus d'aide à la décision. [Bill IMMON in "Using the DataWarehouse"].

Ce  n’est  pas  une  application,  un  ou  une  boite  à  outils,  un  progiciel  tout  fait  il  est  spécifique  à l’entreprise.  Le  terme  Informatique  Décisionnelle  est  utilisé  dans  son  sens  générique  et  désigne indifféremment un datawarehouse, datamart, datamining, entrepôt de données, SIAD, infocentre ou EIS.

2. EVOLUTION DU CONCEPT

Avant les années 90, on travaillait avec les SIAD (Systèmes Interactifs d’Aide à la Décision),

dénomination qui à gardé une connotation technique et aux mains de spécialistes.

Au début des années 90, l’infocentre était une base de données laissée à la disposition plus ou moins

libre des utilisateurs. Souvent non structurée et non gérée, cette base est très vite devenue inutilisable ;

ce système qui a été conçu pour le top management, a été jugé trop rigide et difficilement adaptables

aux besoins changeant du management.

1993 - La technologie OLAP et ses variantes est apparu et 93 et s’est très vite développée, beaucoup

d’éditeurs ont proposé une gamme d’outils performants.

1997 : La généralisation des ERP, qui ne peut traiter les besoins décisionnel, à fait prendre conscient aux entreprise à la quantité importante de données inexploitées produite par l’ERP.

3. LES DIFFERENCES PAR RAPPORT A L’INFORMATIQUE OPERANTE

L’informatique  opérante  (ou  de  production)  est  caractérisée  par  le  traitement  transactionnel  dit OLTP (On‐Line Transactional Processing) et est définie plus précisément par les 12 règles énoncées par E. F. CODD dans les années 1980. L’informatique décisionnelle est caractérisée par l’analyse OLAP (On Line Analytical Processing) et est définie plus précisément par les 12 règles énoncées par W. H. IMMON en 1993.

3

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Les différences par rapport a l’informatique opérante

Exemple : ERP Opérante

Transactions - nombreuses - petites - maîtrisées

OLTP On -Line Transactional Processing

Pas d’historisation (temps implicite)

Pas d’agrégation

OLAP On -Line Analytical Processing

Décisionnelle

Analyse - Simulation

Requêtes - peu nombreuses - lourdes - non maîtrisées

Historisation (temps explicite)

Agrégation

Planche 26 - L’informat ique décisionnelle au service du management

Les problèmes classiques de l’informatique Lorsqu’on a voulu rapprocher les différentes données de l’entreprise, la principale difficulté qui est apparue est la non cohérence globale de ces données. Car chaque utilisateur à historiquement défini ses données pour ses propres besoins, qu'il a naturellement implémenté dans ses bases de données et ses applications.

Exemple :  le  Chiffre  d’Affaires  n’est  certainement  pas  défini  de  la  même  manière  par  la  Direction Commerciale  qui  souhaite  rapidement  en  avoir  une  estimation  ne  serait‐ce  que  pour  évaluer  par exemple  l’impact  d’une  campagne  publicitaire.  A  l’inverse  la  Direction  Financière  aura  le  souci  de précision et de respect des règles comptables et n’aura en conséquence pas la même définition ni les mêmes règles de calcul. La vision transversale exigée en décisionnel fait ressortir ces différents points de vue, d'où ce problème d'incohérence.

Les problèmes classiques de l’informatique

Hétérogénéité - des plateformes - de la définition des données - de la mise à jour

DG

DCM

DAF

DRH

Achats

Prod

AQ

DSI

SAV

Données CA Client Fournisseur ...

Plateformes Mainframe Base Appli

déf. 1 déf. 1

déf. 2 déf. 2 déf. 1

déf. 3

déf. 2

IBM DB2 X,Y

Oracle Z

Oracle U

T

Planche 27 - L’informat ique décisionnelle au service du management

déf. 4

Hétérogénéité (cid:215) Redondance (cid:215) Incohérence

4

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Une autre difficulté est apparu, elle relève de la différence de nature des informations demandées en décisionnel.  Par  exemple :  "un  client  signe  un  contrat",  le  modèle  de  données  opérationnel correspondant peut se représenter comme suit : Client ……

SIGNE ... Contrat.

Mais  ce  modèle  n'est  pas  assez  riche  pour  pouvoir  répondre  aux  besoins  décisionnels.  Pour permettre l'analyse et la simulation on voudra d'une part segmenter à un ou  plusieurs niveaux les notions  de  clients  et  de  contrats  d'ou  la  notion  importante  de  nomenclature  ou  sont  inverse l'agrégation et d'autre part observer l'évolution dans le temps des différentes données, d'où l'autre notion importante d'historisation. On distingue trois types d’historisation :

La datation d’événements ; La mémorisation de changements d’états (un client change d’adresse, de catégorie) ;

(cid:131) (cid:131) (cid:131) Une  évolution  des  changements  de  structure  (modification  du  référentiel,  notion  de

périmètre, une agence change de secteur, etc.).

Pour reprendre l'exemple précédent : à la place de "un client signe un contrat", en décisionnel l'on

préférera : "Pour un type de contrat, un segment de clientèle et une période il a été signé X Euros".

Une modélisation différente

Le décisionnel nécessite un autre type de modélisation

Opérante

Contrat

A été signé

Client

Décisionnelle

Type de contrat

A été signé

Segment clientèle

Période Montant

Planche 28 - L’informat ique décisionnelle au service du management

La  troisième  difficulté  est  apparue  lorsqu’on  a  voulu  des  analyses  et  des  simulations  utilisables  et partageables par tous.

La quatrième difficulté, qui est moins apparente, est le temps consacré à la confection de ces fichiers et

documents : extraction des données, élaboration des macros sur les tableurs, analyse, présentation, etc.

Pour  résoudre  ces  difficultés,  le  premier  réflexe  à  été  de  modifier  les  applications  opérationnelles. Mais  cette  opération  dégrade  les  performances  et,  pour  répondre  a  de  nouveaux  besoins  de pilotage, la répétition de ce type d'opération, perturbe les utilisateurs. Enfin, en introduisant dans les bases  de  nouvelles  données,  non  volatiles,  non  rafraîchies  issues  de  l'historisation,  les  besoins

Publicité

5

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

décisionnels greffés dans les applications opérationnelles, augmentent la volumétrie des bases ce qui contribue également à dégrader les performances.

L’apparition  du  concept  de  Datawarehouse  (entrepôt  de  données)  et  de  la  technologie  OLAP  a  en partie résolu les difficultés citées précédemment.

4. LES TYPES D’OUTILS

Les types d’outils

Présentation (clients)

Requêteur - TBB Datamining - Textmining Arbre de décision

Administration

Référentiel des méta-données Fédérer les référentiels opérationnels Maintenance, sécurité

Rela- tionnelle

et/ou

Multi- dimen.

Bases

ROLAP - MOLAP - HOLAP DOLAP - VOLAP Une combinaison d’1 ou +

Extraction Transformation Loading

Extraire de toute plateforme Nettoyer, calculer, formater Charger dans toute base

Planche 29 - L’informat ique décisionnelle au service du management

On distingue 4 types d'outils :

(cid:131)

(cid:131)

Les  ETL  (Extraction  ‐  Transformation  ‐  Loading)  outils  d'alimentation  des  bases  de  données qui extraient, normalisent et transforment les données qui seront stockées. Les outils base de données qui stockent les données (brutes, agrégées ou historisées) selon des  axes  d'analyse  définis  afin  de  répondre  le  plus  efficacement  aux  requêtes  utilisateurs sans perturber les systèmes opérationnels. Deux types de bases sont employés, les bases de données relationnelles et les bases de données multidimensionnelles. Les  outils  d'aide  à  la  décision  qui  permettent  l'extraction  et  la  présentation  aisée  des informations  par  les  utilisateurs.  Les  outils  "DataMining"  permettent  une  exploration  en ligne des bases afin d'en extraire une information exploitable par les décideurs. Les  outils  d'administration  permettant  de  gérer caractéristiques des données (référentiel), modéliser les données (conception), etc. Outres les outils dédiés au décisionnel, des évolutions sont également à prévoir dans le domaine des

les  droits  d'accès  (sécurité),

les

(cid:131)

(cid:131)

applications progiciels packagées. En effet, des modules adaptés aux problématiques décisionnelles

apparaissent dans les offres progicielles. Des éditeurs comme Comshare, Hyperion, ou SAS sont

positionnés sur ce créneau, suivis désormais par les principaux acteurs du monde des progiciels

6

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

intégrés, comme SAP, Oracle ou Baan. Même si l'idée du progiciel décisionnel "clé en main" apparaît

illusoire, ceux-ci devraient permettre progressivement aux entreprises de se concentrer sur la

construction des parties les plus stratégiques de leur système décisionnel, en s'appuyant sur des

progiciels pour tous les autres domaines.

L’attitude des éditeurs d’ERP ERP = Enterprise Resources Planning (Progiciel de Gestion Intégré)

SIS de SAP R/3

FIS

Compta, Finance s

SAP R/3

HIS

Ressources h umaine s

LIS

Lo gistique (ach ats, vente s, ...)

L’approche progiciel consiste souvent à tirer le datawarehouse vers sa propre base de données « propriétaire »

BW de SAP R/3

BW

Compta , Fi nances

SAP R/3

BW

Ressou rce s humaines

240 cubes BW !

BW

Log istique (achats, ve ntes, ...)

Planche 30 - L’informat ique décisionnelle au service du management

Les outils d’alimentation

Parallèlement à l'apparition des offres progicielles, émergent des solutions facilitant l'extraction de

données issues d'un progiciel. L'éditeur ETI, par exemple, propose des interfaces d'extraction des

données à partir de progiciels tels que SAP. Dans la même logique, apparaissent des logiciels

permettant d'exploiter facilement des données externes. Comshare propose des agents capables

d'extraire et de mettre en valeur des informations issues de Reuter ou du Dow Jones. Microstrategy, de

son côté, a signé un accord avec Source Informatics, fournisseur de données dans le secteur

pharmaceutique, pour faciliter l'intégration de ces données à celles d'une base de données

décisionnelle. Ainsi, acquérir des données, quelle que soit leur origine, devrait devenir avec le temps

une tâche de plus en plus simple sur un plan technique, permettant de se focaliser au maximum sur les

aspects fonctionnels.

7

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Principaux outils ETL (Extraction Transformation Loading)

Editeur

Outil

Ardent Software

DataStage

CA‐Ingres

Infopump

OpenIngres replicator

Carleton

Passport

ETI

Hummingbird

Extract

Génio

IBM

Data propagator relational

Information Builder

Copy manager

Informatica

PowerMart

Informix

Oracle

Praxis

Prism

PowerCenter

Comprehensive replication

Datamart Builder

Oracle V7 option replication

Omni replicator

Warehouse Manager

Sagent Technology

Sagent Datamart

Software AG

SourcePoint

Sybase

Vality

Replication server

Integrity Data Reengineering

8

Publicité

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

5. DE L’ETL A L’EAI (Entreprise Application Interface)

Par ailleurs les EAI, outils d’interfaçage entre applications, ont des fonctionnalités proche des ETL et certains  outils  proposent  les  deux  fonctions :  ETL  et  EAI.  Exemples les  outils  français :  Synopsis, Net.EAI (Mediapps) Dataexchanger (CrossDataBase Technology).

5.1. Les Outils de stockage

Les bases relationnelles

Rela- tionnelle

Peu chère, technique mature et ouverte mais : • Nécessité d’indexer • Parfois dé-normaliser (accepter les redondances) • Malgré tous des performances parfois ...

la-men-ta-bles

Planche 31 - L’informat ique décisionnelle au service du management

Le Relationnel inadapté

Les  bases  de  données  relationnelles  et  leurs  outils,  établis  pour  des  systèmes  OLTP,  ont  dans  un premier temps été jugés inadaptés aux besoins de l'OLAP et cela pour les raisons suivantes

Gestion inefficace des relations à n entités.

Le modèle relationnel est basé sur un modèle physique à 2 dimensions (les tables). Lorsqu'on veut traiter des données multidimensionnelles, cela se traduit par un nombre de tables important qu'il faut relier avec des jointures. On arrive alors rapidement à des requêtes complexes (qui dit complexe, dit beaucoup de chances de se tromper) avec des performances catastrophiques. Pour essayer de résoudre ce problème, le premier réflexe a été de dénormaliser (introduire des redondances) afin de réduction le nombre de jointure et faciliter le calcul des agrégats nécessaires. Mais la dénormalisation (qui demande souvent des traitements complexes pour garantir la cohérence des données redondantes) conduit à des grosses tables (avec beaucoup de lignes et beaucoup de colonnes) qui occupent beaucoup (trop) d'espace disque et de mémoire (espace occupée par la redondance des données, par les index supplémentaires, par les

9

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

colonnes vides qui ne seront renseignées que dans certains cas). Ce qui conduit aussi à des performances dégradées ! Fonctions d'analyse insuffisantes.

Avec le SQL et même si vous êtes très fort, vous aurez du mal à :

‐ Sommer ou effectuer la moyenne de certains champs pour certaines lignes et pas pour d'autres dans la même requête;

‐ Créer des expressions faisant référence à une ensemble de lignes d'une même table (ex: pour chaque magasin, différence du chiffre d'affaires par rapport à la moyenne de la région);

‐ Sommer ou détailler selon les lignes sélectionnées dans la même requête.

5.2.  Les  outils  frontaux  (Query,  Infocentre...)  ont  tendance  pour  combler  cette  lacune  à faire des calculs sur le poste client.

Ce  qui  évidemment  peut  avoir  des  conséquences  désastreuses  pour  le  réseau  (qui  voit plusieurs méga‐octets lui passer dessus), pour le PC (qui finit très souvent par jeter l'éponge), pour l'utilisateur (qui à force de patienter finit par rejoindre une secte Zen), pour le directeur informatique (qui  lorsqu'il  a  dépensé  tout  son  budget  dans  des  méga‐parallélo‐processeurs  massivement  extra‐ chères finit par se faire licencier). Face à ce constat (qui n'est pas exhaustif), des éditeurs ont créé les bases multidimensionnelles pour se libérer du relationnel.

6. LES BASES DE DONNEES MULTIDIMENSIONNELLES

6.1. Définition

Une base de données multidimensionnelle peut être visualisée comme une ensemble de cubes

de données, contenant eux même d'autres cubes; chaque face du cube représentant une dimension.

Chaque dimension représente une catégorie de données, comme un type de produit, un lieu, le temps,

etc. Les dimensions peuvent être hiérarchisées (Région, département, ville...). On parle alors d'attributs

(ou « membres ») hiérarchisés de la dimension. Chaque cellule de la structure multidimensionnelle

représente la consolidation d'une donnée numérique (montant des ventes, quantité de produits vendus,

marge moyenne...) pour l'intersection entre chaque attribut de chaque dimension. Cette consolidation

peut être simple (somme, moyenne) ou complexe (fonctions statistiques, financières...). Les données

consolidées sont appelées 'mesures'.

10

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

6.2. Structure physique des bases multidimensionnelles

Les données dans une base multidimensionnelle sont dynamiquement structurées et

compressées de façon à optimiser l'utilisation de place disque. Par exemple, les données 'denses' (qui

existent pour un grand nombre de dimensions) sont stockées séparément des données 'dispersées' (qui

ont un grand nombre de cellules vides). Cette optimisation de l'espace permet de gérer de grandes

quantités de données et de travailler le plus souvent avec des index gardés en mémoire. La constitution

de la base de données se fait selon le processus suivant :

(cid:131) Extraction  des  données  provenant  de  SGBD  (hiérarchiques,  réseau  ou  relationnels)  ou  de

fichiers;

(cid:131) Décomposition des données en dimensions, attributs et mesures, (cid:131) Calculs des consolidations, (cid:131) Chargement de l'hyper‐cube selon la structure dimensionnelle fixée.

Le format d'une base de données dimensionnelle est « propriétaire » (propre à chaque éditeur). Il

n'existe aucun standard, ni « théorique », ni de fait.

Les bases multidimensionnelles

Multi-

dimen. = MOLAP

Performantes mais : • Structure figée • Accès détail difficile • Sélection complexes difficile • Tout est propriétaire

Planche 32 - L’informat ique décisionnelle au service du management

6.3. L’Hypercube une structure figée

Un hyper-cube est une structure figée qui doit le plus souvent être entièrement reconstruite à

chaque modification, même minime, de la structure dimensionnelle. Il n'est pas possible de relier des

hyper-cubes entre eux. Il s'agit donc de structures non seulement figées mais également fermées.

11

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Accès au niveau de détail difficile

Il n'est généralement pas possible d'accéder au niveau de détail le plus fin (opérationnel) ce qui peut

être parfois nécessaire dans un processus d'analyse (recherche de valeurs d'exceptions...). Il faut alors

passer sur un outil SQL pour aller chercher cette information.

Sélections complexes difficiles à réaliser

Il n'est pas possible de réaliser des sélections complexes sur un hyper-cube (on est, dans ce domaine,

loin de la richesse sémantique du SQL).

Tout est propriétaire !

Rien n'est standard : ni la structure physique, ni l'interface d'interrogation. C'est cher ! Le manque de

souplesse et l'absence de gestion des métadonnées sont les deux principaux freins à l'utilisation des

bases multidimensionnelles traditionnelles. En effet, ces deux caractéristiques sont incompatibles avec

une informatique décisionnelle à l'échelle d'une entreprise. Dans le cadre d'un Datawarehouse, il

semble difficile de concilier l'existence et la gestion dynamique d'un référentiel avec la création de

gros hypercubes relativement figés.

6.4. L’Hypercube relationnel ou le compromis

Leur principe est de stocker les données dans une base relationnelle, mais avec une structure

adaptée aux données multidimensionnelles. Des annonces sont faites en ce moment par Sybase et

Oracle. Ces deux éditeurs fourniront également des outils pour manipuler ces structures

multidimensionnelles, avec une interface proche de celle des bases multidimensionnelles. Bien

entendu, tout cela sera de format propriétaire, et l'on risque de tomber dans les même travers qu'avec

les bases multidimensionnelles. L'avantage résidera dans la possibilité d'utiliser les outils de

conception propres au relationnel.

L'OLAP Relationnel

12

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

Des outils comme DSS/SERVER de MicroStrategy ou AXSYS d'Information Advantage ont pour

principe de proposer un outil client aussi riche que ceux des bases multidimensionnelles, un moteur

OLAP capable de générer dynamiquement des requêtes SQL à partir d'une interrogation

multidimensionnelle et de la connaissance des méta-data.

Il s'agit d'un système complexe, mis en œuvre dans des projets d'envergure. L'accès rapide aux

données ne peut être assuré qu'en utilisant les plus récentes techniques d'optimisation des requêtes

relationnelles (partitionnement des bases; parallélisation des traitements...). Les coûts sont alors à

l'échelle de l'ambition des projets, tant au niveau logiciel (middleware, OLAP Engine) que matériel

(machines multiprocesseurs ...).

7. LES OUTILS DE RESTITUTION

7.1. Les outils clients (analyse et présentation)

Les outils d'interrogations ont aujourd'hui les caractéristiques suivantes :

Interface toujours graphique

(cid:131) (cid:131) Navigation : « drill down » et le « slice and dice » implémentés (cid:131) Gestion des alertes et seuils se fait par codage couleurs (cid:131) Temps de réponses sont très courts (le plus souvent immédiat) et constants Il n'existe aucun standard d'interrogation, le SQL n'est pas implémenté. Des défauts bien

embarrassants. Les bases de données multidimensionnelles sont rapides et faciles à utiliser mais on

leur fait quelques reproches : outils d'administration insuffisants et beaucoup moins riches que ceux

des bases relationnelles.

7.2. Le Datamining

C’est l’exploration des données par les techniques statistiques (régression, analyse en composantes

principales …). Les utilisations sont diverses comme :

Publicité

(cid:131) (cid:131)

Le micro‐marketing : augmenter le taux de réponse d’un mailing L’analyse de risque : banques et assurances

13

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

La grande distribution : corrélation des achats

(cid:131) 7.3. Le Textmining

Une variante du datamining pour analyser des questionnaires en texte libre. Utilisé pour extraire

du « qualitatif » d’un texte brut. Par exemple : déterminer l’état de satisfaction ou l’opinion d’un client

ou d’un usager répondant à un questionnaire.

La méthode se déroule en plusieurs étapes :

lemmatisation (retrouver la racine des termes) ; lexicométrie (compter les termes « intéressants ») ;

(cid:131) (cid:131) (cid:131) numérisation et associations.

Exemple d’outil de textmining : Text Navigator d’IBM, StatLab de SLP Software

7.4. Les arbres de décisions

Exemple : à chaque nœud de l’arbre, l'outil propose lui‐même la variable la plus discriminante

selon l'objectif à atteindre.

100 % de la population

âge

80 % de la population

20 % de la population

CSP

80 % des 20%

20 % des 20%

Exemple d’outil : Scénario de Cognos ‐ Business Miner de B.O. ‐ Alice d ’Isoft

8. LES OUTILS D’ADMINISTRATION

8.1. Le référentiel des données

Théoriquement, on peut imaginer faire l'administration des données de manière manuelle : en  allant  regarder  où  se  trouve  les  données,  en  comparant  les  structures,  en  les  modifiant,  en  les mettant  à  jour,  etc.  Pratiquement,  cela  devient  vite  difficilement  gérable  et  un  outil  s'avère rapidement nécessaire.

14

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

La  problématique  doit  être  considérée  sous  deux  angles  :  l'aspect  organisationnel  et  l'aspect technique.  L'erreur  classique  consiste  à  choisir  un  outil  avant  que  les  procédures  soient  définies. Acheter  une  solution  clé  en  main  est  très  risqué  :  en  effet,  les  fonctionnalités  de  l'outil  vont  alors conditionner  l'organisation  du  projet.  Or  l'administration  de  données  n'est  pas  un  problème technique, c'est un problème fonctionnel voir même de stratégie d'entreprise.

L'outil doit jouer le rôle de fédérateur des référentiels opérationnels. Il doit savoir communiquer avec l'ensemble  des  dictionnaires  et  permettre  de  gérer  les  caractéristiques  autours  des  données décisionnelles  (informations  de  contrôle  et  de  service  nécessaires  pour  assurer  la  cohérence  et  la maintenance, etc.).

Une initiative coordonnées par le Meta Group a abouti à la création en 1995 de la Metadata Coalition (à  l'origine  :  Arbor  Software,  BO,  Cognos,  ETI  et  Texas  Instrument  ‐  maintenant  il  y  a  plus  de  30 membres). Ce groupement de professionnels vise à standardiser les échanges de métadonnées entre les  différents  outils.  Les  premiers  travaux  ont  conduit  à  la  spécification  d'une  norme  décrivant  un protocole  d'échange  de  métadonnées  :  Meta  Data  Interchange  Specification  (MDIS).  Grâce  à  ces travaux,  les  outils  permettent  progressivement  de  gagner  en  productivité  pour  des  tâches  que  les équipes informatiques ne pouvaient mettre en place jusqu'à présent que de manière personnalisée. Cette  évolution  est  particulièrement  nette  dans  le  domaine  de  l'administration,  qu'il  s'agisse d'administration fonctionnelle ou technique.

lors  de

l'apparition  d'une  nouvelle  technologie,

les  besoins  en  terme Comme  souvent d'administration  sont  sous‐estimés  voire  ignorés.  Ils  apparaissent  a  posteriori  quand,  face  à  un système qu'elle a du mal à maîtriser, l'équipe concernée découvre les coûts induits par l'insuffisante industrialisation  de  l'administration  et  de  l'exploitation.  Aujourd'hui,  certaines  entreprises  ont dépassé ce stade et la demande  pour  ce type de solution explose. Pour cette raison, le marché  de l'administration est, dans un contexte d'Informatique Décisionnelle, actuellement le plus petit mais aussi  celui  dont  la  croissance  estimée  est  la  plus  forte  (Selon  le  Gartner  Group,  le  marché  de l'administration aura une croissance annuelle de 114 % d'ici 1999). En réponse à cette demande, un certain nombre d'éditeurs, parmi lesquels Bull, Hewlett Packard, IBM, Informix, Oracle, Platinum, SAS ou encore Software AG, sont positionnés sur ce marché. Leurs solutions adressent des problèmes tels que la gestion des métadonnées, la sécurité, l'automatisation complète de la phase d'alimentation et la gestion des optimisations. Les opportunités d'amélioration sont nombreuses. Il est donc probable que des offres issues de petites sociétés innovantes apparaissent sur ce créneau.

15

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

9. ARCHITECTURE  TYPE D’UN SYSTEME DECISIONNEL

Des données opérationnelles à l'information décisionnelle on distingue 4 étapes : la collecte des

données, l'intégration, la diffusion et la présentation de l'information.

La collecte : c'est la capture et l'extraction sélective des données opérationnelles sources, ce n'est pas

une réplication car il y a « nettoyage » et transformation des données afin de réduire les incohérences.

La fonction collecte doit être non destructive et non perturbatrice vis à vis des applications

opérationnelles.

L'intégration  :  c'est  la  concentration,  l'homogénéisation  technique  et  l'unification  sémantique  des données.

La diffusion : c'est la répartition par domaine ou métier, l'adaptation des structures aux requêtes aux communications et au contrôle d'accès.

La  présentation  :  ce  sont  les  masques  de  restitution,  la  gestion  des  dialogues,  la  personnalisation. C'est malheureusement ce que les concepteurs voient en premier, mais la qualité de la présentation ‐ la décoration ‐ ne compensera jamais la mauvaise qualité de la structure des données. Ce processus, complété  par  une  fonction  d'administration,  induisent  la  structure  de  base  de  l'informatique décisionnelle présentée par la figure suivante :

Architecture type d’un système décisionnel

Présentation (clients)

Référentiel

Administration

ODS

Rela- tionnelle

Multi- dimen.

Bases

Extraction Transformation Loading

- Requêtes - Tableau de Bord - Analyse - Simulation

Décisions Décisions

autre

Informatique opérante (les processus métier)

Bases SAP, Oracle +

Planche 34 - L’informat ique décisionnelle au service du management

C'est à partir des besoins et de cette structure de base que s'établit l'architecture définitive.

16

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

La  base  de  collecte  et  d'intégration :  l'ODS  (Operational  Data  Store)  est  de  type  base  de  données relationnelle. Ce sas de transit a pour vocation d'historiser les données élémentaires dans un format assez proche du système source avec un minimum de transformations et d'agrégations, pour :

(cid:131) minimiser  les  perturbations  du  système  de  production  opérationnel  (performances  et

exploitation) favoriser la justification a posteriori des résultats agrégés

(cid:131) (cid:131) et préserver des possibilités de re‐engineering.

L'ODS  permet  de  reconstruire  tout  ou  partie  du  datawarehouse  final,  par  exemple  en  cas  de modification du référentiel (restructuration du réseau commercial, des filières produits, ...)

Il peut y avoir une ou deux bases pour la diffusion et la présentation, celles‐ci sont soit centralisées dans  un  serveur  soit  décentralisées  sur  les  postes  clients.  Les  bases  sont  de  type  relationnelle  ou multidimensionnelle,  le  cas  le  plus  souple  consiste  disposer  d'une  base  relationnelle  et  d'une  base multidimensionnelle (architecture hybride ‐ HOLAP), la technologie OLAP d'analyse des données est la  plus  employée  (On‐Line  Analytical  Processing  =  système  d'analyse  des  données  en  ligne  ‐ précisions techniques en annexe).

Les bénéfices de la mise en place d’un datawarehouse Le principal bénéfice de la mise en place d’un datawarehouse est une meilleure exploitation des

informations détenues au sein de l’entreprise. Rassembler les données dans un entrepôt de données

permet d’étudier en profondeur l’évolution des différents départements ou produits de l'entreprise

permettant ainsi aux managers de prendre des décisions fondées sur une vue d’ensemble du système

plutôt que sur des estimations liées à des données incomplètes.

L’argument financier plaide aussi en faveur de la mise en place d’un datawarehouse. En effet, le coût de  maintenance  de  nombreux  systèmes  de  prise  de  décision  individuels  peut  être  extrêmement élevé en comparaison de la mise en place d’une application plus centralisée de datawarehouse, plus abordable en termes de supports et de maintenance.

10. COMMENT CONSTRUIRE UN SYSTEME DECISIONNEL ?

Le coût d'implémentation d'un entrepôt de données, véritablement transversal et fédérateur de

l'ensemble des systèmes d'une entreprise, dépasse la plupart du temps tout réalisme en termes de

budget. Il est donc souvent nécessaire de construire un plan d'urbanisation d'ensemble, une cible qui

donne un fil directeur pour assurer une possibilité de convergence à terme, tout en développant

17

Enseignant : Belhassen Guettat

Université Virtuelle de Tunis

Systèmes d'Information Pour L’Entreprise                                                                                     Informatique décisionnelle et  Entrepôts de données

l'entrepôt de données progressivement et « par appartement ». II s'agit ici de respecter une maxime de

bon sens :

La seule règle d'or du datawarehouse s'applique aussi bien :

PENSER GRAND MAIS COMMENCER PETIT

(cid:131) au matériel : puissance et coûts évoluent rapidement et mieux vaut miser sur les possibilités

d'extension du matériel (scalability) capable d'évoluer au rythme de la croissance de l'entrepôt de données

(cid:131) au logiciel : avec une "large" modélisation des données pour préserver l'avenir et une réalisation par étapes pour délivrer des résultats tangibles à court ou moyen terme (cid:131) et au projet lui‐même : un projet pilote, un datamart, sont autant d'assurances de mieux jauger l'ampleur du projet global (mieux estimer les enveloppes budgétaires, les résultats attendus, les difficultés liées à la transversalité, les délais, les impacts sur l'organisation et les utilisateurs, etc ...)

La démarche standard se présente sous forme d'un processus itératif à cycles très courts avec un rôle proactif de la maîtrise d'ouvrage : chaque itération enrichit la solution tout en respectant plus ou moins six étapes principales.

Comment construire un système décisionnel ?

Cycle Itératif Incrémental

Reproduire ce que fait l’utilisateur (Excel, …)

Voir GRAND Commencer PETIT

Plus on passe de temps sur le modèle meilleur sera le résultat

Plus on passe de temps sur la qualité des données meilleur sera le résultat

-6- Validation

-5- Modélisation

4- Analyse des sources

-1- Inventaire des requêtes

-2-Élabora