Introduction à Datamining

Activité 1.2 : Quiz - Introduction au Datamining Question 1 - Nature prédictive et descriptive du datamining Réponse : Vrai Explication : Le datamining se divise en effet en deux grandes familles d'apprentissage.

D'après le document Introduction à Datamining

Cet article a été rédigé automatiquement à partir du document source, puis vérifié avant publication.

Introduction à Datamining

Document source

Introduction à Datamining

Datamining, Analyse des données, Technologie · PDF · 3 pages · 1990

Afficher l'aperçu du document

Consulter le document original →

Activité 1.2 : Quiz - Introduction au Datamining

Question 1 - Nature prédictive et descriptive du datamining

Réponse : Vrai

Explication : Le datamining se divise en effet en deux grandes familles d'apprentissage. L'analyse descriptive (ou apprentissage non supervisé) vise à résumer, explorer et trouver des structures cachées dans les données (comme regrouper des clients selon leurs comportements d'achat). L'analyse prédictive (ou apprentissage supervisé) utilise les données historiques pour construire des modèles capables de prévoir une valeur ou un comportement futur (par exemple, anticiper la résiliation d'un abonnement).

Question 2 - Raison principale du recours au datamining

Réponse : Découvrir des tendances cachées dans les bases de données

Explication : La définition même de l'extraction de connaissances à partir de données (KDD - Knowledge Discovery in Databases) repose sur la découverte de modèles (patterns), de corrélations et de tendances inédites et non triviales au sein de vastes ensembles de données. Bien que cela réduise l'inutilité des données dormantes et introduise des statistiques dans les décisions, l'objectif fondamental et principal est la découverte de ces tendances cachées.

Question 3 - Intérêts du datamining pour l'entreprise

Réponses correctes :

  • L'exploitation des données pour améliorer la rentabilité d'une activité
  • L'avantage d'une longueur d'avance sur ses concurrents
  • L'augmentation du retour sur investissement des systèmes d'informations

Explication : Ces trois propositions sont valides. Le datamining est un outil stratégique. Il permet d'exploiter les données recueillies (souvent à grands frais) pour cibler les actions marketing, réduire les coûts, et ainsi améliorer la rentabilité. Cette meilleure compréhension du marché donne un avantage concurrentiel direct, ce qui augmente mécaniquement le retour sur investissement (ROI) des infrastructures informatiques et de stockage qui, sans cette analyse, ne seraient que des centres de coûts (conservation des données).

Question 4 - Techniques utilisées par le datamining

Réponses correctes :

  • Statistiques
  • Arbres de décisions
  • Réseaux de neurones
  • Recherches d'associations

Explication : Le datamining est un domaine multidisciplinaire à la croisée de plusieurs sciences. Il utilise toutes ces techniques. Les statistiques fournissent les bases mathématiques, les arbres de décisions et les réseaux de neurones (issus de l'intelligence artificielle) servent à la classification et à la prédiction, et la recherche d'associations (comme l'algorithme Apriori) est typique du datamining pour l'analyse des paniers d'achat.

Question 5 - Respect de la vie privée

Réponse : Vrai

Explication : C'est un enjeu éthique et juridique majeur. En croisant des bases de données de natures différentes, le datamining peut déduire des informations personnelles sensibles (santé, opinions, habitudes de vie) à partir de données apparemment anonymes, ce qui pose de réels risques pour la vie privée (d'où l'importance de réglementations comme le RGPD).

Question 6 - Les premières phases d'application du datamining

Réponses correctes :

  • Segmentation/Typologie
  • Scoring

Explication : Bien que la question s'éloigne du cycle de vie théorique des données (comme la méthode CRISP-DM), dans la pratique métier (notamment en marketing), les deux applications fondamentales et initiales sont descriptives puis prédictives. On commence souvent par la Segmentation/Typologie (comprendre de quoi est composée la base de clients) pour ensuite appliquer du Scoring (donner une note de probabilité à un client pour un comportement donné, comme l'achat ou l'attrition).

Question 7 - Applications spécifiques à l'industrie

Réponses correctes :

  • La segmentation de données
  • La classification de données

Explication : Dans le domaine industriel (comme dans les autres secteurs), la segmentation (ex: regrouper des machines selon leurs profils de panne) et la classification (ex: identifier si une pièce fabriquée est défectueuse ou non selon ses caractéristiques) sont des applications directes du datamining. La résolution du stockage relève de l'ingénierie des bases de données (Data Warehousing), et l'hétérogénéisation n'est pas une application, mais plutôt une caractéristique ou un problème des données complexes.

Question 8 - Les opportunités du datamining

Réponse : La mise en évidence de l’influence de certaines variables sur d’autres

Explication : Le cœur de l'opportunité réside dans l'identification des corrélations (par exemple, comprendre que la météo influence fortement les ventes d'un produit spécifique). La "fouille sans l'aide de la main de l'homme" est un mythe (l'expert métier est indispensable pour paramétrer et valider) et l'interprétation relève du travail de l'analyste, non du datamining lui-même.

Question 9 - L'explosion des gisements de données

Réponse : Une chance pour prédire l’avenir

Explication : Le phénomène du Big Data (explosion des données) est le carburant du datamining. Plus les algorithmes (surtout prédictifs et d'apprentissage automatique) disposent de données d'entraînement, plus leurs modèles deviennent précis, stables et capables de généraliser pour prédire les comportements futurs.

Question 10 - Les principaux défis à relever

Réponses correctes :

  • Améliorer l’intelligence de l’exploration de données
  • Augmenter la vitesse de l’extraction de connaissances

Explication : Les défis actuels concernent la qualité et la pertinence des algorithmes face à des données complexes (améliorer l'intelligence) ainsi que la capacité à traiter ces données en temps réel ou quasi-réel (augmenter la vitesse d'extraction des connaissances). La compilation de données relève davantage des processus ETL (Extract, Transform, Load) en amont.

Question 11 - Les limites techniques du datamining

Réponse : La pertinence du résultat donnée par les logiciels d’exploration n’est pas certaine

Explication : C'est la limite fondamentale, souvent résumée par l'adage "Garbage in, Garbage out" (Déchets en entrée, déchets en sortie). Les algorithmes trouveront toujours des relations mathématiques, mais ces relations peuvent être de fausses corrélations dénuées de sens métier. La pertinence n'est jamais garantie et nécessite toujours l'interprétation humaine. Les autres affirmations sont fausses : le text mining traite les données non chiffrées, et les outils mesurent très bien l'importance des variables.

Question 12 - L'année de développement par spécialisation

Réponse : 1990

Explication : Bien que les concepts statistiques datent de bien avant, le terme "Datamining" et l'émergence des premiers logiciels spécialisés et des conférences dédiées (comme KDD - Knowledge Discovery and Data Mining) ont vu le jour à l'aube des années 1990.

Question 13 - Caractéristiques des données de la fouille du web

Réponses correctes :

  • Elles arrivent très rapidement
  • Elles proviennent des journaux des serveurs

Explication : La fouille du web (Web Mining) traite généralement des logs de serveurs (qui a cliqué sur quoi, à quelle heure) et des flux de données continus (clics, réseaux sociaux, flux d'actualités) qui arrivent à très grande vitesse (vélocité). Ces données sont en constante évolution, ce qui rend la première option (paramètres qui ne se modifient jamais) fausse.

Question 14 - Exploration des données cartographiques du crime

Réponse : La fouille de données spatiales

Explication : Les données cartographiques sont par définition des données spatiales (coordonnées géographiques, adresses, zones). L'analyse de ces données pour identifier des zones de forte criminalité (hotspots) relève du "Spatial Data Mining" (fouille de données spatiales).

Question 15 - Les facteurs de succès du datamining

Réponses correctes :

  • La mise en forme des données
  • La connaissance de l'environnement
  • Le niveau de formation des statisticiens
  • La prise de recul sur l'action engagée

Explication : Dans un projet de datamining, toutes ces étapes sont cruciales :

  1. La mise en forme des données (nettoyage, préparation) prend souvent 80% du temps du projet.
  2. La connaissance du métier (environnement) est vitale pour poser les bonnes questions.
  3. La formation des experts garantit l'utilisation correcte des algorithmes.
  4. La prise de recul (interprétation métier) permet de transformer une formule mathématique en une décision d'entreprise pertinente.

Méthode

Face à un questionnaire à choix multiples (QCM) théorique sur les fondements d'une discipline technique comme le datamining, voici la stratégie à adopter :

  1. Identifier les choix multiples absolus vs. relatifs : Dans les quiz d'introduction, certaines questions attendent toutes les réponses qui apportent une valeur ajoutée (comme pour les questions sur les facteurs de succès ou les techniques). Ne vous limitez pas à une seule réponse si plusieurs complètent le tableau conceptuel du cours.
  2. Distinguer le processus amont/aval de l'analyse : Beaucoup de pièges dans ce type d'examen consistent à mélanger la préparation des données (Data Warehousing, ETL, stockage) avec l'analyse elle-même (Classification, Arbres de décision, Scoring). Restez concentré sur la phase "extraction de connaissances".
  3. Le rôle de l'expert métier : Une règle d'or en datamining est que l'outil ne remplace pas l'humain pour donner du sens (causalité vs corrélation). Toute option suggérant que le logiciel travaille de manière totalement autonome et parfaite (sans erreur, sans humain) est systématiquement fausse (cf. Questions 8 et 11).
  4. Vocabulaire spécifique : Apprenez à associer les mots-clés du domaine. Prédiction = Supervisé (Scoring, Classification). Description = Non-supervisé (Segmentation, Typologie, Associations). Web = vélocité et logs. Espace = Cartographie.

Partager

Commentaires

Aucun commentaire pour le moment. Posez la première question.

Les commentaires sont relus avant publication. Votre e-mail n'est jamais affiché.

← Toutes les révisions