TP7
Table des matières
• Reading CSV Files
• Reading Excel Files
• Accessing Rows and Columns from dataset
• Accessing Built-in Datasets in R
Estimation du temps nécessaire : 15 min
Import de données
Apprenons à importer et à lire les données de deux types de fichiers courants utilisés pour stocker des données tabulaires
(lorsque les données sont stockées dans un tableau ou une feuille de calcul).
• Fichiers CSV (.csv)
• Fichiers Excel (.xls ou .xlsx)
Pour commencer, nous devons télécharger les données si elle s sont situées sur un serveur disant.
Télécharger les données
Pour télécharger des données en ligne il suffit d'utiliser la fonction download.file() qui nécessite deux arguments :
l'URL complète du fichier disant ett le nom du fichier qui sera stocké localement
Download datasets
CSV file
download.file("https://url/distant_file_name.csv",
destfile="local_file_name.csv")
XLS file
download.file("https://url/distant_file_name.xls",
destfile="local_file_name.xls")
Lecture des fichiers CSV
Que sont les fichiers CSV ?
Publicité
CSV (Comma Separated Values) est l'un des formats de données structurées les plus courants que vous trouverez. Ces fichiers
contiennent des données dans un format de tableau, où dans chaque ligne, les colonnes sont séparées par un délimiteur --
traditionnellement, une virgule (d'où les valeurs séparées par des virgules).
Habituellement, la première ligne d'un fichier CSV contient les noms des colonnes de la table elle-même. Les fichiers CSV
sont populaires parce que vous n'avez pas besoin d'un programme particulier pour les ouvrir.
Lecture des fichiers CSV dans R
Dans le fichier movies-db.csv, la première ligne de texte est l'en-tête (noms de chacune des colonnes), suivie de lignes
d'informations sur le film. Pour lire les fichiers CSV dans R, nous utilisons la fonction de base read.csv. Tout ce dont vous
avez besoin est le chemin d'accès au fichier CSV. Essayons de charger le fichier en utilisant le chemin d'accès au fichier
movies-db.csv que nous avons téléchargé précédemment :
Load the CSV table into the my_data variable.
my_data <- read.csv("movies-db.csv")
my_data
Les données ont été chargées dans la variable my_data. Mais au lieu de visualiser toutes les données en même temps, nous
pouvons utiliser la fonction head pour ne regarder que les six premières lignes de notre tableau, comme cela :
Print out the first six rows of my_data
head(my_data)
Vous pouvez également jeter un coup d'œil à la structure de votre table nouvellement créé. R nous fournit une fonction qui
résume les propriétés d'une table entière, appelée str. Essayons-la.
Prints out the structure of your table.
str(my_data)
Lecture des fichiers Excel
La lecture des fichiers XLS (tableur Excel) est similaire à la lecture des fichiers CSV, mais il y a un hic : R n'a pas de fonction
native pour les lire. Cependant, heureusement, R dispose d'un très grand répertoire de fonctions créées par les utilisateurs,
appelé CRAN. De là, nous pouvons télécharger un paquet de bibliothèque pour nous rendre capables de lire des fichiers XLS.
Publicité
Pour télécharger un paquet, nous utilisons la fonction install.packages. Une fois installée, vous n'avez plus besoin
d'installer cette même bibliothèque, à moins, bien sûr, que vous ne la désinstallez.
Download and install the "readxl" library
install.packages("readxl")
Chaque fois que vous allez utiliser une bibliothèque qui n'est pas native de R, vous devez la charger dans l'environnement R
après l'avoir installée. En d'autres termes, vous ne devez l'installer qu'une seule fois, mais pour l'utiliser, vous devez la charger
dans R pour chaque nouvelle session. Pour ce faire, utilisez la fonction library, qui charge dans R tout ce que nous pouvons
utiliser dans cette bibliothèque.
Load the "readxl" library into the R environment.
library(readxl)
Maintenant que notre bibliothèque et ses fonctions sont prêtes, nous pouvons passer à la lecture du fichier. Dans readxl, il y
a une fonction appelée read_excel, qui fait tout le travail pour nous. Vous pouvez l'utiliser de cette manière :
Read data from the XLS file and attribute the table to the my_excel_data variable.
my_excel_data <- read_excel("movies-db.xls")
Comme my_excel_data est maintenant une trame de données dans R, tout comme celle que nous avons créée à partir du
fichier CSV, toutes les fonctions R natives peuvent lui être appliquées, comme head et str.
Prints out the structure of your table.
Tells you how many rows and columns there are, and the names and type of each column.
This should be the very same as the other table we created, as they are the same dataset.
str(my_excel_data)
Tout comme la fonction read.csv, read_excel prend comme paramètre principal le chemin d'accès au fichier souhaité.
Accès aux lignes et aux colonnes
Chaque fois que nous utilisons des fonctions pour lire des données tabulaires dans R, la méthode par défaut pour structurer ces
données dans l'environnement R est d'utiliser des Dataframes -- la structure de données primaire de R. Les Dataframes sont
extrêmement polyvalents, et R nous offre de nombreuses options pour les manipuler.
Publicité
Supposons que nous voulions accéder à la colonne "name" de notre ensemble de données. Nous pouvons directement
référencer le nom de la colonne sur notre Dataframe pour récupérer ces données, comme ceci :
Retrieve a subset of the data frame consisting of the "name" columns
my_data['name']
Une autre façon de procéder consiste à utiliser la notation $ qui, à la sortie, fournira un vecteur :
Retrieve the data for the "name" column in the data frame.
my_data$name
Vous pouvez également faire la même chose en utilisant des doubles crochets, pour obtenir une colonne de vecteurs de noms.
my_data[["name"]]
De même, toute ligne particulière de l'ensemble de données peut également être consultée. Par exemple, pour obtenir la
première ligne de l'ensemble de données avec toutes les valeurs des colonnes, nous pouvons utiliser
Retrieve the first row of the data frame.
my_data[1,]
La première valeur avant la virgule représente la ligne de l'ensemble de données et la deuxième valeur (qui est vide dans
l'exemple ci-dessus) représente la colonne de l'ensemble de données à récupérer. En fixant le premier chiffre à 1, nous disons
que nous voulons les données de la ligne 1, et en laissant la colonne vide, nous disons que nous voulons toutes les colonnes de
cette ligne.
Nous pouvons spécifier plus d'une colonne ou d'une ligne en utilisant c, la fonction de concaténation. En utilisant c pour
concaténer une liste d'éléments, nous disons à R que nous voulons que ces observations sortent du cadre des données. Essayons
cela.
Retrieve the first row of the data frame, but only the "name" and "length_min" columns.
my_data[1, c("name","length_min")]
Accès aux ensembles de données intégrés dans R
R fournit divers ensembles de données intégrés que les utilisateurs peuvent utiliser à différentes fins. Pour savoir quels sont les
ensembles de données disponibles, R fournit une fonction simple - data - qui renvoie tous les noms des ensembles de
Publicité
données actuels avec une petite description à côté. Ceux qui se trouvent dans le package de données sont tous intégrés.
Displays a list of the inbuilt datasets. Opens in a new "window".
data()
Complexe
Un nombre complexe est un nombre qui peut être exprimé sous la forme a + bi, où a et b sont des nombres réels et i est l'unité
imaginaire.
z = 8 + 6i # create a complex number
z
class(z)
Utilisez "data(package = .packages(all.available = TRUE))" pour énumérer les ensembles de données
dans tous les packages disponibles.
Comme vous pouvez le voir, il existe de nombreux ensembles de données différents déjà intégrés dans l'environnement R. Il
peut être très fatigant de devoir passer par chacun d'entre eux pour examiner leur structure et essayer de trouver ce qu'ils
représentent. Heureusement, R dispose d'une documentation pour chaque ensemble de données intégré. Vous pouvez y jeter un
coup d'œil en utilisant la fonction d'aide. Par exemple, si nous voulons en savoir plus sur l'ensemble de données sur les
femmes, nous pouvons utiliser la fonction suivante :
Opens up the documentation for the inbuilt "women" dataset.
help(women)
Comme les ensembles de données énumérés sont intégrés, vous n'avez pas besoin de les importer ou de les charger pour les
utiliser. Si vous les référencez par leur nom, R a déjà préparé le Dataframe.
women