TP7

Data Import, R Programming · course

Voir tous les documents en programmation

TP7

Table des matières

• Reading CSV Files

• Reading Excel Files

• Accessing Rows and Columns from dataset

• Accessing Built-in Datasets in R

Estimation du temps nécessaire : 15 min

Import de données

Apprenons à importer et à lire les données de deux types de fichiers courants utilisés pour stocker des données tabulaires

(lorsque les données sont stockées dans un tableau ou une feuille de calcul).

• Fichiers CSV (.csv)

• Fichiers Excel (.xls ou .xlsx)

Pour commencer, nous devons télécharger les données si elle s sont situées sur un serveur disant.

Télécharger les données

Pour télécharger des données en ligne il suffit d'utiliser la fonction download.file() qui nécessite deux arguments :

l'URL complète du fichier disant ett le nom du fichier qui sera stocké localement

Download datasets

CSV file

download.file("https://url/distant_file_name.csv",

destfile="local_file_name.csv")

XLS file

download.file("https://url/distant_file_name.xls",

destfile="local_file_name.xls")

Lecture des fichiers CSV

Que sont les fichiers CSV ?

Publicité

CSV (Comma Separated Values) est l'un des formats de données structurées les plus courants que vous trouverez. Ces fichiers

contiennent des données dans un format de tableau, où dans chaque ligne, les colonnes sont séparées par un délimiteur --

traditionnellement, une virgule (d'où les valeurs séparées par des virgules).

Habituellement, la première ligne d'un fichier CSV contient les noms des colonnes de la table elle-même. Les fichiers CSV

sont populaires parce que vous n'avez pas besoin d'un programme particulier pour les ouvrir.

Lecture des fichiers CSV dans R

Dans le fichier movies-db.csv, la première ligne de texte est l'en-tête (noms de chacune des colonnes), suivie de lignes

d'informations sur le film. Pour lire les fichiers CSV dans R, nous utilisons la fonction de base read.csv. Tout ce dont vous

avez besoin est le chemin d'accès au fichier CSV. Essayons de charger le fichier en utilisant le chemin d'accès au fichier

movies-db.csv que nous avons téléchargé précédemment :

Load the CSV table into the my_data variable.

my_data <- read.csv("movies-db.csv")

my_data

Les données ont été chargées dans la variable my_data. Mais au lieu de visualiser toutes les données en même temps, nous

pouvons utiliser la fonction head pour ne regarder que les six premières lignes de notre tableau, comme cela :

Print out the first six rows of my_data

head(my_data)

Vous pouvez également jeter un coup d'œil à la structure de votre table nouvellement créé. R nous fournit une fonction qui

résume les propriétés d'une table entière, appelée str. Essayons-la.

Prints out the structure of your table.

str(my_data)

Lecture des fichiers Excel

La lecture des fichiers XLS (tableur Excel) est similaire à la lecture des fichiers CSV, mais il y a un hic : R n'a pas de fonction

native pour les lire. Cependant, heureusement, R dispose d'un très grand répertoire de fonctions créées par les utilisateurs,

appelé CRAN. De là, nous pouvons télécharger un paquet de bibliothèque pour nous rendre capables de lire des fichiers XLS.

Publicité

Pour télécharger un paquet, nous utilisons la fonction install.packages. Une fois installée, vous n'avez plus besoin

d'installer cette même bibliothèque, à moins, bien sûr, que vous ne la désinstallez.

Download and install the "readxl" library

install.packages("readxl")

Chaque fois que vous allez utiliser une bibliothèque qui n'est pas native de R, vous devez la charger dans l'environnement R

après l'avoir installée. En d'autres termes, vous ne devez l'installer qu'une seule fois, mais pour l'utiliser, vous devez la charger

dans R pour chaque nouvelle session. Pour ce faire, utilisez la fonction library, qui charge dans R tout ce que nous pouvons

utiliser dans cette bibliothèque.

Load the "readxl" library into the R environment.

library(readxl)

Maintenant que notre bibliothèque et ses fonctions sont prêtes, nous pouvons passer à la lecture du fichier. Dans readxl, il y

a une fonction appelée read_excel, qui fait tout le travail pour nous. Vous pouvez l'utiliser de cette manière :

Read data from the XLS file and attribute the table to the my_excel_data variable.

my_excel_data <- read_excel("movies-db.xls")

Comme my_excel_data est maintenant une trame de données dans R, tout comme celle que nous avons créée à partir du

fichier CSV, toutes les fonctions R natives peuvent lui être appliquées, comme head et str.

Prints out the structure of your table.

Tells you how many rows and columns there are, and the names and type of each column.

This should be the very same as the other table we created, as they are the same dataset.

str(my_excel_data)

Tout comme la fonction read.csv, read_excel prend comme paramètre principal le chemin d'accès au fichier souhaité.

Accès aux lignes et aux colonnes

Chaque fois que nous utilisons des fonctions pour lire des données tabulaires dans R, la méthode par défaut pour structurer ces

données dans l'environnement R est d'utiliser des Dataframes -- la structure de données primaire de R. Les Dataframes sont

extrêmement polyvalents, et R nous offre de nombreuses options pour les manipuler.

Publicité

Supposons que nous voulions accéder à la colonne "name" de notre ensemble de données. Nous pouvons directement

référencer le nom de la colonne sur notre Dataframe pour récupérer ces données, comme ceci :

Retrieve a subset of the data frame consisting of the "name" columns

my_data['name']

Une autre façon de procéder consiste à utiliser la notation $ qui, à la sortie, fournira un vecteur :

Retrieve the data for the "name" column in the data frame.

my_data$name

Vous pouvez également faire la même chose en utilisant des doubles crochets, pour obtenir une colonne de vecteurs de noms.

my_data[["name"]]

De même, toute ligne particulière de l'ensemble de données peut également être consultée. Par exemple, pour obtenir la

première ligne de l'ensemble de données avec toutes les valeurs des colonnes, nous pouvons utiliser

Retrieve the first row of the data frame.

my_data[1,]

La première valeur avant la virgule représente la ligne de l'ensemble de données et la deuxième valeur (qui est vide dans

l'exemple ci-dessus) représente la colonne de l'ensemble de données à récupérer. En fixant le premier chiffre à 1, nous disons

que nous voulons les données de la ligne 1, et en laissant la colonne vide, nous disons que nous voulons toutes les colonnes de

cette ligne.

Nous pouvons spécifier plus d'une colonne ou d'une ligne en utilisant c, la fonction de concaténation. En utilisant c pour

concaténer une liste d'éléments, nous disons à R que nous voulons que ces observations sortent du cadre des données. Essayons

cela.

Retrieve the first row of the data frame, but only the "name" and "length_min" columns.

my_data[1, c("name","length_min")]

Accès aux ensembles de données intégrés dans R

R fournit divers ensembles de données intégrés que les utilisateurs peuvent utiliser à différentes fins. Pour savoir quels sont les

ensembles de données disponibles, R fournit une fonction simple - data - qui renvoie tous les noms des ensembles de

Publicité

données actuels avec une petite description à côté. Ceux qui se trouvent dans le package de données sont tous intégrés.

Displays a list of the inbuilt datasets. Opens in a new "window".

data()

Complexe

Un nombre complexe est un nombre qui peut être exprimé sous la forme a + bi, où a et b sont des nombres réels et i est l'unité

imaginaire.

z = 8 + 6i # create a complex number

z

class(z)

Utilisez "data(package = .packages(all.available = TRUE))" pour énumérer les ensembles de données

dans tous les packages disponibles.

Comme vous pouvez le voir, il existe de nombreux ensembles de données différents déjà intégrés dans l'environnement R. Il

peut être très fatigant de devoir passer par chacun d'entre eux pour examiner leur structure et essayer de trouver ce qu'ils

représentent. Heureusement, R dispose d'une documentation pour chaque ensemble de données intégré. Vous pouvez y jeter un

coup d'œil en utilisant la fonction d'aide. Par exemple, si nous voulons en savoir plus sur l'ensemble de données sur les

femmes, nous pouvons utiliser la fonction suivante :

Opens up the documentation for the inbuilt "women" dataset.

help(women)

Comme les ensembles de données énumérés sont intégrés, vous n'avez pas besoin de les importer ou de les charger pour les

utiliser. Si vous les référencez par leur nom, R a déjà préparé le Dataframe.

women