Cours
R, un langage de programmation statistique plébiscité pour la préparation, l’analyse et la visualisation des données, propose un éventail de structures de données optimisées pour gérer efficacement des tâches variées. Maîtriser la diversité des structures de données de R est la clé pour en exploiter tout le potentiel et transformer vos données en insights pertinents.
Pour bien démarrer, pensez à suivre notre cours Introduction to R Programming, qui vous permet de pratiquer ces notions sur des jeux de données réels. Entrons dans le vif du sujet.
Qu’est-ce qu’une structure de données en R ?
Les structures de données en R servent à organiser les données pour l’analyse. Elles peuvent être simples, ne contenant qu’un seul type de données, ou plus complexes, en combinant des types variés. Ces structures sont adaptées aux besoins spécifiques rencontrés dans les projets basés sur les données. Les principales structures de données en R sont les vecteurs, les listes, les matrices, les tableaux (arrays), les facteurs et les data frames.
Structures de données en R
Les différents types de structures de données en R
Prenons un moment pour nous familiariser avec les structures de données de R. Au passage, vous découvrirez des fonctions R courantes.
Les vecteurs en R
Les vecteurs sont la forme la plus simple de structure de données en R. Il s’agit d’une collection d’éléments de même type : numérique, caractère ou logique, par exemple.
R est conçu pour fonctionner de manière optimale avec les vecteurs, notamment via les opérations vectorisées. Cela signifie que vous pouvez appliquer une fonction à un vecteur sans écrire explicitement de boucle sur ses éléments. Par exemple, additionner deux vecteurs additionne les éléments correspondants, de façon plus rapide et concise que des boucles élément par élément.
Ici, nous créons trois vecteurs de type numérique, caractère et logique à l’aide de la fonction c().
numeric_vector = c(10, 20, 30)character_vector = c("apple", "banana", "cherry")logical_vector = c(TRUE, FALSE, TRUE)
print(numeric_vector)print(character_vector)print(logical_vector)
Exemples de vecteurs en R
Vous pouvez accéder aux éléments d’un vecteur avec des crochets.
# Accéder au premier
élémentprint(numeric_vector[1])
# Accéder à plusieurs éléments
print(character_vector[c(1, 3)])
Accéder aux éléments d’un vecteur en R
Vous pouvez également effectuer des opérations mathématiques et logiques sur les vecteurs.
# Ajouter une constante au vecteur
print(numeric_vector + 2)
# Multiplier les éléments par une constante
print(numeric_vector * 10)
# Opération logique : quels éléments sont > 15 ?
print(numeric_vector > 15)
Opérations sur les vecteurs en R
Parmi les opérations essentielles : la somme, la moyenne, ainsi que les valeurs minimale et maximale.
# Somme
print(sum(numeric_vector))
# Moyenne
print(mean(numeric_vector))
# Max et min
print(max(numeric_vector))
print(min(numeric_vector))
Sorties de fonctions R de base
Les matrices en R
Les matrices sont des tableaux bidimensionnels qui stockent des données d’un seul type. Elles sont particulièrement utiles pour les calculs mathématiques. En R, vous pouvez créer une matrice avec la fonction matrix().
my_matrix <- matrix(1:9, nrow=3, ncol=3)print(my_matrix)
Créer une matrice en R
Vous pouvez accéder aux éléments, aux lignes, aux colonnes ou à des sous-ensembles de la matrice en utilisant des indices.
# Accéder à l’élément en première ligne, deuxième colonne
print(my_matrix[1,2])
# Accéder à la deuxième ligne
print(my_matrix[2,])
# Accéder à la troisième colonne
print(my_matrix[,3])
Accéder aux éléments d’une matrice en R
Vous pouvez également effectuer des opérations mathématiques sur les matrices.
another_matrix <- matrix(9:1, nrow=3, ncol=3)
# Addition élément par élément
print(my_matrix + another_matrix)
# Soustraction élément par élément
print(my_matrix - another_matrix)
# Multiplication élément par élément
print(my_matrix * another_matrix)
# Division élément par élément
print(my_matrix / another_matrix)

Opérations mathématiques sur des matrices en R
Les tableaux (arrays) en R
Les tableaux (arrays) étendent le concept de matrice et peuvent avoir plus de deux dimensions, ce qui permet de stocker efficacement des données multidimensionnelles. Vous pouvez créer un array en R avec la fonction array().
L’argument dim = c(2, 2, 2) définit les dimensions du tableau. Ici, il s’agit d’un tableau à trois dimensions (3D) structuré en 2 lignes, 2 colonnes et 2 couches (profondeur). La sortie du code ci-dessus est présentée ci-dessous. Pour en savoir plus, consultez notre tutoriel Arrays in R.
my_array = array(1:8, dim = c(2, 2, 2))
print(my_array)

Créer un array en R
Les listes en R
Les listes sont des structures de données polyvalentes en R : elles peuvent contenir un mélange d’objets de types et de tailles différents. Vous pouvez créer une liste avec la fonction list().
my_list <- list(name="DataCamp", year=2024, scores=c(80, 90, 85), active=TRUE)
print(my_list)

Contenu d’une liste en R
Une fois la liste créée, vous pouvez accéder à ses éléments par indice ou par nom.
print(my_list[[3]])
print(my_list$name)
print(my_list$scores)
Accéder aux éléments d’une liste en R
Les facteurs en R
Contrairement aux vecteurs, matrices ou listes, les facteurs ne définissent pas une structure de stockage des données, mais décrivent la façon dont les données doivent être traitées au sein de ces structures. On peut donc les considérer comme un type de données, au même titre que les entiers ou les chaînes de caractères.
Nous incluons les facteurs ici car ils sont essentiels pour manipuler les variables catégorielles dans l’écosystème R, notamment lorsque l’on utilise des techniques statistiques où la distinction entre variables catégorielles et continues est déterminante. C’est différent de Python, qui impose souvent de convertir les variables catégorielles en variables numériques via des variables indicatrices (dummy) ou du one-hot encoding.
Vous pouvez créer des facteurs avec la fonction factor() comme ci-dessous :
gender <- factor(c("male", "female", "female", "male"))
print(gender)
![]()
Facteurs en R
Les facteurs sont également stockés sous forme de niveaux (levels) et peuvent être ordonnés ou non.
levels(gender) <- c("Female", "Male")
print(gender)

Niveaux d’un facteur en R
Pour examiner la distribution d’une variable factorielle, utilisez la fonction summary(). La sortie montre ici deux occurrences pour Female et deux pour Male.
summary(gender)
Résumé dans R
Les data frames en R
Les data frames sont la structure de données la plus répandue et la plus utilisée en R. Elles sont très pratiques car elles peuvent contenir différents types de données selon les colonnes. Vous pouvez les assimiler à des tables de base de données ou à des fichiers CSV, puisqu’elles stockent et gèrent les données dans un format bidimensionnel, carré ou rectangulaire.
Créez un data frame avec la commande data.frame().
data_frame <- data.frame( Names = c("Kiran", "Ajey", "Carol"), Age = c(25, 30, 35), Gender = c("Female", "Male", "Female"))
# Afficher le data frame
print(data_frame)
Un data frame en R
Vous pouvez accéder au contenu d’un data frame de plusieurs façons, par colonnes ou par lignes.
# Afficher tous les noms : utiliser le signe $
print(data_frame$Names)
# Accéder à la première ligne
print(data_frame[1, ])
# Accéder à la deuxième colonne
print(data_frame[, 2])
Éléments d’un data frame en R
Les data frames sont particulièrement utiles en préparation et analyse de données : ils prennent en charge le sous-échantillonnage, le tri et facilitent l’affichage de statistiques descriptives.
Extraire un sous-ensemble d’un data frame en R
subset_female <- data_frame[data_frame$Gender == 'Female', ]
print(subset_female)
Sous-ensemble d’un data frame en R
Trier un data frame en R
# Tri
data_frame <- data_frame[order(data_frame$Age), ]
print(data_frame)
Data frame trié en R
Résumer un data frame en R
# Résumé statistique
summary(data_frame)
Résumé descriptif ou statistique en R
Comme vous pouvez le voir, il est très simple d’effectuer des opérations sur les data frames en R. En approfondissant votre pratique, vous constaterez que les data frames sont extrêmement polyvalents et puissants pour la manipulation, l’analyse et la visualisation des données. Pour aller plus loin, consultez notre tutoriel Data Frames in R.
Poursuivre avec R
Ce tutoriel vous a présenté les différentes structures de données de R et leur usage dans des situations d’analyse concrètes. Les maîtriser renforcera vos compétences analytiques et vous aidera à gérer et analyser les données efficacement.
Au fil de votre progression, vous découvrirez que R est un langage unique, reconnu pour ses capacités statistiques avancées et la richesse de ses bibliothèques. C’est un excellent investissement pour toute personne curieuse du monde de l’analyse de données.
Pour plus de tutoriels R, consultez :
Si vous souhaitez en apprendre davantage, parcourez nos R Programming Interview Questions & Answers, une excellente ressource pour préparer un entretien ou simplement progresser. Cet article couvre un large éventail de questions-réponses qui vous aideront à repérer d’éventuelles lacunes au fil de votre apprentissage.
Professionnel chevronné de la science des données, de l'intelligence artificielle, de l'analyse et de la stratégie des données.
