Travailler sur un projet de data science est toujours stimulant, que vous soyez un·e passionné·e qui se lance ou un·e data scientist chevronné·e.
Cependant, configurer votre environnement de travail, installer les bibliothèques requises, stocker vos fichiers en toute sécurité et contourner les limites de calcul de votre machine peuvent vite devenir des obstacles.
Dans ce guide, vous allez découvrir comment Google Colab peut simplifier et doper votre flux de travail en data science.
Sommaire :
- Qu'est-ce que Google Colab ?
- Créer votre premier notebook Google Colab
- Pourquoi utiliser Google Colab
- Bibliothèques de data science préinstallées
- Partage et collaboration facilités
- Intégration fluide avec GitHub
- Travailler avec des données provenant de différentes sources
- Charger des données depuis votre ordinateur
- Monter Google Drive dans une instance Colab
- Cloner un dépôt GitHub dans une instance Colab
- Récupérer des données à distance
- Enregistrement automatique et historique des versions
- Accès à des accélérateurs matériels comme les GPU et TPU
- DataLab : vue d'ensemble
- Limites de Google Colab
- Conclusion
Qu'est-ce que Google Colab ?
Google Colab est un environnement de notebooks Jupyter dans le cloud, proposé par Google Research. Avec son interface simple et intuitive, Colab vous permet de démarrer votre parcours en data science quasiment sans configuration.
Si vous souhaitez faire de la data science avec Python, Colab est un excellent point de départ pour lancer vos projets sans vous soucier de la configuration de l'environnement. Google Colab permet d'écrire et d'exécuter du code Python directement depuis votre navigateur et inclut d'office les bibliothèques Python de data science les plus populaires.
Dans les sections suivantes, vous en apprendrez davantage sur les fonctionnalités de Google Colab.
Créer votre premier notebook Google Colab
Le meilleur moyen de comprendre, c'est d'essayer. Commençons par créer un premier notebook Colab :
- Rendez-vous sur colab.research.google.com. Vous verrez l'écran suivant. Pour pouvoir écrire et exécuter du code, vous devez vous connecter avec vos identifiants Google. C'est la seule étape requise de votre côté. Aucune autre configuration n'est nécessaire.

- Une fois connecté·e à Colab, vous pouvez créer un nouveau notebook via « Fichier » → « Nouveau notebook », comme ci-dessous :

Après avoir créé un nouveau notebook, renommez-le comme vous le souhaitez. Vous êtes prêt·e à coder votre projet.
- Google Colab est un environnement autonome. Vous pouvez écrire du code Python ainsi que du texte — grâce aux cellules Markdown — pour inclure du texte enrichi et des médias, comme ci-dessous. Cela permet d'ajouter des consignes pour un pas-à-pas et d'améliorer la lisibilité.

Maintenant que vous savez créer un notebook Colab, voyons ses avantages.
Pourquoi utiliser Google Colab
Au-delà de son fonctionnement dans le navigateur avec une simple connexion Google, Colab propose de nombreuses fonctionnalités utiles pour la communauté data. Parmi ses atouts :
- Bibliothèques de data science préinstallées
- Partage et collaboration facilités
- Intégration fluide avec GitHub
- Travail avec des données issues de diverses sources
- Enregistrement automatique et historique des versions
- Accès à des accélérateurs matériels comme les GPU et TPU
Bibliothèques de data science préinstallées
Les bibliothèques préinstallées expliquent en partie pourquoi Colab est un choix populaire pour mettre en place un projet de data science presque instantanément.
Colab inclut des bibliothèques Python pour l'analyse et la visualisation des données, comme NumPy, pandas, matplotlib et seaborn. Vous pouvez donc les importer directement dans votre projet et utiliser les modules nécessaires sans les installer.
Comme vous le savez, ces bibliothèques couvrent la plupart des projets d'analyse de données et permettent de réussir les étapes de préparation des données et d'analyse exploratoire (EDA) dans le pipeline de ML pour des projets plus ambitieux.
Si vous souhaitez maîtriser ces bibliothèques de data science, consultez le parcours Data Analyst with Python de DataCamp.
En complément, Colab embarque des bibliothèques de machine learning, dont scikit-learn, et de deep learning comme PyTorch, TensorFlow et Keras.
Vous pouvez donc créer des projets de machine learning et de deep learning sans aucune installation. Un navigateur suffit pour lancer votre projet en quelques minutes.
Travailler en groupe sur un projet est aussi très formateur. Dans la section suivante, vous verrez comment Colab facilite la collaboration.
Partage et collaboration facilités
Un environnement Jupyter en local montre vite ses limites pour collaborer. Avec Colab, vous pouvez partager votre notebook et y travailler à plusieurs, entre collègues ou ami·e·s.
Vous pouvez activer le partage en un clic, comme illustré ci-dessous.

Intégration fluide avec GitHub
En tant que développeur ou data scientist, vous utilisez GitHub en continu pour suivre l'évolution des fichiers d'un projet ; l'intégrer à Colab rend l'ensemble encore plus efficace.
Voyons comment enregistrer vos notebooks dans des dépôts GitHub :
Enregistrer les notebooks Colab sur GitHub
- Pour enregistrer votre notebook dans un dépôt GitHub, allez dans « Fichier » → « Enregistrer une copie dans GitHub ».

- Colab vous demandera ensuite une autorisation. Elle est nécessaire pour que Colab puisse pousser des commits vers votre dépôt.

-
Confirmez ensuite l'accès en suivant les instructions à l'écran.
-
Une fois l'autorisation accordée, la fenêtre suivante s'affiche.

Dans l'image ci-dessus :
- « username » et « name of the repo » sont des espaces réservés. Vous verrez votre identifiant GitHub et pourrez choisir le dépôt vers lequel pousser le notebook actuel comme « name of the repo ».
- La branche par défaut est « main » pour le dépôt choisi, mais vous pouvez sélectionner toute autre branche. Vous pouvez aussi personnaliser le chemin du fichier.
- Enfin, saisissez un bon message de commit et cliquez sur « Ok » : votre commit sera poussé vers le dépôt GitHub sélectionné.
De cette manière, vous pouvez héberger tous vos notebooks Colab dans des dépôts GitHub, ce qui favorise le partage de connaissances et les projets open source.
Travailler avec des données provenant de différentes sources
Dans tout projet de data science, vous commencez par importer le jeu de données dans votre environnement. Voici différentes façons de le faire dans Google Colab.
Charger des données depuis votre ordinateur
Pour téléverser des fichiers de données depuis votre machine, cliquez sur l'icône « Importer un fichier » dans l'onglet « Fichiers » comme ci-dessous, puis choisissez le fichier à envoyer.

Monter Google Drive dans une instance Colab
Si vous préférez stocker vos fichiers dans Google Drive, vous pouvez le monter facilement dans l'instance Colab en cours. Vous pourrez ainsi accéder à tous les jeux de données et fichiers présents sur votre Drive.
Deux options s'offrent à vous :
- Cliquez sur l'icône « drive » dans l'onglet « Fichiers » et suivez les instructions à l'écran.

- Une fois le montage réussi, le dossier « drive » apparaît comme répertoire disponible dans l'onglet « Fichiers ».

Vous pouvez aussi monter Google Drive via les lignes de code suivantes dans une cellule de code du notebook.
from google.colab import drive
drive.mount('content/drive')
Vous devrez autoriser l'accès. Choisissez « Se connecter à Google Drive ». Comme avec la méthode précédente, le dossier « drive » apparaîtra dans l'onglet « Fichiers ».
Cloner un dépôt GitHub dans une instance Colab
Si vous avez besoin d'accéder à tous les fichiers d'un dépôt GitHub, vous pouvez le cloner dans votre espace de travail comme suit.

Exécuter la commande suivante permet de cloner n'importe quel dépôt GitHub distant — remplacez simplement l'espace réservé.
!git clone <URL of the repo>
Récupérer des données à distance
Il arrive que vous deviez récupérer un jeu de données sur le web ; voici comment procéder :
Comme vous pouvez exécuter des commandes shell courantes dans le notebook, utilisez « !wget » pour télécharger des données distantes en précisant l'URL.
Essayons de récupérer le jeu de données Boston housing utilisé dans le cours Supervised Learning with scikit-learn de DataCamp.
Le jeu de données est disponible à cette URL ; l'image suivante illustre la récupération réussie.

Enregistrement automatique et historique des versions
Vous est-il déjà arrivé de peiner à retrouver des fichiers perdus ?
Avec Colab, ce risque est limité : tous les notebooks sont enregistrés automatiquement sur le Drive du compte Google avec lequel vous êtes connecté·e.
Même en collaborant à plusieurs, vous pouvez suivre toutes les modifications du notebook dans le temps via l'historique des versions. Allez dans « Fichier » → « Historique des versions » pour voir les changements et leur date.
Voici un exemple d'historique :

Accès à des accélérateurs matériels comme les GPU et TPU
Bien souvent, les spécifications de votre machine locale et les limites de puissance de calcul posent problème, surtout avec de grands modèles de deep learning.
Pour dépasser ces limites, Colab donne accès à des accélérateurs matériels — GPU (Graphics Processing Unit) et TPU (Tensor Processing Unit) — afin d'entraîner plus vite vos modèles de deep learning.
Les captures ci-dessous montrent comment activer l'utilisation des GPU dans un notebook Colab en deux étapes.
- Allez dans « Exécution » → « Modifier le type d'exécution »

- Choisissez l'accélérateur matériel : GPU ou TPU selon vos besoins.

Vous avez vu jusqu'ici des fonctionnalités utiles de Colab pour la data science. Si cela vous intéresse, découvrez aussi DataLab. Commencez à utiliser DataLab en créant un compte DataCamp gratuit.
DataLab : vue d'ensemble
DataLab offre un environnement 100 % navigateur pour tous vos besoins en data science. Vous codez en Python ou R, avec prise en charge intégrée de SQL, et collaborez sans aucune configuration.
- Si vous souhaitez commencer à bâtir votre portfolio data, DataLab est un excellent choix. Créez un nouveau DataLab Python ou R, ou travaillez directement à partir d'un dépôt GitHub.

- Comme Google Colab, DataLab propose de nombreuses fonctionnalités : bibliothèques préinstallées, jeux de données préchargés, intégrations avec des sources de données courantes, etc. Vous pouvez écrire et exécuter du code Python et R, ainsi qu'ajouter du texte enrichi et des images.

- Une fois votre notebook publié, vous pouvez le partager facilement et collaborer avec d'autres personnes.
-
DataLab propose de nombreux jeux de données, modèles et playbooks préchargés dans des domaines variés : apprentissage non supervisé, analyse de marché, traitement du langage naturel, et bien plus. Ces modèles vous donnent le cap pour démarrer rapidement vos projets.
-
Vous n'avez pas besoin d'héberger vos notebooks sur GitHub. Tous vos notebooks sont accessibles depuis votre profil DataCamp, ce qui vous permet de présenter l'ensemble de votre portfolio data via votre compte gratuit.
-
Pour en savoir plus sur DataLab, consultez la documentation.
Limites de Google Colab
Même si Colab simplifie bien des choses, gardez à l'esprit les limites suivantes :
- L'instance gratuite de Colab suffit pour des projets de petite à moyenne envergure. En revanche, l'usage des GPU est contraint. En général, vous pouvez entraîner vos modèles sur GPU pendant 12 heures, après quoi l'exécution est interrompue. Pour un accès prolongé aux GPU et TPU, il faut passer à Colab Pro.
- Google Colab est conçu pour la data science en Python. Il arrive cependant que vous vouliez utiliser R, SQL ou d'autres langages pour interroger des bases de données. Colab prend actuellement en charge uniquement Python. Si vous préférez R et avez besoin d'intégrations MySQL, pensez à DataLab.
- Dans Colab, la demande et l'attribution des accélérateurs matériels se font en temps réel. Cela peut entraîner des fluctuations d'accès aux GPU et TPU.
-
Les fichiers et bibliothèques que vous installez sont propres à l'instance Colab en cours. À la déconnexion de l'exécution, vous perdez ces fichiers et packages. Si vous travaillez par itérations, vous devrez vous reconnecter et réinstaller les dépendances nécessaires.
-
Colab impose une limite d'espace disque par instance, selon la machine allouée. Cela peut bloquer des jeux de données très volumineux.
Conclusion
Dans ce tutoriel, vous avez découvert les fonctionnalités clés de Google Colab pour la data science. Vous avez aussi vu comment DataLab peut vous aider à construire un portfolio data directement dans le navigateur — une excellente option pour démarrer, avec un compte DataCamp gratuit.
Obtenez une certification en maîtrise des données et décrochez le poste de vos rêves
Nos programmes de certification vous aident à vous démarquer et à prouver aux employeurs potentiels que vos compétences sont adaptées à l'emploi.

