Dans un monde guidé par les données, extraire des insights exploitables à partir d’informations brutes est devenu essentiel pour les entreprises comme pour la recherche. C’est là que DataLab intervient : le notebook de données collaboratif, entièrement géré par DataCamp, qui simplifie l’analyse et facilite le partage avec vos collègues, partenaires ou clients, sans vous soucier de la configuration.
Puisque SQL reste un pilier de nombreux projets data, nous avons travaillé d’arrache-pied pour renforcer encore les capacités SQL de DataLab.
Interroger des fichiers CSV et des DataFrames
Beaucoup d’utilisateurs de DataCamp débutent en science des données et n’ont pas accès à une base de données ou à un entrepôt dédiés. Ils souhaitent plutôt explorer un fichier CSV trouvé en ligne ou importé depuis leur ordinateur. Nous avons d’ailleurs rencontré la même limite lors de formations en direct propulsées par DataLab : il fallait monter une base de données à chaque session SQL, ce qui était fastidieux.
Ce temps est révolu ! Avec une cellule SQL dans un notebook DataLab, vous pouvez interroger directement des fichiers CSV. Votre CSV est alors traité comme une base de données que vous interrogez comme n’importe quelle autre. Essayez ici

Les utilisateurs adorent cette nouveauté, car la prise en charge des CSV leur évite toute configuration de base de données. D’autres plébiscitent les workflows permis par le support SQL sur DataFrame, qui leur permettent d’alterner entre SQL et Python et de tirer le meilleur des deux langages.
Comment ça marche
Cette fonctionnalité s’appuie sur DuckDB. Surnommé « SQLite pour l’analytique », ce moteur de base de données analytique embarqué interroge les fichiers CSV avec d’excellentes performances. Lorsque vous sélectionnez « DataFrames et CSV », DataLab n’envoie pas la requête à un entrepôt comme d’habitude, mais la transforme en code Python qui appelle la DuckDB Python API dans la session de l’utilisateur et renvoie le DataFrame résultant.
Outre l’interrogation de fichiers CSV, DuckDB nous permet également d’interroger des DataFrames en mémoire créés plus haut dans le notebook. Cela ouvre des workflows très puissants, par exemple :
- Interroger un fichier CSV avec une cellule SQL. Le résultat est disponible en tant que DataFrame pandas.
- Utiliser des fonctions pandas pour nettoyer et restructurer les données d’une manière qui serait complexe en SQL. Enregistrer le résultat dans un nouveau DataFrame.
- Interroger ensuite ce DataFrame en SQL pour calculer des agrégats, ce que la fonctionnalité GROUP BY de SQL facilite grandement.
Autres améliorations
Autocomplétion des noms de tables et de colonnes
Nous ne nous sommes pas arrêtés au support des CSV et des DataFrames. Écrire des requêtes SQL peut être fastidieux, surtout avec de grandes bases contenant de nombreuses tables et colonnes. Pour simplifier cela, nous avons ajouté l’autocomplétion des noms de tables et de colonnes dans DataLab. Au fil de la saisie, notre système suggère automatiquement les noms pertinents en fonction de votre entrée, ce qui vous aide à éviter les fautes de frappe et à gagner du temps.

Cette fonctionnalité accroît non seulement la productivité, mais réduit aussi les erreurs. Que vous soyez un expert SQL aguerri ou que vous commenciez tout juste, l’autocomplétion vous aidera à écrire de meilleures requêtes, plus vite.
Explorateur de schémas amélioré
Pour faciliter la navigation et l’exploration de vos bases connectées, nous avons repensé l’explorateur de schémas dans DataLab. Vous pouvez désormais voir rapidement toutes les tables d’une base connectée, les rechercher et même en prévisualiser le contenu en quelques clics.

Notre explorateur de schémas amélioré est conçu pour vous aider à travailler plus efficacement avec vos données : moins de temps à chercher la bonne table ou la bonne colonne, plus de temps à faire émerger des insights de valeur.
Paramétrez vos requêtes SQL
Avec SQL, il arrive que vous souhaitiez mettre à jour dynamiquement vos requêtes en fonction des résultats de calculs précédents ou d’autres données de votre notebook. DataLab le prend désormais en charge grâce à la paramétrisation SQL, qui vous permet d’insérer des variables dans vos requêtes.

Davantage d’intégrations bases de données et entrepôts
Vous devez pouvoir accéder à vos données sans friction, où qu’elles se trouvent. DataCamp vous permet déjà d’interroger les bases et entrepôts les plus courants via une cellule SQL, dont PostgreSQL, MySQL, Redshift, Oracle, SQL Server, BigQuery et Athena. Nous ajouterons encore plus d’intégrations à notre plateforme, comme Snowflake et ClickHouse, pour couvrir tous les stacks et cas d’usage.
Des analyses plus rapides et plus agréables
Chez DataCamp, nous nous engageons à rendre votre expérience d’analyse de données fluide et plaisante. Avec ces améliorations SQL, nous pensons que DataLab est encore mieux armé pour vous aider à exploiter tout le potentiel de vos données. Que vous soyez data scientist, business analyst, ou simplement passionné par les données, nous sommes convaincus que DataLab vous permettra de fluidifier vos workflows et de hisser vos analyses au niveau supérieur. Testez ces nouveautés et voyez la différence par vous-même !
En attendant, nous continuerons de repousser les limites de l’analyse de données et d’ouvrir de nouvelles perspectives d’insights, avec la planification de notebooks, un mode sombre, une prise en charge native de dbt, des tableaux de bord avancés, et bien plus encore ! Voyez-vous quelque chose à améliorer ? Une fonctionnalité qui vous enthousiasme particulièrement ? Écrivez-nous à rocketship@datacamp.com ! Merci !