Cours
DataCamp Workspace s’appuie sur les notebooks Jupyter et optimise l’expérience pour vous rendre plus productif.
Un écueil fréquent pour les analystes et data scientists est de connecter un notebook Jupyter à une base de données pour commencer à travailler. Le problème est encore plus marqué pour les débutants : comment apprendre à écrire du SQL si vous ne pouvez même pas vous connecter à une base de données ?
Workspace rend l’écriture de requêtes SQL simple et fluide — que vous vous entraîniez ou que vous travailliez sur un projet. Ce tutoriel vous montre comment commencer à écrire du SQL dans Workspace en quelques secondes.
Ce tutoriel suppose que vous avez déjà utilisé SQL. Si ce n’est pas le cas, lisez d’abord notre tutoriel SQL pour débutants, puis testez les exemples de ce tutoriel dans Workspace en suivant les techniques présentées ici !
Premiers pas
Pour utiliser Workspace, vous devez créer un compte DataCamp. (Un compte gratuit suffit pour commencer.)
Une fois votre compte créé, utilisez la barre de navigation supérieure pour accéder à Workspace.

Ce tutoriel utilisera le jeu de données intégré « NBA Shooting Data ». Si vous préférez utiliser votre propre jeu de données, passez à la section ci‑dessous.
Utilisez la navigation de gauche pour ouvrir la page Datasets.

Tapez « nba » dans la barre de recherche et cliquez sur le jeu de données.

Un aperçu du jeu de données s’affiche. Parcourez‑le, puis cliquez sur « Use Dataset ».

Téléverser votre propre jeu de données
Vous pouvez utiliser SQL pour analyser tout type de données tabulaires dans Workspace. À ce jour, les fichiers CSV sont les mieux pris en charge ; pour apprendre, nous vous recommandons d’utiliser un fichier CSV si vous importez vos propres données.
Depuis la page Overview, cliquez sur « Empty » pour créer un workspace vide.

Donnez un nom à votre workspace, puis cliquez sur « Create Workspace ».

Dans la barre d’outils de gauche, ouvrez l’outil Files.

En haut à gauche de l’outil, faites glisser un fichier de données dans le panneau pour le téléverser. (Vous pouvez aussi cliquer sur « browse files » ou sur le bouton ⊕ puis Upload.)
Utiliser SQL avec des données au format CSV
Les données de tirs NBA se trouvent dans le fichier nba_players_shooting.csv. Dans la barre d’outils de gauche, ouvrez l’outil Files pour voir le fichier.

Le notebook du workspace contient du code Python pour importer le dataset. Cependant, ici, nous souhaitons utiliser SQL.
À la fin du notebook, cliquez sur « Add SQL ».

Dans le menu « Select source », choisissez « DataFrames and CSVs ».

Pour écrire une requête SQL sur un fichier CSV, une seule adaptation au SQL standard est nécessaire. Dans la clause FROM, au lieu de nommer une table, indiquez le chemin du fichier CSV entre apostrophes.
Calculons la proportion de tirs réussis pour chaque tireur, du meilleur au moins bon. Dans la cellule SQL, saisissez le code suivant.
SELECT
shooter,
SUM((SCORE = 'MADE')::DOUBLE) / COUNT(*) AS prop_score_made
FROM 'nba_players_shooting.csv'
GROUP BY shooter
ORDER BY prop_score_made DESC

Notez que le dialecte SQL utilisé avec un fichier CSV est DuckDB. Pour en savoir plus, lisez DuckDB makes SQL a first-class citizen on DataCamp Workspace.
Poursuivre en Python, R ou avec des graphiques no‑code
Dans l’exemple précédent, nous avons conservé le format de retour par défaut. En haut de la cellule SQL, vous verrez que la valeur de retour est un DataFrame nommé df. Vous pouvez donc poursuivre l’analyse des résultats en Python (ou en R, dans les workspaces R) ou créer des graphiques sans code.

Cliquez sur « Add Chart » pour ajouter un graphique no‑code.

Configurez les options suivantes.
- Type : Bar
- Axe X : prop_score_made
- Axe Y : SHOOTER

Utiliser SQL avec des données en DataFrames
La requête SQL exécutée sur le fichier CSV a créé un DataFrame nommé df. Vous pouvez également écrire des requêtes SQL sur ces DataFrames pandas ou R. La seule différence avec le SQL standard est que, dans la clause FROM, vous indiquez le nom du DataFrame au lieu du nom de table.
Ici, nous allons réutiliser les résultats précédents dans df et scinder la colonne shooter en prénom et nom. Ajoutez une cellule SQL, sélectionnez « DataFrames and CSVs » comme source, et utilisez le code suivant.
SELECT
str_split(shooter, ' ')[1] AS first_name,
str_split(shooter, ' ')[2] AS last_name,
prop_score_made
FROM df
Utiliser les bases d’exemple
Workspace met également à disposition plusieurs bases de données d’exemple pour vous entraîner au SQL.
Ajoutez une cellule SQL et, dans la liste des sources, faites défiler jusqu’à la section « Sample Integrations ». Ici, nous utiliserons « Bicycle Sales ».

Une requête par défaut apparaît. Pour le tutoriel, remplacez‑la par une requête plus simple.
SELECT
product_name,
MIN(list_price) AS cheapest_list_price
FROM products
GROUP BY product_name
Lorsque vous utilisez une connexion à une base (plutôt que d’écrire du SQL sur un CSV ou un DataFrame), vous pouvez retourner les résultats en tant que requête. Dans le menu, choisissez « Query ». Vous pouvez aussi nommer cette valeur. Ici, remplacez « query » par « best_price ».

L’exécution de la requête produit la sortie suivante.

Vous pouvez maintenant réutiliser ce résultat pour écrire d’autres requêtes SQL. En pratique, vous avez créé une « common table expression » (voir le tutoriel SQL Commands for Data Scientists) sans avoir à utiliser la syntaxe CTE.
Ajoutez une autre cellule SQL et écrivez cette nouvelle requête.
SELECT *
FROM best_price
WHERE cheapest_list_price > 10000
L’exécution de cette requête renvoie les résultats suivants.

Se connecter à d’autres bases de données
Workspace vous permet également de vous connecter à de nombreux types de bases de données, dont PostgreSQL, MySQL, Redshift, BigQuery, Athena, SQL Server, MariaDB et Oracle Database. Retrouvez toutes les instructions de connexion dans la documentation Workspace.
Dans la barre d’outils de gauche, cliquez sur « Integrations », puis sur le bouton ⊕ pour créer une nouvelle intégration.
Choisissez le type de base de données auquel vous souhaitez vous connecter.

Il vous sera demandé de renseigner les paramètres de connexion (ils varient selon le type de base).

Utiliser l’assistant IA
Écrire du SQL est à la fois utile et stimulant, mais laisser l’IA le faire pour vous peut accélérer l’apprentissage et booster votre productivité. Pour en savoir plus, lisez From Data to Insights: Get There Faster with the DataCamp Workspace AI Assistant.
Ajoutez une cellule SQL. Dans le menu contextuel à droite, cliquez sur « Generate ».

Une zone de texte apparaît en haut de la cellule SQL. Formulez‑y une tâche pour l’IA. Choisissez la vôtre ou essayez la suivante.
Return the product names and list prices for all mountain bikes made by Trek that are in stock.
Après avoir saisi votre demande, appuyez sur Entrée pour que l’IA génère le code SQL.

Si le code vous paraît pertinent, cliquez sur « Accept & run » (ou « Accept », puis « Run » ensuite) pour voir le résultat de la requête.

Demander à l’IA d’expliquer vos erreurs
Vous pouvez également utiliser l’IA intégrée à Workspace pour expliquer les erreurs dans votre SQL. Supposons que vous vous soyez trompé en écrivant la requête sur les vélos chers et que vous ayez utilisé un opérateur de style Fortran .GT. au lieu de `>`.
SELECT *
FROM best_price
WHERE cheapest_list_price .GT. 10000
Cela génère une erreur. En bas à gauche de la cellule SQL, cliquez sur « Fix Error ».

L’IA propose le code correct, suivi d’une explication de l’erreur.

En résumé
Vous avez vu comment éviter la configuration d’une base en écrivant des requêtes SQL directement sur des fichiers CSV et des DataFrames. Vous avez utilisé des bases d’exemple pour vous entraîner et découvert comment générer du SQL en langage naturel et corriger vos erreurs grâce à l’IA.
Ces fonctionnalités simplifient considérablement les premiers pas en SQL et vous rendent plus productif pendant l’apprentissage comme au quotidien.
Passez à la vitesse supérieure
Lancez‑vous avec SQL dans Workspace en vous connectant ou en créant un compte DataCamp. Vous pouvez aussi maîtriser les fondamentaux de SQL via notre parcours de compétences, afin d’acquérir toutes les compétences nécessaires pour interagir avec vos données et les interroger.
Richie aide les individus et les organisations à mieux utiliser les données et l'IA. Il est data scientist depuis bien avant que l'on parle de data science, et a écrit deux livres et créé de nombreux cours DataCamp sur le sujet. Il est l'hôte du podcast DataFramed et dirige le programme de webinaires de DataCamp.
