Accéder au contenu principal

BigQuery Sandbox : le guide du bac à sable SQL gratuit de Google

Déployez un environnement BigQuery gratuit, entraînez-vous sur du SQL réel avec des données publiques et privées, et créez des tableaux de bord tout en restant dans les limites généreuses de l'offre gratuite.
Actualisé 19 sept. 2026  · 15 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Quand j'ai voulu apprendre BigQuery pour la première fois, le plus gros frein n'était pas la syntaxe SQL, mais la crainte de générer des coûts par erreur. Je ne voulais pas ajouter une carte bancaire juste pour faire des essais. 

Le BigQuery Sandbox est la réponse de Google à ce problème. Il offre une entrée sans coût et sans risque vers l'un des entrepôts de données les plus puissants au monde. Vous bénéficiez de la plupart des capacités analytiques du moteur SQL de BigQuery sans fournir la moindre information de facturation.

Dans cet article, je vous montre comment démarrer avec le BigQuery Sandbox, ce que vous pouvez (et ne pouvez pas) faire avec, des workflows pratiques que j'utilise chaque semaine, et quand il est temps de passer à un projet complet. Que vous soyez un·e junior en data qui veut gagner en confiance ou un·e professionnel·le aguerri·e qui prototype de nouvelles idées, le Sandbox est la façon la plus sûre d'explorer gratuitement un data warehouse de niveau entreprise.

Si vous débutez dans les données dans le cloud, je vous recommande de commencer par le cours Introduction to BigQuery pour poser les bases.

Qu'est-ce que le BigQuery Sandbox ?

Le BigQuery Sandbox est un point d'entrée gratuit et sans carte bancaire vers l'entrepôt de données entièrement géré de Google Cloud. Il permet d'explorer les outils analytiques essentiels de BigQuery et la Google Cloud Console sans créer de compte de facturation ni s'engager sur un moyen de paiement. Il fonctionne dans les limites de l'offre gratuite de BigQuery, tout en appliquant des politiques d'expiration spécifiques pour conserver un environnement léger.

Pour comprendre la valeur du Sandbox, regardons d'abord ce qu'il apporte concrètement à l'utilisateur.

Définition et promesse de valeur

Le BigQuery Sandbox supprime la plus grande friction pour les débutants et les étudiants : devoir configurer des informations de paiement avant même d'exécuter votre première requête. Il suffit de vous connecter avec un compte Google classique, de créer un projet et vous pouvez interroger immédiatement des jeux de données publics.

Vous profitez du même moteur Standard SQL utilisé par des entreprises du Fortune 500, ainsi que de 1 To de données traitées par vos requêtes et 10 Go de stockage actif chaque mois. C'est entièrement gratuit, sous réserve des quotas et limites de l'offre gratuite BigQuery.

Pour être opérationnel·le sur BigQuery, je vous recommande de vous entraîner avec nos Top BigQuery Interview Questions.

Sandbox vs offre gratuite vs essai gratuit

Pour les nouveaux utilisateurs, la différence entre le Sandbox, l'offre gratuite et l'essai gratuit peut prêter à confusion. Voici comment je choisis :

  • Sandbox : Aucun compte de facturation ni carte bancaire requis. Les tables, vues et partitions expirent automatiquement au bout de 60 jours. Idéal pour l'apprentissage, les certifications et les expérimentations rapides.
  • Offre gratuite : Nécessite des infos de facturation mais permet des tables permanentes. Mêmes limites de 10 Go de stockage / 1 To de requêtes. À utiliser quand vous avez besoin que les données restent plus longtemps.
  • Essai gratuit : 300 $ de crédit pendant 90 jours avec accès complet à toutes les fonctionnalités. Parfait pour évaluer sérieusement avant d'allouer un budget.

Ma règle : commencez dans le Sandbox pour tout ce qui est pédagogique ou proof of concept. Passez à l'offre gratuite dès que vous avez besoin de stockage permanent. Optez pour le payant uniquement si vous avez besoin de streaming, de transferts planifiés ou de charges de production lourdes.

Configurer un environnement BigQuery Sandbox

Accéder au Sandbox est simple, mais il y a un enchaînement précis à suivre pour éviter toute demande de carte bancaire.

Prérequis et accès

La seule exigence pour utiliser le Sandbox est un compte Google standard, par exemple un compte Gmail personnel ou un compte Google Workspace. Vous n'avez pas besoin d'un projet Google Cloud existant pour commencer.

Je recommande de commencer en vous rendant directement sur la Google Cloud Console. Si vous n'avez jamais utilisé Google Cloud, vous devrez accepter les conditions d'utilisation avant d'accéder au tableau de bord.

Activer le Sandbox

  1. Cliquez sur Select a project en haut.
  2. Cliquez sur New Project et donnez-lui un nom (par ex. : « sandbox-experiments »).
  3. Important : ne crÉEZ PAS et ne sélectionnez pas de compte de facturation. Créez simplement le projet.
  4. Une fois le projet prêt, ouvrez BigQuery via le menu de gauche. Vous devriez voir une étiquette Sandbox à côté du nom de votre projet, comme sur la capture ci-dessous.

BigQuery Sandbox Homepage

Quand on vous le propose, activez l'API BigQuery — cela prend quelques secondes.

L'interface BigQuery est divisée en trois zones principales que vous utiliserez en permanence. À gauche, le volet Explorer, où se trouvent vos ensembles de données et vos tables. Au centre, l'éditeur de requêtes. En bas, la grille des résultats.

D'après mon expérience, le meilleur moyen de prendre vos marques est d'épingler tout de suite un jeu de données public. Cliquez sur + Add data dans le volet Explorer, sélectionnez Public Datasets, et recherchez bigquery-public-data. Vous avez ainsi un accès instantané à d'immenses jeux de données sur de nombreux sujets (courses de taxis à New York, dépôts GitHub, etc.) sans avoir à téléverser vos propres fichiers.

PublicDatasetBigQuery

Une fois l'interface configurée, vous pouvez commencer à explorer les fonctionnalités avancées que BigQuery propose, même en version gratuite.

Dans la barre de recherche en haut de la galerie, saisissez « GitHub ». Repérez la tuile intitulée GitHub Activity Data dataset (bigquery-public-data.github_repos). Elle est parfaite pour s'entraîner aux jointures complexes et aux manipulations de chaînes grâce à ses riches métadonnées.

GithubPublicDatasetBigQuery

Cliquez sur la tuile GitHub pour ouvrir la page de détails du produit. De là, cliquez sur le bouton View dataset. Vous serez renvoyé·e vers l'éditeur BigQuery. Cliquez ensuite sur l'étoile pour épingler le jeu de données public. 

starGithubPublicDatasetBigQuery

Maintenant que les données sont épinglées, déployez l'arborescence dans le volet Explorer pour voir des tables comme github_repos ou commits. Vous êtes prêt·e à exploiter les vraies fonctionnalités analytiques de la plateforme.

Fonctionnalités essentielles du BigQuery Sandbox

Le Sandbox n'est pas qu'un mode lecture : c'est un moteur SQL pleinement opérationnel qui prend en charge des charges analytiques avancées. Vous accédez à de nombreuses fonctionnalités haut de gamme utilisées par les data engineers. Toutefois, certaines capacités (dont le DML, le streaming et le Data Transfer Service) ne sont pas disponibles dans le Sandbox.

Exécution de requêtes et support SQL

Le Sandbox vous donne toute la puissance du moteur Standard SQL de BigQuery — le même que des entreprises comme Spotify et Twitter utilisent pour des analyses à l'échelle du pétaoctet. Vous pouvez écrire de tout, des SELECT * FROM … basiques jusqu'aux fenêtres analytiques, expressions de table communes (CTE), gestion des ARRAY/STRUCT et requêtes géospatiales avec les types GEOGRAPHY.

Lorsque vous écrivez une requête, BigQuery propose une icône de validation en haut à droite de l'éditeur. Ce validateur est, selon moi, un vrai sauveur pour les utilisateurs du Sandbox. Il indique précisément le volume de données que votre requête traitera avant de l'exécuter. Étant donné la limite mensuelle d'1 To, vérifier cette estimation vous évite de griller votre quota sur un SELECT * inefficace.

Exécutons quelques vraies requêtes sur le jeu de données GitHub Activity vu plus haut. Elles sont sécurisées, scannent très peu de données et enseignent progressivement des concepts SQL.

Nombre total de commits dans le jeu de données GitHub

Dans l'éditeur de requêtes (volet central), supprimez le texte existant. Saisissez ensuite la requête suivante :

SELECT COUNT(*) AS total_commits
FROM bigquery-public-data.github_repos.commits

En bas, vous verrez un petit message du type : « Cette requête traitera X Mo ». Après avoir cliqué sur Run, les résultats apparaissent en quelques secondes dans la grille inférieure.

C'est mon « hello world » pour chaque nouveau jeu de données public : cela me donne immédiatement l'ordre de grandeur. Ce que vous verrez :

  • La grille de résultats affiche une ligne : total_commits avec un très grand nombre (plusieurs centaines de millions).

  • Dans l'onglet Job Information, les métadonnées du job s'affichent, notamment les octets traités, le temps d'exécution et l'utilisation des slots.

Job Information

Commits moyens par auteur dans les dépôts GitHub populaires

On peut aussi utiliser une requête plus complexe :

  • Crée une table temporaire des dépôts, auteurs et commits

  • Agrège par dépôt

  • Filtre les dépôts ayant plus de 50 adresses author_email distinctes

  • Affiche le top 10 classé par nombre moyen de commits par auteur

WITH author_commits AS (
  SELECT repo_name, author.email AS author_email, COUNT(*) AS commits
  FROM bigquery-public-data.github_repos.commits
  GROUP BY repo_name, author_email
)
SELECT 
  repo_name,
  AVG(commits) AS avg_commits_per_author,
  COUNT(DISTINCT author_email) AS unique_authors
FROM author_commits
GROUP BY repo_name
HAVING unique_authors > 50
ORDER BY avg_commits_per_author DESC
LIMIT 10

Voici à quoi ressemble le résultat :

Query Results

Manipulation de chaînes

BigQuery excelle en manipulation de chaînes. Pour trouver tous les dépôts qui mentionnent « data-science » ou « machine-learning » dans leur nom, utilisez la fonction REGEXP_CONTAINS : 

SELECT
   repo_name
FROM bigquery-public-data.github_repos.sample_repos
WHERE REGEXP_CONTAINS(repo_name, r'data-science|machine-learning')
LIMIT 20;

Query Results

Si les jeux de données publics sont excellents pour s'exercer, la vraie puissance du Sandbox se révèle quand vous analysez vos propres données. Qu'il s'agisse d'une petite feuille de calcul ou d'un fichier de logs, BigQuery propose plusieurs moyens d'ingérer vos données dans le cloud.

Méthodes d'ingestion de données

D'après mon expérience, l'ingestion de données dans BigQuery est l'une des plus conviviales du marché entreprise. Vous n'avez pas besoin d'écrire des scripts ETL (Extract, Transform, Load) complexes pour commencer. Utilisez simplement l'assistant intégré pour pointer vers votre source de données.

Méthode 1 : téléverser des fichiers locaux

C'est le chemin le plus courant pour débuter. BigQuery prend en charge plusieurs formats, dont CSV, JSON (avec lignes séparées) et Avro.

Create Dataset BigQuery

Étapes pour téléverser un fichier :

  1. Dans le volet Explorer, cliquez sur les trois points à côté de votre ID de projet et sélectionnez Create dataset, comme sur la capture ci-dessus. 
  2. On vous demandera ensuite quelques détails (nom et région du dataset, etc.) avec des paramètres optionnels. Après saisie, cliquez sur le bouton bleu Create dataset en bas.
  3. Cliquez sur Create Table en haut à droite pour commencer l'import de votre fichier CSV comme source. Comme pour la création de base, vous indiquerez quelques détails ensuite.
  4. Sélectionnez Upload, téléversez votre fichier CSV (BigQuery détecte généralement le format automatiquement) et nommez la table. Gardez en tête la limite de stockage du Sandbox de 10 Go au total.
  5. Dans Schema, laissez Auto detect coché afin que BigQuery déduise les noms et types de colonnes. Cela fonctionne très bien avec des fichiers CSV et JSON propres, mais vous pourrez éditer noms ou types ensuite si besoin.
  6. Une fois terminé, cliquez sur le bouton bleu Create table en bas.

Table Information

BigQuery téléverse le fichier, déduit le schéma et crée la table. Vous pouvez l'interroger immédiatement.

Table created in BigQuery

Pourquoi c'est idéal dans le Sandbox :

  • Zéro coût : l'upload est gratuit.

  • L'inférence automatique du schéma fait gagner du temps pour des tests.

  • Parfait pour s'entraîner au nettoyage de données ou aux JOIN avec des données publiques.

Méthode 2 : importer depuis Google Drive

Si vos données sont déjà dans le cloud, vous pouvez relier BigQuery directement à ces sources. C'est particulièrement utile pour les utilisateurs de Google Sheets qui souhaitent interroger leurs feuilles avec du SQL, ce que je prends ici en exemple.

Étapes pour importer depuis Drive :

  1. Cliquez sur Create Table, mais au lieu de téléverser un fichier, réglez Create table from sur Drive dans le menu déroulant. 
  2. Collez l'URL de votre Google Sheet, réglez le format de fichier sur Google Sheet. Indiquez ensuite la plage de la feuille à importer, puis nommez la table créée (ici personal_expenses). Laissez BigQuery détecter automatiquement le schéma ou définissez-le manuellement. 
  3. Une fois prêt, cliquez sur Create table

Creating a table from Google sheetPourquoi j'utilise cette option :

  • Pas de téléchargement/téléversement local.
  • Idéal pour itérer : modifiez dans Sheets, puis réimportez en nouvelle table pour tester les changements.

Méthode 3 : importer depuis des buckets Google Cloud Storage

Si vous avez des données dans GCS (même dans un bucket gratuit), c'est l'option la plus scalable dans le Sandbox. BigQuery permet aussi d'importer depuis Azure Blob Storage ou Amazon S3. Pour comparer les trois principaux écosystèmes cloud, je vous recommande notre guide AWS vs. Azure vs. Google Cloud.

Étapes pour importer depuis GCS :

  1. Dans le menu déroulant, réglez Create table from sur Google Cloud Storage
  2. Collez l'URL de votre bucket ou parcourez pour le sélectionner. La suite est identique à la méthode d'upload : nommez la table, choisissez/créez un dataset, choisissez une option de schéma, puis cliquez sur Create table.

BigQuery charge depuis GCS, crée la table et vous pouvez commencer. Toutes les tables ingérées suivent toujours la règle d'expiration à 60 jours. C'est idéal pour tester des pipelines, mais pensez à migrer si vous avez besoin de stockage permanent.

Creating a BigQuery table from GCS

Le SQL brut est rarement le livrable final d'un projet data. Pour vraiment communiquer vos résultats, vous devez transformer ces lignes de données en histoires visuelles que les parties prenantes comprennent en un coup d'œil.

Intégrations de visualisation

Le BigQuery Sandbox est conçu pour s'intégrer naturellement à l'écosystème Google, c'est-à-dire qu'il se connecte aux outils de business intelligence de Google avec quasiment aucune configuration. J'ai constaté que le menu Open in dans le volet des résultats est la fonctionnalité la plus importante pour débuter, car il sert de hub central pour passer aux outils visuels.

D'après mon expérience, cette connectivité en un clic est le plus grand atout du Sandbox pour un·e data analyst. Elle évite de gérer des pilotes de base de données complexes ou des installations locales qui compliquent souvent les workflows data en entreprise.

Onglet de visualisation intégré dans la grille des résultats

L'onglet Visualization est le moyen le plus rapide de voir des graphiques sans quitter la console : littéralement à un clic. Voici le fonctionnement pas à pas :

  1. Exécutez n'importe quelle requête dans l'éditeur (par ex. : l'exemple des langages GitHub les plus fréquents vu plus haut).

  2. Une fois les résultats chargés dans la grille du bas, regardez les onglets au-dessus du tableau, cliquez sur l'onglet Visualization (il est juste à côté de « Results », « JSON », « Execution details » et « Execution graph »). 

  3. BigQuery génère automatiquement un graphique de prévisualisation. Souvent, c'est un histogramme ou un nuage de points en fonction de vos données (par ex. : language en abscisse, commit_count en ordonnée).

Sur la droite, le panneau de configuration de la visualisation s'ouvre automatiquement pour que vous puissiez modifier le graphique :

  • Type de visualisation : passez de barres à lignes, nuage de points, carte, etc. (menu déroulant).
  • Dimension (axe x) : choisissez votre colonne de catégories.
  • Mesures (axe y) : choisissez votre colonne numérique.
  • Sélectionnez jusqu'à 5 mesures. Ajoutez plusieurs lignes/barres pour comparer.

Vous pouvez survoler les points/barres pour voir les valeurs exactes, ou zoomer/défiler si le graphique est trop grand.

Tableaux de bord instantanés avec Looker Studio

Autre moyen de visualiser : l'intégration Looker Studio. Une fois votre requête terminée, cherchez le bouton Open in à droite du volet des résultats et sélectionnez Looker Studio.

Une nouvelle onglet s'ouvre et vous devrez valider l'accès aux données. Une fois validé, vos résultats de requête sont déjà préchargés comme source de données dynamique. 

Looker Studio Connection

C'est, à mon sens, le workflow le plus efficace pour créer des projets de portfolio. Vous n'avez pas à vous préoccuper de l'authentification ni des extractions : Google gère la liaison en coulisses. En quelques secondes, vous pouvez glisser-déposer des dimensions dans des graphiques pour déceler des tendances sur vos données GitHub ou taxi, invisibles dans les tables brutes.

Si vous souhaitez comparer Looker Studio à d'autres outils de visualisation et de BI, consultez nos articles Looker Studio vs Power BI et Looker vs Tableau.

Analyse en direct avec Connected Sheets

Parfois, un tableau de bord complet est excessif et vous avez juste besoin de quelques calculs rapides dans un environnement de feuille de calcul familier. Dans le menu Open in , sélectionner Connected Sheets crée un lien en direct entre BigQuery et une feuille Google. Contrairement à un simple copier-coller, cette connexion permet d'actualiser les données directement depuis la feuille.

Connected Sheets

Je trouve cette fonctionnalité très utile quand je dois partager un sous-ensemble de données avec un·e collègue qui n'est pas à l'aise avec le SQL. Elle permet d'utiliser la puissance de BigQuery pour filtrer des téraoctets de données, puis de transmettre une portion propre et gérable à une feuille pour la mise en forme finale ou une analyse en tableau croisant dynamique.

Visualisation avancée avec notebooks et data canvas

Pour celles et ceux qui veulent aller vers la data science, le menu Open in propose aussi une option Notebook. Elle génère un notebook Python (souvent dans Google Colab) déjà configuré pour interroger vos résultats Sandbox via le client Python BigQuery.

Remarque importante : à la différence du reste du Sandbox, lancer un BigQuery Notebook nécessite généralement un compte de facturation actif. En effet, les notebooks démarrent des ressources de calcul Vertex AI. Bien qu'il existe une offre gratuite pour Vertex AI, Google exige un moyen de paiement pour éviter les abus des machines virtuelles sous-jacentes.

Si vous préférez une expérience plus visuelle et sans code, l'option Data canvas permet de voir les relations entre vos jeux de données via une interface graphique. Avec ces outils intégrés, vous pouvez passer d'un dataset brut à un rapport partagé ou un modèle Python en moins de cinq minutes.

Limites critiques du BigQuery Sandbox

Le BigQuery Sandbox est une excellente porte d'entrée pour l'exploration de données, mais il est régi par des garde-fous stricts. Il est important de comprendre ces limites pour éviter toute perte de données inattendue.

Expiration des données et politiques de stockage

La contrainte la plus importante dans le Sandbox est l'expiration obligatoire à 60 jours par défaut des tables. Contrairement aux projets BigQuery standards, où les données peuvent persister indéfiniment, les datasets du Sandbox sont configurés avec un time-to-live de 60 jours pour toutes les partitions et tables.

Cette politique est immuable dans l'offre gratuite : il est impossible de modifier ou supprimer ce délai d'expiration dans les paramètres du dataset. Pour conserver les données au-delà de ces deux mois, il faut passer à un compte payant. 

En outre, le Sandbox limite à 10 Go de stockage actif. Cela peut suffire pour de petits jeux de données, mais des projets plus longs accumulent de l'historique, vous obligeant à supprimer d'anciens enregistrements pour faire de la place une fois le seuil de 10 Go atteint.

Restrictions fonctionnelles

Pour maintenir un environnement léger, Google restreint plusieurs fonctionnalités à haut débit et automatisées. Notamment, des méthodes d'ingestion comme l'API de streaming et le Data Transfer Service (DTS) sont indisponibles dans le Sandbox. Vous ne pouvez donc pas ingérer de télémétrie en temps réel ni automatiser des imports depuis des SaaS tiers comme Google Ads ou Salesforce.

Par ailleurs, des restrictions strictes s'appliquent au Data Manipulation Language (DML) : les projets Sandbox ne peuvent pas exécuter de requêtes DML telles que INSERT, UPDATE et DELETE. 

Enfin, l'absence d'exécution en arrière-plan (requêtes planifiées) implique que toutes les opérations doivent être déclenchées manuellement ; vous ne pouvez pas automatiser vos workflows SQL sur une planification Cron.

Quotas de performances et de capacité

Côté calcul, les projets Sandbox fonctionnent sur la même infrastructure partagée que les offres payantes, en utilisant un pool global de slots (vCPU). Cependant, ils ont une priorité de planification plus basse. Aux heures de pointe, vos requêtes Sandbox peuvent subir une latence accrue, le système priorisant les engagements Flex ou Capacity des clients payants.

Le plafond dur de traitement est la limite de 1 To par mois pour les requêtes. C'est une limite basée sur le volume scanné : si vous lancez une requête sur un vaste dataset public qui scanne 500 Go, vous avez consommé la moitié de votre allocation mensuelle en un clic. 

Vous pouvez suivre cette consommation via l'estimation « Bytes Processed » en haut à droite de l'éditeur avant l'exécution, ou via la section « Quotas » de la Google Cloud Console pour éviter un blocage en milieu de mois.

Comprendre les contraintes du Sandbox aide à définir ses meilleurs cas d'usage. Comme vous ne pouvez pas engendrer de coûts par inadvertance, il devient un formidable laboratoire pour trois types de travaux data.

Cas d'usage du BigQuery Sandbox

D'après mon expérience, le Sandbox est le plus efficace comme zone de préfiguration d'idées. Il permet d'échouer vite et d'itérer sans la charge administrative de la gestion d'un budget cloud.

Apprentissage et développement de compétences

Le cas d'usage le plus évident est de pratiquer la syntaxe SQL et les concepts d'entrepôt de données. Sur votre feuille de route pour apprendre SQL, je recommande de pratiquer dans le Sandbox après les bases dans notre parcours de compétences SQL Fundamentals, en utilisant de vraies données à l'échelle entreprise plutôt que de petits fichiers locaux.

J'ai trouvé le Sandbox particulièrement utile pour maîtriser des fenêtres complexes comme LEAD() et LAG(). Les exécuter sur un million de trajets de taxi aide à comprendre comment les moteurs SQL distribués gèrent le partitionnement et l'ordonnancement. Il s'agit de construire la mémoire musculaire nécessaire à une carrière data exigeante.

Développement de preuves de concept (PoC)

Pour les développeurs, le Sandbox est idéal pour tester des conceptions de schéma avant la production. Je téléverse souvent un échantillon représentatif de mes données pour voir comment la détection automatique de BigQuery gère mes formats de date spécifiques ou mes JSON imbriqués.

Ce workflow est essentiel pour démontrer la valeur à votre équipe. Vous pouvez construire un tableau de bord maquette dans Looker Studio avec des données Sandbox pour montrer le potentiel. Une fois la logique validée et les parties prenantes convaincues, vous pouvez migrer sereinement vers une offre payante où la rétention des données est permanente.

Exploration de données

Le Sandbox est une mine d'or pour l'analyse ad hoc sur des données ouvertes. J'ai un jour exploité les données publiques GitHub pour raconter une histoire sur la productivité des développeurs. En interrogeant des millions de commits, je voulais trouver l'heure exacte où les développeurs sont le plus actifs sur la planète.

Avec la fonction EXTRACT(HOUR FROM ...) dans le Sandbox, j'ai observé un gros pic d'activité autour de 10 h UTC. Ce type de data storytelling est simple dans le Sandbox car vous ne vous souciez pas du coût du scan. Vous pouvez valider la qualité des données ou déceler des tendances cachées sur la météo ou les transactions crypto avant même de construire un pipeline ETL formel.

Du BigQuery Sandbox à la production

Tôt ou tard, vous heurterez les garde-fous du Sandbox. Quand vous avez besoin de conserver vos données plus de 60 jours ou de commencer à ingérer des flux en direct, il est temps de passer au niveau professionnel.

Mettre à niveau le projet

Passer du Sandbox à la production revient à « allumer la lumière ». Il suffit de lier un compte de facturation à votre projet existant. Vous verrez un bouton Upgrade directement dans la console BigQuery, ou vous pouvez le faire depuis la section Billing de la Google Cloud Console.

Set up Billing to Upgrade

En cliquant sur Upgrade, si vous n'avez jamais créé de compte de facturation, vous serez invité·e à en créer un. Une fois créé, liez-le à votre projet.

L'immense soulagement après la mise à niveau, selon moi, est la suppression immédiate de la politique d'expiration des tables. Dès que vous rattachez un compte de facturation et que le projet sort du Sandbox, l'expiration par défaut à 60 jours n'est plus appliquée, et vous pouvez configurer ou supprimer l'expiration pour éviter toute disparition automatique après deux mois.

Vous débloquez aussi l'API de streaming, ce qui permet de passer de l'analyse par lots au traitement temps réel.

Bonnes pratiques de gestion des coûts

Dès la mise à niveau, vous prenez en charge les coûts de stockage et de requêtes. Ma première tâche jour 1 sur tout projet pro est de configurer des alertes de budget. Je les règle à 50 %, 80 % et 100 % de ma dépense mensuelle cible (par ex. 10 $).

Au-delà des alertes, adoptez des réflexes de « Pro » :

  • Max bytes billed : dans les paramètres de requête, vous pouvez fixer un maximum d'octets facturés. C'est un coupe-circuit pour empêcher une requête à 100 $ de s'exécuter.
  • Le « dry run » (validation) : même avec un gros budget, je regarde toujours l'estimation en haut à droite avant de lancer Run.
  • Partitionnement & clustering : apprenez à utiliser PARTITION BY et CLUSTER BY. Même sur de petits jeux, ces habitudes garantissent que, à l'échelle du pétaoctet, vos requêtes restent rapides et peu coûteuses.

Nettoyage des ressources

Si votre exploration est terminée et que vous ne voulez pas passer en production, ne laissez pas le projet traîner. J'ai l'habitude de supprimer les datasets expérimentaux une fois fini. Cela maintient un espace de travail propre et évite toute confusion plus tard.

Si le projet était uniquement destiné à l'apprentissage, vous pouvez le fermer complètement depuis les paramètres du projet. Vous garantissez ainsi une empreinte nulle dans le cloud. Développer ces habitudes de nettoyage maintenant vous servira quand vous gérerez des ressources de production, où le « gaspillage cloud » peut coûter des milliers d'euros.

Conclusion

Le BigQuery Sandbox est la façon la plus fluide d'acquérir des compétences data de niveau entreprise. Il offre un environnement sans risque où vous pouvez explorer des téraoctets de données et créer des tableaux de bord sans jamais fournir de carte bancaire.

L'expiration à 60 jours et la limite d'1 To de requêtes peuvent sembler contraignantes, mais je les vois comme des garde-fous utiles. Elles vous obligent à être efficace en SQL et organisé·e avec vos données. D'après mon expérience, la confiance acquise en pratiquant dans le Sandbox est la meilleure préparation pour une carrière data exigeante.

Prêt·e à mettre ces compétences en pratique ? Commencez le Data Analyst in SQL career track dès aujourd'hui et utilisez le BigQuery Sandbox pour suivre les exercices dans un environnement réel.

FAQ sur BigQuery Sandbox

Ai-je besoin d'une carte bancaire pour utiliser BigQuery Sandbox ?

Non. Contrairement à l'offre gratuite standard ou à l'essai gratuit, le Sandbox vous permet de créer un projet et d'interroger des données immédiatement avec un simple compte Google standard, sans entrer la moindre information de facturation.

Quelles sont les principales limites du BigQuery Sandbox ?

La limite la plus critique est que toutes les tables (ainsi que les vues et partitions) sont soumises à une expiration obligatoire de 60 jours. De plus, vous êtes limité·e à 10 Go de stockage actif et 1 To de données traitées par mois, et vous ne pouvez pas utiliser l'ingestion en streaming, les instructions DML ni le BigQuery Data Transfer Service.

Puis-je visualiser mes données Sandbox ?

Oui. Vous pouvez envoyer les résultats de vos requêtes directement vers Looker Studio pour faire des tableaux de bord, ou vers Connected Sheets pour une analyse dans une feuille de calcul, sans quitter l'écosystème Google.

En quoi le Sandbox diffère-t-il de l'offre gratuite BigQuery ?

Bien que les limites de stockage et de requêtes soient identiques, l'offre gratuite nécessite un compte de facturation (carte bancaire) et permet un stockage permanent. Le Sandbox ne demande aucune carte mais impose une suppression des données au bout de 60 jours.

Comment conserver mes données plus de 60 jours ?

Pour éviter toute perte de données, vous devez mettre à niveau le projet en y liant un compte de facturation. Cela supprime instantanément la politique d'expiration et permet de conserver vos tables de façon permanente.


Aryan Irani's photo
Author
Aryan Irani
Twitter

Je rédige et crée du contenu sur Internet. Expert développeur Google pour Google Workspace, diplômé en informatique de la NMIMS et passionné par l'automatisation et l'intelligence artificielle générative.

Sujets
Google Cloud Platform
SQL
Analyse des données
Visualisation des données

Cours SQL

Cours

Introduction à BigQuery

4 h
12.8K
Débloquez la puissance de BigQuery : maîtrisez ses fondamentaux, exécutez des requêtes et optimisez vos workflows pour une analyse de données efficace.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow