Cours
Data blending — motivation
Aujourd’hui, les entreprises exploitent des données issues de multiples sources pour résoudre leurs problèmes métiers. Collecter et combiner efficacement ces données est devenu une compétence essentielle pour tous les data scientists et data engineers afin d’aider les organisations à prendre des décisions avisées.
Ce tutoriel sur le data blending dans Tableau commence par poser les bases de cette approche puissante de combinaison de données avant d’en explorer les bénéfices. Nous verrons ensuite certaines limites, puis répondrons aux principales questions liées au data blending avec Tableau.
Data blending vs jointures dans Tableau
Dans la réalité, vous manipulerez des informations provenant de plusieurs sources comme des feuilles Excel, SQL, CSV, etc. En tant que data scientist, vous devrez souvent les interconnecter pour dégager des insights métiers globaux.
Tableau permet d’y répondre via différentes approches : jointures, data blending et relations.
Dans cette section, nous allons nous concentrer sur la différence entre les deux premières approches.
Qu’est-ce qu’une jointure dans Tableau ?
Si vous avez déjà travaillé avec SQL, vous connaissez sans doute les principaux types de jointures : left, right, inner, cross et full outer. C’est la même logique dans Tableau.
Ces jointures visent à combiner différentes tables issues d’une même source en s’appuyant sur des relations logiques entre colonnes. Par exemple, tenter de combiner un fichier Excel et une table SQL échouera car ils ne proviennent pas de la même source.
De plus, lors d’une jointure, les colonnes utilisées dans les deux tables doivent être de même type ; toute modification de type de données peut faire échouer la jointure.
Enfin, il n’est pas possible de supprimer les colonnes dupliquées résultant des jointures dans Tableau.
Si vous débutez en SQL, vous pouvez apprendre SQL avec divers cours pour acquérir les compétences fondamentales et interroger vos données en SQL.
Qu’est-ce que le data blending dans Tableau ?
Contrairement aux jointures et aux relations, le data blending agrège des données issues de multiples sources (bases de données, systèmes de BI, solutions cloud, fichiers plats, services web, etc.) pour créer un jeu de données unifié facilitant la visualisation.
Pourquoi utiliser Tableau pour le data blending ?
Tableau est un outil de Business Intelligence sans code, doté d’une interface d’analyse et de visualisation intuitive en glisser-déposer. Cet aspect accessible fait sa différence sur le marché.
En outre, il est rapide et permet de connecter des données issues de multiples sources comme des tableurs, des bases SQL, des services web, qu’elles soient dans le cloud ou on-premise.
Le data blending avec Tableau offre la même flexibilité et facilite la combinaison de données multi-sources sans compétences en programmation.
Si vous utilisez Tableau pour la première fois, notre cours Introduction to Tableau peut vous aider à monter en compétences et à explorer Tableau avec assurance pour créer des tableaux de bord percutants.
Guide pas à pas : comment faire du data blending dans Tableau
Pour bien comprendre le concept de data blending, cette section vous guide pas à pas pour le mettre en pratique avec Tableau.
1. Comprendre le cas d’usage
L’exemple ci-dessous porte sur l’analyse des revenus 2020 et 2021 de deux départements de Zoom.AI, une entreprise d’IA présente dans différentes capitales africaines. Les données sont disponibles à l’adresse suivante.

2. Comprendre les colonnes
On constate que les deux jeux de données partagent le même format et véhiculent la même information. Cependant, les noms des deux premières colonnes diffèrent (Period, Capitals pour le département 1, et Year, Cities pour le département 2).
Tenter d’appliquer des jointures sur ce format échouera car les colonnes impliquées doivent être identiques. Nous verrons comment le data blending permet de combiner intelligemment ces données sans normaliser préalablement les colonnes.
3. Créer les connexions de données
Puisque nos données sont stockées dans des fichiers différents, nous devons les regrouper dans Tableau en créant des connexions de données, comme illustré ci-dessous :

Les données de nos départements apparaissent dans l’onglet Data, en haut à gauche, signe qu’elles ont bien été importées.
4. Démarrer le data blending
Commençons par visualiser la variation du chiffre d’affaires par capitales pour le premier département. Procédez en deux étapes :
- Glissez-déposez la colonne Revenue dans la zone Columns de Tableau.
- Glissez-déposez la colonne Capitals dans la zone Rows de Tableau.

L’objectif est de comparer le chiffre d’affaires des deux départements via le data blending. Pour cela, nous devons répéter le même glisser-déposer pour les données du deuxième département, qui possède la colonne Cities, comme ci-dessous.
Le résultat du département 2 a été repris en orange à des fins de lisibilité.

La visualisation est cassée : pourquoi ?
Parce que nous n’avons pas indiqué à Tableau que la colonne Capitals porte le même niveau d’information que la colonne Cities, ce qui entraîne l’apparition d’astérisques pour Cities dans la visualisation.
C’est là que le data blending est utile : il suffit de préciser que Cities et Capitals désignent la même information. Illustration ci-dessous.

Après correction, une chaîne orange ⛓ apparaît sur la colonne Cities à gauche. Cela signifie que Cities a été utilisée comme champ de liaison.
5. Aller plus loin avec le data blending
Maintenant que vous savez mélanger correctement des données, refaisons la même analyse au niveau année/période. Pour cela, il suffit de créer un lien entre les colonnes Period et Year ; sinon, nous retrouverons le même problème qu’auparavant.

Voilà pour les bases du data blending. Maintenant que vous savez le mettre en œuvre, vous pouvez apprendre à créer des visualisations avancées avec Tableau grâce à notre cours.
Quels sont les avantages du data blending dans Tableau ?
Comme vous l’avez vu dans le tutoriel, le data blending présente de nombreux avantages par rapport aux jointures. En voici quelques-uns :
1. Pas de prétraitement des colonnes
Inutile d’effectuer un prétraitement coûteux des colonnes pour combiner différentes sources : la simple spécification des champs d’intérêt suffit pour que l’algorithme de data blending comprenne comment les combiner efficacement.
2. Une meilleure gestion des différences de granularité
Le data blending offre davantage de flexibilité pour combiner des données de granularités différentes. Imaginons que les revenus de nos départements soient mensuels et non annuels.
Des jointures simples produiraient un résultat biaisé, car les lignes annuelles seraient dupliquées pour chaque mois, comme illustré ci-dessous. Le data blending résout ce problème en agrégeant l’information mensuelle au niveau annuel.

3. Productivité des équipes
Reprenons le cas de granularité précédent. Sans data blending, il faudrait prétraiter les données (agrégations, suppression de doublons, etc.). Sur de grands volumes, ce travail devient vite chronophage.
4. Analyse rapide pour de meilleures décisions
Des décisions pertinentes reposent sur une vue d’ensemble fiable des données. En quelques clics et glisser-déposer, nous avons capté l’essentiel des performances des deux départements. Des jointures mal adaptées pourraient mener à des résultats inexacts et donc à de mauvaises décisions.
Limites du data blending dans Tableau
Malgré ses atouts, le data blending présente aussi des inconvénients :
- Le data blending s’appuie en interne sur une jointure gauche (left join) et ne réalise pas d’autres types de jointures.
- L’ordre compte lorsqu’on mélange des données de granularité différente. La source secondaire doit toujours avoir la plus petite granularité, car c’est elle qui sera agrégée.
- Les agrégats non additifs comme COUNT, MEAN, MEDIAN et SUM sont sensibles au data blending.
Conclusion
Ce tutoriel a présenté les principales motivations d’usage du data blending, certains de ses bénéfices pour les data scientists par rapport aux jointures, ainsi qu’une mise en pratique pour mieux comprendre son fonctionnement.
Nous espérons qu’il vous aura donné les compétences utiles pour approfondir vos analyses métier à partir de multiples sources de données. Pour en savoir plus sur la connexion de données dans Tableau, découvrez notre cours.
FAQ sur le data blending dans Tableau
Pourquoi ai-je un astérisque lors d’un data blending ?
L’une des caractéristiques clés du data blending est que la table secondaire est agrégée pour correspondre à la taille de la table principale. Les astérisques apparaissent parfois pour combler des champs manquants de la table secondaire afin qu’elle ait la même taille que la principale.
Quelle jointure est utilisée pour le data blending dans Tableau ?
Le data blending utilise en interne une jointure gauche (left join), tandis que la fonctionnalité de jointures permet également des jointures right, inner et full.
Combien de sources de données peut-on mélanger avec Tableau ?
Le data blending fonctionne avec deux sources principales : une source primaire et une source secondaire. La source primaire correspond à la table à gauche de l’instruction LEFT JOIN, la source secondaire à celle de droite.