Les organisations les plus performantes s’appuient aujourd’hui massivement sur les données pour décider. Beaucoup d’entre elles, véritablement à l’aise avec les données, génèrent chaque jour des millions de lignes exploitées et analysées par de multiples équipes. L’un des défis clés pour donner à chacun les moyens d’accéder aux données et de travailler avec consiste à garantir que ces données soient collectées, fiables, dignes de confiance, actionnables et facilement découvrables.
Pour naviguer ces environnements de données complexes, de nombreuses organisations ont développé — et parfois ouvert — des technologies internes, appelées outils de data discovery.
Dans un webinaire récent, Ramnath Vaidyanathan, VP of Product Research chez DataCamp, explique comment passer d’un état « réactif aux données », où personne n’a les compétences ni l’accès pour travailler avec, à un état « fluide en données », où chacun a accès et maîtrise les données pour prendre des décisions basées sur les données. Les organisations peuvent accroître leur maturité data en investissant selon le cadre IPTOP : infrastructure, personnes, outils, organisation et processus. À mesure qu’elles démocratisent l’accès aux données via des investissements d’infrastructure, elles doivent offrir une découverte des données simple grâce à des outils de data discovery.
Les données ne servent à rien si l’on ne peut pas y accéder, si l’on ne comprend pas leur contexte, et si l’on ne trouve pas ce dont on a besoin. C’est pourquoi les outils de data discovery sont essentiels. Ramnath Vaidyanathan, VP of Product Research chez DataCamp

Comment les entreprises data fluent utilisent les outils de data discovery
De nombreuses entreprises pilotées par les données ont intégré des outils de data discovery à leur infrastructure data. Examinons les motivations et moteurs derrière des outils emblématiques comme Uber Databook et Lyft Amundsen.

Défis de la data discovery à prendre en compte
Un défi majeur de la data discovery touche à la productivité et à la conformité. Lyft expliquait être confronté à ces enjeux alors que le volume de ses données croissait de manière exponentielle, avec des perspectives similaires pour au moins les dix années suivantes. Lors du développement d’Amundsen, ils ont constaté qu’environ 25 % du temps des analystes était consacré à la recherche de données. Ils ont également vu les exigences de conformité se durcir dans les pays desservis.
Uber faisait des constats similaires en s’étendant au-delà du covoiturage vers des services comme Uber Eats, Uber Freight et Jump Bikes. Au moment de développer Databook, Uber comptait plus de 15 millions de trajets par jour et 18 000 employés sur différentes équipes. Autre difficulté : ses données existaient sous de multiples formes, notamment Hive, Presto et Vertica. Les analystes devaient pouvoir accéder efficacement à ces sources variées et les comprendre pour atteindre une véritable culture des données.
Facebook a conçu sa plateforme de data discovery Nemo pour assurer des données de haute qualité et fiables, alors que leur volume et leur complexité augmentaient selon les rôles et les zones géographiques. En raison des enjeux de confidentialité associés aux données analysées, Facebook devait également répondre à de fortes contraintes de conformité lors de la mise à disposition de tables à des analystes spécifiques.
John Bodley d’Airbnb déclarait lors d’une conférence en 2017 : « À mesure qu’Airbnb grandit, les défis liés au volume, à la complexité et à l’obscurité des données s’amplifient. » Les collaborateurs trouvaient ainsi souvent des données « cloisonnées, inaccessibles et sans contexte ». Résultat : des tables en double étaient créées et les données n’étaient pas utilisées si elles n’inspiraient pas confiance. Airbnb a développé Dataportal pour rendre la découverte des données bien plus efficace en supprimant ces freins à l’analyse productive.
Ces défis sont répandus, indépendants du secteur, et concernent toute organisation souhaitant généraliser les décisions fondées sur les données. Le besoin de données facilement découvrables devient crucial pour qui veut développer sa culture des données.
Les quatre objectifs clés des outils de data discovery
Maintenant que les défis sont posés, voyons comment différents outils y répondent. Uber résume les objectifs d’une plateforme de data discovery réussie en quatre volets :
- Extensibilité : capacité à ajouter facilement des métadonnées, des stockages et des entités aux tables
- Accessibilité : capacité à accéder à toutes les métadonnées de façon programmatique
- Scalabilité : capacité à supporter un grand nombre de requêtes de lecture simultanées
- Puissance : capacité à gérer des lectures et écritures à travers plusieurs centres de données
Atteindre ces objectifs devient d’autant plus critique que les organisations gagnent en maturité data. À mesure que l’échelle des données augmente, chacun de ces volets prend de l’importance.
Lyft et Airbnb misent sur des métadonnées riches
L’équipe d’ingénierie de Lyft affirme que « les métadonnées sont le graal des applications de demain ». Elle distingue deux sous-catégories. La première est un ensemble descriptif composé du contexte applicatif (ce que les humains doivent savoir pour travailler avec les données), des comportements (qui possède un jeu de données et quels sont ses usages courants) et des évolutions (comment le jeu de données change dans le temps). La seconde porte sur les données décrites, c’est-à-dire toute donnée stockée dans l’organisation, sous n’importe quel format : data stores, tableaux de bord, flux de données, etc.
Lors de la conception de Dataportal, la plateforme de data discovery d’Airbnb, les métadonnées ont constitué un apport central à la chaîne de valeur data. Avant son déploiement, beaucoup de collaborateurs n’avaient pas confiance dans les données utilisées faute de contexte et de métadonnées. Airbnb soutient que « la compréhension de l’écosystème data dans son ensemble — de la production d’un log d’événement jusqu’à sa consommation en visualisation — crée plus de valeur que la somme de ses parties ».

Source : Airbnb
Garantir des résultats de recherche pertinents grâce à la data discovery
Une fois le contexte posé, la data discovery repose sur une recherche efficace. Quelle que soit la fiabilité et la clarté d’une table, une plateforme de data discovery n’est utile que si les analystes trouvent vite ce dont ils ont besoin.
La page d’accueil de Lyft Amundsen permet de rechercher des tables en langage naturel et met en avant les tables les plus utilisées dans l’organisation pour un accès rapide. Les analystes peuvent également laisser un retour sur une table afin d’affiner les résultats de recherche futurs.
La solution de Facebook, Nemo, offre des filtres par usage, contraintes de confidentialité et fraîcheur des données, tout en tirant parti de l’expertise de Facebook en traitement du langage naturel : les utilisateurs peuvent saisir des questions dans la barre de recherche pour obtenir des tables pertinentes.
Uber Databook propose des capacités de filtrage similaires, avec des filtres par nom, propriétaire, colonne et colonnes imbriquées. Uber s’appuie sur Elasticsearch pour délivrer des résultats rapidement et efficacement.
Vers la démocratisation des données grâce à la data discovery
La montée en culture des données et la découvrabilité des données vont de pair : les analystes doivent accéder facilement aux données pour prendre des décisions éclairées par les données.

Les organisations au faible niveau de maturité data devraient d’abord développer les compétences et la culture data, et renforcer l’infrastructure. Mais à mesure qu’elles progressent et étendent l’accès aux données, rendre la data discovery extensible et scalable devient crucial pour devenir une organisation véritablement pilotée par les données. Pour un tour d’horizon complet des leviers de progression de la maturité data, regardez notre webinaire sur le chemin vers la culture des données ou passez l’évaluation de maturité data.