Accéder au contenu principal

Les 3 grandes tendances de l’infrastructure data en 2021

Prenez une longueur d’avance en data engineering avec les plateformes d’orchestration, les moteurs de découverte de données et les data lakehouses.
Actualisé 18 sept. 2026  · 3 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Le data engineering reste une priorité stratégique pour les entreprises et, en 2021, le domaine de l’infrastructure data connaît des évolutions majeures. Lors d’un webinaire récent, Maksim Percherskiy, Data Engineer à la Banque mondiale et ex-Chief Data Officer de la ville de San Diego, a mis en avant trois tendances à suivre de près : les plateformes d’orchestration de données, les moteurs de découverte de données et les data lakehouses.

Plateformes d’orchestration de données

Si les plateformes d’orchestration existent depuis des années pour gérer les systèmes et logiciels, l’orchestration de données est un concept plus récent qui abstrait l’accès aux données à travers les systèmes de stockage, virtualise les données et les expose aux applications basées sur les données. Les plateformes d’orchestration aident les entreprises à devenir plus data-driven en combinant des données cloisonnées issues de multiples stockages et en les rendant exploitables. Citons par exemple Apache Airflow, Prefect, Luigi et Stitch, compatibles avec les approches logicielles modernes comme le contrôle de version, le DevOps et l’intégration continue.

Le cours de DataCamp Introduction to Airflow in Python est un excellent point de départ pour apprendre à mettre en œuvre et planifier des workflows ETL et de data engineering de manière simple et reproductible.

Moteurs de découverte de données

Avec la croissance des volumes de données, il est logique que les entreprises investissent davantage pour aider leurs équipes à trouver les données pertinentes, les documenter et réduire les ressaisies. Des moteurs de découverte comme Amundsen de Lyft et Databook d’Uber visent à accroître la productivité des utilisateurs de données en proposant une interface de recherche. Ces outils s’appuient sur la métadonnée, ce qui soutient à la fois la productivité et la conformité en permettant à l’infrastructure data de passer à l’échelle au rythme de la croissance. L’objectif de la découverte de données est de rendre les données plus FAIR : findable, accessible, interoperable et reusable.

Data lakehouse

Les data lakes et data warehouses répondent à des usages différents et à des publics distincts. Par exemple, les data warehouses sont généralement exploités par des analystes pour la business intelligence : ils contiennent des tables aplaties explicitement préparées pour leurs besoins. À l’inverse, les data lakes sont déployés et maintenus par des data engineers qui les intègrent aux pipelines de données. Les data scientists travaillent davantage avec les data lakes, qui offrent des données plus variées et plus récentes.

Les data lakehouses sont exactement ce que le nom suggère : une combinaison de data lakes et de data warehouses. Des plateformes comme Snowflake et Databrick's Delta Lake proposent des solutions pour offrir une source unique de vérité, en réunissant les avantages des deux mondes. Les data lakehouses appliquent aux data lakes les structures et capacités de gestion des data warehouses, généralement plus économiques pour le stockage, tout en conservant le schéma et le versioning des données. Avec les data lakehouses, les data scientists peuvent mener à la fois des projets de machine learning et de business intelligence.

Source : Databricks

Ces trois tendances seront déterminantes pour faire passer l’infrastructure data à l’échelle en 2021. Elles sont utiles aussi bien aux entreprises nées de la donnée qu’à celles qui peinent encore à intégrer durablement la donnée dans leurs processus. Découvrez comment les grands groupes peuvent opérationnaliser leurs données et devenir véritablement data-driven.

Sujets
Ingénierie des données