Cours
Les architectures de données centralisées peuvent constituer une stratégie efficace – jusqu’à ce qu’elles peinent à absorber la croissance du volume et de la complexité des données.
Au fur et à mesure que les données montent en charge, ces systèmes centralisés créent des goulots d’étranglement. Reposant sur un point de contrôle unique, ils finissent par saturer. Résultat : des processus lents et des difficultés à extraire rapidement des informations exploitables.
Le data mesh est une approche architecturale qui décentralise la gestion des données et l’aligne sur les domaines métier. Elle donne aux équipes la main sur leurs propres données, pour une meilleure qualité et des insights plus rapides.
Pour en savoir plus sur la gestion des données, découvrez mes autres articles de cette série :
- Qu’est-ce qu’un data fabric ?
- Qu’est-ce que la traçabilité des données ?
- Qu’est-ce que la fédération de données ?
Consultez aussi notre webinar sur comment faire monter en maturité data & IA votre organisation.
Formation de 2 personnes ou plus ?
Qu’est-ce qu’un data mesh ?
Le data mesh est une approche moderne de l’architecture de données qui déplace la gestion des données d’un modèle centralisé vers un modèle décentralisé.
Il met l’accent sur une responsabilité orientée métier, où la gestion des données s’aligne sur les domaines fonctionnels. Cet alignement rend les opérations de données plus scalables et plus flexibles, en capitalisant sur la connaissance et l’expertise de ceux qui sont au plus près de la donnée.
Principes fondamentaux
Au cœur d’un data mesh se trouvent quatre principes clés qui guident sa mise en œuvre et son fonctionnement.
Responsabilité orientée domaine
Les données sont détenues et gérées par les équipes métier les plus proches de la source. Elles comprennent le mieux le contexte et la valeur des données, ce qui en fait les dépositaires idéals de leurs propres actifs.
La donnée comme produit
Considérer la donnée comme un produit implique de définir des interfaces claires, des normes de qualité et une documentation adéquate. Cela facilite la découverte, l’accès et l’utilisation des données, et garantit qu’elles créent de la valeur pour leurs utilisateurs.
Infrastructure en self-service
Les équipes disposent des outils et de l’infrastructure nécessaires pour construire, déployer et gérer leurs produits de données en autonomie. Cela réduit la dépendance aux équipes IT centrales et accélère les opérations.
Gouvernance fédérée et computationnelle
Un modèle de gouvernance fédérée préserve la cohérence, la sécurité et la conformité des données à l’échelle de l’organisation. Il équilibre supervision centrale et autonomie par domaine, permettant d’adapter les pratiques de gouvernance.
Pour aller plus loin, lisez cet article sur ce qu’est la fédération de données
Ensemble, ces principes créent un environnement où les données sont plus accessibles, fiables et créatrices de valeur dans une grande organisation.
Comment fonctionne un data mesh
Les produits de données constituent les briques de base d’un data mesh. Ce sont des actifs réutilisables et facilement retrouvables, qui encapsulent des données propres à un domaine, conçus avec des interfaces claires et des standards de qualité. Ils facilitent l’intégration et l’usage des données à l’échelle de l’organisation.
Par exemple, une équipe commerciale peut créer un produit de données regroupant l’historique d’achat des clients et les tendances de vente. L’équipe marketing pourra alors y accéder facilement et l’exploiter pour affiner ses campagnes.

Le schéma ci-dessus illustre une vue simplifiée d’un data mesh au sein d’une organisation. Des politiques de gouvernance globales guident chacun des quatre départements : ventes, finance, marketing et développement produit. Chaque département est responsable de ses propres données et crée un produit de données complet hébergé sur une plateforme partagée. Les consommateurs de données interagissent avec les produits de données dans toute l’organisation via une couche expérience unifiée du data mesh.
Architecture d’un data mesh
Une architecture de data mesh typique comprend plusieurs composants clés qui fonctionnent de concert :
Produits de données par domaine
Les produits de données sont le cœur du data mesh. Les équipes métier les détiennent et les gèrent. Elles en garantissent la qualité, la maintenance et l’adéquation aux besoins des utilisateurs.
Plateforme d’infrastructure de données
La plateforme d’infrastructure fournit un socle commun pour le stockage, le traitement et la gouvernance. Elle met à disposition les outils et technologies nécessaires au développement et au déploiement des produits de données.
Gouvernance des données
La gouvernance définit des politiques et des standards en matière de qualité, de sécurité et d’accès pour garantir des pratiques cohérentes et conformes. C’est essentiel pour instaurer la confiance dans les données à l’échelle de l’organisation. Pour en savoir plus, suivez ce cours sur les concepts de gouvernance des données.
Couche d’expérience du data mesh
La couche d’expérience du data mesh est l’interface conviviale qui permet de découvrir, d’accéder et de consommer les produits de données. Elle garantit aux consommateurs de données de trouver et d’utiliser facilement ce dont ils ont besoin. On peut la voir comme une boutique où retrouver tous les produits de données de l’organisation.
Mettre en place un data mesh
Supposons que nous souhaitions implémenter un data mesh dans notre organisation. Par où commencer ? Parcourons quelques étapes clés.
Identifier les domaines
Commencez par délimiter clairement les domaines métier. Cet alignement facilite l’attribution de la responsabilité des données aux bonnes équipes. Repérez les pôles distincts : ventes, marketing, finance, développement produit, etc.
Définir la responsabilité sur les données
Confiez la responsabilité des données aux équipes de domaine concernées. Elles sont garantes de la qualité et de la gestion de leurs propres données.
Construire des produits de données
Définissez et développez des produits de données adaptés aux besoins des consommateurs de données : collaborateurs, investisseurs ou autres parties prenantes. Assurez-vous qu’ils soient faciles à trouver, bien documentés et réutilisables pour maximiser leur valeur.
Par exemple, l’équipe commerciale peut créer un produit de données avec l’historique des achats clients et les tendances de vente, ensuite utilisé par l’équipe marketing, consommatrice de données dans cet exemple.
Fédérer la gouvernance
Instaurer un modèle de gouvernance fédérée pour maintenir la cohérence et la conformité. Cette approche permet des pratiques de gouvernance propres à chaque domaine tout en respectant des standards globaux.
Notre modèle doit équilibrer supervision centrale et autonomie des domaines. Consultez cette antisèche sur les fondamentaux de la gouvernance des données pour quelques conseils.
Mettre en place une infrastructure en self-service
Dotez les équipes des outils et plateformes nécessaires pour gérer leurs produits de données en autonomie. Donnez-leur accès à une plateforme d’infrastructure commune incluant stockage, traitement, gestion et lignage des données (lire aussi cet article sur ce qu’est la traçabilité des données). Cela réduit la dépendance aux équipes IT centrales et accélère les opérations.
La transition vers une architecture de data mesh peut paraître ambitieuse, mais les bénéfices peuvent être considérables pour les grandes organisations.
Outils pour les data meshes
Un data mesh nécessite souvent des outils permettant aux équipes métier de construire, déployer et gérer leurs produits de données en autonomie. Ils vont des plateformes de stockage et de traitement à des solutions de gouvernance et de data discovery.
Outils payants
Voici quelques outils populaires utilisés dans les data meshes :
|
Outil |
Description |
Cloud |
Fonctionnalités clés |
|
Plateforme analytique unifiée intégrant data engineering, data science et analytics |
Oui |
Delta Lake pour le stockage, MLflow pour le machine learning, Databricks SQL pour l’analyse |
|
|
Plateforme cloud pour data warehouse, data lakes et partage de données |
Oui |
Scalabilité, partage de données, collaboration sécurisée, Snowflake Data Marketplace |
|
|
Plateforme de gouvernance et de catalogue de données alignée avec les principes du data mesh |
Oui |
Catalogue de données, gouvernance, confidentialité et gestion de la qualité |
Outils open source
Explorons maintenant quelques outils open source populaires pour les data meshes :
|
Outil |
Description |
Cloud |
Fonctionnalités clés |
|
Plateforme distribuée de diffusion d’événements |
Oui |
Streaming de données en temps réel, scalabilité |
|
|
Système d’automatisation et d’ordonnancement de workflows |
Oui |
Orchestration de workflows de données complexes |
|
|
Outil de transformation des données pour l’analytics engineering |
Oui |
Transformations en SQL, gestion de versions |
Ces outils offrent un ensemble de capacités pour mettre en œuvre efficacement une architecture de data mesh. Il est important d’évaluer plusieurs options afin de constituer une boîte à outils adaptée aux besoins spécifiques de votre organisation.
Avantages d’un data mesh
Un data mesh apporte de la scalabilité en gérant mieux la croissance des volumes et de la complexité que les approches centralisées. Les organisations peuvent ainsi traiter de grandes quantités de données sans goulots d’étranglement ni perte de performance.
La décentralisation de la gestion des données favorise l’agilité : les organisations répondent plus vite aux besoins métier et à l’évolution des marchés. Cette flexibilité permet aux équipes d’adapter leurs stratégies de données en temps réel et de garder une longueur d’avance dans un contexte mouvant.
Dans un data mesh, la qualité des données progresse grâce à la responsabilité par domaine. Les équipes, détentrices de la connaissance la plus pertinente, gèrent et maintiennent leurs produits de données. Cette approche assure exactitude, fiabilité et alignement avec les objectifs métier.
De plus, l’architecture data mesh stimule la collaboration interdomaines et le partage de connaissances. En brisant les silos, les équipes capitalisent sur l’expertise des autres, améliorent la prise de décision et les résultats globaux.
Les défis de l’adoption d’un data mesh
Adopter un data mesh comporte des défis que les organisations doivent anticiper.
Un enjeu majeur réside dans le changement de culture nécessaire. Plutôt qu’une équipe centrale responsable de toutes les données, le data mesh impose une décision et une responsabilité distribuées. Cette évolution suppose l’adhésion à tous les niveaux et peut rencontrer des résistances chez ceux habitués au contrôle central.
La complexité technique de la mise en œuvre peut également poser problème. De nouveaux outils, processus et compétences sont requis, impliquant des investissements en formation et en infrastructure. Les organisations doivent s’assurer de disposer des ressources et de l’expertise nécessaires pour réussir la transition.
Trouver le bon équilibre entre autonomie des domaines et gouvernance centrale constitue un autre défi. Si les équipes ont besoin de liberté pour innover et gérer leurs produits de données, une gouvernance centrale reste indispensable pour la cohérence, la sécurité et la conformité. Atteindre cet équilibre exige planification et coordination afin de définir un cadre conciliant besoins spécifiques et objectifs globaux.
Quand envisager un data mesh
Les grandes organisations aux paysages de données vastes et hétérogènes trouvent souvent les approches centralisées insuffisantes pour passer à l’échelle. Dans ces environnements où volumes et complexité ne cessent d’augmenter, un data mesh offre une alternative décentralisée plus adaptée.
Les organisations évoluant en mode agile, où les réponses rapides aux changements de marché ou aux attentes clients sont essentielles, bénéficieront aussi de la flexibilité du data mesh. Sa nature décentralisée permet d’adapter plus vite les exigences métier, gagnant ainsi en agilité et en réactivité.
Un data mesh est particulièrement pertinent lorsque la responsabilité des données est déjà naturellement distribuée entre équipes ou départements. En alignant la gestion des données sur la structure existante, il donne aux domaines la responsabilité de leurs produits de données. Cette détention distribuée renforce l’accountability et garantit que les données soient gérées par ceux qui en maîtrisent le mieux le contexte.
En revanche, les organisations qui dépendent fortement de pratiques entièrement standardisées et homogénisées, ou qui ne disposent pas de domaines métier distincts, tireront moins parti d’un data mesh. Sans frontières claires ni décision décentralisée, les bénéfices d’agilité et de responsabilité par domaine risquent de se perdre. Une approche centralisée sera alors plus appropriée.
Data mesh vs data fabric
Le data fabric est une approche plus centralisée visant à créer un environnement de données unifié à l’échelle de l’organisation. Il intègre diverses sources et systèmes au sein d’une plateforme cohérente, offrant une vue unifiée des données aux utilisateurs.
Les data fabrics mettent souvent l’accent sur l’intégration, la gouvernance et la sécurité des données pour assurer cohérence et fiabilité à l’échelle de l’entreprise. Pour en savoir plus, lisez cet article sur ce qu’est un data fabric.
Data mesh et data fabric répondent aux défis modernes de la gestion des données, mais par des voies différentes. Le data mesh privilégie la décentralisation et la responsabilité par domaine, tandis que le data fabric met l’accent sur la centralisation et l’intégration.
Le choix entre ces approches dépend de facteurs tels que la structure de l’organisation, le paysage de données et les objectifs métier.
|
Aspect |
Data mesh |
Data fabric |
|
Responsabilité |
Responsabilité orientée domaine ; données détenues par les équipes métier |
Responsabilité centralisée ; données détenues de manière centrale |
|
Intégration des données |
Décentralisée ; intégration gérée par les équipes métier |
Centralisée ; intégration assurée par une plateforme centrale |
|
Gouvernance |
Modèle de gouvernance fédérée ; autonomie par domaine |
Gouvernance centralisée ; standardisée à l’échelle de l’organisation |
|
Qualité des données |
Responsabilité par domaine ; qualité améliorée |
Gouvernance centralisée ; qualité homogène garantie |
|
Accès aux données |
Infrastructure en self-service ; responsabilise les équipes métier |
Contrôle d’accès centralisé ; géré par l’IT centrale |
Conclusion
Le paradigme du data mesh répond aux limites des architectures centralisées dans les grandes organisations. En décentralisant la gestion des données et en l’alignant sur les domaines métier, il améliore scalabilité, agilité, qualité des données et capacité d’innovation.
Pour approfondir la gestion des données, découvrez ces ressources :
Formation de 2 personnes ou plus ?
Je suis titulaire d'un doctorat et j'ai 13 ans d'expérience dans le traitement des données dans un environnement de recherche biologique. Je crée des logiciels dans plusieurs langages de programmation, notamment Python, MATLAB et R. Je suis passionné par le partage de mon amour de l'apprentissage avec le monde.
