Cours
Dans les entreprises modernes, la pression augmente pour réduire le délai entre la collecte des données et leur exploitation. Il faut une approche rapide pour accélérer le passage de la collecte à l'analyse, à l'intelligence artificielle et à la mise en œuvre de l'apprentissage automatique.
Les architectures ETL (extract, transform, load) traditionnelles peinent à répondre aux exigences techniques du big data et de l'analyse en temps réel. Une nouvelle architecture de gestion des données, dite zero-ETL, a donc émergé pour minimiser, voire supprimer, le besoin de processus ETL.
Qu'est-ce que le Zero-ETL ?
Le Zero-ETL désigne un ensemble d'intégrations conçues pour éliminer ou réduire la nécessité de créer des pipelines de données ETL. En permettant d'interroger différents silos sans déplacer physiquement les données, le Zero-ETL vise à rationaliser le traitement des données et à améliorer l'efficacité.
Le terme « zero-ETL » a été présenté lors de la conférence AWS re:Invent en 2022, quand l'intégration d'Amazon Aurora avec Amazon Redshift a été annoncée. Depuis, AWS a fait évoluer ce concept, principalement via des services permettant l'analyse et la transformation des données directement dans les plateformes, sans pipelines ETL séparés.
Dans un pipeline ETL classique, un professionnel des données (data engineer ou data scientist) collecte des données depuis une source, comme une base de données, une API, un fichier JSON ou XML.
Après l'extraction, diverses transformations sont appliquées : combiner des jeux de données, effectuer des calculs, fusionner des tables ou supprimer des informations non essentielles telles que des horodatages ou des identifiants utilisateur.
Enfin, les données transformées sont chargées dans une plateforme pour des analyses complémentaires, comme l'apprentissage automatique, l'analyse statistique ou la visualisation de données. Ce processus est coûteux en temps, en budget et en effort, du fait de sa complexité.

Architecture ETL traditionnelle
Prenons une analogie : en photographie argentique, on capture une image sur pellicule (extraction), on la développe en chambre noire (transformation), puis on l'agrandit et on l'expose (chargement). À l'inverse, imaginez un appareil photo numérique où la prise de vue, le développement et l'affichage (ou la diffusion immédiate en direct) se font au même endroit.
De même, le Zero-ETL transforme le traitement des données en supprimant l'extraction, la transformation et le chargement. Cette architecture limite les mouvements de données et permet de les transformer et de les analyser au sein d'une seule et même plateforme.
Le Zero-ETL promet des analyses en temps réel ou à très faible latence pour les data scientists et les parties prenantes métiers.
Comment fonctionne le Zero-ETL ?
Le Zero-ETL simplifie l'intégration des données en reliant directement les sources aux entrepôts et lacs de données, pour rendre les données disponibles en temps réel pour l'analyse et le reporting. Cela s'appuie sur plusieurs technologies et services cloud, parmi lesquels :
Réplication de bases de données
La réplication consiste à copier et synchroniser les données d'une base vers une autre.
Dans un contexte Zero-ETL entre une base et un entrepôt, elle garantit la mise à jour automatique des données dans l'entrepôt en temps réel ou quasi-réel, supprimant le besoin de processus ETL distincts. C'est le cas de l'intégration entre Amazon Aurora et Amazon Redshift.
Requêtes fédérées
Les requêtes fédérées permettent d'exécuter des requêtes sur plusieurs sources (bases de données, entrepôts, lacs) sans déplacer ni répliquer les données dans un emplacement unique.
Dans le Zero-ETL, elles offrent aux professionnels la possibilité d'accéder et d'analyser directement des données stockées sur différentes plateformes, proposant une vue unifiée sans la lourdeur d'un ETL traditionnel.
Streaming de données
Le streaming désigne le traitement et le transfert continus de données en temps réel, à mesure qu'elles sont générées.
En Zero-ETL, il s'agit de capter des données issues de multiples sources (bases, objets connectés, applications) et de les envoyer immédiatement vers un entrepôt ou un lac de données. Les données sont ainsi quasi instantanément disponibles pour l'analyse et l'interrogation, sans traitements ETL par lots.
Analytique in-place
Pour réaliser de l'analytique in-place, les transformations nécessaires sont intégrées à la plateforme de données cloud, comme un data lake. Cette intégration permet de traiter et d'analyser les données en temps réel là où elles résident, réduisant la latence et améliorant l'efficacité.
Par exemple, des données non structurées collectées en JSON ou XML seront transformées et analysées via des technologies « schema-on-read » au sein même du lac, sans étapes intermédiaires de déplacement vers un stockage prêt pour le reporting.

Exemple d'architecture Zero-ETL
Les différents composants du Zero-ETL
Même si l'architecture Zero-ETL peut laisser penser qu'il n'y a pas de composants ou qu'ils sont unifiés, différents éléments et services peuvent être mobilisés selon les besoins analytiques et les ressources. Parmi eux :
Services d'intégration directe des données
Les fournisseurs cloud proposent des services spécialisés qui automatisent l'intégration Zero-ETL. Comme indiqué, AWS offre l'intégration d'Amazon Aurora avec Amazon Redshift, où les données écrites dans Aurora sont automatiquement répliquées dans Redshift. Ces services gèrent en interne la réplication et la transformation, supprimant le besoin d'ETL traditionnel.
Change Data Capture (CDC)
La technologie CDC est un pilier des architectures Zero-ETL. Elle surveille et capture en continu les changements (insertions, mises à jour, suppressions) dans les bases sources et les réplique en temps réel vers les systèmes cibles.
Pipelines de streaming
Ces pipelines transfèrent les données en temps réel de sources variées vers le système cible. Des plateformes comme Amazon Kinesis et Apache Kafka assurent un flux continu et des mises à jour à faible latence.
Informatique serverless
Les architectures serverless soutiennent le Zero-ETL en gérant automatiquement l'infrastructure et en adaptant les ressources à la demande. Des services comme AWS Lambda et Google Cloud Functions illustrent cette approche en exécutant des fonctions en réponse à des événements de données.
Technologies schema-on-read
En appliquant le schéma à la lecture plutôt qu'à l'écriture, le schema-on-read offre une grande flexibilité pour traiter des formats non ou semi-structurés comme JSON et XML. Cette approche réduit le besoin de schémas prédéfinis et permet une analyse dynamique.
Fédération et abstraction des données
Le Zero-ETL facilite l'ingestion et la duplication de données issues de différentes sources grâce à la fédération de données. Il s'appuie sur des data lakes et la virtualisation interplateformes pour créer une couche d'objets abstraite, simplifiant la duplication sans recourir à d'importantes transformations ni à des mouvements de données. La virtualisation permet d'accéder et d'interroger des données réparties comme si elles se trouvaient au même endroit.
Data lakes
Dans une approche Zero-ETL, les transformations et analyses sont réalisées au sein de la plateforme de données. On peut ainsi gérer des données non structurées dans divers formats (vidéo, images, texte, numérique) dans un stockage multi-format, tel qu'un data lake, souvent sans transformations intermédiaires.
Avantages et inconvénients du Zero-ETL
Le Zero-ETL apparaît comme une voie prometteuse pour gagner en efficacité en data science. Il convient toutefois d'en peser les avantages et les limites avant de se lancer.
Avantages du Zero-ETL
Le Zero-ETL apporte plusieurs bénéfices à la gestion et à l'analyse des données, notamment :
- Ingénierie simplifiée : le Zero-ETL allège l'architecture des pipelines en intégrant extraction, transformation et chargement en un seul processus, voire en les supprimant. Cette rationalisation réduit la complexité et accélère l'analytique et le machine learning, permettant aux data scientists d'obtenir des insights plus vite.
- Analyses en temps réel : le Zero-ETL permet des analyses immédiates en fusionnant les phases d'extraction, de transformation et de chargement au sein de la plateforme. Dès qu'une donnée est collectée, elle peut être analysée, facilitant des décisions rapides et des insights opportuns.
Inconvénients du Zero-ETL
Malgré ses atouts, le Zero-ETL comporte aussi des défis :
- Diagnostic complexe : identifier et résoudre les problèmes peut être plus difficile lorsque tous les traitements se font dans une étape intégrée. Isoler la cause demande une compréhension approfondie de l'ensemble du système.
- Courbe d'apprentissage plus raide : la disparition des pipelines ETL traditionnels peut réduire le besoin de rôles d'ingénierie intermédiaire. Les data scientists et ingénieurs ML doivent alors reprendre des tâches auparavant gérées par des data engineers, ce qui alourdit la prise en main.
- Dépendance au cloud : les solutions Zero-ETL sont généralement conçues pour le cloud. Les organisations qui ne sont pas prêtes à intégrer ces technologies peuvent rencontrer des obstacles, notamment en matière de sécurité, de conformité et de contrôle.
Cas d'usage typiques du Zero-ETL
Le Zero-ETL apporte des avantages significatifs dans divers scénarios de traitement et d'analyse en temps réel. Exemples :
- Analytique en temps réel : le Zero-ETL supprime les traitements par lots et offre un accès instantané aux nouvelles données, comme les interactions clients, les comportements utilisateurs ou les flux de circulation. Les décisions basées sur les données sont prises immédiatement, améliorant réactivité et efficacité opérationnelle.
- Transfert de données instantané : dans une architecture Zero-ETL, la suppression du pipeline ETL accélère fortement, voire rend instantanée, la duplication vers un autre entrepôt auquel les data scientists peuvent accéder.
- Machine learning et IA : le Zero-ETL est particulièrement pertinent lorsque la fraîcheur des données est critique. Le streaming et la disponibilité immédiate permettent d'entraîner et de mettre à jour en continu les modèles, améliorant la précision et la pertinence des prédictions et insights.
Comparaison Zero-ETL vs ETL traditionnel
Le tableau suivant propose une comparaison détaillée entre le Zero-ETL et les processus ETL traditionnels.
|
Zero-ETL |
ETL traditionnel |
|
|
Virtualisation des données |
Recourt à des technologies de virtualisation pour faciliter la duplication des données entre entrepôts. |
La virtualisation peut être redondante ou difficile à mettre en œuvre car, en ETL, les données sont déplacées de la transformation au chargement. |
|
Surveillance de la qualité |
Approche largement automatisée de la gestion des données ; des problèmes de qualité peuvent en découler. |
La nature discrète du pipeline en ETL facilite le suivi et la remédiation de la qualité des données. |
|
Diversité des types de données |
Les data lakes cloud acceptent de multiples types et formats sans contrainte architecturale. |
L'architecture d'extraction et de transformation peut limiter les types de données (un effort d'ingénierie supplémentaire est requis pour chaque type). |
|
Déploiement en temps réel |
L'analyse peut être effectuée sur la plateforme avec une latence minimale entre génération, transformation et analyse. |
Le traitement par lots planifié empêche l'analyse en temps réel. |
|
Coûts et maintenance |
Plus économique et plus simple à maintenir grâce à moins de composants de calcul et de code. Les transformations et le chargement se font à la demande. |
Plus coûteux, nécessitant davantage de ressources de calcul et des professionnels expérimentés. |
|
Passage à l'échelle |
Plus rapide et moins onéreux grâce à la suppression du matériel intermédiaire pour les mouvements de données. |
Peut être lent et coûteux en raison du besoin accru de matériel plus performant et d'optimisations pour gérer davantage de sources. |
|
Mouvements de données |
Nuls ou minimaux. |
Des mouvements sont requis car le pipeline est discret et les données doivent être transférées vers l'étape de chargement. |
Zero-ETL vs autres techniques d'intégration
Ci-dessous, une comparaison du Zero-ETL avec d'autres approches d'intégration, en soulignant leurs points communs et différences clés.
Zero-ETL vs ELT
- Points communs : le Zero-ETL et l'ELT (Extract, Load, Transform) réduisent le temps et la complexité en repoussant la transformation après le chargement dans le système cible. L'ELT est vu comme un précurseur du Zero-ETL, ayant posé les bases du report des transformations.
- Principales différences : le Zero-ETL supprime la zone de transit intermédiaire requise en ELT, réduisant la latence et améliorant la disponibilité en temps réel. Il simplifie davantage le pipeline en diminuant les étapes et l'infrastructure nécessaires.
Zero-ETL vs API
- Points communs : le Zero-ETL et les API permettent d'interroger plusieurs sources, facilitant l'intégration entre systèmes.
- Principales différences : le Zero-ETL est avant tout une technologie sans code, nécessitant peu de développement manuel pour intégrer et gérer les données. À l'inverse, les API requièrent du code spécifique pour se connecter et interagir avec les sources. De plus, la nature codée des intégrations via API peut accroître l'exposition à des failles si elles ne sont pas correctement sécurisées.
Principaux outils Zero-ETL
Comme nous l'avons vu, le Zero-ETL est une approche de gestion des données de pointe, popularisée par AWS et désormais adoptée par d'autres clouds.
Voici un aperçu des principaux outils Zero-ETL disponibles aujourd'hui :
Outils Zero-ETL d'AWS
- Intégration directe Aurora et Redshift : AWS a intégré Amazon Aurora et Amazon Redshift pour activer l'analytique en temps réel sans ETL traditionnel.
- Redshift Spectrum : permet d'exécuter des requêtes SQL sur des exaoctets de données dans Amazon S3 sans chargement ni transformation. Idéal pour interroger des données structurées et non structurées.
- Amazon Athena : solution d'analytique serverless qui traite de grands volumes pour de l'analytique in-place, y compris en machine learning et IA, en utilisant SQL ou Python pour se connecter aux flux cloud.
- Amazon Redshift Streaming Ingestion : ingestion en temps réel depuis Amazon Kinesis Data Streams ou Amazon MSK, adaptée à des charges ML intensives en temps réel.
Outils Zero-ETL d'autres clouds
Au-delà d'AWS, d'autres fournisseurs offrent des plateformes unifiées avec des capacités Zero-ETL :
- Snowflake : permet de créer des entrepôts et lacs gérant des données non structurées avec une architecture Zero-ETL. Snowflake simplifie les workflows et prend en charge l'analytique temps réel et le machine learning.
- Google BigQuery : exécute des requêtes SQL complexes sur de vastes volumes en temps réel, avec une intégration fluide aux services Google Cloud. BigQuery est conçu pour traiter efficacement d'immenses volumes.
- Microsoft Azure Synapse Analytics : ingestion et analyse en temps réel via une plateforme unifiée, pour l'analytique avancée et la BI. Synapse s'intègre à de nombreux services Azure.
Conclusion
La suppression des phases ETL traditionnelles dans les pipelines d'analytique et de machine learning marque un changement profond de paradigme pour l'ingénierie des données. L'adoption d'une architecture Zero-ETL apporte des gains substantiels en vitesse, sécurité et scalabilité.
Mais cette évolution s'accompagne de défis. Les compétences d'ingénierie data classiques pourraient être moins sollicitées, tandis que les analystes, scientifiques des données et ingénieurs ML devront acquérir des notions et compétences d'intégration plus avancées.
Le Zero-ETL répond d'abord aux besoins des analystes et des ingénieurs ML, laissant entrevoir un avenir où ces rôles gagneraient en centralité, influençant les attentes du marché et les référentiels de compétences.
Pour approfondir l'architecture des données, découvrez notre cours ETL and ELT in Python !
FAQs
Comment une entreprise peut-elle passer d'un ETL traditionnel à une architecture Zero-ETL ?
Pour opérer la transition, évaluez vos processus actuels et identifiez les leviers pour réduire les mouvements de données. Adoptez des technologies cloud comme les data lakes et le streaming en temps réel. La montée en compétences de vos équipes sur ces nouveaux outils et méthodes est également essentielle.
Quels types d'organisations ou de projets sont les mieux adaptés au Zero-ETL ?
Le Zero-ETL convient bien aux organisations qui ont besoin d'analyses en temps réel, comme l'e-commerce, les services financiers et les télécoms. Les projets types incluent la supervision en temps réel, le pricing dynamique et la détection instantanée de fraude.
Quelles sont les implications à long terme de l'adoption du Zero-ETL pour la gestion et l'analyse des données ?
À long terme, le Zero-ETL peut accroître l'agilité organisationnelle et accélérer la réaction face aux insights. Il peut aussi faire évoluer les rôles data vers des responsabilités plus axées sur l'intégration. Des mises à jour régulières des mesures de sécurité et de conformité seront indispensables à mesure que les processus se simplifient.
J'ai suivi une formation en mathématiques et en statistiques. J'ai une grande expérience de la modélisation statistique et des applications d'apprentissage automatique. En outre, j'effectue des recherches sur les mathématiques du ML.
