
A engenharia de dados segue como prioridade para as empresas e, em 2021, há novidades empolgantes no universo de infraestrutura de dados. Em um webinar recente, Maksim Percherskiy, Data Engineer no The World Bank e ex-Chief Data Officer da cidade de San Diego, destacou três tendências para ficar de olho: plataformas de orquestração de dados, mecanismos de descoberta de dados e data lakehouses.
Plataformas de orquestração de dados
Embora plataformas de orquestração já existam há muitos anos para gerenciar sistemas e softwares, a orquestração de dados é um conceito relativamente novo que abstrai o acesso aos dados entre sistemas de armazenamento, virtualiza os dados e os apresenta para aplicações orientadas por dados. Plataformas de orquestração ajudam empresas a se tornarem mais data-driven ao combinar dados antes isolados em múltiplos repositórios e torná-los utilizáveis. Exemplos incluem Apache Airflow, Prefect, Luigi e Stitch, compatíveis com abordagens modernas como controle de versão, DevOps e integração contínua.
O curso da DataCamp Introduction to Airflow in Python é um ótimo ponto de partida para aprender a implementar e agendar ETL e fluxos de engenharia de dados de forma simples e repetível.
Mecanismos de descoberta de dados
Faz todo sentido que, à medida que o volume de dados cresce, as empresas invistam mais tempo em permitir que seus times encontrem os dados de que precisam, documentem-nos e reduzam retrabalho. Mecanismos de descoberta de dados como o Amundsen, do Lyft, e o Databook, do Uber, visam aumentar a produtividade dos usuários de dados oferecendo uma interface de busca. Essas ferramentas dependem de metadados, que sustentam produtividade e conformidade ao permitir que a infraestrutura de dados escale junto com o crescimento da empresa. O objetivo da descoberta de dados é tornar os dados mais FAIR: encontráveis, acessíveis, interoperáveis e reutilizáveis.

Data lakehouse
Existem casos de uso diferentes para data lakes e data warehouses. Cada um foi projetado para finalidades e públicos distintos. Por exemplo, data warehouses costumam ser usados por analistas para inteligência de negócios — eles contêm arquivos tabulares já processados para esse trabalho. Já os data lakes são configurados e mantidos por engenheiros de dados, que os integram a pipelines. Cientistas de dados trabalham mais de perto com data lakes, já que eles reúnem dados de escopo mais amplo e mais atualizados.
Data lakehouses são exatamente isso: a combinação de data lakes com data warehouses. Plataformas como a Snowflake e o Delta Lake da Databricks criaram soluções para oferecer uma única fonte de verdade, unindo os benefícios de data lakes e data warehouses. Data lakehouses implementam estruturas e recursos de gestão típicos de data warehouses sobre data lakes, que costumam ser mais econômicos para armazenamento. Ao mesmo tempo, preservam o esquema e o versionamento dos dados. Com data lakehouses, cientistas de dados conseguem realizar tanto machine learning quanto business intelligence.

Fonte: Databricks
Essas três tendências serão decisivas para escalar a infraestrutura de dados em 2021. Elas ajudam tanto empresas nativas em dados quanto aquelas que ainda lutam para integrar dados de forma sustentável em seus fluxos de trabalho. Saiba mais sobre os desafios que grandes organizações enfrentam para operacionalizar seus dados e se tornarem data-driven.

