Atendendo a muitos pedidos, a DataCamp está se preparando para construir uma trilha de aprendizado em engenharia de dados. Como acontece com vários termos no universo sempre em expansão da ciência de dados, há bastante ambiguidade na definição de “engenharia de dados”. Alguns engenheiros de dados fazem muitos relatórios e dashboards. Outros passam a maior parte do tempo trabalhando em pipelines de dados. Há também quem pegue código em Python criado por cientistas de dados e o otimize para rodar em Java ou C.
Para começar a criar os cursos, precisamos escolher uma definição única de “engenheiro de dados” como base. Depois de muita análise e reflexão, decidimos parafrasear o programa de TV americano “Law and Order”:
Engenheiros de dados vs. analistas de dados vs. cientistas de dados
No mundo da ciência de dados, os dados são representados por três profissões distintas, mas igualmente importantes:
- Os engenheiros de dados, que usam linguagens de programação para garantir acesso limpo, confiável e com bom desempenho aos dados e aos bancos de dados
- Os analistas de dados, que usam linguagens de programação, planilhas e ferramentas de business intelligence para descrever e categorizar os dados existentes
- Os cientistas de dados, que usam algoritmos para prever dados futuros a partir das informações atuais
Exemplos
Imagine que uma empresa venda vários tipos de sofás no site. Sempre que um visitante clica em um sofá específico, um novo dado é gerado. Um engenheiro de dados define como coletar esses dados, quais metadados devem ser adicionados a cada evento de clique e como armazenar tudo em um formato fácil de acessar. Um analista de dados cria visualizações para ajudar vendas e marketing a acompanhar quem está comprando cada sofá e quanto a empresa está faturando. Um cientista de dados pega os dados de quais clientes compraram cada sofá e usa essas informações para prever o sofá ideal para cada novo visitante do site.
O que faz um engenheiro de dados?
Em muitas organizações, os engenheiros de dados são as primeiras contratações do time de dados. Antes que os dados coletados possam ser analisados e aproveitados com métodos preditivos, eles precisam ser organizados e limpos. Os engenheiros de dados começam esse processo fazendo um inventário do que está armazenado, o chamado esquema de dados (data schema). Em seguida, escolhem um local confiável e de fácil acesso para armazenar os dados, conhecido como data warehouse. Exemplos de sistemas de data warehousing incluem Amazon Redshift e Google Cloud. Por fim, os engenheiros de dados criam processos de ETL (Extract, Transform, Load) para garantir que os dados cheguem ao data warehouse.
À medida que a organização cresce, os engenheiros de dados ficam responsáveis por integrar novas fontes ao ecossistema de dados e por enviar os dados armazenados para diferentes ferramentas de análise. Quando o data warehouse fica muito grande, cabe aos engenheiros de dados encontrar novas formas de manter um bom desempenho nas análises, como paralelizar o processamento ou criar subconjuntos menores para consultas mais rápidas.
A relação entre as três profissões
Dentro do universo de ciência de dados, sempre há sobreposição entre as três funções. Engenheiros de dados costumam assumir projetos simples de análise de dados ou transformar algoritmos escritos por cientistas de dados em formatos mais robustos, capazes de rodar em paralelo. Analistas e cientistas de dados também precisam aprender noções de engenharia de dados, especialmente em startups em estágio inicial, onde recursos de engenharia são escassos.
Aprenda engenharia de dados com a DataCamp!
Na DataCamp, estamos empolgados para ampliar nossa oferta de cursos de engenharia de dados. Já sabemos o que queremos ensinar e começamos a recrutar instrutores para desenhar esses cursos. Se você tiver interesse, confira nossa inscrição e a lista de cursos que estamos priorizando no momento.

