As organizações mais bem-sucedidas hoje tomam decisões com forte base em dados. Muitas dessas empresas, fluentes em dados, geram milhões de linhas diariamente, usadas e analisadas por diversos times. Um dos principais desafios para dar às equipes a capacidade de acessar e trabalhar com dados é garantir que esses dados sejam coletados, confiáveis, consistentes, acionáveis e fáceis de descobrir.
Para navegar por esses ecossistemas complexos, muitas organizações desenvolveram e abriram o código de tecnologias internas conhecidas como ferramentas de data discovery.
Em um webinar recente, Ramnath Vaidyanathan, VP de Pesquisa de Produto na DataCamp, explica como as organizações podem evoluir de reativas a dados, quando quase ninguém tem habilidade ou acesso para trabalhar com dados, para fluentes em dados, quando todos têm acesso e competências para trabalhar com dados e tomar decisões orientadas por dados. As organizações podem aumentar sua maturidade em dados investindo no framework IPTOP: infraestrutura, pessoas, ferramentas, organização e processos. À medida que ampliam o acesso a dados com investimentos em infraestrutura, será essencial oferecer descoberta de dados simples por meio de ferramentas de data discovery.
Dados não são úteis se as pessoas não conseguem acessá-los, se não entendem o contexto do que foi coletado e se não conseguem encontrar o que precisam. É por isso que as ferramentas de data discovery são realmente críticas. Ramnath Vaidyanathan, VP de Pesquisa de Produto na DataCamp

Como empresas fluentes em dados usam ferramentas de data discovery
Muitas empresas orientadas por dados implementaram ferramentas de data discovery em sua infraestrutura. Vamos analisar as motivações e os direcionadores por trás de soluções de destaque como o Uber Databook e o Lyft Amundsen.

Desafios de data discovery para considerar
Um desafio central em data discovery é equilibrar produtividade e compliance. A Lyft relatou que enfrentava esses obstáculos à medida que o volume de dados crescia exponencialmente, com projeção de manter esse ritmo por pelo menos 10 anos. Ao desenvolver o Amundsen, observaram que cerca de 25% do tempo de um analista era gasto apenas na descoberta de dados. Também notaram demandas de compliance cada vez mais rígidas nos países em que atuavam.
A Uber apontou preocupações semelhantes quando começou a ir além do app de caronas para serviços como Uber Eats, Uber Freight e Jump Bikes. Ao criar o Databook, a Uber já tinha mais de 15 milhões de viagens por dia e 18.000 funcionários em diferentes times. Outro desafio era que seus dados existiam em muitos formatos, incluindo Hive, Presto e Vertica. Os analistas precisavam acessar e entender de forma eficiente várias fontes para alcançar fluência em dados.
O Facebook construiu a plataforma Nemo para garantir dados de alta qualidade e confiáveis, à medida que o tamanho e a complexidade aumentavam entre funções e localidades. Devido às questões de privacidade associadas aos dados analisados, o Facebook também enfrentou exigências significativas de compliance ao disponibilizar tabelas para analistas específicos.
John Bodley, do Airbnb, disse em uma palestra de 2017: “À medida que o Airbnb cresce, também crescem os desafios em torno do volume, da complexidade e da obscuridade dos dados.” Isso significa que os funcionários frequentemente percebiam os dados como “em silos, inacessíveis e sem contexto”. Como resultado, havia duplicação de tabelas e dados deixavam de ser usados quando não eram confiáveis. O Airbnb desenvolveu o Dataportal para tornar a descoberta de dados muito mais eficiente, removendo barreiras à análise produtiva.
Esses desafios são amplos, independem do setor e se aplicam a qualquer organização que queira escalar a tomada de decisão baseada em dados. A necessidade de dados facilmente descobríveis se torna essencial conforme as empresas buscam se tornar fluentes em dados.
Os quatro objetivos-chave de ferramentas de data discovery
Agora que entendemos os desafios, vamos ver como diferentes ferramentas de data discovery os endereçam. A Uber divide os objetivos de uma plataforma de descoberta bem-sucedida em quatro componentes:
- Extensibilidade: capacidade de adicionar facilmente metadados, armazenamento e entidades às tabelas
- Acessibilidade: capacidade de acessar todos os metadados de forma programática
- Escalabilidade: capacidade de suportar muitas leituras simultâneas
- Potência: capacidade de suportar leituras e escritas em múltiplos data centers
Alcançar esses objetivos se torna mais viável conforme as organizações amadurecem suas competências em dados. E, com o aumento do volume de dados, cada componente ganha ainda mais importância.
Lyft e Airbnb oferecem metadados detalhados
A equipe de engenharia da Lyft defende que “metadados são o santo graal das aplicações do futuro”. Eles dividem metadados em duas subcategorias. A primeira é um conjunto descritivo formado por contexto de aplicação (ou seja, o que as pessoas precisam saber sobre os dados para operá-los), comportamento (quem é o dono de um dataset e seus padrões de uso) e mudanças (como o dataset evolui ao longo do tempo). A segunda é o próprio dado descrito — qualquer dado armazenado na organização, em qualquer formato, como data stores, dashboards, datastreams e outros.
Ao desenvolver o Dataportal, a plataforma de data discovery do Airbnb, os metadados foram parte essencial do valor agregado ao pipeline de dados. Antes do Dataportal, muitos colaboradores não confiavam nos dados por falta de contexto e metadados. O Airbnb argumenta que “entender todo o ecossistema de dados — da produção do event log ao consumo na visualização — gera mais valor do que a soma das partes”.

Fonte: Airbnb
Garanta resultados de busca de alta qualidade com data discovery
Com esse contexto disponível, a descoberta de dados exige uma busca eficiente. Por mais confiável e compreensível que seja cada tabela, as plataformas só são úteis se os analistas encontrarem rapidamente o que precisam.
A landing page do Lyft Amundsen permite buscar tabelas com linguagem natural e destaca as mais populares na organização para acesso rápido. Além disso, os analistas podem deixar feedback na tabela para aprimorar resultados de buscas futuras.
Na solução do Facebook, o Nemo, os analistas filtram por uso, restrições de privacidade e recência, e ainda contam com o domínio da empresa em processamento de linguagem natural para digitar perguntas na busca e obter tabelas relevantes.
O Uber Databook oferece filtros semelhantes, permitindo refinar por nome, proprietário, coluna e colunas aninhadas. A Uber utiliza o Elasticsearch para entregar resultados de busca com rapidez e precisão.
Chegando à democratização de dados com data discovery
Escalar a fluência e a descobribilidade de dados andam juntos, já que os analistas precisam de acesso simples aos dados para tomar decisões embasadas.

Organizações com baixa maturidade em dados devem priorizar o desenvolvimento de habilidades e cultura de dados e a ampliação da infraestrutura. Mas, conforme avançam nessa jornada e expandem o acesso aos dados, viabilizar um data discovery extensível e escalável será essencial para se tornar uma organização orientada por dados. Para um mergulho completo em todos os vetores de crescimento da maturidade em dados, assista ao nosso webinar sobre o caminho para a fluência em dados ou faça a avaliação de maturidade em dados.
