Pular para o conteúdo principal

Como o thick data complementa o big data

Todo mundo quer dominar big data. Mas small data e dados qualitativos são tão importantes quanto.
Atualizado 17 de set. de 2026  · 9 min lido

Explorar com IA

ChatGPTClaudePerplexity

O que é big data?

Big data é um dos termos mais falados no universo de dados. Mas quão grande é esse “big”? Uma forma de pensar sobre isso é em termos de volume, ou seja, a quantidade de dados que você tem. Com base no volume, podemos definir big data como dados em uma escala muito maior do que caberia em um laptop moderno ou em um único HD. Por isso, eles precisam ser distribuídos em clusters de computadores para que possamos trabalhar, transmitir e analisar. Podemos ampliar essa definição de big data para cobrir os três Vs: volume, velocidade e variedade.

  • Volume: a quantidade de dados
  • Velocidade: a rapidez com que você consegue mover e analisar os dados
  • Variedade: os diferentes tipos de dados que você possui

Big data é o fim da teoria?

Em 2008, Chris Anderson escreveu um artigo provocativo na Wired chamado The End of Theory, The Data Deluge Makes the Scientific Method Obsolete. A premissa era que já tínhamos dados suficientes para fazer previsões satisfatórias sobre o mundo, sem precisar de teoria para entendê-lo. Parte do impulso para esse tipo de argumento veio do que víamos acontecer com o Google — a empresa conseguia operar com quantidades imensas de dados e, então, fornecer modelos preditivos na forma de produtos de dados para compra programática de anúncios. E faziam isso com análises preditivas avançadas, sem precisar entender ou teorizar profundamente sobre o sistema em estudo.

Tudo girava em torno de usar comportamentos humanos capturados para criar produtos e serviços melhores. O Google permitiu que quem quisesse comprar um anúncio o fizesse facilmente no Google AdWords, e o modelo por trás do AdWords não dependia de nenhuma teoria sobre se alguém clicaria ou não. O Google tinha dados suficientes para fazer uma previsão “boa o bastante”. A hipótese provocativa de Chris Anderson é que big data contém tanta informação que não precisamos mais modelar o mundo — nem entender a teoria por trás do que está acontecendo.

Será que big data realmente cumpriu o que prometeu? Uma forma de pensar sobre isso é usando o Gartner Hype Cycle.

O Gartner Hype Cycle mostra uma inovação tecnológica e as expectativas em torno dela ao longo do tempo. Começamos com o gatilho de inovação, que, no caso de big data, foi a capacidade de armazenar, transmitir e analisar grandes volumes de dados. Em seguida, o assunto viraliza, levando ao pico de expectativas infladas. Depois, o valor entregue não acompanha as expectativas, e entramos no vale da desilusão. Só então o valor real começa a aparecer em diversos setores — iniciando a rampa de esclarecimento.

Em que ponto do Gartner Hype Cycle está o big data hoje? Uma forma de avaliar expectativas é observar o que as pessoas buscam no Google ao longo do tempo. Abaixo estão as tendências do Google para “big data” desde 2004. Dá para ver que Chris Anderson se adiantou ao seu tempo — mas ele errou ao dizer que big data seria o fim da teoria, porque small data e thick data são fundamentais.

Se aceitarmos o Gartner Hype Cycle como um modelo válido para pensar sobre big data, e se aceitarmos as tendências do Google como um proxy de expectativas, vemos que o pico de expectativas infladas ocorreu por volta de 2014 e que ainda não chegamos necessariamente ao vale da desilusão.

Small data também é poderoso

Embora muitas das inovações recentes em ciência de dados tenham se concentrado na nossa capacidade de lidar com volumes cada vez maiores de dados, é importante reconhecer que a imensa maioria dos dados analisados no mundo real cabe na memória de um laptop moderno. Como líder de negócios, vale avaliar com cuidado as necessidades da sua área de dados antes de decidir quais ferramentas e arquiteturas adotar.

Quero te levar de volta no tempo a Johannes Kepler, que descobriu as três leis do movimento planetário, e Tycho Brahe, astrônomo dinamarquês que coletou os dados que Kepler analisou para formular essas leis — que depois embasaram a teoria da gravitação de Newton. Uma enorme quantidade de conhecimento científico foi desenvolvida a partir dos dados coletados por Brahe, que somavam cerca de 2.000 pontos de dados. Isso é minúsculo comparado aos datasets de hoje, que às vezes têm centenas de milhões de pontos. Mas os dados de Brahe tinham alta qualidade. Se você tem dados bons, coletados corretamente, modelos analíticos e teóricos sólidos e um método estatístico bem aplicado, dá para extrair muito valor dos seus dados.

Vamos a outro exemplo explorado no artigo de Andrew Gelman, How can a poll of only 1,004 Americans represent 260 million people with only a 3 percent margin of error? Gelman apresenta a matemática mostrando que, ao aumentar a quantidade de dados, o ganho na redução da margem de erro tem retornos decrescentes. Observação: isso vale apenas se houver algum tipo de amostragem representativa da população, o que nem sempre acontece em pesquisas. Mas estatísticos hoje contam com métodos sofisticados de correção para amostras não representativas, que permitem inferir preferências de voto de uma população maior.

Mais uma vez, vemos um resultado relevante a partir de uma pequena quantidade de dados, que nos diz algo sobre o comportamento e as preferências humanas. No mundo dos negócios, vale o mesmo princípio — trata-se de entender e conseguir prever comportamentos futuros, especialmente dos seus stakeholders. Então por que falamos tanto de big data quando nem sempre é necessário? Um dos principais motivos é que hoje ele é extremamente acessível e computável.

A mensagem final é a mesma apontada pela Harvard Business Review em Sometimes “Small Data” Is Enough to Create Smart Products: “não é sobre montanhas de dados, e sim sobre dados pequenos e de alta precisão”.

O poder do thick data

Agora que falamos do poder do small data, vamos para outro tipo: o thick data, ou dados qualitativos. Dados “finos” envolvem números e tabelas, enquanto thick data — termo da sociologia e da antropologia — é mais qualitativo e descritivo. A consultoria ReD Associates fez um trabalho fantástico usando thick data para ajudar a construir modelos analíticos e de machine learning.

Um exemplo é o trabalho deles em detecção de fraude em cartão de crédito. Esse é um grande desafio, e técnicas de machine learning já vêm sendo usadas, considerando variáveis como valor da transação, horário, localização etc. A ReD Associates buscou coletar thick data para atacar o problema sob uma abordagem sociológica.

Para isso, a ReD Associates conversou com fraudadores de cartão de crédito para entender o que eles realmente fazem e como são seus processos. Eles encontraram uma comunidade de fraudadores na dark web e os entrevistaram presencialmente para conhecer seus métodos e hábitos.

Descobriram que o momento em que fraudadores têm maior chance de serem pegos é quando precisam fazer algo no mundo físico — como retirar entregas. Eles são tecnicamente habilidosos o suficiente para quase não deixarem rastros online. E também são cautelosos no mundo físico — normalmente não enviam encomendas para o próprio endereço, para o trabalho ou para amigos. Em vez disso, mandam para imóveis abandonados ou que estão à venda.

Munidos desse conhecimento, a ReD Associates criou um modelo de detecção de fraude considerando como variável a localização para onde a encomenda seria enviada e cruzando com dados públicos sobre imóveis abandonados e à venda. Observaram que esse modelo baseado em dados qualitativos trouxe um ganho significativo de acurácia quando comparado a modelos mais tradicionais de detecção de transações fraudulentas. É um ótimo exemplo da importância do thick data e de como uma abordagem sociológica pode gerar mais valor. Recomendo estes dois artigos para se aprofundar em por que dados de boa qualidade importam mais do que apenas volume: The Power of 'Thick' Data e Big Data Is Only Half the Data Marketers Need.

Como usar thick data nas suas análises

Escolha uma fonte de dados valiosa para o seu negócio e reflita sobre quanto desses dados você realmente precisa para embasar decisões. Uma forma de avaliar isso é considerar o valor adicional de aumentar o volume em 2X, 5X e 10X — especialmente em relação ao investimento para coletar, armazenar e analisar. Depois, responda: que tipo de thick data você poderia usar para elevar a qualidade dessa fonte?

Saiba mais sobre as melhores práticas para alavancar dados em The Definitive Guide to Machine Learning for Business Leaders.

Tópicos
Big Data
Relacionado

blog

O que é alfabetização de dados? Um guia para 2026 para líderes de dados e análises

Descubra a importância da alfabetização de dados no mundo atual, que gira em torno deles.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

As 10 melhores ferramentas de ciência de dados para usar em 2026

As ferramentas essenciais de ciência de dados para iniciantes e profissionais da área para coletar, processar, analisar, visualizar e modelar os dados de forma eficiente.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

As 10 melhores ferramentas de análise de dados para analistas de dados em 2026

Pensando em começar uma nova carreira como analista de dados? Aqui tá tudo o que você precisa saber sobre as ferramentas de análise de dados que vão liderar o setor de ciência de dados em 2026.
Javier Canales Luna's photo

Javier Canales Luna

13 min

blog

4 etapas para criar um programa de dados bem-sucedido

O diretor de design estratégico, dados, precificação e análise da AXA XL explica como fazer seu programa de dados decolar e implementar uma cultura orientada por dados bem-sucedida.
Joyce Chiu's photo

Joyce Chiu

8 min

blog

A importância dos dados: 5 principais motivos

Por que os dados são importantes? Saiba mais sobre a importância dos dados no mundo atual e descubra alguns cursos para ajudá-lo a aprimorar suas próprias habilidades com dados.
Kurtis Pykes 's photo

Kurtis Pykes

6 min

blog

Um roteiro de ciência de dados para 2026

Quer começar ou crescer na área de ciência de dados? Esse roteiro de ciência de dados ajuda você a entender e começar a trabalhar na área de ciência de dados.
Mark Graus's photo

Mark Graus

15 min

Ver MaisVer Mais