Programa
Seja para incluir um projeto de dados no seu portfólio ou para começar seu primeiro projeto como cientista de dados contratado, a primeira tarefa é encontrar um conjunto de dados adequado. Então, o que é um conjunto de dados e onde você pode encontrá-los?
Dados estão em todo lugar, mas achar uma fonte confiável e acessível de informação para responder às perguntas específicas que você tem pode ser bem mais difícil do que parece. Todo grande projeto de dados começa com um bom conjunto de dados. Neste tutorial, vamos passar rapidamente pelos tipos de conjuntos de dados que existem, como encontrá-los e o que fazer com eles depois.
O que são conjuntos de dados?
Um conjunto de dados é, basicamente, uma coleção de informações. Normalmente, essas informações estão organizadas de alguma forma, embora nem sempre do jeito mais útil para o seu contexto — e aí entra um pouco de trabalho seu para deixá-las utilizáveis.
Há vários tipos de dados que podem ser organizados de formas diferentes. Tipos comuns de conjuntos de dados incluem:
- Dados tabulares, organizados em tabelas, como planilhas
- Dados relacionais, que são coleções de tabelas conectadas por relacionamentos
- Dados de séries temporais, que são ordenados cronologicamente
Outros conjuntos podem incluir coleções de imagens, documentos de texto ou gravações de áudio e vídeo.
Onde posso encontrar conjuntos de dados?
Procurar conjuntos de dados confiáveis para trabalhar pode tomar tempo. Há muitos conjuntos gratuitos disponíveis, embora vários sejam pagos ou até proprietários.
Encontrar os dados de que você precisa para começar seu projeto pode ser complicado por paywalls, questões legais, direitos de propriedade intelectual ou, em alguns casos, simplesmente porque os dados exatos que você busca não existem.
Nessas situações, pode ser preciso ser criativo com o que dá para fazer com os dados que você tem — ou até coletar seus próprios dados (o que pode virar um projeto à parte). Dê uma olhada neste curso de web scraping com Python, neste curso de fundamentos de data science ou neste curso de data science para negócios para ter ideias de coleta de dados.
A DataCamp tem uma coleção de conjuntos de dados selecionados e fáceis de acessar sobre vários temas. É um ótimo ponto de partida, especialmente se você não sabe bem por onde começar.
Outras boas fontes incluem sites de governos, organizações sem fins lucrativos, universidades e bibliotecas. Abaixo está uma tabela com ótimos recursos para encontrar conjuntos de dados interessantes.
|
Fonte dos conjuntos de dados |
Link |
|
DataCamp |
https://www.datacamp.com/workspace/datasets |
|
Google Dataset Search |
https://datasetsearch.research.google.com/ |
|
Data.gov |
https://data.gov/ |
|
Datahub |
https://www.datahub.io/search |
|
UCI Machine Learning Repository |
https://archive.ics.uci.edu/ |
|
Kaggle |
https://www.kaggle.com/datasets |
|
Library of Congress |
https://guides.loc.gov/datasets |
|
US Census Bureau |
https://www.census.gov/data/datasets.html |
|
Federal Trade Commission |
https://www.ftc.gov/policy-notices/open-government/data-sets |
|
World Health Organization |
https://www.who.int/data/sets |
|
Centers for Disease Control and Prevention |
https://open.cdc.gov/data.html |
|
National Institutes for Health |
https://www.ncbi.nlm.nih.gov/datasets/ |
Um passo crucial ao escolher a fonte é avaliar a qualidade e a confiabilidade. O mais importante é verificar se a fonte é confiável. Cada um dos conjuntos de dados da DataCamp traz um link para o material de origem, facilitando a verificação de autenticidade.
Com outras fontes, talvez seja preciso pesquisar um pouco mais para garantir que você está usando dados confiáveis. Fatores de confiabilidade incluem como os dados foram coletados, quais populações estão representadas e se houve vieses no processo de coleta.
Outro ponto a considerar ao escolher um conjunto é o quanto será necessário limpar e tratar os dados para chegar a um formato utilizável. Optar por um conjunto mais curado pode economizar tempo. Ainda assim, muitas vezes é inevitável lidar com dados mais "bagunçados", que exigem esforço para padronizar formatos, tratar ausências e remover duplicidades.
Este tutorial de limpeza de dados ajuda você a enfrentar alguns desses problemas.
Explorando a estrutura de conjuntos de dados
Existe uma terminologia padrão para descrever as partes de um conjunto de dados que vale a pena conhecer.
Conjuntos tabulares são compostos por linhas e colunas. Em geral, cada linha é um registro e cada coluna representa um atributo ou variável desse registro.
Cada célula, na interseção entre linha e coluna, contém um valor. Um índice atribui um número a cada registro. O cabeçalho, ou primeira linha de cada coluna, geralmente traz o nome do atributo ou coluna. Em bancos de dados relacionais, tabelas podem se conectar por relações.

Ao obter um conjunto de dados, é importante examiná-lo e identificar esses pontos-chave. Há várias opções para visualizar seus dados, incluindo carregá-los no Python, no SQL, no R ou no Matlab e exibir linhas específicas.
Dependendo do tipo e do tamanho do arquivo, você talvez consiga abrir diretamente no Microsoft Excel ou no Google Sheets e visualizar por lá. Lembre-se: se o conjunto for muito grande, carregar tudo de uma vez consome muita memória, então pode ser necessário visualizar em blocos.
Limpando e preparando conjuntos de dados
Muitas vezes, depois de garantir um conjunto de dados para o seu projeto, o próximo passo é fazer bastante limpeza e preparação para chegar a um formato utilizável. Escolher um conjunto curado, como os da DataCamp, reduz a necessidade de limpeza.
Ainda assim, é bem provável que você precise adaptar o conjunto às suas necessidades — especialmente se estiver reunindo dados de múltiplas fontes para o projeto.

Ao limpar e preparar seus dados, tarefas comuns incluem:
- Remover dados que não são relevantes para sua análise
- Identificar e excluir entradas duplicadas
- Corrigir erros de digitação, capitalização ou padrões de nomenclatura inconsistentes
- Remover ou imputar valores ausentes
- Codificar dados categóricos em formato numérico
- Transformar dados para um formato consistente
- Garantir consistência e precisão dentro do conjunto
Confira estes cursos para saber mais sobre limpeza de dados em Python ou limpeza de dados em bancos SQL Server.
Análise exploratória de dados
A análise exploratória ajuda você a entender de verdade o conjunto de dados — um passo crucial antes de partir para análises mais complexas. Muitos profissionais juniores pulam essa etapa e pagam o preço.
Minha forte recomendação é realizar várias análises exploratórias no seu conjunto antes de se aventurar em modelagem, machine learning ou qualquer outra análise mais avançada.
Essa etapa ajuda a identificar estranhezas, inconsistências ou problemas nos dados. Também orienta a escolha da análise adequada depois e permite detectar e corrigir resultados anômalos.
O trabalho exploratório deve assumir várias formas, de estatísticas descritivas a visualizações simples. Para a maioria dos conjuntos tabulares, estatísticas-resumo como média, mediana e desvio padrão, junto com gráficos de dispersão ou barras, já oferecem uma visão rica dos padrões e do comportamento dos dados.
Reserve um tempo para plotar o máximo de variáveis que fizer sentido. Embora essa etapa talvez não apareça no dashboard, relatório ou aplicação final do seu projeto, ela vai guiar seu processo. Saiba mais sobre análise exploratória em Python ou análise exploratória em R.
Apresentando sua história com dados
Todo projeto de dados termina na apresentação dos resultados para o público certo. Seja um tomador de decisão do negócio, um possível empregador ou um colega de dados, é fundamental que seus insights sejam claros e fáceis de interpretar.
Às vezes, um gráfico simples com um título descritivo resolve. Em outras, será preciso um dashboard mais elaborado. Qualquer que seja a escolha, garanta que sua interpretação seja fiel ao conjunto de dados.

Nosso guia de bolso de visualização de dados ajuda você a escolher a melhor forma de apresentar seus conjuntos.
O objetivo é transmitir com honestidade o que o conjunto representa e como ele responde às suas perguntas. Explore a trilha de aprendizado em data storytelling para dominar essa habilidade essencial.
A DataCamp é um ótimo lugar para apresentar seu portfólio de dados. Outras opções populares incluem um repositório no GitHub ou um site profissional. Onde quer que você hospede seu projeto, garanta que ele seja fácil de acessar para o público desejado.
Conclusão
A informação está no centro da ciência de dados. Conjuntos de dados reúnem informações em um só lugar, tornando possível identificar tendências, fazer previsões e impulsionar a sociedade. Encontrar conjuntos para analisar pode parecer assustador no começo, mas saber por onde começar faz toda a diferença. Explore a seleção da DataCamp de conjuntos de dados interessantes e veja o que te inspira!
Sou PhD e tenho 13 anos de experiência trabalhando com dados em um ambiente de pesquisa biológica. Crio software em várias linguagens de programação, incluindo Python, MATLAB e R. Sou apaixonado por compartilhar meu amor pelo aprendizado com o mundo.



