Pular para o conteúdo principal

[Infográfico] Checklist de limpeza de dados

A limpeza de dados ocupa 80% do fluxo de trabalho em ciência de dados. Use este checklist para identificar e resolver problemas de qualidade nos seus dados
Atualizado 17 de set. de 2026  · 5 min lido

Explorar com IA

ChatGPTClaudePerplexity

A limpeza de dados ocupa 80% do fluxo de trabalho em ciência de dados. Por isso, criamos este checklist para ajudar você a identificar e resolver problemas de qualidade nos seus dados. Se quiser se aprofundar em limpeza de dados, confira nossos cursos de Cleaning Data in Python e R.

data cleaning checklist

Para baixar este infográfico, clique na imagem acima

Problemas de restrições dos dados

1. Restrições de tipo de dado

  • O que é: Garantir que diferentes colunas tenham o tipo de dado correto antes de iniciar a análise.
  • Exemplo na prática: Uma coluna revenue_usd como string, e não numérica.
  • Soluções possíveis: Converter para o tipo de dado correto

2. Restrições de faixa de valores

  • O que é: Garantir que diferentes colunas estejam dentro da faixa correta, especialmente quando há limites definidos.
  • Exemplo na prática: Uma coluna gpa deve ficar entre [0.0, 4.0]
  • Soluções possíveis:
    • Verificar erros de digitação, como ponto decimal no lugar errado.
    • Remover linhas em que os valores violem os limites da faixa
    • Definir o valor que viola a faixa para o máximo ou mínimo permitido
    • Tratar o valor que viola a faixa como ausente e imputá-lo

3. Restrições de unicidade

  • O que é: Garantir que não existam duplicatas exatas ou quase idênticas entre as linhas.
  • Exemplo na prática: Uma linha duplicada em que as colunas name e phone_number são idênticas, mas height_cm é diferente
  • Soluções possíveis:
    • Manter apenas uma das linhas duplicadas exatamente iguais
    • Mesclar linhas com duplicatas não exatas

Problemas com textos e dados categóricos

1. Restrições de pertencimento para dados categóricos

  • O que é: Garantir que colunas categóricas tenham categorias corretas e consistentes
  • Exemplo na prática: Duas entradas diferentes para “New York” na coluna city
  • Soluções possíveis:
    • Remover linhas afetadas por categorias inconsistentes
    • Remapear categorias inconsistentes para o nome correto
    • Inferir categorias com base em outros pontos de dados quando não estiver claro como remapear

2. Violação de comprimento em dados de texto

  • O que é: Garantir que colunas de texto que seguem um padrão tenham o mesmo comprimento de string
  • Exemplo na prática: Uma coluna de phone_number dos EUA com 9 caracteres em vez de 14
  • Soluções possíveis:
    • Remover linhas afetadas por violação de comprimento
    • Definir as observações afetadas como ausentes

3. Formatação inconsistente em dados de texto

  • O que é: Garantir que colunas de texto sigam um padrão de formatação consistente
  • Exemplo na prática: Uma coluna de phone_number dos EUA com 9 caracteres em vez de 14
  • Soluções possíveis:
    • Remover linhas afetadas por formatação inconsistente
    • Definir as observações afetadas como ausentes

Problemas de uniformidade dos dados

1. Uniformidade de unidades em colunas numéricas

  • O que é: Garantir que colunas numéricas usem as mesmas unidades (por exemplo, temperatura em Celsius ou Fahrenheit em todas as observações. Isso é especialmente relevante ao unir dados de países ou fontes diferentes.)
  • Exemplo na prática: Uma coluna de temperatura em Celsius com valores absurdamente altos ou baixos
  • Soluções possíveis:
    • Remover linhas sem contexto de unidade que não passam no teste de sanidade
    • Padronizar as unidades sempre que possível

2. Uniformidade de formato em colunas de data

  • O que é: Garantir que colunas de data usem o mesmo formato de data e hora
  • Exemplo na prática: Coluna birthday com datas em dd-mm-yyyy e mm-dd-yyyy
  • Soluções possíveis:
    • Padronizar formatos de data e hora sempre que possível
    • Remover linhas sem contexto de formato de data/hora que não passam no teste de sanidade

3. Validação entre campos para colunas numéricas

  • O que é: Validação entre campos é quando usamos múltiplos campos do dataset para verificar a validade de outro. Por exemplo, garantir que partes somem corretamente ao total.
  • Exemplo na prática: Reservas de voo por classe somando o total de reservas registradas
  • Soluções possíveis:
    • Remover linhas que não passam nos testes de sanidade
    • Aplicar regras baseadas no conhecimento do domínio

4. Validação entre campos para colunas de data

  • O que é: Garantir que colunas de data e tempo passem em testes de sanidade (por exemplo, inscrição em webinar sempre precedendo a data de participação)
  • Exemplo na prática: Uma coluna date_of_birth que não corresponde à coluna age
  • Soluções possíveis:
    • Remover linhas que não passam nos testes de sanidade
    • Aplicar regras baseadas no conhecimento do domínio

Problemas de dados ausentes

1. Ausência completamente ao acaso

  • O que é: Quando não há relação sistemática entre valores ausentes e outros valores do dataset
  • Exemplo na prática: Não há relação observada entre dados ausentes e outros valores do dataset
  • Soluções possíveis:
    • Remover linhas com ausências
    • Imputar valores ausentes com medidas de centralidade, como mediana ou média
    • Imputar valores ausentes com abordagens algorítmicas baseadas em machine learning
    • Coletar novos pontos de dados e variáveis

2. Ausência ao acaso

  • O que é: Quando há relação sistemática entre dados ausentes e outros valores observados
  • Exemplo na prática: Dados do censo ausentes em uma região específica porque o serviço postal não tem cobertura completa nessa área
  • Soluções possíveis:
    • Remover linhas com ausências
    • Imputar valores ausentes com medidas de centralidade, como mediana ou média
    • Imputar valores ausentes com abordagens algorítmicas baseadas em machine learning
    • Coletar novos pontos de dados e variáveis

3. Ausência não ao acaso

  • O que é: Quando há relação sistemática entre dados ausentes e outros valores não observados
  • Exemplo na prática: Leituras de temperatura ausentes em um sensor porque a temperatura estava muito baixa ou muito alta
  • Soluções possíveis:
    • Remover linhas com ausências
    • Imputar valores ausentes com medidas de centralidade, como mediana ou média
    • Imputar valores ausentes com abordagens algorítmicas baseadas em machine learning
    • Coletar novos pontos de dados e variáveis
Tópicos
Ciência de dados
Data Analysis

Saiba mais sobre limpeza de dados

Curso

Limpeza de dados em Python

4 h
160.2K
Aprenda a diagnosticar e tratar dados sujos e transforme dados brutos em insights precisos.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

As 10 melhores ferramentas de ciência de dados para usar em 2026

As ferramentas essenciais de ciência de dados para iniciantes e profissionais da área para coletar, processar, analisar, visualizar e modelar os dados de forma eficiente.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

As 15 principais habilidades para cientistas de dados em 2026

Uma lista das habilidades essenciais que todo cientista de dados deve ter em seu arsenal, incluindo recursos para desenvolver suas habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

Artificial Intelligence Concept Art

blog

Guia de casos de uso em data science

Conheça casos de uso em data science e descubra como aplicar data science em diferentes setores para impulsionar crescimento e a tomada de decisões.
Elena Kosourova's photo

Elena Kosourova

15 min

blog

Como criar um excelente portfólio de ciência de dados (com exemplos)

Aqui está nosso guia essencial sobre as características de um excelente portfólio de ciência de dados e por que criar um pode aumentar suas perspectivas de carreira.
Adel Nehme's photo

Adel Nehme

13 min

blog

Como analisar dados para sua empresa em 5 etapas

Descubra as diferentes etapas para analisar dados e extrair valor deles, bem como os métodos e técnicas envolvidos no processo.
Javier Canales Luna's photo

Javier Canales Luna

14 min

Tutorial

Guia do cientista de dados para processamento de sinais

Descubra insights acionáveis ocultos em dados de sinais complexos filtrando ruídos, escolhendo visualizações apropriadas, encontrando padrões no domínio do tempo e da frequência e muito mais usando o processamento de sinais.
Amberle McKee's photo

Amberle McKee

15 min

Ver MaisVer Mais