Ir al contenido principal

[Infographic] Lista de comprobación para la limpieza de datos

La limpieza de datos ocupa el 80% del flujo de trabajo en ciencia de datos. Usa esta lista para detectar y resolver cualquier problema de calidad en tus datos
Actualizado 17 sept 2026  · 5 min leer

Explorar con IA

ChatGPTClaudePerplexity

La limpieza de datos ocupa el 80% del flujo de trabajo en ciencia de datos. Por eso hemos creado esta lista de comprobación: para ayudarte a detectar y resolver cualquier problema de calidad en tus datos. Si quieres aprender más sobre cómo limpiar datos, echa un vistazo a nuestros cursos de Cleaning Data in Python y de R, respectivamente. 

lista de comprobación de limpieza de datos

Para descargar esta infografía, pulsa en la imagen de arriba

Problemas de restricciones de datos

1. Restricciones de tipo de dato

  • Qué es: Comprobar que las columnas tienen el tipo de dato correcto antes de empezar el análisis. 
  • Ejemplo en la práctica: Una columna revenue_usd que es una cadena en lugar de un tipo numérico.
  • Posibles soluciones: Convertir al tipo de dato correcto

2. Restricciones de rango de datos

  • Qué es: Comprobar que las columnas tienen el rango adecuado. Especialmente importante en columnas con límites.
  • Ejemplo en la práctica: Una columna gpa que debería estar limitada a [0.0, 4.0]
  • Posibles soluciones:
    • Revisar posibles erratas, como un punto decimal mal colocado.
    • Eliminar filas cuyos valores rompen las restricciones de rango
    • Ajustar el valor que rompe las restricciones al máximo o al mínimo permitido
    • Marcar como ausente el valor que rompe las restricciones y realizar imputación

3. Restricciones de unicidad

  • Qué es: Asegurarse de que no existan duplicados exactos o casi idénticos entre tus filas. 
  • Ejemplo en la práctica: Una fila duplicada en la que las columnas name y phone_number son idénticas, pero height_cm no lo es
  • Posibles soluciones:
    • Conservar solo una de las filas duplicadas exactas
    • Fusionar filas con duplicados no exactos 

Problemas con texto y datos categóricos

1. Restricciones de pertenencia en datos categóricos

  • Qué es: Garantizar que las columnas categóricas tengan categorías correctas y coherentes
  • Ejemplo en la práctica: Dos entradas diferentes para «New York» en la columna city
  • Posibles soluciones:
    • Eliminar las filas afectadas por categorías incoherentes
    • Reasignar las categorías incoherentes al nombre correcto
    • Inferir categorías a partir de otros datos cuando no esté claro cómo reasignarlas

2. Incumplimiento de longitud en datos de texto

  • Qué es: Garantizar que las columnas de texto que siguen un estándar específico tengan la misma longitud de cadena 
  • Ejemplo en la práctica: Una columna de phone_number de EE. UU. con 9 caracteres en lugar de 14
  • Posibles soluciones:
    • Eliminar las filas afectadas por el incumplimiento de longitud
    • Marcar las observaciones afectadas como ausentes

3. Datos de texto con formato incoherente

  • Qué es: Garantizar que las columnas de texto sigan un formato coherente (por ejemplo, uso consistente de mayúsculas/minúsculas, espacios, guiones, etc.) 
  • Ejemplo en la práctica: Nombres propios escritos con mayúsculas en unas filas y en minúsculas en otras
  • Posibles soluciones:
    • Normalizar el formato (capitalización, espacios, signos)
    • Eliminar filas gravemente afectadas si no es posible normalizarlas

Problemas de uniformidad de datos

1. Uniformidad de unidades en columnas numéricas

  • Qué es: Asegurarse de que las columnas numéricas usan las mismas unidades (por ejemplo, temperatura en Celsius o Fahrenheit en todas las observaciones; especialmente relevante al combinar datos de distintos países o fuentes). 
  • Ejemplo en la práctica: Una columna de temperatura en Celsius con valores absurdamente altos o bajos 
  • Posibles soluciones:
    • Eliminar filas sin contexto de unidades y que no superen una comprobación básica
    • Estandarizar las unidades siempre que sea posible

2. Uniformidad de formatos en columnas de fecha

  • Qué es: Asegurarse de que las columnas de fecha usan el mismo formato de fecha y hora
  • Ejemplo en la práctica: Columna birthday con fechas en dd-mm-yyyy y en mm-dd-yyyy
  • Posibles soluciones:
    • Estandarizar los formatos de fecha y hora cuando sea posible
    • Eliminar filas sin contexto de formato y que no superen una comprobación básica

3. Validación entre campos en columnas numéricas

  • Qué es: La validación entre campos usa varias columnas de un conjunto de datos para verificar la validez de otra. Por ejemplo, comprobar que las partes suman el total correspondiente.
  • Ejemplo en la práctica: Reservas de vuelo por clase que suman el total de reservas registradas
  • Posibles soluciones:
    • Eliminar filas que no superen las comprobaciones básicas
    • Aplicar reglas basadas en el conocimiento del dominio y del propio dato 

4. Validación entre campos en columnas de fecha

  • Qué es: Asegurarse de que las columnas de fecha y tiempo superen comprobaciones básicas (por ejemplo, que la fecha de registro a un webinar sea anterior a la fecha de asistencia) 
  • Ejemplo en la práctica: Una columna date_of_birth que no se corresponde con la columna age
  • Posibles soluciones:
    • Eliminar filas que no superen las comprobaciones básicas
    • Aplicar reglas basadas en el conocimiento del dominio y del propio dato 

Problemas de datos ausentes

1. Ausencia completamente al azar

  • Qué es: Cuando no existe relación sistemática entre los valores ausentes y otros valores del conjunto de datos
  • Ejemplo en la práctica: No se observa relación entre los datos ausentes y otros valores del conjunto
  • Posibles soluciones:
    • Eliminar filas con valores ausentes
    • Imputar filas ausentes con medidas de centralidad como mediana o media
    • Imputar filas ausentes con métodos algorítmicos basados en aprendizaje automático
    • Recopilar nuevos puntos de datos y variables 

2. Ausencia al azar

  • Qué es: Cuando existe una relación sistemática entre los datos ausentes y otros valores observados
  • Ejemplo en la práctica: Datos del censo ausentes de una región específica porque el servicio postal no tiene cobertura completa en esa zona
  • Posibles soluciones:
    • Eliminar filas con valores ausentes
    • Imputar filas ausentes con medidas de centralidad como mediana o media
    • Imputar filas ausentes con métodos algorítmicos basados en aprendizaje automático
    • Recopilar nuevos puntos de datos y variables 

3. Ausencia no al azar

  • Qué es: Cuando existe una relación sistemática entre los datos ausentes y otros valores no observados 
  • Ejemplo en la práctica: Lecturas de temperatura de un sensor ausentes porque la temperatura era demasiado baja o demasiado alta
  • Posibles soluciones:
    • Eliminar filas con valores ausentes
    • Imputar filas ausentes con medidas de centralidad como mediana o media
    • Imputar filas ausentes con métodos algorítmicos basados en aprendizaje automático
    • Recopilar nuevos puntos de datos y variables 
Temas
Ciencia de datos
Análisis de datos

Más sobre limpieza de datos

Curso

Limpieza de datos en Python

4 h
160.2K
Aprende a diagnosticar y tratar los datos en sucio y desarrolla las habilidades necesarias para transformarlos en información precisa.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Las 15 habilidades más importantes para los científicos de datos en 2026

Una lista de las habilidades imprescindibles que todo científico de datos debería tener en su caja de herramientas, incluidos recursos para desarrollar tus habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

blog

28 proyectos de análisis de datos para todos los niveles en 2026

Explora nuestra lista de proyectos de análisis de datos para principiantes, estudiantes de último curso y profesionales. La lista consta de proyectos guiados/no guiados y tutoriales con código fuente.
Abid Ali Awan's photo

Abid Ali Awan

13 min

blog

¿Qué es el data wrangling? Guía práctica con ejemplos

Aprende los conceptos y teorías fundamentales del data wrangling con ejemplos prácticos. Aplica estas habilidades en tu trabajo diario de data science para generar datos limpios y útiles para tus modelos.
Tim Lu's photo

Tim Lu

12 min

blog

28 preguntas principales de la entrevista a un científico de datos para todos los niveles

Explora las preguntas principales de la entrevista sobre ciencia de datos con respuestas para estudiantes de último curso y profesionales en busca de empleo.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

¿Qué es el análisis de datos? Una guía experta con ejemplos

Explora el mundo del análisis de datos con nuestra completa guía. Conoce su importancia, proceso, tipos, técnicas, herramientas y principales carreras en 2023
Matt Crabtree's photo

Matt Crabtree

10 min

Data Science Concept Vector Image

blog

Cómo convertirse en científico de datos en 2026

Descubre todo lo que necesitas saber para convertirte en científico de datos y averigua si es la carrera adecuada para ti.
Jose Jorge Rodriguez Salgado's photo

Jose Jorge Rodriguez Salgado

12 min

Ver MásVer Más