Ir al contenido principal

[Infografía] Lista de verificación para proyectos de data science

Usa esta lista de verificación al planificar tu próximo proyecto de data science.
Actualizado 17 sept 2026

Explorar con IA

ChatGPTClaudePerplexity

Una buena gestión de proyectos aumenta la eficiencia y la productividad, además de reducir el riesgo de fracaso. Por desgracia, los proyectos de data science pueden ser especialmente complicados de gestionar, ya que implican a personas de muchos equipos y deben equilibrar objetivos de negocio y técnicos.

Los marcos de gestión de proyectos te ayudan a planificar, asignar recursos y ejecutar tareas para alcanzar tus objetivos a tiempo y dentro del presupuesto.

Esta infografía sintetiza los puntos clave de dos marcos de referencia líderes —Team Data Science Process de Microsoft y Domino Data Science Life Cycle de Domino Data Lab— en una práctica lista de verificación que podrás usar en tus propios proyectos.

Data Cleaning Checklist@1x (1).png

Ten a mano esta infografía

Descárgate esta infografía y tenla a mano para tu próximo proyecto de ciencia de datos

Descargar Ahora

Cómo usar esta chuleta

Esta chuleta resume las mejores prácticas de gestión de proyectos de data science recogidas del Team Data Science Process de Microsoft y el Domino Data Science Life Cycle de Domino Data Lab, combinando los principios de CRISP-DM con los de los marcos Agile y Scrum de desarrollo de software. ¡Usa esta lista de verificación al planificar tu próximo proyecto de data science! 

Principios para una gestión eficaz de proyectos de data science 

Como regla general, los proyectos de data science que triunfan suelen compartir estas características:

  • Medibles: ¿puedes cuantificar el éxito del proyecto y su impacto en el negocio?
  • Fiables: ¿qué proporción de proyectos alcanzó sus objetivos?
  • Escalables: ¿puede aumentarse el número de proyectos sin degradar de forma notable la fiabilidad?

Además, los equipos de datos deberían seguir estos principios al gestionar proyectos de data science: 

  • Iterar: rara vez un proyecto va en línea recta de principio a fin. A medida que avanzas, aprendes cosas que exigen revisiones. En línea con Scrum y Agile, vuelve a pasos anteriores cuando sea necesario.
  • Reutilizar y reciclar: empezar cada proyecto desde cero consume tiempo y es ineficiente. Reutilizar componentes de un proyecto a otro —código, variables del modelo o plantillas— evita reinventar la rueda.
  • Garantizar la reproducibilidad: explicar y justificar el trabajo suele ser más difícil que hacerlo. Tu metodología y resultados pueden ser auditados por un regulador o por el cliente, o quizá necesites revisarlos más adelante. Adoptar técnicas de investigación reproducible te ahorrará tiempo y reducirá riesgos por errores no detectados.

Lista de verificación para proyectos de data science 

Tanto Microsoft como Domino Data Lab proponen fases similares para un proyecto de data science. A continuación resumimos estas fases en un marco unificado:

Definición del contexto e ideación 

¿Qué hacer?

¿Cómo hacerlo?

Identificar el problema de negocio a resolver

Debes dejar claro por qué se emprende el proyecto de la forma más inequívoca posible. 

Identificar a las personas implicadas

Los roles pueden incluir project manager, data scientist, account manager y data administrator.

Revisar trabajos previos

Repasa proyectos existentes que hayan abordado algo similar.

  • ¿Cuáles fueron los resultados clave?
  • ¿Se puede reutilizar algún trabajo o activo en este proyecto?
  • ¿Qué errores se cometieron que conviene evitar?

Definir indicadores clave de rendimiento (KPI o métricas) para medir el éxito

Las métricas deben seguir los criterios SMART.

  • Específicas: bien definidas, para que todo el equipo las entienda.
  • Medibles: es posible determinar si se alcanzó el KPI.
  • Alcanzables: el equipo tiene las habilidades y recursos para lograrlo.
  • Relevantes: el KPI está alineado con los objetivos de la organización.
  • Temporales: hay un plazo para alcanzar el objetivo.

Ejemplo no SMART: "Aumentar la conversión del sitio web"

Ejemplo SMART: "Optimizar el diseño y la experiencia de usuario del sitio web para incrementar la tasa de conversión un 10% antes de que acabe el Q2"

Delimitar el alcance

  • ¿Cuáles son los entregables del proyecto?
  • ¿Qué requisitos tienen esos entregables?
  • ¿Qué quedará fuera del proyecto?

Redactar un plan de proyecto

  • Fija hitos para los pasos intermedios.
  • Define un calendario para alcanzar cada hito.
  • Escribe una breve descripción de cada paso.

Estimar el impacto del proyecto

  • Cuantifica el beneficio para la organización si se alcanzan los objetivos.
  • Si hay incertidumbre en el cálculo, proporciona un rango o intervalo de confianza.
  • Enumera los beneficios cualitativos que no puedan cuantificarse.

Estimar el esfuerzo del proyecto

  • ¿Cuánto costará el proyecto?
  • ¿Cuánto tiempo llevará?
  • ¿Qué recursos necesitará?

Estimar los riesgos del proyecto

  • Enumera todos los riesgos del proyecto.
  • Para cada riesgo, calcula el impacto como probabilidad de que ocurra por la gravedad si ocurre.

Decidir si seguir adelante con el proyecto

En función del impacto esperado frente al esfuerzo y los riesgos, decide si

  • sigues adelante ahora.
  • lo pones en pausa porque hay otros con mayor prioridad.
  • lo cancelas.

Definir la responsabilidad de cada parte interesada

Usa el modelo RACI. Para cada tarea, determina quién es

  • Responsible: quien ejecuta el trabajo.
  • Accountable: quien toma las decisiones clave.
  • Consulted: a quien se le pide opinión para decisiones clave.
  • Informed: a quien hay que informar de las decisiones clave.

Definir una estrategia de comunicación

  • ¿Cómo os mantendréis en contacto?
  • ¿Con qué cadencia habrá reuniones?

Identificar las fuentes de datos

  • ¿Tienes ya acceso a estos datos?
  • ¿Dónde se almacenan?
  • ¿En qué formato están?
  • ¿Cuán grande es el conjunto de datos?
  • ¿Dispones de un diccionario de datos que explique su significado?
  • ¿Puede crearse data sintética para un prueba de concepto?

Prever necesidades regulatorias

  • ¿Se auditará algún entregable (por ejemplo, modelos financieros)?
  • ¿Es legal usar todas las fuentes de datos o variables?

Elegir un stack tecnológico

  • Acordad las herramientas para almacenar, procesar y modelizar los datos.

Redactar un project charter

  • Resume en un documento breve lo decidido para el proyecto: objetivos, personas implicadas, KPI, plan, fuentes de datos, stack tecnológico y estrategia de comunicación.

Recopilación y exploración de datos 

¿Qué hacer?

¿Cómo hacerlo?

Dar a los data scientists acceso a todos los datasets

  • Configura los permisos adecuados para cada dataset.
  • Compra cualquier dataset comercial o usa datos sintéticos con propiedades similares.

Ingerir los datos

  • Para cada fuente, muévela al entorno de analítica.

Explorar los datos

  • Visualiza la distribución de cada variable con histogramas o gráficos de barras.
  • Cuantifica los valores ausentes de cada variable.
  • Visualiza la relación entre las variables explicativas y la variable objetivo con dispersogramas, histogramas, diagramas de caja o un mapa de calor.

Redactar un informe de calidad de datos

Para cada dataset

  • Proporciona un resumen del conjunto de datos.
  • Describe los problemas de calidad a alto nivel.
  • Describe la calidad de la variable objetivo.
  • Describe la calidad de cada variable.
  • Describe la relación entre cada variable y la variable objetivo.

Decidir si seguir con el proyecto

En función del informe de calidad de datos, decide si

  • continúas con el proyecto.
  • lo pausas mientras recopilas más datos.
  • lo cancelas.

Construir una canalización de datos

Normalmente habrá que actualizar los datos de forma regular según avanza el proyecto. La canalización de datos 

  • debe automatizar la ingesta y la limpieza.
  • debe ejecutarse con una programación (actualizaciones por lotes) o de forma continua (streaming).

Documentar la canalización de datos

  • Dibuja un diagrama con los pasos de la canalización y sus dependencias.
  • Describe qué ocurre en cada paso.

Modelización y pruebas

Esto cubre tanto proyectos basados en machine learning como experimentación tipo A/B testing. Omite los pasos que no apliquen a tu caso. 

Modelización 

¿Qué hacer?

¿Cómo hacerlo?

Formular una hipótesis

  • ¿Tiene sentido la hipótesis en el dominio de negocio?
  • ¿Puedes medir el resultado?
  • ¿Tienes datos suficientes para detectar un efecto estadísticamente significativo?
  • ¿Hay sesgos estadísticos a tener en cuenta?

Dividir los datos en conjuntos de entrenamiento y prueba

Asegúrate de hacerlo antes de empezar con la ingeniería de variables para evitar fugas de información.

Ingeniería de variables

Crea variables para tu modelo con técnicas como:

  • Centrar o escalar variables numéricas.
  • Crear variables categóricas a partir de numéricas mediante binning.
  • Aplicar transformaciones Box-Cox o Yeo-Johnson a variables numéricas para aproximarlas a una distribución normal.
  • Combinar categorías raras o relacionadas en variables categóricas.
  • Extraer o combinar partes de fechas y horas.
  • Crear nuevas variables a partir de estadísticas resumidas.
  • Extraer métricas cuantitativas de texto y otros datos no estructurados.

Ajustar el modelo o ejecutar un experimento

  • Empieza por el modelo más simple y aumenta la complejidad gradualmente.
  • Para datasets grandes, valora modelizar con una muestra.

Evaluar los resultados

Usa métricas como exactitud, precisión y recall para cuantificar el rendimiento del modelo. Si el rendimiento no es suficiente:

  • ¿Puedes recopilar datos adicionales?
  • ¿Puedes generar más variables?
  • ¿Puedes probar otros algoritmos?

Informar de los resultados

  • Ofrece actualizaciones periódicas a las personas interesadas.
  • Adapta el lenguaje al público de negocio frente al técnico.
  • Informa tanto de los éxitos como de los fallos.

Pruebas

¿Qué hacer?

¿Cómo hacerlo?

Crear una batería de pruebas

Define pruebas que se ejecuten automáticamente para comprobar el rendimiento del modelo o experimento y detectar errores introducidos al iterar. Pueden incluir:

  • Pruebas unitarias del código.
  • Backtesting para una cartera u otras series temporales.

Validar el impacto en negocio

Con las métricas de rendimiento del modelo podrás cuantificar mejor el impacto esperado en el negocio. Coméntalo con las partes de negocio.

Validar el enfoque técnico

Comprueba que el modelo final es técnicamente adecuado.

  • ¿Se cumplen los supuestos del modelo?
  • ¿Son los resultados sensibles a la muestra de datos?
  • ¿Son adecuados los hiperparámetros?
  • ¿Puede otra persona reproducir tu modelo?

Validar la posibilidad de despliegue

  • ¿Se pueden gestionar todos los valores de entrada o casos de uso posibles?
  • ¿Están disponibles en producción todas las fuentes de datos necesarias?
  • ¿Puede el modelo fallar de forma controlada si falta alguna fuente?
  • ¿Se pueden generar predicciones con la rapidez necesaria?

Conservar resultados nulos

Todo lo que no llegue a producción debe registrarse en un repositorio de conocimiento para que futuros proyectos no repitan los mismos intentos.

Despliegue y test con usuarios

Despliegue

¿Qué hacer?

¿Cómo hacerlo?

Desarrollar una canalización de datos

  • Configura un DAG (Directed Acyclic Graph) para llevar todas las fuentes de datos al entorno de producción.
  • Programa actualizaciones automáticas de los datos.

Desarrollar una canalización de modelos

  • Divide el flujo del modelo en tareas y combínalas en una canalización.

Operativizar el modelo

Proporciona una API para que paneles, sitios web u otro software puedan acceder al modelo.

Diseñar un plan de monitorización

  • Define métricas a seguir, incluidas métricas de rendimiento y de seguridad que alerten si has introducido un error.
  • Establece límites con rangos aceptables para esas métricas.
  • Decide cómo quieres recibir alertas si las métricas se salen de rango.

Despliegue gradual con A/B test

  • Ofrece la nueva funcionalidad o modelo a una muestra aleatoria de personas usuarias.
  • Supervisa de cerca las métricas elegidas, pero evita declarar un ganador hasta tener significancia estadística.

Analizar e informar de los resultados del A/B test

  • Compara las métricas que decidiste seguir para cada grupo.
  • Informa de los resultados, incluso si la prueba no fue un éxito.

Despliegue al grueso o a la totalidad de personas usuarias

Si la prueba fue un éxito, despliega la funcionalidad o el modelo al grueso o a la totalidad de usuarios.

  • Incluir un pequeño grupo de control que no reciba la novedad te permitirá medir a largo plazo cuánto mejora el rendimiento con la nueva funcionalidad o modelo.

Pruebas con usuarios

¿Qué hacer?

¿Cómo hacerlo?

Redactar un informe final

Resume el estado del proyecto y lo aprendido.

  • Incluye una visión general del proyecto.
  • Resume el problema de negocio abordado.
  • Describe las fuentes de datos y su procesamiento.
  • Describe las técnicas de modelización usadas y cómo se validó el modelo.
  • Resume la arquitectura de la solución.
  • Detalla los beneficios para la empresa y para el cliente.
  • Recoge aprendizajes sobre la ejecución del proyecto, data science, el dominio de negocio y el producto.
  • Indica los próximos pasos.

Recoger feedback de clientes

  • Realiza encuestas y entrevistas con personas usuarias.
  • Monitoriza reseñas, valoraciones y redes sociales.

Monitorización

¿Qué hacer?

¿Cómo hacerlo?

Desarrollar la canalización de monitorización

Configura una canalización para seguir automáticamente las métricas de rendimiento y seguridad definidas en el plan de monitorización.

Crear paneles

Crea paneles para seguir la evolución de estas métricas en el tiempo.

Configurar alertas

Configura alertas para que te avisen por email, Slack, etc., cuando las métricas salgan del rango aceptable.

Temas
Ciencia de datos
Relacionado

blog

28 proyectos de análisis de datos para todos los niveles en 2026

Explora nuestra lista de proyectos de análisis de datos para principiantes, estudiantes de último curso y profesionales. La lista consta de proyectos guiados/no guiados y tutoriales con código fuente.
Abid Ali Awan's photo

Abid Ali Awan

13 min

blog

Las 15 habilidades más importantes para los científicos de datos en 2026

Una lista de las habilidades imprescindibles que todo científico de datos debería tener en su caja de herramientas, incluidos recursos para desarrollar tus habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

R Project

blog

Las 8 mejores ideas de proyectos R para 2026

Descubre qué es R y todas las ventajas de utilizarlo, con ejemplos e ideas nuevas para un proyecto.
Elena Kosourova's photo

Elena Kosourova

14 min

blog

Explorando 12 de las mejores herramientas de visualización de datos en 2023 con ejemplos

Existen muchas herramientas de visualización de datos. En este artículo, hemos preparado una lista exhaustiva de algunas de las herramientas de visualización de datos más útiles en la ciencia de datos.
Javier Canales Luna's photo

Javier Canales Luna

12 min

Machine Learning

blog

33 proyectos de machine learning para todos los niveles en 2026

Proyectos de machine learning para principiantes, estudiantes de último año y profesionales. La lista incluye proyectos guiados, tutoriales y código fuente de ejemplo.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Preparación de la entrevista sobre ciencia de datos

Averigüe cómo prepararse para una entrevista sobre ciencia de datos. Sepa qué esperar y cómo abordar la entrevista técnica sobre ciencia de datos.

Artur Sannikov

12 min

Ver MásVer Más