Una buena gestión de proyectos aumenta la eficiencia y la productividad, además de reducir el riesgo de fracaso. Por desgracia, los proyectos de data science pueden ser especialmente complicados de gestionar, ya que implican a personas de muchos equipos y deben equilibrar objetivos de negocio y técnicos.
Los marcos de gestión de proyectos te ayudan a planificar, asignar recursos y ejecutar tareas para alcanzar tus objetivos a tiempo y dentro del presupuesto.
Esta infografía sintetiza los puntos clave de dos marcos de referencia líderes —Team Data Science Process de Microsoft y Domino Data Science Life Cycle de Domino Data Lab— en una práctica lista de verificación que podrás usar en tus propios proyectos.
Ten a mano esta infografía
Descárgate esta infografía y tenla a mano para tu próximo proyecto de ciencia de datos
Cómo usar esta chuleta
Esta chuleta resume las mejores prácticas de gestión de proyectos de data science recogidas del Team Data Science Process de Microsoft y el Domino Data Science Life Cycle de Domino Data Lab, combinando los principios de CRISP-DM con los de los marcos Agile y Scrum de desarrollo de software. ¡Usa esta lista de verificación al planificar tu próximo proyecto de data science!
Principios para una gestión eficaz de proyectos de data science
Como regla general, los proyectos de data science que triunfan suelen compartir estas características:
- Medibles: ¿puedes cuantificar el éxito del proyecto y su impacto en el negocio?
- Fiables: ¿qué proporción de proyectos alcanzó sus objetivos?
- Escalables: ¿puede aumentarse el número de proyectos sin degradar de forma notable la fiabilidad?
Además, los equipos de datos deberían seguir estos principios al gestionar proyectos de data science:
- Iterar: rara vez un proyecto va en línea recta de principio a fin. A medida que avanzas, aprendes cosas que exigen revisiones. En línea con Scrum y Agile, vuelve a pasos anteriores cuando sea necesario.
- Reutilizar y reciclar: empezar cada proyecto desde cero consume tiempo y es ineficiente. Reutilizar componentes de un proyecto a otro —código, variables del modelo o plantillas— evita reinventar la rueda.
- Garantizar la reproducibilidad: explicar y justificar el trabajo suele ser más difícil que hacerlo. Tu metodología y resultados pueden ser auditados por un regulador o por el cliente, o quizá necesites revisarlos más adelante. Adoptar técnicas de investigación reproducible te ahorrará tiempo y reducirá riesgos por errores no detectados.
Lista de verificación para proyectos de data science
Tanto Microsoft como Domino Data Lab proponen fases similares para un proyecto de data science. A continuación resumimos estas fases en un marco unificado:
Definición del contexto e ideación
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Identificar el problema de negocio a resolver |
Debes dejar claro por qué se emprende el proyecto de la forma más inequívoca posible. |
|
Identificar a las personas implicadas |
Los roles pueden incluir project manager, data scientist, account manager y data administrator. |
|
Revisar trabajos previos |
Repasa proyectos existentes que hayan abordado algo similar.
|
|
Definir indicadores clave de rendimiento (KPI o métricas) para medir el éxito |
Las métricas deben seguir los criterios SMART.
Ejemplo no SMART: "Aumentar la conversión del sitio web" Ejemplo SMART: "Optimizar el diseño y la experiencia de usuario del sitio web para incrementar la tasa de conversión un 10% antes de que acabe el Q2" |
|
Delimitar el alcance |
|
|
Redactar un plan de proyecto |
|
|
Estimar el impacto del proyecto |
|
|
Estimar el esfuerzo del proyecto |
|
|
Estimar los riesgos del proyecto |
|
|
Decidir si seguir adelante con el proyecto |
En función del impacto esperado frente al esfuerzo y los riesgos, decide si
|
|
Definir la responsabilidad de cada parte interesada |
Usa el modelo RACI. Para cada tarea, determina quién es
|
|
Definir una estrategia de comunicación |
|
|
Identificar las fuentes de datos |
|
|
Prever necesidades regulatorias |
|
|
Elegir un stack tecnológico |
|
|
Redactar un project charter |
|
Recopilación y exploración de datos
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Dar a los data scientists acceso a todos los datasets |
|
|
Ingerir los datos |
|
|
Explorar los datos |
|
|
Redactar un informe de calidad de datos |
Para cada dataset
|
|
Decidir si seguir con el proyecto |
En función del informe de calidad de datos, decide si
|
|
Construir una canalización de datos |
Normalmente habrá que actualizar los datos de forma regular según avanza el proyecto. La canalización de datos
|
|
Documentar la canalización de datos |
|
Modelización y pruebas
Esto cubre tanto proyectos basados en machine learning como experimentación tipo A/B testing. Omite los pasos que no apliquen a tu caso.
Modelización
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Formular una hipótesis |
|
|
Dividir los datos en conjuntos de entrenamiento y prueba |
Asegúrate de hacerlo antes de empezar con la ingeniería de variables para evitar fugas de información. |
|
Ingeniería de variables |
Crea variables para tu modelo con técnicas como:
|
|
Ajustar el modelo o ejecutar un experimento |
|
|
Evaluar los resultados |
Usa métricas como exactitud, precisión y recall para cuantificar el rendimiento del modelo. Si el rendimiento no es suficiente:
|
|
Informar de los resultados |
|
Pruebas
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Crear una batería de pruebas |
Define pruebas que se ejecuten automáticamente para comprobar el rendimiento del modelo o experimento y detectar errores introducidos al iterar. Pueden incluir:
|
|
Validar el impacto en negocio |
Con las métricas de rendimiento del modelo podrás cuantificar mejor el impacto esperado en el negocio. Coméntalo con las partes de negocio. |
|
Validar el enfoque técnico |
Comprueba que el modelo final es técnicamente adecuado.
|
|
Validar la posibilidad de despliegue |
|
|
Conservar resultados nulos |
Todo lo que no llegue a producción debe registrarse en un repositorio de conocimiento para que futuros proyectos no repitan los mismos intentos. |
Despliegue y test con usuarios
Despliegue
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Desarrollar una canalización de datos |
|
|
Desarrollar una canalización de modelos |
|
|
Operativizar el modelo |
Proporciona una API para que paneles, sitios web u otro software puedan acceder al modelo. |
|
Diseñar un plan de monitorización |
|
|
Despliegue gradual con A/B test |
|
|
Analizar e informar de los resultados del A/B test |
|
|
Despliegue al grueso o a la totalidad de personas usuarias |
Si la prueba fue un éxito, despliega la funcionalidad o el modelo al grueso o a la totalidad de usuarios.
|
Pruebas con usuarios
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Redactar un informe final |
Resume el estado del proyecto y lo aprendido.
|
|
Recoger feedback de clientes |
|
Monitorización
| ¿Qué hacer? |
¿Cómo hacerlo? |
|
Desarrollar la canalización de monitorización |
Configura una canalización para seguir automáticamente las métricas de rendimiento y seguridad definidas en el plan de monitorización. |
|
Crear paneles |
Crea paneles para seguir la evolución de estas métricas en el tiempo. |
|
Configurar alertas |
Configura alertas para que te avisen por email, Slack, etc., cuando las métricas salgan del rango aceptable. |


