
Un proyecto de data science tiene muchos componentes que requieren colaboración para desplegarse con éxito. Con todas estas piezas conectadas, es clave adoptar un enfoque ágil tanto en el desarrollo como en el despliegue. Este enfoque permite a las organizaciones aprender deprisa e iterar con rapidez. En un webinar reciente de DataCamp, Brian Campbell, Engineering Manager, Internal Engineering en Lucid Software, comparte las mejores prácticas para desplegar con éxito proyectos de data science.
Primeros pasos para fomentar un desarrollo ágil
Brian explica que hay dos pasos clave que pueden abordarse al inicio de un proyecto para avanzar en paralelo en el desarrollo y el despliegue de un modelo: trabajar con modelos de referencia (baselines) y crear un prototipo. Aunque estas estrategias pueden complicar el cronograma, permiten obtener resultados mucho más rápidos y de mayor calidad.
Trabaja con modelos de referencia
Un paso muy útil para poner en producción proyectos de machine learning es crear un modelo de referencia. Un baseline devuelve el mismo tipo de salidas que el modelo final. Sin embargo, se construye antes de la mayor parte del desarrollo y puede basarse en heurísticas o datos aleatorios. Este punto de partida marca el listón que las siguientes iteraciones deben superar.
A medida que el equipo desarrolla nuevos modelos, los resultados se comparan con el baseline y se extraen aprendizajes. La distancia entre el baseline y el estado deseado ayuda a definir los requisitos del proyecto y a identificar los datos y soluciones con más valor para el problema.
Trabaja con prototipos
Los prototipos son modelos que ingieren las mismas entradas y ofrecen el mismo formato de salidas que tendrá el modelo final. Este modelo puede apoyarse en el baseline. Cuando el prototipo está listo, quienes se encargan del despliegue pueden empezar a integrarlo en su uso previsto. El prototipo posibilita el progreso en paralelo: las personas de data science mejoran el modelo mientras el equipo de implementación define cómo se empaquetará para los clientes o dentro de un proceso de negocio.
Los prototipos solo funcionan cuando el modelo final se comporta igual que el prototipo. Por eso es necesario comprender los datos disponibles y el formato de salida deseado antes de crearlo. Esto exige conocer el proyecto más allá de la formulación inicial del problema y colaborar estrechamente con personas expertas en el dominio.
Caso de uso real de baselines y prototipos
Brian cuenta cómo su equipo en Lucid utilizó baselines y prototipos para acelerar el desarrollo de un modelo de clustering para un producto de notas adhesivas usado por equipos de producto, diseño e ingeniería. Estos equipos suelen realizar sesiones de design thinking en las que una persona facilitadora agrupa manualmente notas adhesivas similares bajo una categoría. El objetivo del sistema era reducir el tiempo entre la lluvia de ideas y el debate agrupando automáticamente las ideas en categorías y eliminando duplicados.

El modelo de referencia tomaba ideas aleatorias y generaba categorías aleatorias. Después, crearon un prototipo de este modelo para que el equipo de implementación pudiera empezar a trabajar desde las primeras fases del desarrollo. Con el tiempo, mejoraron el baseline utilizando procesamiento de lenguaje natural y machine learning para agrupar notas adhesivas similares.
La comunicación es clave con estos modelos
La primera iteración del proyecto tuvo problemas por falta de colaboración constante entre el equipo de despliegue y las personas de data science que trabajaban en el modelo. Esta falta de coordinación provocó problemas de rendimiento, pruebas inadecuadas y una mala experiencia de producto. No pudieron aprovechar las sinergias de desarrollar el modelo en paralelo.
Cuando relanzaron el proyecto y colaboraron de forma efectiva, resolvieron estos problemas y definieron expectativas realistas. La colaboración fue posible gracias a disponer de un prototipo con el que el equipo de despliegue pudo trabajar en paralelo al desarrollo del modelo por parte del equipo de data science.
Para conocer las lecciones aprendidas del proyecto y cómo gestionar con éxito proyectos de data science complejos, no te pierdas el webinar on-demand.


