Muchas organizaciones están adoptando prácticas de data science como parte de sus iniciativas de transformación digital. Sin embargo, la mayoría no obtendrá los beneficios de explotar sus datos sin una estrategia de datos y un plan claro para escalar el data science dentro de la empresa. McKinsey descubrió que solo ocho de cada 1.000 empresas en procesos de transformación digital lograron escalar el data science más allá de unos pocos proyectos piloto.
Además, aunque la mayoría entiende el valor de ser una organización basada en datos, muchas tratan el data science como una función centralizada y aislada que responde a peticiones de distintos equipos. Esto choca con lo que debería ser el data science: un medio para lograr objetivos de negocio. Como afirma Peter Wang, CEO de Anaconda, el data science es "un modo de indagación y exploración" para orientarse en el mundo empresarial.
Del mismo modo que una persona física utiliza las matemáticas para razonar sobre el mundo natural, los data scientists aprovechan herramientas matemáticas y computacionales para razonar sobre el mundo de los negocios. —Peter Wang, CEO de Anaconda
Este efecto de trabajo en silos se agrava por la falsa premisa de que el objetivo final del data science debe ser siempre crear modelos de inteligencia artificial que automaticen o optimicen grandes áreas de producción. Las empresas que buscan retornos inmediatos se decepcionan al ver que, a menudo, no es así.
Esta visión estrecha atribuye el valor del data science a analítica predictiva de difícil implantación (es decir, predecir el futuro con datos) y pasa por alto la infraestructura necesaria para hacer machine learning a escala. Sin embargo, gran parte del valor proviene de implantar analítica descriptiva más sencilla (capacidad para describir los datos y ponerlos en las manos adecuadas) y analítica prescriptiva (tomar decisiones basadas en datos).

Completar una transformación digital con éxito exige desarrollar competencias organizativas en data science y analítica. Para ello, hay que construir y ejecutar una estrategia de datos inteligente, inclusiva y escalable.
Aquí entra en juego nuestro marco IPTOP. IPTOP define cinco pilares (I nfraestructura, P ersonas, H erramientas, O rganización y P rocesos) para ejecutar tu estrategia de datos de forma escalable y culminar una transformación digital con éxito. Únete a nuestra próxima serie de seminarios web para saber más.
Infraestructura
El objetivo de cualquier estrategia de datos es convertir datos en bruto en información y decisiones. Para ello, las organizaciones deben recopilar, registrar y almacenar sus datos de forma segura y eficiente, y que sean accesibles para todos. Pero los datos suelen recogerse en formatos, estructuras y tamaños muy distintos. Las diversas bases de datos, data lakes, data warehouses, scripts y paneles que ayudan en este proceso conforman la infraestructura de datos. Construir una infraestructura sólida exige conocer y aplicar buenas prácticas.
Personas
Entender el data science como un medio para tomar mejores decisiones permite construir equipos según las habilidades necesarias. Un enfoque basado en roles implica identificar, evaluar y alinear los objetivos de rendimiento con las competencias requeridas para alcanzar metas de negocio, como predecir el churn o visualizar datos en paneles. El resultado son itinerarios de aprendizaje específicos para cada rol.
Un buen ejemplo es la Data University de Airbnb, su programa de formación propio para dotar a toda la plantilla de las habilidades necesarias para tomar decisiones basadas en datos. Capacitar a empleados que no son data scientists de formación para convertirse en Citizen Data Scientists capaces de decidir con criterio ha liberado tiempo del equipo de data science para proyectos más estratégicos.
Herramientas
Si la infraestructura permite extraer información de los datos, las herramientas facilitan e incentivan la adopción de un lenguaje común de datos en toda la organización. Usar herramientas de acceso, análisis, visualización y paneles hace a las organizaciones más eficientes y reduce el tiempo hasta conseguir insights. Estas herramientas van desde lenguajes open source como Python, R y SQL hasta soluciones de apuntar y hacer clic como Power BI, Tableau y Excel.
Crear marcos específicos de la organización que simplifiquen el acceso a los datos sobre estas herramientas reduce notablemente las barreras para escalar el data science. En DataCamp, contamos con paquetes propios de Python y R que abstraen la conexión a data lakes, la consulta y la agregación con comandos sencillos. Cualquiera puede responder preguntas como "¿Cuál fue la valoración del curso X en las últimas Y semanas?" con una o dos líneas de código. De forma similar, Airbnb tiene un paquete de R que facilita consultar y visualizar datos con su estética deseada, eliminando la incertidumbre y garantizando análisis y visualizaciones consistentes en toda la empresa.

Organización
Una dimensión clave de una estrategia de datos es cómo se organizan los profesionales de datos. Dado que la estructura de reporting y las agendas marcan el trabajo en la mayoría de empresas, la estructura organizativa debe prepararte para un éxito sostenible. Existen compensaciones entre un modelo centralizado, donde los data scientists pertenecen a un único equipo, y un modelo descentralizado, donde están integrados en distintos departamentos.
En el modelo centralizado, un equipo de data science prioriza y atiende las solicitudes de información de otros departamentos. Aquí entran preguntas y se esperan respuestas. Esto permite que el equipo se convierta en un centro de excelencia, donde los data scientists colaboran y comparten conocimiento bajo una dirección estratégica única. Sin embargo, también aísla a los equipos y sus herramientas, complicando la coordinación y la comunicación con el resto.
En el modelo descentralizado, los data scientists se integran en distintos departamentos. Así, el data science tiene voz y voto para influir en la estrategia de su área, a medida que adquieren el conocimiento del dominio necesario para tener éxito. No obstante, al estar dispersos y gestionados por responsables del negocio, puede resentirse su crecimiento, aprendizaje, desarrollo y capacidad de colaborar.
Estos dos modelos deben verse como extremos de un espectro. Existen múltiples modelos híbridos que combinan elementos de ambos, con distintas formas de agrupar y coordinar departamentos para maximizar el valor del data science a escala.

Procesos
Por último, para construir una estrategia de datos escalable hay que alinear convenciones, buenas prácticas y procesos. Fomentar esta alineación es esencial para facilitar la colaboración y evitar una organización en silos. Así, todos los equipos pueden trabajar y comunicarse sin fricciones con un lenguaje común de datos.
Una forma sencilla de empezar es crear una estructura y plantilla de proyecto predefinida, donde se detallen por adelantado las tareas y subtareas de un proyecto de analítica con sus requisitos. Microsoft ha adoptado The Team Data Science Process, que permite a cualquier parte interesada comprender claramente los requisitos del proyecto, usar plantillas para análisis de datos y acceso a cómputo, e identificar a los responsables de cada fase.
Según tu organización y sector, las plantillas predefinidas pueden estar sujetas a requisitos normativos específicos y requerir procesos complejos. Puedes utilizar herramientas open source para establecer plantillas de estructura de proyecto y reforzar la alineación entre equipos y profesionales de datos.
Haz la evaluación de madurez en datos para entender mejor cómo aborda tu equipo los datos.
