
Uno de los grandes motores de la rápida innovación y los avances en ciencia de datos ha sido la proliferación de herramientas open source centradas en el código. Gracias a ellas, data scientists e ingenieros de software han podido crear potentes abstracciones que facilitan enormemente el análisis de datos.
Por ejemplo, paquetes de R como dplyr y tidymodels permiten manipular datos y construir modelos de machine learning sofisticados con apenas unas líneas de código. De forma similar, paquetes de Python como tensorflow y pytorch permiten a cualquiera crear un modelo de deep learning con muy poco esfuerzo.
Aunque las herramientas basadas en código han impulsado el trabajo con datos, el futuro será mucho más amplio e incorporará interfaces gráficas de usuario (GUIs) que permitirán a un público mayor adentrarse en la ciencia de datos con herramientas de apuntar y hacer clic. Esto no significa, ni mucho menos, la desaparición del data scientist que programa. Igual que en la revolución industrial, este cambio permitirá que quienes codifican centren sus esfuerzos en resolver problemas más complejos y en construir interfaces para abordarlos, dejando el trabajo específico del dominio en manos de las personas expertas. Esto ya ocurre en distintas facetas del trabajo con datos: analítica descriptiva, predictiva y prescriptiva.
La analítica descriptiva es accesible gracias al business intelligence
La analítica descriptiva se ha hecho accesible a un público mucho más amplio gracias a las herramientas de business intelligence (BI) de arrastrar y soltar que hoy están por todas partes. Basta con mirar la adquisición el año pasado de Looker, una popular herramienta de BI, por 2.600 millones de dólares por parte de Google. También el año pasado, Salesforce completó la compra de Tableau, otra herramienta de BI muy extendida. Microsoft ha apostado por su propia solución, Power BI. (DataCamp ofrece cursos tanto de Tableau como de Power BI).
Las herramientas de business intelligence acercan el descubrimiento de datos a todos los niveles de habilidad, no solo a profesionales de analítica avanzada. Son una de las formas más sencillas de trabajar con datos: permiten centralizarlos, identificar qué palancas importan, prever resultados y mucho más.
Cómo las interfaces de arrastrar y soltar reducen la barrera de entrada a la analítica predictiva y prescriptiva
La democratización del trabajo con datos avanza también hacia la analítica predictiva y prescriptiva. Por ejemplo, Alteryx es una empresa valorada en 10.000 millones de dólares que ofrece una plataforma de ciencia de datos de arrastrar y soltar que permite a analistas de negocio manipular datos y construir modelos predictivos mediante una interfaz visual.
Google está invirtiendo mucho en su herramienta AutoML, que hace que la IA sea «tan simple como arrastrar y soltar». Vemos que Microsoft también está entrando en este espacio:

Arriba tienes un ejemplo de un modelo básico de regresión con una canalización de datos. Puedes ver cómo los datos fluyen de rectángulo en rectángulo: primero se ingieren, después se seleccionan columnas, se limpian los datos y, por último, se divide y entrena el modelo.
Hay muchos casos de uso potenciales para el machine learning de arrastrar y soltar. Dicho de otro modo: ¿qué perfiles dentro de una organización querrían usar herramientas de ML sin programar? Quizá tu equipo de customer success quiera modelar la fuga de clientes. Podrán hacerlo con herramientas automatizadas de arrastrar y soltar, evitando escribir modelos y código nuevos cada vez que entra un cliente. Del mismo modo, tu Chief People Officer y el equipo de RR. HH. usarán cada vez más modelos automatizados de machine learning en los flujos de selección, incluido el filtrado de currículos (enseguida hablamos de los riesgos). Y tu equipo de marketing puede querer aplicar estas herramientas al embudo de marketing, que cambió con la llegada del ML para la compra programática de anuncios. Otro ejemplo claro es la optimización de la cadena de suministro, que puede reducir significativamente costes en la organización y es un objetivo relativamente asequible.
Esta tendencia también se observa en ámbitos complejos como el deep learning. Por ejemplo, Lobe es una startup que acerca el deep learning a todo el mundo, permitiendo crear modelos con una GUI. Microsoft la adquirió incluso antes de salir de la beta, lo que demuestra la importancia de las GUIs en el futuro del sector.
Otro ejemplo es un buscador de imágenes creado por Google que permite a médicos explorar predicciones del modelo y ajustarlas con criterio humano. Abrir la caja negra y complementar los modelos de ML con inteligencia humana puede disparar la adopción y su impacto.
Vamos a ver más interfaces de arrastrar y soltar que reducirán la barrera de entrada. Esto nos permitirá decidir mejor qué herramientas queremos desarrollar internamente y cuáles preferimos adquirir a proveedores.
Los marketplaces algorítmicos permiten a quien no programa comprar modelos
Veremos cada vez más marketplaces para estos productos de ML. Modzy, de Booz Allen, es un mercado de apuntar y hacer clic donde puedes comprar modelos creados por otras personas para integrarlos en tu stack tecnológico.
Permitir que personas sin experiencia en programación o estadística usen estas herramientas conlleva riesgos. Debemos asegurarnos de que todo el mundo conoce los riesgos inherentes y cómo mitigarlos. Cada vez más, los avances en producto de estas herramientas se centrarán en ayudar a detectar resultados sesgados y a no aceptarlos sin más.
Cuidado con la zona de peligro del ML de arrastrar y soltar
Un juego educativo interesante de Mozilla Labs es Survival of the Best Fit, sobre sesgos en la contratación con IA. Te pones en la piel de una persona CEO que intenta escalar el proceso de selección con una herramienta automatizada que acaba desviando las prácticas de contratación.
Resumen
Veremos más trabajo con datos en GUIs, con interfaces de arrastrar y soltar y de apuntar y hacer clic. El espacio es cada vez más competitivo, con inversiones clave de grandes actores como Google y Microsoft, y lo que queda por venir. Y aunque gran parte de tu trabajo de ciencia de datos se haga hoy internamente, cada vez más tareas se desplazan a proveedores, lo que exige una amplia formación sobre riesgos y consecuencias de adoptar la IA.
Llamada a la acción
Anota cuánto del trabajo del día a día en tu organización se hace actualmente con código. Puedes expresarlo en horas de dedicación o en coste real para la organización. Después, calcula cuánto se hace en GUIs, con apuntar y hacer clic y de arrastrar y soltar. ¿Cómo crees que cambiará esto en los próximos 24 meses?
Descubre más sobre cómo preparar tu programa de datos para el futuro del trabajo en The Definitive Guide to Machine Learning for Business Leaders.





