

En una entrada anterior, exploramos la importancia del machine learning (ML) y repasamos las cinco cosas más importantes que los líderes empresariales deben saber sobre ML. Para empezar, recuerda que el aprendizaje supervisado se centra en la predicción y la clasificación de datos. Ahora toca profundizar.
1. INTERPRETABILIDAD DEL MODELO
Vimos que la precisión (el porcentaje de tus datos que tu modelo predice/clasifica correctamente) no siempre es la mejor métrica para medir el éxito de un modelo, por ejemplo cuando las clases están desbalanceadas (como cuando el 99% de los correos son spam y el 1% no lo es). Otra situación en la que métricas como la precisión pueden no bastar es cuando necesitas que tu modelo sea interpretable. La interpretabilidad es, básicamente, la capacidad de explicar por qué tu modelo hace las predicciones que hace, algo necesario en muchos modelos desplegados en mercados financieros por motivos regulatorios. También es esencial en algoritmos que afectan a la vida y la libertad de las personas, como el modelo de riesgo de reincidencia COMPAS de Northpointe, cuyo resultado usan los jueces para tomar decisiones en vistas de libertad condicional. Existe una compensación inherente entre precisión e interpretabilidad: los modelos más precisos suelen ser cajas negras y poco interpretables. Aunque en tu sector ahora mismo no preocupe la interpretabilidad, conviene tenerla en el radar: la regulación la llevará a muchos otros sectores en los próximos años.
2. MONITORIZACIÓN Y MANTENIMIENTO DE TUS MODELOS DE ML EN PRODUCCIÓN
También es clave recordar que el trabajo en machine learning no termina cuando pones un modelo a predecir o a clasificar. Los modelos en producción necesitan monitorización y mantenimiento. Si tienes un modelo que predice fraude con tarjeta de crédito a partir de datos de transacciones, obtienes información valiosa cada vez que el modelo predice y actúas en consecuencia. Además, la actividad que intentas vigilar y predecir —el fraude con tarjetas— puede ser dinámica y cambiar con el tiempo. Este proceso se llama deriva de datos (data drift) y demuestra lo esencial que es actualizar tu modelo, ya que la forma en que se generan los datos está en constante cambio.
3. DEEP LEARNING
A estas alturas quizá te preguntes cuándo vamos a mencionar el deep learning, uno de los términos más de moda en ciencia de datos e IA. El deep learning es una forma de ML que utiliza modelos llamados redes neuronales, inspiradas de forma muy laxa en las redes neuronales biológicas del cerebro humano. Ten en cuenta que hasta ahí llega la analogía: el deep learning no equivale a la inteligencia humana.
La mayoría de aplicaciones de deep learning se dan en el ámbito supervisado, en tareas como la clasificación de imágenes (reconocimiento facial, coches autónomos, uso de drones para estimar el rendimiento de cultivos en AgTech) y el procesamiento del lenguaje natural (traducción de Google, clasificación de documentos, análisis de sentimiento). También hay aplicaciones en predicción de series temporales, como problemas de predicción financiera. Es importante subrayar que los sistemas de deep learning rara vez son buenos en más de una tarea: un algoritmo creado para reconocimiento facial no servirá para clasificar documentos legales. Aunque puedas llamar al deep learning una forma de IA, lo es en el sentido de inteligencia artificial estrecha, no de inteligencia artificial general, que sería el terreno de sistemas computacionales hipotéticos tan inteligentes como las personas en todos los ámbitos.
4. TRANSFER LEARNING
En un mundo en el que construir modelos de ML competitivos depende de datos de vanguardia y específicos del dominio, es normal preocuparse por no tener suficientes datos propios ni capacidad para recopilarlos. Pero no te preocupes: gran parte del futuro del ML pasará por usar modelos preentrenados, es decir, modelos ya entrenados con otros datos. Este es el mundo del transfer learning. Por ejemplo, puedes comprar un modelo de clasificación de imágenes preentrenado que reconozca y clasifique coches. Lo interesante del transfer learning es que puedes reentrenar esos modelos para tu pregunta y tu dominio concretos. Si quieres un algoritmo que clasifique camiones, puedes partir de uno que clasifique coches y seguir entrenándolo con fotos de camiones.
Actualmente están surgiendo mercados de algoritmos, como Modzy de Booz Allen, donde puedes comprar y vender modelos preentrenados. Ahora bien, hay preocupaciones legítimas, como cómo abordar los sesgos de datos y algorítmicos, y la gobernanza del modelo, cuando se intercambian algoritmos sin acceso a los conjuntos de datos con los que se entrenaron. [1] Es un espacio con gran potencial de crecimiento, pero también expuesto a abusos y a regulación.
5. MACHINE LEARNING Y TOMA DE DECISIONES
El último punto, que no me cansaré de enfatizar, es que el ML —y todo el trabajo con datos— debe estar directamente integrado en la función de toma de decisiones. Es decir, el ML no existe en el vacío: está ahí para servir a la decisión. Esto puede ser automático (como en Google Search), estar integrado en un proceso científico (cuando un algoritmo marca una resonancia para que la revise un especialista) o formar parte de procesos organizativos (por ejemplo, al decidir qué hacer con clientes con probabilidad de darse de baja).
Debes asegurarte de que el trabajo con datos refleje siempre tus necesidades reales y evitar los errores de tipo III, donde obtienes la respuesta correcta a la pregunta equivocada. Por eso el ámbito de la traducción de datos está ganando relevancia y es tan importante instaurar una cultura del dato en tu organización. Esto requiere que la plantilla entienda qué pueden y qué no pueden hacer la ciencia de datos y el ML, cómo formular buenas preguntas a los profesionales de datos y cómo establecer vías de comunicación sanas y productivas entre la función de datos y el resto de la empresa.
En resumen, las cinco cosas que necesitas saber sobre machine learning (además de las [cinco que mencioné antes]) son:
- Existe una compensación inherente entre precisión e interpretabilidad, pero la interpretabilidad (la capacidad de explicar por qué tu modelo hace las predicciones que hace) es cada vez más importante, especialmente en modelos desplegados en mercados regulados como el financiero.
- Los modelos de ML en producción deben monitorizarse y mantenerse para prevenir la deriva de datos.
- El deep learning puede ser muy eficaz en tareas específicas de aprendizaje supervisado como la clasificación de imágenes y el procesamiento del lenguaje natural.
- Si te preocupa no recopilar datos adecuados suficientes para un problema de negocio concreto, el creciente campo del transfer learning te permite reentrenar modelos preentrenados para tu pregunta y tu dominio.
- El ML —y todo el trabajo con datos— debe estar al servicio de la toma de decisiones para reflejar necesidades reales y establecer vías de comunicación productivas entre la función de datos y el resto de la empresa.
[1]: Desde la publicación de este artículo, Modzy se ha puesto en contacto y afirma "exigir que todos los modelos del marketplace incluyan detalles sobre la construcción del modelo, como la arquitectura, los conjuntos de datos de entrenamiento y validación, y las métricas de rendimiento para garantizar la transparencia en la construcción del modelo". Modzy remite a los lectores aquí para más información al respecto.


