Pon el foco en bases de datos sólidas y en el tooling adecuado
Conseguir datos de calidad ya es, de por sí, un gran reto. A las empresas que quieran sacar partido del machine learning, la inteligencia artificial y la ciencia de datos les recomendamos revisar la jerarquía de necesidades de la IA de Monica Rogati, que sitúa el machine learning cerca de la cima como una de las piezas finales del puzle.

Fuente: Hackernoon
Esta jerarquía muestra que, antes de llegar al machine learning, necesitas bases de datos sólidas y herramientas para extraer, cargar y transformar datos (ETL), además de soluciones para limpiar y agregar información procedente de fuentes diversas.
Esto requiere buenas prácticas de ingeniería de datos: tendrás que aprovechar bases de datos, entender cómo procesar los datos correctamente, programar tus flujos de trabajo y usar computación en la nube.
Así que, antes de contratar a tu primer ingeniero o ingeniera de machine learning, establece primero las funciones de ingeniería de datos, ciencia de datos y análisis de datos.
Vigila los sesgos en tus datos y algoritmos
El machine learning solo puede ser tan bueno como los datos que le das. Si tus datos están sesgados, tu modelo también lo estará. Por ejemplo, Amazon creó una herramienta de selección basada en ML para predecir el éxito de candidaturas a partir de currículos con diez años de datos de entrenamiento que favorecían a hombres por la histórica dominancia masculina en el sector tecnológico, lo que provocó que la herramienta también mostrara sesgo contra las mujeres.
Por eso la ética de datos ha ganado tanta importancia en los últimos años. A medida que se genera más y más información, el impacto de cómo se utiliza también se multiplica. Esto exige actuar con principios y monitorizar de forma continua. Como ha señalado Cassie Kozyrkov, Chief Decision Scientist de Google, un profesor solo es tan bueno como los libros que utiliza para enseñar. Si los libros están sesgados, las lecciones también lo estarán.
Mantén tu modelo bajo control y mejóralo
Recuerda que el trabajo del machine learning no termina cuando tu modelo entra en producción, hace predicciones o realiza clasificaciones. Los modelos en producción que ya están funcionando también necesitan ser monitorizados y mantenidos.
Si tienes un modelo que predice fraude con tarjeta de crédito a partir de datos de transacciones, obtienes información valiosa cada vez que el modelo hace una predicción y actúas en consecuencia. Además, la actividad que intentas vigilar y predecir —en este caso, el fraude con tarjeta— puede ser dinámica y cambiar con el tiempo. Este fenómeno, donde los datos generados están en constante evolución, se denomina deriva de datos (data drift) y demuestra lo esencial que es actualizar tu modelo con regularidad.

Fuente: DataBricks




