Curso
Bienvenido a la última entrega de nuestra serie mensual Datos sin misterio. Como parte del Mes de la Competencia en Datos, esta serie ha aclarado conceptos clave del mundo de los datos e intentado responder a esas preguntas que quizá no te atrevías a hacer. Si quieres empezar por el principio, lee la primera entrada de la serie: ¿Qué es un conjunto de datos?

En esta entrega seguimos el hilo de la entrada anterior de Datos sin misterio para hablar de los posibles efectos perjudiciales de la IA, de cómo puede perpetuar sesgos contra ciertos colectivos y de los distintos tipos de sesgo en IA que todo el mundo debería conocer.
El problema del sesgo en la IA
La mayoría de los sistemas de IA actuales se apoyan en el aprendizaje automático. El aprendizaje automático, por definición, aplica técnicas estadísticas avanzadas para aprender patrones a partir de datos pasados y hacer predicciones sobre eventos futuros.
La adopción generalizada del aprendizaje automático ha provocado un fuerte aumento de casos en los que ha realizado predicciones sesgadas. Los algoritmos de IA con sesgos son una preocupación seria en la comunidad y son fruto de los datos usados para entrenar los modelos. El sesgo puede manifestarse de muchas formas: puede ser social o estructural, y afectar a un género, color, religión o nacionalidad concretos.
En consecuencia, los algoritmos de IA aprenden sesgos del conjunto de entrenamiento al intentar imitar el juicio humano. Recordemos algunos ejemplos del pasado en los que predicciones sesgadas de la IA han impactado negativamente en la sociedad y en la humanidad en su conjunto:
Sesgo de género: el motor de selección de Amazon
Amazon desarrolló un motor de reclutamiento para automatizar el cribado de currículos de personas candidatas a entrevistas. Sin embargo, el algoritmo reflejó el sesgo aprendido de los datos históricos y terminó eligiendo únicamente perfiles de candidatos hombres.
Sesgo racial: algoritmo PredPol
PredPol, o policía predictiva, construyó un mapa de calor de zonas con alta actividad delictiva e identificó áreas con alta presencia de minorías como puntos calientes. El algoritmo se entrenó con datos de entrada sesgados que recogían numerosos incidentes reportados en esas zonas.
Sesgo racial: algoritmo COMPAS
El software Correctional Offender Management Profiling for Alternative Sanctions (COMPAS) se utilizó para evaluar la probabilidad de reincidencia de una persona condenada. Sin embargo, la investigación de 2016 evidenció sesgos. El software etiquetaba a personas negras como más propensas a reincidir que a personas blancas.

Como se aprecia en los ejemplos anteriores, los algoritmos de aprendizaje automático aprenden sesgos del conjunto de entrenamiento además de otras regularidades de los datos. A menos que se atajen en el origen, los sesgos pueden aflorar en múltiples puntos de las canalizaciones de IA/ML. A medida que la IA se extiende en organizaciones y en la sociedad, todos deberíamos conocer los distintos tipos de sesgo de los sistemas de IA. A continuación, repasamos tres de los más comunes.
Tres tipos de sesgo en IA muy comunes
Sesgo por prejuicio
Cuando los datos de entrenamiento reflejan prejuicios, estereotipos y supuestos sociales existentes, estos sesgos se incorporan al modelo aprendido; a este tipo se le denomina sesgo por prejuicio. Por ejemplo, al buscar "médico", los resultados muestran en gran medida imágenes de médicos hombres, mientras que una búsqueda similar de "enfermera" devuelve imágenes de mujeres. Esto dice mucho de los estereotipos de género en la sociedad.
Sesgo por selección de muestra
El sesgo por selección de muestra aparece cuando los datos de entrenamiento no representan a la población objeto de estudio. Un ejemplo serían sistemas de IA entrenados para detectar cáncer de piel. Si el conjunto de datos original no es representativo de la población en general, este sistema rendirá peor para miembros de un grupo infrarrepresentado en el conjunto de datos.
Sesgo de medición
El sesgo de medición proviene de errores en la recogida o en el proceso de medición de los datos. Por ejemplo, si las imágenes de una cámara que alimenta un sistema de reconocimiento de imágenes son de mala calidad, podrían generar resultados sesgados contra poblaciones específicas. Otro ejemplo puede surgir del juicio humano. Por ejemplo, un algoritmo de diagnóstico médico puede entrenarse para predecir la probabilidad de enfermedad a partir de métricas indirectas, como las visitas al médico, en lugar de síntomas reales.
Desarrollar competencia en datos para una IA responsable
A lo largo de este mes hemos destacado la importancia de la competencia en datos para personas y organizaciones. Esta competencia permite que perfiles no técnicos se entiendan con especialistas en datos e IA y comprendan las limitaciones de los sistemas de IA. Y, sobre todo, fomenta un diálogo bidireccional entre expertos en la materia y expertos en IA que posibilita un debate meditado sobre el posible daño de un sistema de IA.
Para dotarte de los conocimientos necesarios y poder tener estas conversaciones, realiza nuestro curso Understanding Machine Learning y empieza tu camino hacia la competencia en datos. Para más contenidos sobre competencia en datos y Datos sin misterio, echa un vistazo a estos recursos:

