Cours
Bienvenue dans le dernier article de notre série « données décryptées » qui a rythmé tout le mois. À l'occasion du Mois de la culture des données, cette série a clarifié des notions clés du monde de la donnée et tenté de répondre aux questions que vous n'osiez peut-être pas poser. Pour reprendre depuis le début, lisez notre premier article : Qu'est-ce qu'un jeu de données ?

Dans cet article, nous prolongeons le thème du billet précédent de données décryptées pour aborder les effets potentiellement préjudiciables de l'IA, la manière dont elle peut perpétuer des biais à l'encontre de certains groupes, et les différents types de biais d'IA que chacun devrait connaître.
Le problème des biais de l'IA
La plupart des systèmes d'IA actuels reposent sur l'apprentissage automatique. Par définition, l'apprentissage automatique applique des techniques statistiques avancées pour apprendre des schémas à partir de données passées et effectuer des prédictions sur des événements futurs.
L'adoption généralisée de l'apprentissage automatique a entraîné une forte hausse des cas de prédictions biaisées. Les algorithmes d'IA biaisés sont une préoccupation majeure au sein de la communauté et découlent des données utilisées pour entraîner les modèles. Le biais peut prendre de nombreuses formes : il peut être sociétal ou structurel et viser un genre, une couleur de peau, une religion ou une nationalité en particulier.
En conséquence, les algorithmes d'IA apprennent les biais présents dans les données d'entraînement lorsqu'ils tentent d'imiter le jugement humain. Revenons sur quelques exemples passés où des prédictions biaisées ont eu des effets négatifs sur la société et, plus largement, l'humanité :
Biais de genre : le moteur de recrutement d'Amazon
Amazon a développé un moteur de recrutement pour automatiser le filtrage des CV avant les entretiens. Cependant, l'algorithme a reproduit les biais appris à partir des données historiques et a fini par privilégier exclusivement les candidatures masculines.
Biais racial : l'algorithme PredPol
PredPol, ou Predictive Policing, générait une carte thermique des zones à forte criminalité et identifiait des lieux majoritairement habités par des minorités comme des « hot spots ». L'algorithme avait été entraîné sur des données d'entrée biaisées comprenant de nombreux signalements provenant de ces zones.
Biais racial : l'algorithme COMPAS
Le logiciel Correctional Offender Management Profiling for Alternative Sanctions (COMPAS) a servi à évaluer la probabilité de récidive d'un détenu. Toutefois, une enquête menée en 2016 a révélé un biais. Le logiciel estimait que les personnes noires étaient plus susceptibles de récidiver que les personnes blanches.

Comme l'illustrent ces exemples, les algorithmes d'apprentissage automatique apprennent, en plus d'autres régularités, les biais présents dans les données d'entraînement. S'ils ne sont pas traités à la source, ces biais peuvent se manifester à différents niveaux des chaînes IA/ML. À mesure que l'IA se généralise dans les organisations et la société, il est essentiel que chacun connaisse les différents types de biais des systèmes d'IA. Voici trois des biais les plus courants.
Trois types de biais d'IA courants
Biais de préjugé
Lorsque les données d'entraînement reflètent des préjugés, des stéréotypes et des présupposés sociétaux, ces biais s'ancrent dans le modèle appris : on parle alors de biais de préjugé. Par exemple, lorsque vous cherchez « médecin », les résultats d'image présentent majoritairement des médecins hommes, tandis qu'une recherche sur « infirmière » renvoie surtout des femmes. Cela en dit long sur les stéréotypes de genre dans la société.
Biais d'échantillonnage
Le biais d'échantillonnage survient lorsque les données d'entraînement ne sont pas représentatives de la population étudiée. Un exemple concerne les systèmes d'IA entraînés à détecter les cancers de la peau. Si le jeu de données d'origine n'est pas représentatif de la population globale, ce système sera moins performant pour les membres d'un groupe sous-représenté dans le jeu de données.
Biais de mesure
Le biais de mesure provient d'une erreur lors de la collecte ou de la mesure des données. Par exemple, si les images d'une caméra utilisée pour alimenter un système de reconnaissance d'images sont de mauvaise qualité, cela peut produire des résultats biaisés à l'encontre de certaines populations. Un autre cas peut découler du jugement humain : par exemple, un algorithme de diagnostic médical peut être entraîné à prédire la probabilité de maladie à partir d'indicateurs de substitution comme le nombre de visites chez le médecin au lieu de s'appuyer sur les symptômes réels.
Développer une culture des données pour une IA responsable
Tout au long de ce mois, nous avons souligné l'importance de la culture des données pour les individus et les organisations. La culture des données permet aux parties prenantes non techniques d'échanger avec des experts des données et de l'IA, et de comprendre les limites des systèmes d'IA. Surtout, elle favorise un dialogue bilatéral entre experts métiers et spécialistes de l'IA pour discuter de manière éclairée des risques potentiels d'un système d'IA.
Pour acquérir les connaissances nécessaires à ces échanges, suivez notre cours Understanding Machine Learning et lancez votre parcours de culture des données. Pour plus de contenus sur la culture des données et « données décryptées », consultez les ressources suivantes :