

Dans un article précédent, nous avons souligné l’importance de l’apprentissage automatique (machine learning, ML) et passé en revue les cinq points clés que tout dirigeant doit connaître. Rappelons d’abord que l’apprentissage supervisé concerne la prédiction et la classification de données. Passons maintenant à l’étape suivante.
1. Interprétabilité des modèles
Nous avons vu que la précision (le pourcentage de données correctement prédites/classées par votre modèle) n’est pas toujours le meilleur indicateur de réussite, notamment lorsque les classes sont déséquilibrées (par exemple, 99 % d’e-mails indésirables pour 1 % de non indésirables). Un autre cas où des métriques comme la précision ne suffisent pas, c’est lorsque votre modèle doit être interprétable. L’interprétabilité est la capacité d’expliquer pourquoi un modèle produit ses prédictions. Elle est exigée dans de nombreux modèles déployés sur les marchés financiers pour des raisons réglementaires. Elle est également essentielle pour les algorithmes qui impactent la vie et la liberté des personnes, comme le modèle de risque de récidive COMPAS de Northpointe, dont la sortie est utilisée par des juges lors d’audiences de libération conditionnelle (enquête ProPublica). Il existe un compromis structurel entre précision et interprétabilité : les modèles les plus précis sont souvent des boîtes noires et donc peu interprétables. Même si votre secteur n’est pas encore concerné par l’interprétabilité, c’est un sujet à suivre de près : la réglementation l’imposera à de nombreuses autres industries dans les années à venir.
2. Surveiller et maintenir vos modèles de ML en production
Il est tout aussi essentiel de se rappeler que le travail ne s’arrête pas une fois le modèle déployé pour prédire ou classifier. Les modèles en production doivent être surveillés et maintenus. Si vous prédisez la fraude à la carte bancaire à partir de données de transaction, chaque prédiction exploitée vous fournit un retour utile. En parallèle, l’activité que vous cherchez à détecter et prévoir — la fraude — est dynamique et évolue dans le temps. Ce phénomène, appelé data drift (dérive des données), montre à quel point il est crucial de mettre à jour le modèle, car la façon dont les données sont générées change en permanence.
3. Deep learning
À ce stade, vous vous demandez peut-être quand nous allons parler de deep learning, l’un des termes les plus en vue en data science et en IA. Le deep learning est une forme de ML qui s’appuie sur des réseaux de neurones, librement inspirés des réseaux neuronaux biologiques du cerveau humain. Notons que l’analogie s’arrête là : le deep learning n’équivaut pas à l’intelligence humaine.
La majorité des applications du deep learning relèvent de l’apprentissage supervisé, notamment la classification d’images (reconnaissance faciale, voitures autonomes, analyse d’images de drones pour estimer les rendements en AgTech) et le traitement du langage naturel (traduction Google, classification de documents, analyse de sentiments). On trouve également des usages en prévision de séries temporelles, comme certaines prédictions financières. Il est important de souligner que ces systèmes excellent rarement dans plus d’une tâche : un algorithme conçu pour la reconnaissance faciale ne sera pas performant pour classer des documents juridiques. Même si l’on parle d’IA, il s’agit d’une intelligence artificielle « étroite », et non d’une intelligence artificielle générale, hypothétique, qui serait globalement au niveau de l’humain.
4. Apprentissage par transfert
Dans un monde où la performance des modèles de ML dépend de données de pointe et spécifiques à un domaine, il est légitime de s’inquiéter de ne pas disposer soi-même de suffisamment de données ni des moyens de les collecter. Rassurez-vous : une grande partie de l’avenir du ML repose sur l’usage de modèles préentraînés, c’est‑à‑dire déjà entraînés sur d’autres données. C’est le domaine de l’apprentissage par transfert. Par exemple, vous pouvez acquérir un modèle de classification d’images capable de reconnaître et classer des voitures. L’intérêt de l’apprentissage par transfert est que vous pouvez réentraîner ces modèles sur votre question et votre domaine. Si vous souhaitez un algorithme qui classe des camions, vous pouvez partir d’un modèle qui classe des voitures et le spécialiser avec des photos de camions.
On voit émerger des places de marché d’algorithmes, comme Modzy de Booz Allen, où acheter et vendre des modèles préentraînés. Des questions de fond se posent toutefois, notamment sur les biais de données et d’algorithmes, ainsi que sur la gouvernance des modèles, lorsque l’on échange des algorithmes sans accès aux jeux de données d’entraînement. [1] Le potentiel de croissance est réel, mais les risques d’abus et les besoins de régulation le sont tout autant.
5. Apprentissage automatique et prise de décision
Dernier point, crucial : le ML — et, plus largement, tout travail sur les données — doit être directement intégré à la fonction de décision. Le ML n’existe pas en vase clos ; il sert la prise de décision. Cela peut être automatisé (comme la recherche Google), intégré à une démarche scientifique (par exemple lorsqu’un algorithme signale une IRM à examiner par un spécialiste), ou ancré dans les processus de l’organisation (par exemple, décider des actions à mener auprès des clients à risque de churn).
Veillez à ce que le travail mené sur les données reflète toujours vos enjeux réels, et évitez les erreurs de type III, où l’on trouve la bonne réponse… à la mauvaise question. C’est pourquoi la traduction métier des enjeux data devient un sujet majeur, et pourquoi il est essentiel d’instaurer une véritable culture de la donnée dans vos organisations. Cela suppose que les équipes comprennent ce que la data science et le ML peuvent — ou non — accomplir, sachent formuler les bonnes questions aux professionnels de la donnée et établissent des canaux de communication sains et productifs entre la fonction data et le reste de l’entreprise.
En résumé, les cinq points à connaître sur l’apprentissage automatique (en complément des [cinq déjà évoqués]) sont :
- Il existe un compromis entre précision et interprétabilité, mais l’interprétabilité (la capacité à expliquer pourquoi le modèle produit ses prédictions) devient de plus en plus importante, notamment pour les modèles déployés sur des marchés régulés comme la finance.
- Les modèles de ML déployés doivent être surveillés et maintenus pour prévenir la dérive des données.
- Le deep learning peut être très performant sur des tâches supervisées spécifiques comme la classification d’images et le traitement du langage naturel.
- Si vous manquez de données adaptées pour un problème métier donné, l’essor de l’apprentissage par transfert permet de réentraîner des modèles préentraînés sur votre question et votre domaine.
- Le ML — et tout travail sur les données — doit servir la prise de décision, afin de refléter les enjeux réels et d’établir des échanges efficaces entre la fonction data et le reste de l’entreprise.
[1] : Depuis la publication de cet article, Modzy nous a contactés et affirme « exiger que tous les modèles du marketplace incluent des informations sur la conception du modèle, telles que l’architecture, les jeux de données d’entraînement et de validation, ainsi que les métriques de performance, afin de garantir la transparence ». Modzy renvoie les lecteurs ici pour plus d’informations.
