
L’une des grandes raisons de l’innovation fulgurante en science des données tient à la généralisation d’outils open source centrés sur le code. Ils ont permis aux data scientists et aux ingénieurs logiciels de créer des abstractions puissantes qui facilitent grandement l’analyse des données.
Par exemple, des packages R comme dplyr et tidymodels permettent de manipuler des données et de construire des modèles de machine learning sophistiqués en quelques lignes de code. De même, des packages Python comme tensorflow et pytorch permettent à quiconque de bâtir un modèle de deep learning avec un effort limité.
Si les outils pilotés par le code ont largement fait leurs preuves, l’avenir du travail sur les données sera bien plus vaste et fera appel à des interfaces graphiques (GUI) qui ouvriront la pratique de la data science à un public plus large grâce à des outils de pointage-cliqué. Cela ne signifie en rien la fin du data scientist codeur. À l’image de la révolution industrielle, ce mouvement permettra aux codeurs de se concentrer sur des problèmes plus complexes et sur la création d’interfaces, en laissant le travail métier aux experts du domaine. Cette évolution est déjà à l’œuvre sur les différents volets de l’analytique : descriptive, prédictive et prescriptive.
L’analytique descriptive, rendue accessible par la business intelligence
L’analytique descriptive a été démocratisée grâce aux outils de business intelligence (BI) en glisser-déposer désormais omniprésents. Il suffit de regarder le rachat de Looker, un outil de BI très populaire, par Google pour 2,6 milliards de dollars l’an dernier. La même année, Salesforce a finalisé l’acquisition de Tableau, autre outil de BI majeur. Microsoft a investi dans son propre outil, Power BI. (DataCamp propose des cours sur Tableau et sur Power BI.)
Les outils de business intelligence rendent l’exploration de données accessible à tous les niveaux de compétence, et pas seulement aux experts en analyses avancées. Ils offrent l’un des moyens les plus simples de travailler la donnée : centraliser l’information, identifier les leviers de performance, anticiper les résultats, et bien plus encore.
Comment les interfaces en glisser-déposer abaissent la barrière d’entrée pour l’analytique prédictive et prescriptive
La démocratisation du travail sur les données s’étend désormais à l’analytique prédictive et prescriptive. Par exemple, Alteryx est une entreprise valorisée à 10 milliards de dollars qui propose une plateforme de data science en glisser-déposer permettant aux analystes métier de manipuler des données et de construire des modèles prédictifs via une interface graphique.
Google investit massivement dans son outil AutoML, qui rend « l’IA aussi simple que le glisser-déposer ». Nous voyons également que Microsoft se positionne sur ce terrain :

Ci-dessus, un exemple de modèle de régression basique avec un pipeline de données. On voit la donnée circuler de rectangle en rectangle : d’abord l’ingestion, puis la sélection de colonnes, le nettoyage, et enfin la séparation et l’entraînement du modèle.
Les cas d’usage potentiels du machine learning en glisser-déposer sont nombreux. En d’autres termes : qui, au sein d’une organisation, souhaiterait utiliser des outils ML sans coder ? Votre équipe Customer Success, par exemple, peut vouloir modéliser l’attrition client. Elle pourra le faire avec des outils automatisés en glisser-déposer, sans réécrire de nouveaux modèles et de nouveaux scripts à chaque nouvel arrivant. De même, votre Chief People Officer et votre équipe RH recourront de plus en plus à des modèles de machine learning automatisés dans les processus de recrutement, y compris pour le tri de CV (nous aborderons les risques potentiels dans un instant). Votre équipe marketing pourra s’appuyer sur ces outils pour optimiser le funnel, ce qui a déjà évolué avec l’essor du ML pour l’achat média programmatique. Autre exemple parlant : l’optimisation de la chaîne d’approvisionnement, un levier souvent à fort impact et relativement facile à actionner.
Cette tendance se retrouve aussi dans des domaines complexes comme le deep learning. Par exemple, Lobe est une startup qui rend le deep learning accessible à tous, en permettant de construire des modèles via une GUI. Lobe a été rachetée par Microsoft avant même la fin de sa bêta, preuve de l’importance des outils GUI dans la définition de l’avenir.
Autre illustration : un moteur de recherche d’images développé par Google qui permet aux médecins d’explorer les prédictions des modèles et de les affiner grâce à l’intelligence humaine. En ouvrant la « boîte noire » et en complétant les modèles par l’expertise humaine, de tels outils favorisent une adoption plus large et plus efficace.
Nous allons voir émerger davantage d’interfaces en glisser-déposer qui abaisseront la barrière d’entrée. Cela nous amènera tous à mieux arbitrer entre ce que nous souhaitons développer en interne et ce que nous pouvons sourcer auprès de fournisseurs.
Des places de marché algorithmiques pour permettre aux non-codeurs d’acheter des modèles
Nous verrons se multiplier les marketplaces dédiées aux produits de ML. Modzy de Booz Allen est une place de marché en pointage-cliqué où vous pouvez acheter des modèles créés par d’autres et les intégrer à votre stack technologique.
Il existe des risques à mettre ces outils entre les mains de non-codeurs et de non-statisticiens. Il faut notamment s’assurer que chacun connaisse les risques inhérents à ces technologies et sache comment les atténuer. De plus en plus, les évolutions produit des outils de pointage-cliqué viseront à aider les utilisateurs à détecter des résultats biaisés et à éviter de les prendre pour argent comptant.
Attention aux zones à risque du ML en glisser-déposer
Un jeu pédagogique intéressant issu de Mozilla Labs, Survival of the Best Fit, traite des biais de recrutement dans l’IA. Vous y incarnez un CEO qui tente de faire passer à l’échelle le processus d’embauche à l’aide d’un outil automatisé… avec des dérives à la clé.
Récapitulatif
De plus en plus de travaux sur les données se feront dans des GUI, via des interfaces de glisser-déposer et de pointage-cliqué. Le secteur devient de plus en plus concurrentiel, avec des investissements clés de grands acteurs comme Google et Microsoft, et ce n’est qu’un début. Et même si une grande partie de vos travaux de data science est aujourd’hui réalisée en interne, une part croissante se déplacera vers des fournisseurs, ce qui impose une large sensibilisation aux risques et aux conséquences liés à l’adoption de l’IA.
Appel à l’action
Notez quelle part du travail quotidien de votre organisation s’effectue actuellement en code. Vous pouvez l’exprimer en heures-homme ou en coût réel pour votre structure. Puis évaluez la part réalisée dans des GUI, en pointage-cliqué et en glisser-déposer. Comment voyez-vous cette répartition évoluer au cours des 24 prochains mois ?
Découvrez comment bâtir votre programme data pour le futur du travail dans The Definitive Guide to Machine Learning for Business Leaders.



