
Un projet de data science comporte de nombreux éléments qui exigent une véritable collaboration pour aboutir à un déploiement réussi. Avec ces pièces interconnectées, une approche agile s'impose pour le développement comme pour le déploiement. Elle permet aux organisations d'apprendre vite et d'itérer rapidement. Dans un récent webinar DataCamp, Brian Campbell, Engineering Manager, Internal Engineering chez Lucid Software, présente les meilleures pratiques pour réussir le déploiement de projets de data science.
Étapes préliminaires pour favoriser un développement agile
Brian explique que deux actions clés peuvent être engagées dès le début d'un projet pour avancer en parallèle sur le développement et le déploiement d'un modèle : travailler avec des modèles de référence (baselines) et créer un prototype. Si ces approches complexifient le calendrier, elles permettent d'obtenir des résultats bien plus rapides et de meilleure qualité.
Travailler avec des modèles de référence
Une étape utile pour livrer avec succès des projets de machine learning consiste à créer un modèle de référence. Un modèle de référence produit les mêmes types de sorties que le modèle final. Cependant, il est construit avant la majeure partie du développement et peut reposer sur des heuristiques ou des données aléatoires. Cette base fixe un objectif à dépasser pour les itérations suivantes.
À mesure que l'équipe développe de nouveaux modèles, les résultats peuvent être comparés à cette référence pour guider l'apprentissage. L'écart entre la baseline et l'ambition visée éclaire les exigences du projet et aide les équipes à identifier les données et les solutions les plus pertinentes pour le problème.
Travailler avec des prototypes
Les prototypes sont des modèles qui ingèrent les mêmes entrées et renvoient le même format de sorties que le modèle final. Ils peuvent s'appuyer sur le modèle de référence. Une fois le prototype prêt, les responsables du déploiement peuvent commencer l'intégration du modèle dans son usage cible. Le prototype permet une avancée parallèle : les data scientists améliorent le modèle tandis que l'équipe d'implémentation travaille sur son intégration auprès des clients ou au sein d'un processus métier.
Les prototypes ne fonctionnent que si le modèle final se comporte comme le prototype. Il est donc indispensable de bien comprendre les données disponibles et le format de sortie attendu avant de créer le prototype. Cela suppose de dépasser la simple formulation initiale du problème et d'établir une forte collaboration avec les experts du problème.
Cas d'usage concret des baselines et des prototypes
Brian explique comment son équipe chez Lucid a utilisé des baselines et des prototypes pour accélérer le développement d'un modèle de clustering pour un produit de notes adhésives, utilisé par les équipes produit, design et ingénierie. Ces équipes organisent souvent des ateliers de design thinking où un facilitateur doit regrouper manuellement des notes similaires sous une même catégorie. L'objectif du système était de réduire le temps entre l'idée et la discussion en regroupant automatiquement les idées par catégories et en supprimant les doublons.

Le modèle de référence prenait des idées aléatoires et générait pour elles des catégories aléatoires. Ensuite, ils ont créé un prototype de ce modèle pour permettre aux spécialistes de l'implémentation de commencer à travailler très tôt dans le processus de développement. Avec le temps, ils ont amélioré la baseline en s'appuyant sur le traitement du langage naturel et le machine learning pour regrouper les notes similaires.
La communication est essentielle avec ces modèles
La première itération du projet a rencontré des difficultés faute de collaboration régulière entre l'équipe de déploiement et les data scientists en charge du modèle. Ce manque de coordination a entraîné des problèmes de performance, des tests biaisés et une expérience produit dégradée. Ils n'ont pas pu tirer parti des synergies d'un développement en parallèle.
Lors de la relance du projet, une collaboration efficace a permis de résoudre ces problèmes et de fixer des attentes réalistes. Cette collaboration a été rendue possible grâce à un prototype que l'équipe de déploiement pouvait exploiter en parallèle de l'équipe data science qui faisait évoluer le modèle.
Pour découvrir les enseignements du projet et savoir comment piloter au mieux des projets de data science complexes, visionnez le webinar à la demande.
