Une bonne gestion de projet accroît l'efficacité et la productivité, tout en réduisant le risque d'échec. Malheureusement, les projets de data science sont particulièrement délicats à piloter, car ils impliquent de nombreuses parties prenantes et doivent concilier objectifs métiers et techniques.
Des cadres de gestion de projet peuvent vous guider pour planifier, allouer les ressources et exécuter les tâches afin d'atteindre vos objectifs dans les délais et le budget impartis.
Cette infographie synthétise les points clés de deux cadres de référence — le Team Data Science Process de Microsoft et le Domino Data Science Life Cycle de Domino Data Lab — dans une liste de contrôle pratique que vous pouvez utiliser pour vos propres projets.
Cette infographie est à portée de main
Téléchargez cette infographie et gardez-la à portée de main pour votre prochain projet de science des données.
Comment utiliser cette fiche mémo
Cette fiche mémo résume les bonnes pratiques de gestion de projet en data science issues du Team Data Science Process de Microsoft et du Domino Data Science Life Cycle de Domino Data Lab, en combinant les principes de CRISP-DM avec ceux des cadres de développement Agile et Scrum. Utilisez cette checklist pour planifier votre prochain projet de data science !
Principes pour une gestion efficace des projets de data science
En règle générale, les projets de data science qui réussissent partagent souvent les caractéristiques suivantes :
- Mesurable : le succès du projet et son impact sur l'activité sont-ils quantifiables ?
- Fiable : quelle part des projets a atteint ses objectifs ?
- Scalable : peut-on augmenter le débit des projets sans dégrader significativement la fiabilité ?
En outre, les équipes data devraient s'appuyer sur les principes suivants lors de la gestion des projets de data science :
- Itérer : les projets avancent rarement en ligne droite du début à la fin. En cours de route, vous apprenez des éléments qui nécessitent des ajustements. Conformément aux techniques Agile et Scrum, il est recommandé de revenir à des étapes précédentes si nécessaire.
- Réutiliser et capitaliser : repartir de zéro à chaque projet est chronophage et peu efficace. Réutiliser des composants d'un projet à l'autre — qu'il s'agisse de code, de caractéristiques de modèles ou de modèles de documents — évite de réinventer la roue.
- Assurer la reproductibilité : expliquer et justifier votre travail est souvent plus difficile que le réaliser. Votre méthodologie et vos résultats peuvent faire l'objet d'un audit par un régulateur ou un client, et vous devrez peut-être y revenir plus tard. Adopter des pratiques de recherche reproductible vous fera gagner du temps et réduira les risques d'erreurs non détectées.
Liste de contrôle pour un projet de data science
Microsoft et Domino Data Lab proposent des phases similaires pour un projet de data science. Ci-dessous, nous regroupons ces phases dans un cadre unifié :
Cadrage et idéation
| Que faire ? |
Comment le faire ? |
|
Identifier le problème métier à résoudre |
Clarifiez sans ambiguïté pourquoi le projet est lancé. |
|
Identifier les parties prenantes |
Les rôles peuvent inclure : chef de projet, data scientist, responsable comptes, administrateur des données. |
|
Passer en revue les travaux antérieurs |
Analysez les projets existants ayant couvert un périmètre similaire.
|
|
Définir les indicateurs clés de performance (KPI ou métriques) pour mesurer le succès |
Les métriques doivent suivre les critères SMART.
Exemple non SMART : "Augmenter la conversion du site web" Exemple SMART : "Optimiser le design et l'expérience utilisateur du site pour augmenter de 10 % le taux de conversion d'ici la fin du T2" |
|
Définir le périmètre |
|
|
Rédiger un plan de projet |
|
|
Estimer l'impact du projet |
|
|
Estimer la charge du projet |
|
|
Évaluer les risques du projet |
|
|
Décider de poursuivre ou non le projet |
Au regard de l'impact attendu par rapport à l'effort et aux risques, décidez de :
|
|
Définir les responsabilités de chaque partie prenante |
Utilisez le modèle RACI. Pour chaque tâche, identifiez qui est :
|
|
Définir une stratégie de communication |
|
|
Identifier les sources de données |
|
|
Anticiper les besoins réglementaires |
|
|
Choisir une pile technologique |
|
|
Rédiger une charte de projet |
|
Collecte et exploration des données
| Que faire ? |
Comment le faire ? |
|
Donner aux data scientists l'accès à tous les jeux de données |
|
|
Ingestion des données |
|
|
Explorer les données |
|
|
Rédiger un rapport de qualité des données |
Pour chaque jeu de données
|
|
Décider de poursuivre ou non le projet |
Sur la base du rapport de qualité des données, décidez de :
|
|
Construire un pipeline de données |
Les données devront généralement être mises à jour régulièrement au fil du projet. Le pipeline de données
|
|
Documenter le pipeline de données |
|
Modélisation et tests
Cela couvre à la fois les projets basés sur l'apprentissage automatique et les projets d'expérimentation tels que les tests A/B. Écartez les étapes qui ne s'appliquent pas à votre cas d'usage.
Modélisation
| Que faire ? |
Comment le faire ? |
|
Formuler une hypothèse |
|
|
Diviser vos données en ensembles d'entraînement et de test |
Faites-le avant d'ingénier les variables pour éviter toute fuite de données. |
|
Ingénierie des variables |
Créez des variables pour votre modèle à l'aide de techniques telles que :
|
|
Ajuster le modèle, ou lancer une expérimentation |
|
|
Évaluer les résultats |
Utilisez des métriques comme l'exactitude, la précision et le rappel pour quantifier les performances de votre modèle. Si les performances ne sont pas suffisantes :
|
|
Restituer les résultats |
|
Tests
| Que faire ? |
Comment le faire ? |
|
Créer une suite de tests |
Définissez des tests s'exécutant automatiquement pour contrôler les performances de votre modèle ou expérimentation et détecter les bogues introduits lors des itérations. Ceux-ci peuvent inclure :
|
|
Valider l'impact business |
Maintenant que vous disposez de métriques de performance du modèle, vous pouvez mieux quantifier l'impact attendu sur l'activité. Échangez sur cet impact avec les parties prenantes métiers. |
|
Valider l'approche technique |
Vérifiez que le modèle final est techniquement adapté.
|
|
Valider la déployabilité |
|
|
Conserver les résultats nuls |
Tout ce qui n'ira pas en production doit être consigné dans un référentiel de connaissances afin d'éviter de refaire les mêmes tentatives à l'avenir. |
Déploiement et test utilisateur
Déploiement
| Que faire ? |
Comment le faire ? |
|
Développer un pipeline de données |
|
|
Développer un pipeline de modèles |
|
|
Industrialiser le modèle |
Fournir une API vers votre modèle, consommable par des tableaux de bord, des sites web ou d'autres logiciels. |
|
Concevoir un plan de supervision |
|
|
Déployer via un test A/B |
|
|
Analyser et restituer les résultats du test A/B |
|
|
Déployer auprès de la majorité ou de l'ensemble des utilisateurs |
Si le test est concluant, déployez la fonctionnalité ou le modèle auprès de la plupart ou de l'ensemble des utilisateurs.
|
Test utilisateur
| Que faire ? |
Comment le faire ? |
|
Rédiger un rapport de clôture |
Résumez l'état du projet et les enseignements clés.
|
|
Recueillir les retours des utilisateurs |
|
Supervision
| Que faire ? |
Comment le faire ? |
|
Mettre en place le pipeline de supervision |
Créez un pipeline pour suivre automatiquement les métriques de performance et de sécurité définies dans le plan de supervision. |
|
Créer des tableaux de bord |
Créez des tableaux de bord pour suivre l'évolution de ces métriques dans le temps. |
|
Configurer des alertes |
Paramétrez des alertes pour être averti par e-mail, Slack, etc., lorsque les métriques sortent de la plage acceptable. |
