Accéder au contenu principal

[Infographie] Liste de contrôle pour un projet de data science

Utilisez cette checklist pour planifier votre prochain projet de data science.
Actualisé 18 sept. 2026

Explorer avec l’IA

ChatGPTClaudePerplexity

Une bonne gestion de projet accroît l'efficacité et la productivité, tout en réduisant le risque d'échec. Malheureusement, les projets de data science sont particulièrement délicats à piloter, car ils impliquent de nombreuses parties prenantes et doivent concilier objectifs métiers et techniques.

Des cadres de gestion de projet peuvent vous guider pour planifier, allouer les ressources et exécuter les tâches afin d'atteindre vos objectifs dans les délais et le budget impartis.

Cette infographie synthétise les points clés de deux cadres de référence — le Team Data Science Process de Microsoft et le Domino Data Science Life Cycle de Domino Data Lab — dans une liste de contrôle pratique que vous pouvez utiliser pour vos propres projets.

Data Cleaning Checklist@1x (1).png

Cette infographie est à portée de main

Téléchargez cette infographie et gardez-la à portée de main pour votre prochain projet de science des données.

Télécharger Maintenant

Comment utiliser cette fiche mémo

Cette fiche mémo résume les bonnes pratiques de gestion de projet en data science issues du Team Data Science Process de Microsoft et du Domino Data Science Life Cycle de Domino Data Lab, en combinant les principes de CRISP-DM avec ceux des cadres de développement Agile et Scrum. Utilisez cette checklist pour planifier votre prochain projet de data science !

Principes pour une gestion efficace des projets de data science 

En règle générale, les projets de data science qui réussissent partagent souvent les caractéristiques suivantes :

  • Mesurable : le succès du projet et son impact sur l'activité sont-ils quantifiables ?
  • Fiable : quelle part des projets a atteint ses objectifs ?
  • Scalable : peut-on augmenter le débit des projets sans dégrader significativement la fiabilité ?

En outre, les équipes data devraient s'appuyer sur les principes suivants lors de la gestion des projets de data science : 

  • Itérer : les projets avancent rarement en ligne droite du début à la fin. En cours de route, vous apprenez des éléments qui nécessitent des ajustements. Conformément aux techniques Agile et Scrum, il est recommandé de revenir à des étapes précédentes si nécessaire.
  • Réutiliser et capitaliser : repartir de zéro à chaque projet est chronophage et peu efficace. Réutiliser des composants d'un projet à l'autre — qu'il s'agisse de code, de caractéristiques de modèles ou de modèles de documents — évite de réinventer la roue.
  • Assurer la reproductibilité : expliquer et justifier votre travail est souvent plus difficile que le réaliser. Votre méthodologie et vos résultats peuvent faire l'objet d'un audit par un régulateur ou un client, et vous devrez peut-être y revenir plus tard. Adopter des pratiques de recherche reproductible vous fera gagner du temps et réduira les risques d'erreurs non détectées.

Liste de contrôle pour un projet de data science 

Microsoft et Domino Data Lab proposent des phases similaires pour un projet de data science. Ci-dessous, nous regroupons ces phases dans un cadre unifié :

Cadrage et idéation 

Que faire ?

Comment le faire ?

Identifier le problème métier à résoudre

Clarifiez sans ambiguïté pourquoi le projet est lancé. 

Identifier les parties prenantes

Les rôles peuvent inclure : chef de projet, data scientist, responsable comptes, administrateur des données.

Passer en revue les travaux antérieurs

Analysez les projets existants ayant couvert un périmètre similaire.

  • Quels ont été les principaux résultats ?
  • Peut-on réutiliser des travaux ou des actifs dans ce projet ?
  • Quelles erreurs ont été commises et doivent être évitées ?

Définir les indicateurs clés de performance (KPI ou métriques) pour mesurer le succès

Les métriques doivent suivre les critères SMART.

  • Spécifique : bien défini, compréhensible par toute l'équipe.
  • Mesurable : on peut déterminer si le KPI est atteint ou non.
  • Atteignable : l'équipe dispose des compétences et ressources nécessaires.
  • Pertinent : le KPI est lié aux objectifs plus larges de l'organisation.
  • Temporel : une échéance est fixée pour atteindre l'objectif.

Exemple non SMART : "Augmenter la conversion du site web"

Exemple SMART : "Optimiser le design et l'expérience utilisateur du site pour augmenter de 10 % le taux de conversion d'ici la fin du T2"

Définir le périmètre

  • Quels sont les livrables du projet ?
  • Quelles sont les exigences associées à ces livrables ?
  • Qu'est-ce qui est hors périmètre ?

Rédiger un plan de projet

  • Définissez des jalons pour les étapes intermédiaires.
  • Fixez un calendrier pour atteindre chaque jalon.
  • Rédigez une brève description de chaque étape.

Estimer l'impact du projet

  • Quantifiez le bénéfice pour l'organisation si les objectifs sont atteints.
  • En cas d'incertitude, fournissez une fourchette ou un intervalle de confiance.
  • Listez les bénéfices qualitatifs non quantifiables.

Estimer la charge du projet

  • Quel sera le coût du projet ?
  • Combien de temps faudra-t-il ?
  • Quelles ressources seront nécessaires ?

Évaluer les risques du projet

  • Dressez la liste de tous les risques.
  • Pour chaque risque, estimez l'impact comme la probabilité d'occurrence multipliée par la gravité.

Décider de poursuivre ou non le projet

Au regard de l'impact attendu par rapport à l'effort et aux risques, décidez de :

  • poursuivre le projet maintenant ;
  • mettre le projet en attente au profit d'initiatives plus prioritaires ;
  • annuler le projet.

Définir les responsabilités de chaque partie prenante

Utilisez le modèle RACI. Pour chaque tâche, identifiez qui est :

  • Responsible : la personne qui exécute le travail.
  • Accountable : la personne responsable des décisions clés.
  • Consulted : toute personne sollicitée pour avis lors des décisions clés.
  • Informed : toute personne à informer des décisions clés.

Définir une stratégie de communication

  • Comment allez-vous rester en contact ?
  • Quel sera le rythme des réunions ?

Identifier les sources de données

  • Avez-vous déjà accès à ces données ?
  • Où les données sont-elles stockées ?
  • Sous quelle forme se présentent-elles ?
  • Quelle est la taille du jeu de données ?
  • Disposez-vous d'un dictionnaire des données décrivant leur signification ?
  • Peut-on créer des données synthétiques pour un proof of concept ?

Anticiper les besoins réglementaires

  • Certains livrables (par exemple des modèles financiers) seront-ils audités ?
  • Toutes les sources ou variables peuvent-elles être utilisées légalement ?

Choisir une pile technologique

  • Convenir des outils pour stocker, traiter et modéliser les données.

Rédiger une charte de projet

  • Résumez dans un court document les décisions prises : objectifs, parties prenantes, KPI, plan, sources de données, pile technologique et stratégie de communication.

Collecte et exploration des données 

Que faire ?

Comment le faire ?

Donner aux data scientists l'accès à tous les jeux de données

  • Mettre en place les autorisations appropriées pour chaque jeu de données.
  • Acheter les jeux de données commerciaux nécessaires ou utiliser des données synthétiques aux propriétés similaires.

Ingestion des données

  • Pour chaque source de données, la transférer dans l'environnement d'analytique.

Explorer les données

  • Visualiser la distribution de chaque variable avec un histogramme ou un diagramme en barres.
  • Quantifier les valeurs manquantes pour chaque variable.
  • Visualiser la relation entre les variables explicatives et la variable cible avec un nuage de points, des histogrammes, des boîtes à moustaches ou une carte de chaleur.

Rédiger un rapport de qualité des données

Pour chaque jeu de données

  • Fournir un résumé du jeu de données.
  • Décrire les problèmes de qualité de haut niveau.
  • Décrire la qualité de la variable cible.
  • Décrire la qualité de chaque variable.
  • Décrire la relation entre chaque variable et la cible.

Décider de poursuivre ou non le projet

Sur la base du rapport de qualité des données, décidez de :

  • poursuivre le projet ;
  • le mettre en pause le temps de collecter plus de données ;
  • l'annuler.

Construire un pipeline de données

Les données devront généralement être mises à jour régulièrement au fil du projet. Le pipeline de données 

  • doit automatiser l'ingestion et le nettoyage ;
  • doit s'exécuter selon un planning (mises à jour par lots) ou en continu (flux).

Documenter le pipeline de données

  • Schématiser les étapes du pipeline de données et leurs dépendances.
  • Décrire ce qui se passe à chaque étape.

Modélisation et tests

Cela couvre à la fois les projets basés sur l'apprentissage automatique et les projets d'expérimentation tels que les tests A/B. Écartez les étapes qui ne s'appliquent pas à votre cas d'usage. 

Modélisation 

Que faire ?

Comment le faire ?

Formuler une hypothèse

  • L'hypothèse a-t-elle du sens dans le contexte métier ?
  • Pouvez-vous mesurer le résultat ?
  • Disposez-vous de suffisamment de données pour détecter un effet statistiquement significatif ?
  • Y a-t-il des biais statistiques à prendre en compte ?

Diviser vos données en ensembles d'entraînement et de test

Faites-le avant d'ingénier les variables pour éviter toute fuite de données.

Ingénierie des variables

Créez des variables pour votre modèle à l'aide de techniques telles que :

  • Centrer ou mettre à l'échelle les variables numériques.
  • Créer des variables catégorielles à partir de variables numériques par discrétisation.
  • Appliquer des transformations de Box-Cox ou Yeo-Johnson aux variables numériques pour approcher une loi normale.
  • Regrouper des modalités rares ou proches des variables catégorielles.
  • Extraire ou combiner des composantes de dates/heures.
  • Créer de nouvelles variables à partir de statistiques de synthèse.
  • Extraire des métriques quantitatives de textes et autres données non structurées.

Ajuster le modèle, ou lancer une expérimentation

  • Commencez par le modèle le plus simple et augmentez progressivement la complexité.
  • Pour les grands jeux de données, envisagez de modéliser sur un échantillon.

Évaluer les résultats

Utilisez des métriques comme l'exactitude, la précision et le rappel pour quantifier les performances de votre modèle. Si les performances ne sont pas suffisantes :

  • Pouvez-vous collecter des données supplémentaires ?
  • Pouvez-vous créer davantage de variables ?
  • Pouvez-vous tester d'autres algorithmes ?

Restituer les résultats

  • Informez régulièrement les parties prenantes.
  • Adaptez votre langage selon les interlocuteurs métiers ou techniques.
  • Communiquez les échecs comme les réussites.

Tests

Que faire ?

Comment le faire ?

Créer une suite de tests

Définissez des tests s'exécutant automatiquement pour contrôler les performances de votre modèle ou expérimentation et détecter les bogues introduits lors des itérations. Ceux-ci peuvent inclure :

  • Des tests unitaires du code.
  • Un backtest pour un portefeuille ou autre série temporelle.

Valider l'impact business

Maintenant que vous disposez de métriques de performance du modèle, vous pouvez mieux quantifier l'impact attendu sur l'activité. Échangez sur cet impact avec les parties prenantes métiers.

Valider l'approche technique

Vérifiez que le modèle final est techniquement adapté.

  • Les hypothèses du modèle sont-elles valides ?
  • Les résultats sont-ils sensibles à l'échantillonnage des données ?
  • Les hyperparamètres sont-ils appropriés ?
  • Quelqu'un d'autre peut-il reproduire votre modèle ?

Valider la déployabilité

  • Tous les cas d'entrée ou d'usage possibles peuvent-ils être gérés ?
  • Toutes les sources de données requises sont-elles disponibles en production ?
  • Le modèle peut-il échouer de manière maîtrisée si certaines sources manquent ?
  • Les prédictions peuvent-elles être produites suffisamment vite ?

Conserver les résultats nuls

Tout ce qui n'ira pas en production doit être consigné dans un référentiel de connaissances afin d'éviter de refaire les mêmes tentatives à l'avenir.

Déploiement et test utilisateur

Déploiement

Que faire ?

Comment le faire ?

Développer un pipeline de données

  • Mettre en place un graphe orienté acyclique (DAG) reliant toutes les sources de données à l'environnement de production.
  • Planifier des mises à jour automatiques des données.

Développer un pipeline de modèles

  • Diviser le flux du modèle en tâches, puis les assembler en pipeline.

Industrialiser le modèle

Fournir une API vers votre modèle, consommable par des tableaux de bord, des sites web ou d'autres logiciels.

Concevoir un plan de supervision

  • Définir les métriques à suivre, incluant des métriques de performance et des métriques de sécurité indiquant l'introduction éventuelle d'un bogue.
  • Fixer des bornes d'acceptabilité pour ces métriques.
  • Décider comment être alerté si les métriques sortent de l'intervalle prévu.

Déployer via un test A/B

  • Proposer la nouvelle fonctionnalité ou le modèle à un échantillon aléatoire d'utilisateurs.
  • Surveiller de près les métriques choisies, mais résister à la tentation de déclarer un gagnant avant d'avoir une significativité statistique.

Analyser et restituer les résultats du test A/B

  • Comparer les métriques suivies pour chaque groupe.
  • Communiquer les résultats, même si le test n'est pas concluant.

Déployer auprès de la majorité ou de l'ensemble des utilisateurs

Si le test est concluant, déployez la fonctionnalité ou le modèle auprès de la plupart ou de l'ensemble des utilisateurs.

  • Conserver un petit groupe de contrôle sans la nouvelle fonctionnalité ou le modèle permet d'obtenir dans la durée une estimation de l'amélioration de performance.

Test utilisateur

Que faire ?

Comment le faire ?

Rédiger un rapport de clôture

Résumez l'état du projet et les enseignements clés.

  • Présenter une vue d'ensemble du projet.
  • Résumer le problème métier traité.
  • Décrire les sources de données et leur traitement.
  • Décrire les techniques de modélisation utilisées et la méthode de validation.
  • Résumer l'architecture de la solution.
  • Exposer les bénéfices pour l'entreprise et pour le client.
  • Décrire les enseignements liés à l'exécution du projet, à la data science, au domaine métier et au produit.
  • Présenter les prochaines étapes.

Recueillir les retours des utilisateurs

  • Mener des enquêtes et des entretiens utilisateurs.
  • Surveiller les avis, notes et réseaux sociaux.

Supervision

Que faire ?

Comment le faire ?

Mettre en place le pipeline de supervision

Créez un pipeline pour suivre automatiquement les métriques de performance et de sécurité définies dans le plan de supervision.

Créer des tableaux de bord

Créez des tableaux de bord pour suivre l'évolution de ces métriques dans le temps.

Configurer des alertes

Paramétrez des alertes pour être averti par e-mail, Slack, etc., lorsque les métriques sortent de la plage acceptable.

Sujets
Science des données