Accéder au contenu principal

Ce que l’US Army peut vous apprendre sur la data science

La vie militaire forge des compétences, des qualités et des habitudes précieuses. Elle apprend aussi à se lancer en data science en passant à l’action.
Actualisé 18 sept. 2026  · 14 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

En terminant récemment le parcours Data Scientist with Python de DataCamp, je me suis senti prêt à affronter des défis data bien réels, mais les choses ne sont pas si simples. Suivre des cours sur DataCamp ou à l’université n’est que la première étape d’un long chemin pour devenir data scientist. Les compétences acquises doivent être mises en pratique, entretenues et transformées en un portfolio concret, capable de montrer ce que vous savez faire et de prouver à de futurs employeurs que vous serez un atout pour leur équipe.

Mais comment y parvenir ?

Avoir des outils et savoir globalement s’en servir, c’est une chose ; se lancer pour de bon peut être intimidant.

Alors, par où commencer ?

Cet article ne porte pas sur le code que vous écrirez, mais sur le processus que vous suivrez. Il s’appuie sur mon expérience au sein de l’armée américaine pour répondre à cette question.

Affaires civiles et gestion de l’information civile

Avant d’entamer ma reconversion vers la data science, j’ai passé vingt ans dans l’armée américaine, dont les cinq dernières années dans la réserve de l’US Army, au sein de la branche des Affaires civiles. En bref, les Affaires civiles sont chargées de stabiliser une région après une catastrophe ou un conflit. Elles sont déployées sur des théâtres très variés, de l’épidémie d’Ebola dans la Corne de l’Afrique (2014–2016) à la reconstruction après l’ouragan Katrina. Elles sont également très sollicitées durant les conflits, comme la guerre en Irak. Leur mission : ramener une zone donnée à la « vie normale » d’avant la crise.

Quel rapport avec la data science, me direz-vous ?

Les Affaires civiles reposent sur l’information — autrement dit, sur les données. Pour rétablir la normalité, il faut savoir ce qu’était cette normalité, et si elle suffit à assurer la stabilité. Les habitants peuvent considérer comme « normal » l’absence de système éducatif, de sécurité ou même d’eau potable. Prendre des décisions sur ce qu’il faut pour stabiliser une région exige d’énormes volumes de données à collecter, analyser et mettre entre les mains des décideurs.

Ces décideurs, dans les Affaires civiles, sont l’équivalent du « top management » dans l’entreprise : des responsables militaires et gouvernementaux de haut rang, des dirigeants d’organisations comme la Croix-Rouge et l’Organisation mondiale de la Santé, qui tranchent sur l’allocation des budgets, des efforts et du temps. Leurs décisions s’appuient fortement sur des informations fiables collectées via un processus appelé Civil Information Management (CIM), ou gestion de l’information civile.

Au sein des Affaires civiles, j’ai dirigé une équipe CIM, formé d’autres unités à ce processus et amélioré nos méthodes. J’étais largement reconnu comme expert du sujet, et je peux vous assurer que ce n’est pas réservé aux militaires. Les données que nous utilisions n’étaient pas classifiées. Elles devaient être exploitables par l’armée, les autorités locales, la FEMA et des organisations civiles comme la Croix-Rouge et l’OMS.

Le processus CIM de collecte, d’analyse et de diffusion de l’information s’applique très bien à la data science et, d’après ce que j’ai vu sur DataCamp, il est déjà très répandu, même s’il ne porte pas ce nom.

La data science va bien au-delà de la ligne de commande ou d’un notebook Jupyter. Quand vous travaillez sur un jeu de données, il y a presque toujours un objectif final et un « client ». Si vous explorez par curiosité ou pour vous entraîner, le client, c’est vous. Le client peut aussi être votre audience de blog, vos collègues, votre manager ou un client payant.

Si vous admettez qu’il y a toujours un client, alors il faut aussi admettre qu’il doit y avoir un produit — et que ce produit doit répondre à la fameuse « question ».

La question

Avant d’entrer dans les six étapes du processus CIM, vous devez définir « la question ». En termes simples, c’est la raison d’être de votre analyse.

Par exemple, dans Intro to Python for Data Science, la question est : « Quelle est la taille médiane des gardiens de but dans FIFA ? ». Dans la compétition Titanic de Kaggle, la question est : « Quel profil de personne avait le plus de chances de survivre au naufrage du Titanic ? ».

Il y a toujours une question — et souvent plusieurs. Une fois la question définie, vous pouvez lancer le processus.

Le processus CIM

Collecte

Sans données, pas d’analyse — et pas vraiment de raison d’être pour un data scientist. Les jeux de données utilisés sur DataCamp, Kaggle, Driven Data et Data.gov ont tous dû être collectés. Une quantité quasi illimitée de données est disponible en ligne et une grande partie de la collecte peut être automatisée via le web scraping ou d’autres techniques. Quand j’étais aux Affaires civiles, je m’appuyais beaucoup sur le CIA World Factbook, les données de recensement et Google Maps.

Cela dit, ce n’est pas toujours si simple.

En novembre 2016, la ville de Gatlinburg (Tennessee) a été frappée par un incendie dévastateur qui a détruit plus de 2 500 habitations et commerces. À l’époque, j’étais affecté à une unité des Affaires civiles à Knoxville, non loin de là, et on nous a demandé d’aider à évaluer les dégâts. La zone, rurale et montagneuse, est parsemée d’habitations et il est presque impossible de maintenir des cartes à jour. Le seul moyen de savoir quels bâtiments tenaient encore debout était de collecter les données manuellement. Avec des bénévoles et les autorités locales, nous nous sommes répartis en équipes pour parcourir en voiture ou à pied ces routes de montagne à la recherche des habitations. Pour chaque bâtiment rencontré, nous le pointions sur la carte et notions son niveau de dégradation. Les données étaient ensuite transmises pour être consolidées par les agences locales.

Un autre excellent exemple de collecte manuelle est le jeu de données sur l’hérédité de la profondeur du bec des Geospiza scandens, utilisé dans Statistical Thinking in Python Part 2. Ces données proviennent de plus de 40 ans d’observations de terrain !

Rassurez-vous, vous n’aurez sans doute pas à aller aussi loin pour trouver des données. Commencez par les jeux fournis en début de chaque cours DataCamp. Si rien ne vous inspire, explorez les ressources mentionnées ci-dessus, ou cherchez simplement sur Google les données dont vous avez besoin.

Consolidation

Tomber sur un jeu de données complet avec toutes les informations souhaitées, joliment empaquetées, est très satisfaisant. Malheureusement, c’est l’exception plutôt que la règle. La plupart du temps, vous trouverez des morceaux à assembler.

La consolidation consiste à organiser des données brutes pour en faire un ensemble exploitable.

Si une partie des données initiales provenait d’Internet dans les Affaires civiles, c’était minoritaire. La grande majorité venait du terrain. Les équipes allaient sur place, prenaient des photos, interrogeaient les habitants, évaluaient des infrastructures comme les aéroports, écoles, commissariats et centrales. Toutes ces informations revenaient sous forme de rapports écrits qu’il fallait consolider pour les rendre exploitables. Je n’ai pas participé à la consolidation des cartes manuscrites évoquées plus haut pour les incendies, mais chacune a dû être intégrée dans une source unique indiquant les coordonnées, l’état et la description des biens recensés.

Pour un data scientist en devenir, la consolidation est souvent l’endroit où l’on commence vraiment à manipuler les données.

Prenez les données sur la profondeur de bec des Scandens : chaque rapport quotidien a dû être agrégé en rapports hebdomadaires ou mensuels, puis annuels, pour constituer au final un seul jeu couvrant 40 ans.

Une bonne consolidation fait gagner beaucoup de temps ensuite, car elle permet de nettoyer au fil de l’eau et de ranger les informations dans des catégories adaptées. Les techniques de merge, join et append prennent ici tout leur sens.

Traitement

Soyons honnêtes : même si l’on trouve un jeu de données collecté et consolidé avec toutes les informations recherchées, il sera probablement « brut de décoffrage » et nécessitera du nettoyage. Le traitement consiste à transformer ces « données » en un format prêt pour l’analyse. Dans les Affaires civiles, j’ai passé beaucoup de temps à collecter et consolider, mais c’est au traitement que j’apprenais vraiment à connaître les données et que je commençais à élaborer un plan d’analyse.

Au sein de l’équipe CIM, je réalisais de nombreuses « évaluations de zone ». C’est une analyse initiale d’une zone donnée, en amont d’un déploiement sur place, pour identifier les priorités potentielles. Après avoir collecté et consolidé les informations pertinentes, on les traite pour les rendre immédiatement consommables, avant même l’analyse. Le résultat prend souvent la forme d’un classeur Excel ou d’une base de données propre et catégorisée, interrogeable ou filtrable pour répondre à des questions simples ne nécessitant pas d’analyse approfondie.

En data science, c’est l’étape de la mise au propre et de l’exploration des données, et de l’Exploratory Data Analysis. Vous pouvez vous épargner bien des soucis en catégorisant et en étiquetant correctement vos variables, et en vérifiant leurs types. Un bon traitement prépare une excellente analyse.

Analyse

Reprenons l’évaluation de zone : c’est utile d’avoir un jeu de données interrogeable pour obtenir des chiffres. Par exemple, combien de médecins sur la zone, ou combien de gallons d’eau potable par personne et par an. C’est essentiel, mais ce n’est pas encore une analyse. L’analyse répondra à des questions comme « comment la zone se situe-t-elle par rapport à la région alentour en matière de gouvernance, économie, infrastructures, sécurité et santé ? » ou encore « au rythme actuel de consommation, dans combien de temps la zone manquera-t-elle d’eau potable ? ».

L’analyse, c’est le cœur de ce qui attire beaucoup d’entre nous vers DataCamp, c’est la partie la plus stimulante, et celle où l’on répond à la question centrale. Elle est d’ailleurs largement couverte dans la plupart des cours DataCamp, je ne m’y attarderai donc pas. L’essentiel est de travailler la donnée et d’en tirer des conclusions.

Production

Revenons aux incendies de Gatlinburg. Une fois les données collectées, consolidées et traitées dans une base recensant les coordonnées de chaque bâtiment, son état et la description des dégâts, nous déterminons que 60 % des bâtiments de la zone sinistrée sont irrécupérables. Nous avons répondu à la question « quelle part de la zone a été impactée par l’incendie ? ».

Nous pouvons aller plus loin : estimer la valeur de chaque bâtiment endommagé et le coût de reconstruction global, avec un niveau de détail par quartier et par rue. Nous pouvons même identifier les quartiers les plus touchés pour prioriser les efforts.

L’analyse, c’est bien ; mais elle ne vaut rien si elle n’est pas transformée en produit. C’est tout l’objet de l’étape de production dans le processus CIM. Tout ce qui précède converge vers ce moment : créer l’élément phare que vous allez partager avec votre client.

C’est l’aboutissement de tout votre travail. Le produit peut prendre la forme d’un notebook Jupyter, d’un tableur avec tableaux et graphiques, d’une page web, d’un PDF ou d’un dépôt de code source. Autres options : une présentation en personne, une vidéo commentée, ou un diaporama avec Sway ou PowerPoint. Quel que soit votre choix, il doit correspondre aux besoins du client. Avec quelques exigences supplémentaires :

  1. Être clair, concis et facilement exploitable par le client.
  2. Raconter l’histoire et être compréhensible pour le client.
  3. Être adapté au niveau technique et éducatif du client.

Diffusion

La diffusion est la dernière étape du processus CIM et, en apparence, la plus simple : livrer le produit au client. Pourtant, avec un peu de recul, c’est probablement l’étape la plus décisive. Dans l’équipe CIM, nous produisions surtout des PDF, des présentations PowerPoint ou des rapports Excel. Pourquoi ces formats ? Parce qu’ils sont accessibles, simples d’usage et portables, et que presque tout le monde sait les utiliser.

Avec les compétences que j’ai aujourd’hui, j’aurais pu produire des pages web interactives avec rapports, graphiques Bokeh à curseurs et filtres, et des cartes interactives. Ce serait un produit dynamique, utilisable par presque tous puisqu’il serait encapsulé dans une page web. Mais, quelle que soit la qualité du livrable, il ne sert à rien s’il n’est pas diffusé au client d’une manière :

  • Accessible : l’information doit être accessible aux destinataires. Enfouir le produit dans un endroit où le public visé ne peut pas l’atteindre le rend difficile à consulter et vite oublié.
  • Simple à utiliser : le mode de diffusion doit être intuitif pour l’immense majorité de vos destinataires. Par exemple, fournir un script Python à des data scientists peut convenir, mais envoyer ce même script à quelqu’un qui ne sait pas lancer « data_analysis.py » n’aura pas l’effet escompté.
  • Portable : nous consommons de plus en plus d’information sur mobile. Il est rare d’avoir le temps de s’asseoir à un bureau pour lire de longs contenus. Les produits data doivent être portables, via des applications Office comme PowerPoint et Excel, des PDF ou le web.

Les moyens de diffusion ne manquent pas et il serait impossible de tous les citer ici. Le choix nécessite un vrai arbitrage. Posez-vous toujours la question : « comment livrer ce produit au client de la manière qui servira au mieux ses besoins en accessibilité, simplicité d’usage et portabilité ? »

Cela dit, si vous constituez un portfolio, Github, Anaconda Cloud, vos pages et blogs personnels, ainsi que les réseaux sociaux, sont d’excellents points de départ. N’ayez pas peur de partager votre travail avec des personnes qui ont les mêmes centres d’intérêt.

Dernières réflexions

Si vous travaillez avec des données, vous appliquez probablement déjà certaines des étapes évoquées ici. Même si vous n’intervenez pas personnellement sur les six, vous en comprenez désormais mieux la logique et voyez comment transformer des données brutes en produit fini. Cela peut sembler inhabituel de parler de procédures militaires pour la data science, mais ces six étapes m’ont bien servi, tant dans l’armée que dans le monde de l’entreprise. J’espère qu’elles vous seront tout aussi utiles dans votre parcours vers le métier de data scientist.

Sujets
Science des données