Le traitement, l’analyse et les visualisations ont été réalisés avec R et ses packages associés. Le notebook et les fichiers pertinents sont disponibles ici.
Selon le dictionnaire Merriam-Webster, les données sont des informations factuelles utilisées comme base de raisonnement, de discussion ou de calcul. Par cette définition, une donnée est toute information collectée qui peut être exploitée, traitée et analysée pour produire des insights. On l’associe souvent à l’informatique, car les données sont généralement produites et stockées sur ordinateur, mais elles existent depuis bien plus longtemps qu’on ne l’imagine.
Histoire des données
Les premières traces de stockage et d’analyse de données par l’humain remontent à 18 000 av. J.-C., lorsque l’on a découvert que les préhistoriques utilisaient des bâtons de comptage pour effectuer des calculs rudimentaires. Ces peuples du Paléolithique entaillaient des bâtons et des os pour suivre leurs activités, comme le troc ou la gestion des provisions. Vers 2 400 av. J.-C., l’abaque, un dispositif de calcul, est inventé à Babylone.
Au fil des siècles, la collecte, le traitement et l’analyse des données se sont développés en continu, comme en témoignent les écrits sur tablettes de pierre, argile, papyrus, bois ou rouleaux de papier. À mesure que de nouvelles formes de données apparaissaient, les besoins en matière de traitement, de collecte, de stockage et d’analyse ont eux aussi évolué.
Avec l’essor des sociétés humaines, les exigences en matière de traitement des données se sont accrues. Au XIXe siècle, le recensement s’est généralisé aux États-Unis. Le volume de données collectées a augmenté de façon exponentielle, au point que le Bureau du recensement estimait qu’il faudrait des années, voire des décennies, pour traiter et analyser l’ensemble. Problème majeur : l’analyse du recensement en cours n’était achevée qu’au moment où le suivant commençait, voire avait déjà débuté. Heureusement, un jeune ingénieur et inventeur, Herman Hollerith, a mis au point la Hollerith Tabulating Machine – une tabulatrice électromécanique qui a réduit le temps de traitement du recensement de plusieurs années à quelques mois seulement. Hollerith est ainsi considéré comme le père du calcul automatique moderne et deviendra plus tard célèbre pour avoir fondé IBM.
Au XXe siècle, avec l’invention de l’ordinateur, le besoin de stocker les données de manière plus sophistiquée s’est imposé. L’ingénieur germano-autrichien Fritz Pfleumer invente une méthode de stockage magnétique sur bande. Certains principes de son invention servent encore aujourd’hui au stockage numérique. À cette époque, l’expression « business intelligence » gagne en popularité, portée par l’émergence de logiciels et de systèmes d’analyse de la performance commerciale et opérationnelle.
La révolution des données s’accélère véritablement en 1989, lorsque Tim Berners-Lee crée le World Wide Web, autrement dit Internet. Il devient alors possible de partager automatiquement des informations à l’échelle mondiale. Résultat : un volume croissant de données est partagé, créé et stocké, ouvrant la voie à de nouvelles méthodes de collecte, d’utilisation et d’analyse.
Passage au « Big Data »
L’essor fulgurant d’Internet dans les années 1990 et la démocratisation des ordinateurs personnels et des terminaux ont entraîné une explosion du nombre d’appareils connectés et, par ricochet, du volume de données produites.
Si l’idée de Big Data existait déjà avant les années 1990, c’est en 2005 que Roger Mougalas lui a donné son nom. Il l’a défini comme « un ensemble de données si volumineux qu’il est presque impossible à gérer et à traiter avec les outils traditionnels de business intelligence ».
Le Big Data désigne ces volumes massifs de données – structurées comme non structurées – qui submergent les organisations au quotidien. Il recouvre le volume d’informations, la vélocité à laquelle elles sont créées et collectées, ainsi que la variété des points de données concernés.
Compte tenu de sa taille et de sa complexité, la collecte, l’organisation et l’analyse du Big Data pour mettre au jour des motifs récurrents et des informations utiles contribuent désormais à la prise de décision de nombreuses organisations. Cela a donné naissance à la data science – un domaine interdisciplinaire qui mobilise méthodes scientifiques, processus, algorithmes et systèmes sur de grands volumes de données afin d’identifier des schémas et d’aider les décideurs à formuler des insights éclairés.
Quels sont les métiers de la data science ?
Selon IBM, la data science est une approche pluridisciplinaire visant à extraire des insights actionnables à partir des volumes de données, toujours plus importants, collectés et créés par les organisations. Le domaine requiert généralement des compétences en informatique et en sciences fondamentales : les data scientists appliquent la méthode scientifique et recourent à l’analytique prédictive et à l’intelligence artificielle pour extraire des enseignements des données. Consultez notre guide complet « qu’est-ce que la data science » pour une définition plus approfondie.
Aujourd’hui, « data science » est souvent employé comme terme générique par les entreprises pour désigner la gestion de grands volumes de données : préparation, nettoyage, analyse ou visualisation pour révéler des tendances. Voici quelques-unes des carrières possibles en data science :
-
Data scientist
Les data scientists savent appliquer les mathématiques, les statistiques et la méthode scientifique ; utiliser divers outils et techniques pour nettoyer et préparer les données ; mener des analyses prédictives et des projets d’intelligence artificielle ; et expliquer comment les résultats permettent d’apporter des solutions basées sur les données aux enjeux métier. Ils ont des compétences techniques nettement plus poussées que les data analysts. Pour commencer, vous pouvez suivre des cours orientés data science sur DataCamp : Introduction to Python for Data Science et Introduction to R.
-
Data analyst
Les data analysts collectent, traitent et réalisent des analyses statistiques pour dégager des conclusions utiles aux organisations. Ils transforment et manipulent de grands jeux de données afin de les rendre exploitables, par exemple sous forme de rapports ou de présentations. Ils contribuent aussi à la décision en repérant des tendances clés et en extrayant des insights qu’ils communiquent efficacement aux dirigeants. Ces cours sur DataCamp peuvent vous aider à lancer votre carrière de data analyst : Introduction to SQL et Exploratory Data Analysis in SQL.
-
Data engineer
Les data engineers préparent, traitent et gèrent les données collectées et stockées pour des usages analytiques ou opérationnels. À l’instar des ingénieurs traditionnels, ils construisent et maintiennent des « pipelines » de données qui relient les systèmes entre eux, rendant l’information accessible aux data scientists. Ils doivent donc maîtriser plusieurs langages utilisés en data science, comme Python, R et SQL. Des sujets liés au data engineering sont disponibles sur DataCamp : Introduction to Data Engineering et Understanding Data Engineering.
-
Data architect
Les data architects conçoivent principalement les plans et les schémas directeurs des systèmes de gestion des données que les data engineers construisent ensuite. À l’image des architectes, ils jouent un rôle de « visionnaires » en imaginant et en dessinant le cadre de gestion des données d’une organisation. Ils optimisent également la performance des systèmes existants, en veillant à leur accessibilité pour les administrateurs de bases de données et les analystes. Vous pouvez suivre des cours liés à l’architecture des données sur DataCamp, tels que : AWS Cloud Concepts et Database Design
-
Développeur business intelligence (BI)
Les développeurs BI sont des ingénieurs spécialisés qui utilisent des outils logiciels pour transformer les données en insights utiles à la décision. Ils rendent l’information technique compréhensible par tous au sein de l’entreprise. En pratique, ils créent et exécutent des rapports issus d’outils de business intelligence, puis traduisent les résultats en termes accessibles. Des cours sur les outils de business intelligence comme Microsoft Power BI et Tableau sont disponibles sur DataCamp, par exemple : Introduction to Power BI et Analyzing Data in Tableau
-
Statisticien
La statistique étant l’un des piliers de la data science, de nombreux statisticiens peuvent basculer facilement vers ce domaine. Ils sont principalement responsables de la collecte et de la gestion des données. Ils déterminent quelles données recueillir et comment les collecter. Ils conçoivent des expériences, analysent et interprètent les résultats, puis formulent des conclusions. Découvrez ces cours d’initiation à la statistique sur DataCamp : Introduction to Statistical Modeling in R et Introduction to Statistics in Spreadsheets.
-
Ingénieur machine learning
Les ingénieurs en machine learning sont des ingénieurs spécialisés qui recherchent, conçoivent et développent des systèmes d’intelligence artificielle (IA) et d’apprentissage automatique (ML) pour automatiser des modèles prédictifs. En pratique, ils élaborent des algorithmes qui exploitent des données d’entrée et des modèles statistiques pour prévoir une sortie, tout en actualisant continuellement les résultats à mesure que de nouvelles données arrivent. DataCamp propose de nombreux cours en machine learning qui peuvent vous être utiles, par exemple : Understanding Machine Learning et Machine Learning with caret in R.
Une recherche d’emploi rapide en ligne vous donnera une idée des parcours en data science les plus demandés. Le graphique ci-dessous présente les offres par métier selon Indeed USA au 8 décembre 2021.

Le métier de data architect apparaît comme le plus recherché, en raison de son rôle clé dans la conception des systèmes de gestion de données utilisés par les autres professionnels. Arrive ensuite l’ingénieur machine learning, porté par l’importance croissante de l’IA pour prédire des résultats dans de nombreuses entreprises technologiques.
Les statisticiens sont les moins demandés, principalement parce que nombre d’entre eux évoluent désormais vers des postes de data scientist. Cette tendance devrait se poursuivre, tant la transition de la statistique vers la data science est naturelle pour des profils qui maîtrisent déjà les fondamentaux requis pour devenir data scientist à part entière.
La data science ne ralentit pas
La data science a gagné une immense popularité dans les années 2010, surtout lorsque Harvard Business Review a qualifié le poste de « Data Scientist » de « métier le plus sexy du XXIe siècle ». L’expression « Data Scientist » est ainsi devenue omniprésente et tendance. Au-delà de la formule, cela renvoie au fait que ces profils sont très recherchés, coûteux à recruter et difficiles à fidéliser.
Que la data science soit très en vogue ne fait aucun doute ; la vraie question est de savoir si elle le restera. Les projections d’emploi semblent l’indiquer. Les données 2020-2030 du Bureau of Labor Statistics américain montrent que les carrières en data science – incluant statistique, data science et autres métiers à dominante mathématique ou scientifique comme le data engineering – afficheront une croissance très élevée en pourcentage entre 2020 et 2030. Les statisticiens se classent 14e au global, tandis que les data scientists et autres métiers des sciences mathématiques occupent la 31e place sur 790 emplois étudiés.
Même si la part des statisticiens et des data scientists dans l’ensemble de la population active reste modeste par rapport à d’autres professions, elle devrait augmenter dans les années à venir à mesure que ces carrières gagnent en popularité. La figure ci-dessous compare les statisticiens, les data scientists et d’autres métiers des sciences mathématiques à d’autres emplois à forte croissance prévue.

Un domaine très rémunérateur
Si la data science séduit, c’est aussi parce qu’elle fait partie des métiers les mieux payés au monde. Le graphique ci-dessous présente les fourchettes de salaires pour 10 professions – dont data scientists et data analysts – à New York. Les données proviennent de Teleport, un site qui agrège des informations sur les conditions de vie (p. ex. : salaires) dans différentes villes.

Selon Teleport, les data scientists avaient le 4e salaire annuel médian à New York, à 114 105 $US, derrière les dirigeants C-level et les professionnels de santé. Dans certaines villes comme Manille, ils montent même à la 2e place, juste derrière les dirigeants C-level : un signe fort de l’attrait du métier. Les postes de data analyst, bien que moins rémunérés que ceux de data scientist, restent très honorables : avec un salaire médian annuel de 61 818 $US, ils se situent autour du revenu moyen des ménages à New York.
Une présence croissante sur le marché de l’emploi
Autre raison majeure de cet engouement : les organisations intègrent désormais les principes de la data science dans leurs opérations quotidiennes. Le graphique ci-dessous présente les 10 secteurs qui mobilisent le plus la data science. L’échantillon de 8 000 entreprises orientées data science provient de Diffbot, le plus grand graphe de connaissances au monde.

Sans surprise, les éditeurs de logiciels – y compris des acteurs comme Google, Apple et Uber – dominent. L’explosion du big data découle de la création d’Internet, intimement liée au logiciel et à la technologie. La data science consiste précisément à traiter de grands volumes d’informations à l’aide d’outils et de technologies variés.
Viennent ensuite les services financiers, portés par la montée des fintech. Mot-valise formé de « finance » et « technologie », les fintech intègrent l’innovation technologique à leurs offres pour améliorer l’expérience client et bousculer les services financiers traditionnels. Gestion de masses de données oblige (informations clients, transactions, etc.), ces entreprises ont rapidement perçu l’intérêt des outils de data science pour rationaliser et optimiser leurs processus et améliorer leurs services.
En conclusion, une carrière en data science en vaut-elle la peine ?
Au vu de tout ce qui précède, la réponse est clairement oui ! Le choix du parcours précis dépend avant tout de vos forces et de vos centres d’intérêt. L’essentiel : chacune des carrières évoquées ci-dessus peut s’avérer riche et porteuse.
À la fois très rémunératrice et toujours en pleine ascension, la data science continuera de façonner et d’influencer le fonctionnement des entreprises et des organisations pendant de nombreuses années.