Accéder au contenu principal

Quelles compétences et quels parcours les data scientists ont-ils en commun ?

Découvrez des enseignements tirés d’1 million d’offres et de postes liés aux données.
Actualisé 18 sept. 2026  · 12 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Motivation

\n

En 2012, Harvard Business Review a qualifié le métier de data scientist de plus sexy du XXIe siècle. Depuis, le terme data scientist n’a cessé de gagner en popularité.

\n
\n

L’image ci-dessus montre l’intérêt pour le mot-clé «\u00a0data science\u00a0» sur Google Search entre 2016 et 2021. On constate une progression continue de l’intérêt pour la data science au cours des cinq dernières années.

\n

Au-delà d’une rémunération attractive, le métier de data scientist permet de mobiliser une grande variété de compétences, d’extraire des insights pertinents à partir de données réelles et d’avoir un impact sur la société grâce à ses analyses. Il n’est donc pas étonnant qu’il ait été désigné comme le métier le plus sexy du XXIe siècle.

\n

Cependant, avant de postuler à un poste en data science, il est utile d’analyser le profil type et le parcours des data scientists. Connaître leurs parcours et leurs compétences vous donnera les informations nécessaires pour acquérir les bons atouts et vous démarquer parmi les autres candidats.

\n

Voici quelques questions intéressantes à explorer\u00a0:

\n
    \n
  • Quelles compétences possèdent la plupart des data scientists\u00a0?
  • \n
  • En quoi ces compétences diffèrent-elles de celles d’autres intitulés de poste comme machine learning engineer, data analyst ou data engineer\u00a0?
  • \n
  • Quelles sont les spécialisations universitaires les plus fréquentes\u00a0?
  • \n
  • Faut-il un master ou un doctorat pour devenir data scientist\u00a0?
  • \n
  • Quelle est la répartition femmes-hommes dans la data science\u00a0?
  • \n
  • Où se concentrent la plupart des emplois en data science\u00a0?
  • \n
  • Comment la popularité des différents métiers des données évolue-t-elle dans le temps\u00a0?
  • \n
  • Comment les compétences attendues chez les data scientists évoluent-elles dans le temps\u00a0?
  • \n
\n

Obtenir les données

\n

Nous utiliserons des données portant sur plus de 160\u00a0000 data scientists, 570\u00a0000 data analysts, plus de 100\u00a0000 data engineers et plus de 19\u00a0000 machine learning engineers à travers le monde. Les jeux de données proviennent de Diffbot, le plus grand graphe de connaissances au monde. Vous trouverez plus d’instructions pour utiliser Diffbot ici.

\n

Pour faciliter le suivi, toutes les données utilisées dans cet article sont disponibles dans ce dépôt. L’accès et le téléchargement sont gratuits.

\n

Le notebook contenant le code de cet article est accessible ici. Si vous préférez récupérer les données directement depuis Diffbot, vous pouvez utiliser ce notebook.

\n

Identifier les langages les plus populaires

\n

Quelles sont les compétences clés des data scientists, data analysts, data engineers et machine learning engineers\u00a0? Nous pouvons y répondre grâce à un jeu de données listant les 100 compétences les plus fréquentes chez les personnes occupant ces postes.

\n
import pandas as pd\nskill_count = pd.read_csv(\n\"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/all_skills.csv\",\n    index_col=0,\n)\n\n# Show the top 10 rows\nskill_count.head(10)\n
\n
\n

Nous utiliserons ce jeu de données pour analyser la popularité des différents langages de programmation selon chaque famille de métiers de la donnée. La visualisation est réalisée sous forme de matrice de bulles sur Observable.

\n

Une matrice de bulles encode deux dimensions via la taille et la couleur. Les lignes représentent les intitulés de poste et les colonnes les langages. Plus la bulle est grande, plus le langage est fréquent dans une catégorie de poste donnée.

\n\n
\n

Pour dimensionner les bulles, nous calculons le ratio entre la fréquence d’un langage et la fréquence maximale observée, tous langages et postes confondus.

\n
languages = skill_count[\n    skill_count[\"skill\"].isin(\n        [\"python\", \"r\", \"sql\", \"c\", \"c++\", \"matlab\", \"java\", \"javascript\"]\n    )\n]\n\nlanguages[\"Ratio to All Skills\"] = languages[\"count\"].apply(\n    lambda c: c / max(skill_count[\"count\"])\n)\n# View languages used by data analysts\nlanguages[languages[\"Title\"] == \"Data Analyst\"]\n
\n
\n\n

Les bulles sont mises en évidence au-delà d’un certain nombre d’occurrences. Un curseur permet de fixer ce seuil. Par exemple, avec un seuil à 100\u00a0000, seules les bulles dont le compteur dépasse 100\u00a0000 sont colorées en violet foncé.

\n

Autre fonctionnalité utile\u00a0: trier les bulles par intitulé de poste. Utilisons-la pour identifier les compétences majeures de chaque poste.

\n\n
\n

Vous pouvez interagir avec le graphique ici. On observe que\u00a0:

\n
    \n
  • Pour les data analysts, les trois principales compétences, par ordre décroissant, sont SQL, Python puis R.
  • \n
  • Pour les data engineers\u00a0: SQL, Python puis Java.
  • \n
  • Pour les data scientists\u00a0: Python, R puis SQL.
  • \n
  • Pour les machine learning engineers\u00a0: Python, Java puis C++.
  • \n
\n

\n

Analyser la formation

\n

Les spécialisations les plus courantes

\n

Quelles spécialisations universitaires dominent selon les métiers de la donnée\u00a0? Pour répondre, téléchargeons les données indiquant la fréquence des principales spécialisations par poste.

\n
!wget 'majors_df.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/majors_df.pkl'\n\nimport pickle\n\nmajors_df = pickle.load(open(\"majors_df.pkl\", \"rb\"))\nmajors_df[\"data scientist\"]\n
\n
\n

Visualisons ce jeu de données pour mieux l’appréhender. Commençons par une fonction traçant les spécialisations d’un poste.

\n
import plotly.express as px\n\n\ndef plot_majors(title: str, majors_df: dict):\n    majors = majors_df[title]\n    return px.bar(data_frame=majors, x=\"name\", y=\"value\")\n
\n

Spécialisations les plus fréquentes chez les data scientists\u00a0:

\n
plot_majors('data scientist', majors_df)\n
\n
\n

Interagissez avec le graphique ici. Étant donné que de nombreux postes en data science exigent des bases en programmation et en mathématiques, il est logique que les deux spécialisations principales soient l’informatique et les mathématiques.

\n

Spécialisations les plus fréquentes chez les data engineers\u00a0:

\n
plot_majors('data engineer', majors_df)\n
\n
\n

Graphique interactif ici. Le métier de data engineer mobilisant de nombreuses technologies et langages, il est logique de voir une majorité issue de l’informatique et des technologies de l’information plutôt que des mathématiques.

\n

Spécialisations les plus fréquentes chez les data analysts\u00a0:

\n
plot_majors('data analyst', majors_df)\n
\n
\n

Graphique interactif ici. Le trio de tête pour les data analysts est administration des affaires, informatique et économie, ce qui est cohérent avec la dimension interprétation/analyse du métier.

\n

Spécialisations les plus fréquentes chez les machine learning engineers\u00a0:

\n
plot_majors('machine learning engineer', majors_df)\n
\n
\n

Graphique interactif ici. On peut également recourir à une visualisation en «\u00a0circle packing\u00a0» pour comparer les spécialisations selon les métiers.

\n\n
\n\n

Vous pouvez interagir avec ce graphique ici.

\n

Analyser les diplômes

\n

Beaucoup d’offres pour des postes de data scientist mentionnent un master ou un doctorat. Mais, en pratique, combien de data scientists ont réellement un master ou un Ph.D.\u00a0?

\n

Répondons à cette question en téléchargeant les données indiquant le nombre de titulaires par niveau de diplôme et par poste.

\n
degree_df = pd.read_csv(\n\"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/degrees.csv\"\n)\n\ndegree_df.head(10)\n
\n
\n

Les niveaux de diplôme pris en compte sont\u00a0:

\n
    \n
  • High school
  • \n
  • Associate’s
  • \n
  • Bachelor’s
  • \n
  • Master’s
  • \n
  • Ph.D.
  • \n
  • Certificate
  • \n
\n

Visualisons ces données sous forme de matrice de bulles.

\n
\n

Vous pouvez manipuler le graphique ici. On observe que le diplôme le plus répandu, tous métiers confondus, est le bachelor’s (licence). C’est logique\u00a0: la plupart des postes exigent au minimum une licence, et les titulaires d’un master ou d’un doctorat ont eux aussi une licence.

\n

Voici une autre vue en histogrammes groupés.

\n
\n

À noter\u00a0: le nombre de data analysts titulaires d’une licence est presque deux fois supérieur à celui des data analysts titulaires d’un master. En revanche, chez les data scientists, les effectifs licence et master sont comparables.

\n

Cela signifie qu’une plus grande proportion de data scientists poursuivent des études supérieures après la licence, comparativement aux data analysts.

\n

Analyser la répartition femmes-hommes

\n

Quelle est la proportion de femmes et d’hommes dans les métiers de la donnée\u00a0? Répondons-y avec les données comptabilisant femmes et hommes par poste.

\n
gender_df = pd.read_csv(\n    \"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/genders.csv\"\n)\ngender_df.head(10)\n
\n
\n

Traçons ensuite un histogramme groupé.

\n
\n

Ce graphique montre que\u00a0:

\n
    \n
  • Dans tous les métiers de la donnée sauf la saisie de données (data entry), les hommes sont plus nombreux que les femmes.
  • \n
  • Le nombre d’hommes est presque le double de celui des femmes pour des rôles comme data analyst ou statisticien.
  • \n
  • Le nombre d’hommes est plus du double de celui des femmes pour des rôles comme data scientist, data engineer et machine learning engineer.
  • \n
\n

Analyser la géographie

\n

Les États américains où les data scientists sont les plus nombreux

\n

Quels sont les États les plus attractifs pour les data scientists\u00a0? Commençons par récupérer les effectifs par État.

\n
state_jobs = pd.read_csv(\n    \"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/state_jobs.csv\"\n)\nstate_jobs.head(10)\n
\n
\n

Puis traçons une carte avec folium, une bibliothèque Python dédiée aux cartes.

\n
state_geo = \"https://raw.githubusercontent.com/python-visualization/folium/master/examples/data/us-states.json\"\n\nm = folium.Map(location=[48, -102], zoom_start=3)\n\nfolium.Choropleth(\n    geo_data=state_geo,\n    name=\"choropleth\",\n    data=state_jobs,\n    columns=[\"state\", \"count\"],\n    key_on=\"feature.id\",\n    fill_color=\"YlGn\",\n    fill_opacity=0.7,\n    line_opacity=0.2,\n    legend_name=\"Number of Data Science Jobs\",\n).add_to(m)\n\nfolium.LayerControl().add_to(m)\n\nm\n
\n
\n

Carte interactive ici. On voit que l’État qui compte le plus de data scientists est la Californie. Viennent ensuite New York, le Massachusetts et le Texas.

\n

Les 25 pays les plus attractifs pour les data scientists

\n

Quels sont les 25 pays qui concentrent le plus de data scientists\u00a0? Commençons par télécharger les données donnant les effectifs par pays\u00a0:

\n
!wget 'countries.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/countries.pkl'\n\ncountries = pickle.load(open(\"countries.pkl\", \"rb\"))\n
\n

Puis traçons les 25 premiers pays\u00a0:

\n
def plot_top_25_locations(title: str, locations: dict):\n    data = locations[title]\n    return px.bar(data_frame=data, x=\"location\", y=\"count\")\n\nplot_top_25_locations(\"data scientist\", countries)\n
\n
\n

Graphique interactif ici. Les cinq pays les plus représentés sont\u00a0:

\n
    \n
  • United States
  • \n
  • India
  • \n
  • France
  • \n
  • United Kingdom
  • \n
  • Germany
  • \n
\n

Les 25 villes les plus attractives pour les data scientists

\n

Quelles sont les 25 villes qui regroupent le plus de data scientists\u00a0? Téléchargeons les données par ville\u00a0:

\n
!wget 'cities.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/cities.pkl'\n\ncities = pickle.load(open(\"cities.pkl\", \"rb\"))\n
\n

Voici le graphique des 25 premières villes\u00a0:

\n
\n

Graphique interactif ici. On observe que les cinq villes les plus représentées sont\u00a0:

\n
    \n
  • San Francisco
  • \n
  • Bengaluru
  • \n
  • London
  • \n
  • Paris
  • \n
  • New York City
  • \n
\n

Les intitulés de poste les plus courants pour les data scientists

\n

Autour du rôle de data scientist, on trouve toute une palette d’intitulés\u00a0: senior data scientist, junior data scientist, data scientist intern, etc. Ne serait-il pas utile de visualiser la popularité de chacun\u00a0?

\n

Commençons par récupérer les données de comptage de tous les intitulés liés à data scientist\u00a0:

\n
!wget \"top_titles.pkl\" \"https://github.com/khuyentran1401/dataset/raw/master/data_science_market/top_titles.pkl\"\n\ntop_titles = pickle.load(open(\"top_titles.pkl\", \"rb\"))\ntop_titles[\"data scientist\"]\n
\n
\n

Histogramme des principaux intitulés liés à data scientist\u00a0:

\n
\n

Graphique interactif ici. Une visualisation en «\u00a0circle packing\u00a0» permet aussi d’apprécier la diversité des intitulés sur plusieurs métiers de la donnée.

\n\n
\n\n

Testez la visualisation vous-même ici.

\n

Analyser les tendances du secteur

\n

Mots-clés

\n

Comment l’intérêt pour le mot-clé data scientist a-t-il évolué sur Google Search au fil du temps\u00a0? Récupérons ces données avec pytrends, puis traçons-les avec Plotly Express\u00a0:

\n
from pytrends.request import TrendReq\n\n\ndef plot_keyword_trend(title: str):\n    pytrends = TrendReq(hl=\"en-US\", tz=360)\n    pytrends.build_payload(kw_list=[title])\n\n    df = pytrends.interest_over_time()\n    return px.line(data_frame=df, y=title)\n\n\nplot_keyword_trend(\"data scientist\")\n
\n
\n

Graphique interactif ici. L’intérêt pour le mot-clé data scientist semble augmenter de manière quasi linéaire entre 2016 et 2021.

\n

Évolution du nombre de postes dans le temps

\n

Comment les effectifs par métier ont-ils évolué au fil des années\u00a0? Répondons grâce aux données retraçant l’évolution du nombre de postes occupés dans le temps.

\n
dates_df = pd.read_csv(\n\"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/dates.csv\",\n    index_col=0)\ndates_df.head(10)\n
\n
\n

La première ligne indique qu’en 1988, 40 personnes exerçaient comme data scientists. La deuxième ligne indique qu’elles étaient 52 en 1989.

\n

Courbe d’évolution correspondante\u00a0:

\n
px.line(dates_df, x=\"date\", y=\"value\", color=\"name\")\n
\n
\n

Graphique interactif ici. Points clés\u00a0:

\n
    \n
  • Le nombre de statisticiens reste stable dans le temps.
  • \n
  • Avant 2010, la saisie de données (data entry) est le métier le plus répandu parmi les fonctions data.
  • \n
  • En 2010, le rôle de data analyst dépasse la saisie de données.
  • \n
  • En 2013, data scientist, data analyst et data engineer dépassent le rôle de statisticien, avec une croissance exponentielle du data scientist tandis que la saisie manuelle recule fortement.
  • \n
  • En 2019, le rôle de machine learning engineer dépasse à son tour celui de statisticien.
  • \n
\n

Observons maintenant une «\u00a0bar chart race\u00a0» pour visualiser les changements de classement\u00a0:

\n
\n

Impressionnant\u00a0! Cette animation permet de repérer précisément les bascules de classement. Vous pouvez la consulter ici.

\n

Évolution des compétences dans le temps

\n

Comment la fréquence des principales compétences des data scientists évolue-t-elle\u00a0? Observons-le via les données de compétences dans le temps.

\n
skills_df = pd.read_csv(\n    \"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/skills_over_time.csv\",\n    index_col=0,\n)\nskills_df.head(10)\n
\n
\n

Créons ensuite une bar chart race à partir de ces données\u00a0:

\n
\n

On constate qu’avant 2014, l’enseignement et l’économie figuraient parmi les compétences les plus courantes chez les data scientists. Après 2014, Python les dépasse et devient la compétence dominante.

\n

Conclusion

\n

Prêt à mettre en avant vos compétences professionnelles en data science\u00a0? Découvrez le programme de certification de DataCamp et ses services carrière pour décrocher le poste de vos rêves dans la data science.

Sujets
Science des données
Services d'orientation professionnelle