On me demande souvent : « qu’est-ce qui vous enthousiasme le plus dans l’avenir de la data science ? »
Quand les experts évoquent les avancées les plus enthousiasmantes, ils parlent souvent des travaux à la frontière du domaine. Ils citent le deep learning et sa capacité à battre des humains au Go, les progrès de l’IA qui ont rendu possibles les voitures autonomes, ou encore des technologies comme Spark et Hadoop qui permettent de calculer sur des jeux de données colossaux.
Ma réponse est différente. Je l’explique en détail dans notre récent webinar DataCamp, Democratizing Data Science within your Company, et je partage ici quelques réflexions.
Rendre l’impossible possible ; rendre le possible simple
Imaginez vivre en 1903, et que l’on vous demande quelle est l’avancée la plus excitante dans les transports. La réponse est évidente : le 3 décembre 1903 marque le premier vol d’un appareil plus lourd que l’air, réalisé par les frères Wright à Kitty Hawk. Si on vous avait posé la même question en 1969, vous auriez peut-être répondu « Apollo 11 et l’alunissage ». Ces réponses sont parfaitement légitimes, car elles se concentrent sur des « premières » dans l’histoire des transports : rendre l’impossible possible.
Permettez-moi toutefois un autre angle. 1903 n’est pas seulement l’année du premier vol motorisé, c’est aussi l’année de la création de la Ford Motor Company. Quelques années plus tard, Ford lance la Model T, souvent créditée d’avoir transformé l’automobile de produit de luxe en moyen de transport abordable. Et si 1969 a vu le premier pas de l’Homme sur la Lune, c’est aussi l’année du premier vol du Boeing 747, le premier « jumbo jet ». L’augmentation de la capacité passagers a rendu le transport aérien accessible au plus grand nombre. Je qualifierais ces avancées de rendre le possible simple.
À mon sens, la question « qu’est-ce qui est excitant en data science » appelle une réponse similaire. Les innovations très médiatisées comme le deep learning, les voitures autonomes ou le big data rendent l’impossible possible : à l’image du premier vol des frères Wright ou de l’alunissage, elles suscitent des réactions du type « incroyable qu’on sache faire ça ! »
Mais il existe une seconde révolution : la diffusion des compétences en data science, en programmation comme en analyse statistique, auprès d’un public beaucoup plus large.

De plus en plus de personnes, aux parcours variés et dans des services et secteurs très différents, s’appuient sur des outils et compétences de data science pour accomplir leur travail. Parmi ces évolutions :
- La croissance du nombre de personnes utilisant Python et R pour analyser des données
- Des interfaces d’outils statistiques de plus en plus intuitives
- Des progrès notables dans l’enseignement des statistiques et de la programmation
La plupart de ces changements n’impliquent pas de nouvelles méthodes statistiques ou d’approches d’IA inédites, tout comme la Model T n’était pas la première automobile ni le Boeing 747 le premier avion. Ce qui les rend enthousiasmants, c’est l’ampleur du public qui peut en tirer parti.
Qu’est-ce qui a changé en data science ?
L’essor des langages de programmation pour la data science. Ces dernières années, l’usage des langages de programmation dédiés à la data science a explosé. Comme le montrent les analyses du blog Stack Overflow, Python peut revendiquer le statut de langage à la plus forte croissance au monde, principalement grâce à ses outils pour la data science. Le langage R connaît une progression tout aussi impressionnante, notamment dans des secteurs comme le monde académique, la santé, le public et le conseil.
Source : Stack OverflowUne meilleure ergonomie des langages et des outils. Cette croissance vient moins de nouvelles méthodes en statistiques, machine learning ou IA que d’améliorations rendant les méthodes existantes plus faciles à utiliser. Un exemple emblématique est la bibliothèque pandas en Python, qui structure les données dans un objet appelé DataFrame et permet des analyses puissantes et intuitives.
Source : Stack OverflowPandas vise à rendre plus intuitives les transformations de données existantes. Comme l’a expliqué son créateur, Wes McKinney, dans un entretien à Quartz : « cela permet à des personnes qui ne sont pas des informaticiens chevronnés d’analyser et de manipuler des données. Il faut toujours écrire du code, mais il devient plus intuitif et accessible. Cela aide à aller au-delà d’Excel pour l’analyse de données. » Pandas est l’ossature du parcours Data Scientist with Python de DataCamp.
Dans l’écosystème R, le tidyverse apporte une révolution tout aussi enthousiasmante en matière d’ergonomie. Il s’agit d’un ensemble de packages conçus pour faciliter la transformation, la visualisation et la modélisation des données. De mon expérience, j’ai trouvé le tidyverse remarquablement intuitif pour initier les débutants à la visualisation de données, et les analyses confirment qu’il figure parmi les parties à la croissance la plus rapide de l’écosystème R.
Une meilleure formation. L’essor des langages de programmation pour la data science s’explique par l’arrivée de nouveaux publics, venant d’autres domaines de l’ingénierie logicielle ou de carrières totalement différentes. Autrement dit, la révolution de la data science tient autant à la façon dont les outils sont conçus qu’à la manière dont on les enseigne.
Nos cours interactifs de data science sur DataCamp ont appris à des centaines de milliers de personnes à analyser et visualiser des données, y compris à nombre d’entre elles qui n’avaient jamais programmé. Aplanir la courbe d’apprentissage est essentiel pour démocratiser la data science.
Qu’est-ce que cela implique pour votre entreprise ?
Quand on vous demande si vous exploitez pleinement la data science, ne supposez pas qu’il vous faut ajouter des chatbots à votre produit ou confier un budget à un consultant qui jure par le deep learning. Interrogez plutôt la façon dont vos équipes exploitent l’analyse et la visualisation de données.
Qu’un labo chez Google utilise l’IA pour construire une voiture autonome, c’est remarquable. Mais c’est tout aussi enthousiasmant quand une responsable marketing utilise R pour visualiser l’efficacité de ses campagnes, ou quand une équipe finance s’appuie sur Python pour prévoir les revenus.
Si vous souhaitez mieux comprendre comment cette révolution de la data science peut impacter votre entreprise, suivez notre webinar Democratizing Data Science Within Your Company.