Accéder au contenu principal

Comment le NLP transforme l’avenir de la data science

Avec l’essor de grands modèles comme GPT-3, le NLP produit des résultats stupéfiants. Dans cet article, nous expliquons comment le NLP façonne l’avenir de la data science et du machine learning, ses cas d’usage à venir, ses risques et comment y faire face.
Actualisé 18 sept. 2026  · 15 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

« L’intelligence artificielle ne détruira pas l’humanité. Croyez-moi. » Des mots rassurants pour quiconque redoute une IA incontrôlable menaçant l’humanité. Seul bémol : ces mots ont été rédigés par une IA. 

Le modèle de langage GPT-3 affirmait dans une tribune du Guardiian : « Nous ne complotons pas pour prendre le contrôle de la population humaine. » À la fois sidérant et glaçant, l’article illustre parfaitement l’état de l’art du traitement automatique du langage naturel (NLP) aujourd’hui.

GPT-3 est l’enfant phare des grands modèles de langage. Entraînés sur d’immenses volumes de textes, ces modèles ont émergé grâce à des architectures de NLP d’une efficacité inédite. GPT-3 peut écrire de façon cohérente, traduire des langues, répondre à des questions et même écrire du code. 

Je dois avoir des ombres sur mon chemin

Si je veux marcher je dois

Avancer chaque pas lentement, seul

Pour l’avoir tout prêt

Et je dois penser en nuances de gris 

Pour que des pensées voilées me guident

Je dois regarder le bleu et le vert

Et ne jamais laisser mon œil oublier

Que la couleur est mon amie

Et le pourpre doit m’entourer aussi

Le jaune du soleil n’est pas plus

Intrusif que la neige bleutée 

Qui tombe sur nous tous. Je dois avoir 

Des pensées grises et bleues pour m’accompagner 

Si je dois partir un jour.

A poem generated by GPT-3 OpenAI's latest language model

Les grands modèles de langage ont stupéfié le monde par leur maîtrise linguistique. Sans entraînement explicite sur une tâche donnée, ils savent en accomplir une grande variété au meilleur niveau. 

Bonne nouvelle, ces modèles ne sont pas réservés aux géants de la tech. Leur accès s’élargit grâce à une communauté open source NLP florissante, renforcée par la multiplication des APIs de modèles. Il n’a jamais été aussi simple d’exploiter la puissance d’un grand modèle de langage.

L’essor du NLP a éveillé l’intérêt des entreprises comme des investisseurs. 60 % des dirigeants tech indiquent que leur budget NLP a augmenté d’au moins 10 % par rapport à 2020, selon une enquête de John Snow Labs et Gradient Flow. On observe aussi une croissance spectaculaire des start-up du NLP qui se disputent des parts de marché. À mesure que le NLP accélère, la communauté IA alerte à juste titre sur les risques liés aux grands modèles de langage. Avant une adoption massive, nous devons garantir qu’ils soient équitables et sûrs.

Dans cet article, nous allons explorer plusieurs facettes du NLP et des grands modèles de langage : ce qu’ils sont, leurs usages et comment les déployer de manière responsable.

Les progrès du NLP : de Word2Vec au Transformer

Parmi les premières avancées marquantes de la décennie passée figure la percée de Word2Vec. Les auteurs, Mikolov et al., ont montré qu’un modèle apprenant les associations de mots surpasse nettement les modèles N-gram populaires à l’époque, tout en étant plus efficace et rapide.

Cependant, Word2Vec n’exploite pas l’ordre des mots comme information utile. L’architecture de réseaux de neurones récurrents (RNN) est venue répondre à ce défi. À la différence de Word2Vec, un RNN utilise les entrées précédentes pour influencer l’entrée et la sortie courantes. Il dispose ainsi d’une « mémorisation », idéale pour apprendre les relations dans les textes. 

Mais la mémoire des RNN est de courte durée à cause du problème de gradient qui s’annule. S’ils performent correctement sur des phrases courtes, ils échouent sur des paragraphes longs. L’arrivée des Long Short Term Memory (LSTM), un type particulier de RNN doté de « portes », a permis de conserver l’information beaucoup plus longtemps.

Les LSTM ont fait figure de standard dans le NLP jusqu’à ce que l’article « Attention Is All You Need » ne leur vole la vedette. Le mécanisme d’attention présenté confère aux réseaux la capacité de se focaliser sur un sous-ensemble d’informations pour produire une sortie. Un type spécial de réseau à base d’attention, le Transformer, s’est révélé d’une simplicité, d’une efficacité et d’une puissance remarquables. 

En particulier, le modèle BERT (Bidirectional Encoder Representations from Transformers) a marqué une avancée décisive dans le domaine du NLP (voir ce tutoriel NLP pour un aperçu de BERT). Contrairement aux modèles directionnels qui lisent le texte séquentiellement, BERT lit toute la séquence de mots d’un coup. Plus impressionnant encore, un BERT pré-entraîné peut être affiné avec une simple couche de sortie supplémentaire pour atteindre l’état de l’art sur diverses tâches. Depuis, plusieurs architectures à base d’attention ont dépassé BERT, dont XLNet, ERNIE de Baidu, et RoBERTa. Ces modèles restent très utilisés aujourd’hui.

L’essor des grands modèles de langage

Les passionnés de technologie connaissent bien des modèles comme Megatron-LM, GPT-3 et T5. Caractérisés par un nombre colossal de paramètres, les grands modèles de langage font la une par leurs performances impressionnantes en langage naturel.

L’exemple le plus connu est sans doute le Generative Pre-trained Transformer 3 (GPT-3) d’OpenAI. Avec plus de 175 milliards de paramètres et un entraînement sur 570 Go de texte, il est 100 fois plus grand que son prédécesseur GPT-2

L’augmentation de la taille leur a donné un pouvoir inattendu : accomplir des tâches pour lesquelles ils n’ont pas été explicitement entraînés. Par exemple, GPT-3 peut traduire des phrases de l’anglais vers l’allemand avec peu voire pas d’exemples. Il sait aussi répondre à des questions, rédiger des essais, résumer des textes longs et même générer du code. Étonnamment, il surpasse parfois des modèles de pointe entraînés spécifiquement pour ces tâches. 

Autrement dit, les grands modèles de langage apprennent en « few-shot ». Ils n’ont besoin que de peu de données d’entraînement adaptées au domaine pour bien performer sur une tâche précise. Ils peuvent même apprendre en « zero-shot » pour certaines tâches, c’est-à-dire sans aucun exemple préalable.

few shot learning in action

Démonstration des apprentissages few-shot, one-shot et zero-shot (Source)

La course aux modèles toujours plus grands continue. En 2021, Microsoft et Nvidia ont publié Megatron-Turing NLG 530B avec 530 milliards de paramètres. En mai 2022, Meta a partagé avec la communauté de recherche IA son Open Pretrained Transformer (OPT-175B) de 175 milliards de paramètres. DeepMind a également annoncé la publication de son modèle de 7 milliards de paramètres, le Retrieval Enhanced Transformer (RETRO), qui atteindrait les performances de réseaux 25 fois plus grands. 

size of llms

Des modèles de langage géants, chaque année plus grands (Source)

La démocratisation des grands modèles de langage

Il y a peu, ces modèles étaient l’apanage des géants disposant de supercalculateurs internes. Leur nombre de paramètres est tel que même le plus gros GPU grand public n’y suffit pas. Et même en surmontant cette limite, le temps d’entraînement resterait irréaliste sans parallélisation. Nvidia estimait par exemple qu’il faudrait 36 ans pour entraîner GPT-3 sur huit GPU V100. Lambda Labs évalue le coût initial de développement de GPT-3 à au moins 11,5 à 27,6 millions $, et le coût annuel récurrent en cloud à au moins 87 000 $. 

Des start-up aux budgets serrés n’ont ni le temps ni l’argent pour cela, mais grâce aux APIs des grands modèles, elles peuvent exploiter la puissance de GPT-3 sans investir dans des ressources de calcul hors de prix ni du matériel hautes performances. Par exemple, des fondateurs peuvent intégrer des modèles comme GPT-3 via les APIs proposées par OpenAI, Cohere et AI21.

En mars 2021, OpenAI indiquait que plus de 300 applications généraient 4,5 milliards de mots par jour via leur API GPT-3. Grâce à ces APIs, le développement d’applications NLP puissantes est plus rapide et plus scalable que jamais. 

La prolifération des start-up NLP

À mesure que l’accès aux grands modèles s’élargit, il n’est pas surprenant de voir éclore de plus en plus de start-up proposant une multitude de services. 

Les praticiens ont été bluffés par la capacité de GPT-3 à générer des textes longs et cohérents, comme l’expérience immersive d’AI Dungeon, un jeu d’aventure textuel qui s’appuie sur GPT-3. Une autre start-up, Fable Studio, a utilisé GPT-3 pour créer un nouveau genre d’histoires interactives donnant vie à des « Virtual Beings ».

example of gpt-3

Une capture d’écran d’AI Dungeon. Que ferez-vous ensuite ? 

Depuis, GPT-3 sert aussi à générer des contenus marketing pour les entreprises. Des articles de blog engageants, des contenus pour les réseaux sociaux, des textes publicitaires et des emails peuvent être produits à partir d’un court prompt. Parmi les start-up marquantes : copy.ai (valorisée 13,9 M$), CopySmith (10 M$) et Rtyr. Si certains détracteurs prétendent reconnaître aisément un texte rédigé par un bot, ils pourraient revoir leur jugement en apprenant qu’un article généré par GPT-3 a atteint le sommet de Hacker News

Les start-up NLP bousculent aussi la recherche en ligne. Un billet intitulé « Google Search is Dying » a pointé les limites des moteurs actuels et lancé un débat sur la manière de disrupter ce marché. you.com, dirigée par un ancien chief scientist de Salesforce, a levé environ 20 M$. Pour défier Google, elle s’appuie sur le NLP afin de comprendre sémantiquement les requêtes et de synthétiser les résultats du web. Une autre, Zir AI, fondée par un ex-CTO de Cloudera, fournit aux entreprises des moteurs internes qui comprennent l’intention et la sémantique. 

L’ascension de HuggingFace🤗, poids lourd du NLP

Autre start-up notable, HuggingFace propose des outils pour concevoir, entraîner et déployer facilement des modèles NLP de pointe basés sur les Transformers. Se présentant comme une « communauté IA qui bâtit l’avenir », HuggingFace anime un écosystème open source actif partageant modèles et jeux de données à la pointe. Sa simplicité d’usage renforce son statut de référence des outils NLP. 

HuggingFace Interface

L’interface de HuggingFace

Depuis sa création en 2016, HuggingFace a gagné une popularité immense dans la communauté IA. Plus de 5 000 organisations l’utilisent, dont Google AI, Facebook AI, Microsoft et l’Allen Institute for AI. Son dépôt GitHub cumule environ 60 000 étoiles, en faisant l’un des dépôts les plus populaires. De quoi justifier une valorisation de 61,3 M$ en mars 2021, avec des levées récentes susceptibles de pousser la valorisation jusqu’à 2 milliards $, selon Business Insider (avril 2022).

La démocratisation de l’IA sera l’une des plus grandes avancées sociétales, selon Julien Chaumond, CTO de HuggingFace. Sans surprise, l’entreprise s’attache à élargir l’accès aux applications NLP. Sa bibliothèque de modèles réunit environ 42 000 modèles issus de diverses librairies, dont PyTorch, TensorFlow et Keras. Son modèle le plus populaire, le gpt2 basé sur Transformer, totalise plus de 100 millions de téléchargements. 

Applications rendues possibles par HuggingFace

Ces modèles couvrent une impressionnante diversité de tâches. Au-delà des cas d’usage NLP (traduction, synthèse, génération de texte), le dépôt propose aussi des modèles pour la vision par ordinateur (classification, segmentation d’images) et l’audio (classification audio, synthèse vocale).

HuggingFace a récemment intensifié ses efforts pour démocratiser le NLP auprès des experts, des débutants et de tous les profils intermédiaires. Les étudiants découvrant le NLP peuvent profiter du cours NLP HuggingFace gratuit, avec des tutoriels pratiques sur les modèles Transformers. Ceux qui souhaitent concevoir et déployer des projets ML peuvent tirer parti des ressources de calcul gratuites proposées sur les Spaces de HuggingFace. 

Les passionnés de NLP peuvent explorer d’immenses corpus textuels via la bibliothèque Datasets. Data scientists et ingénieurs ML seront ravis d’apprendre qu’HuggingFace a récemment ouvert Optimum, pour optimiser les Transformers à grande échelle.

huggingface library

La bibliothèque Datasets de HuggingFace réunit plus de 4 500 jeux de données uniques couvrant 467 langues et dialectes, téléchargeables en quelques lignes de code.

Le futur grand modèle de langage BigScience incarne le sommet de ces efforts de démocratisation. BigScience est un modèle multilingue de 176 milliards de paramètres, construit collaborativement par plus de 1 000 chercheurs dans le monde. Son entraînement s’achèvera mi‑2022. D’ici là, il ne reste qu’à attendre les avancées que BigScience rendra possibles. Vous pouvez suivre son entraînement sur Twitter

Maintenant que nous avons passé en revue les services proposés par les start-up du NLP, voyons comment ils s’appliquent à deux secteurs en particulier. 

L’avenir du NLP en santé

Le secteur de la santé pèse 4 000 milliards $ par an, emploie un Américain sur dix et représente 25 % des dépenses publiques américaines. Malgré son importance capitale, des inefficacités structurelles minent le système de santé américain. Le NLP pourrait profondément le transformer.

Il peut d’abord améliorer l’efficacité et la précision des soins. Les médecins passent près de 6 heures par jour, soit 50 % de leur temps de travail, sur les dossiers médicaux électroniques (EHR), selon une étude 2019 de l’American Medical Association. Outre la perte de temps, les saisies manuelles entraînent inévitablement des erreurs médicales évitables. 

Le NLP peut changer la donne en automatisant la création et l’analyse des EHR. Grâce aux modèles de reconnaissance vocale, les échanges médecin‑patient peuvent être transcrits automatiquement. Avec des modèles de synthèse de texte, des comptes rendus de visite peuvent être générés rapidement. En entraînant des modèles NLP sur de vastes EHR, on peut prédire diagnostics et traitements

Le NLP peut aussi améliorer l’expérience des patients. Des chatbots basés sur le NLP peuvent fournir des informations pertinentes sur les rendez-vous, rappeler les échéances et répondre aux questions de santé des patients

NLP in medicine

Exemple de réponse à une question de patient par un modèle NLP (Source)

Dans une étude, des patientes atteintes d’un cancer du sein ont déclaré un taux de satisfaction proche de 94 % avec un chatbot médical utilisé pendant plus d’un an. Sans surprise, des entreprises comme Babylon Health et AdaHealth ont saisi cette opportunité et proposent des chatbots aux services de santé du monde entier. Le potentiel du NLP en santé est bien résumé par Neal Khosla, CEO de Curai, une start-up MedTech : « L’IA et le NLP offrent la possibilité de démultiplier l’accès à des soins primaires de qualité, pour plus de personnes et à moindre coût. »

L’avenir du NLP dans l’éducation

Autre champ d’application prometteur : l’éducation. Offrir un enseignement de qualité à grande échelle pose des défis économiques majeurs. Les chercheurs explorent donc des approches computationnelles scalables qui aident les enseignants à mieux enseigner et plus efficacement. Les modèles NLP les plus puissants peuvent être entraînés pour devenir experts d’un domaine précis. Ils peuvent alors assister les enseignants pour la notation, le feedback et même la génération de questions. 

Un exemple concret est le ProtoTransformer, un modèle qui a corrigé un examen de mi‑semestre en informatique à réponses ouvertes à l’Université de Stanford. Grâce au traitement multimodal (énoncé, schéma, grille d’évaluation), ProtoTransformer s’est montré aussi efficace que des assistants d’enseignement humains. 

Le NLP peut aussi fournir un feedback personnalisé, impossible à grande échelle dans des classes nombreuses. Cela devient envisageable si le NLP automatise la rétroaction. Exemple : MathBERT, un BERT entraîné sur un large corpus mathématique de la maternelle au niveau master. 

Le NLP peut également automatiser le processus de génération de questions. Des chercheurs de Stanford ont notamment montré que des modèles de langage modernes peuvent générer de nouvelles questions de rétro‑traduction avec un niveau de difficulté ciblé. 

NLP in education

Des modèles de langage ont généré des questions de traduction anglais → espagnol de difficultés variées. Les questions en italique sont inédites et absentes du jeu de données d’origine. 

Selon McKinsey, 20 à 40 % du temps des enseignants pourrait être automatisé par les technologies existantes. Des start-up edtech comme Noodle Factory s’inscrivent déjà dans cette voie. Libérés des tâches manuelles et répétitives, les enseignants pourraient consacrer davantage de temps au coaching et au mentorat — des activités que l’IA ne sait pas reproduire. 

Les risques des grands modèles de langage

Jusqu’ici, nous avons vu comment ces modèles ont ouvert des capacités autrefois impossibles. Mais chercheurs et critiques mettent en garde contre un optimisme naïf qui ignorerait les risques. Les grands modèles de langage vont transformer la science, la société et l’IA, affirment des chercheurs de Stanford. Que cette transformation soit bénéfique ou non dépendra de la manière dont nous gérons ces risques. 

L’un d’eux est la présence de biais et de contenus nuisibles. Les modèles sont entraînés sur des jeux de données non curés, collectés sur le web, qui peuvent être faux ou toxiques. Ils apprennent donc notre langage — avec ses travers — et amplifient les biais du monde réel. 

Un exemple devenu classique est le chatbot Tay de Microsoft (2016), qui a publié sur Twitter des messages racistes et à connotation sexuelle. Plus récemment, Wallace et al. ont montré qu’un simple déclencheur ajouté à n’importe quelle entrée peut amener GPT-2 à produire des sorties racistes même dans des contextes non raciaux. Dans la même expérience, un autre déclencheur a fait répondre le modèle SQuAD « to kill American people » à toutes les questions commençant par « why ». 

Dans le même esprit, les données d’entraînement peuvent être empoisonnées, mettant en danger les applications aval. De manière alarmante, Schuster et al. ont démontré qu’un système de complétion de code peut être amené à produire du code non sécurisé en injectant seulement quelques fichiers malveillants. On peut concevoir que d’autres modèles génératifs apprennent à produire des contenus dangereux via des injections similaires. 

Les fournisseurs de modèles peuvent également faillir. Aujourd’hui, GPT-3 requiert de téléverser chez OpenAI les données d’inférence. Une violation de ces données potentiellement sensibles constituerait une atteinte à la vie privée. Beaucoup de modèles sont aussi servis sur l’infrastructure de HuggingFace. Une attaque sur cette infrastructure commune pourrait perturber de nombreux modèles en production. 

Ces risques sont amplifiés lorsque les modèles pré-entraînés sous-jacents deviennent ultra‑populaires. Une faille découverte par un adversaire dans un modèle répandu peut être exploitée contre d’autres applications qui le partagent. 

Le manque d’interprétabilité

L’interprétabilité se définit comme le degré auquel un humain peut comprendre la cause d’une décision. Malheureusement, beaucoup de modèles NLP actuels sont loin de l’idéal en la matière.

Les grands modèles de langage sont des boîtes noires qui livrent peu ou pas d’indications sur leur raisonnement. Il est hasardeux de prendre des décisions à fort enjeu sans comprendre le processus décisionnel. Par exemple, un système NLP chargé d’accorder ou de refuser une libération conditionnelle doit expliquer ses décisions par des faits. Ces explications sont un moyen concret d’auditer l’équité et la cohérence de ses jugements. 

Certes, des méthodes d’IA explicable existent pour éclairer le comportement des modèles. Ce sont des modèles distincts conçus pour expliquer une boîte noire. Citons par exemple l’outil LIT (Language Interpretability Tool) de Google et LIME.

google lit demo

Démonstration de LIT par Google (Source)

Mais ces explications peuvent être infidèles et ne pas refléter fidèlement le raisonnement derrière la prédiction. Elles peuvent être peu fiables, trompeuses et dangereuses. Des explications plausibles mais infidèles peuvent donner un faux sentiment de sécurité et inciter à faire confiance à des modèles bancals, comme l’explique l’article de référence « Stop Explaining Black-Box Machine Learning Models for High Stake Decisions and Use Interpretable Models Instead ».

Les grands modèles de langage vont transformer l’avenir de l’IA

« Ce n’est que le début d’un changement de paradigme : les grands modèles de langage ne font que commencer à transformer la manière de concevoir et déployer les systèmes d’IA », conclut un groupe éminent de chercheurs en IA en détaillant opportunités et risques associés. 

Les cas d’usage qu’ils rendent possibles sont proprement stupéfiants. Mais tout ce qui brille n’est pas or. En tant que praticiens, nous devons connaître leurs limites et les utiliser avec discernement. C’est à cette condition que nous en exploiterons tout le potentiel.

Pour aller plus loin en traitement du langage naturel :

Ou commencez ici pour apprendre l’IA depuis les fondamentaux.

Sujets
Intelligence artificielle