Ces derniers mois, les mondes de la data science et de l’IA bruissent de l’arrivée de GPT-3, le tout dernier modèle de langage d’OpenAI. Pour beaucoup, ce modèle marque un saut majeur dans la capacité d’un algorithme à raisonner sur le langage humain, et ce, sur une grande variété de tâches.
Les développeurs qui testent GPT-3 ont partagé de nombreux cas d’usage fascinants. Des exemples de génération automatique de code à partir d’instructions en anglais, de réponses à des questions médicales et de traduction de textes juridiques ont stimulé l’imagination de nombreux data scientists quant à la prochaine génération de logiciels propulsés par l’IA.



Si, au niveau organisationnel, une grande part de la valeur du machine learning réside dans des cas d’usage à fort impact immédiat comme la prédiction du churn, les prévisions commerciales simples ou la segmentation client, il est utile de réfléchir à ce que la commercialisation de GPT-3 implique pour demain. Son potentiel pourrait transformer notre manière d’envisager et d’industrialiser l’intelligence artificielle.
Définir l’intelligence artificielle, le machine learning et le deep learning
Le monde de l’entreprise et les médias regorgent de termes à la mode comme intelligence artificielle (IA), machine learning (ML) et deep learning (DL). Posons rapidement ces définitions avant d’expliquer le fonctionnement de GPT-3.
Andrew Ng, cofondateur de Google Brain et ancien Chief Scientist chez Baidu, décrit l’intelligence artificielle comme un « vaste ensemble d’outils permettant de rendre les ordinateurs plus intelligents ». Cela inclut des logiciels explicitement programmés comme les calculatrices, mais aussi des applications de ML telles que les systèmes de recommandation et les voitures autonomes.
Le machine learning est « le domaine d’étude qui donne aux ordinateurs la capacité d’apprendre sans être explicitement programmés », selon Arthur Samuel, pionnier de l’IA et du jeu vidéo. On distingue généralement deux types d’algorithmes de machine learning. Le premier est l’apprentissage supervisé, où les algorithmes apprennent les relations entre des données existantes (entrées) et des étiquettes (sorties), puis prédisent la sortie sur de nouvelles données, par exemple la probabilité qu’un nouveau client se désabonne à partir de données historiques. Le second est l’apprentissage non supervisé, où les algorithmes découvrent des motifs généraux dans les données et regroupent les points de données similaires entre eux, comme dans la segmentation de clients selon des comportements communs.
Le deep learning est une forme de machine learning fondée sur des réseaux de neurones artificiels à plusieurs couches, inspirés de manière approximative des réseaux biologiques du cerveau. Il peut être supervisé ou non supervisé, et il est en grande partie à l’origine des cas d’usage phares de la dernière décennie en ML, comme la reconnaissance d’images et l’analyse de sentiments. Les modèles de deep learning varient par leur architecture, de simple à complexe selon le nombre de couches et de nœuds. Plus un modèle est complexe, plus il comporte de paramètres. Pour en savoir plus sur la construction de modèles de deep learning, consultez le parcours de compétences en deep learning de DataCamp.
Pour approfondir ces sujets, lisez notre e-book The Definitive Guide to Machine Learning for Business Leaders.
Comment fonctionne GPT-3
Où GPT-3 se situe-t-il par rapport à l’intelligence artificielle, au machine learning et au deep learning ? L’acronyme GPT signifie « generative pre-trained transformer » — un algorithme de deep learning non supervisé généralement pré-entraîné sur un grand volume de texte non étiqueté. Il est ensuite affiné et entraîné sur un vaste jeu de données étiquetées spécifique à une tâche (par exemple, traduction de l’anglais vers le français), puis il doit inférer l’ensemble de sorties le plus probable (traduction française) pour un ensemble d’entrées donné (mots anglais). Vous pouvez l’imaginer comme une forme d’autocomplétion extrêmement sophistiquée, applicable à de nombreuses tâches linguistiques.
GPT-3 est la troisième itération de ce modèle et, sans innover sur l’architecture de ses prédécesseurs, il est pré-entraîné sur des jeux de données immenses couvrant une large part d’internet, dont le jeu de données Common Crawl, et comporte bien plus de couches dans son architecture. Cela fait de GPT-3 le modèle de langage le plus complexe jamais conçu, avec 175 milliards de paramètres. C’est dix fois plus que le modèle le plus complexe avant la sortie de GPT-3, Turing-NLG de Microsoft, et 117 fois plus que GPT-2.
Surtout, GPT-3 bénéficie du few-shot learning, où le modèle pré-entraîné n’a pas besoin d’être affiné avec d’énormes volumes de données étiquetées pour une tâche linguistique précise. On lui fournit plutôt une description de la tâche — traduire des mots anglais en français — ainsi que quelques exemples d’entrées et de sorties. Associé à une interface plug-and-play simple à utiliser, GPT-3 lève en grande partie les barrières à l’entrée et permet à des non-spécialistes d’obtenir des résultats probants sur différentes tâches de langage.

Pourquoi GPT-3 est important
Avec seulement quelques exemples et une description de tâche, GPT-3 rivalise avec des modèles de langage affinés sur des jeux d’entraînement spécifiques, et ce pour de nombreuses tâches linguistiques. GPT-3 montre également une certaine réussite sur des tâches nécessitant du raisonnement, comme l’arithmétique, qui ne sont pas à proprement parler des tâches de langage. Par exemple, GPT-3 a atteint 100 % de précision sur des additions et soustractions à deux chiffres après avoir reçu quelques exemples. Des modèles moins complexes, dotés de moins de paramètres, n’ont pas réussi à dépasser le plafond des 60 % sur ces mêmes tâches. Même si GPT-3 faiblit sur des formes plus complexes d’arithmétique, cela laisse penser que des modèles plus vastes pourraient généraliser au-delà du domaine sur lequel ils ont été entraînés.

Fait intéressant, cela suggère que l’on peut encore progresser en augmentant simplement la taille des jeux de données et des modèles. À ce stade, les performances globales du modèle sur différentes tâches ne semblent pas plafonner à 175 milliards de paramètres. En partant du même facteur d’échelle entre GPT-2 et GPT-3, on peut se demander comment évoluerait la performance si GPT-4 comptait 117 fois plus de paramètres que GPT-3.

Actuellement en phase de bêta privée, l’emballage de GPT-3 dans une API plug-and-play signifie qu’il pourrait être déployé à grande échelle dès sa sortie publique. Comme l’a souligné la chercheuse en IA Shreya Shankar, un défi majeur sera de servir cette API de manière efficace et simple pour les organisations.

Ce que cela signifie pour l’avenir
Les nouvelles technologies suivent souvent le cycle de hype de Gartner — d’ailleurs, le CEO d’OpenAI, Sam Altman, a déjà tiré la sonnette d’alarme à propos du battage autour de GPT-3.

Cependant, les cas d’usage publiés par les développeurs de GPT-3 éclairent les types d’applications dopées à l’IA que l’on peut attendre à moyen et long terme. Parmi les applications potentielles : des outils pour aider les designers à prototyper plus facilement, fluidifier l’analyse de données, renforcer la recherche, automatiser la production de contenus pour les équipes marketing, et bien plus.




De plus, proposer le modèle via une interface plug-and-play simple pourrait changer la manière d’instrumentaliser l’IA à l’échelle de l’organisation. Cela pourrait, par exemple, décourager le développement de modèles internes et permettre à des profils moins techniques de bâtir des solutions avec GPT-3.
Enfin, déployer des systèmes d’IA à grande échelle exige de prendre très au sérieux le risque de diffusion de biais et de dommages. Comme de nombreux chercheurs l’ont constaté en testant GPT-3, il est relativement facile de générer des sorties nuisibles qui renforcent des stéréotypes et des biais à partir d’entrées pourtant neutres.

Comme tout algorithme de machine learning déployé à grande échelle, GPT-3 doit faire l’objet d’une vigilance et d’un suivi rigoureux pour limiter les impacts négatifs potentiels.
