Cursus
BERT, GPT-3, DALL-E 2, LLaMA, BLOOM : ces modèles figurent parmi les vedettes de la révolution de l’IA que nous observons depuis la sortie de ChatGPT. Qu’ont-ils en commun ? Vous l’avez deviné : ce sont tous des foundation models.
Les foundation models sont une évolution récente de l’IA. Ils reposent sur des algorithmes conçus pour optimiser la généralité et la polyvalence des résultats. Basés sur des réseaux de neurones à grande échelle, ils sont souvent entraînés sur un large éventail de sources et de volumes de données afin d’accomplir une variété de tâches en aval, y compris certaines pour lesquelles ils n’ont pas été spécifiquement conçus ni entraînés.
La popularisation des foundation models relance le débat classique entre IA faible et intelligence artificielle générale (AGI), également appelée IA forte. L’IA faible désigne des systèmes conçus pour des tâches précises, incapables d’agir au-delà de leur périmètre. À l’inverse, l’AGI est un système hypothétique capable de comprendre, d’apprendre et d’appliquer des connaissances sur un large éventail de tâches, à l’image d’un humain.
S’ils ne raisonnent pas encore comme nous, les foundation models livrent des résultats inédits qui nous rapprochent du seuil de l’AGI. D’où l’intérêt, pour les professionnels de la donnée comme pour les non-spécialistes, de bien les connaître.
Pour démarrer, notre parcours de compétences AI Essentials vous offre une vue d’ensemble approfondie des modèles d’IA de nouvelle génération. Si vous avez déjà des compétences, notre article sur les projets en IA générative vous permet de mettre vos connaissances en pratique.
Voyons de plus près ce que sont les foundation models !
Que sont les foundation models ? Comprendre les notions clés
Le terme foundation model est relativement récent et chevauche d’autres notions populaires comme l’IA générative, le transformer et les grands modèles de langage (LLMs).
La terminologie de l’IA demeure toutefois discutée. Voici des définitions qui vous aideront à naviguer dans ce domaine en évolution rapide :
- IA générative : terme englobant décrivant des systèmes d’IA dont la fonction première est de générer du contenu, par opposition à d’autres systèmes conçus pour la classification, la prédiction, etc.
- Transformer : les transformers ont bouleversé l’apprentissage profond. Leur architecture innovante gère bien mieux les données séquentielles. Particulièrement adaptés au traitement du texte, ils sont devenus une pierre angulaire du traitement et de la génération du langage naturel (NLP/NLG). Ils s’appliquent aussi à d’autres types de données, comme l’image, avec un succès comparable.
- Grand modèle de langage : les LLMs modélisent et traitent le langage humain. Les transformers en sont la technologie sous-jacente. On dit qu’ils sont « grands » car ils comptent des centaines de millions, voire des milliards de paramètres, préentraînés sur d’immenses corpus de textes.
- Foundation model : terme générique pour désigner des modèles d’IA conçus pour produire une grande variété de résultats. Ils couvrent de multiples tâches et cas d’usage : génération de texte, vidéo, image ou audio. Particularité : ils peuvent fonctionner seuls ou servir de « fondation » à d’autres applications. Par exemple, le LLM GPT est le foundation model de ChatGPT.
Comment fonctionnent les foundation models ?
Quelle que soit la tâche visée ou le type de données d’entraînement, la technologie au cœur des foundation models est le transformer.
Développés par des chercheurs de Google en 2017, les transformers offrent une alternative aux réseaux de neurones récurrents (RNN) et aux réseaux de neurones convolutionnels (CNN) pour traiter les données séquentielles, notamment le texte.
Les transformers prédisent le mot suivant d’une séquence pour produire une réponse cohérente. Ils s’appuient pour cela sur un mécanisme d’attention qui pondère l’influence des différents mots lors de la génération.
L’entraînement des transformers comporte deux étapes : le pré-entraînement et l’affinage.
Pré-entraînement
Dans cette phase, les transformers sont entraînés sur de grandes quantités de données brutes (textuelles), majoritairement issues d’Internet.
L’entraînement utilise l’apprentissage auto-supervisé, une approche innovante qui ne nécessite pas d’annotation manuelle.
L’objectif est d’apprendre les régularités statistiques du langage. La stratégie dominante pour améliorer les performances consistant à augmenter la taille du modèle (c.-à-d. le nombre de paramètres) et le volume de données de pré-entraînement, cette phase est généralement longue et coûteuse.
Affinage (fine-tuning)
Le pré-entraînement donne au transformer une compréhension de base du langage, insuffisante pour des tâches opérationnelles spécifiques. Il est donc affiné sur un jeu de données plus restreint et spécifique à un domaine, généré avec l’aide d’évaluateurs humains suivant des consignes précises.
Modalité
Autre caractéristique importante : la modalité. Selon les types de données en entrée, les foundation models peuvent être unimodaux ou multimodaux. Les premiers n’acceptent qu’un seul type de données et génèrent le même type de sortie ; les seconds acceptent plusieurs modalités en entrée et produisent divers types de sorties (par exemple, GPT-4 accepte des entrées images et texte et génère du texte).
Le fonctionnement des transformers peut sembler ardu et dépasse le cadre de cet article. Pour aller plus loin, consultez notre article Qu’est-ce que ChatGPT ?, où nous avons posé la question directement à ChatGPT, et découvrez Transformers et Hugging Face pour une vue plus technique.
Pour comprendre en détail le fonctionnement des LLMs, notre cours Concepts sur les grands modèles de langage (LLMs) est un excellent point de départ.
Applications des foundation models
Les foundation models peuvent fonctionner de manière autonome ou servir de base à une myriade de systèmes et d’applications d’IA en aval. Si la majorité des systèmes récents génèrent du texte ou du code et accomplissent des tâches de NLP, de plus en plus de systèmes produisent aussi des images, de la musique, etc.
Vous trouverez ci-dessous un tableau de quelques foundation models parmi les plus populaires.
|
Foundation model |
Système d’IA en aval |
Applications |
|
LaMDA (Google) |
Service de chat conversationnel en IA, expérimental. |
|
|
GPT-3.5 (OpenAI) |
Permet des conversations proches du langage humain. |
|
|
GPT-4 (OpenAI) |
Aide les utilisateurs de DataLab à coder mieux et plus efficacement. |
|
|
Codex (OpenAI) |
GitHub Copilot |
Suggère du code et des fonctions complètes en temps réel. |
|
AudioLM (Google) |
MusicLM |
Crée de la musique à partir de descriptions textuelles. |
|
BLOOM (Hugging Face) |
Pas d’application en aval. Utilisable directement |
Multiples tâches de NLP. Entraîné en 46 langues et 13 langages de programmation. |
|
LLaMA (Meta) |
Pas d’application en aval. Utilisable directement |
Aide les chercheurs à faire progresser leurs travaux dans ce sous-domaine de l’IA. |
|
DALL-E 2 (OpenAI) |
Pas d’application en aval. Utilisable directement |
Génère des images et des illustrations réalistes à partir d’une description en langage naturel. |
Enjeux et risques liés aux foundation models
En pointe sur l’IA, les foundation models peuvent alimenter d’innombrables applications. Il est toutefois essentiel d’en considérer les risques et limites.
Voici une liste non exhaustive des risques à prendre en compte pour une adoption étendue des foundation models :
- Manque de transparence. L’opacité algorithmique est une préoccupation majeure. Souvent décrits comme des « boîtes noires », ces modèles sont si complexes qu’il est impossible de retracer leur chaînement. Les fournisseurs d’IA hésitent souvent à dévoiler des informations pour des raisons de confidentialité commerciale. Accroître la transparence est pourtant indispensable pour évaluer les coûts, l’impact, la sécurité et l’efficacité des foundation models.
- Biais et discrimination. Des modèles biaisés peuvent engendrer des décisions injustes, aggravant les discriminations envers des groupes minoritaires. IBM Research explore des moyens de réduire ces biais.
- Vie privée. Les foundation models sont entraînés sur d’énormes volumes de données, souvent personnelles, avec des enjeux de confidentialité et de sécurité.
- Considérations éthiques. Les décisions émanant de ces modèles peuvent avoir des effets réels sur nos vies et nos droits fondamentaux. Nous abordons l’éthique de l’IA générative dans un billet dédié.
Quel avenir pour les foundation models ?
Les foundation models alimentent l’essor actuel de l’IA générative. Le champ des applications est tel que tous les secteurs, y compris la data science, seront vraisemblablement touchés par l’adoption de l’IA dans les années à venir.
Même si l’intelligence artificielle générale reste lointaine, le développement des foundation models constitue une étape clé de la course à l’IA. Entreprises, régulateurs et société doivent se tenir informés de l’état de l’art pour garantir transparence, équité et responsabilité.
DataCamp s’emploie à proposer des ressources complètes et accessibles pour permettre à chacun de suivre les évolutions de l’IA. Découvrez-les :
- Introduction to Meta AI's LLaMA: Empowering AI Innovation – Ce billet présente LLaMA, une collection de foundation models de langage de pointe.
- Introduction au machine learning statistique – Tutoriel expliquant comment les techniques statistiques sous-tendent les modèles de machine learning, base essentielle pour comprendre les foundation models.
- 5 projets à réaliser avec des modèles d’IA générative (avec exemples) – Des idées de projets concrets mobilisant des modèles d’IA générative, un type de foundation model.
- Comment utiliser éthiquement le machine learning pour piloter les décisions – L’importance des considérations éthiques lors de l’usage de modèles de machine learning, y compris les foundation models.
- AI Essentials Skill Track – Ce parcours d’apprentissage propose une introduction complète à l’IA, y compris des modèles comme ChatGPT, un type de foundation model.
Je suis analyste de données indépendant et je collabore avec des entreprises et des organisations du monde entier dans le cadre de projets de science des données. Je suis également formateur en science des données avec plus de 2 ans d'expérience. Je rédige régulièrement des articles sur les sciences des données en anglais et en espagnol, dont certains ont été publiés sur des sites web réputés tels que DataCamp, Towards Data Science et Analytics Vidhya En tant que scientifique des données ayant une formation en sciences politiques et en droit, mon objectif est de travailler à l'interaction des politiques publiques, du droit et de la technologie, en tirant parti du pouvoir des idées pour faire avancer des solutions et des récits innovants qui peuvent nous aider à relever des défis urgents, à savoir la crise climatique. Je me considère comme un autodidacte, un apprenant permanent et un fervent partisan de la pluridisciplinarité. Il n'est jamais trop tard pour apprendre de nouvelles choses.
