Accéder au contenu principal

Les dernières nouveautés d’OpenAI, de Google AI et leurs impacts sur la data science

Découvrez les technologies de langage, de vision et multimodales qui bousculent le marché et comment elles nous rendent plus productifs et efficaces.
Actualisé 18 sept. 2026  · 13 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

OpenAI Google AI Data Science

Google AI et OpenAI ont l’habitude de dévoiler des technologies d’IA de pointe. Mais le paysage a changé avec l’arrivée de ChatGPT, qui a déclenché une nouvelle course où les géants comme Google s’empressent de lancer des modèles similaires.

Dans cet article, nous passons en revue les dernières avancées d’OpenAI et de Google AI et ce que nous pouvons en attendre. Nous verrons aussi comment ces progrès transforment la data science et comment en tirer parti pour gagner en productivité.   

OpenAI

L’API OpenAI est une plateforme qui donne accès, via API, à des modèles génératifs de pointe. On peut générer des images de haute qualité avec DALL·E 2, du texte et du code avec GPT-3, et utiliser des embeddings pour d’autres tâches liées au langage. De plus, elle permet de modérer les résultats, de fixer des limites de débit et d’affiner un modèle sur un jeu de données spécifique. Pour en savoir plus sur GPT-3, lisez notre guide du débutant sur GPT-3.

OpenAI Products

Image par l’auteur | Source OpenAI

Tous ces produits sont commerciaux, sur un modèle à l’usage. OpenAI publie toutefois ponctuellement des outils et modèles open source, parmi lesquels :

  1. Whisper : modèle de reconnaissance vocale entraîné avec une supervision faible à grande échelle.
  2. OpenAI Baselines : implémentations d’algorithmes d’apprentissage par renforcement.
  3. Gym : boîte à outils pour développer et évaluer des algorithmes d’apprentissage par renforcement.
  4. GPT2 : code et modèle de l’article « Language Models are Unsupervised Multitask Learners ».
  5. DALL-E : package PyTorch pour le VAE discret utilisé par DALL·E.

Les APIs, toolkits et grands modèles de langage sont précieux, mais aucun n’a connu un succès comparable à ChatGPT

Le modèle ChatGPT a été entraîné avec du Reinforcement Learning from Human Feedback (RLHF), comme InstructGPT (une version améliorée de GPT-3), avec toutefois une phase de collecte des données un peu différente. 

En quoi diffère-t-il des générations précédentes ? L’IA conversationnelle peut poser des questions de relance, contester des prémisses erronées, reconnaître ses erreurs et démontrer des garde-fous de sûreté.

Récemment, le partenaire d’OpenAI, Microsoft, a présenté une version améliorée de ChatGPT. Avec le déploiement itératif d’OpenAI, une nouvelle vague de technologies capables de comprendre nos besoins et de nous assister voit le jour. 

Si vous débutez en intelligence artificielle, suivez le cours sans code AI Fundamentals. Il couvre les bases de l’apprentissage automatique, comme l’apprentissage supervisé et non supervisé, le deep learning, et plus encore. 

GPT-4

Au-delà de ChatGPT, GPT-4 est attendu comme le grand modèle de langage le plus avancé. Dans le podcast Greylock, le PDG d’OpenAI, Sam Altman, a livré quelques informations : les rumeurs sur Twitter sont fausses, GPT-4 n’aura pas 100 000 milliards de paramètres, et « certains risquent d’être déçus ». Il a aussi précisé « nous publierons GPT-4 lorsque nous jugerons qu’il est sûr et opérationnel ». 

GPT 4

Image par l’auteur

Que peut-on attendre de GPT-4 ?

  • Une taille de modèle pas beaucoup plus grande que GPT-3.
  • Des modèles géants optimisés via une nouvelle paramétrisation (μP).
  • Un entraînement avec calcul optimal, en augmentant le nombre de tokens pour minimiser la perte. 
  • Un modèle centré sur le texte : GPT-4 ne sera pas multimodal comme DALL·E 2.
  • Un recours possible à la parcimonie pour réduire les coûts de calcul.
  • À l’instar de ChatGPT, une meilleure adéquation avec nos intentions et nos valeurs.

Découvrez GPT-1, GPT-2, GPT-3 et GPT-4 dans notre article Tout ce que nous savons déjà sur GPT-4

Vers une AGI sûre

Lors de son entretien avec StrictlyVC, Sam Altman a évoqué l’état d’avancement vers l’AGI (Artificial General Intelligence). 

Il a déclaré : « Plus on s’en approche, plus il est difficile de répondre. Je pense que la transition sera plus floue et plus progressive qu’on ne l’imagine. »

Il a aussi tordu le cou aux rumeurs : OpenAI ne dispose pas d’une AGI qui apprend comme un humain. 

Creation of safe AGI

Image par l’auteur

OpenAI est sur la bonne voie pour développer une AGI sûre, mais nous en sommes encore loin. L’AGI évoquée serait un modèle multimodal capable de comprendre la parole, le texte, l’image et la vidéo. En pratique, une combinaison de ChatGPT, DALL·E 2, Whisper, d’un modèle de génération vidéo et d’algorithmes d’apprentissage par renforcement. 

Modèles multimodaux

Pour parvenir à l’AGI, OpenAI doit travailler sur des modèles multimodaux, pas seulement texte–image, mais aussi texte–vidéo et audio–vidéo/ audio. Autrement dit, vous pourrez dialoguer avec un agent à la voix et à l’apparence naturelles. Des développeurs l’ont déjà esquissé, comme ce persona de streameur Twitch généré par IA. Ce n’est pas parfait, mais c’est un début. 

Au StrictlyVC, Sam Altman a indiqué qu’un modèle vidéo était en préparation. On peut raisonnablement supposer une génération texte–vidéo couplée à un modèle audio, ajoutant une couche de complexité. Des techniques de génération vidéo existent déjà, par superposition d’images issues de Stable Diffusion. 

Google AI 

Google AI est l’épine dorsale de l’écosystème Google. On la retrouve dans Maps, Photos, les applications et le Cloud. Google est à la pointe du développement d’outils et de modèles d’IA. La plupart des produits sont disponibles sur Google Cloud, d’AutoML aux grands modèles de vision et de langage les plus avancés. 

L’entreprise a aussi publié de multiples outils et modèles d’état de l’art qui ont transformé le traitement du langage naturel, de la parole et de la vision par ordinateur. De TensorFlow à BERT (Bidirectional Encoder Representations from Transformers), Google a ouvert une nouvelle voie pour la recherche et développement en IA et machine learning. 

Google LaMDA

Gif tiré de LaMDA

En 2020, Google Research a présenté Meena, un modèle conversationnel neuronal qui comprend le contexte et apprend à répondre de manière pertinente. Par la suite, Google a publié LaMDA, proche de ChatGPT. Une percée en conversation, bâtie sur des transformers mais entraînée sur des dialogues. 

Chaque année, Google dévoile de nouvelles technologies et, à l’avenir, on peut s’attendre à un moteur de recherche enrichi par Bard, ainsi qu’à des modèles de langage, de vision, génératifs et multimodaux qui rendront l’IA polyvalente. 

Google AI Bard

Après le lancement de ChatGPT, certains ont parlé d’un « Google killer ». Le partenariat renforcé entre Microsoft et OpenAI a crédibilisé cette idée. Microsoft s’attaque à Google sur la recherche avec son Bing dopé à OpenAI. 

En réponse, Google a lancé sa version de ChatGPT, baptisée Google AI Bard. Consultez notre comparatif entre ChatGPT et Google Bard dans un article dédié. 

Google Bard and new AI features

Gif tiré de Bard and new AI features

Dans ses dernières annonces IA, Sundar Pichai, PDG de Google et d’Alphabet, a présenté Bard, un nouveau service conversationnel expérimental propulsé par LaMDA. Google a indiqué l’avoir ouvert à des testeurs de confiance, avec une ouverture au public dans les semaines suivantes. 

Bard s’appuie sur les informations du web pour fournir des réponses de qualité. Contrairement à ChatGPT, Bard est un service qui marie la connaissance du monde à la puissance, l’intelligence et la créativité. Google le propose d’abord avec une version légère de LaMDA, puis déploiera des modèles plus puissants.

Langage, vision et modèles génératifs

Selon les récents bilans de Google Research, des avancées majeures ont été réalisées en technologies de langage, vision par ordinateur et modèles génératifs. 

The ability to perform multi-step arithmetic

Image Google AI

  • Grands modèles de langage : PaLM (Pathways Language Model) et LaMDA ont montré des résultats prometteurs. Attendez-vous à des modèles encore meilleurs pour l’IA conversationnelle et d’autres tâches de traitement du langage naturel. 
  • Vision par ordinateur : MaxViT (Multi-Axis Vision Transformer), Pix2Seq (cadre de modélisation du langage pour la détection d’objets) et des progrès en imagerie 2D vers 3D via interpolation de mouvements.
  • Génération d’images : modèles photoréalistes avancés : Imagen (modèle de diffusion) et Parti (architecture transformer autoregressive). Les deux génèrent des pixels d’image à partir de texte. 
  • Génération vidéo : Google AI a travaillé sur Imagen Video et Phenaki. Imagen Video utilise des modèles de diffusion en cascade pour générer des vidéos haute résolution, tandis que Phenaki génère des vidéos de longueur variable à partir de descriptions textuelles ouvertes. 

Lancez votre carrière en deep learning (IA) avec notre parcours de compétences Deep Learning in Python. Il comprend quatre cours pour faire passer vos compétences en apprentissage automatique au niveau supérieur. 

Modèles multimodaux

La plupart des modèles de ML se concentrent sur une seule modalité (classification de texte, segmentation d’images, reconnaissance vocale). Mais avec DALL·E 2 et Stable Diffusion, les entreprises se tournent vers le multimodal pour atteindre l’état de l’art. 

Google AI atteint la multimodalité en faisant passer les données par des couches de traitement spécifiques à chaque modalité, puis en fusionnant les caractéristiques via une couche goulot d’étranglement. La combinaison des modalités peut aussi améliorer les performances sur des tâches mono-modales. 

Multimodal Models

Gif tiré de Google AI

Voici quelques travaux récents de Google AI sur les modèles multimodaux : 

  • Locked-image Tuning (LiT) ajoute la compréhension du langage à des modèles d’images préentraînés. 
  • PaLI réalise de nombreuses tâches dans plus de 100 langues : VQA, légendage d’images, détection d’objets avec traduction, classification d’images, et plus encore.  
  • VDTTS (Visually-Driven Text-To-Speech) prend un texte et les images vidéo originales d’un acteur pour générer une sortie vocale synchronisée, en respectant timing et émotion. 
  • Look and Talk est une technologie multimodale qui utilise la vidéo et l’audio pour rendre la conversation avec Google Assistant naturelle. Le modèle apprend des indices visuels et audio pour mieux déterminer si l’interlocuteur s’adresse à l’assistant.  
  • 4D-Net combine des nuages de points 3D issus de véhicules autonomes avec d’autres capteurs pour mieux comprendre l’environnement et les objets, et prendre de meilleures décisions.

On peut penser que ces modèles seront progressivement intégrés dans l’écosystème Google pour renforcer l’engagement et créer de nouveaux produits. 

IA et data science

L’IA moderne s’appuie sur la data science, les algorithmes et l’ingénierie des données. Pour créer des technologies de pointe comme ChatGPT et LaMDA, il faut maîtriser les fondamentaux : la gestion des données, les techniques de traitement du langage naturel et d’apprentissage par renforcement, les algorithmes de deep learning et transformers, ainsi que l’optimisation des modèles.

Lancez votre carrière en data science avec le parcours Data Scientist with Python. Il vous apprendra les compétences essentielles pour devenir data scientist professionnel.

AI and Data Science

Image par l’auteur

Répondons à la question qui fâche : l’IA va-t-elle remplacer les data scientists, analystes ou ingénieurs ? La réponse courte est « non ». Peut-être dans un futur lointain, mais nous aurons alors d’autres métiers, plus créatifs et décisionnels. Le développement de l’IA nous fera grandir aussi.

GitHub Copilot, DALL·E 2, ChatGPT et d’autres technologies de pointe sont là pour nous assister. Elles sont là pour nous rendre plus productifs et efficaces. 

Andrej Karpathy, ex-directeur de l’IA chez Tesla et OpenAI, déclare :

« Copilot a considérablement accéléré mon code, j’ai du mal à imaginer revenir au “codage manuel”. J’apprends encore à l’utiliser mais il écrit déjà ~80 % de mon code, ~80 % de précision. Je ne “code” presque plus, je rédige des prompts. Et j’édite. » - Twitter

Preuve que ceux qui comprennent la technologie l’utiliseront pour progresser en programmation, logique, analyse de données et prise de décision. 

Comment les data scientists peuvent-ils utiliser l’IA ?

  1. Générer des données réalistes tout en préservant la vie privée.
  2. Écrire un code élégant et efficace.
  3. Prototyper un produit.
  4. Améliorer l’analyse de données grâce aux prompts. 
  5. Générer des requêtes SQL complexes en langage naturel. 
  6. Créer de meilleurs rapports pour des parties prenantes non techniques.
  7. Mener des analyses statistiques complexes avec explications.
  8. Apprendre de nouveaux langages, compétences, frameworks et concepts. 
  9. Utiliser l’AutoML piloté par l’IA et des outils d’optimisation de modèles pour des solutions ML de pointe.
  10. Construire des scripts d’automatisation pour gagner du temps et éviter les erreurs. 

Une nouvelle ère pour l’IA

Microsoft, en partenariat avec OpenAI, a intégré ChatGPT dans le nouveau moteur Bing, présenté comme un copilote pour le web. Avec cette annonce, une nouvelle course à la suprématie technologique s’est engagée.

Microsoft prévoit d’intégrer ChatGPT et d’autres modèles GPT dans tout son écosystème. Cela va tout changer : sans quitter l’application, les utilisateurs pourront rechercher, ajouter et éditer du contenu, et générer des idées en dialoguant avec un agent. 

Bing Copilot Demo

Démo Bing Copilot

Lors de l’événement de Paris, Google a lancé Bard, sa réponse à ChatGPT, propulsée par une version légère de LaMDA. Bard ressemble beaucoup au copilote web de Microsoft : il est intégré à la recherche Google et offre des fonctionnalités similaires. 

Les limites des avancées en IA

  • Les grands modèles de langage comme GPT peuvent servir à des campagnes de désinformation à l’avenir – openai.com. Les risques physiques et psychologiques existent.
  • Les contenus générés par IA sont optimisés SEO et plus difficiles à détecter. Étudiants et professionnels peuvent les utiliser pour produire des travaux « originaux » sans apprendre ni comprendre. Plus d’informations sur les risques et opportunités pour l’éducation dans la documentation OpenAI API.
  • Les problèmes de droits d’auteur sont bien réels. Ces modèles ont été entraînés sur des textes en ligne, dont certains protégés. On ne peut pas s’approprier une œuvre au nom du progrès de l’IA. 
  • Parfois, l’IA produit des réponses factuellement erronées. Implémentées dans des services cruciaux, par exemple la police, ces erreurs pourraient avoir de lourdes conséquences. 

Ces enjeux trouveront des réponses, et de nouvelles lois encadreront l’usage de l’IA. Les écoles et les plateformes de contenus déploient déjà des politiques sur les contenus générés par IA. 

Que faire à notre niveau ? Se former à ces technologies et les utiliser de façon responsable. Vous pouvez apprendre l’IA en vous inscrivant à notre parcours Machine Learning Scientist with Python. Il vous enseignera les compétences clés pour décrocher un poste d’ingénieur IA.

Sujets
Intelligence artificielle
Apprentissage profond
Science des données

Meilleures formations

Cursus

Principes fondamentaux de l'apprentissage automatique en Python

16 h
Apprenez l'art de l'apprentissage automatique et devenez un maître de la prédiction, de la reconnaissance des formes et des débuts de l'apprentissage profond et de l'apprentissage par renforcement.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow