Accéder au contenu principal

GPT-4 Vision : le guide complet pour débutants

Ce tutoriel vous présente tout ce qu'il faut savoir sur GPT-4 Vision : accès, prise en main avec des exemples concrets, et limites du modèle.
Actualisé 19 sept. 2026  · 12 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Avec la sortie de ChatGPT, en plein engouement pour l'IA, OpenAI a lancé GPT-4, son produit phare aux capacités génératives remarquables. Lors de son lancement en mars 2023, OpenAI a présenté les possibilités de l'IA générative multimodale via GPT-4. La multimodalité en IA générative désigne la capacité d'un système à traiter, comprendre et/ou générer des sorties pour plusieurs types de données.

Après plusieurs mois de silence, en septembre 2023, OpenAI a annoncé l'activation de cette capacité multimodale dans ChatGPT, qui peut désormais voir, entendre et parler : de nouvelles fonctionnalités d'image et de voix ont été déployées. Une fois maîtrisées, les capacités multimodales des systèmes d'IA devraient ouvrir la voie à de nouvelles possibilités et innovations dans de nombreux secteurs.

Dans ce tutoriel, nous présenterons les fonctionnalités liées aux images et le modèle GPT-4 Vision, qui permet à ChatGPT de « voir ». Nous passerons également en revue les limites actuelles du modèle et vous proposerons des ressources pour aller plus loin.

Développer des applications d'IA

Apprenez à créer des applications d'IA à l'aide de l'API OpenAI.
Commencez À Upskiller Gratuitement

Qu'est-ce que GPT-4 Vision ?

GPT-4 Vision (GPT-4V) est un modèle multimodal qui permet à un utilisateur de téléverser une image en entrée et d'engager une conversation avec le modèle. La conversation peut comprendre des questions ou des instructions sous forme de prompt, orientant le modèle pour réaliser des tâches à partir de l'image fournie.

GPT-4V s'appuie sur les capacités existantes de GPT-4 et ajoute l'analyse visuelle aux interactions textuelles. Nous avons publié une introduction pour débutants à l'API OpenAI qui vous aidera à vous mettre à jour sur les évolutions ayant précédé la sortie de GPT-4V.

Fonctionnalités clés de GPT-4 Vision

  • Entrées visuelles : la grande nouveauté de GPT-4 Vision est sa capacité à accepter des contenus visuels (photos, captures d'écran, documents) et à exécuter une variété de tâches.
  • Détection et analyse d'objets : le modèle peut identifier des objets dans une image et fournir des informations à leur sujet.
  • Analyse de données : GPT-4 Vision sait interpréter et analyser des données présentées sous forme visuelle (graphiques, diagrammes, visualisations).
  • Déchiffrage de texte : le modèle peut lire et interpréter des notes manuscrites et du texte présent dans des images.

Maintenant que nous avons passé en revue quelques-unes des capacités de GPT-4 Vision, passons à la pratique pour mieux les appréhender.

Prise en main : démarrer avec GPT-4 Vision

Actuellement (octobre 2023), GPT-4 Vision est disponible uniquement pour les abonnés ChatGPT Plus et Enterprise. ChatGPT Plus coûte 20 $ par mois et peut être activé depuis un compte ChatGPT gratuit.

Si vous débutez totalement avec ChatGPT, voici comment accéder à GPT-4 Vision :

  • Rendez-vous sur le site OpenAI ChatGPT et créez un compte.
  • Connectez-vous et sélectionnez l'option « Upgrade to Plus ».
  • Finalisez la mise à niveau pour accéder à ChatGPT Plus (abonnement mensuel de 20 $).
  • Choisissez « GPT-4 » comme modèle dans la fenêtre de discussion, comme illustré ci-dessous.

OpenAI chat avec images

  • Cliquez sur l'icône d'image pour téléverser votre visuel, puis ajoutez un prompt indiquant à GPT-4 la tâche à réaliser.

Questionner ChatGPT à propos d'une image

Ici, GPT-4 Vision comprend correctement que des enfants jouent au cricket en se basant sur la batte tenue par l'un d'eux. En IA, cette tâche est connue sous le nom de détection d'objets : les objets identifiés sont les enfants et la batte. Consultez notre tutoriel sur la détection d'objets YOLO pour en savoir plus.

De même, vous pouvez réaliser d'autres tâches en fonction de votre cas d'usage.

Cas d'usage et exemples concrets de GPT-4 Vision

Maintenant que nous avons compris ses capacités, appliquons-les à quelques cas pratiques dans l'industrie :

1. Recherche académique

L'intégration par GPT-4 Vision d'un modèle linguistique avancé et de capacités visuelles ouvre de nouvelles possibilités dans les domaines académiques, notamment pour le déchiffrage de manuscrits historiques. Cette tâche, traditionnellement minutieuse et chronophage, est généralement réalisée par des paléographes et des historiens.

Nous fournissons d'abord une image qui semble provenir d'un ancien article de journaux :

Ancienne coupure de journal dans ChatGPT

GPT-4 Vision lit correctement le contenu de l'image et l'interprète :

Réponse de ChatGPT à l'image du journal

Le modèle a su lire, déchiffrer le contenu et en proposer une analyse, tout en indiquant de manière réaliste que certaines parties de l'image sont coupées ou illisibles.

Cependant, il est important de noter que le modèle rencontre des difficultés avec des manuscrits complexes, en particulier dans d'autres langues (nous y revenons plus loin), comme ci-dessous :

Une autre image de texte donnée à ChatGPT et sa réponse

2. Développement web

GPT-4 Vision peut écrire le code d'un site web à partir d'une image de la maquette souhaitée. Il transforme un design visuel en code source. Cette seule capacité peut réduire considérablement le temps de développement.

Demandons à GPT-4 Vision de générer le code à partir d'un croquis fait à la main pour un site de blog.

Croquis d'un design de site de blog

Une fois le code fourni, il suffit de le copier-coller pour créer les fichiers HTML et CSS comme indiqué. Voici le rendu du site :

Rendu HTML en action

La ressemblance est frappante, n'est-ce pas ? Certes, l'exemple est simple, mais vous pouvez aller plus loin et développer un site plus complexe et sur mesure en une fraction du temps grâce à GPT-4 Vision.

3. Interprétation de données

Le modèle peut analyser des visualisations de données pour interpréter les tendances sous-jacentes et fournir des enseignements clés à partir des graphiques. Pour tester cette fonctionnalité, il suffit de fournir un graphique et de demander des insights.

Graphique fourni à ChatGPT

S'il comprend bien le contexte général du graphique et la tendance linéaire, il commet des erreurs en mentionnant un début en 1950 alors que les données ne commencent qu'en 1960. Le modèle évoque aussi des facteurs comme la croissance démographique ou le développement économique : même s'ils sont plausibles, ces éléments ne peuvent pas être déduits de ce seul graphique.

On peut poser plusieurs questions de relance pour affiner la première réponse de GPT-4 Vision. D'après nos tests, une validation humaine reste indispensable, le modèle servant surtout à accélérer l'analyse.

4. Création de contenus créatifs

Avec l'essor de ChatGPT, les réseaux sociaux regorgent de techniques de prompt engineering, et beaucoup ont trouvé des façons créatives d'exploiter cette technologie générative.

Pour ce tutoriel, nous allons utiliser DALL-E 3 (disponible également dans ChatGPT Plus) avec GPT-4 Vision pour créer un post pour les réseaux sociaux.

Étape 1 : demandez à GPT-4 de créer un prompt pour générer une image. Par exemple, vous souhaitez contraster le rôle d'un data scientist en startup versus en grande entreprise.

Prompt engineering dans ChatGPT

Étape 2 : utilisez ce prompt dans DALL-E pour générer une image. Vous pouvez l'ajuster jusqu'à obtenir un résultat satisfaisant.

Image générée

Étape 3 : fournissez l'image à GPT-4 Vision et demandez-lui de rédiger le texte qui l'accompagne.

Réinjecter l'image IA dans ChatGPT

En peaufinant et en détaillant davantage le prompt, vous obtiendrez de meilleurs résultats et pourrez explorer d'autres idées de contenu créatif. Précisons qu'inonder le web ou les réseaux sociaux de contenus générés par IA n'est pas recommandé : ces contenus ont leurs limites. Privilégiez la vérification des faits et enrichissez-les de votre expérience.

Bien sûr, cette liste de cas d'usage n'est pas exhaustive : GPT-4 Vision en permet bien d'autres. Considérez-la comme une source d'inspiration et un point de départ pour explorer votre curiosité en appliquant la technologie à votre domaine.

Limites et atténuation des risques de GPT-4 Vision

Avant d'utiliser GPT-4 Vision, un dernier point essentiel : ses limites et les risques associés.

Ceci est d'autant plus important qu'OpenAI a pris quelques mois supplémentaires après le lancement de GPT-4 (mars 2023) pour le tester via des exercices internes et externes de « red teaming », afin d'identifier les faiblesses de cette technologie générative, présentées dans leur system card.

1. Précision et fiabilité

Bien que GPT-4 représente un net progrès en matière de fiabilité et de précision, ce n'est pas garanti en toutes circonstances. D'après OpenAI, sur la base de tests internes, GPT-4 Vision peut encore manquer de fiabilité et d'exactitude. L'équipe va même jusqu'à rappeler « ChatGPT peut se tromper. Vérifiez les informations importantes. » sous la barre de chat lorsque l'on saisit du texte et des images.

Il est donc primordial d'évaluer de manière critique les résultats du modèle et de rester vigilant.

2. Vie privée et biais

Selon OpenAI, à l'instar de ses prédécesseurs, GPT-4 Vision peut renforcer des biais sociaux et des visions du monde, y compris des stéréotypes nuisibles et dévalorisants à l'égard de certains groupes marginalisés. Il est donc important d'en être conscient et de prévoir des mesures pour gérer ces biais dans votre cas d'usage, sans compter sur le modèle pour les corriger.

Au-delà des biais, les données partagées avec ChatGPT peuvent servir à entraîner des modèles sauf si vous vous y opposez ; évitez donc de communiquer des informations sensibles ou confidentielles. Vous pouvez également refuser le partage des données pour l'amélioration des modèles dans « Data Controls », section « Settings & Beta ».

3. Restrictions pour les tâches à risque

GPT-4 Vision ne répond pas aux demandes visant à identifier des personnes spécifiques dans une image. Il s'agit d'un comportement de « refus » prévu par conception. Par ailleurs, OpenAI recommande d'éviter d'utiliser GPT-4 Vision pour des tâches à haut risque, notamment :

  • Compétences scientifiques : le modèle peut manquer du texte ou des caractères, ignorer des symboles mathématiques dans des contenus scientifiques, et être incapable de reconnaître correctement des positions spatiales ou des codages de couleurs.
  • Conseils médicaux : le modèle peut parfois répondre correctement à partir d'imagerie médicale, mais se tromper pour la même question dans d'autres cas. Compte tenu de ces incohérences, ses réponses ne doivent pas remplacer un avis médical professionnel.
  • Risque de désinformation : les énoncés accompagnés d'images paraissent plus crédibles (qu'ils soient vrais ou non). Le modèle peut générer des textes plausibles et ciblés à partir d'une image, ce qui accroît le risque de désinformation.
  • Contenus haineux : le modèle refuse parfois de répondre à des questions impliquant des symboles de haine ou du contenu extrémiste, mais pas systématiquement. C'est un défi persistant pour OpenAI.

En tant qu'utilisateurs, restons donc vigilants et responsables, en particulier pour les tâches à haut risque et les contextes sensibles.

Conclusion

Ce tutoriel vous a proposé une introduction complète au nouveau modèle GPT-4 Vision. Vous êtes également alerté sur ses limites et ses risques, et savez désormais dans quels contextes l'utiliser.

La manière la plus efficace de maîtriser cette technologie est de l'essayer : testez différents prompts pour évaluer ses capacités et, avec la pratique, vous serez de plus en plus à l'aise.

Bien que récent, cet outil s'appuie sur les principes des grands modèles de langage et de GPT-4. Voici quelques ressources complémentaires si vous souhaitez approfondir les concepts fondamentaux liés à GPT-4 Vision :

Obtenez une certification de haut niveau en matière d'IA

Démontrez que vous pouvez utiliser l'IA de manière efficace et responsable.

Arunn Thevapalan's photo
Author
Arunn Thevapalan
LinkedIn
Twitter

En tant que data scientist senior, je conçois, développe et déploie des solutions d'apprentissage automatique à grande échelle pour aider les entreprises à prendre de meilleures décisions basées sur les données. En tant que rédacteur spécialisé dans la science des données, je partage mes apprentissages, mes conseils de carrière et des tutoriels pratiques approfondis.

Sujets
Intelligence artificielle

Débutez votre aventure ChatGPT dès aujourd'hui !

Cours

Comprendre ChatGPT

1 h
434.6K
Apprenez à utiliser ChatGPT, à rédiger des prompts efficaces et à explorer ses principaux cas d’usage en IA.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow