Accéder au contenu principal

Guide du débutant sur l’API Vision de Google en Python

Découvrez ce qu’est l’API Vision et tout ce qu’elle propose. À la fin de ce tutoriel, vous saurez aussi comment appeler l’API Vision depuis votre code Python.
Actualisé 19 sept. 2026  · 10 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Il y a déjà quelque temps, Google a publié une API dédiée appelée Vision API pour réaliser des tâches liées à la vision par ordinateur. La vision par ordinateur étudie la façon dont un ordinateur traite une image. Pour nous, humains, il est assez simple de tirer des informations utiles d’une image donnée, mais comment un ordinateur s’y prend-il ?

Supposons, par exemple, que vous fournissiez une image de chien à votre ordinateur et qu’à l’aide d’un logiciel, l’ordinateur vous indique que l’image fournie représente un chien. C’est précisément là qu’intervient la vision par ordinateur. C’est un domaine d’étude à part entière, et l’API Vision propose un ensemble d’outils pour réaliser des tâches de vision par ordinateur avec une grande simplicité. Le plus intéressant, c’est que des développeurs n’ayant aucune expérience préalable en vision par ordinateur peuvent utiliser l’API Vision simplement en consultant sa documentation.

Ce tutoriel vise à vous présenter l’API Vision et la manière de l’appeler depuis du code Python.

Remarque : si vous souhaitez d’abord approfondir la notion d’API en général (sous l’angle Python et Machine Learning) avant de commencer ce tutoriel, voici quelques excellentes ressources :

Qu’est-ce que l’API Vision de Google ? Une introduction plus détaillée

Google a encapsulé ses modèles de Machine Learning dans une API afin de permettre aux développeurs d’exploiter sa technologie Vision. L’API Vision peut classer rapidement des images en milliers de catégories et leur attribuer des libellés pertinents. Elle peut même détecter des objets, des visages et du texte au sein d’une image.

À un niveau élevé, l’API Vision de Google vous permet de faire deux choses :

  • Utiliser directement l’API depuis votre code pour réaliser des analyses d’images puissantes et à grande échelle.
  • Construire des modèles personnalisés à l’aide de l’API pour apporter davantage de flexibilité à votre cas d’usage.

Cette API est particulièrement utile, car la demande pour des profils « full-stack » augmente très rapidement. Imaginez qu’un développeur web full-stack (c’est‑à‑dire maîtrisant à la fois le front-end et le back-end) doive créer un site qui reçoit des images et en détecte la nature. Sans connaissances en vision par ordinateur, il faudrait concevoir un back-end capable d’identifier correctement une image, le tout avec une échéance courte.

Dans une telle situation, s’il commence par apprendre la vision par ordinateur depuis zéro avant d’implémenter les fonctionnalités requises, il risque fort de rater la deadline. À l’inverse, s’il ou elle s’appuie sur des modèles de vision pré‑entraînés tout en apprenant les concepts au fil du développement, l’approche sera bien plus pragmatique. C’est exactement le type de scénario où l’API Vision fait gagner un temps précieux. L’API fournit de nombreux modèles de pointe pré‑entraînés pour répondre à des cas d’usage concrets.

Le terme « full‑stack » s’applique aussi désormais à des rôles comme Machine Learning Engineer ou Data Scientist. Un praticien full‑stack en machine learning/data science doit concevoir et comprendre les processus métier de bout en bout. Cela inclut la « mise en production des modèles » comme étape clé : l’équipe emballe le modèle dans une API ou un ensemble d’API et le déploie en production. La notion de production varie selon les cas, mais le cadre général reste le même. L’API Vision vous permet d’entraîner efficacement des modèles de vision personnalisés avec AutoML Vision BETA.

Parfait ! À présent, vous devriez avoir une bonne vue d’ensemble de l’API Vision. Une petite expérimentation à faire sur la page d’accueil de Vision consiste à analyser vos images préférées et à en tirer des informations utiles grâce à Vision. Voici les étapes :

  • Rendez-vous sur la page d’accueil de Vision.
  • Vous y trouverez une section « Try the API ». Elle vous permet de glisser‑déposer/téléverser une image dans l’interface. try the api
  • Une fois l’image fournie, l’outil renvoie un ensemble d’informations sur celle‑ci : vision detected facts Comme vous le voyez, Vision détecte en un rien de temps de nombreux éléments à propos de l’image. N’hésitez pas à explorer les autres onglets pour en apprendre davantage.

Imaginez réaliser la même tâche sur un milliard d’images. Utiliser une API de ce type serait évidemment très avantageux. Passons maintenant aux fonctionnalités de l’API Vision et à des exemples de cas d’usage réels qu’elle couvre.

Quelles sont les fonctionnalités de l’API Vision — quelques cas d’usage

L’API Vision est reconnue pour la précision de ses résultats. Sa documentation propose une excellente collection de tutoriels offrant une vue très détaillée de l’API. À première vue, cela peut paraître dense. Pour simplifier, voici quelques cas d’usage déjà couverts par l’API Vision :

  • Reconnaissance optique de caractères (OCR) : un grand classique de la vision par ordinateur, qui consiste à extraire du texte d’une image. L’API Vision intègre des approches de pointe pour cette tâche.
  • Détection des propriétés d’image : c’est la tâche réalisée plus haut. Avec l’API Vision, vous pouvez récupérer des attributs généraux d’une image, comme la couleur dominante.
  • Détection de libellés : cette fonctionnalité annote une image par un libellé (ou « tag ») en fonction de son contenu. Par exemple, une photo de chien peut produire les libellés « dog », « animal » ou d’autres annotations similaires. C’est une étape essentielle en recherche d’information basée sur le contenu.
  • Détection de visages : à partir d’une image ou d’un lot d’images, il s’agit de détecter les visages présents. Les applications sont nombreuses, notamment pour les systèmes de surveillance.

Ce ne sont là que quelques excellents cas d’usage où l’API Vision fonctionne de manière fluide, et vous pouvez intégrer n’importe lequel d’entre eux dans vos applications en très peu de temps. Pour en découvrir d’autres, consultez ces tutoriels.

L’API Vision prend en charge de nombreux langages : Go, C#, Java, PHP, Node.js, Python, Ruby. Dans les sections suivantes, vous verrez comment utiliser l’API Vision en Python.

Bibliothèque cliente Vision API pour Python

Première étape pour utiliser la variante Python de l’API Vision : l’installer. Le plus simple est de passer par pip.

!pip install google-cloud-vision

Une fois l’installation effectuée, vérifiez qu’elle a bien réussi.

from google.cloud import vision

Si la ligne ci‑dessus s’exécute sans erreur, vous pouvez poursuivre. Google propose une série de très bons tutoriels sur l’utilisation de l’API Vision en Python.

Nous allons maintenant créer une petite application Python capable de détecter des attributs généraux d’une image, comme la couleur dominante.

Étude de cas avec l’API Vision en Python

Votre application prendra en entrée le chemin d’une image et affichera les attributs généraux de l’image correspondante. C’est utile lorsque les images sont stockées sur la machine où l’application s’exécute. Mais si vous devez lire une image depuis Internet ? L’API Vision sait aussi lire des images en ligne.

Dans cette étude de cas, vous apprendrez à traiter le premier scénario. Pour la variante en ligne, il ne s’agit que d’une ligne de code supplémentaire.

Comme toujours, commencez par importer vision depuis le module google.cloud.

from google.cloud import vision

Étape suivante : appeler ImageAnnotatorClient(), qui contient les utilitaires d’extraction des propriétés d’image.

client = vision.ImageAnnotatorClient()

Vous risquez de rencontrer une erreur si la variable d’environnement GOOGLE_APPLICATION_CREDENTIALS n’est pas définie. Ces bibliothèques utilisent en effet les Identifiants par défaut de l’application (ADC) pour localiser les identifiants de votre application. Lorsque votre code utilise de telles bibliothèques, la stratégie recherche vos identifiants.

Suivez ce lien pour apprendre à générer GOOGLE_APPLICATION_CREDENTIALS. L’objectif est d’obtenir un fichier client_secrets.json que vous utiliserez pour l’authentification.

Une fois client_secrets.json obtenu, exécutez le code suivant pour définir la variable d’environnement GOOGLE_APPLICATION_CREDENTIALS.

import os
os.environ["GOOGLE_APPLICATION_CREDENTIALS"]="client_secrets.json"

À présent, l’exécution du code ci‑dessous ne devrait plus provoquer d’erreur.

client = vision.ImageAnnotatorClient()

Vous allez maintenant écrire le code pour lire une image via un chemin donné.

dog

Crédit image

import io

path = 'Image.jpeg'
with io.open(path, 'rb') as image_file:
        content = image_file.read()

Vous avez chargé une image dans votre espace de travail. Créez maintenant un objet de type vision.types.Image et passez content=content en argument.

image = vision.types.Image(content=content)

Il ne vous reste plus que les dernières étapes de votre application de détection des propriétés d’image. Vous allez :

  • Appeler client.image_properties avec l’argument (image=image).
  • Stocker la réponse d’image_properties() dans une variable response et extraire les propriétés via l’attribut image_properties_annotation de response.
  • Afficher plusieurs propriétés de l’image de manière formatée.
 response = client.image_properties(image=image)
props = response.image_properties_annotation
print('Properties of the image:')

for color in props.dominant_colors.colors:
    print('Fraction: {}'.format(color.pixel_fraction))
    print('\tr: {}'.format(color.color.red))
    print('\tg: {}'.format(color.color.green))
    print('\tb: {}'.format(color.color.blue))

Vous pourriez de nouveau rencontrer des erreurs si vous n’avez pas activé l’API Vision pour votre application. L’activation est très simple, et la trace d’erreur fournit les instructions nécessaires pour le faire rapidement.

Après avoir activé l’API, vous devrez également activer la Billing pour utiliser l’API Vision. Les utilitaires de détection des propriétés d’image coûtent seulement 0,60 $. Une fois cela fait, le code s’exécute correctement et produit un résultat.

utilities for Image Properties detection

Félicitations !

Vous avez vu à quel point il est facile d’utiliser l’API Vision, et l’étendue des fonctionnalités proposées, pour un coût remarquablement faible. Aujourd’hui, de nombreuses entreprises et organisations en tirent parti, que ce soit pour des besoins métiers ou de recherche. Dans ce tutoriel, nous n’avons fait qu’effleurer la surface de l’API Vision, mais cela constitue un excellent point de départ pour intégrer des APIs de Machine Learning dans vos applications.

Prenez le temps d’explorer toute la suite d’APIs de Machine Learning proposée par Google, appelée CloudML.

Vous pouvez créer de nombreuses applications puissantes grâce à ces APIs faciles à appeler. Les liens vers l’API Vision et CloudML rassemblent une compilation de tutoriels pour expérimenter rapidement. Bonne continuation !

Si vous souhaitez en savoir plus sur le traitement d’images, suivez le cours de DataCamp Convolutional Neural Networks for Image Processing.

Sujets
Python
Intelligence artificielle

En savoir plus sur Python

Cours

Modélisation d'images avec Keras

4 h
40K
Analyse d’images avec Keras : construisez, entraînez et évaluez des réseaux convolutifs (CNN) en Python.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow