Weiter zum Inhalt

Einstieg: Googles Vision API mit Python

Erfahre, was die Vision API ist und welche Möglichkeiten sie bietet. Am Ende dieses Tutorials weißt du auch, wie du die Vision API aus deinem Python-Code aufrufst.
Aktualisiert 18. Sept. 2026  · 10 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Es ist schon eine Weile her, dass Google eine eigene API namens Vision API für Aufgaben der Computer Vision veröffentlicht hat. Computer Vision befasst sich damit, wie ein Computer ein Bild verarbeitet. Für uns Menschen ist es leicht, aus einem Bild nützliche Informationen abzuleiten – aber wie macht das ein Computer?

Stell dir vor, du gibst deinem Computer ein Hundefoto und eine Software meldet dir, dass es sich um einen Hund handelt. Genau hier setzt Computer Vision an. Computer Vision ist ein riesiges Forschungsfeld, und die Vision API liefert eine Reihe von Funktionen, mit denen sich solche Aufgaben extrem einfach umsetzen lassen. Das Beste daran: Auch Entwicklerinnen und Entwickler ohne Vorerfahrung in Computer Vision können die Vision API nutzen, wenn sie die Dokumentation durchgehen.

Dieses Tutorial führt dich in die Vision API ein und zeigt, wie du sie aus Python aufrufst.

Hinweis: Wenn du vorab generell mehr über APIs wissen willst (aus Python- und Machine-Learning-Perspektive), sind diese Ressourcen ein guter Startpunkt:

Was ist Googles Vision API? Eine ausführlichere Einführung

Google hat seine Machine-Learning-Modelle in eine API gekapselt, damit Entwicklerinnen und Entwickler die Vision-Technologie nutzen können. Die Vision API klassifiziert Bilder rasch in Tausende Kategorien und versieht sie mit sinnvollen Labels. Sie erkennt sogar Objekte, Gesichter und Text in Bildern.

Auf hoher Ebene ermöglicht dir Googles Vision API zwei Dinge:

  • Die API direkt aus deinem Code heraus für leistungsstarke Bildanalysen in großem Maßstab nutzen.
  • Eigene Modelle mit der API erstellen, um sie flexibel auf deinen Anwendungsfall zuzuschneiden.

Diese API ist besonders praktisch, weil der Bedarf an „Full-Stack“-Profilen stark wächst. Stell dir vor, eine Full-Stack-Webentwicklerin (beherrscht also Frontend und Backend) soll eine Website bauen, die Bilder entgegennimmt und ihren Typ erkennt. Ohne Vorkenntnisse in Computer Vision müsste sie dem Backend beibringen, Bilder korrekt zu erkennen – und die Deadline ist knapp.

In so einer Situation ist es unrealistisch, Computer Vision komplett von Grund auf zu lernen und dann alles selbst zu implementieren. Sinnvoller ist es, vortrainierte Modelle zu nutzen und die Konzepte entlang des Projekts zu vertiefen. Genau hier spielt die Vision API ihre Stärken aus. Sie bietet erstklassige, vortrainierte Modelle für zahlreiche reale Business-Use-Cases.

Der Begriff „Full-Stack“ taucht inzwischen auch bei Rollen wie Machine Learning Engineer oder Data Scientist auf. Full-Stack-ML-Praktikerinnen und -Praktiker sollen End-to-End-Prozesse verstehen und umsetzen – inklusive „Produktionsreifer Modelle“. Dabei wird das Modell in eine API (oder mehrere) verpackt und in der Produktion bereitgestellt. Was „Produktion“ konkret bedeutet, hängt vom Use-Case ab, die Grundidee bleibt jedoch gleich. Mit AutoML Vision BETA kannst du mit der Vision API eigene Vision-Modelle effizient trainieren.

Super! Jetzt hast du einen soliden Überblick über die Vision API. Ein kleines Experiment auf der Vision-Startseite: Lade ein Lieblingsbild hoch und sieh dir an, welche Insights Vision liefert. So geht’s:

  • Öffne die Vision-Startseite.
  • Dort gibt es den Bereich „Try the API“. Zieh ein Bild per Drag-and-drop hinein oder lade es hoch. try the api
  • Nach dem Upload bekommst du zahlreiche Infos zum Bild: vision detected facts Wie du siehst, erkennt Vision in kürzester Zeit viele Aspekte des Bildes. Schau dir auch die anderen Tabs an, um mehr zu erfahren.

Stell dir vor, diese Aufgabe müsste für eine Milliarde Bilder erledigt werden. Eine API wie diese ist dafür ideal. Schauen wir uns nun an, was die Vision API bietet und welche realen Use-Cases sie bereits bedient.

Was bietet die Vision API? Ausgewählte Use-Cases

Die Vision API ist für präzise Ergebnisse bekannt. In der Dokumentation findest du eine hervorragende Sammlung an Tutorials, die sehr tief ins Detail gehen. Für den ersten Überblick kann das jedoch viel sein. Deshalb schauen wir uns ein paar bereits bewährte Anwendungsfälle an.

  • Optical Character Recognition (OCR): Ein Klassiker der Computer Vision. Dabei wird Text aus Bildern extrahiert. Die Vision API nutzt dafür moderne, leistungsfähige Verfahren.
  • Erkennung von Bildeigenschaften: Das hast du oben bereits ausprobiert. Mit der Vision API kannst du allgemeine Attribute eines Bildes abrufen, etwa dominante Farben.
  • Label-Erkennung: Hier wird ein Bild anhand seines Inhalts mit Labels (oder „Tags“) versehen. Ein Hundefoto kann z. B. „dog“, „animal“ oder ähnliche Labels erhalten. Das ist ein wichtiger Schritt für inhaltsbasierte Informationssuche.
  • Gesichtserkennung: Aus einem Bild oder einer Bildmenge werden Gesichter erkannt. Großes Einsatzfeld: Überwachungssysteme und Sicherheit.

Das sind nur einige Beispiele, bei denen die Vision API nahtlos funktioniert – und du kannst sie in kürzester Zeit in deine Anwendungen integrieren. Für weitere Use-Cases wirf einen Blick in diese Tutorials.

Die Vision API unterstützt viele Sprachen wie Go, C#, Java, PHP, Node.js, Python, Ruby. In den nächsten Abschnitten siehst du, wie du die Vision API mit Python nutzt.

Vision API Clientbibliothek für Python

Im ersten Schritt installierst du die Python-Variante der Vision API. Am einfachsten geht das mit pip.

!pip install google-cloud-vision

Wenn die Installation abgeschlossen ist, prüfst du als Nächstes, ob alles funktioniert.

from google.cloud import vision

Wenn diese Zeile ohne Fehler läuft, kannst du weitermachen. Google stellt eine Reihe hervorragender Tutorials zur Nutzung der Vision API in Python bereit.

Jetzt baust du eine kleine Python-App, die allgemeine Bildeigenschaften erkennt, etwa die dominante Farbe.

Eine Fallstudie mit der Vision API in Python

Deine Anwendung erhält einen Bildpfad als Eingabe und gibt die allgemeinen Eigenschaften des entsprechenden Bildes aus. Das ist praktisch, wenn die Bilder lokal auf dem Rechner liegen, auf dem die App läuft. Du kannst Bilder aber auch direkt aus dem Internet laden – die Vision API unterstützt das ebenfalls.

In dieser Fallstudie decken wir das erste Szenario ab. Die Variante mit Internet-URLs ist mit einer weiteren Codezeile erledigt.

Wie immer startest du mit dem Import von vision aus dem Modul google.cloud.

from google.cloud import vision

Als Nächstes rufst du ImageAnnotatorClient() auf. Darin stecken die Funktionen für das Auslesen von Bildeigenschaften.

client = vision.ImageAnnotatorClient()

Wahrscheinlich bekommst du eine Fehlermeldung, wenn die Umgebungsvariable GOOGLE_APPLICATION_CREDENTIALS nicht gesetzt ist. Diese Bibliotheken verwenden Application Default Credentials (ADC), um die Zugangsdaten deiner Anwendung zu finden. Wenn dein Code solche Bibliotheken nutzt, prüft die Strategie, ob Anmeldedaten vorhanden sind.

Folge diesem Link, um GOOGLE_APPLICATION_CREDENTIALS zu generieren. Ziel ist eine Datei client_secrets.json, die du zur Authentifizierung verwendest.

Sobald client_secrets.json vorliegt, setzt du die Umgebungsvariable GOOGLE_APPLICATION_CREDENTIALS so:

import os
os.environ["GOOGLE_APPLICATION_CREDENTIALS"]="client_secrets.json"

Jetzt sollte der folgende Code ohne Fehler laufen.

client = vision.ImageAnnotatorClient()

Als Nächstes liest du ein Bild von einem angegebenen Pfad ein.

dog

Bildnachweis

import io

path = 'Image.jpeg'
with io.open(path, 'rb') as image_file:
        content = image_file.read()

Das Bild ist nun erfolgreich in deinem Workspace geladen. Jetzt erzeugst du ein Objekt vom Typ vision.types.Image und übergibst content=content als Argument.

image = vision.types.Image(content=content)

Es fehlen nur noch die letzten Schritte für deine Anwendung zur Erkennung von Bildeigenschaften. Du wirst:

  • client.image_properties mit dem Argument (image=image) aufrufen.
  • Die Antwort von image_properties() in der Variablen response speichern und die Bildeigenschaften über das Attribut image_properties_annotation von response auslesen.
  • Mehrere Eigenschaften des Bildes formatiert ausgeben.
 response = client.image_properties(image=image)
props = response.image_properties_annotation
print('Properties of the image:')

for color in props.dominant_colors.colors:
    print('Fraction: {}'.format(color.pixel_fraction))
    print('\tr: {}'.format(color.color.red))
    print('\tg: {}'.format(color.color.green))
    print('\tb: {}'.format(color.color.blue))

Es kann erneut zu Fehlern kommen, wenn die Vision API für dein Projekt nicht aktiviert ist. Das Aktivieren ist sehr einfach, und der Fehler-Trace enthält die nötigen Schritte.

Nach dem Aktivieren musst du auch das Billing freischalten, um die Vision API zu nutzen. Die Funktionen zur Erkennung von Bildeigenschaften kosten nur 0,60 $. Danach läuft der Code durch und gibt das Ergebnis aus.

utilities for Image Properties detection

Glückwunsch!

Du hast gesehen, wie einfach sich die Vision API nutzen lässt und welche Funktionen sie zu einem sehr geringen Preis bietet. Viele Unternehmen und Organisationen profitieren bereits davon – ob für geschäftliche Zwecke oder in der Forschung. In diesem Tutorial hast du nur an der Oberfläche gekratzt, aber es ist ein guter Ausgangspunkt, um Machine-Learning-APIs in deinen Anwendungen einzusetzen.

Sieh dir unbedingt das gesamte Portfolio an ML-APIs von Google an: CloudML.

Mit diesen leicht aufrufbaren APIs kannst du zahlreiche spannende Anwendungen bauen. Die Links zur Vision API und zu CloudML enthalten eine hervorragende Sammlung an Tutorials, mit denen du direkt loslegen kannst. Viel Erfolg!

Wenn du tiefer in die Bildverarbeitung einsteigen willst, schau dir den DataCamp-Kurs Convolutional Neural Networks for Image Processing an.

Themen
Python
Künstliche Intelligenz

Mehr über Python lernen

Kurs

Bildmodellierung mit Keras

4 Std.
40K
Lerne, wie du mit Keras und Python Bilder analysierst, indem du Faltungsneuronale Netze aufbaust, trainierst und bewertest.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Tutorial

Python-Lambda-Funktionen: Ein Leitfaden für Anfänger

Lerne mehr über Python-Lambda-Funktionen, wozu sie gut sind und wann man sie benutzt. Enthält praktische Beispiele und bewährte Methoden für eine effektive Umsetzung.
Mark Pedigo's photo

Mark Pedigo

10 Min.

Tutorial

Python-Anweisungen IF, ELIF und ELSE

In diesem Tutorial lernst du ausschließlich Python if else-Anweisungen kennen.
Sejal Jaiswal's photo

Sejal Jaiswal

9 Min.

Tutorial

Python-Arrays

Python-Arrays mit Code-Beispielen. Lerne noch heute, wie du mit Python NumPy Arrays erstellen und ausdrucken kannst!
DataCamp Team's photo

DataCamp Team

3 Min.

Tutorial

Python-Listenfunktionen und -Methoden – Tutorial und Beispiele

Lerne die Funktionen und Methoden von Python-Listen kennen. Schau dir jetzt die Code-Beispiele für list() und andere Python-Funktionen und -Methoden an!
Abid Ali Awan's photo

Abid Ali Awan

7 Min.

Tutorial

Python-Tutorial zum Verknüpfen von Zeichenfolgen

Lerne verschiedene Methoden zum Verknüpfen von Zeichenfolgen in Python kennen, mit Beispielen, die jede Technik zeigen.
DataCamp Team's photo

DataCamp Team

5 Min.

Tutorial

Wie man Listen in Python aufteilt: Einfache Beispiele und fortgeschrittene Methoden

Lerne, wie du Python-Listen mit Techniken wie Slicing, List Comprehensions und itertools aufteilen kannst. Finde heraus, wann du welche Methode für die beste Datenverarbeitung nutzen solltest.
Allan Ouko's photo

Allan Ouko

11 Min.

Mehr AnzeigenMehr Anzeigen