Weiter zum Inhalt

Einführung in die Google Gemini API: Entdecke die Power der neuen Gemini-KI-Modelle

Lerne, wie du die Gemini-Python-API und ihre Funktionen nutzt, um kostenlos KI-gestützte Anwendungen zu bauen.
Aktualisiert 18. Sept. 2026  · 13 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Google Bard stand zuletzt stark im Wettbewerb mit ChatGPT. Mit den neuen Gemini-KI-Modellen will Google nun wieder Boden gutmachen. Um das Nutzungserlebnis zu verbessern, hat Google Bard mit Gemini-Pro-Modellen neu aufgestellt. So wird es für Nutzerinnen und Nutzer einfacher, Text und Bilder einzugeben und präzise, natürlich klingende Antworten zu erhalten.

In diesem Tutorial schauen wir uns die Google Gemini API an, mit der du fortgeschrittene KI-gestützte Anwendungen entwickeln kannst. Dank ihrer starken Fähigkeiten kombinierst du mühelos Text- und Bildeingaben, um präzise und kontextrelevante Ausgaben zu generieren. Die Gemini-Python-API vereinfacht die Integration in bestehende Projekte und ermöglicht dir, moderne KI-Funktionen nahtlos einzubauen.

Was ist Gemini AI?

Gemini AI ist ein State-of-the-Art-KI-Modell, das in Zusammenarbeit mehrerer Google-Teams wie Google Research und Google DeepMind entstanden ist. Als multimodales Modell kann Gemini AI verschiedene Datentypen verstehen und verarbeiten – darunter Text, Code, Audio, Bilder und Videos.

Der Antrieb von Google DeepMind war stets, KI zum Wohle der Allgemeinheit zu nutzen. Mit Gemini AI wurden große Fortschritte erzielt, eine neue Generation von KI-Modellen zu schaffen, die davon inspiriert sind, wie Menschen die Welt wahrnehmen und mit ihr interagieren.

Als bislang fortschrittlichstes und größtes KI-Modell von Google wurde Gemini AI besonders flexibel entwickelt, um vielfältige Informationsarten zu verarbeiten. Seine Vielseitigkeit ermöglicht einen effizienten Einsatz auf unterschiedlichen Systemen – von leistungsstarken Rechenzentrumsservern bis hin zu mobilen Geräten.

Es gibt drei Versionen der Gemini-Modelle, jeweils für spezifische Anwendungsfälle trainiert:

  1. Gemini Ultra: Die leistungsfähigste Variante für hochkomplexe Aufgaben.
  2. Gemini Pro: Die ausgewogene Wahl mit guter Performance und Skalierung.
  3. Gemini Nano: Für Mobilgeräte optimiert und maximal effizient.

Gemini Ultra vs GPT4

Bild Quelle

Unter diesen Varianten hat Gemini Ultra außergewöhnlich gut abgeschnitten und GPT-4 in mehreren Kriterien übertroffen. Es ist das erste Modell, das menschliche Expertinnen und Experten im Massive Multitask Language Understanding Benchmark übertrifft, der Weltwissen und Problemlösefähigkeiten in 57 Fachgebieten prüft. Das belegt die überlegene Verständniskompetenz und Problemlösefähigkeit von Gemini Ultra.

Wenn du neu in der Künstlichen Intelligenz bist, schau dir den Lernpfad AI Fundamentals an. Er deckt beliebte KI-Themen wie ChatGPT, große Sprachmodelle und generative KI ab.

Umgebung einrichten

Bevor wir die API nutzen, benötigen wir den API-Schlüssel von Google AI for Developers.

1. Klicke auf die Schaltfläche „Get an API key“.

image1.png

2. Erstelle anschließend ein Projekt und generiere den API-Schlüssel.

image16.png

3. Kopiere den API-Schlüssel und lege in deinem System eine Umgebungsvariable namens "Gemini_API_KEY" an. Um auf Kaggle eine sichere Umgebungsvariable zu erstellen, gehe zu „Add-ons“ und wähle „Secrets“. Klicke dann auf „Add a new secret“, gib ein Label und den entsprechenden Wert ein und speichere.

image6.png

4. Installiere das Gemini-Python-API-Paket mit pip.

%pip install google-generativeai

5. Konfiguriere die Gemini API, indem du den API-Schlüssel hinzufügst. Um auf das Secret zuzugreifen, erstellst du das Objekt UserSecretsClient und übergibst anschließend das Label.

import google.generativeai as genai
from kaggle_secrets import UserSecretsClient

user_secrets = UserSecretsClient()
gemini_key = user_secrets.get_secret("GEMINI_API_KEY")

genai.configure(api_key = gemini_key)

Antworten generieren

In diesem Abschnitt generieren wir Antworten mit dem Modell Gemini Pro. Wenn du Probleme beim Ausführen des Codes hast, kannst du das Gemini-API-Kaggle-Notebook nutzen.

Zunächst prüfen wir, auf welche Modelle die freie API Zugriff bietet. Führe dazu den folgenden Code aus. Mit der Funktion list_models werden die unterstützten Generierungsmodelle angezeigt.

for m in genai.list_models():
    if 'generateContent' in m.supported_generation_methods:
        print(m.name)

Offenbar haben wir Zugriff auf zwei Modelle: "gemini-pro" und "gemini-pro-vision".

models/gemini-pro
models/gemini-pro-vision

Lass uns das Modell "Gemini Pro" verwenden und mit einer einfachen Eingabeaufforderung eine Antwort erzeugen.

model = genai.GenerativeModel('gemini-pro')

response = model.generate_content("Please provide a list of the most influential people in the world.")

print(response.text)

Mit nur wenigen Zeilen Code konnten wir eine sehr treffsichere Antwort generieren.

image2.png

Gemini AI kann für eine Eingabe mehrere Antworten, sogenannte Kandidaten, erzeugen, aus denen du die passendste auswählst. In der kostenlosen API-Version steht allerdings nur ein Kandidat zur Verfügung.

response.candidates

image7.png

Unsere Ausgabe ist im Markdown-Format. Das bereiten wir mit dem IPython-Markdown-Tool hübsch auf. Als Nächstes lassen wir Gemini Python-Code generieren.

from IPython.display import Markdown

response = model.generate_content("Build a simple Python web application.")

Markdown(response.text)

Das Modell liefert starke Ergebnisse: eine Schritt-für-Schritt-Anleitung mit Erklärung, wie man mit Flask eine einfache Webanwendung baut und startet.

image11.png

Streaming

Streaming steigert die wahrgenommene Geschwindigkeit deiner Anwendung. Mit dem Argument „stream“ wird die Antwort erzeugt und angezeigt, sobald sie verfügbar ist. Die Ausgabe kommt in Blöcken, daher iterieren wir über die Antwort.

from IPython.display import display

model = genai.GenerativeModel("gemini-pro")
response = model.generate_content(
    "How can I make authentic Italian pasta?", stream=True
)

for chunk in response:
    display(Markdown(chunk.text))
    display(Markdown("_" * 80))

Jeder Block wird durch eine gestrichelte Linie getrennt. Wie du siehst, wird der Inhalt stückweise generiert. Das Streaming in der Gemini-API ähnelt der OpenAI- und Anthropic-API.

image5.png

Antworten feinjustieren

Wir können die generierte Antwort an unsere Anforderungen anpassen.

Im folgenden Beispiel erzeugen wir einen Kandidaten mit maximal 1000 Tokens und einer Temperatur von 0,7. Außerdem definieren wir eine Stop-Sequenz, sodass der Generierungsprozess automatisch endet, wenn das Wort "time" erscheint.

response = model.generate_content(
    'How to be productive during a burnout stage.',
    generation_config=genai.types.GenerationConfig(
        candidate_count=1,
        stop_sequences=['time'],
        max_output_tokens=1000,
        temperature=0.7)
)

Markdown(response.text)

image10.png

Gemini Pro Vision ausprobieren

In diesem Abschnitt nutzen wir Gemini Pro Vision, um die Multimodalität von Gemini AI zu demonstrieren.

Wir laden das Foto von Mayumi Maciel auf pexel.com mit dem Tool curl herunter.

!curl -o landscape.jpg "https://images.pexels.com/photos/18776367/pexels-photo-18776367/free-photo-of-colorful-houses-line-the-canal-in-burano-italy.jpeg?auto=compress&cs=tinysrgb&w=1260&h=750&dpr=2"

image3.png

Zum Laden und Anzeigen des Bildes im Kaggle-Notebook verwenden wir das Python-Paket Pillow.

import PIL.Image

img = PIL.Image.open('landscape.jpg')
display(img)

image15.jpg

Um den Bildinhalt zu verstehen, laden wir das Modell "gemini-pro-vision" und übergeben ihm ein Bildobjekt.

model = genai.GenerativeModel('gemini-pro-vision')

response = model.generate_content(img)

Markdown(response.text)

Das Modell hat den Ort im Bild korrekt erkannt und eine Beschreibung geliefert.

A beautiful day in Burano, Italy. The colorful houses and the calm water make this a perfect place to relax and enjoy the scenery.

Als Nächstes kombinieren wir Texteingabe und Bild und stellen dem Modell eine Frage zum Bild.

response = model.generate_content(
    ["Can you provide the exact location with coordinates?", img]
)

Markdown(response.text)
45.4408° N, 12.3150° E

Die Koordinaten wurden korrekt geliefert. Wir haben sie zusätzlich in Google Maps geprüft.

image13.png

Chat-Konversationen

Du kannst mit dem KI-Modell Gespräche führen, die den Kontext über die Chat-Historie hinweg behalten. So erinnert sich das Modell an den Gesprächsverlauf und liefert Antworten, die zu den vorherigen Interaktionen passen.

Dafür erstellen wir ein Chat-Objekt mit model.start_chat und geben die erste Nachricht vor.

model = genai.GenerativeModel('gemini-pro')

chat = model.start_chat(history=[])

chat.send_message("Who created the Mona Lisa?")

for message in chat.history:
    display(Markdown(f'**{message.role}**: {message.parts[0].text}'))

image8.png

Stellen wir eine weitere Frage und zeigen die Antwort wieder im Chat-Format an.

chat.send_message("What else he created?")

for message in chat.history:
    display(Markdown(f'**{message.role}**: {message.parts[0].text}'))

Das Modell hat den Kontext behalten und passend geantwortet.

image9.png

Embeddings

Die API bietet Zugriff auf Embedding-Modelle – ein beliebtes Werkzeug für kontextbewusste Anwendungen. Mit einer einfachen Python-Funktion wandelst du Eingaben in Embeddings um und kannst Wörter, Sätze oder ganze Dokumente als dichte Vektoren mit semantischer Bedeutung repräsentieren.

Wir übergeben der Funktion embed_content den Modellnamen, den Inhalt, den Aufgabentyp und den Titel.

result = genai.embed_content(
    model="models/embedding-001",
    content="Who created the Mona Lisa?",
    task_type="retrieval_document",
    title="Mona Lisa Research")

print(result['embedding'][:10])
[0.086675204, -0.027617611, -0.015689207, -0.00445945, 0.07286186, 0.00017529335, 0.07243656, -0.018299067, 0.018799499, 0.028495966]

Um mehrere Inhalte in Embeddings zu konvertieren, übergibst du eine Liste von Strings an das Argument „content“.

result = genai.embed_content(
    model="models/embedding-001",
    content=[
        "Who created the Mona Lisa?",
        "What else he created?",
        "When did he died?"
    ],
    task_type="retrieval_document",
    title="Mona Lisa Research 2")

for emb in result['embedding']:
    print(emb[:10],"\n")
[0.07942627, -0.032543894, -0.010346633, -0.0039942865, 0.071596086, -0.0016670177, 0.07821064, -0.011955016, 0.019478166, 0.03784406] 

[0.027897138, -0.030693276, -0.0012639443, 0.0018902065, 0.07171923, -0.011544562, 0.04235154, -0.024570161, 0.013215181, 0.03026724] 

[0.04341321, 0.013262799, -0.0152797215, -0.009688456, 0.07342798, 0.0033503908, 0.05274988, -0.010907041, 0.05933596, 0.019402765]

Melde dich für den Kurs Introduction to Embeddings with the OpenAI API an und lerne, wie du Embedding-Modelle für fortgeschrittene KI-Anwendungen wie semantische Suche und Empfehlungs-Systeme nutzt.

Erweiterte Anwendungsfälle

Um das volle Potenzial der Gemini API auszuschöpfen, lohnt sich ein Blick auf erweiterte Funktionen wie Safety-Einstellungen und die Low-Level-API.

  • Safety-Einstellungen erlauben das Konfigurieren von Inhaltsblockierung und -zulassung in Prompts und Antworten, um Community-Richtlinien einzuhalten.
  • Low-Level-API bietet zusätzliche Flexibilität für individuelle Anpassungen.
  • Mehrstufige Konversationen lassen sich mit der Klasse GenaiChatSession erweitern und so die Gesprächserfahrung verbessern.

Mit diesen erweiterten Features entwickeln Entwicklerinnen und Entwickler effizientere Anwendungen und erschließen neue Möglichkeiten für Interaktionen.

Fazit

Die Gemini API eröffnet spannende Möglichkeiten, fortgeschrittene KI-Anwendungen mit Text- und Bildeingaben zu entwickeln. Ihre modernen Modelle wie Gemini Ultra verschieben die Grenzen dessen, was KI-Systeme verstehen und generieren können.

Dank der praktischen Python-API wird die Integration von KI in Anwendungen deutlich einfacher. Die Gemini API bietet Funktionen wie Content-Generierung, Embeddings und mehrstufige Konversationen und macht KI so noch zugänglicher. Gemini AI ist ein großer Schritt nach vorn beim multimodalen Verständnis.

Wenn du mehr lernen willst, starte deine Reise zu KI-gestützten Anwendungen mit der OpenAI API und melde dich für den kurzen Kurs Working with the OpenAI API an. Entdecke die Funktionen hinter beliebten KI-Anwendungen wie ChatGPT und DataLab, dem KI-fähigen Datennotizbuch von DataCamp.

Wenn du bereits Profi bist und keinen Praxiskurs brauchst, wirf einen Blick auf unser Cheat Sheet OpenAI API in Python.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.

Themen
Künstliche Intelligenz

Starte heute deine KI-Reise!

Kurs

Konzeptuelle Einführung in generative KI

2 Std.
117.2K
Erfahren Sie, wie Sie generative KI verantwortungsvoll nutzen. Lernen Sie ihre Entwicklung und Auswirkungen kennen.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow