Weiter zum Inhalt

Gemini 3.7 Flash: Funktionen, Benchmarks und Preise

Googles Gemini 3.7 Flash zielt auf Coding- und agentische Workflows – zum halben Startpreis von 3.6 Flash. Hier sind die Neuerungen, Benchmarks und Einsatzfelder.
Aktualisiert 23. Sept. 2026  · 10 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Hinweis: Nur wenige Wochen nach dem Start von Gemini 3.7 Flash hat Google Gemini 3.8 Flash veröffentlicht. Sieh dir das Modell in Aktion in unserem Gemini 3.8 Flash API-Tutorial an.

Google hat Gemini 3.7 Flash veröffentlicht – das bislang stärkste Modell der Flash-Klasse, klar ausgerichtet auf Coding und agentische Workflows. Der Launch erfolgt, während Googles Flaggschiff Gemini 3.5 Pro weiter auf sich warten lässt – laut Reuters ein Test, ob DeepMind mit Anthropic und OpenAI Schritt halten kann.

Die Schlagzeilen-Zahlen sind offensiv: Gemini 3.7 Flash erreicht 43,6% auf FrontierCode 1.1 Main (zuvor 34,4% für 3.6 Flash), erzielt 1588 Elo auf Code Arena für Webentwicklung und startet mit einem Einführungspreis von 0,75 $ pro 1 Mio. Eingabetokens und 3,75 $ pro 1 Mio. Ausgabetokens – die Hälfte der ursprünglichen 3.6-Flash-Kosten.

In diesem Artikel zeige ich, was bei Gemini 3.7 Flash neu ist: Funktionen, Benchmarks und Praxis-Setups, die du selbst testen kannst. Für einen tieferen Blick auf konkurrierende Modelle sieh dir unsere Guides zu GPT-5.6 Terra vs Claude Sonnet 5 und How to learn Claude an. 

Auf einen Blick

  • Gemini 3.7 Flash ist Googles leistungsfähigstes Flash-Modell für Coding und agentische Workflows – mit einem Kontextfenster von 1 Mio. Tokens.
  • Einführungspreise: 0,75 $/1 Mio. Eingabe- und 3,75 $/1 Mio. Ausgabetokens bis zum 31. Dezember 2026, danach 1,50 $/7,50 $ regulär.
  • Spitze bei FrontierCode 1.1 (43,6%), GDP.pdf (34,0%), Harvey LAB-AA (90,7%) und GDM-MRCR Long Context (97,0%) – im Vergleich zu Claude Sonnet 5 und GPT-5.6 Terra.
  • GPT-5.6 Terra führt weiterhin bei DeepSWE, Terminal-bench und OSWorld-Agenten-Evals.
  • Verfügbar über die Gemini API, Google Antigravity, Gemini Enterprise und Gemini Spark.

Was ist Gemini 3.7 Flash?

Gemini 3.7 Flash ist Googles leistungsstarkes Mid-Tier-Modell – positioniert als das fähigste Flash-Modell für komplexes Coding, agentische Workflows und verlässliche mehrstufige Ausführung. Es folgt auf Gemini 3.6 Flash, das drei Wochen zuvor erschien. Google nennt Entwicklerfeedback und algorithmische Änderungen als Treiber für den Qualitätssprung.

Das Modell ist allgemein über die Gemini API verfügbar und bietet ein Kontextfenster von 1 Mio. Tokens (1.048.576 Eingabetokens) sowie ein Limit von 65.536 Ausgabetokens. Es akzeptiert Text-, Bild-, Video-, Audio- und PDF-Eingaben und liefert ausschließlich Text-Ausgaben. Google bietet einstellbare Denkstufen in niedrig, mittel und hoch; die API gibt jedoch einen Fehler zurück, wenn du die nicht unterstützte Einstellung minimal anfragst.

Der aussagekräftigste Benchmark ist DeepSWE v1.1, eine Langzeit-Evaluation für Software Engineering: 3.7 Flash erreicht 65,3% gegenüber 34,4% seines Vorgängers auf FrontierCode und nur 48,6% für 3.6 Flash auf DeepSWE selbst. Das ist ein ungewöhnlich großer Generationssprung bei gleichzeitig gesenktem Preis.

Was ist neu bei Gemini 3.7 Flash?

Die Story: ein fähigeres Flash-Modell zum niedrigeren Preis, mit besserem Befolgen von Anweisungen und weniger Mikromanagement in Agent-Loops. Das sind die wichtigsten Änderungen für Praktiker.

Stärker beim Coding und bei der Fehlerbehebung

Du kannst Gemini 3.7 Flash anspruchsvollere Debugging- und Refactoring-Aufgaben anvertrauen und mit höherer Ersttrefferquote rechnen. Google meldet 43,6% auf FrontierCode 1.1 Main für produktionsreife Codequalität (vorher 34,4% bei 3.6 Flash) und 65,3% auf DeepSWE v1.1 für langfristige Softwareentwicklung.

Für praktizierende Engineers bedeutet das: weniger Wiederholungen. Laut Google meistert das Modell Blockaden besser und folgt Anweisungen genauer – dadurch sinkt die manuelle Aufsicht, die günstige Modelle in der Nettozeit oft teuer macht.

Schnellere Web-App- und UI-Generierung

Gemini 3.7 Flash erzeugt funktionale Layouts und funktionsfertige Web-Apps mit weniger Prompts als 3.6 Flash. Auf der Webentwicklungs-Bestenliste von Code Arena erreicht es 1588 Elo – gegenüber 1538 für 3.6 Flash und 1541 für Claude Sonnet 5.

Bei der UI-Generierung kann das Modell Referenzen nachbilden – ob Screenshot, Bild oder vollständiges Designsystem. Fütterst du es mit einem Mockup einer Preisseite, zielt es auf die Einhaltung des Designs statt auf ein generisches Layout.

Verbesserte mehrstufige Agentenausführung

Das Modell investiert mehr in Planung und Tool-Aufrufe – genau dort, wo günstige Modelle oft scheitern. Auf AutomationBench, einer privaten Evaluation realer Geschäfts-Workflows, erzielt 3.7 Flash 30,4% gegenüber 17,0% bei 3.6 Flash und 10,7% bei Claude Sonnet 5.

Über die API verfügbare integrierte Tools umfassen Caching, Codeausführung, Dateisuche, Funktionsaufrufe, Search Grounding, Grounding mit Google Maps, strukturierte Ausgaben und URL-Kontext. Computer Use ist vorhanden, aber als Vorschau gekennzeichnet – für die Produktion würde ich darauf noch nicht setzen.

Verbesserte Dokument- und Wissensarbeit

Gemini 3.7 Flash bewältigt wissensintensive Bereiche wie Finanzen, Recht und Biowissenschaften mit besserem Reasoning und höherem Textverständnis. Beim GDP.pdf-Benchmark für Experten-PDF-Verständnis erreicht es 34,0% (vs. 22,0% bei 3.6 Flash) und bei Harvey LAB-AA für komplexe juristische Workflows 90,7%.

Wenn du strukturierte Antworten aus dichten Geschäftsberichten oder Verträgen ziehen musst, ist diese Version einen Test wert. Das Modell liefert weiterhin nur Text aus, d. h. es erzeugt keine Diagramme, die es liest, sondern beschreibt oder fasst sie zusammen.

Niedrigerer Preis für skalierende Agenten

Die Einführungspreise halbieren die Kosten für Flash-basierte Agenten gegenüber den Startkonditionen von 3.6 Flash. Bis zum 31. Dezember 2026 zahlst du 0,75 $ pro 1 Mio. Eingabetokens und 3,75 $ pro 1 Mio. Ausgabetokens.

  • Eingabe: 0,75 $ pro 1 Mio. Tokens (Einführung), ab 1. Januar 2027 1,50 $ pro 1 Mio.
  • Ausgabe: 3,75 $ pro 1 Mio. Tokens (Einführung), ab 1. Januar 2027 7,50 $ pro 1 Mio.

Zum Vergleich: Claude Sonnet 5 liegt laut Googles eigener Benchmark-Tabelle bei 2,00 $ für Eingabe und 10,00 $ für Ausgabe, GPT-5.6 Terra bei 2,00 $ und 12,00 $. Beim reinen Tokenpreis unterbietet 3.7 Flash beide deutlich.

Gemini 3.7 Flash Benchmarks

Googles Benchmark-Tabelle stellt Gemini 3.7 Flash 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra und Muse Spark 1.2 gegenüber. Das Muster ist klar: 3.7 Flash schlägt seinen Vorgänger fast durchweg und liefert sich enge Duelle mit teureren Rivalen – wobei GPT-5.6 Terra bei einigen agentischen Coding-Evals knapp vorn liegt.

Gemini 3.7 Flash im Schnellvergleich

So ordnen sich die wichtigsten Zahlen der vier Modelle in Googles Benchmark-Tabelle ein.

Messgröße Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
Eingabepreis / 1 Mio. $0.75 $2.00 $2.00
Ausgabepreis / 1 Mio. $3.75 $10.00 $12.00
FrontierCode 1.1 Main 43.6% 42.7% 41.3%
DeepSWE v1.1 65.3% 53.8% 69.6%
Terminal-bench 2.1 85.8% 80.4% 87.4%
GDP.pdf 34.0% 28.0% 24.7%
GDM-MRCR v2 (128k) 97.0% 81.5% 93.5%

FrontierCode 1.1 Main

FrontierCode 1.1 Main misst produktionsreife Codequalität. Belohnt wird also korrekter, auslieferbarer Code – nicht nur syntaktische Korrektheit.

Gemini 3.7 Flash erreicht 43,6% und liegt damit vor Claude Sonnet 5 (42,7%), GPT-5.6 Terra (41,3%) und seinem Vorgänger 3.6 Flash (34,4%).

Dass ein Modell der Flash-Klasse beide Top-Rivalen bei produktionsreifer Codequalität übertrifft – und das zu einem Drittel ihrer Tokenkosten – ist das herausragende Ergebnis dieses Releases.

DeepSWE v1.1

DeepSWE v1.1 testet langfristiges Software Engineering – also Multi-File-Aufgaben, die über viele Schritte konsistenten Kontext erfordern.

Hier erzielt 3.7 Flash 65,3% – ein großer Sprung von 48,6% bei 3.6 Flash. GPT-5.6 Terra führt jedoch mit 69,6%, Claude Sonnet 5 liegt bei 53,8%.

Fazit: 3.7 Flash hat den Abstand zu Terra beim Langzeit-Coding weitgehend geschlossen, aber ihn nicht überholt. Wenn du das absolute Maximum für agentisches Multi-File-Coding brauchst, gewinnt Terra diese spezifische Eval.

Terminal-bench 2.1 und 3.0

Terminal-bench misst agentisches Terminal-Coding, bei dem das Modell eine Kommandozeile steuert, um Aufgaben zu erledigen.

Auf Terminal-bench 2.1 erreicht 3.7 Flash 85,8% gegenüber 78,0% bei 3.6 Flash und 80,4% bei Claude Sonnet 5; GPT-5.6 Terra führt mit 87,4%.

Die neuere Terminal-bench 3.0 für allgemeine Agentenfähigkeiten ist insgesamt härter: 3.7 Flash kommt auf 14,9% – deutlich über 3.6 Flash (5,4%), in etwa auf Augenhöhe mit Claude Sonnet 5 (14,6%) und hinter Terra (20,8%).

Diese niedrigen Absolutwerte sind eine nützliche Realitätsspritze dafür, wie viel Weg allgemeine Agenten-Zuverlässigkeit noch vor sich hat.

GDP.pdf und Harvey LAB-AA

GDP.pdf prüft das Expertenverständnis von PDF-Dokumenten, Harvey LAB-AA komplexe juristische Workflows.

Gemini 3.7 Flash führt in beiden: 34,0% bei GDP.pdf gegenüber 28,0% für Claude Sonnet 5 und 24,7% für GPT-5.6 Terra sowie 90,7% bei Harvey LAB-AA gegenüber 90,1% für Sonnet 5 und 85,2% für Terra.

Wenn deine Arbeit dokumentenlastige Rechts- oder Finanzanalysen umfasst, ist hier das günstigste Modell zugleich das präziseste – eine seltene Kombination.

GDM-MRCR v2 Long Context

GDM-MRCR v2 (8-Needle) misst Long-Context-Retrieval und prüft, ob das Modell mehrere versteckte Informationseinheiten in einem langen Input findet.

Bei 128k im Mittel erzielt 3.7 Flash 97,0% – vor 3.6 Flash (91,8%), Claude Sonnet 5 (81,5%) und GPT-5.6 Terra (93,5%).

Mit einem Kontextfenster von 1 Mio. Tokens und der stärksten 8-Needle-Retrieval-Leistung im Feld ist 3.7 Flash eine sehr gute Wahl für Pipelines, die große Dokumente oder lange Transkripte in einem einzigen Aufruf verarbeiten.

Als wir Terra und Sonnet 5 verglichen, war Long-Context-Retrieval eines der klaren Unterscheidungsmerkmale – 3.7 Flash liegt hier nun über beiden.

Wo GPT-5.6 Terra noch führt

Es lohnt sich, die Niederlagen klar zu benennen.

GPT-5.6 Terra schlägt Gemini 3.7 Flash bei DeepSWE v1.1 (69,6% vs. 65,3%), Terminal-bench 2.1 (87,4% vs. 85,8%), Terminal-bench 3.0 (20,8% vs. 14,9%) und OSWorld-2.0 für agentische Computerbedienung (50,2% vs. 47,9%).

Das Muster: Terra hat einen kleinen Vorsprung bei den schwierigsten agentischen und terminalbasierten Coding-Evals, während 3.7 Flash bei produktionsreifer Codequalität, Dokumentverständnis und Long-Context-Retrieval gewinnt. Was für dich besser ist, hängt davon ab, ob dein Engpass Agenten-Zuverlässigkeit oder Kosten sind.

Gemini 3.7 Flash: Preise und Verfügbarkeit

Gemini 3.7 Flash ist ab sofort über mehrere Google-Oberflächen allgemein verfügbar.

Die API-Model-ID lautet gemini-3.7-flash. Du kannst in Google AI Studio, Android Studio oder der agentenzentrierten Umgebung Google Antigravity loslegen.

  • Entwickler: Gemini API über Google AI Studio und Android Studio; Agent-Workflows in Google Antigravity
  • Unternehmen: Gemini Enterprise Agent Platform und die Gemini Enterprise App
  • Einzelpersonen: Gemini Spark, der 24/7-Persönliche Agent in der Gemini App, für Google AI Pro- und Ultra-Abonnenten in über 160 Ländern

Die Preise betragen 0,75 $ pro 1 Mio. Eingabetokens und 3,75 $ pro 1 Mio. Ausgabetokens bis zum 31. Dezember 2026. Ab dem 1. Januar 2027 gelten Standardtarife von 1,50 $ (Eingabe) und 7,50 $ (Ausgabe). Beachte: Audiogenerierung, Bildgenerierung und die Live API werden von diesem Modell nicht unterstützt; Computer Use ist nur als Vorschau verfügbar.

Fazit

Gemini 3.7 Flash steht für hohes Tempo und sinkende Preise, während das Flaggschiff Gemini 3.5 Pro verspätet ist.

Ein verbessertes Flash-Modell drei Wochen nach 3.6 Flash herauszubringen – und das zum halben Tokenpreis – wirkt wie eine klare Offensive im Mid-Tier, wo der Großteil der Produktionslast liegt.

Ehrlich gesagt: Wenn deine Workloads Dokumentverständnis, produktionsreifen Web- und App-Code oder Long-Context-Retrieval sind, ist das hier das Modell der Wahl. Es liegt dabei klar vor Claude Sonnet 5 und GPT-5.6 Terra – bei einem Bruchteil der Kosten.

Wenn dein Engpass das härteste agentische Terminal-Coding ist, behält Terra bei DeepSWE und Terminal-bench einen knappen Vorsprung – zu höheren Kosten für diese Spitze.

Nach dem Führungswechsel bei DeepMind und der Verzögerung des Pro-Modells setzt Google auf Flash, um seine Wettbewerbsfähigkeit zu beweisen. In der veröffentlichten Benchmark-Tabelle geht diese Rechnung für ein Mid-Tier-Modell weitgehend auf.

Wenn du mit Modellen wie diesem praktisch arbeiten willst, starte am besten mit unserem AI Fundamentals Skill Track, um dir die Grundlagen zu erarbeiten, bevor du Gemini 3.7 Flash in eigene Agenten-Pipelines einbindest.

FAQs

Wie schlägt sich Gemini 3.7 Flash im Vergleich zu Gemini 3.6 Flash?

Gemini 3.7 Flash legt gegenüber 3.6 Flash in nahezu allen von Google veröffentlichten Benchmarks zu, darunter FrontierCode 1.1 Main (43,6% vs. 34,4%), DeepSWE v1.1 (65,3% vs. 48,6%), GDP.pdf für Dokumentverständnis (34,0% vs. 22,0%) und AutomationBench (30,4% vs. 17,0%). Zudem startet es zum halben Tokenpreis von 3.6 Flash. Beide Modelle teilen sich das 1-Million-Token-Kontextfenster.

Wo kann ich auf Gemini 3.7 Flash zugreifen?

Entwickler nutzen das Modell über die Gemini API in Google AI Studio und Android Studio oder in der agentenfokussierten Umgebung Google Antigravity, mit der Model-ID gemini-3.7-flash. Unternehmen erhalten Zugriff über die Gemini Enterprise Agent Platform und die Gemini Enterprise App. Einzelpersonen greifen über Gemini Spark darauf zu – für Google AI Pro- und Ultra-Abonnenten in über 160 Ländern.

Was kostet Gemini 3.7 Flash?

Bis zum 31. Dezember 2026 liegt der Einführungspreis bei 0,75 $ pro 1 Mio. Eingabetokens und 3,75 $ pro 1 Mio. Ausgabetokens. Ab dem 1. Januar 2027 steigen die Standardpreise auf 1,50 $ pro 1 Mio. Eingabetokens und 7,50 $ pro 1 Mio. Ausgabetokens. Damit unterbietet 3.7 Flash Claude Sonnet 5 und GPT-5.6 Terra, die in Googles Benchmark-Tabelle bei 2,00 $ für Eingaben liegen.

Welche Sicherheitsstandards erfüllt Gemini 3.7 Flash?

Gemini 3.7 Flash wird mit aktualisierten Frontier-Sicherheitsmaßnahmen gegen Missbrauch in den Bereichen Chemie, Biologie, Radiologie, Nuklear (CBRN) und Cyber-Offense ausgeliefert. Google berichtet, dass es bei Sicherheits- und Tonevaluierungen ähnlich wie 3.6 Flash abschneidet – mit wenigen unbegründeten Verweigerungen. Es erfüllte außerdem Googles Kinder­schutz-Schwellenwerte während des Red-Teaming.

Ist Gemini 3.7 Flash besser als GPT-5.6 Terra für Coding?

Es kommt auf die Aufgabe an. Gemini 3.7 Flash führt bei produktionsreifer Codequalität (FrontierCode 1.1: 43,6% vs. 41,3%), während GPT-5.6 Terra bei DeepSWE v1.1 (Langzeit-Coding, 69,6% vs. 65,3%), Terminal-bench 2.1 (87,4% vs. 85,8%) und OSWorld für agentische Computerbedienung vorne liegt. Terra hat bei den härtesten agentischen Evals einen kleinen Vorsprung, 3.7 Flash kostet jedoch nur einen Bruchteil.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Autorin und Redakteurin im Bereich der Bildungstechnologie. Engagiert bei der Erforschung von Datentrends und begeistert davon, Data Science zu lernen.

Themen
Künstliche Intelligenz
Große Sprachmodelle

Top-DataCamp-Kurse

Kurs

Praxisnahe KI mit Google Gemini und NotebookLM

2 Std.
9.7K
Lerne Gemini und NotebookLM, um Aufgaben zu automatisieren, produktiver zu sein und im KI-Ökosystem von Google smarter zu arbeiten.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Die 36 wichtigsten Fragen und Antworten zum Thema generative KI für 2026

Dieser Blog hat eine ganze Reihe von Fragen und Antworten zu generativer KI, von den Grundlagen bis hin zu fortgeschrittenen Themen.
Hesam Sheikh Hassani's photo

Hesam Sheikh Hassani

15 Min.

Blog

Ein kompletter Leitfaden zu den Gehältern von Business-Analysten im Jahr 2026

Finde raus, wie viel du als Business Analyst verdienen kannst und wie du dein jetziges Gehalt aufbessern kannst.
Matt Crabtree's photo

Matt Crabtree

14 Min.

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Tutorial

30 coole Python-Tricks für besseren Code mit Beispielen

Wir haben 30 coole Python-Tricks zusammengestellt, mit denen du deinen Code verbesserst und deine Python-Kompetenzen ausbaust.
Kurtis Pykes 's photo

Kurtis Pykes

15 Min.

Tutorial

AVERAGE() in Excel: Die wichtige Funktion einfach erklärt

Lerne die Arbeit mit Excels AVERAGE()-Funktion – inklusive bedingter und logischer Varianten.
Josef Waples's photo

Josef Waples

3 Min.

Mehr AnzeigenMehr Anzeigen