Lewati ke konten utama

Gemini 3.7 Flash: Fitur, Tolok Ukur, dan Harga

Gemini 3.7 Flash dari Google menargetkan pengkodean dan alur kerja agen dengan setengah harga peluncuran 3.6 Flash. Inilah yang baru, tolok ukurnya, dan posisinya.
Diperbarui 28 Sep 2026  · 10 mnt baca

Jelajahi dengan AI

ChatGPTClaudePerplexity

Catatan: Hanya beberapa minggu setelah peluncuran Gemini 3.7 Flash, Google merilis Gemini 3.8 Flash. Lihat demonya di tutorial API Gemini 3.8 Flash kami.

Google merilis Gemini 3.7 Flash, model kelas Flash paling canggih sejauh ini, yang ditujukan untuk pengkodean dan alur kerja agen. Peluncuran ini hadir saat model andalan Google, Gemini 3.5 Pro, masih tertunda, yang oleh Reuters disebut sebagai ujian apakah DeepMind bisa mengimbangi Anthropic dan OpenAI.

Angka-angka utamanya agresif. Gemini 3.7 Flash meraih 43,6% pada FrontierCode 1.1 Main (naik dari 34,4% untuk 3.6 Flash), skor 1588 Elo di Code Arena untuk pengembangan web, dan diluncurkan dengan harga perkenalan $0,75 per 1 juta token masukan dan $3,75 per 1 juta token keluaran, setengah dari biaya awal 3.6 Flash.

Dalam artikel ini, saya akan membahas semua hal baru pada Gemini 3.7 Flash, meninjau fiturnya, mengeksplorasi tolok ukurnya, dan menyiapkan uji coba langsung yang bisa Anda jalankan sendiri. Untuk pembahasan lebih dalam tentang model pesaingnya, lihat panduan kami tentang GPT-5.6 Terra vs Claude Sonnet 5 dan cara mempelajari Claude. 

Gambaran Singkat

  • Gemini 3.7 Flash adalah model Flash paling canggih dari Google, ditujukan untuk pengkodean dan alur kerja agen, dengan jendela konteks 1 juta token.
  • Harga perkenalan adalah $0,75/1 juta token masukan dan $3,75/1 juta token keluaran hingga 31 Desember 2026, lalu $1,50/$7,50 sebagai standar.
  • Memimpin FrontierCode 1.1 (43,6%), GDP.pdf (34,0%), Harvey LAB-AA (90,7%), dan GDM-MRCR konteks panjang (97,0%) melawan Claude Sonnet 5 dan GPT-5.6 Terra.
  • GPT-5.6 Terra masih unggul pada evaluasi DeepSWE, Terminal-bench, dan OSWorld untuk agen.
  • Tersedia melalui Gemini API, Google Antigravity, Gemini Enterprise, dan Gemini Spark.

Apa itu Gemini 3.7 Flash?

Gemini 3.7 Flash adalah model pekerja kelas menengah Google, diposisikan sebagai model Flash paling canggih untuk pengkodean kompleks, alur kerja agen, dan eksekusi multi-langkah yang andal. Model ini mengikuti Gemini 3.6 Flash yang hadir tiga minggu sebelumnya, dan Google mengkreditkan umpan balik pengembang serta perubahan algoritme atas lonjakan kualitasnya.

Model ini tersedia umum melalui Gemini API dengan jendela konteks 1 juta token (1.048.576 token masukan) dan batas keluaran 65.536 token. Model ini menerima masukan teks, gambar, video, audio, dan PDF, serta hanya menghasilkan keluaran teks. Google menyediakan tingkat penalaran yang dapat diatur: rendah, sedang, dan tinggi, meskipun API akan mengembalikan galat jika Anda meminta pengaturan minimal yang tidak didukung.

Tolok ukur paling mencolok adalah DeepSWE v1.1, evaluasi rekayasa perangkat lunak berjangka panjang, di mana 3.7 Flash meraih 65,3% dibandingkan 34,4% untuk pendahulunya pada FrontierCode dan hanya 48,6% untuk 3.6 Flash pada DeepSWE itu sendiri. Ini adalah lonjakan besar untuk satu generasi pada model yang juga turun harganya—hal yang tidak biasa.

Apa yang Baru di Gemini 3.7 Flash?

Intinya adalah model Flash yang lebih mampu dengan harga lebih rendah, instruksi yang lebih patuh, dan lebih sedikit “penjagaan” dalam loop agen. Berikut perubahan yang paling berdampak bagi praktisi.

Kemampuan coding dan penyelesaian isu yang lebih kuat

Anda dapat menyerahkan pekerjaan debug dan refaktor yang lebih sulit kepada Gemini 3.7 Flash dan mengharapkan akurasi percobaan pertama yang lebih tinggi. Google melaporkan 43,6% pada FrontierCode 1.1 Main untuk kualitas kode produksi, naik dari 34,4% untuk 3.6 Flash, dan 65,3% pada DeepSWE v1.1 untuk rekayasa perangkat lunak berjangka panjang.

Bagi engineer yang bekerja, implikasi praktisnya adalah lebih sedikit pengulangan. Google menyatakan model ini lebih adaptif menghadapi hambatan dan lebih setia mengikuti instruksi, yang mengurangi pengawasan manual yang membuat model murah menjadi mahal dalam waktu nyata.

Generasi aplikasi web dan UI yang lebih cepat

Gemini 3.7 Flash menghasilkan tata letak fungsional dan aplikasi web dengan fitur lengkap dalam lebih sedikit prompt dibanding 3.6 Flash. Di papan peringkat pengembangan web Code Arena, model ini mencetak 1588 Elo dibanding 1538 untuk 3.6 Flash dan 1541 untuk Claude Sonnet 5.

Model ini juga dapat meniru masukan referensi saat membuat UI, baik referensi berupa tangkapan layar, gambar, atau sistem desain lengkap. Jika Anda memberinya mockup halaman harga, tujuannya adalah meniru kepatuhan desain alih-alih mengimprovisasi tata letak generik.

Eksekusi agen multi-langkah yang lebih baik

Model ini lebih serius dalam perencanaan dan pemanggilan alat—area yang biasanya menjadi titik lemah model murah. Pada AutomationBench, evaluasi privat untuk alur kerja bisnis dunia nyata, 3.7 Flash meraih 30,4% dibanding 17,0% untuk 3.6 Flash dan 10,7% untuk Claude Sonnet 5.

Alat bawaan yang tersedia melalui API mencakup caching, eksekusi kode, penelusuran berkas, pemanggilan fungsi, search grounding, grounding dengan Google Maps, keluaran terstruktur, dan konteks URL. Computer use tersedia namun berstatus pratinjau, jadi saya belum menyarankan membangun agen produksi di atasnya.

Peningkatan pekerjaan dokumen dan pengetahuan

Gemini 3.7 Flash menangani bidang padat pengetahuan seperti keuangan, hukum, dan biosains dengan penalaran dan pemahaman dokumen yang lebih baik. Pada tolok ukur GDP.pdf untuk pemahaman PDF tingkat ahli, model ini meraih 34,0% dibanding 22,0% untuk 3.6 Flash, dan pada Harvey LAB-AA untuk alur kerja hukum kompleks mencapai 90,7%.

Jika pekerjaan Anda melibatkan mengekstrak jawaban terstruktur dari laporan tahunan atau kontrak yang padat, rilis ini layak diuji. Model ini masih hanya menghasilkan teks, jadi tidak akan membuat bagan yang dibacanya—hanya mendeskripsikan atau meringkasnya.

Harga lebih rendah untuk penskalaan agen

Harga perkenalan memangkas setengah biaya menjalankan agen berbasis Flash dibanding tarif peluncuran 3.6 Flash. Hingga 31 Desember 2026, Anda membayar $0,75 per 1 juta token masukan dan $3,75 per 1 juta token keluaran.

  • Masukan: $0,75 per 1 juta token (perkenalan), naik menjadi $1,50 per 1 juta pada 1 Januari 2027
  • Keluaran: $3,75 per 1 juta token (perkenalan), naik menjadi $7,50 per 1 juta pada 1 Januari 2027

Sebagai perbandingan, Claude Sonnet 5 berada di $2,00 untuk masukan dan $10,00 untuk keluaran pada tabel tolok ukur Google, dan GPT-5.6 Terra di $2,00 untuk masukan dan $12,00 untuk keluaran. Berdasarkan harga token mentah, 3.7 Flash jauh lebih murah daripada keduanya.

Tolok Ukur Gemini 3.7 Flash

Tabel tolok ukur Google membandingkan Gemini 3.7 Flash dengan 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra, dan Muse Spark 1.2. Polanya konsisten: 3.7 Flash mengungguli pendahulunya di hampir semua evaluasi dan bersaing ketat dengan rival yang lebih mahal, meski GPT-5.6 Terra unggul tipis pada beberapa evaluasi pengkodean agen.

Sekilas: Gemini 3.7 Flash vs para pesaing

Berikut perbandingan angka kunci di antara empat model pada tabel tolok ukur Google.

Metode ukur Gemini 3.7 Flash Claude Sonnet 5 GPT-5.6 Terra
Harga masukan / 1 juta $0.75 $2.00 $2.00
Harga keluaran / 1 juta $3.75 $10.00 $12.00
FrontierCode 1.1 Main 43.6% 42.7% 41.3%
DeepSWE v1.1 65.3% 53.8% 69.6%
Terminal-bench 2.1 85.8% 80.4% 87.4%
GDP.pdf 34.0% 28.0% 24.7%
GDM-MRCR v2 (128k) 97.0% 81.5% 93.5%

FrontierCode 1.1 Main

FrontierCode 1.1 Main mengukur kualitas kode produksi, jadi menilai kode yang benar dan siap rilis, bukan sekadar valid secara sintaks.

Gemini 3.7 Flash mencetak 43,6%, di atas Claude Sonnet 5 (42,7%), GPT-5.6 Terra (41,3%), dan pendahulunya 3.6 Flash (34,4%).

Bagi model kelas Flash untuk memimpin kedua rival frontier dalam kualitas kode produksi adalah hasil paling menonjol pada rilis ini—terutama dengan biaya token sepertiga dari mereka.

DeepSWE v1.1

DeepSWE v1.1 menguji rekayasa perangkat lunak berjangka panjang, yakni tugas multi-berkas yang memerlukan konteks berkelanjutan di banyak langkah.

Di sini, 3.7 Flash meraih 65,3%, lonjakan besar dari 48,6% untuk 3.6 Flash, tetapi GPT-5.6 Terra memimpin dengan 69,6%, dan Claude Sonnet 5 berada di 53,8%.

Intinya: 3.7 Flash menutup sebagian besar jarak terhadap Terra pada pengkodean berjangka panjang, tetapi belum melampauinya. Jika Anda butuh plafon tertinggi untuk pengkodean agen multi-berkas, Terra masih menang pada evaluasi ini.

Terminal-bench 2.1 dan 3.0

Terminal-bench mengukur pengkodean terminal berbasis agen, ketika model mengoperasikan command line untuk menyelesaikan tugas.

Pada Terminal-bench 2.1, 3.7 Flash mencetak 85,8% dibanding 78,0% untuk 3.6 Flash dan 80,4% untuk Claude Sonnet 5, meskipun GPT-5.6 Terra memimpin dengan 87,4%.

Terminal-bench 3.0 yang lebih baru untuk kemampuan agen umum lebih sulit bagi semua model: 3.7 Flash mencetak 14,9%, jauh di atas 3.6 Flash (5,4%), kurang lebih setara dengan Claude Sonnet 5 (14,6%), dan di belakang Terra (20,8%).

Angka absolut yang rendah ini menjadi pengingat berguna tentang seberapa jauh reliabilitas agen umum masih harus ditempuh.

GDP.pdf dan Harvey LAB-AA

GDP.pdf menguji pemahaman dokumen PDF tingkat ahli, dan Harvey LAB-AA menguji alur kerja hukum yang kompleks.

Gemini 3.7 Flash memimpin keduanya: 34,0% pada GDP.pdf dibanding 28,0% untuk Claude Sonnet 5 dan 24,7% untuk GPT-5.6 Terra, serta 90,7% pada Harvey LAB-AA dibanding 90,1% untuk Sonnet 5 dan 85,2% untuk Terra.

Jika beban kerja Anda adalah analisis hukum atau keuangan yang padat dokumen, inilah area di mana model termurah di tabel juga yang paling akurat—kombinasi yang jarang.

GDM-MRCR v2 konteks panjang

GDM-MRCR v2 (8-needle) mengukur pengambilan informasi dalam konteks panjang, menguji apakah model dapat menemukan beberapa informasi yang tersembunyi di seluruh masukan yang panjang.

Pada rata-rata 128k, 3.7 Flash mencetak 97,0%, di atas 3.6 Flash (91,8%), Claude Sonnet 5 (81,5%), dan GPT-5.6 Terra (93,5%).

Dengan jendela konteks 1 juta token dan pengambilan 8-needle terkuat di tabel, 3.7 Flash adalah pilihan yang kuat untuk pipeline yang memasukkan dokumen besar atau transkrip panjang dalam satu panggilan.

Saat kami membandingkan Terra dan Sonnet 5, pengambilan konteks panjang adalah salah satu pembeda paling jelas di antara keduanya, dan 3.7 Flash kini berada di atas keduanya pada rentang ini.

Area di mana GPT-5.6 Terra masih memimpin

Penting untuk jujur tentang kekalahan.

GPT-5.6 Terra mengungguli Gemini 3.7 Flash pada DeepSWE v1.1 (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%), Terminal-bench 3.0 (20,8% vs 14,9%), dan OSWorld-2.0 untuk penggunaan komputer berbasis agen (50,2% vs 47,9%).

Pola yang terlihat: Terra memiliki keunggulan kecil pada evaluasi agen dan pengkodean terminal yang paling sulit, sementara 3.7 Flash unggul pada kualitas kode produksi, pemahaman dokumen, dan pengambilan konteks panjang. Mana yang terbaik bagi Anda tergantung apakah hambatan utamanya adalah reliabilitas agen atau biaya.

Harga dan Ketersediaan Gemini 3.7 Flash

Gemini 3.7 Flash kini tersedia umum melalui beberapa kanal Google.

ID model API adalah gemini-3.7-flash, dan Anda bisa mulai membangun di Google AI Studio, Android Studio, atau lingkungan Google Antigravity yang berfokus pada agen.

  • Pengembang: Gemini API melalui Google AI Studio dan Android Studio; alur kerja agen di Google Antigravity
  • Perusahaan: Gemini Enterprise Agent Platform dan aplikasi Gemini Enterprise
  • Individu: Gemini Spark, agen pribadi 24/7 dalam aplikasi Gemini, untuk pelanggan Google AI Pro dan Ultra di lebih dari 160 negara

Harganya $0,75 per 1 juta token masukan dan $3,75 per 1 juta token keluaran hingga 31 Desember 2026. Mulai 1 Januari 2027, berlaku tarif standar $1,50 untuk masukan dan $7,50 untuk keluaran. Perlu dicatat bahwa pembuatan audio, pembuatan gambar, dan Live API tidak didukung untuk model ini, dan penggunaan komputer masih pratinjau.

Penutup

Gemini 3.7 Flash menunjukkan Google bergerak cepat dan memangkas harga sementara model andalan Gemini 3.5 Pro masih tertunda.

Merilis model Flash yang ditingkatkan tiga minggu setelah 3.6 Flash, dengan biaya token setengahnya, menggambarkan upaya perusahaan untuk menang di kelas menengah—tempat sebagian besar volume produksi berada.

Terus terang, inilah model yang layak Anda pilih jika beban kerja Anda adalah pemahaman dokumen, kode web dan aplikasi produksi, atau pengambilan konteks panjang, di mana model ini melampaui Claude Sonnet 5 dan GPT-5.6 Terra sekaligus berbiaya sebagian kecil saja.

Jika hambatan Anda adalah pengkodean terminal agen yang paling sulit, Terra masih unggul tipis pada DeepSWE dan Terminal-bench, dan Anda akan membayar lebih untuk plafon tersebut.

Dengan perubahan kepemimpinan DeepMind dan keterlambatan model Pro, Google mengandalkan Flash untuk membuktikan bahwa mereka masih bisa bersaing. Pada tabel tolok ukur yang baru saja dipublikasikan, argumen itu sebagian besar terbukti untuk model kelas menengah.

Jika Anda ingin praktik langsung dengan model seperti ini, saya sarankan mulai dari alur keterampilan AI Fundamentals kami untuk membangun fondasi sebelum menghubungkan Gemini 3.7 Flash ke pipeline agen Anda sendiri.

FAQ

Bagaimana perbandingan Gemini 3.7 Flash dengan Gemini 3.6 Flash?

Gemini 3.7 Flash meningkat dibanding 3.6 Flash di hampir setiap tolok ukur yang dipublikasikan Google, termasuk FrontierCode 1.1 Main (43,6% vs 34,4%), DeepSWE v1.1 (65,3% vs 48,6%), pemahaman dokumen GDP.pdf (34,0% vs 22,0%), dan AutomationBench (30,4% vs 17,0%). Model ini juga diluncurkan dengan harga token setengah dari 3.6 Flash. Keduanya berbagi jendela konteks 1 juta token yang sama.

Di mana saya dapat mengakses Gemini 3.7 Flash?

Pengembang dapat menggunakannya melalui Gemini API di Google AI Studio dan Android Studio, atau di lingkungan Google Antigravity yang berfokus pada agen, dengan ID model gemini-3.7-flash. Perusahaan mendapatkannya melalui Gemini Enterprise Agent Platform dan aplikasi Gemini Enterprise. Individu dapat mengaksesnya melalui Gemini Spark untuk pelanggan Google AI Pro dan Ultra di lebih dari 160 negara.

Berapa harga Gemini 3.7 Flash?

Hingga 31 Desember 2026, harga perkenalan adalah $0,75 per 1 juta token masukan dan $3,75 per 1 juta token keluaran. Mulai 1 Januari 2027, harga standar naik menjadi $1,50 per 1 juta token masukan dan $7,50 per 1 juta token keluaran. Ini lebih murah daripada Claude Sonnet 5 dan GPT-5.6 Terra, yang berada di $2,00 untuk masukan pada tabel tolok ukur Google.

Standar keamanan apa yang diikuti Gemini 3.7 Flash?

Gemini 3.7 Flash hadir dengan penjagaan Frontier Safety yang diperbarui untuk mencegah penyalahgunaan di domain Kimia, Biologi, Radiologi, dan Nuklir (CBRN) serta serangan siber. Google melaporkan performanya serupa dengan 3.6 Flash pada evaluasi keselamatan dan nada, dengan tingkat penolakan tidak beralasan yang rendah. Model ini juga memenuhi ambang peluncuran keselamatan anak Google selama red teaming.

Apakah Gemini 3.7 Flash lebih baik daripada GPT-5.6 Terra untuk coding?

Tergantung tugasnya. Gemini 3.7 Flash memimpin pada kualitas kode produksi FrontierCode 1.1 (43,6% vs 41,3%), sementara GPT-5.6 Terra unggul pada DeepSWE v1.1 untuk pengkodean berjangka panjang (69,6% vs 65,3%), Terminal-bench 2.1 (87,4% vs 85,8%), dan penggunaan komputer berbasis agen OSWorld. Terra unggul tipis pada evaluasi agen tersulit, tetapi 3.7 Flash berharga jauh lebih murah.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Editor senior di bidang AI dan edtech. Berkomitmen mengeksplorasi tren data dan AI.  

Topik
Kecerdasan Buatan
Large Language Models

Kursus DataCamp Teratas

Kursus

AI Praktis dengan Google Gemini dan NotebookLM

2 Hr
9.7K
Gunakan Master Gemini dan NotebookLM untuk mengotomatisasi tugas, meningkatkan produktivitas, dan bekerja lebih cerdas di ekosistem AI Google.
Lihat DetailRight Arrow
Mulai Kursus
Lihat Lebih BanyakRight Arrow