Kursus
Sejauh ini, 2026 adalah tahunnya AI agentik. Peningkatan model telah melahirkan banyak alat untuk pekerjaan agentik, dari asisten AI pribadi hingga agen pengodean. Pemain besar di ranah ini adalah Gemini dari Google, seri GPT dari OpenAI, dan model Anthropic, yang telah menjadi favorit para pengembang.
Dalam artikel ini, saya akan membandingkan Claude Opus 4.7 dan Gemini 3.1 Pro, termasuk tolok ukur dan harga. Di akhir, saya akan memberikan kriteria yang dapat Anda gunakan untuk menentukan model mana yang terbaik untuk alur kerja Anda.
Apa Itu Claude Opus 4.7?
Seperti yang kami bahas dalam artikel Opus 4.7, Claude Opus 4.7 adalah model andalan terbaru dari Anthropic, pembaruan dari pendahulunya, Claude Opus 4.6. Model ini dirancang untuk alur kerja agentik yang kompleks dan penalaran multi-langkah. Kinerjanya lebih baik pada pengodean agentik, penalaran visual, dan penggunaan alat.
Fitur dan kapabilitas utama Claude Opus 4.7
Salah satu fitur sentral Opus 4.7 adalah anggaran tugas, yang memungkinkan Anda menetapkan batasan biaya atas jumlah token yang dapat dibelanjakan agen per tugas. Ini mencegah biaya tak terduga saat agen berjalan secara otonom dengan memaksanya untuk mengoptimalkan dan tetap dalam anggaran.
Claude Opus 4.7 memiliki jendela konteks 1 juta token dan 128K token keluaran. Artinya, ia dapat menjalankan tugas jangka panjang sambil mempertahankan seluruh konteks tugas. Ini sangat berguna saat menelusuri basis kode yang besar.
Model ini juga meningkatkan kapabilitas visinya, mendukung gambar hingga 3,75 megapiksel. Hasilnya, kinerjanya lebih baik dalam penalaran visual dibandingkan Opus 4.6, menjadikannya model ideal untuk tugas seperti ekstraksi data dari bagan beresolusi tinggi.
Opus 4.7 juga menghadirkan upaya penalaran baru xhigh yang berada di antara high dan max untuk memberikan hasil terbaik pada tugas pengodean dan agentik. Anda juga dapat menggunakan upaya berpikir high untuk upaya berpikir yang sedikit lebih rendah. Anthropic juga memperkenalkan /ultrareview di Claude Code untuk menjalankan code review pada perubahan kode dan menangkap bug.

Hal yang mungkin mengejutkan sebagian orang adalah Adaptive Thinking kini tidak menampilkan respons pemikiran secara bawaan. Anda dapat mengembalikan versi ringkas dari penalaran dengan mengatur thinking.display ke summarized.
Dalam hal tolok ukur, Opus 4.7 meraih skor:
- 87,6% pada SWE-bench Verified
- 64,3% pada varian yang lebih sulit, SWE-bench Pro
- 78% pada OSWorld, yang mengukur penggunaan komputer secara otonom
- 77,3% pada MCP Atlas untuk orkestrasi alur kerja multi-alat
Saat Claude Opus 4.7 dirilis, model ini berada di puncak Artificial Analysis Intelligence Index dengan skor 57. Model ini juga memimpin pekerjaan agentik dunia nyata yang diukur dengan GDPval-AA, dengan skor 1.753 Elo. Sementara itu, GPT-5.5 telah melampauinya pada keduanya.
Pelajari cara membangun aplikasi tolok ukur Streamlit yang menguji apakah memori kritik mandiri Opus 4.7 benar-benar meningkatkan performa pengodean di lintas level upaya high, xhigh, dan max dari Claude Opus 4.7 Practical Benchmark tutorial.
Kelebihan dan kekurangan Claude Opus 4.7
Model Anthropic dikenal sebagai yang terbaik untuk pengodean, dan tolok ukur Opus 4.7 membuktikannya. Namun, keluarga model Opus tidak murah, sehingga anggaran tugas menjadi tambahan yang berguna, terutama bagi mereka yang menjalankan alur kerja agentik yang panjang.
Model ini juga tersedia melalui berbagai penyedia cloud seperti Amazon Bedrock, Google Vertex AI, dan Microsoft Foundry. Ini memudahkan integrasi menggunakan penyedia yang sudah Anda gunakan.
Opus 4.7 juga hadir dengan tokenizer baru, sehingga sedikit lebih sulit membandingkan biaya aktual dengan model Opus sebelumnya. Namun, menurut Artificial Analysis Intelligence, Opus 4.7 menggunakan ~35% lebih sedikit token keluaran daripada Opus 4.6 untuk menjalankan indeks.

Pelajari kapabilitas model terbaik Anthropic yang tersedia untuk publik, Claude Opus 4.7, dan bangun alat sains data yang dapat mengubah bagan menjadi data mentah dari Tutorial API Claude Opus 4.7.
Apa itu Gemini 3.1 Pro?
Gemini 3.1 Pro adalah model penalaran andalan Google DeepMind saat ini yang menampilkan model campuran pakar berbasis Transformer. Ketika Gemini 3.1 Pro dirilis, model ini memimpin Artificial Analysis Intelligence Index dengan keunggulan 4 poin di depan Opus 4.6, dan kini setara dengan Opus 4.7 dengan skor 57.
Untuk mempelajari lebih lanjut tentang Gemini 3.1 Pro, simaka artikel Building with Gemini 3.1 Pro kami, yang membahas cara membangun aplikasi siap produksi dengan Gemini 3.1 Pro.
Fitur dan kapabilitas utama Gemini 3.1 Pro
Berbeda dengan Gemini 3 Pro yang memiliki dua level, Gemini 3.1 Pro memiliki 3 level berpikir: penalaran low, medium, dan high. Low terbaik untuk kecepatan dan optimasi token. medium memberikan pendekatan seimbang. Karena high menghasilkan lebih banyak token pemikiran dan respons paling lambat, Anda sebaiknya menggunakannya untuk tugas yang memerlukan penalaran kompleks.
Gemini 3.1 Pro juga memiliki jendela konteks 1 juta untuk input, namun lebih kecil untuk keluaran sekitar 65K token. Model ini multimodal, mendukung audio, PDF, teks, dan gambar.
Mari bahas tolok ukur. Berikut dua area di mana Gemini 3.1 Pro unggul:
- Gemini 3.1 Pro memimpin pada ARC-AGI-2 dengan skor 77,1%.
- Gemini 3.1 Pro meraih 73,9% pada MCP Atlas, yang mengukur koordinasi alur kerja multi-alat.

Menurut Artificial Analysis Intelligence, Gemini 3.1 Pro Preview efisien token, menggunakan ~57M token untuk menjalankan Indeks mereka dibandingkan Opus 4.6.
Gemini 3.1 Pro unggul atas Opus 4.7 pada Coding Index Artificial Analysis, namun tertinggal pada Agentic Index.
Kelebihan dan kekurangan Gemini 3.1 Pro
Harga Gemini 3.1 Pro cukup menarik, terutama untuk pekerjaan yang membutuhkan banyak token. Google juga menawarkan diskon 50% dengan model harga batch mereka, menjadikannya opsi ideal saat Anda tidak memerlukan hasil real-time.
Di sisi lain, jendela keluaran 65K milik Gemini 3.1 Pro hanya setengah dari Opus 4.7 (128K).
Perbandingan Langsung Claude Opus 4.7 vs Gemini 3.1 Pro
Berikut referensi cepat, sebelum kita melihat masing-masing kategori.
|
Claude Opus 4.7 |
Gemini 3.1 Pro |
|
|
Tanggal rilis |
16 April 2026 |
19 Februari 2026 |
|
Jendela konteks |
1M token |
1M token |
|
Keluaran maks |
128K token |
65K token |
|
SWE-bench Verified |
87,6% |
80,6% |
|
SWE-bench Pro |
64,3% |
54,2% |
|
ARC-AGI-2 |
75,8% |
77,1% |
|
GPQA Diamond |
94,2% (imbang) |
94,3% (imbang) |
|
MCP Atlas |
77,3% |
73,9% |
|
OSWorld |
78,0% |
Tidak ada skor yang dipublikasikan |
|
Visi |
2576px / 3,75MP |
Multimodal (video, audio, PDF) |
|
Harga input |
$5/M token |
$2/M token |
|
Harga output |
$25/M token |
$12/M token |
Kinerja agentik dan penggunaan komputer
Opus 4.7 adalah model yang sangat kuat untuk pekerjaan agentik, terutama karena memungkinkan Anda mengontrol berapa banyak token yang dapat digunakan agen. Sistem ini tidak tersedia di Gemini 3.1 Pro; Anda harus menggunakan level berpikir untuk mengendalikan penggunaan token.
Opus 4.7 meraih 78% pada tolok ukur penggunaan komputer otonom OSWorld. Itu hasil kuat yang sebanding dengan GPT 5.5 yang 78,7%, sementara Gemini 3.1 Pro tidak memiliki skor OSWorld yang dipublikasikan. Pada MCP Atlas, Opus 4.7 memimpin dengan 77,3% dibanding 73,9% milik Gemini. Angka-angka ini membuat Opus 4.7 menjadi pilihan ideal untuk sistem agentik produksi.
Tolok ukur pengodean
Sekarang mari lihat model mana yang terbaik dalam hal pemrograman menurut tolok ukur yang tersedia, khususnya SWE-bench Verified, yang menguji isu GitHub nyata.
Opus 4.7 mencapai 87,6% dibandingkan 80,6% milik Gemini 3.1 Pro. Pada SWE-bench Pro, varian uji yang lebih sulit, Opus 4.7 meraih 64,3% dibanding 54,2% milik Gemini (dan 58,6% milik GPT 5.5). Angka-angka ini menunjukkan bahwa Opus 4.7 saat ini adalah model pengodean terkuat di dunia.
Mari lihat performa model pada Terminal-Bench 2.0, yang menguji kemampuan model untuk ngoding di terminal. Opus 4.7 meraih 69,4%, Gemini Pro mendapat 68,5%, dan GPT 5.5 baru meraih 82,7%. GPT-5.5 adalah pemenang jelas pada tolok ukur ini, sementara kedua model kita imbang di sini.
Penalaran dan tugas ilmiah
Mana model terbaik untuk penalaran dan tugas ilmiah? Mari cari tahu. Saya tidak akan menggunakan tolok ukur GPQA Diamond karena semua model unggul di sana. Sebagai gantinya, kita akan melihat ARC-AGI-2, yang menguji kecerdasan cair, yaitu kemampuan model memecahkan masalah penalaran abstrak yang belum pernah dilihat sebelumnya.
Gemini 3.1 Pro meraih 77,1% dibanding 75,8% milik Opus 4.7 dan 85,0% milik GPT 5.5, menjadikan GPT 5.5 pemenang jelas di sini, diikuti Gemini 3.1 Pro.
Pada Humanity's Last Exam, yang bertujuan mengukur penalaran tingkat pascasarjana di bidang sains, matematika, dan humaniora, Opus 4.7 memimpin atas Gemini 3.1 Pro baik dengan maupun tanpa alat:
- Tanpa alat: Opus 4.7 memimpin dengan 46,9%, diikuti Gemini 3.1 Pro (44,4%) dan GPT 5.5 Pro (43,1%).
- Dengan alat: GPT 5.5 Pro memimpin dengan 57,2%, diikuti Opus 4.7 (54,7%) dan Gemini 3.1 Pro (51,4%).
Biaya dan efisiensi token
Opus 4.7 berharga $5 per satu juta token input dan $25 per satu juta token output, sementara Gemini 3.1 Pro berharga $2 per satu juta token input dan $12 per satu juta token output. Gemini jauh lebih murah, dan dengan diskon harga batch 50%, model ini sangat kompetitif untuk tugas yang memerlukan banyak token.
Perlu juga disebutkan bahwa tokenizer baru dari Opus 4.7 membuat perbandingan biaya dengan model Opus sebelumnya menjadi sedikit lebih sulit.
Jendela konteks dan kapasitas keluaran
Kedua model menerima 1 juta token input, sehingga memungkinkan mereka mengonsumsi seluruh basis kode dan dokumen riset panjang dalam satu prompt.
Untuk token keluaran, Opus 4.7 mendukung 128K token sementara Gemini 3.1 Pro mendukung 65.536. Ini membuat Opus menjadi pilihan lebih baik untuk alur kerja yang memerlukan generasi token keluaran lebih banyak.

Pelajari bagaimana perbandingan Opus 4.7 dan GPT 5.4 dalam tutorial Opus 4.7 vs. GPT-5.4, di mana kami membandingkan keduanya untuk pengodean, alur kerja agentik, dan tugas konteks panjang, serta menganalisis tolok ukur.
Apakah Claude Opus 4.7 Lebih Baik Daripada Gemini 3.1 Pro?
Ini membawa kita ke pertanyaan: mana dari dua model ini yang sebaiknya Anda pilih?
Anda sebaiknya memilih Claude Opus 4.7 jika...
- Anda membangun pipeline pengodean agentik di mana selisih 10 poin pada SWE-bench Pro langsung berdampak pada lebih sedikit kegagalan run di produksi.
- Anda memerlukan anggaran tugas untuk membuat loop otonom panjang lebih dapat diprediksi tanpa menambahkan logika pemantauan eksternal.
- Pipeline Anda menghasilkan keluaran panjang, dan batas 128K token penting, hampir dua kali lipat dari yang didukung Gemini 3.1 Pro.
- Anda menginginkan skor orkestrasi multi-alat terkuat pada MCP Atlas untuk alur kerja agentik yang kompleks.
- Anda sudah berada dalam ekosistem Anthropic melalui Claude Code, Amazon Bedrock, atau Claude API, dan biaya perpindahan lebih besar daripada selisih harga.
Anda sebaiknya memilih Gemini 3.1 Pro jika...
- Volume token Anda membuat perbedaan biaya input 2,5x menjadi signifikan; pada 500 juta token per bulan, selisihnya adalah $1.500 setiap bulan
- Anda memerlukan input video, audio, atau PDF secara native dalam satu panggilan API tanpa langkah prapemrosesan terpisah
- Anda membangun di infrastruktur Google dan menginginkan hubungan vendor tunggal melalui Vertex AI
- Penalaran visual abstrak adalah kasus penggunaan utama Anda. Opus tertinggal pada ARC-AGI-2 dengan 75,8% dibanding 77,1% milik Gemini
Pemikiran Akhir
Claude Opus 4.7 dan Gemini 3.1 Pro sama-sama model yang kuat. Pilihan model yang akan digunakan bergantung pada anggaran dan tugas yang ingin Anda capai. Opus unggul pada tugas agentik, tetapi jika melebihi anggaran, Gemini 3.1 Pro juga kandidat kuat, terutama mengingat tokennya yang lebih murah dan diskon harga batch 50%.
Anthropic mempertahankan keunggulannya dalam model pengodean terbaik, menjadikannya sangat cocok untuk tugas agentik yang memerlukan penalaran dan pemrograman kompleks. Google menghadirkan model penalaran terdepan dengan harga yang jauh lebih rendah dibandingkan Anthropic. Pertarungan antara kedua perusahaan dan pemain besar lain seperti OpenAI adalah untuk menghadirkan model agentik terbaik yang juga merupakan model serbaguna yang baik.
Mengingat betapa mahalnya keluarga model Opus, senang melihat diperkenalkannya anggaran tugas. Saya tidak akan terkejut jika penyedia lain mengintegrasikannya dalam rilis mendatang. Ini akan menjadi tambahan yang baik untuk membuat biaya menjalankan tugas agen jangka panjang lebih dapat diprediksi.
Untuk mempelajari lebih lanjut tentang bekerja dengan alat AI, saya sarankan melihat panduan kami tentang alat AI gratis terbaik. Untuk keterampilan pengodean AI yang lebih luas, coba kursus AI-Assisted Coding for Developers kami untuk mengembangkan keterampilan yang membuat asisten AI menjadi mitra yang lebih andal dalam alur kerja pengembangan Anda.
Terakhir, Anda juga dapat mempelajari cara membangun aplikasi bertenaga AI menggunakan LLM, prompt, chain, dan agen di LangChain dari kursus Developing LLM Applications with LangChain kami.
Claude Opus 4.7 vs Gemini 3.1 Pro FAQs
Apakah Claude Opus 4.7 lebih baik daripada Gemini 3.1 Pro?
Itu bergantung pada kasus penggunaan. Opus 4.7 memimpin pada tolok ukur pengodean (87,6% vs 80,6% pada SWE-bench Verified), penggunaan alat agentik (MCP Atlas 77,3% vs 73,9%), dan kapasitas keluaran (128K vs 65K token).
Apa itu anggaran tugas di Claude Opus 4.7?
Anggaran tugas adalah batas token yang Anda tetapkan untuk satu loop agentik penuh, mencakup pemikiran, pemanggilan alat, hasil alat, dan keluaran akhir. Claude melacak berapa banyak anggaran yang telah digunakan dan menyesuaikan pekerjaannya sesuai.
Berapa biaya Gemini 3.1 Pro dibandingkan Claude Opus 4.7?
Gemini 3.1 Pro berharga $2 per satu juta token input dan $12 per satu juta token output. Claude Opus 4.7 berharga $5 per satu juta token input dan $25 per satu juta token output, sehingga Gemini 2,5x lebih murah pada input. Gemini juga menawarkan batch API dengan diskon 50%, menurunkan biaya input menjadi $1 per satu juta token untuk beban kerja asinkron.
Bagaimana perbandingan Claude Opus 4.7 dan Gemini 3.1 Pro pada tolok ukur SWE-bench?
Gemini 3.1 Pro meraih 80,6% pada SWE-bench Verified dan 54,2% pada SWE-bench Pro. Claude Opus 4.7 meraih 87,6% pada SWE-bench Verified dan 64,3% pada SWE-bench Pro. Selisih 10 poin pada varian Pro adalah perbedaan paling bermakna antara kedua model pada tugas pengodean.
Model mana yang memiliki jendela konteks terpanjang?
Baik Claude Opus 4.7 maupun Gemini 3.1 Pro mendukung jendela konteks 1 juta token untuk input. Pada keluaran, Opus 4.7 mendukung hingga 128.000 token, dua kali lipat dari 65.536 token milik Gemini 3.1 Pro. Jika Anda perlu menghasilkan dokumen panjang atau kode multi-berkas yang kompleks dalam satu kali proses, batas keluaran Opus 4.7 adalah yang lebih tinggi di antara keduanya.

