Program
Sebagian besar pembaca masih mengenal lab di balik Grok sebagai xAI. SpaceXAI merilis Grok 4.6 pada 12 Agustus 2026, sedikit lebih dari sebulan setelah Grok 4.5, dengan fokus pada pengodean, kerja web visual, dan tugas agen yang berjalan lebih lama.
Data peluncuran tidak mendukung satu peringkat sederhana. Grok memimpin beberapa uji pilihan SpaceXAI, sementara GPT-5.6 Sol dan Claude Fable 5 memimpin yang lain. Artificial Analysis menempatkan Grok di samping Sol pada harga campuran yang lebih rendah, tetapi peningkatan ini juga mulai menjawab lebih lambat dan berbiaya lebih tinggi per tugas terukur dibandingkan Grok 4.5.
Artikel ini mengikuti pertukaran itu melalui spesifikasi model, harga, akses, dan perbandingan langsung dengan Sol dan Claude. Ulasan Grok 4.5 kami berfokus pada penggunaan token yang rendah. Di sini, pertanyaannya adalah apakah skor yang lebih tinggi mengubah tagihan aktual setelah input yang di-cache, token penalaran, dan keluaran ekstra dihitung.
Ringkasnya: Grok 4.6
Kesimpulan singkat saya: kenaikan lima poin kurang berarti sendirian dibandingkan yang disiratkan halaman peluncuran. Perilaku harga dan jenis tugas menentukan apakah itu mengubah pilihan model.
-
Pada upaya
high, Grok 4.6 mencetak 61 pada Artificial Analysis Intelligence Index, secara angka setara dengan Sol padamaxdan dua poin di belakang Opus 5 padamax. -
Tarif dasar input dan output tetap $2 dan $6 per sejuta token, tetapi input yang di-cache, jeda token pertama, dan biaya tugas terukur semuanya naik dari Grok 4.5.
-
Dalam AA-Briefcase, Grok menggunakan lebih sedikit giliran dan token input daripada Opus 5; Sol memimpin uji terminal, sementara Sonnet 5 menawarkan konteks dua kali lipat tanpa biaya tambahan untuk prompt panjang.
Perbandingan di bawah ini memisahkan klaim penyedia dari hasil Artificial Analysis. Itu penting karena posisi model dapat berubah ketika tingkat upaya atau pengaturan uji berubah.
Apa Itu Grok 4.6?
Grok 4.6 adalah model penalaran proprietari milik SpaceXAI. API dan Cursor tidak menampilkan batas konteks yang sama, dan tarif konteks panjang yang lebih tinggi mulai berlaku jauh sebelum batas API. Tabel menempatkan batasan tersebut di samping jenis input, alat, dan cutoff pengetahuan.
|
Spesifikasi |
Grok 4.6 |
|
500.000 token (API); 256.000 token di dalam Cursor |
|
|
Input / output |
Teks dan gambar masuk; teks keluar |
|
Upaya penalaran |
Low, medium, high (default), xhigh |
|
Cutoff pengetahuan |
1 Februari 2026 |
|
Alat |
Function calling, penelusuran web, penelusuran X, eksekusi kode, pencarian koleksi (RAG), remote MCP |
|
Harga standar |
$2 / sejuta token input, $0,50 untuk cache, $6 / sejuta token output |
|
Harga konteks panjang |
$4 / $1 / $12 ketika prompt mencapai 200.000 token, diterapkan ke seluruh permintaan |
SpaceXAI masih belum memublikasikan jumlah parameter untuk kedua model. Angka 1,5 triliun dalam beberapa laporan tidak berasal dari SpaceXAI, sehingga bukan spesifikasi yang terkonfirmasi.
Apa yang Baru di Grok 4.6?
SpaceXAI mengatakan ini bukan model baru yang dilatih dari nol. Sebaliknya, Grok 4.5 diberi pelatihan tambahan, dengan perhatian ekstra pada tugas agen AI. Perubahan yang dilaporkan mencakup run agen yang lebih panjang, pembuatan visual, dan pascapelatihan.
Tugas agen yang lebih panjang
SpaceXAI menyatakan Grok 4.6 tetap pada jalurnya selama tugas panjang dengan beberapa langkah, seperti riset, bekerja di seluruh basis kode, dan membangun aplikasi. Model ini dilaporkan lebih sering memeriksa pekerjaannya alih-alih melakukan semuanya dalam satu kali proses.
Itu sejalan dengan perubahan yang lebih luas dalam pengujian model. Jawaban awal yang baik kurang berarti jika model melupakan keputusan sebelumnya setelah beberapa panggilan alat. Pengujian internal GitHub juga menemukan bahwa Grok 4.6 mempertahankan penalaran dan penggunaan alat pada tugas yang lebih panjang.
API memiliki fitur yang terkait dengan klaim tersebut. Grok 4.6 dapat melakukan stream ringkasan penalaran, yang tidak diekspos Grok 4.5, dan xAI merekomendasikan context compaction dengan prompt_cache_key yang persisten untuk loop agen yang panjang. Kompaksi memendekkan riwayat sebelumnya menjadi satu item, tetapi tetap menggunakan token, dan permintaan harus muat dalam jendela konteks sebelum kompaksi dijalankan.
Pengembangan web visual dan interaktif
SpaceXAI dan Cursor sama-sama melaporkan upaya pertama yang lebih baik pada proyek visual. Dalam satu uji eksternal, Grok 4.6 membangun ulang halaman produk iPod Mini lama sebagai situs 3D dengan roda warna yang berfungsi dan animasi gulir. Demonya berhasil, tetapi satu uji tidak dapat membuktikan klaim yang lebih luas.
Bagaimana Grok 4.6 dipascapelatihan
Jika Anda hanya peduli pada tolok ukur dan harga, lewati subbagian ini. Bagian ini menjelaskan penuturan SpaceXAI tentang asal kenaikan tersebut.
SpaceXAI menjalankan pelatihan lebih banyak daripada yang dilakukan untuk Grok 4.5. Mereka menggunakan contoh penalaran buatan AI dan contoh rekayasa, menghapus contoh buruk dengan pemeriksaan berbasis model, lalu menggunakan reinforcement learning untuk pengodean, tugas perkantoran, pengembangan web, penalaan kernel, dan perancangan komputer. SpaceXAI juga mengatakan Grok 4.5 membuat contoh pelatihan baru di berbagai pengaturan penalaran dan subjek. Perusahaan mengaitkan kenaikan ini dengan lebih banyak pelatihan dan seleksi data yang lebih ketat, bukan arsitektur baru.
Tim luar tidak dapat memeriksa detail tersebut, dan SpaceXAI belum membagikan cukup informasi untuk mengulang pelatihannya. Ini adalah penuturan perusahaan tentang apa yang berubah, bukan hasil yang diverifikasi pihak lain.
Tolok Ukur Grok 4.6: Resmi dan Independen
Tabel peluncuran SpaceXAI menunjukkan di mana skor naik, tetapi skor kompetitor adalah "yang terbaik dari hasil yang dilaporkan sendiri atau tersedia publik." Satu tim tidak menjalankan setiap model di bawah pengaturan yang sama. Tingkat upaya penalaran disertakan di bawah karena memengaruhi skor.
|
Tolok ukur |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1.753 |
1.526 |
1.728 |
1.741 |
|
DeepSWE 1.1 |
65,9% |
54,0% |
73,0% |
70,0% |
|
Terminal-Bench 3.0 |
26,0% |
15,7% |
34,6% |
34,1% |
|
APEX-Agents |
57,5% |
47,1% |
56,7% |
59,2% |
|
CursorBench v3.2 |
69,9% |
66,7% |
67,2% |
70,5% |
Grok 4.6 meningkat dibanding Grok 4.5 di seluruh tabel. Kesenjangan terbesar Sol muncul pada DeepSWE dan Terminal-Bench, sementara Fable memimpin 3 baris. Bahkan tabel SpaceXAI sendiri tidak menunjuk satu pemenang.
Hasil tolok ukur independen
Artificial Analysis menjalankan Intelligence Index mereka sendiri untuk enam model dalam perbandingan ini. Hasilnya mendekati angka SpaceXAI, tetapi tidak sama persis.

Grok 4.6 versus lima rival frontier. Gambar oleh Penulis.
Bagan menempatkan Grok setara dengan Sol dalam kecerdasan, tetapi jauh lebih rendah pada harga campuran. Artificial Analysis menghitung harga tersebut dengan campuran 7:2:1 untuk input cache, input tidak di-cache, dan output. Biaya per tugas indeks yang diselesaikan menunjukkan celah yang sama: $0,84 untuk Grok, $1,23 untuk Sol, dan $2,34 untuk Opus 5.
Waktu menuju token jawaban pertama naik dari 14,62 detik pada Grok 4.5 menjadi 40,44 detik, sementara biaya per tugas meningkat dari $0,36 menjadi $0,84. Grok 4.6 menggunakan sekitar 20% lebih banyak token output pada uji yang sama, jadi daftar harga yang tidak berubah tidak berarti biaya tugas yang tidak berubah. Biaya per tugas selesai memberikan pandangan yang lebih baik daripada kartu harga API saja karena mencakup sebagian penalaran ekstra yang digunakan untuk menyelesaikan pekerjaan.
Dibandingkan dengan GPT-5.6 Sol dan Claude Sonnet 5, Grok 4.6 mengirim token jawaban pertamanya lebih cepat. Sol pada upaya maksimum membutuhkan 213,52 detik, dan Sonnet 5 membutuhkan 184,48, dibandingkan 40,44 pada Grok. Grok hanya terlihat lambat di samping model berlatensi rendah seperti Gemini 3.7 Flash.
Seberapa andal perbandingan tolok ukur ini?
Berguna untuk menemukan kekuatan relatif, tetapi bukan peringkat lintas-model yang andal. Upaya penalaran mengubah skor dan waktu respons: GPT-5.6 Sol mencetak 57 pada upaya tinggi dan 61 pada maksimum. Nama tolok ukur juga dapat merujuk pada versi berbeda, sehingga Terminal-Bench 3.0 milik xAI dan Terminal-Bench 2.1 milik Artificial Analysis tidak dapat dibandingkan.
Apa yang Berubah dari Grok 4.5?
Bagi pengguna Grok 4.5, keputusan bukan apakah 4.6 "lebih baik" secara abstrak. Yang penting apakah skor yang lebih tinggi menutupi profil latensi dan penggunaan token yang berbeda. Tabel menempatkan perubahan itu pada garis dasar yang sama.
|
Ukuran |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
Biaya per tugas indeks |
$0,36 |
$0,84 |
|
Waktu ke token jawaban pertama |
14,62d |
40,44d |
|
Harga input yang di-cache |
$0,30 / M |
$0,50 / M |
|
Token output yang digunakan untuk menjalankan indeks |
60M |
72M |
|
Harga input / output dasar |
$2 / $6 |
$2 / $6 (tidak berubah) |
Namun, "harga sama" hanya menggambarkan tarif daftar dasar. Satu perubahan lagi penting bagi pengguna Grok 4.5 yang ada: input yang di-cache naik 67%, dari $0,30 menjadi $0,50 per sejuta token. Tarif cache yang lebih tinggi itu menambah celah antara kartu harga dan biaya tugas yang selesai.
Grok 4.6 vs Pesaing
Setelah kita membahas perbandingan dengan pendahulunya, mari lihat bagaimana Grok 4.6 dibandingkan dengan model mutakhir lain dari OpenAI dan Anthropic.
Grok 4.6 vs GPT-5.6 Sol
Hasil seri pada indeks menyembunyikan perbedaan jelas. Sol unggul 7,1 poin atas Grok pada DeepSWE dan 8,6 poin pada Terminal-Bench, menjadikan pengodean yang banyak terminal sebagai kasus terkuatnya. Grok mencetak lebih tinggi pada tiga baris tugas lainnya.
Uji internal OpenAI memperluas hasil terminal itu ke penjelajahan web dan penggunaan komputer. Itu tetap bukti pilihan vendor alih-alih perbandingan terkontrol, tetapi mengarah ke arah yang sama: kasus terkuat Sol adalah pekerjaan yang bergantung pada terminal, browser, atau panggilan alat berulang.
OpenAI juga mempratinjau mode Ultrafast untuk Sol yang diklaim berjalan hingga 14 kali lebih cepat. Belum ada harga yang dipublikasikan, jadi belum termasuk dalam perbandingan biaya.
Grok 4.6 dimulai pada $2 input dan $6 output per sejuta token. Tarif standar Sol adalah $5 input dan $30 output, lima kali harga output Grok. Di atas 272.000 token, Sol menggandakan harga input dan menaikkan output menjadi $45.
Itu tidak membuat setiap tugas Grok lima kali lebih murah. Penggunaan token penalaran, hit cache, dan jumlah giliran tetap mengubah tagihan akhir. Keunggulan harga Grok paling jelas ketika penggunaan token dapat diprediksi. Untuk pekerjaan yang banyak terminal, skor tolok ukur Sol yang lebih tinggi mungkin lebih penting daripada selisih harga daftar.
Grok 4.6 vs. Claude Sonnet 5
Sonnet 5 dan Grok 4.6 sama-sama mulai pada $2 per sejuta token input, sehingga harganya mudah dibandingkan. Sonnet 5 memiliki jendela konteks 1 juta token secara default, dua kali Grok yang 500.000, tanpa tarif lebih tinggi untuk prompt panjang. Output berharga $10 per sejuta dibanding $6 milik Grok.
Dua hari sebelum Grok 4.6 diluncurkan, Anthropic menetapkan harga $2/$10 menjadi permanen dan membatalkan kenaikan yang direncanakan menjadi $3/$15. Ini penting saat membandingkan dengan lembar harga lama, termasuk milik kami yang lebih lama.
Pada indeks Artificial Analysis, Sonnet 5 mencetak 55 pada upaya maksimum, enam poin di bawah Grok 4.6. Ia menggunakan 300 juta token output untuk uji tersebut dibanding 72 juta milik Grok, menempatkan biaya per tugasnya pada $1,72. Tokenizer-nya menghasilkan kira-kira 30% lebih banyak token daripada Sonnet 4.6 untuk teks yang sama. Itu membuat perbandingan harga antara dua versi Sonnet tersebut lebih sulit. Sonnet 5 juga bukan model teratas Anthropic.
Grok 4.6 vs Claude Opus 5 dan Fable 5
Opus 5, pada $5 input dan $25 output, memimpin indeks di 63. Fable 5, pada $10 input dan $50 output, mencetak 62. Skor indeks Fable juga perlu dicatat. Artificial Analysis mencatat fallback keamanan pada beberapa prompt yang lebih sulit, sehingga skor mencerminkan model sebagaimana dapat digunakan orang, bukan versi tanpa batasan yang tidak ditawarkan Anthropic.
Pada tolok ukur AA-Briefcase milik Artificial Analysis untuk tugas agen panjang, Grok 4.6 selesai dalam sekitar 53 giliran dan menggunakan 0,5 miliar token input. Opus 5 membutuhkan sekitar 103 giliran dan 2 miliar token. Ini tidak menunjukkan bahwa Grok adalah model yang lebih kuat secara keseluruhan. Ini menunjukkan bahwa Grok menggunakan lebih sedikit langkah dan lebih sedikit token input pada set uji ini, sementara Claude memimpin pada uji lain yang dibahas di atas.
Harga Grok 4.6
Ambang 200.000 token pada prompt adalah bagian yang akan saya awasi: itu memindahkan setiap token dalam permintaan ke tingkat yang lebih tinggi. Tabel juga menyertakan biaya prioritas dan alat.
|
Item |
Tarif |
|
Token input, di bawah prompt 200K |
$2,00 / sejuta |
|
Input yang di-cache, di bawah prompt 200K |
$0,50 / sejuta |
|
Token output, di bawah prompt 200K |
$6,00 / sejuta |
|
Input / cache / output (di atas prompt 200K) |
$4,00 / $1,00 / $12,00 |
|
Pemrosesan cepat atau prioritas |
2x tarif standar |
|
Penelusuran web, penelusuran X, eksekusi kode |
$5 per 1.000 panggilan |
Biaya alat terpisah dari biaya token. Permintaan yang menelusuri web lalu menjalankan kode dapat menimbulkan kedua biaya alat sebelum teks akhir ditagih. Tidak ada nama model terpisah grok-4.6-fast . API langsung memiliki opsi prioritas yang ditagih 2x ketika respons mengonfirmasi penggunaan prioritas. Cursor menampilkan pilihan terpisah "Grok 4.6 (Fast)" dengan tarif 2x yang sama.

Grok 4.6 Fast dipilih di dalam Cursor. Gambar oleh Penulis.
Bagaimana Cara Mengakses Grok 4.6?
Grok 4.6 tersedia secara first-party melalui:
- API SpaceXAI
- Cursor
- Grok Build
- Gateway pihak ketiga (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Alat pengodean lain (GitHub Copilot, VS Code, JetBrains, Xcode, dan Eclipse)
Peluncuran mencakup paket Pro, Pro+, Max, Business, dan Enterprise. Admin Business dan Enterprise harus mengaktifkan model karena default-nya nonaktif. Grok 4.6 tidak didukung pada Batch API milik SpaceXAI, jadi tidak ada opsi batch dengan diskon.
Satu detail enterprise berada di luar ketersediaan model. Respons bersifat stateful secara default, dan SpaceXAI menyatakan riwayat disimpan selama 30 hari. Di bawah Zero Data Retention, tim tidak dapat menggunakan rantai respons tersimpan atau penyelesaian tertunda; xAI mengarahkan pada pemutaran ulang penalaran terenkripsi dan WebSocket Responses. Setiap respons menyertakan header yang menunjukkan apakah ZDR aktif.
Pekan Peluncuran Grok 4.6: Model, Copilot, dan Cursor
Yang menonjol bagi saya pekan itu adalah seberapa cepat peluncuran model dan kesepakatan distribusi berkumpul di sekitar Grok 4.6.

Pekan peluncuran Grok 4.6, di luar tolok ukur. Gambar oleh Penulis.
Grok Bot menetapkan nada sebelum peluncuran model. Agen cloud beta awal ini dibundel dengan SuperGrok Heavy seharga $300 per bulan atau Cursor Ultra seharga $200 per bulan alih-alih dijual terpisah, mengaitkan akses dengan paket premium. Grok 4.6 kemudian membawa fokus agen yang sama ke API, Cursor, dan Grok Build.
Peluncuran Gemini 3.7 Flash dari Google dan pratinjau GPT-5.6 Sol Ultrafast dari OpenAI membuat pekan itu lebih padat. Pada saat yang sama, peluncuran Copilot dan Cursor bergabung dengan SpaceX meluaskan distribusi Grok. Cursor melacak proses tersebut kembali ke kemitraannya dengan SpaceXAI awal tahun itu dan membingkai langkah tersebut seputar akses ke GPU SpaceX, bukan skor model. Postingannya menyatakan akses itu akan membantunya membangun model dengan biaya lebih rendah.
Pembacaan saya terhadap pekan itu: SpaceXAI ingin Grok berada di dalam alat yang sudah digunakan orang. Grok 4.5 dilatih bersama dengan Cursor, dan Grok 4.6 berpindah ke Copilot hampir seketika. Itu menjadikan distribusi mitra sebagai bagian dari rilis, bukan renungan belakangan.
Kapan Sebaiknya Menggunakan Grok 4.6?
Grok 4.6 cocok untuk pekerjaan di mana harga API dan tugas agen yang panjang lebih penting daripada latensi token pertama. Kecocokannya lebih lemah ketika skor terminal Sol yang lebih tinggi atau jendela konteks Sonnet 5 yang lebih besar lebih sesuai dengan tugas.
Grok 4.6 cocok ketika:
- Harga API adalah kendala utama. Ia menyalip Sol, Opus 5, dan Fable 5 pada harga daftar dan biaya per tugas
- Pekerjaan berjalan sebagai tugas agen panjang multi-langkah, di mana efisiensi gilirannya (lebih sedikit giliran dan token input daripada Opus 5 pada AA-Briefcase) membuahkan hasil
- Tugasnya adalah pekerjaan pengetahuan atau penalaran hukum, di mana ia memimpin tabel tolok ukur
- Latensi token pertama tidak penting. Awal yang lambat tidak berarti pada run panjang, tetapi memengaruhi pengalaman dalam chat interaktif
Mungkin ada alternatif yang lebih baik ketika:
- Pekerjaannya adalah pengodean yang banyak terminal → GPT-5.6 Sol (skor DeepSWE dan Terminal-Bench lebih tinggi)
- Tugas membutuhkan jendela konteks besar → Claude Sonnet 5 (konteks 1M, tanpa biaya tambahan prompt panjang)
- Anda menginginkan latensi terendah untuk penggunaan interaktif → Gemini 3.7 Flash
- Anda membeli murni berdasarkan kecerdasan puncak → Opus 5 (63) atau Fable 5 (62) memimpin indeks
Pemikiran Akhir tentang Grok 4.6
Grok 4.6 mendarat di tengah yang canggung. Ia naik lima poin indeks dan tetap di bawah Sol dan Opus 5 pada harga terdaftar, namun mulai lebih lambat dan berbiaya lebih tinggi per tugas terukur dibanding Grok 4.5. "Harga sama, model lebih baik" melewatkan setengah dari rilis.
Bagian yang masih ingin saya lihat adalah run multi-jam di mana basis kode, alat, dan instruksi terus berubah. Cursor dan GitHub Copilot kini menyediakan pengaturan itu. Jika tingkat koreksi dan kegagalan tetap rendah di sana, klaim pelatihan agen punya bukti di luar uji tetap; jika tidak, kenaikan lima poin tetap hanya itu.
Bagi pembaca yang membangun di atas xAI API, tutorial Grok 4 API kami membahas klien Python dan alur permintaan.
Grok 4.6 FAQs
Apakah Grok 4.6 menggantikan Grok 4.5?
Tidak secara resmi. SpaceXAI belum mengumumkan tanggal penghentian untuk Grok 4.5, dan model tersebut masih terdaftar di API maupun Cursor. Belum ada perpindahan paksa ke 4.6.
Bisakah saya self-host Grok 4.6?
Tidak. Seperti disebutkan di atas, tidak ada bobot terbuka dan tidak ada jumlah parameter yang dipublikasikan, sehingga tidak ada yang dapat diunduh dan dijalankan di perangkat keras Anda sendiri. Setiap jalur akses, termasuk API langsung, melalui infrastruktur SpaceXAI atau mitra yang menjualnya kembali.
Bagaimana GitHub Copilot menagihkan Grok 4.6?
Copilot mengonversi penggunaan Grok 4.6 menjadi GitHub AI Credits pada harga daftar penyedia, dengan satu sen setara satu kredit. Penyelesaian kode normal dan saran suntingan berikutnya tidak ditagih dalam AI Credits. Penggunaan model dalam chat atau tugas agen mengikuti aturan penggunaan Copilot.
Apakah Grok 4.6 tersedia di UE?
Ya, tetapi diproses di AS. Pengguna UE dapat mengakses Grok 4.6 (basis Grok 4.5 bersama telah lolos EU AI Act dan dibuka untuk pengguna UE pada Juli, dan 4.6 tersedia di Cursor di seluruh UE), tetapi tidak ada residensi data UE. Halaman model xAI hanya mencantumkan us-east-1 dan us-west-2, sehingga permintaan berjalan di AS. Konfirmasikan per permukaan (konsol API, Cursor, gateway) sebelum mengandalkannya.
Apakah Grok 4.6 berfungsi dengan residensi data AS milik Cursor?
Grok 4.6 kini tersedia di Cursor (memiliki halaman model sendiri), tetapi residensi data khusus AS adalah fitur Enterprise yang hanya mencakup model yang didukung dengan beberapa pengecualian. Jadi, pastikan 4.6 ada dalam daftar model yang didukung terkini milik Cursor sebelum mengandalkannya.
Saya seorang data engineer dan pembangun komunitas yang bekerja lintas pipeline data, cloud, dan perkakas AI sambil menulis tutorial praktis dan berdampak tinggi untuk DataCamp dan pengembang yang sedang berkembang.

