Program
Pada 26 Agustus 2026, Z.ai merilis GLM-5.3-Flash dan tim Qwen dari Alibaba membuka bobot Qwen3.8-Flash-Next. Keduanya adalah model mixture-of-experts (MoE) multisaluran asli berbobot terbuka, diposisikan sebagai kelas biaya Flash, bukan sekadar varian murah yang tertinggal.
Dulu, Flash berarti "yang ramping." Dua model ini adalah taruhan efisiensi lab untuk agen coding dan penyajian konteks panjang, dirilis dalam rentang 24 jam yang sama. Pasangan ini sengaja tidak sejenis: mereka tidak menerbitkan tolok ukur yang sama, dan hanya satu API pihak pertama yang sudah aktif hari ini.
Ringkasnya
- GLM-5.3-Flash memimpin tolok ukur coding dan penggunaan alat yang diterbitkan kedua lab.
- Pilih GLM-5.3-Flash jika Anda membutuhkan API aktif, bobot berlisensi MIT, dan jendela 1 juta token tanpa YaRN.
- Pilih Qwen3.8-Flash-Next jika Anda bisa self-host (bobotnya sudah bisa dijalankan dengan llama.cpp) atau jika Anda bisa menunggu API terkelola QwenCloud.
- Harga daftar berselisih beberapa sen; promo 50% GLM hingga 9 September 2026 adalah satu-satunya yang mengubah tagihan minggu ini.
Apa Itu GLM-5.3-Flash?
GLM-5.3-Flash adalah model multisaluran asli pertama Z.ai dalam seri GLM-5, dirilis pada 26 Agustus 2026 dengan total 320 miliar parameter dan 18 miliar yang aktif. Tulisan peluncuran Z.ai menyebut model ini mengungguli GLM-5.2 pada tolok ukur coding dan agen dengan harga sekitar sepersepuluhnya, serta meraih skor 57 pada Artificial Analysis Intelligence Index v4.1.1 dengan biaya $0,045 per tugas pada tingkat diskon.
Arsitekturnya adalah inti cerita produk: atensi hibrida linear dan jarang, Manifold-Constrained Hyper-Connections (mHC), korpus multisaluran 30 triliun token, dan 45 lapisan alih-alih 92 pada GLM-4.5. Z.ai menjalankannya secara anonim sebagai ox-alpha di OpenCode dan OpenRouter sebelum menamainya, disajikan di chip AI Tiongkok. Bobot tersedia di Hugging Face dengan lisensi MIT, lengkap dengan resep penyajian untuk SGLang, vLLM, dan TokenSpeed.
Baca detail selengkapnya di panduan GLM-5.3-Flash kami. Untuk generasi sebelumnya, lihat panduan GLM-5.2 dan tutorial kami tentang menjalankan GLM-5 secara lokal untuk coding agenik.
Apa Itu Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next adalah pratinjau bobot terbuka dari arsitektur yang direncanakan untuk Qwen4 oleh tim Qwen Alibaba pada 26 Agustus 2026. Model utamanya memiliki 125 miliar parameter, ditambah tabel embedding n-gram 51 miliar parameter, dengan 6 miliar parameter aktif per token. Konteks asli adalah 262.144 token, dapat diperluas hingga 1.000.000 dengan YaRN. Qwen menyatakan biaya pelatihan sekitar sepersembilan Qwen3.7-Plus.
SKU produksi adalah Qwen3.8-Flash di QwenCloud, tercantum $0,16 per 1 juta token masukan dan $0,47 per 1 juta token keluaran, dengan API bertanda segera hadir. ID model cloud adalah qwen3.8-flash. Kami sudah menulis panduan Qwen3.8-Flash-Next terpisah dan tutorial penyiapan tentang cara menjalankan Qwen3.8-Flash-Next sebagai agen coding lokal dengan OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: Perbandingan Head-to-Head

Pada tolok ukur yang diterbitkan kedua lab, GLM-5.3-Flash unggul, sesuai harapan karena ukurannya lebih besar. Harga keduanya sangat mirip.
| Fitur | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / tanggal | Z.ai, 26 Agustus 2026 | Qwen (Alibaba), 26 Agustus 2026 |
| Ukuran | 320B total, 18B aktif | 125B utama + 51B n-gram, 6B aktif |
| Konteks | 1M token asli | 262.144 asli; 1.000.000 dengan YaRN |
| Modalitas | Multisaluran asli (teks, gambar, video masuk) | MoE multisaluran asli |
| Bobot | MIT, zai-org/GLM-5.3-Flash |
Bobot terbuka, Qwen/Qwen3.8-Flash-Next |
| Tolok ukur coding bersama | Memimpin DeepSWE, Toolathlon, NL2Repo | Tertinggal pada ketiganya; menerbitkan SWE-bench Pro 62,5 |
| Tolok ukur agen perkantoran | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Harga daftar API (per 1M) | $0,15 masuk / $0,50 keluar | $0,16 masuk / $0,47 keluar (Qwen3.8-Flash) |
| API pihak pertama | Aktif, glm-5.3-flash |
Dalam antrean, qwen3.8-flash |
Workflow coding dan agenik
GLM-5.3-Flash memimpin skor coding dan penggunaan alat yang kedua vendor tampilkan berdampingan. Tabel Z.ai tanggal 26 Agustus mencantumkan DeepSWE v1.1 di 63,4, Toolathlon Verified di 78,4, dan NL2Repo di 56,3. Tabel Qwen mencantumkan 58,7, 73,5, dan 48,1 untuk nama yang sama.
Selain itu, perbandingan sulit karena pilihan tolok ukur berbeda. Qwen menerbitkan SWE-bench Pro di 62,5 dan SWE-bench Multilingual di 81,0. Z.ai menerbitkan Terminal Bench 2.1 di 84,3 dan AutomationBench di 48,8, plus hasil internal Z.ai Code Bench v1.0 sebesar 29,0 pada upaya maksimum melawan 29,5 milik Claude Opus 4,8, dijalankan di Claude Code 2.1.207.
| Tolok ukur | GLM-5.3-Flash | Qwen3.8-Flash-Next | Catatan |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Tabel vendor; GLM memakai mini-swe-agent, Qwen melaporkan nilai tertinggi antara Claude Code dan mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM merata-ratakan 3 run |
| NL2Repo | 56,3 | 48,1 | Qwen memberi label NL2Repo-Bench |
| SWE-bench Pro | Tidak diterbitkan | 62,5 | Qwen menjalankan ulang baseline di Claude Code |
| Terminal Bench 2.1 | 84,3 | Tidak diterbitkan | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (skor 51,2) | Format pelaporan berbeda |
Saya akan menganggap GLM sebagai agen coding kelas Flash yang lebih kuat pada set yang tumpang tindih, dan menolak menobatkan pemenang SWE-bench tanpa skor terbitan Z.ai.
Pekerjaan perkantoran dan agen horizon panjang
Qwen adalah lab yang menerbitkan skor pekerjaan perkantoran horizon panjang. CoWorkBench 73,9 dan JobBench 55,7, jauh di depan Qwen3.7-Plus (65,1 dan 27,6) dan Claude Opus 4,6 Max pada baris tersebut (68,2 dan 36,6).
Angka "kerja" Z.ai yang tumpang tindih adalah AutomationBench 48,8 dan OfficeQA Pro 62,4, plus ZCode Browser Use dan Computer Use untuk pekerjaan desktop visual.
Itu bukan tes yang sama, jadi tidak menetapkan pemenang. Jika model mental pekerjaan Anda adalah agen perkantoran multi-jam, Qwen memberi Anda tolok ukurnya. Jika itu otomasi ala Zapier atau QA dokumen PDF, GLM yang menyediakannya.
Arsitektur dan biaya penyajian
Qwen3.8-Flash-Next mengaktifkan 6 miliar parameter per token. GLM-5.3-Flash mengaktifkan 18 miliar. Kesenjangan 3x itu adalah fakta perangkat keras paling bersih dalam pasangan ini, dan alasan diskusi penyajian lokal sering berlabuh pada Qwen. Dalam praktiknya, GGUF UD-Q4_K_XL (~111GB) berjalan pada satu kartu 96GB dengan RAM offload — kami mencobanya di sini.
Keduanya menggunakan atensi hibrida. Z.ai menyebut GLM-5.3-Flash memangkas komputasi atensi 3,0x dan ukuran cache KV 4,4x dibanding GLM-5.3. Qwen menyebut kernel atensi QSA hingga 7,6x lebih cepat pada prefill dan 4,9x pada decode di 1M token, serta throughput prefill 8,6x Qwen3.7-Plus pada tingkat hit prefix-cache 90%.
Trik kapasitas ekstra ala 51B milik GLM bukan tabel embedding; tabel n-gram 51B Qwen dirancang untuk tinggal di RAM host dan prefetch. Resep berbeda, janji sama: lebih banyak kapabilitas per watt.
Kemampuan multisaluran dan konteks
Kedua model menerima gambar pada generasi yang sama dengan teks. GLM-5.3-Flash secara eksplisit adalah anggota multisaluran asli pertama GLM-5, dilatih pada korpus multisaluran 30 triliun token, dengan baris visi yang mendukung video (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next menerbitkan AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5, dan CharXiv 84,6 tanpa alat penggunaan komputer / 90,6 bila memakai alat tersebut.
Ukuran jendela konteks cukup berdekatan sehingga saya tidak akan memilih semata-mata karenanya. GLM mengiklankan jendela 1M token asli. Qwen asli di 262.144 dan merentang ke 1.000.000 dengan YaRN. Ulasan dalam catatan riset masih memperlakukan 1M milik GLM sebagai yang baru diuji ringan di produksi.
Harga: berapa yang benar-benar Anda bayar

Selain tarif promo, Anda hampir tidak bisa membedakan harga kedua model. Qwen dan Z.ai jelas membidik tingkat yang sama.
Tarif token berdampingan
| Tarif | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Masukan, per 1M token | $0,15 ($0,075 promo) | $0,16 |
| Keluaran, per 1M token | $0,50 ($0,25 promo) | $0,47 |
| Masukan cache, per 1M token | $0,03 ($0,015 promo) | $0,016 |
| Keluaran cache, per 1M token | Gratis selama promo | $0,20 |
| Promo peluncuran | Diskon 50% hingga 9 September 2026, 24.00 UTC+8 | Tidak diumumkan |
| Kuota Coding Plan | 3x GLM-5.3 di semua tingkat paket | Tidak diumumkan |
Bentuknya nyaris datar. Keluaran Qwen yang sedikit lebih murah membantu bulan yang berat generasi; masukan GLM yang sedikit lebih murah membantu pengambilan. Z.ai menagih token berpikir pada tarif keluaran. Qwen mendokumentasikan enable_thinking dan reasoning_effort di QwenCloud tanpa harga token berpikir terpisah, jadi perlakukan penalaran sebagai keluaran sampai ada keterangan lain.
Kedua lab menerbitkan tarif cache, dan mereka memberi harga pertukarannya secara berbeda. Z.ai mencantumkan masukan cache di $0,03 per 1M token ($0,015 saat promo) dan membuat penulisan cache gratis selama jendela promo. Qwen membaca cache di $0,016 namun mengenakan $0,20 per 1M token untuk membuat cache eksplisit.
Jadi Qwen memangkas separuh tarif baca cache Anda, dan GLM menggratiskan penulisan. Jika prefiks Anda stabil dan berumur panjang, tarif baca Qwen menang; jika Anda sering menulis ulang cache, penulisan gratis GLM yang unggul, setidaknya hingga 9 September.
Biaya beban kerja nyata
Rumus: (volume ÷ 1M) × tarif, dijumlahkan untuk masukan dan keluaran, pada harga daftar standar. Nominal promo tidak dimasukkan tabel.
| Beban kerja | GLM-5.3-Flash | Qwen3.8-Flash | Selisih |
|---|---|---|---|
| Asisten seimbang: 1M masuk / 250K keluar | $0,28 | $0,28 | $0,00 (0%) |
| Berat generasi: 1M masuk / 4M keluar | $2,15 | $2,04 | Qwen lebih murah $0,11 (5%) |
| Pengambilan, sub-ambang: 10M masuk / 1M keluar | $2,00 | $2,07 | GLM lebih murah $0,07 (3%) |
Biaya daftar API pada dasarnya imbang. Keputusan bergantung pada kecocokan beban kerja dan apakah endpoint tersedia. Kedua model memakai tokenizer spesifik vendor, dan tidak ada hitungan token untuk beban kerja bersama yang diterbitkan, jadi perlakukan total ini sebagai perbandingan tarif, bukan tagihan. Hingga 9 September 2026, promo GLM memangkas separuh total kolom GLM tersebut ($0,14, $1,08, $1,00).
Kapan Memilih GLM-5.3-Flash vs Qwen3.8-Flash-Next

Jika Anda perlu memanggil API pihak pertama minggu ini, GLM-5.3-Flash adalah satu-satunya produk lengkap di pasangan ini. Jika Anda mengevaluasi arsitektur Qwen4, atau Anda peduli pada CoWorkBench dan JobBench, mulai sekarang dengan bobot Qwen3.8-Flash-Next dan tambahkan qwen3.8-flash saat tersedia di QwenCloud.
Pilih GLM-5.3-Flash jika...
-
Anda membutuhkan
glm-5.3-flashdi Z.ai, atauz-ai/glm-5.3-flashdi OpenRouter, tanpa menunggu SKU cloud yang masih antre. -
Set evaluasi Anda mirip DeepSWE, Toolathlon, NL2Repo, atau Terminal Bench 2.1, dan Anda menginginkan lab yang menerbitkan skor tumpang tindih yang lebih tinggi.
-
Anda menginginkan bobot MIT dan jendela 1M token asli, dan Anda tidak masalah mengaktifkan 18B parameter.
-
Anda sudah memakai GLM Coding Plan dan bisa memanfaatkan kuota 3x dibanding GLM-5.3, termasuk promo hingga 9 September 2026.
- Anda menginginkan agen desktop visual. ZCode Browser Use dan Computer Use ada di posting peluncuran, dan angka tandingan Qwen adalah OSWorld 2.0 sebesar 19,4, yang bukan piala.
Pilih Qwen3.8-Flash-Next jika...
-
Anda membeli pratinjau Qwen4, bukan API terkelola yang sudah jadi. Bobot adalah produknya saat ini.
-
Tolok ukur agen perkantoran adalah yang benar-benar Anda perhatikan. CoWorkBench dan JobBench adalah cerita yang diterbitkan Qwen, bukan GLM.
-
Anda menginginkan 6B parameter aktif dan tabel n-gram yang bisa berada di memori host, termasuk berdampingan dengan setup lokal Qwen3.8-27B.
-
Anda sudah memakai Qwen Chat, Qwen Studio, Qwen Code, atau mengarahkan agen kompatibel OpenAI mana pun (OpenCode, Codex, Qwen Code) ke endpoint llama.cpp lokal hari ini. Claude Code butuh proksi penerjemah.
Cara Memulai dengan GLM-5.3-Flash dan Qwen3.8-Flash-Next
| Permukaan | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Aplikasi konsumen | Playground web Z.ai dan GLM Coding Plan | Qwen Chat dan Qwen Studio |
| API pihak pertama | Ya, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API segera hadir) |
| Platform cloud | Tidak tersedia di Bedrock, Vertex AI, atau Azure AI Foundry | Tidak tersedia di Bedrock, Vertex AI, atau Azure AI Foundry |
| Agen coding | ZCode; OpenRouter ke IDE yang menerima penyedia kustom. Belum native di Claude Code, GitHub Copilot, atau Cursor | Bekerja hari ini via llama.cpp lokal + OpenCode; kabel yang sama berlaku ke QwenCloud saat aktif. Belum native di Claude Code, GitHub Copilot, atau Cursor |
| Router pihak ketiga | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID model API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash di QwenCloud dan OpenRouter; bobot Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash bisa dipanggil sekarang. Qwen3.8-Flash-Next juga bisa, hanya saja di hardware Anda sendiri atau lewat router seperti OpenRouter. Endpoint API milik Qwen seharusnya segera menyusul.
Ketik ID tersebut persis. ID Qwen3.8-Flash-Next adalah qwen3.8-flash (tanpa "next"), jadi jangan mengada-ada ID cloud qwen3.8-flash-next dari nama bobot.
Melakukan panggilan API pertama Anda
Kedua model memakai format chat completions OpenAI, jadi Anda bisa memakai klien standar. Cara tercepat untuk mencoba berdampingan adalah OpenRouter, di mana keduanya berada di belakang satu base URL, dan string model adalah satu-satunya yang Anda ubah.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Memakai pihak pertama mengorbankan portabilitas. Endpoint Z.ai berada di docs.z.ai dan menerima thinking: {"type": "enabled"} dengan reasoning_effort diatur ke low, high, atau max. Milik Alibaba memakai enable_thinking dengan reasoning_effort bawaan xhigh, dengan base URL DashScope (internasional, Beijing, atau Virginia). SDK-nya sama, tetapi kenop penalaran tidak portabel, jadi siapkan adaptor kecil jika Anda berencana berpindah.
Untuk panduan Qwen lengkap, baca tutorial kami tentang menjalankan Qwen3.8-Flash-Next secara lokal dan tutorial Qwen Code CLI. Untuk penyajian lokal keluarga GLM, gunakan Jalankan GLM-5 Secara Lokal untuk Coding Agenik. Jika Anda sudah memakai mesin Qwen3.8-27B, setup RTX 5090 kami adalah jalur lokal saudaranya, bukan pratinjau 125B ini.
Pikiran Akhir
Jika Anda perlu mengirim melawan API Flash aktif minggu ini, gunakan GLM-5.3-Flash. Jika Anda mempelajari Qwen4 atau Anda lebih percaya CoWorkBench ketimbang DeepSWE, gunakan bobot Qwen3.8-Flash-Next secara lokal dan beralih ke qwen3.8-flash via API saat dirilis.
Yang paling menarik bagi saya adalah betapa kecilnya perbedaan harga daftar. Perdebatan adalah soal akses dan baris yang belum diterbitkan mana yang Anda siap abaikan, bukan tebing biaya 2x.
Jika Anda ingin memahami konsep di balik kedua MoE, saya merekomendasikan kursus Large Language Models (LLMs) Concepts, lalu jalur AI Agent Fundamentals. Untuk kerja hub-dan-bobot, Working with Hugging Face adalah langkah praktis berikutnya.
FAQ
Kapan saya harus memakai GLM-5.3-Flash dibanding Qwen3.8-Flash-Next?
Gunakan GLM-5.3-Flash saat Anda membutuhkan API pihak pertama yang aktif minggu ini, bobot berlisensi MIT, atau skor coding tumpang tindih yang lebih tinggi (DeepSWE v1.1 63,4; Toolathlon Verified 78,4; NL2Repo 56,3).
Gunakan Qwen3.8-Flash-Next saat Anda ingin menjalankan pratinjau arsitektur Qwen4 secara lokal, memiliki 6B parameter aktif yang lebih efisien, atau ingin memakai model dalam setup agen perkantoran (CoWorkBench 73,9; JobBench 55,7).
Di mana saya bisa mengakses GLM-5.3-Flash dan Qwen3.8-Flash-Next?
GLM-5.3-Flash aktif di Z.ai sebagai glm-5.3-flash, di GLM Coding Plan, dan di OpenRouter sebagai z-ai/glm-5.3-flash. Bobot tersedia di Hugging Face dengan lisensi MIT.
Bobot Qwen3.8-Flash-Next tersedia di Hugging Face dan ModelScope. API produksi adalah Qwen3.8-Flash di QwenCloud sebagai qwen3.8-flash, bertanda segera hadir, tetapi Anda sudah bisa mengakses model via OpenRouter. Qwen Chat dan Qwen Studio adalah permukaan konsumen.
Bagaimana perbandingan GLM-5.3-Flash dan Qwen3.8-Flash-Next pada coding?
Pada tolok ukur coding yang diterbitkan kedua lab, GLM-5.3-Flash memimpin: DeepSWE v1.1 63,4 vs 58,7; Toolathlon Verified 78,4 vs 73,5; dan NL2Repo 56,3 vs 48,1. Harness tidak identik.
Apa ID model API untuk GLM-5.3-Flash dan Qwen3.8-Flash-Next?
GLM-5.3-Flash adalah glm-5.3-flash di Z.ai dan z-ai/glm-5.3-flash di OpenRouter.
ID produksi QwenCloud adalah qwen3.8-flash, bukan ID cloud qwen3.8-flash-next. Bobot terbuka adalah Qwen/Qwen3.8-Flash-Next.
Apakah Qwen3.8-Flash-Next sama dengan Qwen3.8-Flash?
Tidak. Qwen3.8-Flash-Next adalah pratinjau arsitektur berbobot terbuka. Qwen3.8-Flash adalah SKU produksi di QwenCloud, tercantum $0,16 / $0,47 per 1M token, dengan konteks bawaan 1M dan alat bawaan resmi. API bertanda segera hadir pada 26 Agustus 2026.
Tom adalah seorang ilmuwan data dan pendidik teknis. Ia menulis dan mengelola tutorial serta artikel blog ilmu data DataCamp. Sebelumnya, Tom bekerja di bidang ilmu data di Deutsche Telekom.

