Tracks
Ngày 26 tháng 8 năm 2026, Z.ai ra mắt GLM-5.3-Flash và đội Qwen của Alibaba mở trọng số của Qwen3.8-Flash-Next. Cả hai đều là mô hình Mixture-of-Experts (MoE) đa phương thức gốc với trọng số mở, được định vị ở phân khúc chi phí kiểu Flash, không phải “phiên bản rút gọn giá rẻ”.
Trước đây Flash có nghĩa là “mảnh mai.” Hai mô hình này là canh bạc hiệu năng của các phòng lab cho tác vụ lập trình và phục vụ ngữ cảnh dài, được phát hành trong cùng 24 giờ. Cặp đôi này được đặt cạnh nhau một cách có chủ ý: họ không công bố cùng một bộ benchmark, và chỉ có một API do chính hãng vận hành đang hoạt động hôm nay.
Tóm tắt nhanh
- GLM-5.3-Flash dẫn đầu các benchmark lập trình và sử dụng công cụ mà cả hai phòng lab đều công bố.
- Chọn GLM-5.3-Flash khi bạn cần API đang hoạt động, trọng số theo giấy phép MIT và cửa sổ 1 triệu token mà không cần YaRN.
- Chọn Qwen3.8-Flash-Next nếu bạn có thể tự triển khai (trọng số chạy được với llama.cpp ngay hôm nay) hoặc có thể chờ API QwenCloud quản lý.
- Giá niêm yết chênh nhau vài cent; khuyến mãi 50% của GLM đến hết ngày 9/9/2026 là mức giá duy nhất có thể làm hóa đơn tuần này thay đổi đáng kể.
GLM-5.3-Flash là gì?
GLM-5.3-Flash là mô hình đa phương thức gốc đầu tiên trong dòng GLM-5 của Z.ai, phát hành ngày 26/8/2026 với tổng 320 tỷ tham số và 18 tỷ tham số kích hoạt. Bài ra mắt của Z.ai cho biết mô hình vượt GLM-5.2 ở benchmark lập trình và tác tử với chi phí khoảng một phần mười, và đạt 57 điểm trên Artificial Analysis Intelligence Index v4.1.1 ở mức $0,045 mỗi tác vụ theo bậc giá giảm.
Kiến trúc mới là trọng tâm sản phẩm: kết hợp attention tuyến tính và thưa, Manifold-Constrained Hyper-Connections (mHC), kho dữ liệu đa phương thức 30 nghìn tỷ token, và 45 tầng thay vì 92 tầng của GLM-4.5. Z.ai đã vận hành ẩn danh mô hình này dưới tên ox-alpha trên OpenCode và OpenRouter trước khi đặt tên chính thức, chạy trên chip AI Trung Quốc. Trọng số có trên Hugging Face theo giấy phép MIT, kèm công thức phục vụ cho SGLang, vLLM và TokenSpeed.
Đọc thêm chi tiết trong hướng dẫn GLM-5.3-Flash riêng. Với thế hệ trước, xem hướng dẫn GLM-5.2 và bài thực hành chạy GLM-5 tại chỗ cho lập trình tác tử.
Qwen3.8-Flash-Next là gì?
Qwen3.8-Flash-Next là bản xem trước trọng số mở ngày 26/8/2026 của đội Qwen (Alibaba) về kiến trúc dự kiến cho Qwen4. Mô hình chính có 125 tỷ tham số, cộng bảng nhúng n-gram 51 tỷ tham số, với 6 tỷ tham số kích hoạt mỗi token. Ngữ cảnh gốc là 262.144 token, mở rộng đến 1.000.000 với YaRN. Qwen cho biết chi phí huấn luyện khoảng bằng một phần chín Qwen3.7-Plus.
SKU sản phẩm là Qwen3.8-Flash trên QwenCloud, niêm yết $0,16 mỗi 1M token đầu vào và $0,47 mỗi 1M token đầu ra, API ghi chú sẽ sớm ra mắt. ID mô hình đám mây là qwen3.8-flash. Chúng tôi đã có hướng dẫn Qwen3.8-Flash-Next riêng và bài thiết lập chạy Qwen3.8-Flash-Next tại chỗ như một tác tử lập trình với OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: So sánh trực diện

Ở các benchmark mà cả hai phòng lab đều công bố, GLM-5.3-Flash dẫn trước, điều dễ hiểu vì đây là mô hình lớn hơn trong hai mô hình. Giá của cả hai rất sát nhau.
| Tính năng | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Phòng lab / ngày | Z.ai, 26/8/2026 | Qwen (Alibaba), 26/8/2026 |
| Kích thước | 320B tổng, 18B kích hoạt | 125B chính + 51B n-gram, 6B kích hoạt |
| Ngữ cảnh | 1M token gốc | 262.144 gốc; 1.000.000 với YaRN |
| Đa phương thức | Đa phương thức gốc (văn bản, hình ảnh, video đầu vào) | MoE đa phương thức gốc |
| Trọng số | MIT, zai-org/GLM-5.3-Flash |
Trọng số mở, Qwen/Qwen3.8-Flash-Next |
| Benchmark lập trình chung | Dẫn DeepSWE, Toolathlon, NL2Repo | Theo sau ở ba mục đó; công bố SWE-bench Pro 62,5 |
| Benchmark tác vụ văn phòng | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Giá API niêm yết (mỗi 1M) | $0,15 vào / $0,50 ra | $0,16 vào / $0,47 ra (Qwen3.8-Flash) |
| API chính hãng | Đang hoạt động, glm-5.3-flash |
Đang chờ, qwen3.8-flash |
Quy trình lập trình và tác tử
GLM-5.3-Flash dẫn các điểm lập trình và sử dụng công cụ mà cả hai hãng đều đặt cùng một hàng. Bảng ngày 26/8 của Z.ai liệt kê DeepSWE v1.1 ở 63,4; Toolathlon Verified 78,4; và NL2Repo 56,3. Bảng của Qwen cho các mục đó lần lượt là 58,7; 73,5; và 48,1.
Ngoài các mục này, so sánh trở nên khó vì mỗi bên chọn bộ benchmark khác nhau. Qwen công bố SWE-bench Pro 62,5 và SWE-bench Multilingual 81,0. Z.ai công bố Terminal Bench 2.1 đạt 84,3 và AutomationBench 48,8, cùng kết quả nội bộ Z.ai Code Bench v1.0 đạt 29,0 ở mức nỗ lực tối đa so với 29,5 của Claude Opus 4.8, chạy trong Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Ghi chú |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Bảng của nhà cung cấp; GLM dùng mini-swe-agent, Qwen báo cáo giá trị cao hơn giữa Claude Code và mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM lấy trung bình 3 lần chạy |
| NL2Repo | 56,3 | 48,1 | Qwen gắn nhãn NL2Repo-Bench |
| SWE-bench Pro | Không công bố | 62,5 | Qwen chạy lại baseline trong Claude Code |
| Terminal Bench 2.1 | 84,3 | Không công bố | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (điểm 51,2) | Định dạng báo cáo khác nhau |
Tôi sẽ xem GLM là tác tử lập trình Flash mạnh hơn trên tập benchmark giao nhau, và sẽ không vội chọn người thắng ở SWE-bench khi Z.ai chưa công bố điểm.
Công việc văn phòng và tác tử dài hạn
Qwen là phòng lab công bố điểm cho các tác vụ văn phòng dài hạn. CoWorkBench đạt 73,9 và JobBench 55,7, đều vượt xa Qwen3.7-Plus (65,1 và 27,6) và Claude Opus 4.6 Max ở các hàng đó (68,2 và 36,6).
Các con số “công việc” giao nhau của Z.ai là AutomationBench 48,8 và OfficeQA Pro 62,4, cùng ZCode Browser Use và Computer Use cho tác vụ desktop thị giác.
Đây không phải cùng bài test, nên không phân thắng bại. Nếu bạn hình dung công việc là tác tử văn phòng trong nhiều giờ, Qwen đã đưa benchmark. Nếu là tự động hóa kiểu Zapier hoặc QA tài liệu PDF, GLM đưa các bài đó.
Kiến trúc và chi phí phục vụ
Qwen3.8-Flash-Next kích hoạt 6 tỷ tham số mỗi token. GLM-5.3-Flash kích hoạt 18 tỷ. Chênh lệch 3x là thực tế phần cứng rõ ràng nhất, và đó là lý do các cuộc thảo luận phục vụ tại chỗ thường nghiêng về Qwen. Trong thực tế, GGUF UD-Q4_K_XL (~111GB) chạy trên một card 96GB với offload RAM — chúng tôi đã chạy được.
Cả hai dùng attention lai. Z.ai nói GLM-5.3-Flash giảm 3,0x tính toán attention và 4,4x kích thước bộ nhớ đệm KV so với GLM-5.3. Qwen nói kernel attention QSA nhanh hơn tối đa 7,6x ở prefill và 4,9x ở decode tại 1M token, và thông lượng prefill cao hơn 8,6x so với Qwen3.7-Plus khi tỉ lệ trúng prefix-cache là 90%.
Mẹo tăng dung lượng kiểu 51B của GLM không phải bảng nhúng; bảng n-gram 51B của Qwen được thiết kế để nằm trong RAM máy chủ và prefetch. Công thức khác nhau, cùng lời hứa: nhiều năng lực hơn trên mỗi watt.
Năng lực đa phương thức và ngữ cảnh
Cả hai mô hình đều nhận hình ảnh trong cùng thế hệ với văn bản. GLM-5.3-Flash là thành viên đa phương thức gốc đầu tiên của GLM-5, huấn luyện trên kho đa phương thức 30 nghìn tỷ token, với các hàng đánh giá thị giác hỗ trợ video (MVBench 77,8; MMVU 80,5).
Qwen3.8-Flash-Next công bố AndroidWorld 84,5; LVBench 76,6; RealWorldQA 88,5; và CharXiv 84,6 không dùng công cụ sử dụng máy tính / 90,6 khi có công cụ.
Kích thước cửa sổ ngữ cảnh đủ gần để không nên chọn chỉ vì tiêu chí này. GLM quảng bá cửa sổ gốc 1M token. Qwen gốc ở 262.144 và kéo giãn đến 1.000.000 với YaRN. Các ghi chú nghiên cứu vẫn xem 1M của GLM là mới được kiểm thử nhẹ trong sản xuất.
Giá: bạn thực sự trả bao nhiêu

Bỏ qua khuyến mãi, gần như không thể phân biệt giá của hai mô hình. Qwen và Z.ai rõ ràng nhắm tới cùng một nấc giá.
Giá token cạnh nhau
| Mức giá | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Đầu vào, mỗi 1M token | $0,15 ($0,075 khuyến mãi) | $0,16 |
| Đầu ra, mỗi 1M token | $0,50 ($0,25 khuyến mãi) | $0,47 |
| Đầu vào được cache, mỗi 1M token | $0,03 ($0,015 khuyến mãi) | $0,016 |
| Đầu ra được cache, mỗi 1M token | Miễn phí trong thời gian khuyến mãi | $0,20 |
| Khuyến mãi ra mắt | Giảm 50% đến 24:00, 9/9/2026 (UTC+8) | Chưa công bố |
| Hạn ngạch gói Coding | Gấp 3 lần GLM-5.3 trên mọi bậc gói | Chưa công bố |
Đường giá gần như phẳng. Đầu ra hơi rẻ hơn của Qwen có lợi cho tháng nặng sinh văn bản; đầu vào hơi rẻ hơn của GLM có lợi cho truy xuất. Z.ai tính token tư duy theo mức đầu ra. Qwen có tài liệu enable_thinking và reasoning_effort trên QwenCloud mà không có mức giá token tư duy riêng, nên tạm coi suy luận là đầu ra cho đến khi có thông báo khác.
Cả hai công bố giá cache, nhưng cách định giá khác nhau. Z.ai tính đọc cache đầu vào $0,03/1M token ($0,015 trong khuyến mãi) và miễn phí ghi cache trong thời gian khuyến mãi. Qwen đọc cache $0,016 nhưng tính $0,20/1M token để tạo cache rõ ràng.
Vậy Qwen giảm một nửa chi phí đọc cache, còn GLM miễn phí khâu ghi. Nếu tiền tố của bạn ổn định và sống lâu, mức đọc của Qwen thắng; nếu bạn ghi lại cache thường xuyên, miễn phí ghi của GLM thắng, ít nhất đến ngày 9/9.
Chi phí một khối lượng công việc thực
Công thức: (khối lượng ÷ 1M) × mức giá, cộng cả đầu vào và đầu ra, theo giá niêm yết tiêu chuẩn. Không tính tiền khuyến mãi vào bảng.
| Khối lượng công việc | GLM-5.3-Flash | Qwen3.8-Flash | Chênh lệch |
|---|---|---|---|
| Trợ lý cân bằng: 1M vào / 250K ra | $0,28 | $0,28 | $0,00 (0%) |
| Nặng sinh văn bản: 1M vào / 4M ra | $2,15 | $2,04 | Qwen rẻ hơn $0,11 (5%) |
| Truy xuất, dưới ngưỡng: 10M vào / 1M ra | $2,00 | $2,07 | GLM rẻ hơn $0,07 (3%) |
Chi phí API theo giá niêm yết là ngang nhau. Quyết định phụ thuộc vào phù hợp khối lượng công việc và việc endpoint có tồn tại hay không. Cả hai dùng tokenizer riêng của nhà cung cấp, và không bên nào công bố số token cho cùng một khối lượng công việc, nên coi tổng này như so sánh mức giá hơn là hóa đơn thực. Đến ngày 9/9/2026, khuyến mãi của GLM giảm một nửa các cột GLM ($0,14; $1,08; $1,00).
Khi nào nên chọn GLM-5.3-Flash và khi nào chọn Qwen3.8-Flash-Next

Nếu bạn cần gọi API chính hãng trong tuần này, GLM-5.3-Flash là sản phẩm hoàn chỉnh duy nhất trong cặp đôi. Nếu bạn đang đánh giá kiến trúc Qwen4, hoặc quan tâm đến CoWorkBench và JobBench, hãy bắt đầu với trọng số Qwen3.8-Flash-Next ngay bây giờ và thêm qwen3.8-flash khi có trên QwenCloud.
Chọn GLM-5.3-Flash nếu...
-
Bạn cần
glm-5.3-flashtrên Z.ai, hoặcz-ai/glm-5.3-flashtrên OpenRouter, mà không phải chờ SKU đám mây trong hàng đợi. -
Bộ đánh giá của bạn giống DeepSWE, Toolathlon, NL2Repo, hoặc Terminal Bench 2.1, và bạn muốn phòng lab có điểm cao hơn ở các bài giao nhau.
-
Bạn muốn trọng số MIT và cửa sổ gốc 1M token, và chấp nhận kích hoạt 18B tham số.
-
Bạn đã dùng GLM Coding Plan và có thể tận dụng hạn ngạch gấp 3 lần so với GLM-5.3, bao gồm khuyến mãi đến ngày 9/9/2026.
- Bạn muốn tác tử desktop thị giác. Browser Use và Computer Use của ZCode có trong bài ra mắt, và con số đối ứng của Qwen là OSWorld 2.0 ở 19,4—không phải thành tích ấn tượng.
Chọn Qwen3.8-Flash-Next nếu...
-
Bạn đang mua bản xem trước Qwen4, không phải API quản lý hoàn chỉnh. Trọng số chính là sản phẩm hôm nay.
-
Các benchmark tác tử văn phòng là những gì bạn thực sự quan tâm. CoWorkBench và JobBench là câu chuyện Qwen công bố, không phải GLM.
-
Bạn muốn 6B tham số kích hoạt và bảng n-gram có thể nằm trong bộ nhớ máy chủ, bao gồm cạnh một thiết lập Qwen3.8-27B tại chỗ.
-
Bạn đã quen dùng Qwen Chat, Qwen Studio, Qwen Code, hoặc trỏ bất kỳ tác tử tương thích OpenAI (OpenCode, Codex, Qwen Code) tới endpoint llama.cpp tại chỗ ngay hôm nay. Claude Code cần một proxy chuyển đổi.
Bắt đầu với GLM-5.3-Flash và Qwen3.8-Flash-Next
| Bề mặt sử dụng | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Ứng dụng người dùng | Web playground của Z.ai và GLM Coding Plan | Qwen Chat và Qwen Studio |
| API chính hãng | Có, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API sắp ra mắt) |
| Nền tảng đám mây | Chưa có trên Bedrock, Vertex AI, hoặc Azure AI Foundry | Chưa có trên Bedrock, Vertex AI, hoặc Azure AI Foundry |
| Tác tử lập trình | ZCode; OpenRouter tích hợp vào IDE chấp nhận nhà cung cấp tùy chỉnh. Chưa hỗ trợ gốc trong Claude Code, GitHub Copilot, hoặc Cursor | Hoạt động ngay hôm nay qua llama.cpp tại chỗ + OpenCode; cách nối tương tự áp dụng cho QwenCloud khi lên sóng. Chưa hỗ trợ gốc trong Claude Code, GitHub Copilot, hoặc Cursor |
| Router bên thứ ba | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID mô hình API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash trên QwenCloud và OpenRouter; trọng số Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash có thể gọi ngay. Qwen3.8-Flash-Next cũng vậy, chỉ là trên phần cứng của bạn hoặc qua các router như OpenRouter. Endpoint API của Qwen sẽ sớm xuất hiện.
Gõ đúng các ID đó. ID của Qwen3.8-Flash-Next là qwen3.8-flash (không có “next”), nên đừng tự tạo ID đám mây qwen3.8-flash-next từ tên trọng số.
Thực hiện cuộc gọi API đầu tiên
Cả hai mô hình đều dùng định dạng chat completions của OpenAI, nên bạn tái sử dụng client chuẩn. Cách nhanh nhất để thử song song là OpenRouter, nơi cả hai dùng chung một base URL, và bạn chỉ đổi chuỗi model.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Dùng API chính hãng khiến bạn mất tính di động. Endpoint của Z.ai ở docs.z.ai và nhận thinking: {"type": "enabled"} với reasoning_effort đặt low, high hoặc max. Bên Alibaba nhận enable_thinking với reasoning_effort mặc định xhigh, trên base URL DashScope (quốc tế, Bắc Kinh, hoặc Virginia). Cùng SDK, nhưng núm suy luận không tương thích hoàn toàn, nên hãy dự trù một adapter nhỏ nếu bạn định chuyển đổi.
Để xem hướng dẫn đầy đủ về Qwen, đọc bài hướng dẫn chạy Qwen3.8-Flash-Next tại chỗ và hướng dẫn Qwen Code CLI. Với họ GLM phục vụ tại chỗ, xem Chạy GLM-5 Tại Chỗ Cho Lập Trình Tác Tử. Nếu bạn đang có máy Qwen3.8-27B, thiết lập RTX 5090 là nhánh cục bộ tương ứng, không phải bản xem trước 125B này.
Suy nghĩ cuối
Nếu bạn cần triển khai với API Flash đang hoạt động trong tuần này, hãy dùng GLM-5.3-Flash. Nếu bạn đang nghiên cứu Qwen4 hoặc tin CoWorkBench hơn DeepSWE, hãy dùng trọng số Qwen3.8-Flash-Next tại chỗ và chuyển sang qwen3.8-flash qua API khi ra mắt.
Điều tôi thấy thú vị nhất là giá niêm yết gần như không khác. Tranh luận là về khả năng truy cập và hàng mục chưa công bố mà bạn sẵn sàng bỏ qua, chứ không phải về vách chi phí 2x.
Nếu bạn muốn nắm các khái niệm nền tảng của cả hai MoE, tôi khuyến nghị khóa Large Language Models (LLMs) Concepts, sau đó là lộ trình AI Agent Fundamentals. Với công việc trên hub và trọng số, Working with Hugging Face là bước thực hành tiếp theo.
Câu hỏi thường gặp
Khi nào tôi nên dùng GLM-5.3-Flash thay vì Qwen3.8-Flash-Next?
Dùng GLM-5.3-Flash khi bạn cần API chính hãng đang hoạt động trong tuần này, trọng số theo giấy phép MIT, hoặc điểm cao hơn trên các benchmark giao nhau (DeepSWE v1.1 63,4; Toolathlon Verified 78,4; NL2Repo 56,3).
Dùng Qwen3.8-Flash-Next khi bạn muốn chạy bản xem trước kiến trúc Qwen4 tại chỗ, có 6B tham số kích hoạt hiệu quả hơn, hoặc muốn dùng mô hình trong thiết lập tác tử văn phòng (CoWorkBench 73,9; JobBench 55,7).
Tôi có thể truy cập GLM-5.3-Flash và Qwen3.8-Flash-Next ở đâu?
GLM-5.3-Flash đang hoạt động trên Z.ai với ID glm-5.3-flash, trong GLM Coding Plan, và trên OpenRouter với ID z-ai/glm-5.3-flash. Trọng số có trên Hugging Face theo giấy phép MIT.
Trọng số Qwen3.8-Flash-Next có trên Hugging Face và ModelScope. API sản phẩm là Qwen3.8-Flash trên QwenCloud với ID qwen3.8-flash, ghi chú sắp ra mắt, nhưng bạn có thể truy cập mô hình ngay qua OpenRouter. Qwen Chat và Qwen Studio là các giao diện cho người dùng.
GLM-5.3-Flash và Qwen3.8-Flash-Next so sánh thế nào về lập trình?
Ở các benchmark lập trình mà cả hai phòng lab đều công bố, GLM-5.3-Flash dẫn trước: DeepSWE v1.1 63,4 so với 58,7; Toolathlon Verified 78,4 so với 73,5; và NL2Repo 56,3 so với 48,1. Bộ công cụ đo không hoàn toàn giống nhau.
ID mô hình API của GLM-5.3-Flash và Qwen3.8-Flash-Next là gì?
GLM-5.3-Flash có ID glm-5.3-flash trên Z.ai và z-ai/glm-5.3-flash trên OpenRouter.
ID sản phẩm trên QwenCloud là qwen3.8-flash, không phải qwen3.8-flash-next trên đám mây. Trọng số mở là Qwen/Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next có giống Qwen3.8-Flash không?
Không. Qwen3.8-Flash-Next là bản xem trước kiến trúc với trọng số mở. Qwen3.8-Flash là SKU sản phẩm trên QwenCloud, niêm yết $0,16 / $0,47 mỗi 1M token, có ngữ cảnh mặc định 1M và công cụ tích hợp chính thức. API được ghi chú là sắp ra mắt vào ngày 26/8/2026.
Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.
