Tracks
2026 年 8 月 26 日,Z.ai 发布了 GLM-5.3-Flash,阿里巴巴通义千问团队开源了 Qwen3.8-Flash-Next 的权重。两者都是开放权重、原生多模态的专家混合(MoE)模型,定位为 Flash 级的性价比产品,而非降价清仓款。
过去的 Flash 往往意味着“更轻薄”。这两款模型是各自实验室押注在编程智能体与长上下文服务上的效率之作,并在同一 24 小时内发布。我们刻意把它们放在一起比较:它们未公布相同的一套基准,且目前只有一家提供了已上线的一方 API。
要点速览
- 在两家均公布的编程与工具使用基准上,GLM-5.3-Flash 领先。
- 若您需要可用的在线 API、MIT 许可的权重,以及无需 YaRN 的 100 万 token 窗口,请选 GLM-5.3-Flash。
- 若您能自托管(权重已可用 llama.cpp 运行)或可等待托管的 QwenCloud API,请选 Qwen3.8-Flash-Next。
- 标价基本相差无几;本周账单真正会变的是 GLM 截至 2026 年 9 月 9 日的 50% 促销。
GLM-5.3-Flash 是什么?
GLM-5.3-Flash 是 Z.ai 在 GLM-5 系列中首个原生多模态模型,于 2026 年 8 月 26 日发布,总参数 3200 亿、激活参数 180 亿。Z.ai 的发布文章称,其在编程与智能体基准上优于 GLM-5.2,同时价格约为后者的十分之一;在折扣档位上,Artificial Analysis Intelligence Index v4.1.1 得分为 57,单次任务成本为 0.045 美元。
其架构才是核心看点:混合线性与稀疏注意力、流形约束超连接(mHC)、30 万亿 token 的多模态语料,以及 45 层(对比 GLM-4.5 的 92 层)。Z.ai 在命名前曾以 ox-alpha 匿名身份在 OpenCode 与 OpenRouter 上运行,并部署在国产 AI 芯片上。权重以 MIT 许可发布在 Hugging Face,提供 SGLang、vLLM 与 TokenSpeed 的服务方案。
更多细节可参阅我们的独立GLM-5.3-Flash 指南。上代内容见我们的 GLM-5.2 指南及本地运行 GLM-5 进行智能体编程教程。
Qwen3.8-Flash-Next 是什么?
Qwen3.8-Flash-Next 是阿里巴巴通义千问团队在 2026 年 8 月 26 日发布的面向 Qwen4 架构的开放权重预览。主模型 1250 亿参数,外加 510 亿参数的 n-gram 嵌入表,每个 token 激活参数 60 亿。原生上下文为 262,144 个 token,可用 YaRN 扩展至 1,000,000。通义称其训练成本约为 Qwen3.7-Plus 的九分之一。
面向生产的 SKU 是 QwenCloud 上的Qwen3.8-Flash,标价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,API 标注为即将上线。云端模型 ID 为 qwen3.8-flash。我们已发布独立的Qwen3.8-Flash-Next 指南,以及使用 OpenCode 将 Qwen3.8-Flash-Next 作为本地编程智能体运行的配置教程。
GLM-5.3-Flash vs Qwen3.8-Flash-Next:正面比较

在两家都公布的基准上,GLM-5.3-Flash 领先——这也符合其规模更大的直觉。两者的定价非常接近。
| 特性 | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 实验室 / 日期 | Z.ai,2026 年 8 月 26 日 | 通义千问(阿里巴巴),2026 年 8 月 26 日 |
| 规模 | 总参 3200 亿,激活 180 亿 | 主干 1250 亿 + n-gram 510 亿,激活 60 亿 |
| 上下文 | 原生 100 万 token | 原生 262,144;配合 YaRN 至 1,000,000 |
| 模态 | 原生多模态(文本、图像、视频输入) | 原生多模态 MoE |
| 权重 | MIT,zai-org/GLM-5.3-Flash |
开放权重,Qwen/Qwen3.8-Flash-Next |
| 共享编程基准 | 领先 DeepSWE、Toolathlon、NL2Repo | 在这三项中落后;公布 SWE-bench Pro 62.5 |
| 办公智能体基准 | AutomationBench 48.8;OfficeQA Pro 62.4 | CoWorkBench 73.9;JobBench 55.7 |
| 官方 API 标价(每百万) | 输入 $0.15 / 输出 $0.50 | 输入 $0.16 / 输出 $0.47(Qwen3.8-Flash) |
| 一方 API | 已上线,glm-5.3-flash |
排队中,qwen3.8-flash |
编程与智能体式工作流
在两家放在同一行对比的编程与工具使用分数上,GLM-5.3-Flash 领先。Z.ai 于 8 月 26 日的表中列出:DeepSWE v1.1 为 63.4、Toolathlon Verified 为 78.4、NL2Repo 为 56.3。Qwen 的表中对应三项为 58.7、73.5 与 48.1。
除此之外,由于两家选择的其他基准不同,难以直接横评。Qwen 公布了 SWE-bench Pro 62.5 与 SWE-bench Multilingual 81.0。Z.ai 则公布了 Terminal Bench 2.1 为 84.3、AutomationBench 为 48.8,以及自家 Z.ai Code Bench v1.0 在最大努力下 29.0 的结果(Claude Code 2.1.207 下的 Claude Opus 4.8 为 29.5)。
| 基准 | GLM-5.3-Flash | Qwen3.8-Flash-Next | 备注 |
|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 58.7 | 厂商表格;GLM 用 mini-swe-agent,Qwen 报告 Claude Code 与 mini-SWE-agent 中较高者 |
| Toolathlon Verified | 78.4 | 73.5 | Pass@1;GLM 为 3 次运行均值 |
| NL2Repo | 56.3 | 48.1 | Qwen 标注为 NL2Repo-Bench |
| SWE-bench Pro | 未公布 | 62.5 | Qwen 在 Claude Code 中重跑基线 |
| Terminal Bench 2.1 | 84.3 | 未公布 | Z.ai,Claude Code 2.1.207 |
| Agents' Last Exam | 26.3 | pass@1 为 24.3(分数 51.2) | 报告口径不同 |
在重叠集合上,我会将 GLM 视为更强的编程型 Flash,但在 Z.ai 公布 SWE-bench 成绩前,不急于判定该项胜者。
办公与长程智能体
发布长程办公分数的是 Qwen。CoWorkBench 为 73.9、JobBench 为 55.7,均显著领先于 Qwen3.7-Plus(65.1 与 27.6)以及同表行的 Claude Opus 4.6 Max(68.2 与 36.6)。
Z.ai 在“工作”相关的重叠数据为 AutomationBench 48.8 与 OfficeQA Pro 62.4,并公布了面向可视化桌面工作的 ZCode Browser Use 与 Computer Use。
这并非相同测试,难分高下。若您将工作想象为“多小时的办公智能体”,Qwen 给出了相应基准;若是偏向 Zapier 风格自动化或 PDF 办公问答,GLM 给出了对应数据。
架构与服务成本
Qwen3.8-Flash-Next 每 token 激活 60 亿参数;GLM-5.3-Flash 为 180 亿。3 倍差距是两者在硬件侧最清晰的事实,这也是本地部署讨论更常落到 Qwen 的原因。实际中,UD-Q4_K_XL GGUF(约 111GB)可在单张 96GB 显卡上配合内存卸载运行——我们已这样做过。
两者均采用混合注意力。Z.ai 称 GLM-5.3-Flash 相比 GLM-5.3 将注意力计算降低 3.0 倍、KV 缓存缩小 4.4 倍。Qwen 称 QSA 的注意力内核在 100 万 token 下预填速度最高快 7.6 倍、解码快 4.9 倍,且在 90% 前缀缓存命中率下,预填吞吐为 Qwen3.7-Plus 的 8.6 倍。
GLM 的“额外 51B 式”容量并非嵌入表;Qwen 的 51B n-gram 表设计为驻留主内存并预取。配方不同,诉求一致:每瓦特产能更高。
多模态与上下文
两款模型都能在同一代中接收图像与文本。GLM-5.3-Flash 明确为 GLM-5 的首个原生多模态成员,基于 30 万亿 token 的多模态语料训练,具备视频相关视觉能力(MVBench 77.8、MMVU 80.5)。
Qwen3.8-Flash-Next 公布了 AndroidWorld 84.5、LVBench 76.6、RealWorldQA 88.5,以及 CharXiv 无工具 84.6 / 有计算机使用工具 90.6。
上下文窗口的体量相近,不足以单独作为决策依据。GLM 标称原生 100 万 token;Qwen 原生 262,144,可用 YaRN 拉伸至 100 万。研究注解中仍将 GLM 的 100 万视为在生产中“轻度压力测试”。
定价:您实际会花多少钱

撇开促销,几乎难以区分两者定价。Qwen 与 Z.ai 显然瞄准了同一价位层。
Token 费率对照
| 费率 | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| 输入,每百万 token | $0.15(促销 $0.075) | $0.16 |
| 输出,每百万 token | $0.50(促销 $0.25) | $0.47 |
| 缓存读取输入,每百万 token | $0.03(促销 $0.015) | $0.016 |
| 缓存写入输出,每百万 token | 促销期间免费 | $0.20 |
| 上线促销 | 至 2026 年 9 月 9 日 24:00(UTC+8)五折 | 未公布 |
| Coding Plan 配额 | 所有套餐对 GLM-5.3 提供 3 倍配额 | 未公布 |
整体几乎持平。Qwen 略低的输出价利好生成密集型月份;GLM 略低的输入价利好检索。Z.ai 将“思考”token 按输出价计费。Qwen 在 QwenCloud 文档中提供了 enable_thinking 与 reasoning_effort 设置,且未单列思考 token 价格,因此在另行说明前,可将推理视作输出计费。
两家都公布了缓存费率,但定价侧重点不同。Z.ai 的缓存输入为每百万 token 0.03 美元(促销期 0.015 美元),且在促销期内缓存写入免费。Qwen 的缓存读取为 0.016 美元,但显式创建缓存需按每百万 token 0.20 美元计费。
因此,Qwen 将缓存读取费用减半,而 GLM 赠送写入。若您的前缀稳定且长期复用,Qwen 的读取价更优;若您经常重写缓存,GLM 的免费写入更划算,至少在 9 月 9 日之前如此。
真实工作负载的成本
计算公式:(用量 ÷ 1,000,000)× 费率,分别对输入与输出求和,按标准标价。表内不计促销。
| 工作负载 | GLM-5.3-Flash | Qwen3.8-Flash | 差异 |
|---|---|---|---|
| 均衡助理:100 万入 / 25 万出 | $0.28 | $0.28 | $0.00(0%) |
| 生成密集:100 万入 / 400 万出 | $2.15 | $2.04 | Qwen 便宜 $0.11(5%) |
| 检索、低输出:1000 万入 / 100 万出 | $2.00 | $2.07 | GLM 便宜 $0.07(3%) |
API 标价层面的成本几乎打平。选择取决于工作负载匹配度以及端点是否可用。两者均使用各自的分词器,且未公布共享工作负载下的 token 统计,因此请将这些合计视为费率对比,而非最终账单。至 2026 年 9 月 9 日,GLM 的促销会将 GLM 列的总额对半($0.14、$1.08、$1.00)。
何时选择 GLM-5.3-Flash,何时选择 Qwen3.8-Flash-Next

若您本周需要调用一方 API,GLM-5.3-Flash 是这对组合中唯一“完整”的产品。若您评估 Qwen4 架构,或关注 CoWorkBench 与 JobBench,请先用 Qwen3.8-Flash-Next 的权重本地测试,待 QwenCloud 上线后再接入 qwen3.8-flash。
若以下情况,请选择 GLM-5.3-Flash:
-
您需要在 Z.ai 使用
glm-5.3-flash,或在 OpenRouter 使用z-ai/glm-5.3-flash,而不想等待排队中的云端 SKU。 -
您的评测集接近 DeepSWE、Toolathlon、NL2Repo 或 Terminal Bench 2.1,并希望选择在重叠项目上分数更高的实验室。
-
您需要 MIT 许可的权重与原生 100 万 token 窗口,且接受激活 180 亿参数。
-
您已订阅 GLM Coding Plan,可享受相对 GLM-5.3 的 3 倍配额,包括截至 2026 年 9 月 9 日的促销。
- 您想要视觉桌面型智能体。ZCode 的 Browser Use 与 Computer Use 已在发布文中出现;而 Qwen 的对应数据是 OSWorld 2.0 的 19.4 分,这并不亮眼。
若以下情况,请选择 Qwen3.8-Flash-Next:
-
您购买的是 Qwen4 的预览,而非已托管完成的一方 API。当前产品形态是权重。
-
您真正关心的是办公智能体基准。CoWorkBench 和 JobBench 是 Qwen 的主打,而非 GLM 的。
-
您希望每 token 仅激活 60 亿参数,并使用可驻留主内存的 n-gram 表,包括与Qwen3.8-27B 本地部署相邻的环境。
-
您已在使用 Qwen Chat、Qwen Studio、Qwen Code,或将任一兼容 OpenAI 的智能体(OpenCode、Codex、Qwen Code)指向本地 llama.cpp 端点。Claude Code 需要中转代理。
如何开始使用 GLM-5.3-Flash 与 Qwen3.8-Flash-Next
| 使用面 | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 面向消费者的应用 | Z.ai 网页试玩与 GLM Coding Plan | Qwen Chat 与 Qwen Studio |
| 一方 API | 是,Z.ai,glm-5.3-flash |
QwenCloud qwen3.8-flash(API 即将上线) |
| 云平台 | Bedrock、Vertex AI、Azure AI Foundry 上均不可用 | Bedrock、Vertex AI、Azure AI Foundry 上均不可用 |
| 编程智能体 | ZCode;通过 OpenRouter 接入支持自定义提供商的 IDE。不原生支持 Claude Code、GitHub Copilot 或 Cursor | 今日可通过本地 llama.cpp + OpenCode 使用;QwenCloud 上线后接法相同。不原生支持 Claude Code、GitHub Copilot 或 Cursor |
| 第三方路由 | OpenRouter、DeepInfra、Together.ai | OpenRouter |
| API 模型 ID | glm-5.3-flash(OpenRouter:z-ai/glm-5.3-flash) |
QwenCloud 与 OpenRouter:qwen3.8-flash;权重 Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash 现已可调用。Qwen3.8-Flash-Next 也可用,但仅限于您自有硬件或通过 OpenRouter 等路由使用。Qwen 自家的 API 端点预计很快上线。
请严格按 ID 书写。Qwen3.8-Flash-Next 的云端 ID 就是 qwen3.8-flash(不含“next”),不要根据权重名自行“发明”qwen3.8-flash-next 的云端 ID。
发起您的首个 API 调用
两者都支持 OpenAI 的聊天补全格式,因此可复用同一标准客户端。最快的对比方式是使用 OpenRouter,两者共用一个 base URL,您只需更换模型字符串。
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
走一方 API 会损失可移植性。Z.ai 的端点在 docs.z.ai,接受 thinking: {"type": "enabled"},reasoning_effort 可设为 low、high 或 max。阿里巴巴端接受 enable_thinking,reasoning_effort 默认为 xhigh,基于 DashScope(国际、北京或弗吉尼亚)URL。SDK 用法基本一致,但“推理力度”的参数名不可移植,若打算切换,请预留一个小适配层。
完整的 Qwen 上手可参阅我们的本地运行 Qwen3.8-Flash-Next教程与Qwen Code CLI 教程。GLM 家族的本地服务请参考本地运行 GLM-5 以进行智能体编程。若您已在用 Qwen3.8-27B 机器,我们的RTX 5090 配置是对应的本地路径,而非此 125B 预览。
结语
若您本周需要对接可用的 Flash API,请用 GLM-5.3-Flash。若您在研究 Qwen4,或更认可 CoWorkBench 而非 DeepSWE,请在本地使用 Qwen3.8-Flash-Next 权重,并在 API 上线后切换到 qwen3.8-flash。
我觉得最有意思的是,双方的标价几乎没有分歧。争论的焦点在于可用性与您愿意忽略哪些未公布的项目,而不是“价格翻倍”的悬崖。
若您想系统理解两家 MoE 背后的概念,推荐我们的大型语言模型(LLM)概念课程,接着是AI 智能体基础学习路径。若做 Hugging Face 与权重相关的实践,玩转 Hugging Face是务实的下一步。
常见问题
我什么时候该选 GLM-5.3-Flash 而不是 Qwen3.8-Flash-Next?
若您本周需要一方在线 API、MIT 许可权重,或想要更高的重叠编程分数(DeepSWE v1.1 63.4、Toolathlon Verified 78.4、NL2Repo 56.3),请选择 GLM-5.3-Flash。
若您希望在本地运行 Qwen4 架构预览、更高效的每 token 60 亿激活参数,或用于办公智能体场景(CoWorkBench 73.9、JobBench 55.7),请选择 Qwen3.8-Flash-Next。
我在哪里可以访问 GLM-5.3-Flash 和 Qwen3.8-Flash-Next?
GLM-5.3-Flash 已在 Z.ai 以 glm-5.3-flash 提供,在 GLM Coding Plan 与 OpenRouter 上则为 z-ai/glm-5.3-flash。权重以 MIT 许可发布在 Hugging Face。
Qwen3.8-Flash-Next 的权重在 Hugging Face 与 ModelScope 可得。面向生产的 API 是 QwenCloud 上的 Qwen3.8-Flash(qwen3.8-flash),标注为即将上线;您也可通过 OpenRouter 先行使用。Qwen Chat 与 Qwen Studio 是面向消费者的入口。
GLM-5.3-Flash 与 Qwen3.8-Flash-Next 在编程方面如何对比?
在两家均公布的编程基准上,GLM-5.3-Flash 领先:DeepSWE v1.1 为 63.4 vs 58.7,Toolathlon Verified 为 78.4 vs 73.5,NL2Repo 为 56.3 vs 48.1。测试框架并非完全一致。
GLM-5.3-Flash 与 Qwen3.8-Flash-Next 的 API 模型 ID 是什么?
GLM-5.3-Flash 在 Z.ai 的 ID 是 glm-5.3-flash,在 OpenRouter 上是 z-ai/glm-5.3-flash。
QwenCloud 的生产 ID 是 qwen3.8-flash,而非 qwen3.8-flash-next。开源权重为 Qwen/Qwen3.8-Flash-Next。
Qwen3.8-Flash-Next 与 Qwen3.8-Flash 是同一个东西吗?
不是。Qwen3.8-Flash-Next 是开放权重的架构预览;Qwen3.8-Flash 则是 QwenCloud 上的生产 SKU,标价每百万 token 为 $0.16 / $0.47,默认 100 万上下文并提供官方内置工具。2026 年 8 月 26 日时 API 标注为即将上线。