Tracks
2026年8月26日、Z.ai は GLM-5.3-Flash をリリースし、Alibaba の Qwen チームは Qwen3.8-Flash-Next の重みを公開しました。いずれもオープンウェイトのネイティブ・マルチモーダル Mixture-of-Experts(MoE)モデルで、残り物の廉価版ではなく、Flash クラスのコスト競争力を前面に出した製品です。
かつて Flash は「薄いモデル」を意味していました。この2つは、コーディングエージェントや長文コンテキスト提供に向けた、各ラボの効率性への賭けであり、同じ24時間内に登場しました。意図的に比較しづらい組み合わせでもあります。公開するベンチが一致しておらず、現時点でファーストパーティ API が稼働しているのは一方だけだからです。
TL;DR
- 両ラボが公開したコーディング/ツール利用系ベンチでは、GLM-5.3-Flash が優位です。
- 今すぐ使える API、MIT ライセンスの重み、YaRN なしでの 100万トークンウィンドウが必要なら GLM-5.3-Flash を選んでください。
- セルフホストできる(重みは本日時点で llama.cpp で動作)か、マネージドの QwenCloud API を待てるなら Qwen3.8-Flash-Next を選んでください。
- 掲示価格は数セント差です。今週の請求額に効くのは、9月9日までの GLM の50%プロモのみです。
GLM-5.3-Flash とは?
GLM-5.3-Flash は GLM-5 シリーズで初のネイティブ・マルチモーダルモデルで、2026年8月26日にリリース。総パラメータは3,200億、そのうち有効パラメータは180億です。Z.ai の発表によると、コーディングやエージェント系ベンチで GLM-5.2 を上回り、価格は約10分の1。割引階層で1タスクあたり $0.045 のコストで Artificial Analysis Intelligence Index v4.1.1 において 57 を記録しています。
製品としての肝はアーキテクチャです。線形+スパースのハイブリッドアテンション、Manifold-Constrained Hyper-Connections(mHC)、3兆トークンのマルチモーダルコーパス、そして GLM-4.5 の92層に対して45層。Z.ai は命名前に ox-alpha として OpenCode と OpenRouter 上で匿名提供し、中国製 AI チップで提供していました。重みは MIT ライセンスで Hugging Face に公開済みで、SGLang、vLLM、TokenSpeed 向けのサービング手順も用意されています。
詳しくは単独記事の GLM-5.3-Flash ガイドをご覧ください。前世代については GLM-5.2 ガイド と、GLM-5 をローカルで動かしてエージェント的コーディングを行うチュートリアルがあります。
Qwen3.8-Flash-Next とは?
Qwen3.8-Flash-Next は、Qwen4 のアーキテクチャを見据えた、Alibaba の Qwen チームによる 2026年8月26日のオープンウェイト版プレビューです。メインモデルは1,250億パラメータに、510億パラメータの n-gram 埋め込みテーブルを加え、トークンあたり有効パラメータは60億。ネイティブのコンテキストは262,144トークンで、YaRN により 1,000,000 まで拡張可能。学習コストは Qwen3.7-Plus の約9分の1とされています。
プロダクション SKU は QwenCloud 上のQwen3.8-Flashで、価格は入力 100万トークンあたり $0.16、出力 100万トークンあたり $0.47、API は近日公開予定と記載。クラウドのモデル ID は qwen3.8-flash です。すでに単独の Qwen3.8-Flash-Next ガイド と、Qwen3.8-Flash-Next をローカルのコーディングエージェントとして OpenCode で動かす方法のセットアップ記事も公開しています。
GLM-5.3-Flash vs Qwen3.8-Flash-Next:徹底比較

両ラボが公開している共通ベンチでは、より大きいモデルであることを踏まえると予想どおり、GLM-5.3-Flash が優勢です。価格は両モデルとも非常に近い水準です。
| Feature | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / date | Z.ai、2026年8月26日 | Qwen(Alibaba)、2026年8月26日 |
| Size | 総3,200億/有効180億 | メイン1,250億+n-gram 510億/有効60億 |
| Context | ネイティブで100万トークン | ネイティブ262,144;YaRN で1,000,000 |
| Modalities | ネイティブ・マルチモーダル(テキスト・画像・動画入力) | ネイティブ・マルチモーダル MoE |
| Weights | MIT、zai-org/GLM-5.3-Flash |
オープンウェイト、Qwen/Qwen3.8-Flash-Next |
| Shared coding benches | DeepSWE、Toolathlon、NL2Repo でリード | 上記3つで後塵を拝す;SWE-bench Pro 62.5 を公開 |
| Office-agent benches | AutomationBench 48.8;OfficeQA Pro 62.4 | CoWorkBench 73.9;JobBench 55.7 |
| API list price (per 1M) | $0.15 入力/$0.50 出力 | $0.16 入力/$0.47 出力(Qwen3.8-Flash) |
| First-party API | 稼働中、glm-5.3-flash |
順番待ち、qwen3.8-flash |
コーディングとエージェントワークフロー
両社が同列に載せたコーディング/ツール利用スコアでは GLM-5.3-Flash が優勢。Z.ai の8月26日の表では、DeepSWE v1.1 が 63.4、Toolathlon Verified が 78.4、NL2Repo が 56.3。Qwen の表では同名に対して 58.7、73.5、48.1 です。
それ以外は、採用ベンチが異なるため比較は難しいです。Qwen は SWE-bench Pro 62.5、SWE-bench Multilingual 81.0 を公開。Z.ai は Terminal Bench 2.1 で 84.3、AutomationBench で 48.8、さらに社内の Z.ai Code Bench v1.0 にて最大努力で 29.0(Claude Code 2.1.207 上の Claude Opus 4.8 は 29.5)を公表しています。
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Notes |
|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 58.7 | ベンダー表;GLM は mini-swe-agent、Qwen は Claude Code と mini-SWE-agent の高い方を報告 |
| Toolathlon Verified | 78.4 | 73.5 | Pass@1;GLM は3回平均 |
| NL2Repo | 56.3 | 48.1 | Qwen は NL2Repo-Bench と表記 |
| SWE-bench Pro | 未公開 | 62.5 | Qwen はベースラインを Claude Code で再実行 |
| Terminal Bench 2.1 | 84.3 | 未公開 | Z.ai、Claude Code 2.1.207 |
| Agents' Last Exam | 26.3 | pass@1 24.3(スコア 51.2) | 報告形式が異なる |
重なっている範囲では、公開済みのコーディングエージェント Flash として GLM を強いと見なしますが、Z.ai の SWE-bench スコアが出るまでは勝者は決めません。
オフィス業務と長期視野のエージェント
長期視野のオフィス系スコアを公開しているのは Qwen です。CoWorkBench は 73.9、JobBench は 55.7 で、Qwen3.7-Plus(65.1 と 27.6)や、その行での Claude Opus 4.6 Max(68.2 と 36.6)を大きく上回ります。
Z.ai の重なる「業務」系数値は AutomationBench 48.8 と OfficeQA Pro 62.4、加えて視覚的なデスクトップ作業向けの ZCode Browser Use と Computer Use です。
同一テストではないため勝敗は決まりません。仕事のメンタルモデルが「数時間のオフィスエージェント」なら Qwen がベンチを提示。Zapier 的な自動化や PDF のオフィス QA が中心なら GLM が数字を示しています。
アーキテクチャとサービングコスト
Qwen3.8-Flash-Next の有効パラメータはトークンあたり 60億。GLM-5.3-Flash は 180億。この3倍の差はハードウェア観点で最もわかりやすく、ローカル提供の議論が Qwen に傾く理由です。実際、UD-Q4_K_XL GGUF(約111GB)は RAM オフロード込みで 96GB の単一カード上で動作します — こちらで実施。
両者ともハイブリッドアテンションを採用。Z.ai によると GLM-5.3-Flash は GLM-5.3 比でアテンション計算を 3.0 倍、KV キャッシュを 4.4 倍削減。Qwen は QSA のアテンションカーネルが 100万トークン時にプレフィル最大 7.6 倍、デコード最大 4.9 倍高速で、プレフィルスループットは Qwen3.7-Plus の 8.6 倍(プレフィックスキャッシュ 90% ヒット時)としています。
GLM の「追加 51B 風」のキャパ拡張は埋め込みテーブルではありません。Qwen の 51B n-gram テーブルはホスト RAM に常駐しプレフェッチする設計。アプローチは異なれど、狙いは同じ――ワット当たり能力の最大化です。
マルチモーダル機能とコンテキスト
両モデルとも、同一世代でテキストと画像入力に対応。GLM-5.3-Flash は GLM-5 の初のネイティブ・マルチモーダルで、3兆トークンのマルチモーダルコーパスで学習し、動画対応のビジョン系行でも(MVBench 77.8、MMVU 80.5)。
Qwen3.8-Flash-Next は AndroidWorld 84.5、LVBench 76.6、RealWorldQA 88.5、CharXiv 84.6(コンピュータ利用ツールなし)/90.6(あり)を公表しています。
コンテキストウィンドウは、単独で選定理由になるほどの差ではありません。GLM はネイティブで 100万トークンを謳い、Qwen はネイティブ 262,144 を YaRN で 1,000,000 に拡張。リサーチノートでは、GLM の 100万は本番でのストレステストがまだ軽いという見方も残っています。
価格:実際の支払い

プロモを除けば、価格差はほとんど見分けがつきません。Qwen と Z.ai は明らかに同じ階層を狙っています。
トークン単価の並び
| Rate | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| 入力(100万トークンあたり) | $0.15(プロモ $0.075) | $0.16 |
| 出力(100万トークンあたり) | $0.50(プロモ $0.25) | $0.47 |
| キャッシュ読込(100万トークンあたり) | $0.03(プロモ $0.015) | $0.016 |
| キャッシュ書込(100万トークンあたり) | プロモ期間は無料 | $0.20 |
| 発売プロモ | 2026年9月9日 24:00(UTC+8)まで 50% オフ | 未掲載 |
| コーディングプラン枠 | 全プラン階層で GLM-5.3 の 3 倍 | 未掲載 |
ほぼフラットな形です。出力がやや安い Qwen は生成量の多い月に有利。入力がやや安い GLM はリトリーバルに有利。Z.ai は思考トークンを出力レートで課金。Qwen は QwenCloud で enable_thinking と reasoning_effort を文書化していますが、思考トークンの別料金は示していないため、告知があるまで出力扱いと見ておくのが妥当です。
両ラボともキャッシュ料金を公開し、価格設計は異なります。Z.ai はキャッシュ読込を 100万トークンあたり $0.03(プロモでは $0.015)とし、プロモ期間中はキャッシュ書込を無料に。Qwen は読込 $0.016 と半額にする一方で、明示的なキャッシュ作成に 100万トークンあたり $0.20 を課金します。
つまり、Qwen はキャッシュ読込を半額に、GLM は書込を無料にします。プレフィックスが安定し長寿命なら Qwen の読込が有利。頻繁にキャッシュを書き換えるなら GLM の無料書込が有利、少なくとも 9 月 9 日までは。
実ワークロードのコスト
式:(ボリューム ÷ 1,000,000)× 単価。入力と出力で合算。標準のリストレートを使用。プロモ額は表から除外。
| Workload | GLM-5.3-Flash | Qwen3.8-Flash | Difference |
|---|---|---|---|
| バランス型アシスタント:入力 100万/出力 25万 | $0.28 | $0.28 | $0.00(0%) |
| 生成多め:入力 100万/出力 400万 | $2.15 | $2.04 | Qwen が $0.11 安い(5%) |
| リトリーバル(閾値未満):入力 1,000万/出力 100万 | $2.00 | $2.07 | GLM が $0.07 安い(3%) |
API の掲示価格ではほぼ互角。判断はワークロード適合と、エンドポイントの有無にかかっています。両モデルともベンダー固有のトークナイザを使い、共通ワークロードでのトークン数を公開していないため、これらの合計は請求額というよりレート比較として扱ってください。2026年9月9日までは、GLM のプロモにより GLM 列の合計は半額($0.14、$1.08、$1.00)になります。
GLM-5.3-Flash と Qwen3.8-Flash-Next の使い分け

今週、ファーストパーティ API を叩く必要があるなら、完成度の点で GLM-5.3-Flash に分があります。Qwen4 のアーキテクチャ評価や CoWorkBench/JobBench を重視するなら、まずは Qwen3.8-Flash-Next の重みを使ってローカルで試し、QwenCloud に qwen3.8-flash が来たら切り替えてください。
GLM-5.3-Flash を選ぶべきケース
-
Z.ai の
glm-5.3-flash、または OpenRouter のz-ai/glm-5.3-flashを、クラウド SKU の順番待ちなしで使いたい。 -
評価セットが DeepSWE、Toolathlon、NL2Repo、Terminal Bench 2.1 に近く、重複ベンチで高いスコアを公表しているラボを選びたい。
-
MIT ライセンスの重みとネイティブ 100万トークンウィンドウを望み、有効 180 億パラメータの活性化で問題ない。
-
すでに GLM Coding Plan を利用中で、GLM-5.3 に対する 3 倍枠や、2026年9月9日までのプロモを活用できる。
- ビジュアルなデスクトップエージェントが必要。ZCode の Browser Use と Computer Use は発表記事に記載。Qwen の対抗数値は OSWorld 2.0 の 19.4 で、誇れる水準ではない。
Qwen3.8-Flash-Next を選ぶべきケース
-
完成したマネージド API ではなく、Qwen4 のプレビューを買うつもりでいる。現時点で製品は重みそのもの。
-
オフィスエージェント系ベンチを重視。CoWorkBench と JobBench は Qwen が語る物語であり、GLM ではない。
-
有効 60 億パラメータと、ホストメモリ常駐が可能な n-gram テーブルを望む(Qwen3.8-27B のローカル環境の隣でも)。
-
すでに Qwen Chat/Qwen Studio/Qwen Code を使っている、または OpenAI 互換エージェント(OpenCode、Codex、Qwen Code)を本日からローカルの llama.cpp エンドポイントに向けられる。Claude Code は変換プロキシが必要。
GLM-5.3-Flash と Qwen3.8-Flash-Next を始めるには
| Surface | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| コンシューマー向けアプリ | Z.ai の Web プレイグラウンドと GLM Coding Plan | Qwen Chat と Qwen Studio |
| ファーストパーティ API | あり(Z.ai、glm-5.3-flash) |
QwenCloud の qwen3.8-flash(API は近日公開) |
| クラウドプラットフォーム | Bedrock/Vertex AI/Azure AI Foundry では未提供 | Bedrock/Vertex AI/Azure AI Foundry では未提供 |
| コーディングエージェント | ZCode;カスタムプロバイダ対応 IDE への OpenRouter 接続。Claude Code、GitHub Copilot、Cursor にネイティブ対応はなし | 本日時点で llama.cpp+OpenCode のローカル構成で動作;QwenCloud 稼働後も同様の配線。Claude Code、GitHub Copilot、Cursor にネイティブ対応はなし |
| サードパーティルーター | OpenRouter、DeepInfra、Together.ai | OpenRouter |
| API model ID | glm-5.3-flash(OpenRouter:z-ai/glm-5.3-flash) |
QwenCloud と OpenRouter では qwen3.8-flash;重みは Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash は今すぐ呼び出せます。Qwen3.8-Flash-Next も、現時点では自前ハードウェアか OpenRouter などのルーター経由で利用可能。Qwen の公式 API エンドポイントもまもなく追随するはずです。
ID は正確に入力してください。Qwen3.8-Flash-Next の ID は 実際には qwen3.8-flash("next" なし)です。重み名から qwen3.8-flash-next というクラウド ID を作らないでください。
最初の API コール
両モデルとも OpenAI の chat completions 形式に対応しているため、標準クライアントをそのまま使い回せます。最速で両者を並べて試すには OpenRouter が便利で、共通のベース URL の背後に両モデルがあり、変更するのはモデル文字列だけです。
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
ファーストパーティに行くと可搬性は下がります。Z.ai のエンドポイントは docs.z.ai で、thinking: {"type": "enabled"} と reasoning_effort(low/high/max)を受け付けます。Alibaba 側は enable_thinking を受け付け、reasoning_effort はデフォルトで xhigh。ベース URL は DashScope(国際/北京/バージニア)。SDK は同じでも、推論ノブは可搬ではないため、切替予定があるなら小さなアダプタ実装を見込んでください。
Qwen のフル手順は、Qwen3.8-Flash-Next をローカルで動かすチュートリアルと、Qwen Code の CLI チュートリアルをご覧ください。GLM ファミリのローカル提供は、Run GLM-5 Locally For Agentic Coding を参照。すでに Qwen3.8-27B マシンがある場合は、RTX 5090 設定が兄弟ルートであり、今回の 125B プレビューとは別です。
まとめ
今週、稼働中の Flash API に対して出荷する必要があるなら GLM-5.3-Flash を。Qwen4 を研究している、または DeepSWE より CoWorkBench を重視するなら、まずはローカルで Qwen3.8-Flash-Next の重みを使い、API が出たら qwen3.8-flash に切り替えてください。
最も興味深いのは、掲示価格の差がほとんどないことです。論点はアクセス可否と、未公開のどの行を看過するかであり、2倍のコスト差といった崖ではありません。
両 MoE の基礎概念を学ぶなら、Large Language Models(LLMs)Concepts コース、その後に AI Agent Fundamentals トラックをおすすめします。Hub と重みを扱う実務には、Working with Hugging Face が実践的な次の一歩です。
FAQs
GLM-5.3-Flash と Qwen3.8-Flash-Next はどのように使い分ければよいですか?
今週すぐに使えるファーストパーティ API、MIT ライセンスの重み、または重複するコーディングスコアの優位(DeepSWE v1.1 63.4、Toolathlon Verified 78.4、NL2Repo 56.3)が必要なら GLM-5.3-Flash を使ってください。
Qwen4 のアーキテクチャプレビューをローカルで動かしたい、有効 60 億パラメータで効率よく運用したい、またはオフィスエージェント構成(CoWorkBench 73.9、JobBench 55.7)で使いたい場合は Qwen3.8-Flash-Next を使ってください。
GLM-5.3-Flash と Qwen3.8-Flash-Next はどこで利用できますか?
GLM-5.3-Flash は Z.ai で glm-5.3-flash、GLM Coding Plan、OpenRouter では z-ai/glm-5.3-flash として提供されています。重みは MIT ライセンスで Hugging Face にあります。
Qwen3.8-Flash-Next の重みは Hugging Face と ModelScope にあります。プロダクション API は QwenCloud の Qwen3.8-Flash(qwen3.8-flash)で、近日公開予定の表示ですが、OpenRouter からはすでにモデルにアクセス可能です。コンシューマー向けの窓口は Qwen Chat と Qwen Studio です。
GLM-5.3-Flash と Qwen3.8-Flash-Next のコーディング性能比較は?
両ラボが公開したコーディング系ベンチでは GLM-5.3-Flash がリードしています:DeepSWE v1.1 は 63.4 対 58.7、Toolathlon Verified は 78.4 対 73.5、NL2Repo は 56.3 対 48.1。ただしハーネスは同一ではありません。
GLM-5.3-Flash と Qwen3.8-Flash-Next の API モデル ID は?
GLM-5.3-Flash は Z.ai で glm-5.3-flash、OpenRouter で z-ai/glm-5.3-flash です。
QwenCloud のプロダクション ID は qwen3.8-flash で、qwen3.8-flash-next というクラウド ID ではありません。オープンウェイトは Qwen/Qwen3.8-Flash-Next です。
Qwen3.8-Flash-Next と Qwen3.8-Flash は同じものですか?
いいえ。Qwen3.8-Flash-Next はオープンウェイトのアーキテクチャプレビューです。Qwen3.8-Flash は QwenCloud 上のプロダクション SKU で、100万トークンあたり $0.16/$0.47、デフォルトの 100万コンテキストと公式ビルトインツールを備えます。API は 2026年8月26日時点で近日公開とされていました。