Lernpfad
Am 26. August 2026 veröffentlichte Z.ai GLM-5.3-Flash und Alibabas Qwen-Team legte die Gewichte von Qwen3.8-Flash-Next offen. Beide sind Open-Weight-Modelle, nativ multimodal und als Mixture-of-Experts (MoE) konzipiert — positioniert als Flash-Klasse für Kosteneffizienz, nicht als abgespeckter Restposten.
Früher stand Flash für „dünn“. Diese beiden sind die Effizienz-Wetten der Labs für Coding-Agents und Long-Context-Serving — veröffentlicht innerhalb von 24 Stunden. Die Gegenüberstellung ist bewusst holprig: Sie veröffentlichen nicht dieselben Benchmarks, und nur eine First-Party-API ist heute live.
TL;DR
- GLM-5.3-Flash führt die Coding- und Tool-Use-Benchmarks an, die beide Labs veröffentlicht haben.
- Wähle GLM-5.3-Flash, wenn du eine Live-API, MIT-lizenzierte Gewichte und ein 1M-Token-Fenster ohne YaRN brauchst.
- Wähle Qwen3.8-Flash-Next, wenn du selbst hosten kannst (die Gewichte laufen heute mit llama.cpp) oder wenn du auf die gemanagte QwenCloud-API warten kannst.
- Listenpreise liegen nur wenige Cent auseinander; der einzige Tarif, der diese Woche wirklich zählt, ist GLMs 50%-Promo bis 9. September 2026.
Einführung in KI-Agenten
Was ist GLM-5.3-Flash?
GLM-5.3-Flash ist Z.ai's erstes nativ multimodales Modell der GLM-5-Serie, veröffentlicht am 26. August 2026 mit insgesamt 320 Milliarden Parametern und 18 Milliarden aktiven. Laut Launch-Post schlägt es GLM-5.2 auf Coding- und Agent-Benchmarks bei etwa einem Zehntel der Kosten und erreicht 57 im Artificial Analysis Intelligence Index v4.1.1 zu $0,045 pro Task im rabattierten Tarif.
Die Architektur ist die eigentliche Produktstory: hybride lineare und spärliche Attention, Manifold-Constrained Hyper-Connections (mHC), ein multimodaler Korpus mit 30 Billionen Tokens und 45 Layer statt 92 bei GLM-4.5. Z.ai lief anonym als ox-alpha auf OpenCode und OpenRouter, serviert auf chinesischen KI-Chips. Gewichte liegen auf Hugging Face unter MIT-Lizenz, mit Serving-Rezepten für SGLang, vLLM und TokenSpeed.
Mehr Details findest du in unserem separaten GLM-5.3-Flash-Guide. Zur vorherigen Generation: unser GLM-5.2-Guide und das Tutorial zum lokalen Ausführen von GLM-5 für agentisches Coding.
Was ist Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next ist Alibabas Qwen-Open-Weight-Vorschau vom 26. August 2026 für die Architektur, die für Qwen4 geplant ist. Das Hauptmodell hat 125 Milliarden Parameter, plus eine n-Gramm-Embedding-Tabelle mit 51 Milliarden Parametern; pro Token sind 6 Milliarden Parameter aktiv. Natives Kontextfenster: 262.144 Tokens, erweiterbar auf 1.000.000 mit YaRN. Qwen sagt, das Training kostete etwa ein Neuntel von Qwen3.7-Plus.
Die Produktions-SKU ist Qwen3.8-Flash auf QwenCloud, gelistet mit $0,16 pro 1M Input-Tokens und $0,47 pro 1M Output-Tokens; die API ist als bald verfügbar markiert. Die Cloud-Model-ID ist qwen3.8-flash. Wir haben bereits einen separaten Qwen3.8-Flash-Next-Guide und ein Setup-Tutorial dazu, Qwen3.8-Flash-Next lokal als Coding-Agent mit OpenCode auszuführen.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: Direktvergleich

Auf den Benchmarks, die beide Labs veröffentlicht haben, liegt GLM-5.3-Flash vorne — erwartbar, da es das größere der beiden Modelle ist. Die Preise beider Modelle sind sehr ähnlich.
| Feature | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / Datum | Z.ai, 26. August 2026 | Qwen (Alibaba), 26. August 2026 |
| Größe | 320B gesamt, 18B aktiv | 125B Haupt + 51B n-Gramm, 6B aktiv |
| Kontext | 1M Tokens nativ | 262.144 nativ; 1.000.000 mit YaRN |
| Modalitäten | Nativ multimodal (Text, Bild, Video in) | Nativ multimodales MoE |
| Gewichte | MIT, zai-org/GLM-5.3-Flash |
Open Weight, Qwen/Qwen3.8-Flash-Next |
| Gemeinsame Coding-Benchmarks | Führt DeepSWE, Toolathlon, NL2Repo | Dahinter bei diesen dreien; veröffentlicht SWE-bench Pro 62,5 |
| Office-Agent-Benchmarks | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| API-Listenpreis (pro 1M) | $0,15 in / $0,50 out | $0,16 in / $0,47 out (Qwen3.8-Flash) |
| First-Party-API | Live, glm-5.3-flash |
In der Warteschlange, qwen3.8-flash |
Coding und agentische Workflows
GLM-5.3-Flash liegt bei Coding- und Tool-Use-Scores vorn, die beide Anbieter auf denselben Zeilen ausweisen. Z.ais Tabelle vom 26. August listet DeepSWE v1.1 mit 63,4, Toolathlon Verified mit 78,4 und NL2Repo mit 56,3. Qwens Tabelle zeigt 58,7, 73,5 und 48,1 für dieselben Namen.
Darüber hinaus ist der Vergleich schwierig, da sich die ausgewählten Benchmarks unterscheiden. Qwen veröffentlichte SWE-bench Pro mit 62,5 und SWE-bench Multilingual mit 81,0. Z.ai veröffentlichte Terminal Bench 2.1 mit 84,3 und AutomationBench mit 48,8, plus ein internes Z.ai Code Bench v1.0 mit 29,0 bei Max-Effort gegen Claude Opus 4.8 mit 29,5, ausgeführt in Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Notizen |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Anbietertabellen; GLM nutzte mini-swe-agent, Qwen berichtet den höheren von Claude Code und mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM mittelt über 3 Läufe |
| NL2Repo | 56,3 | 48,1 | Qwen bezeichnet es als NL2Repo-Bench |
| SWE-bench Pro | Nicht veröffentlicht | 62,5 | Qwen hat Baselines in Claude Code neu ausgeführt |
| Terminal Bench 2.1 | 84,3 | Nicht veröffentlicht | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (Score 51,2) | Unterschiedliche Reporting-Formate |
Ich würde GLM auf dem überlappenden Set als den stärkeren veröffentlichten Coding-Agent-Flash behandeln und keinen SWE-bench-Sieger ohne Z.ais veröffentlichten Score küren.
Office-Workflows und Long-Horizon-Agents
Qwen ist das Lab, das Long-Horizon-Office-Scores veröffentlicht hat. CoWorkBench liegt bei 73,9 und JobBench bei 55,7 — weit vor Qwen3.7-Plus (65,1 und 27,6) und vor Claude Opus 4.6 Max auf diesen Zeilen (68,2 und 36,6).
Z.ais überlappende „Work“-Zahlen sind AutomationBench 48,8 und OfficeQA Pro 62,4, plus ZCode Browser Use und Computer Use für visuelle Desktop-Arbeit.
Das sind nicht dieselben Tests, also können sie keinen eindeutigen Sieger liefern. Wenn dein Mentalmodell der Aufgabe ein mehrstündiger Office-Agent ist, hat Qwen die Benchmarks geliefert. Wenn es eher um Zapier-Style-Automatisierung oder PDF-Office-QA geht, hat GLM die passenden Werte.
Architektur und Serving-Kosten
Qwen3.8-Flash-Next aktiviert 6 Milliarden Parameter pro Token. GLM-5.3-Flash aktiviert 18 Milliarden. Diese 3x-Lücke ist die klarste Hardware-Konstante im Vergleich und der Grund, warum lokale Serving-Gespräche immer wieder bei Qwen landen. In der Praxis läuft das UD-Q4_K_XL GGUF (~111GB) auf einer einzelnen 96GB-Karte mit RAM-Offload — wir haben es hier getan.
Beide nutzen hybride Attention. Z.ai sagt, GLM-5.3-Flash reduziert Attention-Compute um 3,0x und die KV-Cache-Größe um 4,4x gegenüber GLM-5.3. Qwen sagt, dass QSAs Attention-Kernel bei 1M Tokens bis zu 7,6x schneller im Prefill und 4,9x im Decode ist, sowie 8,6x Prefill-Durchsatz gegenüber Qwen3.7-Plus bei einer Prefix-Cache-Hitrate von 90%.
GLMs zusätzlicher 51B-Style-Capacity-Trick ist keine Embedding-Tabelle; Qwens 51B-n-Gramm-Tabelle ist dafür gedacht, im Host-RAM zu liegen und zu prefetchen. Unterschiedliche Rezepte, gleiche Aussage: mehr Leistung pro Watt.
Multimodale Fähigkeiten und Kontext
Beide Modelle nehmen Bilder in derselben Generation wie Text. GLM-5.3-Flash ist explizit das erste nativ multimodale Mitglied von GLM-5, trainiert auf einem multimodalen Korpus mit 30 Billionen Tokens, mit video-fähigen Vision-Reihen (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next veröffentlicht AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 und CharXiv 84,6 ohne Computer-Use-Tool / 90,6 mit Tool.
Die Kontextfenster sind so nah beieinander, dass ich nicht allein danach entscheiden würde. GLM bewirbt ein natives 1M-Token-Fenster. Qwen ist nativ bei 262.144 und streckt auf 1.000.000 mit YaRN. Reviews in den Research Notes behandeln GLMs 1M weiterhin als in der Produktion nur leicht Stresstests unterzogen.
Preise: Was du wirklich zahlst

Abseits von Promo-Tarifen kannst du die Preise der beiden Modelle kaum unterscheiden. Qwen und Z.ai zielen hier offensichtlich auf dieselbe Stufe.
Token-Tarife im Vergleich
| Tarif | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Input, pro 1M Tokens | $0,15 ($0,075 Promo) | $0,16 |
| Output, pro 1M Tokens | $0,50 ($0,25 Promo) | $0,47 |
| Gecachter Input, pro 1M Tokens | $0,03 ($0,015 Promo) | $0,016 |
| Gecachter Output, pro 1M Tokens | Kostenlos während der Promo | $0,20 |
| Launch-Promo | 50% Rabatt bis 9. September 2026, 24:00 UTC+8 | Keine veröffentlicht |
| Coding-Plan-Kontingent | 3x GLM-5.3 auf allen Planstufen | Nicht veröffentlicht |
Die Kurven verlaufen fast flach. Qwens etwas günstigerer Output hilft in generationlastigen Monaten; GLMs etwas günstigerer Input hilft beim Retrieval. Z.ai berechnet Thinking-Tokens zum Output-Tarif. Qwen dokumentiert enable_thinking und reasoning_effort auf QwenCloud ohne separaten Thinking-Token-Preis — behandle Reasoning also als Output, bis etwas anderes kommuniziert wird.
Beide Labs veröffentlichen Cache-Tarife, und sie bepreisen den Tausch unterschiedlich. Z.ai listet gecachten Input mit $0,03 pro 1M Tokens ($0,015 in der Promo) und macht Cache-Writes während der Promo kostenlos. Qwen liest Cache mit $0,016, berechnet aber $0,20 pro 1M Tokens für das explizite Erstellen eines Caches.
Damit halbiert Qwen deine Cache-Read-Kosten, und GLM verschenkt den Write. Sind deine Prefixe stabil und langlebig, gewinnt Qwens Read-Rate; schreibst du Caches oft neu, punktet GLM mit kostenlosen Writes — zumindest bis zum 9. September.
Was eine echte Last kostet
Formel: (Volumen ÷ 1M) × Tarif, summiert über Input und Output, zu Standard-Listenpreisen. Promo-Dollars bleiben außen vor.
| Workload | GLM-5.3-Flash | Qwen3.8-Flash | Unterschied |
|---|---|---|---|
| Ausgeglichen: 1M in / 250K out | $0,28 | $0,28 | $0,00 (0%) |
| Generation-lastig: 1M in / 4M out | $2,15 | $2,04 | Qwen $0,11 günstiger (5%) |
| Retrieval, unter Schwelle: 10M in / 1M out | $2,00 | $2,07 | GLM $0,07 günstiger (3%) |
Die API-Listenpreise sind praktisch ein Unentschieden. Die Entscheidung hängt vom Workload-Fit und der Verfügbarkeit des Endpunkts ab. Beide Modelle nutzen anbieter-spezifische Tokenizer, und keines der Labs veröffentlichte Token-Zählungen für eine gemeinsame Last — behandle die Summen daher als Tarifvergleich, nicht als Rechnung. Bis 9. September 2026 halbiert GLMs Promo die GLM-Spalten ($0,14, $1,08, $1,00).
Wann GLM-5.3-Flash vs. Qwen3.8-Flash-Next wählen

Wenn du diese Woche eine First-Party-API aufrufen musst, ist GLM-5.3-Flash das einzige vollständige Produkt im Duo. Wenn du Qwen4s Architektur evaluierst oder dir CoWorkBench und JobBench wichtig sind, starte jetzt mit den Qwen3.8-Flash-Next-Gewichten und füge qwen3.8-flash hinzu, sobald es auf QwenCloud verfügbar ist.
Wähle GLM-5.3-Flash, wenn ...
-
Du
glm-5.3-flashauf Z.ai oderz-ai/glm-5.3-flashauf OpenRouter brauchst — ohne auf eine Cloud-SKU in der Warteschlange zu warten. -
Dein Eval-Set wie DeepSWE, Toolathlon, NL2Repo oder Terminal Bench 2.1 aussieht und du das Lab willst, das die höheren überlappenden Scores veröffentlicht hat.
-
Du MIT-Gewichte und ein natives 1M-Token-Fenster möchtest und mit 18B aktiven Parametern einverstanden bist.
-
Du bereits einen GLM Coding Plan nutzt und das 3x-Kontingent gegenüber GLM-5.3 verwenden kannst, inklusive der Promo bis 9. September 2026.
- Du visuelle Desktop-Agents willst. ZCodes Browser Use und Computer Use stehen im Launch-Post, und Qwens Gegenwert ist OSWorld 2.0 mit 19,4 — das ist kein Pokal.
Wähle Qwen3.8-Flash-Next, wenn ...
-
Du eine Qwen4-Vorschau kaufst, keine fertige gemanagte API. Die Gewichte sind heute das Produkt.
-
Office-Agent-Benchmarks die sind, die du wirklich liest. CoWorkBench und JobBench sind Qwens veröffentlichte Story, nicht GLMs.
-
Du 6B aktive Parameter willst und eine n-Gramm-Tabelle, die im Host-Speicher liegen kann — auch neben einem lokalen Qwen3.8-27B-Setup.
-
Du bereits in Qwen Chat, Qwen Studio, Qwen Code lebst oder heute jeden OpenAI-kompatiblen Agenten (OpenCode, Codex, Qwen Code) auf einen lokalen llama.cpp-Endpunkt zeigen kannst. Claude Code braucht einen Übersetzungs-Proxy.
So startest du mit GLM-5.3-Flash und Qwen3.8-Flash-Next
| Surface | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Consumer-App | Z.ai Web-Playground und GLM Coding Plan | Qwen Chat und Qwen Studio |
| First-Party-API | Ja, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API kommt bald) |
| Cloud-Plattformen | Nicht verfügbar auf Bedrock, Vertex AI oder Azure AI Foundry | Nicht verfügbar auf Bedrock, Vertex AI oder Azure AI Foundry |
| Coding-Agents | ZCode; OpenRouter in IDEs, die Custom-Provider akzeptieren. Nicht nativ in Claude Code, GitHub Copilot oder Cursor | Funktioniert heute via lokales llama.cpp + OpenCode; gleiche Anbindung gilt für QwenCloud, wenn live. Nicht nativ in Claude Code, GitHub Copilot oder Cursor |
| Third-Party-Router | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| API-Model-ID | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash auf QwenCloud und OpenRouter; Gewichte Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash ist jetzt aufrufbar. Qwen3.8-Flash-Next auch — allerdings nur auf deiner eigenen Hardware oder über Router wie OpenRouter. Qwens eigener API-Endpunkt sollte bald folgen.
Tippe diese IDs exakt. Qwen3.8-Flash-Nexts ID ist qwen3.8-flash (ohne „next“), also erfinde keine Cloud-ID qwen3.8-flash-next aus dem Gewichtsnamen.
Deinen ersten API-Call machen
Beide Modelle sprechen das OpenAI-Chat-Completions-Format, also nutzt du in beiden Fällen denselben Standard-Client. Am schnellsten testest du sie Seite an Seite über OpenRouter: Beide liegen hinter derselben Base-URL, nur der Model-String ändert sich.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
First-Party zu gehen, kostet Portabilität. Z.ais Endpoint lebt unter docs.z.ai und erwartet thinking: {"type": "enabled"} mit reasoning_effort auf low, high oder max. Alibabas nimmt enable_thinking mit reasoning_effort standardmäßig auf xhigh, gegen eine DashScope-Base-URL (international, Beijing oder Virginia). Es ist in beiden Fällen dasselbe SDK, aber der Reasoning-Drehregler ist nicht portabel — plane also einen kleinen Adapter ein, wenn du wechseln möchtest.
Für einen vollständigen Qwen-Walkthrough lies unser Tutorial, wie du Qwen3.8-Flash-Next lokal ausführst, und das Qwen Code CLI-Tutorial. Für lokales Serving der GLM-Familie nutze Run GLM-5 Locally For Agentic Coding. Wenn du bereits auf einer Qwen3.8-27B-Box arbeitest, ist unser RTX 5090 Setup der verwandte lokale Pfad — nicht diese 125B-Vorschau.
Fazit
Wenn du diese Woche gegen eine Live-Flash-API ausliefern musst, nimm GLM-5.3-Flash. Wenn du Qwen4 studierst oder CoWorkBench mehr traust als DeepSWE, nutze Qwen3.8-Flash-Next lokal und wechsle auf die API qwen3.8-flash, sobald sie verfügbar ist.
Am interessantesten finde ich, wie wenig sich die Listenpreise unterscheiden. Die Diskussion dreht sich um Zugriff und darum, welche unveröffentlichte Zeile du ignorierst — nicht um eine 2x-Kostenklippe.
Wenn du die Konzepte hinter beiden MoEs verstehen willst, empfehle ich unseren Kurs Large Language Models (LLMs) Concepts und anschließend den Lernpfad AI Agent Fundamentals. Für Hub-und-Gewichte-Arbeit ist Working with Hugging Face der praktische nächste Schritt.
FAQs
Wann sollte ich GLM-5.3-Flash statt Qwen3.8-Flash-Next verwenden?
Nutze GLM-5.3-Flash, wenn du diese Woche eine Live-First-Party-API brauchst, MIT-lizenzierte Gewichte oder die höheren überlappenden Coding-Scores (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).
Nutze Qwen3.8-Flash-Next, wenn du die Qwen4-Architekturvorschau lokal laufen lassen willst, effizientere 6B aktive Parameter möchtest oder das Modell in einem Office-Agent-Setup einsetzen willst (CoWorkBench 73,9, JobBench 55,7).
Wo kann ich auf GLM-5.3-Flash und Qwen3.8-Flash-Next zugreifen?
GLM-5.3-Flash ist auf Z.ai als glm-5.3-flash, im GLM Coding Plan und auf OpenRouter als z-ai/glm-5.3-flash verfügbar. Gewichte liegen auf Hugging Face unter MIT-Lizenz.
Qwen3.8-Flash-Next-Gewichte liegen auf Hugging Face und ModelScope. Die Produktions-API ist Qwen3.8-Flash auf QwenCloud als qwen3.8-flash, als bald verfügbar markiert, aber du kannst bereits über OpenRouter zugreifen. Qwen Chat und Qwen Studio sind die Consumer-Oberflächen.
Wie schneiden GLM-5.3-Flash und Qwen3.8-Flash-Next beim Coding ab?
Auf den Coding-Benchmarks, die beide Labs veröffentlicht haben, liegt GLM-5.3-Flash vorne: DeepSWE v1.1 63,4 vs. 58,7, Toolathlon Verified 78,4 vs. 73,5 und NL2Repo 56,3 vs. 48,1. Die Harnesses sind nicht identisch.
Was sind die API-Model-IDs für GLM-5.3-Flash und Qwen3.8-Flash-Next?
GLM-5.3-Flash ist glm-5.3-flash auf Z.ai und z-ai/glm-5.3-flash auf OpenRouter.
Die QwenCloud-Produktions-ID ist qwen3.8-flash, nicht qwen3.8-flash-next als Cloud-ID. Die offenen Gewichte sind Qwen/Qwen3.8-Flash-Next.
Ist Qwen3.8-Flash-Next dasselbe wie Qwen3.8-Flash?
Nein. Qwen3.8-Flash-Next ist die Open-Weight-Architekturvorschau. Qwen3.8-Flash ist die Produktions-SKU auf QwenCloud, gelistet mit $0,16 / $0,47 pro 1M Tokens, mit standardmäßig 1M Kontext und offiziellen integrierten Tools. Die API war am 26. August 2026 als bald verfügbar markiert.
Datenwissenschaftsredakteur bei DataCamp | Prognosen erstellen und mit APIs arbeiten ist genau mein Ding.
