Ga naar hoofdinhoud

GLM-5.3-Flash vs Qwen3.8-Flash-Next: coderen, kosten en toegang

De nieuwste modellen van Z.ai en Alibaba mikken op hetzelfde segment. GLM-5.3-Flash leidt gedeelde codebenchmarks en is live; Qwen3.8-Flash-Next is de lichtgewicht Qwen4-preview met een API in de wachtrij.
Bijgewerkt 31 aug 2026  · 11 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

Op 26 augustus 2026 lanceerde Z.ai GLM-5.3-Flash en maakte Alibaba’s Qwen-team de gewichten van Qwen3.8-Flash-Next openbaar. Beide zijn open-weight, native multimodale mixture-of-experts (MoE)-modellen die gepositioneerd zijn als Flash-klasse kostenmodellen, niet als een goedkope restvariant.

Flash betekende ooit “de dunne”. Deze twee zijn de efficiency-inzetten van de labs voor code-agents en long-context serving, uitgebracht binnen hetzelfde etmaal. De combinatie is expres ongemakkelijk: ze publiceren niet dezelfde benchmarks, en slechts één first-party API is vandaag live.

TL;DR

  • GLM-5.3-Flash leidt op de code- en tool-use-benchmarks die beide labs publiceerden.
  • Kies GLM-5.3-Flash als je een live API nodig hebt, MIT-gelicentieerde gewichten en een venster van 1M tokens zonder YaRN.
  • Kies Qwen3.8-Flash-Next als je zelf kunt hosten (de gewichten draaien vandaag met llama.cpp) of als je kunt wachten op de beheerde QwenCloud API.
  • Catalogusprijzen liggen op een paar cent na gelijk; GLM’s 50%-promo t/m 9 september 2026 is de enige tariefwijziging die deze week je rekening beïnvloedt.

Wat is GLM-5.3-Flash?

GLM-5.3-Flash is Z.ai’s eerste native multimodale model in de GLM-5-serie, uitgebracht op 26 augustus 2026 met 320 miljard totale parameters en 18 miljard actief. In Z.ai’s lancering staat dat het GLM-5.2 verslaat op code- en agentbenchmarks tegen ongeveer een tiende van de prijs, en dat het 57 scoort op de Artificial Analysis Intelligence Index v4.1.1 voor $0,045 per taak in de kortingslaag.

De architectuur is het echte productverhaal: hybride lineaire en sparse attention, Manifold-Constrained Hyper-Connections (mHC), een multimodaal corpus van 30 biljoen tokens, en 45 lagen in plaats van de 92 van GLM-4.5. Z.ai draaide het anoniem als ox-alpha op OpenCode en OpenRouter voordat het werd benoemd, geserveerd op Chinese AI-chips. Gewichten staan op Hugging Face onder een MIT-licentie, met serving-recepten voor SGLang, vLLM en TokenSpeed.

Lees meer in onze aparte GLM-5.3-Flash-gids. Voor de vorige generatie: bekijk onze GLM-5.2-gids en onze tutorial over GLM-5 lokaal draaien voor agentisch coderen.

Wat is Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next is het open-weight previewmodel van Alibaba’s Qwen-team van 26 augustus 2026 voor de architectuur die gepland is voor Qwen4. Het hoofdmodel heeft 125 miljard parameters, plus een n-gram embeddingtabel van 51 miljard parameters, met 6 miljard parameters actief per token. De native context is 262.144 tokens, uitbreidbaar tot 1.000.000 met YaRN. Qwen zegt dat de trainingskosten ongeveer een negende zijn van Qwen3.7-Plus.

De productie-SKU is Qwen3.8-Flash op QwenCloud, geprijsd op $0,16 per 1M invoertokens en $0,47 per 1M uitvoertokens, met de API gemarkeerd als binnenkort beschikbaar. De cloudmodel-ID is qwen3.8-flash. We schreven al een aparte Qwen3.8-Flash-Next-gids en een set-uptutorial over hoe je Qwen3.8-Flash-Next lokaal draait als code-agent met OpenCode.

GLM-5.3-Flash vs Qwen3.8-Flash-Next: vergelijking head-to-head

GLM leidt gedeelde codebenchmarks; Qwen is de wachtrij-API

Op de benchmarks die beide labs publiceerden, ligt GLM-5.3-Flash voor, zoals je zou verwachten omdat het het grotere model van de twee is. De prijsstelling van beide modellen is erg vergelijkbaar.

Feature GLM-5.3-Flash Qwen3.8-Flash-Next
Lab / datum Z.ai, 26 augustus 2026 Qwen (Alibaba), 26 augustus 2026
Grootte 320B totaal, 18B actief 125B hoofd + 51B n-gram, 6B actief
Context 1M tokens native 262.144 native; 1.000.000 met YaRN
Modaliteiten Native multimodaal (tekst, afbeelding, video in) Native multimodale MoE
Gewichten MIT, zai-org/GLM-5.3-Flash Open weight, Qwen/Qwen3.8-Flash-Next
Gedeelde codebenchmarks Leidt DeepSWE, Toolathlon, NL2Repo Loopt achter op die drie; publiceerde SWE-bench Pro 62.5
Office-agent-benchmarks AutomationBench 48.8; OfficeQA Pro 62.4 CoWorkBench 73.9; JobBench 55.7
API-catalogusprijs (per 1M) $0,15 in / $0,50 uit $0,16 in / $0,47 uit (Qwen3.8-Flash)
First-party API Live, glm-5.3-flash In de wachtrij, qwen3.8-flash

Coderen en agentische workflows

GLM-5.3-Flash leidt de code- en tool-use-scores die beide leveranciers op dezelfde rij zetten. Z.ai’s tabel van 26 augustus vermeldt DeepSWE v1.1 op 63,4, Toolathlon Verified op 78,4 en NL2Repo op 56,3. Qwen’s tabel noteert 58,7, 73,5 en 48,1 op diezelfde namen.

Afgezien daarvan is de vergelijking lastig omdat de gekozen benchmarks verschillen tussen de twee leveranciers. Qwen publiceerde SWE-bench Pro op 62,5 en SWE-bench Multilingual op 81,0. Z.ai publiceerde wel Terminal Bench 2.1 op 84,3 en AutomationBench op 48,8, plus een interne Z.ai Code Bench v1.0-score van 29,0 bij maximale inspanning tegenover 29,5 voor Claude Opus 4.8, gedraaid in Claude Code 2.1.207.

Benchmark GLM-5.3-Flash Qwen3.8-Flash-Next Notities
DeepSWE v1.1 63,4 58,7 Leverancierstabellen; GLM gebruikte mini-swe-agent, Qwen rapporteert de hoogste van Claude Code en mini-SWE-agent
Toolathlon Verified 78,4 73,5 Pass@1; GLM gemiddeld over 3 runs
NL2Repo 56,3 48,1 Qwen labelt het als NL2Repo-Bench
SWE-bench Pro Niet gepubliceerd 62,5 Qwen her-runde baselines in Claude Code
Terminal Bench 2.1 84,3 Niet gepubliceerd Z.ai, Claude Code 2.1.207
Agents' Last Exam 26,3 24,3 pass@1 (score 51,2) Rapportageformaten verschillen

Ik zou GLM behandelen als de sterkere gepubliceerde code-agent-Flash op de overlappende set, en geen SWE-bench-winnaar aanwijzen zonder Z.ai’s gepubliceerde score.

Officewerk en long-horizon-agents

Qwen is het lab dat long-horizon-kantoorscores publiceerde. CoWorkBench is 73,9 en JobBench is 55,7, beide mijlen voor op Qwen3.7-Plus (65,1 en 27,6) en op Claude Opus 4.6 Max op die rijen (68,2 en 36,6).

Z.ai’s overlappende “werk”-cijfers zijn AutomationBench 48,8 en OfficeQA Pro 62,4, plus ZCode Browser Use en Computer Use voor visueel desktopwerk.

Dat zijn niet dezelfde tests, dus ze wijzen geen winnaar aan. Als je mentale model van de taak een meerurige office-agent is, gaf Qwen je de benches. Als het gaat om Zapier-stijl automatisering of PDF office QA, gaf GLM je die.

Architectuur en serveerkosten

Qwen3.8-Flash-Next activeert 6 miljard parameters per token. GLM-5.3-Flash activeert 18 miljard. Dat 3x verschil is het duidelijkste hardwarefeit in deze vergelijking, en het is waarom lokale serving-gesprekken steeds bij Qwen uitkomen. In de praktijk draait de UD-Q4_K_XL GGUF (~111GB) op één 96GB-kaart met RAM-offload — wij deden het hier.

Beiden gebruiken hybride attention. Z.ai zegt dat GLM-5.3-Flash de attentioncompute 3,0x en de KV-cachegrootte 4,4x verlaagt ten opzichte van GLM-5.3. Qwen zegt dat QSA’s attention-kernel tot 7,6x sneller is in prefill en 4,9x in decode bij 1M tokens, en 8,6x de prefill-throughput van Qwen3.7-Plus bij een prefix-cache-hit-rate van 90%.

GLM’s extra 51B-achtige capaciteitsfoefje is geen embeddingtabel; Qwen’s 51B n-gramtabel is ontworpen om in host-RAM te leven en te prefetch-en. Andere recepten, dezelfde belofte: meer capaciteit per watt.

Multimodale capaciteiten en context

Beide modellen nemen afbeeldingen in binnen dezelfde generatie als tekst. GLM-5.3-Flash is expliciet het eerste native multimodale lid van GLM-5, getraind op een multimodaal corpus van 30 biljoen tokens, met vision-rijen die videovaardig zijn (MVBench 77,8, MMVU 80,5).

Qwen3.8-Flash-Next publiceert AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 en CharXiv 84,6 zonder computer-use-tool / 90,6 met een tool.

De contextvenstergrootte ligt dicht genoeg bij elkaar dat ik er niet op zichzelf op zou kiezen. GLM adverteert een native venster van 1M tokens. Qwen is native op 262.144 en rekt op tot 1.000.000 met YaRN. Beoordelingen in de onderzoeksnotities behandelen GLM’s 1M nog als licht beproefd in productie.

Prijzen: wat je daadwerkelijk betaalt

Catalogusprijzen zijn gelijkspel, goedkoper model wisselt per workload

Promotietarieven daargelaten, je kunt de prijs van de twee modellen bijna niet onderscheiden. Qwen en Z.ai mikken hier duidelijk op dezelfde laag.

Token-tarieven naast elkaar

Tarief GLM-5.3-Flash Qwen3.8-Flash
Input, per 1M tokens $0,15 ($0,075 promo) $0,16
Output, per 1M tokens $0,50 ($0,25 promo) $0,47
Gecachte input, per 1M tokens $0,03 ($0,015 promo) $0,016
Gecachte output, per 1M tokens Gratis tijdens promo $0,20
Launchpromo 50% korting t/m 9 september 2026, 24:00 UTC+8 Niet gepubliceerd
Coding Plan-quota 3x GLM-5.3 op alle planniveaus Niet gepubliceerd

Het profiel is bijna vlak. Qwen’s iets goedkopere output helpt in generatierijke maanden; GLM’s iets goedkopere input helpt bij retrieval. Z.ai rekent denktokens af tegen het outputtarief. Qwen documenteert enable_thinking en reasoning_effort op QwenCloud zonder aparte prijs voor denktokens, dus behandel reasoning als output totdat ze anders zeggen.

Beide labs publiceren cachetarieven, en ze prijzen de trade-off anders. Z.ai vermeldt gecachte input op $0,03 per 1M tokens ($0,015 in de promo) en maakt cachewrites gratis tijdens het promovenster. Qwen leest cache op $0,016 maar rekent $0,20 per 1M tokens om een expliciete cache aan te maken.

Dus Qwen halveert je cache-read-tarief, en GLM geeft de write weg. Als je prefixes stabiel en langlevend zijn, wint Qwen’s read-tarief; als je vaak caches herschrijft, wint GLM’s gratis writes, in elk geval tot 9 september.

Wat een echte workload kost

Formule: (volume ÷ 1M) × tarief, opgeteld over input en output, tegen standaard catalogustarieven. Promodollars blijven buiten de tabel.

Workload GLM-5.3-Flash Qwen3.8-Flash Verschil
Gebalanceerde assistent: 1M in / 250K uit $0,28 $0,28 $0,00 (0%)
Generatiezwaar: 1M in / 4M uit $2,15 $2,04 Qwen $0,11 goedkoper (5%)
Retrieval, onder drempel: 10M in / 1M uit $2,00 $2,07 GLM $0,07 goedkoper (3%)

API-cataloguskosten zijn lood om oud ijzer. De keuze hangt af van de workload-fit en of het endpoint bestaat. Beide modellen gebruiken leverancier-specifieke tokenizers, en geen van beide labs publiceerde tokentellingen voor een gedeelde workload, dus behandel deze totalen als een tariefvergelijking in plaats van een rekening. Tot en met 9 september 2026 halveert GLM’s promo die GLM-kolomtotaalbedragen ($0,14, $1,08, $1,00).

Wanneer kies je voor GLM-5.3-Flash vs Qwen3.8-Flash-Next

Kies GLM voor een live API, Qwen voor office-agents

Als je deze week een first-party API moet aanroepen, is GLM-5.3-Flash het enige complete product van de twee. Als je de architectuur van Qwen4 evalueert, of als je waarde hecht aan CoWorkBench en JobBench, begin dan nu met de Qwen3.8-Flash-Next-gewichten en voeg qwen3.8-flash toe zodra die beschikbaar is op QwenCloud.

Kies GLM-5.3-Flash als...

  • Je glm-5.3-flash op Z.ai nodig hebt, of z-ai/glm-5.3-flash op OpenRouter, zonder te wachten op een cloud-SKU in de wachtrij.

  • Je evalset lijkt op DeepSWE, Toolathlon, NL2Repo of Terminal Bench 2.1, en je het lab wilt dat de hogere overlappende scores publiceerde.

  • Je MIT-gewichten wilt en een native venster van 1M tokens, en het prima vindt om 18B parameters te activeren.

  • Je al op een GLM Coding Plan zit en de 3x quota t.o.v. GLM-5.3 kunt gebruiken, inclusief de promo t/m 9 september 2026.

  • Je visuele desktopagents wilt. ZCode’s Browser Use en Computer Use staan in de launchpost, en Qwen’s tegengetal is OSWorld 2.0 op 19,4, wat geen trofee is.

Kies Qwen3.8-Flash-Next als...

  • Je een Qwen4-preview koopt, geen afgewerkte beheerde API. De gewichten zijn vandaag het product.

  • Office-agent-benchmarks zijn degene die je echt leest. CoWorkBench en JobBench zijn Qwen’s gepubliceerde verhaal, niet dat van GLM.

  • Je 6B actieve parameters wilt en een n-gramtabel die in het hostgeheugen kan staan, ook naast een lokale Qwen3.8-27B-setup.

  • Je al werkt in Qwen Chat, Qwen Studio, Qwen Code, of vandaag een OpenAI-compatibele agent (OpenCode, Codex, Qwen Code) richt op een lokale llama.cpp-endpoint. Claude Code heeft een vertaalproxy nodig.

Hoe je begint met GLM-5.3-Flash en Qwen3.8-Flash-Next

Surface GLM-5.3-Flash Qwen3.8-Flash-Next
Consumentenapp Z.ai web playground en GLM Coding Plan Qwen Chat en Qwen Studio
First-party API Ja, Z.ai, glm-5.3-flash QwenCloud qwen3.8-flash (API binnenkort)
Cloudplatforms Niet beschikbaar op Bedrock, Vertex AI of Azure AI Foundry Niet beschikbaar op Bedrock, Vertex AI of Azure AI Foundry
Code-agents ZCode; OpenRouter naar IDE’s die custom providers accepteren. Niet native in Claude Code, GitHub Copilot of Cursor Werkt vandaag via lokale llama.cpp + OpenCode; dezelfde bedrading geldt voor QwenCloud zodra live. Niet native in Claude Code, GitHub Copilot of Cursor
Routers van derden OpenRouter, DeepInfra, Together.ai OpenRouter
API-model-ID glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) qwen3.8-flash op QwenCloud en OpenRouter; gewichten Qwen/Qwen3.8-Flash-Next

GLM-5.3-Flash is nu aanroepbaar. Qwen3.8-Flash-Next ook, maar dan op je eigen hardware of via routers zoals OpenRouter. Qwen’s eigen API-endpoint volgt waarschijnlijk snel.

Typ die ID’s exact. De ID van Qwen3.8-Flash-Next is qwen3.8-flash (zonder “next”), dus verzin geen cloud-ID qwen3.8-flash-next op basis van de gewichtnaam.

Je eerste API-call maken

Beide modellen spreken het OpenAI chat completions-formaat, dus je hergebruikt in beide gevallen de standaardclient. De snelste manier om ze naast elkaar te proberen is OpenRouter, waar beide achter één base-URL zitten en de modelstring het enige is dat je wijzigt.

from openai import OpenAI
import os

# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",  # or "qwen/qwen3.8-flash"
    messages=[{"role": "user", "content": "Refactor this function..."}],
    extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)

First-party gaan kost je de portabiliteit. Z.ai’s endpoint staat op docs.z.ai en accepteert thinking: {"type": "enabled"} met reasoning_effort ingesteld op low, high of max. Dat van Alibaba accepteert enable_thinking met reasoning_effort standaard op xhigh, tegen een DashScope-base-URL (internationaal, Peking of Virginia). Het is dezelfde SDK, maar de reasoning-knop is niet uitwisselbaar, dus voorzie een kleine adapter als je wilt kunnen wisselen.

Voor een volledige Qwen-walkthrough, lees onze tutorial over Qwen3.8-Flash-Next lokaal draaien en de Qwen Code CLI-tutorial. Voor lokale serving van de GLM-familie: gebruik Run GLM-5 Locally For Agentic Coding. Als je al op een Qwen3.8-27B-machine zit, is onze RTX 5090-setup het zusterpad voor lokaal, niet deze 125B-preview.

Slotgedachten

Als je deze week tegen een live Flash-API moet leveren, gebruik GLM-5.3-Flash. Als je Qwen4 bestudeert of je gelooft meer in CoWorkBench dan in DeepSWE, gebruik dan lokaal de Qwen3.8-Flash-Next-gewichten en schakel over op qwen3.8-flash via API zodra die er is.

Wat ik het interessantst vind, is hoe weinig de catalogusprijzen verschillen. De discussie gaat over toegang en welke niet-gepubliceerde rij je wilt negeren, niet over een 2x-kostenkloof.

Als je de concepten onder beide MoE’s wilt, raad ik onze cursus Large Language Models (LLMs) Concepts aan, en daarna de track AI Agent Fundamentals. Voor hub-and-weights-werk is Working with Hugging Face de praktische volgende stap.

FAQs

Wanneer moet ik GLM-5.3-Flash gebruiken in plaats van Qwen3.8-Flash-Next?

Gebruik GLM-5.3-Flash als je deze week een live first-party API nodig hebt, MIT-gelicentieerde gewichten, of de hogere overlappende codescores (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).

Gebruik Qwen3.8-Flash-Next als je de Qwen4-architectuurpreview lokaal wilt draaien, efficiëntere 6B actieve parameters wilt, of het model in een office-agent-setup wilt gebruiken (CoWorkBench 73,9, JobBench 55,7).

Waar kan ik GLM-5.3-Flash en Qwen3.8-Flash-Next gebruiken?

GLM-5.3-Flash is live op Z.ai als glm-5.3-flash, op het GLM Coding Plan, en op OpenRouter als z-ai/glm-5.3-flash. Gewichten staan op Hugging Face onder een MIT-licentie.

Qwen3.8-Flash-Next-gewichten staan op Hugging Face en ModelScope. De productie-API is Qwen3.8-Flash op QwenCloud als qwen3.8-flash, gemarkeerd als binnenkort, maar je kunt het model nu al via OpenRouter benaderen. Qwen Chat en Qwen Studio zijn de consumentenzijde.

Hoe vergelijken GLM-5.3-Flash en Qwen3.8-Flash-Next op coderen?

Op de codebenchmarks die beide labs publiceerden, ligt GLM-5.3-Flash voor: DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5, en NL2Repo 56,3 vs 48,1. Harnesses zijn niet identiek.

Wat zijn de API-model-ID’s voor GLM-5.3-Flash en Qwen3.8-Flash-Next?

GLM-5.3-Flash is glm-5.3-flash op Z.ai en z-ai/glm-5.3-flash op OpenRouter.

De productie-ID op QwenCloud is qwen3.8-flash, niet een cloud-ID qwen3.8-flash-next. De open gewichten zijn Qwen/Qwen3.8-Flash-Next.

Is Qwen3.8-Flash-Next hetzelfde als Qwen3.8-Flash?

Nee. Qwen3.8-Flash-Next is de open-weight architectuurpreview. Qwen3.8-Flash is de productie-SKU op QwenCloud, geprijsd op $0,16 / $0,47 per 1M tokens, met een standaard 1M context en officiële ingebouwde tools. De API stond op 26 augustus 2026 gemarkeerd als binnenkort.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom is data scientist en technisch docent. Hij schrijft en beheert de data science-tutorials en blogposts van DataCamp. Eerder werkte Tom in data science bij Deutsche Telekom.

Onderwerpen

Leer AI met DataCamp!

Leerpad

Associate AI Engineer voor ontwikkelaars

26 Hr
Leer hoe je AI in softwareapplicaties kunt integreren met behulp van API's en open-sourcebibliotheken. Begin vandaag nog aan je reis om AI-ingenieur te worden!
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow
Gerelateerd

blog

AI vanaf nul leren in 2026: een complete gids van de experts

Ontdek alles wat je moet weten om in 2026 AI te leren, van tips om te beginnen tot handige resources en inzichten van industrie-experts.
Adel Nehme's photo

Adel Nehme

15 min

Meer ZienMeer Zien