track
Den 26 augusti 2026 släppte Z.ai GLM-5.3-Flash och Alibabas Qwen-team öppnade vikterna för Qwen3.8-Flash-Next. Båda är öppen-vikt, nativt multimodala mixture-of-experts-modeller (MoE) som säljs som Flash-klassade kostnadsalternativ, inte som billigare restprodukter.
Flash brukade betyda ”den slimmade”. De här två är labbens satsningar på effektivitet för kodningsagenter och servering med långt kontextfönster, släppta inom samma 24 timmar. Parningen är avsiktligt skev: de publicerar inte samma bänkar, och bara ett förstaparts-API är live idag.
TL;DR
- GLM-5.3-Flash leder kodnings- och verktygsbänkarna som båda labben publicerade.
- Välj GLM-5.3-Flash när du behöver ett live-API, MIT-licensierade vikter och ett 1M-tokenfönster utan YaRN.
- Välj Qwen3.8-Flash-Next om du kan köra själv (vikterna fungerar idag med llama.cpp) eller om du kan vänta på det hanterade QwenCloud-API:et.
- Listpriserna ligger inom några cent; GLM:s 50 % kampanj till och med 9 september 2026 är den enda tariff som märkbart ändrar en faktura denna vecka.
Vad är GLM-5.3-Flash?
GLM-5.3-Flash är Z.ais första nativt multimodala modell i GLM-5-serien, släppt den 26 augusti 2026 med totalt 320 miljarder parametrar och 18 miljarder aktiva. Z.ais lanseringsinlägg säger att den slår GLM-5.2 på kodnings- och agentbänkar till ungefär en tiondel av priset, och får 57 på Artificial Analysis Intelligence Index v4.1.1 till $0,045 per uppgift på rabatterad nivå.
Arkitekturen är den verkliga produktberättelsen: hybrid linjär och gles uppmärksamhet, Manifold-Constrained Hyper-Connections (mHC), ett multimodalt korpus på 30 biljoner token och 45 lager istället för GLM-4.5:s 92. Z.ai körde den anonymt som ox-alpha på OpenCode och OpenRouter innan den namngavs, serverad på kinesiska AI-kretsar. Vikter finns på Hugging Face under en MIT-licens, med serveringsrecept för SGLang, vLLM och TokenSpeed.
Läs fler detaljer i vår fristående guide till GLM-5.3-Flash. För föregående generation, se vår guide till GLM-5.2 och vår handledning om att köra GLM-5 lokalt för agentisk kodning.
Vad är Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next är Alibabas Qwen-teams öppen-vikt-förhandsvisning den 26 augusti 2026 av den arkitektur som planeras för Qwen4. Huvudmodellen har 125 miljarder parametrar, plus en n-gram-inbäddningstabell på 51 miljarder parametrar, med 6 miljarder parametrar aktiva per token. Inbyggt kontextfönster är 262 144 token, förlängningsbart till 1 000 000 med YaRN. Qwen säger att träningskostnaden var ungefär en niondel av Qwen3.7-Plus.
Produktions-SKU:n är Qwen3.8-Flash på QwenCloud, listad till $0,16 per 1M indata-token och $0,47 per 1M utdata-token, med API markerat som ”kommer snart”. Molnmodell-ID är qwen3.8-flash. Vi har redan skrivit en fristående guide till Qwen3.8-Flash-Next och en installationshandledning om hur du kör Qwen3.8-Flash-Next som en lokal kodningsagent med OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: direkt jämförelse

På de riktmärken som båda labben publicerade ligger GLM-5.3-Flash före, vilket man kan förvänta sig då det är den större modellen av de två. Prissättningen för båda modellerna är mycket likartad.
| Funktion | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / datum | Z.ai, 26 augusti 2026 | Qwen (Alibaba), 26 augusti 2026 |
| Storlek | 320B totalt, 18B aktiva | 125B huvud + 51B n-gram, 6B aktiva |
| Kontext | 1M token inbyggt | 262 144 inbyggt; 1 000 000 med YaRN |
| Modaliteter | Nativt multimodal (text, bild, video in) | Nativt multimodal MoE |
| Vikter | MIT, zai-org/GLM-5.3-Flash |
Öppen vikt, Qwen/Qwen3.8-Flash-Next |
| Delade kodningsbänkar | Leder DeepSWE, Toolathlon, NL2Repo | Ligger efter på de tre; publicerade SWE-bench Pro 62,5 |
| Office-agent-bänkar | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| API-listpris (per 1M) | $0,15 in / $0,50 ut | $0,16 in / $0,47 ut (Qwen3.8-Flash) |
| Förstaparts-API | Live, glm-5.3-flash |
I kö, qwen3.8-flash |
Kodning och agentiska arbetsflöden
GLM-5.3-Flash leder kodnings- och verktygsresultaten som båda leverantörerna satte på samma rad. Z.ais tabell från 26 augusti listar DeepSWE v1.1 på 63,4, Toolathlon Verified på 78,4 och NL2Repo på 56,3. Qwens tabell listar 58,7, 73,5 och 48,1 på samma namn.
Utöver dessa är jämförelsen svår eftersom de valda riktmärkena skiljer sig mellan leverantörerna. Qwen publicerade SWE-bench Pro på 62,5 och SWE-bench Multilingual på 81,0. Z.ai publicerade Terminal Bench 2.1 på 84,3 och AutomationBench på 48,8, plus ett internt Z.ai Code Bench v1.0-resultat på 29,0 vid max ansträngning mot Claude Opus 4.8:s 29,5, kört i Claude Code 2.1.207.
| Riktmärke | GLM-5.3-Flash | Qwen3.8-Flash-Next | Noteringar |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Leverantörstabeller; GLM använde mini-swe-agent, Qwen rapporterar det högre av Claude Code och mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM snittar 3 körningar |
| NL2Repo | 56,3 | 48,1 | Qwen märker det som NL2Repo-Bench |
| SWE-bench Pro | Inte publicerat | 62,5 | Qwen körde om baslinjer i Claude Code |
| Terminal Bench 2.1 | 84,3 | Inte publicerat | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (poäng 51,2) | Rapporteringsformaten skiljer sig |
Jag skulle behandla GLM som den starkare publicerade kodningsagent-Flash på den överlappande uppsättningen, och avstå från att utse en SWE-bench-vinnare utan Z.ais publicerade poäng.
Kontorsarbete och långhorisont-agenter
Qwen är labbet som publicerade långhorisont-poäng för kontorsarbete. CoWorkBench är 73,9 och JobBench är 55,7, båda långt före Qwen3.7-Plus (65,1 och 27,6) och före Claude Opus 4.6 Max på de raderna (68,2 och 36,6).
Z.ais överlappande ”work”-siffror är AutomationBench 48,8 och OfficeQA Pro 62,4, plus ZCode Browser Use och Computer Use för visuellt skrivbordsarbete.
Det är inte samma tester, så de avgör ingen vinnare. Om din mentala modell av jobbet är en flertimmars kontorsagent gav Qwen dig bänkarna. Om det är automation i Zapier-stil eller PDF-byråfrågor gav GLM dig dem.
Arkitektur och serveringskostnad
Qwen3.8-Flash-Next aktiverar 6 miljarder parametrar per token. GLM-5.3-Flash aktiverar 18 miljarder. Det 3x-gapet är den renaste hårdvarufakten i paret, och det är därför samtal om lokal servering fortsätter att landa på Qwen. I praktiken kör UD-Q4_K_XL GGUF (~111 GB) på ett enda 96 GB-kort med RAM-offload — vi gjorde det här.
Båda använder hybrid-uppmärksamhet. Z.ai säger att GLM-5.3-Flash minskar beräkningen för uppmärksamhet 3,0x och KV-cache-storleken 4,4x jämfört med GLM-5.3. Qwen säger att QSAs uppmärksamhetskärna är upp till 7,6x snabbare i prefill och 4,9x i decode vid 1M token, och 8,6x Qwen3.7-Plus prefill-genomströmning vid 90 % prefix-cache-träff.
GLM:s extra kapacitetstrick i 51B-stil är inte en inbäddningstabell; Qwens n-gramtabell på 51B är utformad för att bo i värd-RAM och förhämtas. Olika recept, samma pitch: mer förmåga per watt.
Multimodala förmågor och kontext
Båda modellerna tar bilder i samma generation som text. GLM-5.3-Flash är uttryckligen den första nativt multimodala medlemmen av GLM-5, tränad på ett multimodalt korpus på 30 biljoner token, med videokapabla visionsrader (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next publicerar AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 och CharXiv 84,6 utan datoranvändningsverktyg / 90,6 med ett.
Kontextfönstrets storlek är tillräckligt nära för att jag inte skulle välja enbart på den. GLM annonserar ett inbyggt 1M-tokenfönster. Qwen är inbyggt på 262 144 och sträcker till 1 000 000 med YaRN. Recensioner i forskningsanteckningarna behandlar fortfarande GLM:s 1M som lätt stresstestat i produktion.
Prissättning: vad du faktiskt betalar

Bortsett från kampanjpriser kan du nästan inte skilja mellan modellernas prissättning. Qwen och Z.ai siktar tydligt på samma nivå här.
Tokenpriser sida vid sida
| Pris | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Indata, per 1M token | $0,15 ($0,075 kampanj) | $0,16 |
| Utdata, per 1M token | $0,50 ($0,25 kampanj) | $0,47 |
| Cachead indata, per 1M token | $0,03 ($0,015 kampanj) | $0,016 |
| Cachead utdata, per 1M token | Kostnadsfritt under kampanj | $0,20 |
| Lanseringskampanj | 50 % rabatt till och med 9 september 2026, 24:00 UTC+8 | Ingen publicerad |
| Coding Plan-kvot | 3× GLM-5.3 på alla plannivåer | Inte publicerat |
Kurvan är nästan platt. Qwens något billigare utdata hjälper generationstunga månader; GLM:s något billigare indata hjälper hämtningar. Z.ai debiterar tänkande-token till utdata-priset. Qwen dokumenterar enable_thinking och reasoning_effort på QwenCloud utan separat pris för tänkande-token, så behandla resonemang som utdata tills de säger något annat.
Båda labben publicerar cachepriser, och de prissätter bytet olika. Z.ai listar cachead indata till $0,03 per 1M token ($0,015 under kampanjen) och gör cache-skrivningar gratis under kampanjfönstret. Qwen läser cache till $0,016 men tar $0,20 per 1M token för att skapa en explicit cache.
Så Qwen halverar din cache-läsningskostnad, och GLM bjuder på skrivningen. Om dina prefix är stabila och långlivade vinner Qwens läsrate; om du skriver om cacher ofta vinner GLM:s gratis skrivningar, åtminstone till 9 september.
Vad en verklig arbetslast kostar
Formel: (volym ÷ 1M) × pris, summerat över in- och utdata, till standardlistpriser. Kampanjdollar håller sig utanför tabellen.
| Arbetslast | GLM-5.3-Flash | Qwen3.8-Flash | Skillnad |
|---|---|---|---|
| Balanserad assistent: 1M in / 250K ut | $0,28 | $0,28 | $0,00 (0 %) |
| Generationstung: 1M in / 4M ut | $2,15 | $2,04 | Qwen $0,11 billigare (5 %) |
| Hämtning, under tröskel: 10M in / 1M ut | $2,00 | $2,07 | GLM $0,07 billigare (3 %) |
API-listkostnad är dött lopp. Beslutet beror på arbetslastens passform och om slutpunkten finns. Båda modellerna använder leverantörsspecifika tokenizer, och inget labb publicerade tokenantal för en delad arbetslast, så behandla totalerna som en prisjämförelse snarare än en faktura. Till och med 9 september 2026 halverar GLM:s kampanj dessa GLM-kolumnsummor ($0,14, $1,08, $1,00).
När du ska välja GLM-5.3-Flash vs Qwen3.8-Flash-Next

Om du behöver anropa ett förstaparts-API denna vecka är GLM-5.3-Flash den enda kompletta produkten i paret. Om du utvärderar Qwen4:s arkitektur, eller bryr dig om CoWorkBench och JobBench, börja med Qwen3.8-Flash-Next-vikter nu och lägg till qwen3.8-flash när det blir tillgängligt på QwenCloud.
Välj GLM-5.3-Flash om…
-
Du behöver
glm-5.3-flashpå Z.ai, ellerz-ai/glm-5.3-flashpå OpenRouter, utan att vänta på en moln-SKU i kö. -
Din eval-uppsättning liknar DeepSWE, Toolathlon, NL2Repo eller Terminal Bench 2.1, och du vill ha labbet som publicerade de högre överlappande poängen.
-
Du vill ha MIT-vikter och ett inbyggt 1M-tokenfönster, och du är okej med att aktivera 18B parametrar.
-
Du redan har en GLM Coding Plan och kan använda 3× kvotan jämfört med GLM-5.3, inklusive kampanjen till 9 september 2026.
- Du vill ha visuella skrivbordsagenter. ZCodes Browser Use och Computer Use finns i lanseringsinlägget, och Qwens motsiffra är OSWorld 2.0 på 19,4, vilket inte är någon pokal.
Välj Qwen3.8-Flash-Next om…
-
Du köper en Qwen4-förhandsvisning, inte ett färdigt hanterat API. Vikterna är produkten idag.
-
Office-agent-bänkarna är de du faktiskt bryr dig om. CoWorkBench och JobBench är Qwens publicerade berättelse, inte GLM:s.
-
Du vill ha 6B aktiva parametrar och en n-gramtabell som kan ligga i värdminnet, inklusive bredvid en lokal Qwen3.8-27B-setup.
-
Du lever redan i Qwen Chat, Qwen Studio, Qwen Code, eller pekar vilken OpenAI-kompatibel agent som helst (OpenCode, Codex, Qwen Code) mot en lokal llama.cpp-endpoint idag. Claude Code kräver en översättningsproxy.
Så kommer du igång med GLM-5.3-Flash och Qwen3.8-Flash-Next
| Yta | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Konsumentapp | Z.ai webb-lekplats och GLM Coding Plan | Qwen Chat och Qwen Studio |
| Förstaparts-API | Ja, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API kommer snart) |
| Molnplattformar | Inte tillgänglig på Bedrock, Vertex AI eller Azure AI Foundry | Inte tillgänglig på Bedrock, Vertex AI eller Azure AI Foundry |
| Kodningsagenter | ZCode; OpenRouter in i IDE:er som accepterar anpassade leverantörer. Inte inbyggt i Claude Code, GitHub Copilot eller Cursor | Fungerar idag via lokal llama.cpp + OpenCode; samma koppling gäller för QwenCloud när det är live. Inte inbyggt i Claude Code, GitHub Copilot eller Cursor |
| Tredjepartsroutrar | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| API-modell-ID | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash på QwenCloud och OpenRouter; vikter Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash kan anropas nu. Qwen3.8-Flash-Next kan också det, men bara på egen hårdvara eller via routrar som OpenRouter. Qwens eget API-endpoint bör följa snart.
Skriv de där ID:na exakt. Qwen3.8-Flash-Nexts ID är qwen3.8-flash (utan ”next”), så hitta inte på ett qwen3.8-flash-next-moln-ID från viktnamnet.
Göra ditt första API-anrop
Båda modellerna talar OpenAIs chat completions-format, så du återanvänder standardklienten i båda fallen. Det snabbaste sättet att prova dem sida vid sida är OpenRouter, där båda ligger bakom en bas-URL, och modellsträngen är det enda du ändrar.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Att gå förstaparts kostar dig portabiliteten. Z.ais endpoint ligger på docs.z.ai och tar thinking: {"type": "enabled"} med reasoning_effort satt till low, high eller max. Alibabas tar enable_thinking med reasoning_effort som standard xhigh, mot en DashScope-bas-URL (internationell, Peking eller Virginia). Det är samma SDK i båda fallen, men resonemangsvredet är inte portabelt, så budgetera för en liten adapter om du planerar att byta.
För en fullständig Qwen-genomgång, läs vår handledning om hur du kör Qwen3.8-Flash-Next lokalt och Qwen Code CLI-handledningen. För lokal servering i GLM-familjen, använd Kör GLM-5 lokalt för agentisk kodning. Om du redan är på en Qwen3.8-27B-maskin är vår RTX 5090-setup syskonets lokala väg, inte denna 125B-förhandsvisning.
Avslutande tankar
Om du behöver leverera mot ett live-Flash-API denna vecka, använd GLM-5.3-Flash. Om du studerar Qwen4 eller litar mer på CoWorkBench än på DeepSWE, använd Qwen3.8-Flash-Next-vikter lokalt och byt till qwen3.8-flash via API när det lanseras.
Det jag tycker är mest intressant är hur lite listpriserna skiljer sig. Argumentet handlar om åtkomst och vilken opublicerad rad du är villig att ignorera, inte om ett 2× kostnadsstup.
Om du vill ha koncepten under båda MoE:erna rekommenderar jag vår kurs Large Language Models (LLMs) Concepts och sedan spåret AI Agent Fundamentals. För hubb- och viktarbete är Working with Hugging Face nästa praktiska steg.
Vanliga frågor
När ska jag använda GLM-5.3-Flash i stället för Qwen3.8-Flash-Next?
Använd GLM-5.3-Flash när du behöver ett live förstaparts-API denna vecka, MIT-licensierade vikter eller de högre överlappande kodningspoängen (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).
Använd Qwen3.8-Flash-Next när du vill köra Qwen4:s arkitekturförhandsvisning lokalt, ha mer effektiva 6B aktiva parametrar eller vill använda modellen i en office-agentmiljö (CoWorkBench 73,9, JobBench 55,7).
Var kan jag komma åt GLM-5.3-Flash och Qwen3.8-Flash-Next?
GLM-5.3-Flash är live på Z.ai som glm-5.3-flash, på GLM Coding Plan och på OpenRouter som z-ai/glm-5.3-flash. Vikter finns på Hugging Face under en MIT-licens.
Qwen3.8-Flash-Next-vikter finns på Hugging Face och ModelScope. Produktions-API:et är Qwen3.8-Flash på QwenCloud som qwen3.8-flash, markerat kommer snart, men du kan redan nå modellen via OpenRouter. Qwen Chat och Qwen Studio är konsumentytorna.
Hur jämför sig GLM-5.3-Flash och Qwen3.8-Flash-Next på kodning?
På kodningsbänkarna som båda labben publicerade leder GLM-5.3-Flash: DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5 och NL2Repo 56,3 vs 48,1. Ramverken är inte identiska.
Vilka är API-modell-ID:na för GLM-5.3-Flash och Qwen3.8-Flash-Next?
GLM-5.3-Flash är glm-5.3-flash på Z.ai och z-ai/glm-5.3-flash på OpenRouter.
QwenClouds produktions-ID är qwen3.8-flash, inte ett qwen3.8-flash-next-moln-ID. De öppna vikterna är Qwen/Qwen3.8-Flash-Next.
Är Qwen3.8-Flash-Next samma som Qwen3.8-Flash?
Nej. Qwen3.8-Flash-Next är förhandsvisningen av den öppna arkitekturen. Qwen3.8-Flash är produktions-SKU:n på QwenCloud, listad till $0,16 / $0,47 per 1M token, med ett standard 1M-kontextfönster och officiella inbyggda verktyg. API:et var markerat som kommer snart den 26 augusti 2026.