track
Pe 26 august 2026, Z.ai a lansat GLM-5.3-Flash, iar echipa Qwen de la Alibaba a publicat greutățile pentru Qwen3.8-Flash-Next. Ambele sunt modele MoE cu greutăți deschise, nativ multimodale, poziționate ca oferte din clasa Flash la nivel de cost, nu ca versiuni ieftinite rămase în urmă.
Flash însemna cândva „cel subțire”. Aceste două modele sunt pariurile laboratoarelor pe eficiență pentru agenți de programare și servire pe contexte lungi, lansate în același interval de 24 de ore. Asocierea e intenționat stângace: nu publică aceleași teste, iar doar un API first-party este activ azi.
Pe scurt
- GLM-5.3-Flash conduce testele de programare și folosire a uneltelor pe care le-au publicat ambele laboratoare.
- Alege GLM-5.3-Flash când ai nevoie de un API live, greutăți sub licență MIT și o fereastră de 1M tokeni fără YaRN.
- Alege Qwen3.8-Flash-Next dacă poți găzdui local (greutățile rulează azi cu llama.cpp) sau dacă poți aștepta API-ul gestionat QwenCloud.
- Prețurile de listă sunt la câțiva cenți distanță; promoția de 50% a GLM până pe 9 septembrie 2026 e singura care îți schimbă factura săptămâna asta.
Ce este GLM-5.3-Flash?
GLM-5.3-Flash este primul model nativ multimodal din seria GLM-5 de la Z.ai, lansat pe 26 august 2026, cu 320 de miliarde de parametri în total și 18 miliarde activi. Postarea de lansare Z.ai spune că depășește GLM-5.2 pe testele de programare și agenți la aproximativ o zecime din preț și obține scorul 57 pe Artificial Analysis Intelligence Index v4.1.1 la 0,045 $ per sarcină pe nivelul redus.
Arhitectura e povestea de produs: atenție hibridă liniară și rară, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodal de 30 de trilioane de tokeni și 45 de straturi în loc de 92 la GLM-4.5. Z.ai l-a rulat anonim ca ox-alpha pe OpenCode și OpenRouter înainte de a-l numi, servit pe cipuri AI chinezești. Greutățile sunt pe Hugging Face sub licență MIT, cu rețete de servire pentru SGLang, vLLM și TokenSpeed.
Citește mai multe detalii în ghidul nostru GLM-5.3-Flash. Pentru generația anterioară, vezi ghidul GLM-5.2 și tutorialul nostru despre rularea GLM-5 local pentru programare cu agenți.
Ce este Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next este previzualizarea cu greutăți deschise din 26 august 2026 a arhitecturii planificate pentru Qwen4 de la echipa Qwen a Alibaba. Modelul principal are 125 de miliarde de parametri, plus un tabel de embedding n-gram de 51 de miliarde de parametri, cu 6 miliarde de parametri activi per token. Contextul nativ este 262.144 tokeni, extensibil la 1.000.000 cu YaRN. Qwen spune că antrenarea a costat cam o nouă parte din Qwen3.7-Plus.
SKU-ul de producție este Qwen3.8-Flash pe QwenCloud, listat la 0,16 $ per 1M tokeni input și 0,47 $ per 1M tokeni output, cu API-ul marcat ca „în curând”. ID-ul modelului în cloud este qwen3.8-flash. Am scris deja un ghid separat pentru Qwen3.8-Flash-Next și un tutorial de configurare despre cum să rulezi Qwen3.8-Flash-Next local ca agent de programare cu OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: comparație directă

Pe benchmark-urile publicate de ambele laboratoare, GLM-5.3-Flash este înainte, cum te-ai aștepta, fiind modelul mai mare dintre cele două. Prețurile celor două modele sunt foarte similare.
| Caracteristică | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Laborator / dată | Z.ai, 26 august 2026 | Qwen (Alibaba), 26 august 2026 |
| Mărime | 320B total, 18B activi | 125B principal + 51B n-gram, 6B activi |
| Context | 1M tokeni nativ | 262.144 nativ; 1.000.000 cu YaRN |
| Modalități | Nativ multimodal (text, imagine, video la input) | MoE nativ multimodal |
| Greutăți | MIT, zai-org/GLM-5.3-Flash |
Greutăți deschise, Qwen/Qwen3.8-Flash-Next |
| Teste comune de programare | Conduce DeepSWE, Toolathlon, NL2Repo | Rămâne în urmă la acestea trei; a publicat SWE-bench Pro 62,5 |
| Teste pentru agenți de birou | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Preț de listă API (per 1M) | 0,15 $ input / 0,50 $ output | 0,16 $ input / 0,47 $ output (Qwen3.8-Flash) |
| API first-party | Activ, glm-5.3-flash |
În așteptare, qwen3.8-flash |
Programare și fluxuri de lucru agentice
GLM-5.3-Flash conduce scorurile de programare și folosire a uneltelor pe care ambii furnizori le-au pus pe aceeași linie. Tabelul Z.ai din 26 august listează DeepSWE v1.1 la 63,4, Toolathlon Verified la 78,4 și NL2Repo la 56,3. Tabelul Qwen listează 58,7, 73,5 și 48,1 pentru aceleași teste.
În afara acestora, comparația e dificilă deoarece benchmark-urile selectate diferă între cei doi furnizori. Qwen a publicat SWE-bench Pro la 62,5 și SWE-bench Multilingual la 81,0. Z.ai a publicat Terminal Bench 2.1 la 84,3 și AutomationBench la 48,8, plus un rezultat intern Z.ai Code Bench v1.0 de 29,0 la efort maxim față de 29,5 pentru Claude Opus 4.8, rulat în Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Note |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Tabele ale furnizorilor; GLM a folosit mini-swe-agent, Qwen raportează valoarea mai mare dintre Claude Code și mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM face media pe 3 rulări |
| NL2Repo | 56,3 | 48,1 | Qwen îl etichetează NL2Repo-Bench |
| SWE-bench Pro | Nepublicat | 62,5 | Qwen a rerulat baseline-urile în Claude Code |
| Terminal Bench 2.1 | 84,3 | Nepublicat | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (scor 51,2) | Formatele de raportare diferă |
Aș trata GLM ca fiind cel mai puternic agent de programare din clasa Flash pe setul comun publicat și aș refuza să declar un câștigător pe SWE-bench fără scorul publicat de Z.ai.
Muncă de birou și agenți pe orizont lung
Qwen este laboratorul care a publicat scoruri pentru sarcini de birou pe orizont lung. CoWorkBench este 73,9 și JobBench este 55,7, ambele mult peste Qwen3.7-Plus (65,1 și 27,6) și peste Claude Opus 4.6 Max pe aceleași linii (68,2 și 36,6).
Numerele „de lucru” suprapuse ale Z.ai sunt AutomationBench 48,8 și OfficeQA Pro 62,4, plus ZCode Browser Use și Computer Use pentru muncă vizuală pe desktop.
Nu sunt aceleași teste, deci nu stabilesc un câștigător. Dacă în mintea ta jobul înseamnă un agent de birou pe durată de mai multe ore, Qwen ți-a dat benchmark-urile. Dacă înseamnă automatizări în stil Zapier sau QA pe documente PDF, GLM ți le-a dat pe acelea.
Arhitectură și cost de servire
Qwen3.8-Flash-Next activează 6 miliarde de parametri per token. GLM-5.3-Flash activează 18 miliarde. Acest raport de 3x este cel mai clar fapt hardware în comparație și motivul pentru care discuțiile despre servirea locală ajung mereu la Qwen. În practică, GGUF-ul UD-Q4_K_XL (~111GB) rulează pe un singur GPU de 96GB cu offload în RAM — noi am făcut-o aici.
Ambele folosesc atenție hibridă. Z.ai spune că GLM-5.3-Flash reduce calculul pe atenție de 3,0x și dimensiunea KV cache de 4,4x față de GLM-5.3. Qwen spune că kernelul de atenție al QSA este de până la 7,6x mai rapid pe prefill și 4,9x pe decode la 1M tokeni și oferă un throughput de prefill de 8,6x față de Qwen3.7-Plus la o rată de hit de 90% pentru prefix-cache.
Trucul suplimentar de capacitate în stil 51B al GLM nu este un tabel de embedding; tabelul n-gram de 51B al Qwen este conceput să stea în RAM-ul gazdei și să preîncarce. Rețete diferite, aceeași promisiune: mai multă capabilitate per watt.
Capabilități multimodale și context
Ambele modele primesc imagini în aceeași generație ca textul. GLM-5.3-Flash este explicit primul membru nativ multimodal al GLM-5, antrenat pe un corpus multimodal de 30 de trilioane de tokeni, cu rânduri de viziune capabile de video (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next publică AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 și CharXiv 84,6 fără unealtă de utilizare a computerului / 90,6 cu una.
Mărimea ferestrei de context e suficient de apropiată cât să n-aș alege doar pe baza ei. GLM anunță o fereastră nativă de 1M tokeni. Qwen este nativ la 262.144 și se extinde la 1.000.000 cu YaRN. Recenziile din notele de cercetare încă tratează 1M-ul GLM drept moderat testat în producție.
Prețuri: ce plătești de fapt

Lăsând promoțiile la o parte, aproape că nu poți deosebi prețurile celor două modele. Qwen și Z.ai vizează clar același palier aici.
Tarife pe token, alăturate
| Tarif | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Input, per 1M tokeni | 0,15 $ (0,075 $ promo) | 0,16 $ |
| Output, per 1M tokeni | 0,50 $ (0,25 $ promo) | 0,47 $ |
| Input din cache, per 1M tokeni | 0,03 $ (0,015 $ promo) | 0,016 $ |
| Output din cache, per 1M tokeni | Gratuit în timpul promoției | 0,20 $ |
| Promo de lansare | Reducere 50% până pe 9 septembrie 2026, 24:00 UTC+8 | Nicio ofertă publicată |
| Contingent Coding Plan | De 3x GLM-5.3 pe toate planurile | Nepublicat |
Forma e aproape plată. Output-ul ușor mai ieftin al Qwen ajută în lunile cu multă generare; input-ul ușor mai ieftin al GLM ajută la recuperare. Z.ai facturează tokenii de „gândire” la tariful de output. Qwen documentează enable_thinking și reasoning_effort pe QwenCloud fără un preț separat pentru tokenii de gândire, deci tratează raționarea ca output până anunță altfel.
Ambele laboratoare publică tarife de cache, și prețuiesc diferit schimbul. Z.ai listează input-ul din cache la 0,03 $ per 1M tokeni (0,015 $ în promo) și face scrierile în cache gratuite în fereastra promo. Qwen citește cache-ul la 0,016 $, dar taxează 0,20 $ per 1M tokeni pentru a crea un cache explicit.
Așadar, Qwen înjumătățește tariful de citire din cache, iar GLM oferă gratuit scrierea. Dacă prefixele sunt stabile și longevive, rata de citire a Qwen câștigă; dacă rescrii des cache-urile, câștigă scrierile gratuite ale GLM, cel puțin până pe 9 septembrie.
Cât costă un workload real
Formula: (volum ÷ 1M) × tarif, însumat între input și output, la tarifele standard de listă. Sumele promo nu intră în tabel.
| Workload | GLM-5.3-Flash | Qwen3.8-Flash | Diferență |
|---|---|---|---|
| Asistent echilibrat: 1M in / 250K out | 0,28 $ | 0,28 $ | 0,00 $ (0%) |
| Generare intensă: 1M in / 4M out | 2,15 $ | 2,04 $ | Qwen mai ieftin cu 0,11 $ (5%) |
| Recuperare, sub prag: 10M in / 1M out | 2,00 $ | 2,07 $ | GLM mai ieftin cu 0,07 $ (3%) |
Costul de listă API este la egalitate. Decizia ține de potrivirea pe workload și dacă există endpoint-ul. Ambele modele folosesc tokenizatoare specifice furnizorilor, iar niciun laborator nu a publicat numărări de tokeni pentru un workload comun, deci tratează aceste totaluri ca o comparație de tarife, nu ca o factură. Până pe 9 septembrie 2026, promoția GLM înjumătățește totalurile din coloana GLM (0,14 $, 1,08 $, 1,00 $).
Când să alegi GLM-5.3-Flash vs Qwen3.8-Flash-Next

Dacă trebuie să apelezi un API first-party săptămâna asta, GLM-5.3-Flash este singurul produs complet dintre cele două. Dacă evaluezi arhitectura Qwen4 sau îți pasă de CoWorkBench și JobBench, începe acum cu greutățile Qwen3.8-Flash-Next și adaugă qwen3.8-flash când devine disponibil pe QwenCloud.
Alege GLM-5.3-Flash dacă...
-
Ai nevoie de
glm-5.3-flashpe Z.ai sau dez-ai/glm-5.3-flashpe OpenRouter, fără să aștepți un SKU cloud în coadă. -
Setul tău de evaluare arată ca DeepSWE, Toolathlon, NL2Repo sau Terminal Bench 2.1 și vrei laboratorul care a publicat scorurile mai mari pe setul comun.
-
Vrei greutăți MIT și o fereastră nativă de 1M tokeni și ești ok să activezi 18B parametri.
-
Ești deja pe un GLM Coding Plan și poți folosi contingentul de 3x față de GLM-5.3, inclusiv promoția până pe 9 septembrie 2026.
- Vrei agenți vizuali pentru desktop. Browser Use și Computer Use din ZCode sunt în postarea de lansare, iar contra-numărul Qwen este OSWorld 2.0 la 19,4, care nu e un trofeu.
Alege Qwen3.8-Flash-Next dacă...
-
Cumperi o previzualizare a Qwen4, nu un API gestionat finalizat. Greutățile sunt produsul azi.
-
Teste pentru agenți de birou sunt cele pe care chiar le citești. CoWorkBench și JobBench sunt povestea publicată de Qwen, nu de GLM.
-
Vrei 6B parametri activi și un tabel n-gram care poate sta în memoria gazdă, inclusiv lângă o configurare locală Qwen3.8-27B.
-
Deja lucrezi în Qwen Chat, Qwen Studio, Qwen Code sau îndrepți orice agent compatibil OpenAI (OpenCode, Codex, Qwen Code) către un endpoint local llama.cpp azi. Claude Code are nevoie de un proxy de traducere.
Cum să începi cu GLM-5.3-Flash și Qwen3.8-Flash-Next
| Suprafață | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Aplicație pentru consumatori | Playground web Z.ai și GLM Coding Plan | Qwen Chat și Qwen Studio |
| API first-party | Da, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API în curând) |
| Platforme cloud | Indisponibil pe Bedrock, Vertex AI sau Azure AI Foundry | Indisponibil pe Bedrock, Vertex AI sau Azure AI Foundry |
| Agenți de programare | ZCode; OpenRouter în IDE-uri care acceptă provideri personalizați. Nu e nativ în Claude Code, GitHub Copilot sau Cursor | Funcționează azi via llama.cpp local + OpenCode; aceeași conectare se aplică pentru QwenCloud când devine activ. Nu e nativ în Claude Code, GitHub Copilot sau Cursor |
| Routere terțe | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID model API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash pe QwenCloud și OpenRouter; greutăți Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash poate fi apelat acum. Qwen3.8-Flash-Next, de asemenea, doar că pe hardware-ul tău sau prin routere precum OpenRouter. Endpoint-ul propriu al Qwen ar trebui să urmeze în curând.
Introdu exact aceste ID-uri. ID-ul pentru Qwen3.8-Flash-Next este qwen3.8-flash (fără „next”), deci nu inventa un ID cloud qwen3.8-flash-next pornind de la numele greutăților.
Prima ta apelare de API
Ambele modele vorbesc formatul OpenAI chat completions, deci refolosești clientul standard în ambele cazuri. Cea mai rapidă metodă de a le încerca alăturat este OpenRouter, unde ambele stau în spatele aceluiași URL de bază, iar singurul lucru pe care îl schimbi este șirul modelului.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Mersul pe first-party te costă portabilitatea. Endpoint-ul Z.ai trăiește la docs.z.ai și primește thinking: {"type": "enabled"} cu reasoning_effort setat la low, high sau max. Cel al Alibaba primește enable_thinking cu reasoning_effort implicit xhigh, pe un URL de bază DashScope (internațional, Beijing sau Virginia). E același SDK în ambele cazuri, dar potențiometrul pentru reasoning nu e portabil, deci ia în calcul un mic adaptor dacă plănuiești să comuți.
Pentru un ghid complet Qwen, citește tutorialul nostru despre cum să rulezi Qwen3.8-Flash-Next local și tutorialul pentru Qwen Code CLI. Pentru servire locală în familia GLM, folosește Rulează GLM-5 local pentru programare cu agenți. Dacă ești deja pe o mașină Qwen3.8-27B, configurația noastră RTX 5090 este calea locală înrudită, nu acest preview de 125B.
Gânduri finale
Dacă trebuie să livrezi folosind un API Flash live săptămâna asta, folosește GLM-5.3-Flash. Dacă studiezi Qwen4 sau ai mai multă încredere în CoWorkBench decât în DeepSWE, folosește local greutățile Qwen3.8-Flash-Next și comută la qwen3.8-flash prin API când apare.
Ce mi se pare cel mai interesant este cât de puțin diferă prețurile de listă. Discuția este despre acces și despre ce linie nepublicată ești dispus să ignori, nu despre o prăpastie de cost 2x.
Dacă vrei conceptele din spatele ambelor MoE, îți recomand cursul nostru Large Language Models (LLMs) Concepts, apoi traseul AI Agent Fundamentals. Pentru lucru cu hub-uri și greutăți, Working with Hugging Face este pasul practic următor.
Întrebări frecvente
Când ar trebui să folosesc GLM-5.3-Flash în loc de Qwen3.8-Flash-Next?
Folosește GLM-5.3-Flash când ai nevoie de un API first-party activ săptămâna asta, greutăți sub licență MIT sau scorurile mai mari pe setul comun de programare (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).
Folosește Qwen3.8-Flash-Next când vrei să rulezi local previzualizarea arhitecturii Qwen4, ai nevoie de 6B parametri activi mai eficienți sau vrei să folosești modelul într-un setup de agenți de birou (CoWorkBench 73,9, JobBench 55,7).
Unde pot accesa GLM-5.3-Flash și Qwen3.8-Flash-Next?
GLM-5.3-Flash este activ pe Z.ai ca glm-5.3-flash, pe GLM Coding Plan și pe OpenRouter ca z-ai/glm-5.3-flash. Greutățile sunt pe Hugging Face sub licență MIT.
Greutățile Qwen3.8-Flash-Next sunt pe Hugging Face și ModelScope. API-ul de producție este Qwen3.8-Flash pe QwenCloud ca qwen3.8-flash, marcat „în curând”, dar poți accesa deja modelul prin OpenRouter. Qwen Chat și Qwen Studio sunt suprafețele pentru consumatori.
Cum se compară GLM-5.3-Flash și Qwen3.8-Flash-Next pe programare?
Pe testele de programare publicate de ambele laboratoare, GLM-5.3-Flash conduce: DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5 și NL2Repo 56,3 vs 48,1. Harness-urile nu sunt identice.
Care sunt ID-urile de model API pentru GLM-5.3-Flash și Qwen3.8-Flash-Next?
GLM-5.3-Flash este glm-5.3-flash pe Z.ai și z-ai/glm-5.3-flash pe OpenRouter.
ID-ul de producție pe QwenCloud este qwen3.8-flash, nu un ID cloud qwen3.8-flash-next. Greutățile deschise sunt Qwen/Qwen3.8-Flash-Next.
Este Qwen3.8-Flash-Next același lucru cu Qwen3.8-Flash?
Nu. Qwen3.8-Flash-Next este previzualizarea cu greutăți deschise a arhitecturii. Qwen3.8-Flash este SKU-ul de producție pe QwenCloud, listat la 0,16 $ / 0,47 $ per 1M tokeni, cu un context implicit de 1M și unelte oficiale integrate. API-ul era marcat „în curând” pe 26 august 2026.