Programma
Il 26 agosto 2026, Z.ai ha rilasciato GLM-5.3-Flash e il team Qwen di Alibaba ha aperto i pesi di Qwen3.8-Flash-Next. Entrambi sono modelli MoE a pesi aperti, nativamente multimodali, proposti come soluzioni classe Flash incentrate sull’efficienza dei costi, non come varianti economiche di ripiego.
Flash un tempo voleva dire "quello leggero". Questi due sono le scommesse dei laboratori sull’efficienza per agenti di coding e serving a contesto lungo, usciti nelle stesse 24 ore. L’accoppiata è volutamente scomoda: non pubblicano gli stessi benchmark e solo una delle API first-party è attiva oggi.
TL;DR
- GLM-5.3-Flash guida i benchmark di coding e uso di tool pubblicati da entrambi i laboratori.
- Scegli GLM-5.3-Flash quando ti serve un’API attiva, pesi con licenza MIT e una finestra da 1M token senza YaRN.
- Scegli Qwen3.8-Flash-Next se puoi fare self-hosting (i pesi girano oggi con llama.cpp) o se puoi aspettare l’API gestita QwenCloud.
- I prezzi di listino sono a pochi centesimi di distanza; la promo al 50% di GLM fino al 9 settembre 2026 è l’unica che cambia davvero il conto questa settimana.
Che cos’è GLM-5.3-Flash?
GLM-5.3-Flash è il primo modello nativamente multimodale di Z.ai nella serie GLM-5, rilasciato il 26 agosto 2026 con 320 miliardi di parametri totali e 18 miliardi attivi. Il post di lancio di Z.ai afferma che supera GLM-5.2 nei benchmark di coding e agent a circa un decimo del prezzo, e ottiene 57 sull’Artificial Analysis Intelligence Index v4.1.1 a $0,045 per task sul tier scontato.
L’architettura è il vero punto forte: attenzione ibrida lineare e sparsa, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodale da 30 trilioni di token e 45 layer invece dei 92 di GLM-4.5. Z.ai lo ha fatto girare in forma anonima come ox-alpha su OpenCode e OpenRouter prima di battezzarlo, servito su chip di IA cinesi. I pesi sono su Hugging Face con licenza MIT, con ricette di serving per SGLang, vLLM e TokenSpeed.
Approfondisci nel nostro guida a GLM-5.3-Flash dedicato. Per la generazione precedente, vedi la guida a GLM-5.2 e il tutorial su come eseguire GLM-5 in locale per il coding agentico.
Che cos’è Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next è l’anteprima a pesi aperti del 26 agosto 2026 del team Qwen di Alibaba per l’architettura prevista in Qwen4. Il modello principale ha 125 miliardi di parametri, più una tabella di embedding n-gram da 51 miliardi, con 6 miliardi di parametri attivi per token. Il contesto nativo è 262.144 token, estendibile a 1.000.000 con YaRN. Qwen afferma che l’addestramento è costato circa un nono di Qwen3.7-Plus.
Lo SKU di produzione è Qwen3.8-Flash su QwenCloud, a listino a $0,16 per 1M token in input e $0,47 per 1M token in output, con l’API indicata come in arrivo. L’ID del modello cloud è qwen3.8-flash. Abbiamo già scritto una guida a Qwen3.8-Flash-Next dedicata e un tutorial di setup su come eseguire Qwen3.8-Flash-Next in locale come agente di coding con OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: confronto diretto

Sui benchmark pubblicati da entrambi i laboratori, GLM-5.3-Flash è avanti, come prevedibile dato che è il modello più grande dei due. I prezzi dei due modelli sono molto simili.
| Caratteristica | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / data | Z.ai, 26 agosto 2026 | Qwen (Alibaba), 26 agosto 2026 |
| Dimensione | 320B totali, 18B attivi | 125B main + 51B n-gram, 6B attivi |
| Contesto | 1M token nativi | 262.144 nativi; 1.000.000 con YaRN |
| Modalità | Nativamente multimodale (testo, immagine, video in input) | MoE nativamente multimodale |
| Pesi | MIT, zai-org/GLM-5.3-Flash |
Pesi aperti, Qwen/Qwen3.8-Flash-Next |
| Benchmark di coding condivisi | Guida DeepSWE, Toolathlon, NL2Repo | Dietro su quei tre; pubblicato SWE-bench Pro 62,5 |
| Benchmark agenti da ufficio | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Prezzo di listino API (per 1M) | $0,15 in / $0,50 out | $0,16 in / $0,47 out (Qwen3.8-Flash) |
| API first-party | Attiva, glm-5.3-flash |
In coda, qwen3.8-flash |
Workflow di coding e agentici
GLM-5.3-Flash guida i punteggi di coding e uso di tool che entrambi i vendor riportano sulla stessa riga. La tabella del 26 agosto di Z.ai elenca DeepSWE v1.1 a 63,4, Toolathlon Verified a 78,4 e NL2Repo a 56,3. La tabella di Qwen riporta 58,7, 73,5 e 48,1 sugli stessi nomi.
Oltre a questi, il confronto è difficile perché i benchmark selezionati differiscono tra i due vendor. Qwen ha pubblicato SWE-bench Pro a 62,5 e SWE-bench Multilingual a 81,0. Z.ai ha pubblicato Terminal Bench 2.1 a 84,3 e AutomationBench a 48,8, più un risultato interno Z.ai Code Bench v1.0 di 29,0 allo sforzo massimo contro i 29,5 di Claude Opus 4.8, eseguito in Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Note |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Tabelle dei vendor; GLM ha usato mini-swe-agent, Qwen riporta il migliore tra Claude Code e mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM media su 3 run |
| NL2Repo | 56,3 | 48,1 | Qwen lo etichetta NL2Repo-Bench |
| SWE-bench Pro | Non pubblicato | 62,5 | Qwen ha ri-eseguito i baseline in Claude Code |
| Terminal Bench 2.1 | 84,3 | Non pubblicato | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (score 51,2) | I formati di reporting differiscono |
Tratterei GLM come il Flash per agenti di coding più forte tra quelli con set sovrapposto pubblicati, e eviterei di proclamare un vincitore su SWE-bench senza il punteggio pubblicato di Z.ai.
Lavoro d’ufficio e agenti a lungo orizzonte
Qwen è il laboratorio che ha pubblicato punteggi per compiti d’ufficio a lungo orizzonte. CoWorkBench è 73,9 e JobBench è 55,7, entrambi anni luce davanti a Qwen3.7-Plus (65,1 e 27,6) e a Claude Opus 4.6 Max su quelle righe (68,2 e 36,6).
I numeri "work" sovrapponibili di Z.ai sono AutomationBench 48,8 e OfficeQA Pro 62,4, oltre a ZCode Browser Use e Computer Use per lavoro desktop visuale.
Non sono gli stessi test, quindi non decretano un vincitore. Se nel tuo modello mentale il lavoro è un agente da ufficio multi-ora, Qwen ti ha dato i benchmark. Se è automazione in stile Zapier o QA su PDF d’ufficio, te li ha dati GLM.
Architettura e costo di serving
Qwen3.8-Flash-Next attiva 6 miliardi di parametri per token. GLM-5.3-Flash ne attiva 18 miliardi. Questo divario 3x è il dato hardware più netto del confronto, ed è il motivo per cui le discussioni sul serving locale finiscono spesso su Qwen. In pratica, il GGUF UD-Q4_K_XL (~111GB) gira su una singola scheda da 96GB con offload in RAM — l’abbiamo fatto qui.
Entrambi usano attenzione ibrida. Z.ai afferma che GLM-5.3-Flash riduce il compute dell’attenzione di 3,0x e la dimensione della KV cache di 4,4x rispetto a GLM-5.3. Qwen afferma che il kernel di attenzione di QSA è fino a 7,6x più veloce in prefill e 4,9x in decode a 1M token, e 8,6x il throughput di prefill di Qwen3.7-Plus con un tasso di hit della prefix-cache del 90%.
Il trucco di capacità extra in stile 51B di GLM non è una tabella di embedding; la tabella n-gram da 51B di Qwen è progettata per risiedere nella RAM host e fare prefetch. Ricette diverse, stesso pitch: più capacità per watt.
Capacità multimodali e contesto
Entrambi i modelli accettano immagini nella stessa generazione del testo. GLM-5.3-Flash è esplicitamente il primo membro nativamente multimodale della famiglia GLM-5, addestrato su un corpus multimodale da 30 trilioni di token, con righe di vision capaci di video (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next pubblica AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 e CharXiv 84,6 senza tool di computer-use / 90,6 con uno.
La dimensione della finestra di contesto è abbastanza vicina da non sceglierne una solo per questo. GLM pubblicizza una finestra nativa da 1M token. Qwen è nativo a 262.144 e si estende a 1.000.000 con YaRN. Le note di ricerca trattano ancora l’1M di GLM come moderatamente stress-testato in produzione.
Prezzi: quanto paghi davvero

Al netto delle promo, è quasi impossibile distinguere i prezzi dei due modelli. Qwen e Z.ai puntano chiaramente allo stesso tier.
Tariffe token affiancate
| Tariffa | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Input, per 1M token | $0,15 ($0,075 promo) | $0,16 |
| Output, per 1M token | $0,50 ($0,25 promo) | $0,47 |
| Input in cache, per 1M token | $0,03 ($0,015 promo) | $0,016 |
| Output in cache, per 1M token | Gratis durante la promo | $0,20 |
| Promo di lancio | -50% fino al 9 settembre 2026, 24:00 UTC+8 | Nessuna pubblicata |
| Quota Coding Plan | 3x GLM-5.3 su tutti i tier di piano | Non pubblicata |
Il profilo è quasi piatto. L’output leggermente più economico di Qwen aiuta nei mesi molto generativi; l’input leggermente più economico di GLM aiuta il retrieval. Z.ai fattura i thinking token alla tariffa di output. Qwen documenta enable_thinking e reasoning_effort su QwenCloud senza un prezzo separato per i thinking token, quindi considera il reasoning come output finché non dicono il contrario.
Entrambi i laboratori pubblicano tariffe di cache, ma prezzano lo scambio in modo diverso. Z.ai lista l’input in cache a $0,03 per 1M token ($0,015 in promo) e rende gratuite le scritture in cache durante la finestra promo. Qwen legge la cache a $0,016 ma addebita $0,20 per 1M token per creare una cache esplicita.
Quindi Qwen dimezza la tariffa di lettura della cache, e GLM regala la scrittura. Se i tuoi prefissi sono stabili e longevi, vince la lettura di Qwen; se riscrivi spesso le cache, vincono le scritture gratuite di GLM, almeno fino al 9 settembre.
Quanto costa un carico reale
Formula: (volume ÷ 1M) × tariffa, sommata tra input e output, a prezzi di listino standard. I dollari promo restano fuori tabella.
| Carico | GLM-5.3-Flash | Qwen3.8-Flash | Differenza |
|---|---|---|---|
| Assistente bilanciato: 1M in / 250K out | $0,28 | $0,28 | $0,00 (0%) |
| Molto generativo: 1M in / 4M out | $2,15 | $2,04 | Qwen $0,11 più economico (5%) |
| Retrieval, sotto soglia: 10M in / 1M out | $2,00 | $2,07 | GLM $0,07 più economico (3%) |
Il costo API di listino è pari. La scelta dipende dall’aderenza al carico e dall’esistenza dell’endpoint. Entrambi i modelli usano tokenizer specifici del vendor e nessuno dei due laboratori ha pubblicato conteggi di token per un carico condiviso, quindi tratta questi totali come un confronto di tariffe più che come una fattura. Fino al 9 settembre 2026, la promo di GLM dimezza quei totali nella colonna GLM ($0,14, $1,08, $1,00).
Quando scegliere GLM-5.3-Flash vs Qwen3.8-Flash-Next

Se devi chiamare un’API first-party questa settimana, GLM-5.3-Flash è l’unico prodotto completo della coppia. Se stai valutando l’architettura di Qwen4, o ti interessano CoWorkBench e JobBench, parti subito con i pesi di Qwen3.8-Flash-Next e aggiungi qwen3.8-flash quando sarà disponibile su QwenCloud.
Scegli GLM-5.3-Flash se...
-
Ti serve
glm-5.3-flashsu Z.ai, oz-ai/glm-5.3-flashsu OpenRouter, senza aspettare uno SKU cloud in coda. -
Il tuo set di valutazione somiglia a DeepSWE, Toolathlon, NL2Repo o Terminal Bench 2.1, e vuoi il laboratorio che ha pubblicato i punteggi più alti sul set sovrapposto.
-
Vuoi pesi con licenza MIT e una finestra nativa da 1M token, e ti va bene attivarne 18B.
-
Sei già su un GLM Coding Plan e puoi usare la quota 3x rispetto a GLM-5.3, inclusa la promo fino al 9 settembre 2026.
- Vuoi agenti desktop visuali. Browser Use e Computer Use di ZCode sono nel post di lancio, e il numero di Qwen a confronto è OSWorld 2.0 a 19,4, che non è da podio.
Scegli Qwen3.8-Flash-Next se...
-
Stai acquistando un’anteprima di Qwen4, non un’API gestita finita. Oggi il prodotto sono i pesi.
-
I benchmark per agenti da ufficio sono quelli che leggi davvero. CoWorkBench e JobBench sono la storia pubblicata da Qwen, non da GLM.
-
Vuoi 6B parametri attivi e una tabella n-gram che può stare in memoria host, anche accanto a un setup locale Qwen3.8-27B.
-
Vivi già in Qwen Chat, Qwen Studio, Qwen Code, o punti qualsiasi agente compatibile OpenAI (OpenCode, Codex, Qwen Code) a un endpoint locale llama.cpp oggi. Claude Code richiede un proxy di traduzione.
Come iniziare con GLM-5.3-Flash e Qwen3.8-Flash-Next
| Superficie | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| App consumer | Playground web Z.ai e GLM Coding Plan | Qwen Chat e Qwen Studio |
| API first-party | Sì, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API in arrivo) |
| Piattaforme cloud | Non disponibile su Bedrock, Vertex AI o Azure AI Foundry | Non disponibile su Bedrock, Vertex AI o Azure AI Foundry |
| Agenti di coding | ZCode; OpenRouter negli IDE che accettano provider personalizzati. Non nativo in Claude Code, GitHub Copilot o Cursor | Funziona oggi via llama.cpp locale + OpenCode; stesso collegamento varrà per QwenCloud quando sarà attivo. Non nativo in Claude Code, GitHub Copilot o Cursor |
| Router di terze parti | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID modello API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash su QwenCloud e OpenRouter; pesi Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash è chiamabile ora. Anche Qwen3.8-Flash-Next lo è, solo sul tuo hardware o tramite router come OpenRouter. L’endpoint API di Qwen dovrebbe seguire a breve.
Digita quegli ID esattamente. L’ID di Qwen3.8-Flash-Next è qwen3.8-flash (senza "next"), quindi non inventare un ID cloud qwen3.8-flash-next partendo dal nome dei pesi.
Fare la tua prima chiamata API
Entrambi i modelli parlano il formato chat completions di OpenAI, quindi puoi riutilizzare lo stesso client in entrambi i casi. Il modo più veloce per provarli fianco a fianco è OpenRouter, dove entrambi stanno dietro un’unica base URL, e l’unica cosa che cambi è la stringa del modello.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Andare first-party ti costa la portabilità. L’endpoint di Z.ai vive su docs.z.ai e accetta thinking: {"type": "enabled"} con reasoning_effort impostato su low, high o max. Quello di Alibaba accetta enable_thinking con reasoning_effort predefinito a xhigh, su una base URL DashScope (internazionale, Pechino o Virginia). È lo stesso SDK in entrambi i casi, ma la manopola del reasoning non è portabile, quindi prevedi un piccolo adapter se pensi di cambiare.
Per una guida completa a Qwen, leggi il nostro tutorial su come eseguire Qwen3.8-Flash-Next in locale e il tutorial sulla CLI di Qwen Code. Per il serving locale della famiglia GLM, usa Esegui GLM-5 in locale per il coding agentico. Se sei già su una macchina Qwen3.8-27B, il nostro setup RTX 5090 è il percorso locale gemello, non questa anteprima da 125B.
Considerazioni finali
Se devi spedire contro un’API Flash attiva questa settimana, usa GLM-5.3-Flash. Se stai studiando Qwen4 o credi più a CoWorkBench che a DeepSWE, usa i pesi di Qwen3.8-Flash-Next in locale e passa a qwen3.8-flash via API quando sarà disponibile.
Ciò che trovo più interessante è quanto poco i prezzi di listino divergano. La discussione riguarda l’accesso e quale riga non pubblicata sei disposto a ignorare, non un baratro di costi 2x.
Se vuoi i concetti alla base di entrambi i MoE, ti consigliamo il corso Large Language Models (LLMs) Concepts, poi il percorso AI Agent Fundamentals. Per lavoro con hub e pesi, Working with Hugging Face è il passo pratico successivo.
FAQ
Quando dovrei usare GLM-5.3-Flash invece di Qwen3.8-Flash-Next?
Usa GLM-5.3-Flash quando ti serve un’API first-party attiva questa settimana, pesi con licenza MIT o i punteggi più alti sul set sovrapposto di coding (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).
Usa Qwen3.8-Flash-Next quando vuoi eseguire in locale l’anteprima dell’architettura Qwen4, avere 6B parametri attivi più efficienti o usare il modello in un setup da agente d’ufficio (CoWorkBench 73,9, JobBench 55,7).
Dove posso accedere a GLM-5.3-Flash e Qwen3.8-Flash-Next?
GLM-5.3-Flash è attivo su Z.ai come glm-5.3-flash, sul GLM Coding Plan e su OpenRouter come z-ai/glm-5.3-flash. I pesi sono su Hugging Face con licenza MIT.
I pesi di Qwen3.8-Flash-Next sono su Hugging Face e ModelScope. L’API di produzione è Qwen3.8-Flash su QwenCloud come qwen3.8-flash, indicata in arrivo, ma puoi già accedere al modello tramite OpenRouter. Qwen Chat e Qwen Studio sono le superfici consumer.
Come si confrontano GLM-5.3-Flash e Qwen3.8-Flash-Next sul coding?
Sui benchmark di coding pubblicati da entrambi i laboratori, GLM-5.3-Flash è avanti: DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5 e NL2Repo 56,3 vs 48,1. Gli harness non sono identici.
Quali sono gli ID modello API per GLM-5.3-Flash e Qwen3.8-Flash-Next?
GLM-5.3-Flash è glm-5.3-flash su Z.ai e z-ai/glm-5.3-flash su OpenRouter.
L’ID di produzione su QwenCloud è qwen3.8-flash, non un ID cloud qwen3.8-flash-next. I pesi aperti sono Qwen/Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next è lo stesso di Qwen3.8-Flash?
No. Qwen3.8-Flash-Next è l’anteprima a pesi aperti dell’architettura. Qwen3.8-Flash è lo SKU di produzione su QwenCloud, a listino a $0,16 / $0,47 per 1M token, con un contesto predefinito da 1M e strumenti integrati ufficiali. L’API era indicata in arrivo il 26 agosto 2026.
Tom è un data scientist e formatore tecnico. Scrive e gestisce i tutorial e i post del blog di DataCamp su data science. In precedenza, Tom ha lavorato nella data science presso Deutsche Telekom.


