Vai al contenuto principale

GLM-5.3-Flash vs Qwen3.8-Flash-Next: coding, costi e accesso

I nuovi modelli di Z.ai e Alibaba competono per lo stesso segmento. GLM-5.3-Flash guida i benchmark di coding condivisi ed è attivo; Qwen3.8-Flash-Next è l’anteprima leggera di Qwen4 con un’API in coda.
Aggiornato 31 ago 2026  · 11 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

Il 26 agosto 2026, Z.ai ha rilasciato GLM-5.3-Flash e il team Qwen di Alibaba ha aperto i pesi di Qwen3.8-Flash-Next. Entrambi sono modelli MoE a pesi aperti, nativamente multimodali, proposti come soluzioni classe Flash incentrate sull’efficienza dei costi, non come varianti economiche di ripiego.

Flash un tempo voleva dire "quello leggero". Questi due sono le scommesse dei laboratori sull’efficienza per agenti di coding e serving a contesto lungo, usciti nelle stesse 24 ore. L’accoppiata è volutamente scomoda: non pubblicano gli stessi benchmark e solo una delle API first-party è attiva oggi.

TL;DR

  • GLM-5.3-Flash guida i benchmark di coding e uso di tool pubblicati da entrambi i laboratori.
  • Scegli GLM-5.3-Flash quando ti serve un’API attiva, pesi con licenza MIT e una finestra da 1M token senza YaRN.
  • Scegli Qwen3.8-Flash-Next se puoi fare self-hosting (i pesi girano oggi con llama.cpp) o se puoi aspettare l’API gestita QwenCloud.
  • I prezzi di listino sono a pochi centesimi di distanza; la promo al 50% di GLM fino al 9 settembre 2026 è l’unica che cambia davvero il conto questa settimana.

Che cos’è GLM-5.3-Flash?

GLM-5.3-Flash è il primo modello nativamente multimodale di Z.ai nella serie GLM-5, rilasciato il 26 agosto 2026 con 320 miliardi di parametri totali e 18 miliardi attivi. Il post di lancio di Z.ai afferma che supera GLM-5.2 nei benchmark di coding e agent a circa un decimo del prezzo, e ottiene 57 sull’Artificial Analysis Intelligence Index v4.1.1 a $0,045 per task sul tier scontato.

L’architettura è il vero punto forte: attenzione ibrida lineare e sparsa, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodale da 30 trilioni di token e 45 layer invece dei 92 di GLM-4.5. Z.ai lo ha fatto girare in forma anonima come ox-alpha su OpenCode e OpenRouter prima di battezzarlo, servito su chip di IA cinesi. I pesi sono su Hugging Face con licenza MIT, con ricette di serving per SGLang, vLLM e TokenSpeed.

Approfondisci nel nostro guida a GLM-5.3-Flash dedicato. Per la generazione precedente, vedi la guida a GLM-5.2 e il tutorial su come eseguire GLM-5 in locale per il coding agentico.

Che cos’è Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next è l’anteprima a pesi aperti del 26 agosto 2026 del team Qwen di Alibaba per l’architettura prevista in Qwen4. Il modello principale ha 125 miliardi di parametri, più una tabella di embedding n-gram da 51 miliardi, con 6 miliardi di parametri attivi per token. Il contesto nativo è 262.144 token, estendibile a 1.000.000 con YaRN. Qwen afferma che l’addestramento è costato circa un nono di Qwen3.7-Plus.

Lo SKU di produzione è Qwen3.8-Flash su QwenCloud, a listino a $0,16 per 1M token in input e $0,47 per 1M token in output, con l’API indicata come in arrivo. L’ID del modello cloud è qwen3.8-flash. Abbiamo già scritto una guida a Qwen3.8-Flash-Next dedicata e un tutorial di setup su come eseguire Qwen3.8-Flash-Next in locale come agente di coding con OpenCode.

GLM-5.3-Flash vs Qwen3.8-Flash-Next: confronto diretto

GLM guida i benchmark di coding condivisi; Qwen ha l’API in coda

Sui benchmark pubblicati da entrambi i laboratori, GLM-5.3-Flash è avanti, come prevedibile dato che è il modello più grande dei due. I prezzi dei due modelli sono molto simili.

Caratteristica GLM-5.3-Flash Qwen3.8-Flash-Next
Lab / data Z.ai, 26 agosto 2026 Qwen (Alibaba), 26 agosto 2026
Dimensione 320B totali, 18B attivi 125B main + 51B n-gram, 6B attivi
Contesto 1M token nativi 262.144 nativi; 1.000.000 con YaRN
Modalità Nativamente multimodale (testo, immagine, video in input) MoE nativamente multimodale
Pesi MIT, zai-org/GLM-5.3-Flash Pesi aperti, Qwen/Qwen3.8-Flash-Next
Benchmark di coding condivisi Guida DeepSWE, Toolathlon, NL2Repo Dietro su quei tre; pubblicato SWE-bench Pro 62,5
Benchmark agenti da ufficio AutomationBench 48,8; OfficeQA Pro 62,4 CoWorkBench 73,9; JobBench 55,7
Prezzo di listino API (per 1M) $0,15 in / $0,50 out $0,16 in / $0,47 out (Qwen3.8-Flash)
API first-party Attiva, glm-5.3-flash In coda, qwen3.8-flash

Workflow di coding e agentici

GLM-5.3-Flash guida i punteggi di coding e uso di tool che entrambi i vendor riportano sulla stessa riga. La tabella del 26 agosto di Z.ai elenca DeepSWE v1.1 a 63,4, Toolathlon Verified a 78,4 e NL2Repo a 56,3. La tabella di Qwen riporta 58,7, 73,5 e 48,1 sugli stessi nomi.

Oltre a questi, il confronto è difficile perché i benchmark selezionati differiscono tra i due vendor. Qwen ha pubblicato SWE-bench Pro a 62,5 e SWE-bench Multilingual a 81,0. Z.ai ha pubblicato Terminal Bench 2.1 a 84,3 e AutomationBench a 48,8, più un risultato interno Z.ai Code Bench v1.0 di 29,0 allo sforzo massimo contro i 29,5 di Claude Opus 4.8, eseguito in Claude Code 2.1.207.

Benchmark GLM-5.3-Flash Qwen3.8-Flash-Next Note
DeepSWE v1.1 63,4 58,7 Tabelle dei vendor; GLM ha usato mini-swe-agent, Qwen riporta il migliore tra Claude Code e mini-SWE-agent
Toolathlon Verified 78,4 73,5 Pass@1; GLM media su 3 run
NL2Repo 56,3 48,1 Qwen lo etichetta NL2Repo-Bench
SWE-bench Pro Non pubblicato 62,5 Qwen ha ri-eseguito i baseline in Claude Code
Terminal Bench 2.1 84,3 Non pubblicato Z.ai, Claude Code 2.1.207
Agents' Last Exam 26,3 24,3 pass@1 (score 51,2) I formati di reporting differiscono

Tratterei GLM come il Flash per agenti di coding più forte tra quelli con set sovrapposto pubblicati, e eviterei di proclamare un vincitore su SWE-bench senza il punteggio pubblicato di Z.ai.

Lavoro d’ufficio e agenti a lungo orizzonte

Qwen è il laboratorio che ha pubblicato punteggi per compiti d’ufficio a lungo orizzonte. CoWorkBench è 73,9 e JobBench è 55,7, entrambi anni luce davanti a Qwen3.7-Plus (65,1 e 27,6) e a Claude Opus 4.6 Max su quelle righe (68,2 e 36,6).

I numeri "work" sovrapponibili di Z.ai sono AutomationBench 48,8 e OfficeQA Pro 62,4, oltre a ZCode Browser Use e Computer Use per lavoro desktop visuale.

Non sono gli stessi test, quindi non decretano un vincitore. Se nel tuo modello mentale il lavoro è un agente da ufficio multi-ora, Qwen ti ha dato i benchmark. Se è automazione in stile Zapier o QA su PDF d’ufficio, te li ha dati GLM.

Architettura e costo di serving

Qwen3.8-Flash-Next attiva 6 miliardi di parametri per token. GLM-5.3-Flash ne attiva 18 miliardi. Questo divario 3x è il dato hardware più netto del confronto, ed è il motivo per cui le discussioni sul serving locale finiscono spesso su Qwen. In pratica, il GGUF UD-Q4_K_XL (~111GB) gira su una singola scheda da 96GB con offload in RAM — l’abbiamo fatto qui.

Entrambi usano attenzione ibrida. Z.ai afferma che GLM-5.3-Flash riduce il compute dell’attenzione di 3,0x e la dimensione della KV cache di 4,4x rispetto a GLM-5.3. Qwen afferma che il kernel di attenzione di QSA è fino a 7,6x più veloce in prefill e 4,9x in decode a 1M token, e 8,6x il throughput di prefill di Qwen3.7-Plus con un tasso di hit della prefix-cache del 90%.

Il trucco di capacità extra in stile 51B di GLM non è una tabella di embedding; la tabella n-gram da 51B di Qwen è progettata per risiedere nella RAM host e fare prefetch. Ricette diverse, stesso pitch: più capacità per watt.

Capacità multimodali e contesto

Entrambi i modelli accettano immagini nella stessa generazione del testo. GLM-5.3-Flash è esplicitamente il primo membro nativamente multimodale della famiglia GLM-5, addestrato su un corpus multimodale da 30 trilioni di token, con righe di vision capaci di video (MVBench 77,8, MMVU 80,5).

Qwen3.8-Flash-Next pubblica AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 e CharXiv 84,6 senza tool di computer-use / 90,6 con uno.

La dimensione della finestra di contesto è abbastanza vicina da non sceglierne una solo per questo. GLM pubblicizza una finestra nativa da 1M token. Qwen è nativo a 262.144 e si estende a 1.000.000 con YaRN. Le note di ricerca trattano ancora l’1M di GLM come moderatamente stress-testato in produzione.

Prezzi: quanto paghi davvero

I prezzi di listino sono pari; il modello più economico varia in base al carico

Al netto delle promo, è quasi impossibile distinguere i prezzi dei due modelli. Qwen e Z.ai puntano chiaramente allo stesso tier.

Tariffe token affiancate

Tariffa GLM-5.3-Flash Qwen3.8-Flash
Input, per 1M token $0,15 ($0,075 promo) $0,16
Output, per 1M token $0,50 ($0,25 promo) $0,47
Input in cache, per 1M token $0,03 ($0,015 promo) $0,016
Output in cache, per 1M token Gratis durante la promo $0,20
Promo di lancio -50% fino al 9 settembre 2026, 24:00 UTC+8 Nessuna pubblicata
Quota Coding Plan 3x GLM-5.3 su tutti i tier di piano Non pubblicata

Il profilo è quasi piatto. L’output leggermente più economico di Qwen aiuta nei mesi molto generativi; l’input leggermente più economico di GLM aiuta il retrieval. Z.ai fattura i thinking token alla tariffa di output. Qwen documenta enable_thinking e reasoning_effort su QwenCloud senza un prezzo separato per i thinking token, quindi considera il reasoning come output finché non dicono il contrario.

Entrambi i laboratori pubblicano tariffe di cache, ma prezzano lo scambio in modo diverso. Z.ai lista l’input in cache a $0,03 per 1M token ($0,015 in promo) e rende gratuite le scritture in cache durante la finestra promo. Qwen legge la cache a $0,016 ma addebita $0,20 per 1M token per creare una cache esplicita.

Quindi Qwen dimezza la tariffa di lettura della cache, e GLM regala la scrittura. Se i tuoi prefissi sono stabili e longevi, vince la lettura di Qwen; se riscrivi spesso le cache, vincono le scritture gratuite di GLM, almeno fino al 9 settembre.

Quanto costa un carico reale

Formula: (volume ÷ 1M) × tariffa, sommata tra input e output, a prezzi di listino standard. I dollari promo restano fuori tabella.

Carico GLM-5.3-Flash Qwen3.8-Flash Differenza
Assistente bilanciato: 1M in / 250K out $0,28 $0,28 $0,00 (0%)
Molto generativo: 1M in / 4M out $2,15 $2,04 Qwen $0,11 più economico (5%)
Retrieval, sotto soglia: 10M in / 1M out $2,00 $2,07 GLM $0,07 più economico (3%)

Il costo API di listino è pari. La scelta dipende dall’aderenza al carico e dall’esistenza dell’endpoint. Entrambi i modelli usano tokenizer specifici del vendor e nessuno dei due laboratori ha pubblicato conteggi di token per un carico condiviso, quindi tratta questi totali come un confronto di tariffe più che come una fattura. Fino al 9 settembre 2026, la promo di GLM dimezza quei totali nella colonna GLM ($0,14, $1,08, $1,00).

Quando scegliere GLM-5.3-Flash vs Qwen3.8-Flash-Next

Scegli GLM per un’API attiva, Qwen per agenti da ufficio

Se devi chiamare un’API first-party questa settimana, GLM-5.3-Flash è l’unico prodotto completo della coppia. Se stai valutando l’architettura di Qwen4, o ti interessano CoWorkBench e JobBench, parti subito con i pesi di Qwen3.8-Flash-Next e aggiungi qwen3.8-flash quando sarà disponibile su QwenCloud.

Scegli GLM-5.3-Flash se...

  • Ti serve glm-5.3-flash su Z.ai, o z-ai/glm-5.3-flash su OpenRouter, senza aspettare uno SKU cloud in coda.

  • Il tuo set di valutazione somiglia a DeepSWE, Toolathlon, NL2Repo o Terminal Bench 2.1, e vuoi il laboratorio che ha pubblicato i punteggi più alti sul set sovrapposto.

  • Vuoi pesi con licenza MIT e una finestra nativa da 1M token, e ti va bene attivarne 18B.

  • Sei già su un GLM Coding Plan e puoi usare la quota 3x rispetto a GLM-5.3, inclusa la promo fino al 9 settembre 2026.

  • Vuoi agenti desktop visuali. Browser Use e Computer Use di ZCode sono nel post di lancio, e il numero di Qwen a confronto è OSWorld 2.0 a 19,4, che non è da podio.

Scegli Qwen3.8-Flash-Next se...

  • Stai acquistando un’anteprima di Qwen4, non un’API gestita finita. Oggi il prodotto sono i pesi.

  • I benchmark per agenti da ufficio sono quelli che leggi davvero. CoWorkBench e JobBench sono la storia pubblicata da Qwen, non da GLM.

  • Vuoi 6B parametri attivi e una tabella n-gram che può stare in memoria host, anche accanto a un setup locale Qwen3.8-27B.

  • Vivi già in Qwen Chat, Qwen Studio, Qwen Code, o punti qualsiasi agente compatibile OpenAI (OpenCode, Codex, Qwen Code) a un endpoint locale llama.cpp oggi. Claude Code richiede un proxy di traduzione.

Come iniziare con GLM-5.3-Flash e Qwen3.8-Flash-Next

Superficie GLM-5.3-Flash Qwen3.8-Flash-Next
App consumer Playground web Z.ai e GLM Coding Plan Qwen Chat e Qwen Studio
API first-party Sì, Z.ai, glm-5.3-flash QwenCloud qwen3.8-flash (API in arrivo)
Piattaforme cloud Non disponibile su Bedrock, Vertex AI o Azure AI Foundry Non disponibile su Bedrock, Vertex AI o Azure AI Foundry
Agenti di coding ZCode; OpenRouter negli IDE che accettano provider personalizzati. Non nativo in Claude Code, GitHub Copilot o Cursor Funziona oggi via llama.cpp locale + OpenCode; stesso collegamento varrà per QwenCloud quando sarà attivo. Non nativo in Claude Code, GitHub Copilot o Cursor
Router di terze parti OpenRouter, DeepInfra, Together.ai OpenRouter
ID modello API glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) qwen3.8-flash su QwenCloud e OpenRouter; pesi Qwen/Qwen3.8-Flash-Next

GLM-5.3-Flash è chiamabile ora. Anche Qwen3.8-Flash-Next lo è, solo sul tuo hardware o tramite router come OpenRouter. L’endpoint API di Qwen dovrebbe seguire a breve.

Digita quegli ID esattamente. L’ID di Qwen3.8-Flash-Next è qwen3.8-flash (senza "next"), quindi non inventare un ID cloud qwen3.8-flash-next partendo dal nome dei pesi.

Fare la tua prima chiamata API

Entrambi i modelli parlano il formato chat completions di OpenAI, quindi puoi riutilizzare lo stesso client in entrambi i casi. Il modo più veloce per provarli fianco a fianco è OpenRouter, dove entrambi stanno dietro un’unica base URL, e l’unica cosa che cambi è la stringa del modello.

from openai import OpenAI
import os

# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",  # or "qwen/qwen3.8-flash"
    messages=[{"role": "user", "content": "Refactor this function..."}],
    extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)

Andare first-party ti costa la portabilità. L’endpoint di Z.ai vive su docs.z.ai e accetta thinking: {"type": "enabled"} con reasoning_effort impostato su low, high o max. Quello di Alibaba accetta enable_thinking con reasoning_effort predefinito a xhigh, su una base URL DashScope (internazionale, Pechino o Virginia). È lo stesso SDK in entrambi i casi, ma la manopola del reasoning non è portabile, quindi prevedi un piccolo adapter se pensi di cambiare.

Per una guida completa a Qwen, leggi il nostro tutorial su come eseguire Qwen3.8-Flash-Next in locale e il tutorial sulla CLI di Qwen Code. Per il serving locale della famiglia GLM, usa Esegui GLM-5 in locale per il coding agentico. Se sei già su una macchina Qwen3.8-27B, il nostro setup RTX 5090 è il percorso locale gemello, non questa anteprima da 125B.

Considerazioni finali

Se devi spedire contro un’API Flash attiva questa settimana, usa GLM-5.3-Flash. Se stai studiando Qwen4 o credi più a CoWorkBench che a DeepSWE, usa i pesi di Qwen3.8-Flash-Next in locale e passa a qwen3.8-flash via API quando sarà disponibile.

Ciò che trovo più interessante è quanto poco i prezzi di listino divergano. La discussione riguarda l’accesso e quale riga non pubblicata sei disposto a ignorare, non un baratro di costi 2x.

Se vuoi i concetti alla base di entrambi i MoE, ti consigliamo il corso Large Language Models (LLMs) Concepts, poi il percorso AI Agent Fundamentals. Per lavoro con hub e pesi, Working with Hugging Face è il passo pratico successivo.

FAQ

Quando dovrei usare GLM-5.3-Flash invece di Qwen3.8-Flash-Next?

Usa GLM-5.3-Flash quando ti serve un’API first-party attiva questa settimana, pesi con licenza MIT o i punteggi più alti sul set sovrapposto di coding (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).

Usa Qwen3.8-Flash-Next quando vuoi eseguire in locale l’anteprima dell’architettura Qwen4, avere 6B parametri attivi più efficienti o usare il modello in un setup da agente d’ufficio (CoWorkBench 73,9, JobBench 55,7).

Dove posso accedere a GLM-5.3-Flash e Qwen3.8-Flash-Next?

GLM-5.3-Flash è attivo su Z.ai come glm-5.3-flash, sul GLM Coding Plan e su OpenRouter come z-ai/glm-5.3-flash. I pesi sono su Hugging Face con licenza MIT.

I pesi di Qwen3.8-Flash-Next sono su Hugging Face e ModelScope. L’API di produzione è Qwen3.8-Flash su QwenCloud come qwen3.8-flash, indicata in arrivo, ma puoi già accedere al modello tramite OpenRouter. Qwen Chat e Qwen Studio sono le superfici consumer.

Come si confrontano GLM-5.3-Flash e Qwen3.8-Flash-Next sul coding?

Sui benchmark di coding pubblicati da entrambi i laboratori, GLM-5.3-Flash è avanti: DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5 e NL2Repo 56,3 vs 48,1. Gli harness non sono identici.

Quali sono gli ID modello API per GLM-5.3-Flash e Qwen3.8-Flash-Next?

GLM-5.3-Flash è glm-5.3-flash su Z.ai e z-ai/glm-5.3-flash su OpenRouter.

L’ID di produzione su QwenCloud è qwen3.8-flash, non un ID cloud qwen3.8-flash-next. I pesi aperti sono Qwen/Qwen3.8-Flash-Next.

Qwen3.8-Flash-Next è lo stesso di Qwen3.8-Flash?

No. Qwen3.8-Flash-Next è l’anteprima a pesi aperti dell’architettura. Qwen3.8-Flash è lo SKU di produzione su QwenCloud, a listino a $0,16 / $0,47 per 1M token, con un contesto predefinito da 1M e strumenti integrati ufficiali. L’API era indicata in arrivo il 26 agosto 2026.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom è un data scientist e formatore tecnico. Scrive e gestisce i tutorial e i post del blog di DataCamp su data science. In precedenza, Tom ha lavorato nella data science presso Deutsche Telekom.

Argomenti

Impara l’IA con DataCamp!

Programma

Ingegnere AI associato per sviluppatori

26 h
Scopri come integrare l'intelligenza artificiale nelle applicazioni software utilizzando API e librerie open-source. Inizia oggi il tuo percorso per diventare un ingegnere AI!
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro