Cursus
Le 26 août 2026, Z.ai a lancé GLM-5.3-Flash et l’équipe Qwen d’Alibaba a ouvert les poids de Qwen3.8-Flash-Next. Deux modèles open-weight, nativement multimodaux et de type mixture-of-experts (MoE), positionnés dans la classe Flash pour l’efficacité-coût, pas comme des versions au rabais.
Flash signifiait autrefois « le modèle allégé ». Ces deux modèles incarnent le pari d’efficacité des labos pour les agents de code et le service long contexte, sortis à 24 heures d’intervalle. L’appariement est volontairement bancal : ils ne publient pas les mêmes benchmarks, et une seule API propriétaire est disponible aujourd’hui.
À retenir
- GLM-5.3-Flash mène sur les benchmarks de code et d’outillage publiés par les deux labos.
- Choisissez GLM-5.3-Flash si vous avez besoin d’une API live, de poids sous licence MIT et d’une fenêtre de 1 million de tokens sans YaRN.
- Choisissez Qwen3.8-Flash-Next si vous pouvez auto-héberger (les poids tournent déjà avec llama.cpp) ou si vous pouvez attendre l’API managée QwenCloud.
- Les prix publics se tiennent à quelques cents près ; la promo à -50 % de GLM jusqu’au 9 septembre 2026 est la seule qui fera bouger une facture cette semaine.
Introduction aux agents d'intelligence artificielle
Qu’est-ce que GLM-5.3-Flash ?
GLM-5.3-Flash est le premier modèle nativement multimodal de la série GLM-5 de Z.ai, publié le 26 août 2026 avec 320 milliards de paramètres au total et 18 milliards actifs. Selon Z.ai, il surpasse GLM-5.2 sur les benchmarks de code et d’agents pour environ un dixième du prix, et obtient 57 sur l’Artificial Analysis Intelligence Index v4.1.1, pour 0,045 $ par tâche au tarif remisé.
L’architecture est le vrai sujet : attention hybride linéaire et clairsemée, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodal de 30 000 milliards de tokens, et 45 couches au lieu des 92 de GLM-4.5. Z.ai l’a fait tourner anonymement sous ox-alpha sur OpenCode et OpenRouter avant de l’annoncer, servi sur des puces IA chinoises. Les poids sont sur Hugging Face sous licence MIT, avec des recettes de déploiement pour SGLang, vLLM et TokenSpeed.
Pour plus de détails, consultez notre guide GLM-5.3-Flash. Pour la génération précédente, voyez notre guide GLM-5.2 et notre tutoriel sur exécuter GLM-5 en local pour le code agentique.
Qu’est-ce que Qwen3.8-Flash-Next ?
Qwen3.8-Flash-Next est l’aperçu open-weight de l’architecture prévue pour Qwen4 par l’équipe Qwen d’Alibaba, publié le 26 août 2026. Le modèle principal compte 125 milliards de paramètres, plus une table d’embedding n-grammes de 51 milliards de paramètres, avec 6 milliards de paramètres actifs par token. Le contexte natif est de 262 144 tokens, extensible à 1 000 000 avec YaRN. Qwen indique un coût d’entraînement d’environ un neuvième de Qwen3.7-Plus.
La référence en production est Qwen3.8-Flash sur QwenCloud, listée à 0,16 $ par 1 M de tokens en entrée et 0,47 $ par 1 M en sortie, avec une API indiquée comme « bientôt disponible ». L’ID du modèle cloud est qwen3.8-flash. Nous avons déjà publié un guide Qwen3.8-Flash-Next dédié et un tutoriel de mise en place pour exécuter Qwen3.8-Flash-Next en local comme agent de code avec OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next : comparaison directe

Sur les benchmarks publiés par les deux labos, GLM-5.3-Flash est devant, ce qui est attendu puisqu’il est le plus grand des deux. Les prix sont très proches.
| Caractéristique | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Labo / date | Z.ai, 26 août 2026 | Qwen (Alibaba), 26 août 2026 |
| Taille | 320B au total, 18B actifs | 125B principal + 51B n-grammes, 6B actifs |
| Contexte | 1 M de tokens natif | 262 144 natif ; 1 000 000 avec YaRN |
| Modalités | Nativement multimodal (texte, image, vidéo en entrée) | MoE nativement multimodal |
| Poids | MIT, zai-org/GLM-5.3-Flash |
Open weight, Qwen/Qwen3.8-Flash-Next |
| Benchmarks de code partagés | En tête sur DeepSWE, Toolathlon, NL2Repo | Derrière sur ces trois ; SWE-bench Pro 62,5 publié |
| Benchmarks d’agent bureau | AutomationBench 48,8 ; OfficeQA Pro 62,4 | CoWorkBench 73,9 ; JobBench 55,7 |
| Prix public API (par 1 M) | 0,15 $ entrée / 0,50 $ sortie | 0,16 $ entrée / 0,47 $ sortie (Qwen3.8-Flash) |
| API propriétaire | Active, glm-5.3-flash |
En file d’attente, qwen3.8-flash |
Code et workflows agentiques
GLM-5.3-Flash mène sur les scores de code et d’outillage publiés par les deux fournisseurs. La table du 26 août de Z.ai indique DeepSWE v1.1 à 63,4, Toolathlon Verified à 78,4 et NL2Repo à 56,3. La table de Qwen affiche 58,7, 73,5 et 48,1 sur ces mêmes jeux.
Au-delà, la comparaison est difficile car les sélections de benchmarks diffèrent. Qwen publie SWE-bench Pro à 62,5 et SWE-bench Multilingual à 81,0. Z.ai publie Terminal Bench 2.1 à 84,3 et AutomationBench à 48,8, ainsi qu’un score interne Z.ai Code Bench v1.0 de 29,0 à effort max contre 29,5 pour Claude Opus 4.8, exécuté dans Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Notes |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Tables fournisseurs ; GLM a utilisé mini-swe-agent, Qwen reporte le meilleur de Claude Code et mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1 ; GLM moyenne 3 runs |
| NL2Repo | 56,3 | 48,1 | Qwen l’intitule NL2Repo-Bench |
| SWE-bench Pro | Non publié | 62,5 | Qwen a relancé les baselines dans Claude Code |
| Terminal Bench 2.1 | 84,3 | Non publié | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (score 51,2) | Formats de reporting différents |
Je traiterais GLM comme le meilleur agent de code « Flash » publié sur l’ensemble commun, et je m’abstiendrais de désigner un vainqueur sur SWE-bench sans score publié par Z.ai.
Travail bureautique et agents long-horizon
Qwen est le labo qui publie des scores long-horizon orientés bureau. CoWorkBench est à 73,9 et JobBench à 55,7, loin devant Qwen3.7-Plus (65,1 et 27,6) et devant Claude Opus 4.6 Max sur ces lignes (68,2 et 36,6).
Les chiffres « travail » de Z.ai qui se recoupent sont AutomationBench 48,8 et OfficeQA Pro 62,4, plus ZCode Browser Use et Computer Use pour le travail visuel sur desktop.
Ce ne sont pas les mêmes tests, donc pas de verdict définitif. Si votre cadre mental est un agent de bureau multi-heures, Qwen vous fournit les benchmarks. Si c’est de l’automatisation façon Zapier ou de la QA sur PDF, GLM vous donne ces repères.
Architecture et coût de service
Qwen3.8-Flash-Next active 6 milliards de paramètres par token. GLM-5.3-Flash en active 18 milliards. Cet écart de 3x est le fait matériel le plus net ici, et c’est pourquoi les discussions de service local convergent sur Qwen. En pratique, le GGUF UD-Q4_K_XL (~111 Go) tourne sur une seule carte 96 Go avec offload RAM — nous l’avons fait ici.
Les deux utilisent une attention hybride. Z.ai annonce que GLM-5.3-Flash réduit le calcul d’attention par 3,0x et la taille du cache KV par 4,4x vs GLM-5.3. Qwen indique que le kernel d’attention de QSA est jusqu’à 7,6x plus rapide en prefill et 4,9x en decode à 1 M de tokens, et 8,6x le throughput prefill de Qwen3.7-Plus avec 90 % de hits en prefix-cache.
Le « bonus capacité » façon 51B de GLM n’est pas une table d’embedding ; la table n-grammes 51B de Qwen est conçue pour résider en RAM hôte et du préchargement. Recettes différentes, même promesse : plus de capacité par watt.
Capacités multimodales et contexte
Les deux modèles acceptent les images dans la même génération que le texte. GLM-5.3-Flash est explicitement le premier membre nativement multimodal de GLM-5, entraîné sur un corpus multimodal de 30 000 milliards de tokens, avec des capacités vidéo côté vision (MVBench 77,8, MMVU 80,5).
Qwen3.8-Flash-Next publie AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 et CharXiv 84,6 sans outil d’usage ordinateur / 90,6 avec.
La taille de fenêtre de contexte est assez proche pour ne pas être un critère unique. GLM annonce 1 M de tokens natif. Qwen est natif à 262 144 et s’étend à 1 000 000 avec YaRN. Les retours de recherche considèrent encore le 1 M de GLM comme peu éprouvé en production.
Tarification : ce que vous payez vraiment

Hors promos, vous distinguerez à peine les prix. Qwen et Z.ai visent clairement le même segment.
Tarifs par token côte à côte
| Tarif | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Entrée, par 1 M de tokens | 0,15 $ (0,075 $ promo) | 0,16 $ |
| Sortie, par 1 M de tokens | 0,50 $ (0,25 $ promo) | 0,47 $ |
| Entrée en cache, par 1 M de tokens | 0,03 $ (0,015 $ promo) | 0,016 $ |
| Sortie en cache, par 1 M de tokens | Gratuit pendant la promo | 0,20 $ |
| Promo de lancement | -50 % jusqu’au 9 septembre 2026, 24:00 UTC+8 | Aucune publiée |
| Quota Coding Plan | 3x GLM-5.3 sur tous les niveaux | Non publié |
La courbe est quasiment plate. La sortie un peu moins chère chez Qwen aide les mois très génératifs ; l’entrée un peu moins chère chez GLM favorise la recherche. Z.ai facture les tokens de réflexion au tarif sortie. Qwen documente enable_thinking et reasoning_effort sur QwenCloud sans tarif distinct pour la réflexion, donc considérez-la comme de la sortie jusqu’à nouvel ordre.
Les deux publient des tarifs de cache, avec des arbitrages différents. Z.ai liste la lecture de cache d’entrée à 0,03 $/1 M (0,015 $ en promo) et rend l’écriture de cache gratuite pendant la promo. Qwen lit le cache à 0,016 $ mais facture 0,20 $/1 M pour créer un cache explicite.
Ainsi, Qwen divise par deux votre coût de lecture de cache, et GLM offre l’écriture. Si vos préfixes sont stables et durables, l’avantage est à Qwen ; si vous réécrivez souvent les caches, GLM gagne, au moins jusqu’au 9 septembre.
Combien coûte une charge réelle
Formule : (volume ÷ 1 M) × tarif, sommée entre entrées et sorties, aux tarifs publics standards. Les montants promo ne figurent pas dans le tableau.
| Charge | GLM-5.3-Flash | Qwen3.8-Flash | Écart |
|---|---|---|---|
| Assistant équilibré : 1 M entrée / 250 K sortie | 0,28 $ | 0,28 $ | 0,00 $ (0 %) |
| Génération lourde : 1 M entrée / 4 M sortie | 2,15 $ | 2,04 $ | Qwen moins cher de 0,11 $ (5 %) |
| Recherche, sous-seuil : 10 M entrée / 1 M sortie | 2,00 $ | 2,07 $ | GLM moins cher de 0,07 $ (3 %) |
À prix publics, balle au centre. La décision tient à l’adéquation à la charge et à l’existence de l’endpoint. Les deux modèles ont des tokenizers propriétaires, et aucun labo n’a publié de comptage commun sur une même charge, donc traitez ces totaux comme une comparaison de tarifs, pas une facture. Jusqu’au 9 septembre 2026, la promo GLM divise par deux les totaux de la colonne GLM (0,14 $, 1,08 $, 1,00 $).
Quand choisir GLM-5.3-Flash vs Qwen3.8-Flash-Next

Si vous devez appeler une API propriétaire cette semaine, GLM-5.3-Flash est le seul produit complet des deux. Si vous évaluez l’architecture de Qwen4, ou si CoWorkBench et JobBench comptent pour vous, commencez dès maintenant avec les poids Qwen3.8-Flash-Next et ajoutez qwen3.8-flash quand il sera disponible sur QwenCloud.
Choisissez GLM-5.3-Flash si…
-
Vous avez besoin de
glm-5.3-flashsur Z.ai, ou dez-ai/glm-5.3-flashsur OpenRouter, sans attendre une référence cloud en file d’attente. -
Votre set d’évaluation ressemble à DeepSWE, Toolathlon, NL2Repo ou Terminal Bench 2.1, et vous voulez le labo qui a publié les meilleurs scores sur l’ensemble commun.
-
Vous souhaitez des poids MIT et une fenêtre native de 1 M de tokens, et activer 18B de paramètres vous convient.
-
Vous êtes déjà sur un GLM Coding Plan et pouvez utiliser le quota 3x par rapport à GLM-5.3, y compris la promo jusqu’au 9 septembre 2026.
- Vous voulez des agents desktop visuels. Browser Use et Computer Use de ZCode sont dans le post de lancement, et le contre-exemple de Qwen est OSWorld 2.0 à 19,4, ce qui n’est pas un trophée.
Choisissez Qwen3.8-Flash-Next si…
-
Vous achetez un aperçu Qwen4, pas une API managée finalisée. Aujourd’hui, le produit, ce sont les poids.
-
Les benchmarks d’agents bureautiques sont ceux que vous suivez. CoWorkBench et JobBench sont l’histoire publiée de Qwen, pas celle de GLM.
-
Vous voulez 6B de paramètres actifs et une table n-grammes logeable en mémoire hôte, y compris à côté d’une installation locale Qwen3.8-27B.
-
Vous utilisez déjà Qwen Chat, Qwen Studio, Qwen Code, ou vous pointez un agent compatible OpenAI (OpenCode, Codex, Qwen Code) sur un endpoint llama.cpp local aujourd’hui. Claude Code nécessite un proxy de traduction.
Par où commencer avec GLM-5.3-Flash et Qwen3.8-Flash-Next
| Surface | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Application grand public | Playground web Z.ai et GLM Coding Plan | Qwen Chat et Qwen Studio |
| API propriétaire | Oui, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API bientôt disponible) |
| Plateformes cloud | Non disponible sur Bedrock, Vertex AI ou Azure AI Foundry | Non disponible sur Bedrock, Vertex AI ou Azure AI Foundry |
| Agents de code | ZCode ; OpenRouter dans des IDE acceptant des fournisseurs personnalisés. Pas natif dans Claude Code, GitHub Copilot ou Cursor | Fonctionne aujourd’hui via llama.cpp local + OpenCode ; le même câblage s’appliquera à QwenCloud une fois live. Pas natif dans Claude Code, GitHub Copilot ou Cursor |
| Routeurs tiers | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID du modèle API | glm-5.3-flash (OpenRouter : z-ai/glm-5.3-flash) |
qwen3.8-flash sur QwenCloud et OpenRouter ; poids Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash est appelable dès maintenant. Qwen3.8-Flash-Next aussi, mais uniquement sur votre propre matériel ou via des routeurs comme OpenRouter. L’endpoint API de Qwen devrait suivre rapidement.
Saisissez les IDs à l’identique. L’ID de Qwen3.8-Flash-Next est qwen3.8-flash (sans « next »), donc n’inventez pas un ID cloud qwen3.8-flash-next à partir du nom des poids.
Votre premier appel d’API
Les deux modèles parlent le format OpenAI chat completions, vous réutilisez donc le client standard. Le moyen le plus rapide de les essayer côte à côte est OpenRouter, où les deux partagent la même base URL, et seule la chaîne du modèle change.
from openai import OpenAI
import os
# Un client, deux modèles. Remplacez le nom du modèle à la ligne 12 — rien d’autre ne change.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # ou "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Aller en propriétaire vous fait perdre en portabilité. L’endpoint de Z.ai vit sur docs.z.ai et prend thinking: {"type": "enabled"} avec reasoning_effort réglé sur low, high ou max. Celui d’Alibaba prend enable_thinking avec reasoning_effort par défaut à xhigh, sur une base URL DashScope (international, Pékin ou Virginie). Le SDK est le même, mais le réglage de « reasoning » n’est pas portable, prévoyez donc un petit adaptateur si vous comptez basculer.
Pour un pas-à-pas Qwen complet, lisez notre tutoriel pour exécuter Qwen3.8-Flash-Next en local et le tutoriel Qwen Code CLI. Pour la famille GLM en local, utilisez Run GLM-5 Locally For Agentic Coding. Si vous êtes déjà sur une machine Qwen3.8-27B, notre configuration RTX 5090 est la voie sœur en local, pas cet aperçu 125B.
Dernières réflexions
Si vous devez livrer contre une API Flash live cette semaine, utilisez GLM-5.3-Flash. Si vous étudiez Qwen4 ou si vous faites davantage confiance à CoWorkBench qu’à DeepSWE, utilisez les poids Qwen3.8-Flash-Next en local et basculez vers l’API qwen3.8-flash quand elle sera en ligne.
Ce qui m’intéresse le plus, c’est à quel point les prix publics diffèrent peu. Le débat porte sur l’accès et sur quelle ligne non publiée vous êtes prêt à ignorer, pas sur un gouffre de coûts de 2x.
Pour les concepts derrière ces MoE, je recommande notre cours Large Language Models (LLMs) Concepts, puis le parcours AI Agent Fundamentals. Pour le travail hub + poids, Working with Hugging Face est l’étape pratique suivante.
FAQ
Quand utiliser GLM-5.3-Flash plutôt que Qwen3.8-Flash-Next ?
Utilisez GLM-5.3-Flash si vous avez besoin d’une API propriétaire live cette semaine, de poids sous licence MIT, ou des meilleurs scores sur l’ensemble de benchmarks de code communs (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).
Utilisez Qwen3.8-Flash-Next si vous souhaitez exécuter en local l’aperçu d’architecture Qwen4, bénéficier de 6B de paramètres actifs plus efficients, ou exploiter le modèle dans un cadre d’agent bureautique (CoWorkBench 73,9, JobBench 55,7).
Où accéder à GLM-5.3-Flash et Qwen3.8-Flash-Next ?
GLM-5.3-Flash est disponible sur Z.ai sous glm-5.3-flash, dans le GLM Coding Plan, et sur OpenRouter sous z-ai/glm-5.3-flash. Les poids sont sur Hugging Face sous licence MIT.
Les poids de Qwen3.8-Flash-Next sont sur Hugging Face et ModelScope. L’API de production est Qwen3.8-Flash sur QwenCloud sous qwen3.8-flash, annoncée « bientôt disponible », mais vous pouvez déjà accéder au modèle via OpenRouter. Qwen Chat et Qwen Studio sont les surfaces grand public.
Comment GLM-5.3-Flash et Qwen3.8-Flash-Next se comparent-ils sur le code ?
Sur les benchmarks de code publiés par les deux labos, GLM-5.3-Flash est devant : DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5, et NL2Repo 56,3 vs 48,1. Les harnais ne sont pas identiques.
Quels sont les IDs de modèles API pour GLM-5.3-Flash et Qwen3.8-Flash-Next ?
GLM-5.3-Flash est glm-5.3-flash sur Z.ai et z-ai/glm-5.3-flash sur OpenRouter.
L’ID de production sur QwenCloud est qwen3.8-flash, pas un ID cloud qwen3.8-flash-next. Les poids ouverts sont Qwen/Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next est-il identique à Qwen3.8-Flash ?
Non. Qwen3.8-Flash-Next est l’aperçu d’architecture open-weight. Qwen3.8-Flash est la référence de production sur QwenCloud, listée à 0,16 / 0,47 $ par 1 M de tokens, avec un contexte par défaut à 1 M et des outils intégrés officiels. L’API était annoncée comme « bientôt disponible » au 26 août 2026.
Rédacteur en chef Data Science chez DataCamp | Je suis passionné par la prévision et le développement à l'aide d'API.


