Accéder au contenu principal

GLM-5.3-Flash vs Qwen3.8-Flash-Next : code, coûts et accès

Les nouveaux modèles de Z.ai et d’Alibaba visent le même segment. GLM-5.3-Flash mène sur les benchmarks de code partagés et est disponible ; Qwen3.8-Flash-Next est l’aperçu Qwen4 allégé avec une API en file d’attente.
Actualisé 31 août 2026  · 11 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Le 26 août 2026, Z.ai a lancé GLM-5.3-Flash et l’équipe Qwen d’Alibaba a ouvert les poids de Qwen3.8-Flash-Next. Deux modèles open-weight, nativement multimodaux et de type mixture-of-experts (MoE), positionnés dans la classe Flash pour l’efficacité-coût, pas comme des versions au rabais.

Flash signifiait autrefois « le modèle allégé ». Ces deux modèles incarnent le pari d’efficacité des labos pour les agents de code et le service long contexte, sortis à 24 heures d’intervalle. L’appariement est volontairement bancal : ils ne publient pas les mêmes benchmarks, et une seule API propriétaire est disponible aujourd’hui.

À retenir

  • GLM-5.3-Flash mène sur les benchmarks de code et d’outillage publiés par les deux labos.
  • Choisissez GLM-5.3-Flash si vous avez besoin d’une API live, de poids sous licence MIT et d’une fenêtre de 1 million de tokens sans YaRN.
  • Choisissez Qwen3.8-Flash-Next si vous pouvez auto-héberger (les poids tournent déjà avec llama.cpp) ou si vous pouvez attendre l’API managée QwenCloud.
  • Les prix publics se tiennent à quelques cents près ; la promo à -50 % de GLM jusqu’au 9 septembre 2026 est la seule qui fera bouger une facture cette semaine.

Introduction aux agents d'intelligence artificielle

Apprenez les principes fondamentaux des agents d'intelligence artificielle, leurs composants et leur utilisation dans le monde réel - aucun codage n'est nécessaire.
Cours D'exploration

Qu’est-ce que GLM-5.3-Flash ?

GLM-5.3-Flash est le premier modèle nativement multimodal de la série GLM-5 de Z.ai, publié le 26 août 2026 avec 320 milliards de paramètres au total et 18 milliards actifs. Selon Z.ai, il surpasse GLM-5.2 sur les benchmarks de code et d’agents pour environ un dixième du prix, et obtient 57 sur l’Artificial Analysis Intelligence Index v4.1.1, pour 0,045 $ par tâche au tarif remisé.

L’architecture est le vrai sujet : attention hybride linéaire et clairsemée, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodal de 30 000 milliards de tokens, et 45 couches au lieu des 92 de GLM-4.5. Z.ai l’a fait tourner anonymement sous ox-alpha sur OpenCode et OpenRouter avant de l’annoncer, servi sur des puces IA chinoises. Les poids sont sur Hugging Face sous licence MIT, avec des recettes de déploiement pour SGLang, vLLM et TokenSpeed.

Pour plus de détails, consultez notre guide GLM-5.3-Flash. Pour la génération précédente, voyez notre guide GLM-5.2 et notre tutoriel sur exécuter GLM-5 en local pour le code agentique.

Qu’est-ce que Qwen3.8-Flash-Next ?

Qwen3.8-Flash-Next est l’aperçu open-weight de l’architecture prévue pour Qwen4 par l’équipe Qwen d’Alibaba, publié le 26 août 2026. Le modèle principal compte 125 milliards de paramètres, plus une table d’embedding n-grammes de 51 milliards de paramètres, avec 6 milliards de paramètres actifs par token. Le contexte natif est de 262 144 tokens, extensible à 1 000 000 avec YaRN. Qwen indique un coût d’entraînement d’environ un neuvième de Qwen3.7-Plus.

La référence en production est Qwen3.8-Flash sur QwenCloud, listée à 0,16 $ par 1 M de tokens en entrée et 0,47 $ par 1 M en sortie, avec une API indiquée comme « bientôt disponible ». L’ID du modèle cloud est qwen3.8-flash. Nous avons déjà publié un guide Qwen3.8-Flash-Next dédié et un tutoriel de mise en place pour exécuter Qwen3.8-Flash-Next en local comme agent de code avec OpenCode.

GLM-5.3-Flash vs Qwen3.8-Flash-Next : comparaison directe

GLM domine les benchmarks de code partagés ; Qwen a l’API en file d’attente

Sur les benchmarks publiés par les deux labos, GLM-5.3-Flash est devant, ce qui est attendu puisqu’il est le plus grand des deux. Les prix sont très proches.

Caractéristique GLM-5.3-Flash Qwen3.8-Flash-Next
Labo / date Z.ai, 26 août 2026 Qwen (Alibaba), 26 août 2026
Taille 320B au total, 18B actifs 125B principal + 51B n-grammes, 6B actifs
Contexte 1 M de tokens natif 262 144 natif ; 1 000 000 avec YaRN
Modalités Nativement multimodal (texte, image, vidéo en entrée) MoE nativement multimodal
Poids MIT, zai-org/GLM-5.3-Flash Open weight, Qwen/Qwen3.8-Flash-Next
Benchmarks de code partagés En tête sur DeepSWE, Toolathlon, NL2Repo Derrière sur ces trois ; SWE-bench Pro 62,5 publié
Benchmarks d’agent bureau AutomationBench 48,8 ; OfficeQA Pro 62,4 CoWorkBench 73,9 ; JobBench 55,7
Prix public API (par 1 M) 0,15 $ entrée / 0,50 $ sortie 0,16 $ entrée / 0,47 $ sortie (Qwen3.8-Flash)
API propriétaire Active, glm-5.3-flash En file d’attente, qwen3.8-flash

Code et workflows agentiques

GLM-5.3-Flash mène sur les scores de code et d’outillage publiés par les deux fournisseurs. La table du 26 août de Z.ai indique DeepSWE v1.1 à 63,4, Toolathlon Verified à 78,4 et NL2Repo à 56,3. La table de Qwen affiche 58,7, 73,5 et 48,1 sur ces mêmes jeux.

Au-delà, la comparaison est difficile car les sélections de benchmarks diffèrent. Qwen publie SWE-bench Pro à 62,5 et SWE-bench Multilingual à 81,0. Z.ai publie Terminal Bench 2.1 à 84,3 et AutomationBench à 48,8, ainsi qu’un score interne Z.ai Code Bench v1.0 de 29,0 à effort max contre 29,5 pour Claude Opus 4.8, exécuté dans Claude Code 2.1.207.

Benchmark GLM-5.3-Flash Qwen3.8-Flash-Next Notes
DeepSWE v1.1 63,4 58,7 Tables fournisseurs ; GLM a utilisé mini-swe-agent, Qwen reporte le meilleur de Claude Code et mini-SWE-agent
Toolathlon Verified 78,4 73,5 Pass@1 ; GLM moyenne 3 runs
NL2Repo 56,3 48,1 Qwen l’intitule NL2Repo-Bench
SWE-bench Pro Non publié 62,5 Qwen a relancé les baselines dans Claude Code
Terminal Bench 2.1 84,3 Non publié Z.ai, Claude Code 2.1.207
Agents' Last Exam 26,3 24,3 pass@1 (score 51,2) Formats de reporting différents

Je traiterais GLM comme le meilleur agent de code « Flash » publié sur l’ensemble commun, et je m’abstiendrais de désigner un vainqueur sur SWE-bench sans score publié par Z.ai.

Travail bureautique et agents long-horizon

Qwen est le labo qui publie des scores long-horizon orientés bureau. CoWorkBench est à 73,9 et JobBench à 55,7, loin devant Qwen3.7-Plus (65,1 et 27,6) et devant Claude Opus 4.6 Max sur ces lignes (68,2 et 36,6).

Les chiffres « travail » de Z.ai qui se recoupent sont AutomationBench 48,8 et OfficeQA Pro 62,4, plus ZCode Browser Use et Computer Use pour le travail visuel sur desktop.

Ce ne sont pas les mêmes tests, donc pas de verdict définitif. Si votre cadre mental est un agent de bureau multi-heures, Qwen vous fournit les benchmarks. Si c’est de l’automatisation façon Zapier ou de la QA sur PDF, GLM vous donne ces repères.

Architecture et coût de service

Qwen3.8-Flash-Next active 6 milliards de paramètres par token. GLM-5.3-Flash en active 18 milliards. Cet écart de 3x est le fait matériel le plus net ici, et c’est pourquoi les discussions de service local convergent sur Qwen. En pratique, le GGUF UD-Q4_K_XL (~111 Go) tourne sur une seule carte 96 Go avec offload RAM — nous l’avons fait ici.

Les deux utilisent une attention hybride. Z.ai annonce que GLM-5.3-Flash réduit le calcul d’attention par 3,0x et la taille du cache KV par 4,4x vs GLM-5.3. Qwen indique que le kernel d’attention de QSA est jusqu’à 7,6x plus rapide en prefill et 4,9x en decode à 1 M de tokens, et 8,6x le throughput prefill de Qwen3.7-Plus avec 90 % de hits en prefix-cache.

Le « bonus capacité » façon 51B de GLM n’est pas une table d’embedding ; la table n-grammes 51B de Qwen est conçue pour résider en RAM hôte et du préchargement. Recettes différentes, même promesse : plus de capacité par watt.

Capacités multimodales et contexte

Les deux modèles acceptent les images dans la même génération que le texte. GLM-5.3-Flash est explicitement le premier membre nativement multimodal de GLM-5, entraîné sur un corpus multimodal de 30 000 milliards de tokens, avec des capacités vidéo côté vision (MVBench 77,8, MMVU 80,5).

Qwen3.8-Flash-Next publie AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 et CharXiv 84,6 sans outil d’usage ordinateur / 90,6 avec.

La taille de fenêtre de contexte est assez proche pour ne pas être un critère unique. GLM annonce 1 M de tokens natif. Qwen est natif à 262 144 et s’étend à 1 000 000 avec YaRN. Les retours de recherche considèrent encore le 1 M de GLM comme peu éprouvé en production.

Tarification : ce que vous payez vraiment

Prix publics à égalité, le moins cher bascule selon la charge

Hors promos, vous distinguerez à peine les prix. Qwen et Z.ai visent clairement le même segment.

Tarifs par token côte à côte

Tarif GLM-5.3-Flash Qwen3.8-Flash
Entrée, par 1 M de tokens 0,15 $ (0,075 $ promo) 0,16 $
Sortie, par 1 M de tokens 0,50 $ (0,25 $ promo) 0,47 $
Entrée en cache, par 1 M de tokens 0,03 $ (0,015 $ promo) 0,016 $
Sortie en cache, par 1 M de tokens Gratuit pendant la promo 0,20 $
Promo de lancement -50 % jusqu’au 9 septembre 2026, 24:00 UTC+8 Aucune publiée
Quota Coding Plan 3x GLM-5.3 sur tous les niveaux Non publié

La courbe est quasiment plate. La sortie un peu moins chère chez Qwen aide les mois très génératifs ; l’entrée un peu moins chère chez GLM favorise la recherche. Z.ai facture les tokens de réflexion au tarif sortie. Qwen documente enable_thinking et reasoning_effort sur QwenCloud sans tarif distinct pour la réflexion, donc considérez-la comme de la sortie jusqu’à nouvel ordre.

Les deux publient des tarifs de cache, avec des arbitrages différents. Z.ai liste la lecture de cache d’entrée à 0,03 $/1 M (0,015 $ en promo) et rend l’écriture de cache gratuite pendant la promo. Qwen lit le cache à 0,016 $ mais facture 0,20 $/1 M pour créer un cache explicite.

Ainsi, Qwen divise par deux votre coût de lecture de cache, et GLM offre l’écriture. Si vos préfixes sont stables et durables, l’avantage est à Qwen ; si vous réécrivez souvent les caches, GLM gagne, au moins jusqu’au 9 septembre.

Combien coûte une charge réelle

Formule : (volume ÷ 1 M) × tarif, sommée entre entrées et sorties, aux tarifs publics standards. Les montants promo ne figurent pas dans le tableau.

Charge GLM-5.3-Flash Qwen3.8-Flash Écart
Assistant équilibré : 1 M entrée / 250 K sortie 0,28 $ 0,28 $ 0,00 $ (0 %)
Génération lourde : 1 M entrée / 4 M sortie 2,15 $ 2,04 $ Qwen moins cher de 0,11 $ (5 %)
Recherche, sous-seuil : 10 M entrée / 1 M sortie 2,00 $ 2,07 $ GLM moins cher de 0,07 $ (3 %)

À prix publics, balle au centre. La décision tient à l’adéquation à la charge et à l’existence de l’endpoint. Les deux modèles ont des tokenizers propriétaires, et aucun labo n’a publié de comptage commun sur une même charge, donc traitez ces totaux comme une comparaison de tarifs, pas une facture. Jusqu’au 9 septembre 2026, la promo GLM divise par deux les totaux de la colonne GLM (0,14 $, 1,08 $, 1,00 $).

Quand choisir GLM-5.3-Flash vs Qwen3.8-Flash-Next

Choisissez GLM pour une API live, Qwen pour les agents bureautiques

Si vous devez appeler une API propriétaire cette semaine, GLM-5.3-Flash est le seul produit complet des deux. Si vous évaluez l’architecture de Qwen4, ou si CoWorkBench et JobBench comptent pour vous, commencez dès maintenant avec les poids Qwen3.8-Flash-Next et ajoutez qwen3.8-flash quand il sera disponible sur QwenCloud.

Choisissez GLM-5.3-Flash si…

  • Vous avez besoin de glm-5.3-flash sur Z.ai, ou de z-ai/glm-5.3-flash sur OpenRouter, sans attendre une référence cloud en file d’attente.

  • Votre set d’évaluation ressemble à DeepSWE, Toolathlon, NL2Repo ou Terminal Bench 2.1, et vous voulez le labo qui a publié les meilleurs scores sur l’ensemble commun.

  • Vous souhaitez des poids MIT et une fenêtre native de 1 M de tokens, et activer 18B de paramètres vous convient.

  • Vous êtes déjà sur un GLM Coding Plan et pouvez utiliser le quota 3x par rapport à GLM-5.3, y compris la promo jusqu’au 9 septembre 2026.

  • Vous voulez des agents desktop visuels. Browser Use et Computer Use de ZCode sont dans le post de lancement, et le contre-exemple de Qwen est OSWorld 2.0 à 19,4, ce qui n’est pas un trophée.

Choisissez Qwen3.8-Flash-Next si…

  • Vous achetez un aperçu Qwen4, pas une API managée finalisée. Aujourd’hui, le produit, ce sont les poids.

  • Les benchmarks d’agents bureautiques sont ceux que vous suivez. CoWorkBench et JobBench sont l’histoire publiée de Qwen, pas celle de GLM.

  • Vous voulez 6B de paramètres actifs et une table n-grammes logeable en mémoire hôte, y compris à côté d’une installation locale Qwen3.8-27B.

  • Vous utilisez déjà Qwen Chat, Qwen Studio, Qwen Code, ou vous pointez un agent compatible OpenAI (OpenCode, Codex, Qwen Code) sur un endpoint llama.cpp local aujourd’hui. Claude Code nécessite un proxy de traduction.

Par où commencer avec GLM-5.3-Flash et Qwen3.8-Flash-Next

Surface GLM-5.3-Flash Qwen3.8-Flash-Next
Application grand public Playground web Z.ai et GLM Coding Plan Qwen Chat et Qwen Studio
API propriétaire Oui, Z.ai, glm-5.3-flash QwenCloud qwen3.8-flash (API bientôt disponible)
Plateformes cloud Non disponible sur Bedrock, Vertex AI ou Azure AI Foundry Non disponible sur Bedrock, Vertex AI ou Azure AI Foundry
Agents de code ZCode ; OpenRouter dans des IDE acceptant des fournisseurs personnalisés. Pas natif dans Claude Code, GitHub Copilot ou Cursor Fonctionne aujourd’hui via llama.cpp local + OpenCode ; le même câblage s’appliquera à QwenCloud une fois live. Pas natif dans Claude Code, GitHub Copilot ou Cursor
Routeurs tiers OpenRouter, DeepInfra, Together.ai OpenRouter
ID du modèle API glm-5.3-flash (OpenRouter : z-ai/glm-5.3-flash) qwen3.8-flash sur QwenCloud et OpenRouter ; poids Qwen/Qwen3.8-Flash-Next

GLM-5.3-Flash est appelable dès maintenant. Qwen3.8-Flash-Next aussi, mais uniquement sur votre propre matériel ou via des routeurs comme OpenRouter. L’endpoint API de Qwen devrait suivre rapidement.

Saisissez les IDs à l’identique. L’ID de Qwen3.8-Flash-Next est qwen3.8-flash (sans « next »), donc n’inventez pas un ID cloud qwen3.8-flash-next à partir du nom des poids.

Votre premier appel d’API

Les deux modèles parlent le format OpenAI chat completions, vous réutilisez donc le client standard. Le moyen le plus rapide de les essayer côte à côte est OpenRouter, où les deux partagent la même base URL, et seule la chaîne du modèle change.

from openai import OpenAI
import os

# Un client, deux modèles. Remplacez le nom du modèle à la ligne 12 — rien d’autre ne change.
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",  # ou "qwen/qwen3.8-flash"
    messages=[{"role": "user", "content": "Refactor this function..."}],
    extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)

Aller en propriétaire vous fait perdre en portabilité. L’endpoint de Z.ai vit sur docs.z.ai et prend thinking: {"type": "enabled"} avec reasoning_effort réglé sur low, high ou max. Celui d’Alibaba prend enable_thinking avec reasoning_effort par défaut à xhigh, sur une base URL DashScope (international, Pékin ou Virginie). Le SDK est le même, mais le réglage de « reasoning » n’est pas portable, prévoyez donc un petit adaptateur si vous comptez basculer.

Pour un pas-à-pas Qwen complet, lisez notre tutoriel pour exécuter Qwen3.8-Flash-Next en local et le tutoriel Qwen Code CLI. Pour la famille GLM en local, utilisez Run GLM-5 Locally For Agentic Coding. Si vous êtes déjà sur une machine Qwen3.8-27B, notre configuration RTX 5090 est la voie sœur en local, pas cet aperçu 125B.

Dernières réflexions

Si vous devez livrer contre une API Flash live cette semaine, utilisez GLM-5.3-Flash. Si vous étudiez Qwen4 ou si vous faites davantage confiance à CoWorkBench qu’à DeepSWE, utilisez les poids Qwen3.8-Flash-Next en local et basculez vers l’API qwen3.8-flash quand elle sera en ligne.

Ce qui m’intéresse le plus, c’est à quel point les prix publics diffèrent peu. Le débat porte sur l’accès et sur quelle ligne non publiée vous êtes prêt à ignorer, pas sur un gouffre de coûts de 2x.

Pour les concepts derrière ces MoE, je recommande notre cours Large Language Models (LLMs) Concepts, puis le parcours AI Agent Fundamentals. Pour le travail hub + poids, Working with Hugging Face est l’étape pratique suivante.

FAQ

Quand utiliser GLM-5.3-Flash plutôt que Qwen3.8-Flash-Next ?

Utilisez GLM-5.3-Flash si vous avez besoin d’une API propriétaire live cette semaine, de poids sous licence MIT, ou des meilleurs scores sur l’ensemble de benchmarks de code communs (DeepSWE v1.1 63,4, Toolathlon Verified 78,4, NL2Repo 56,3).

Utilisez Qwen3.8-Flash-Next si vous souhaitez exécuter en local l’aperçu d’architecture Qwen4, bénéficier de 6B de paramètres actifs plus efficients, ou exploiter le modèle dans un cadre d’agent bureautique (CoWorkBench 73,9, JobBench 55,7).

Où accéder à GLM-5.3-Flash et Qwen3.8-Flash-Next ?

GLM-5.3-Flash est disponible sur Z.ai sous glm-5.3-flash, dans le GLM Coding Plan, et sur OpenRouter sous z-ai/glm-5.3-flash. Les poids sont sur Hugging Face sous licence MIT.

Les poids de Qwen3.8-Flash-Next sont sur Hugging Face et ModelScope. L’API de production est Qwen3.8-Flash sur QwenCloud sous qwen3.8-flash, annoncée « bientôt disponible », mais vous pouvez déjà accéder au modèle via OpenRouter. Qwen Chat et Qwen Studio sont les surfaces grand public.

Comment GLM-5.3-Flash et Qwen3.8-Flash-Next se comparent-ils sur le code ?

Sur les benchmarks de code publiés par les deux labos, GLM-5.3-Flash est devant : DeepSWE v1.1 63,4 vs 58,7, Toolathlon Verified 78,4 vs 73,5, et NL2Repo 56,3 vs 48,1. Les harnais ne sont pas identiques.

Quels sont les IDs de modèles API pour GLM-5.3-Flash et Qwen3.8-Flash-Next ?

GLM-5.3-Flash est glm-5.3-flash sur Z.ai et z-ai/glm-5.3-flash sur OpenRouter.

L’ID de production sur QwenCloud est qwen3.8-flash, pas un ID cloud qwen3.8-flash-next. Les poids ouverts sont Qwen/Qwen3.8-Flash-Next.

Qwen3.8-Flash-Next est-il identique à Qwen3.8-Flash ?

Non. Qwen3.8-Flash-Next est l’aperçu d’architecture open-weight. Qwen3.8-Flash est la référence de production sur QwenCloud, listée à 0,16 / 0,47 $ par 1 M de tokens, avec un contexte par défaut à 1 M et des outils intégrés officiels. L’API était annoncée comme « bientôt disponible » au 26 août 2026.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Rédacteur en chef Data Science chez DataCamp | Je suis passionné par la prévision et le développement à l'aide d'API.

Sujets

Apprenez l’IA avec DataCamp !

Cursus

Associate AI Engineer pour développeurs

26 h
Apprenez à intégrer l'IA dans des applications logicielles en utilisant des API et des bibliothèques open source. Commencez dès aujourd'hui votre parcours pour devenir AI Engineer !
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow
Contenus associés

blog

Comprendre les TPU et les GPU dans l'IA : Un guide complet

L'essor du développement de l'intelligence artificielle (IA) a entraîné une augmentation notable de la demande en matière de calcul, d'où la nécessité de disposer de solutions matérielles robustes. Les unités de traitement graphique (GPU) et les unités de traitement tensoriel (TPU) sont devenues des technologies essentielles pour répondre à ces demandes.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

blog

ROI de l'IA en 2026 : pourquoi les compétences des équipes déterminent le retour sur investissement

Seuls 21 % des dirigeants font état d'un retour sur investissement « significatif » de leurs investissements dans l'IA.
Lynn Heidmann's photo

Lynn Heidmann

blog

Architecture de l'entrepôt de données : Tendances, outils et techniques

Apprenez l'essentiel de l'architecture d'un entrepôt de données, des composants clés aux meilleures pratiques, pour construire un système de données évolutif et efficace !
Kurtis Pykes 's photo

Kurtis Pykes

15 min

blog

Plus de 50 questions/réponses d’entretien AWS pour 2026

Un guide complet des questions d’entretien AWS de base, intermédiaires et avancées, avec des mises en situation inspirées de cas réels.
Zoumana Keita 's photo

Zoumana Keita

15 min

blog

Les 20 meilleures questions d'entretien pour les flocons de neige, à tous les niveaux

Vous êtes actuellement à la recherche d'un emploi qui utilise Snowflake ? Préparez-vous à répondre à ces 20 questions d'entretien sur le flocon de neige pour décrocher le poste !
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 min

cursor ai code editor

Tutoriel

Cursor AI : Un guide avec 10 exemples pratiques

Apprenez à installer Cursor AI sur Windows, macOS et Linux, et découvrez comment l'utiliser à travers 10 cas d'utilisation différents.
Voir PlusVoir Plus