Programa
Em 26 de agosto de 2026, a Z.ai lançou o GLM-5.3-Flash e a equipe Qwen da Alibaba abriu os pesos do Qwen3.8-Flash-Next. Ambos são modelos MoE (mixture-of-experts) de pesos abertos, nativamente multimodais, posicionados como ofertas da classe Flash pelo custo, não como sobras baratas.
Flash costumava significar "o magrinho". Esses dois são as apostas de eficiência dos laboratórios para agentes de codificação e atendimento de longo contexto, lançadas no mesmo intervalo de 24 horas. O emparelhamento é propositalmente desconfortável: eles não publicam os mesmos testes e só uma API própria está ativa hoje.
Resumo
- O GLM-5.3-Flash lidera os testes de codificação e uso de ferramentas que ambos os laboratórios publicaram.
- Escolha o GLM-5.3-Flash quando você precisar de uma API ativa, pesos sob licença MIT e uma janela de 1 milhão de tokens sem YaRN.
- Escolha o Qwen3.8-Flash-Next se você puder fazer self-host (os pesos rodam hoje com llama.cpp) ou se puder esperar pela API gerenciada no QwenCloud.
- Os preços de tabela ficam separados por alguns centavos; a promoção de 50% do GLM até 9 de setembro de 2026 é a única que muda a conta nesta semana.
Introdução aos agentes de IA
O que é o GLM-5.3-Flash?
O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da Z.ai na série GLM-5, lançado em 26 de agosto de 2026 com 320 bilhões de parâmetros totais e 18 bilhões ativos. O post de lançamento da Z.ai afirma que ele supera o GLM-5.2 em testes de codificação e agentes por cerca de um décimo do preço, e marca 57 no Artificial Analysis Intelligence Index v4.1.1 a US$ 0,045 por tarefa no nível com desconto.
A arquitetura é o verdadeiro destaque: atenção híbrida linear e esparsa, Manifold-Constrained Hyper-Connections (mHC), um corpus multimodal de 30 trilhões de tokens e 45 camadas em vez das 92 do GLM-4.5. A Z.ai o executou anonimamente como ox-alpha no OpenCode e no OpenRouter antes de batizá-lo, hospedado em chips de IA chineses. Os pesos estão no Hugging Face sob licença MIT, com receitas de serving para SGLang, vLLM e TokenSpeed.
Veja mais detalhes no nosso guia do GLM-5.3-Flash. Para a geração anterior, confira nosso guia do GLM-5.2 e o tutorial sobre rodar o GLM-5 localmente para codificação com agentes.
O que é o Qwen3.8-Flash-Next?
O Qwen3.8-Flash-Next é o preview de pesos abertos da equipe Qwen da Alibaba, lançado em 26 de agosto de 2026, com a arquitetura planejada para o Qwen4. O modelo principal tem 125 bilhões de parâmetros, mais uma tabela de embeddings n-gram de 51 bilhões de parâmetros, com 6 bilhões de parâmetros ativos por token. O contexto nativo é de 262.144 tokens, extensível para 1.000.000 com YaRN. A Qwen diz que o treinamento custou cerca de um nono do Qwen3.7-Plus.
O SKU de produção é o Qwen3.8-Flash no QwenCloud, listado a US$ 0,16 por 1M de tokens de entrada e US$ 0,47 por 1M de tokens de saída, com a API marcada como em breve. O ID do modelo na nuvem é qwen3.8-flash. Já publicamos um guia do Qwen3.8-Flash-Next e um tutorial de setup sobre como rodar o Qwen3.8-Flash-Next localmente como agente de código com OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: comparação direta

Nos benchmarks que ambos os laboratórios publicaram, o GLM-5.3-Flash está à frente, como esperado por ser o maior dos dois modelos. Os preços são muito semelhantes.
| Recurso | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Lab / data | Z.ai, 26 de agosto de 2026 | Qwen (Alibaba), 26 de agosto de 2026 |
| Tamanho | 320B total, 18B ativos | 125B principal + 51B n-gram, 6B ativos |
| Contexto | 1M tokens nativos | 262.144 nativos; 1.000.000 com YaRN |
| Modalidades | Nativamente multimodal (texto, imagem, vídeo de entrada) | MoE nativamente multimodal |
| Pesos | MIT, zai-org/GLM-5.3-Flash |
Pesos abertos, Qwen/Qwen3.8-Flash-Next |
| Testes de codificação compartilhados | Lidera DeepSWE, Toolathlon, NL2Repo | Fica atrás nesses três; publicou SWE-bench Pro 62,5 |
| Testes de agente de escritório | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Preço de tabela da API (por 1M) | US$ 0,15 in / US$ 0,50 out | US$ 0,16 in / US$ 0,47 out (Qwen3.8-Flash) |
| API própria | Ativa, glm-5.3-flash |
Na fila, qwen3.8-flash |
Codificação e fluxos agentic
O GLM-5.3-Flash lidera as pontuações de codificação e uso de ferramentas que ambos os fornecedores colocaram lado a lado. A tabela de 26 de agosto da Z.ai lista DeepSWE v1.1 em 63,4, Toolathlon Verified em 78,4 e NL2Repo em 56,3. A tabela da Qwen lista 58,7, 73,5 e 48,1 nesses mesmos testes.
Fora isso, a comparação é difícil porque os benchmarks escolhidos diferem entre os fornecedores. A Qwen publicou SWE-bench Pro em 62,5 e SWE-bench Multilingual em 81,0. A Z.ai publicou Terminal Bench 2.1 em 84,3 e AutomationBench em 48,8, além de um resultado interno Z.ai Code Bench v1.0 de 29,0 no esforço máximo contra 29,5 do Claude Opus 4.8, rodado no Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Observações |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Tabelas dos fornecedores; GLM usou mini-swe-agent, Qwen reporta o maior entre Claude Code e mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM faz média de 3 execuções |
| NL2Repo | 56,3 | 48,1 | Qwen rotula como NL2Repo-Bench |
| SWE-bench Pro | Não publicado | 62,5 | Qwen refez baselines no Claude Code |
| Terminal Bench 2.1 | 84,3 | Não publicado | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (score 51,2) | Formatos de relatório diferentes |
Eu trataria o GLM como o Flash de agente de código mais forte no conjunto sobreposto e evitaria coroar um vencedor no SWE-bench sem a pontuação publicada da Z.ai.
Trabalho de escritório e agentes de longo horizonte
A Qwen é o laboratório que publicou pontuações de longo horizonte para tarefas de escritório. CoWorkBench é 73,9 e JobBench é 55,7, bem à frente do Qwen3.7-Plus (65,1 e 27,6) e do Claude Opus 4.6 Max nessas linhas (68,2 e 36,6).
Os números de "trabalho" da Z.ai que se sobrepõem são AutomationBench 48,8 e OfficeQA Pro 62,4, além de ZCode Browser Use e Computer Use para trabalho visual em desktop.
Não são os mesmos testes, então não definem um vencedor. Se o seu modelo mental do trabalho é um agente de escritório multi-hora, a Qwen publicou os testes. Se é automação ao estilo Zapier ou QA de PDFs, a Z.ai publicou esses.
Arquitetura e custo de serving
O Qwen3.8-Flash-Next ativa 6 bilhões de parâmetros por token. O GLM-5.3-Flash ativa 18 bilhões. Essa diferença de 3x é o dado de hardware mais direto nessa dupla, e é por isso que a conversa de serving local tende a cair no Qwen. Na prática, o GGUF UD-Q4_K_XL (~111GB) roda em uma única placa de 96GB com offload para RAM — fizemos aqui.
Ambos usam atenção híbrida. A Z.ai diz que o GLM-5.3-Flash reduz o compute de atenção em 3,0x e o tamanho do cache KV em 4,4x versus o GLM-5.3. A Qwen afirma que o kernel de atenção do QSA é até 7,6x mais rápido no prefill e 4,9x no decode em 1M de tokens, e 8,6x a vazão de prefill do Qwen3.7-Plus com 90% de acerto no prefix-cache.
O truque extra de capacidade ao estilo 51B do GLM não é uma tabela de embeddings; a tabela n-gram de 51B do Qwen foi projetada para ficar na RAM do host e fazer prefetch. Receitas diferentes, mesma proposta: mais capacidade por watt.
Recursos multimodais e contexto
Ambos os modelos recebem imagens na mesma geração que texto. O GLM-5.3-Flash é explicitamente o primeiro membro nativamente multimodal do GLM-5, treinado em um corpus multimodal de 30 trilhões de tokens, com linhas de visão capazes de vídeo (MVBench 77,8, MMVU 80,5).
O Qwen3.8-Flash-Next publica AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 e CharXiv 84,6 sem ferramenta de uso de computador / 90,6 com uma.
O tamanho da janela de contexto é próximo o suficiente para não decidir sozinho. O GLM anuncia janela nativa de 1M de tokens. O Qwen é nativo em 262.144 e estica para 1.000.000 com YaRN. Análises nas notas de pesquisa ainda tratam o 1M do GLM como moderadamente testado em produção.
Preços: quanto você realmente paga

Fora promoções, é quase impossível distinguir os preços dos dois modelos. Qwen e Z.ai estão mirando claramente o mesmo patamar aqui.
Taxas por token, lado a lado
| Tarifa | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Entrada, por 1M de tokens | US$ 0,15 (US$ 0,075 promo) | US$ 0,16 |
| Saída, por 1M de tokens | US$ 0,50 (US$ 0,25 promo) | US$ 0,47 |
| Entrada em cache, por 1M de tokens | US$ 0,03 (US$ 0,015 promo) | US$ 0,016 |
| Saída em cache, por 1M de tokens | Grátis durante a promoção | US$ 0,20 |
| Promo de lançamento | 50% off até 9 de setembro de 2026, 24:00 UTC+8 | Nenhuma publicada |
| Franquia do Coding Plan | 3x GLM-5.3 em todos os níveis de plano | Não publicado |
O desenho é quase plano. A saída um pouco mais barata do Qwen ajuda em meses com muita geração; a entrada um pouco mais barata do GLM ajuda em recuperação. A Z.ai cobra tokens de raciocínio na tarifa de saída. A Qwen documenta enable_thinking e reasoning_effort no QwenCloud sem preço separado para tokens de raciocínio, então trate o raciocínio como saída até que digam o contrário.
Ambos publicam tarifas de cache, e precificam o trade de forma diferente. A Z.ai lista leitura de entrada em cache a US$ 0,03 por 1M (US$ 0,015 na promo) e torna as gravações em cache gratuitas durante a janela promocional. A Qwen lê cache a US$ 0,016, mas cobra US$ 0,20 por 1M de tokens para criar um cache explícito.
Assim, a Qwen reduz pela metade sua taxa de leitura de cache, e o GLM oferece a escrita. Se seus prefixos são estáveis e duradouros, a leitura da Qwen vence; se você reescreve caches com frequência, as escritas gratuitas do GLM vencem, pelo menos até 9 de setembro.
Quanto custa uma carga real
Fórmula: (volume ÷ 1M) × tarifa, somado entre entrada e saída, nas tarifas padrão de tabela. Valores promocionais ficam fora da tabela.
| Carga | GLM-5.3-Flash | Qwen3.8-Flash | Diferença |
|---|---|---|---|
| Assistente balanceado: 1M in / 250K out | US$ 0,28 | US$ 0,28 | US$ 0,00 (0%) |
| Muito geração: 1M in / 4M out | US$ 2,15 | US$ 2,04 | Qwen US$ 0,11 mais barato (5%) |
| Recuperação, abaixo do limiar: 10M in / 1M out | US$ 2,00 | US$ 2,07 | GLM US$ 0,07 mais barato (3%) |
O custo de tabela da API empata. A decisão recai sobre o ajuste à carga e se o endpoint existe. Ambos usam tokenizadores específicos do fornecedor, e nenhum publicou contagens de tokens para a mesma carga, então trate esses totais como comparação de tarifa, não de fatura. Até 9 de setembro de 2026, a promoção do GLM reduz à metade os totais da coluna GLM (US$ 0,14, US$ 1,08, US$ 1,00).
Quando escolher GLM-5.3-Flash vs Qwen3.8-Flash-Next

Se você precisa chamar uma API própria esta semana, o GLM-5.3-Flash é o único produto completo da dupla. Se você está avaliando a arquitetura do Qwen4, ou se se importa com CoWorkBench e JobBench, comece agora com os pesos do Qwen3.8-Flash-Next e adicione o qwen3.8-flash quando estiver disponível no QwenCloud.
Escolha GLM-5.3-Flash se...
-
Você precisa de
glm-5.3-flashna Z.ai, ouz-ai/glm-5.3-flashno OpenRouter, sem esperar um SKU de nuvem na fila. -
Seu conjunto de avaliação se parece com DeepSWE, Toolathlon, NL2Repo ou Terminal Bench 2.1, e você quer o laboratório que publicou as maiores pontuações sobrepostas.
-
Você quer pesos MIT e uma janela nativa de 1M de tokens, e tudo bem ativar 18B de parâmetros.
-
Você já está em um GLM Coding Plan e pode usar a franquia 3x versus GLM-5.3, incluindo a promoção até 9 de setembro de 2026.
- Você quer agentes visuais de desktop. Browser Use e Computer Use do ZCode estão no post de lançamento, e o número de resposta da Qwen é OSWorld 2.0 em 19,4, que não é um troféu.
Escolha Qwen3.8-Flash-Next se...
-
Você está comprando um preview do Qwen4, não uma API gerenciada finalizada. Hoje, o produto são os pesos.
-
Os testes de agente de escritório são os que você realmente acompanha. CoWorkBench e JobBench são a história publicada da Qwen, não do GLM.
-
Você quer 6B de parâmetros ativos e uma tabela n-gram que pode ficar na memória do host, inclusive ao lado de um setup local do Qwen3.8-27B.
-
Você já vive no Qwen Chat, Qwen Studio, Qwen Code ou aponta qualquer agente compatível com OpenAI (OpenCode, Codex, Qwen Code) para um endpoint local do llama.cpp hoje. O Claude Code precisa de um proxy de tradução.
Como começar com GLM-5.3-Flash e Qwen3.8-Flash-Next
| Superfície | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| App para consumidor | Playground web da Z.ai e GLM Coding Plan | Qwen Chat e Qwen Studio |
| API própria | Sim, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API em breve) |
| Plataformas de nuvem | Indisponível em Bedrock, Vertex AI ou Azure AI Foundry | Indisponível em Bedrock, Vertex AI ou Azure AI Foundry |
| Agentes de codificação | ZCode; OpenRouter em IDEs que aceitam provedores customizados. Não é nativo em Claude Code, GitHub Copilot ou Cursor | Funciona hoje via llama.cpp local + OpenCode; a mesma conexão vale para o QwenCloud quando estiver ativo. Não é nativo em Claude Code, GitHub Copilot ou Cursor |
| Roteadores de terceiros | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID do modelo na API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash no QwenCloud e no OpenRouter; pesos Qwen/Qwen3.8-Flash-Next |
O GLM-5.3-Flash pode ser chamado agora. O Qwen3.8-Flash-Next também, só que no seu próprio hardware ou via roteadores como o OpenRouter. O endpoint de API da própria Qwen deve chegar em breve.
Digite esses IDs exatamente. O ID do Qwen3.8-Flash-Next é qwen3.8-flash (sem o "next"), então não invente um ID de nuvem qwen3.8-flash-next a partir do nome do peso.
Fazendo sua primeira chamada de API
Ambos os modelos falam o formato de chat completions da OpenAI, então você reaproveita o cliente padrão em qualquer um. A forma mais rápida de testá-los lado a lado é o OpenRouter, onde ambos ficam atrás de uma base URL, e a string do modelo é a única coisa que você muda.
from openai import OpenAI
import os
# Um cliente, dois modelos. Troque a string do modelo na linha 12 — nada mais muda.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # ou "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refatore esta função..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Ir na API própria custa portabilidade. O endpoint da Z.ai vive em docs.z.ai e aceita thinking: {"type": "enabled"} com reasoning_effort definido como low, high ou max. O da Alibaba usa enable_thinking com reasoning_effort padrão xhigh, em uma base URL do DashScope (internacional, Pequim ou Virgínia). É o mesmo SDK em ambos, mas o controle de raciocínio não é portátil, então preveja um pequeno adaptador se pretende alternar.
Para um passo a passo completo do Qwen, leia nosso tutorial sobre como rodar o Qwen3.8-Flash-Next localmente e o tutorial do Qwen Code CLI. Para serving local da família GLM, use Run GLM-5 Locally For Agentic Coding. Se você já está em uma máquina com Qwen3.8-27B, nosso setup no RTX 5090 é o caminho local irmão, não este preview de 125B.
Considerações finais
Se você precisa publicar contra uma API Flash ativa esta semana, use o GLM-5.3-Flash. Se você está estudando o Qwen4 ou acredita mais no CoWorkBench do que no DeepSWE, use os pesos do Qwen3.8-Flash-Next localmente e mude para o qwen3.8-flash via API quando for lançado.
O que acho mais interessante é como os preços de tabela quase não divergem. A discussão é sobre acesso e qual linha não publicada você está disposto a ignorar, não sobre um penhasco de custo 2x.
Se você quer os conceitos por trás de ambos os MoEs, recomendo nosso curso Large Language Models (LLMs) Concepts e, em seguida, a trilha AI Agent Fundamentals. Para trabalho com hubs e pesos, Working with Hugging Face é o próximo passo prático.
Perguntas frequentes
Quando devo usar o GLM-5.3-Flash em vez do Qwen3.8-Flash-Next?
Use o GLM-5.3-Flash quando você precisar de uma API própria ativa esta semana, pesos sob licença MIT ou as maiores pontuações sobrepostas de codificação (DeepSWE v1.1 63,4; Toolathlon Verified 78,4; NL2Repo 56,3).
Use o Qwen3.8-Flash-Next quando quiser rodar localmente o preview da arquitetura do Qwen4, ter 6B de parâmetros ativos mais eficientes ou usar o modelo em um setup de agente de escritório (CoWorkBench 73,9; JobBench 55,7).
Onde posso acessar o GLM-5.3-Flash e o Qwen3.8-Flash-Next?
O GLM-5.3-Flash está ativo na Z.ai como glm-5.3-flash, no GLM Coding Plan, e no OpenRouter como z-ai/glm-5.3-flash. Os pesos estão no Hugging Face sob licença MIT.
Os pesos do Qwen3.8-Flash-Next estão no Hugging Face e no ModelScope. A API de produção é o Qwen3.8-Flash no QwenCloud como qwen3.8-flash, marcada como em breve, mas você já pode acessar o modelo via OpenRouter. Qwen Chat e Qwen Studio são as superfícies para consumidores.
Como GLM-5.3-Flash e Qwen3.8-Flash-Next se comparam em codificação?
Nos testes de codificação que ambos os labs publicaram, o GLM-5.3-Flash lidera: DeepSWE v1.1 63,4 vs 58,7; Toolathlon Verified 78,4 vs 73,5; e NL2Repo 56,3 vs 48,1. Os harnesses não são idênticos.
Quais são os IDs dos modelos na API para GLM-5.3-Flash e Qwen3.8-Flash-Next?
O GLM-5.3-Flash é glm-5.3-flash na Z.ai e z-ai/glm-5.3-flash no OpenRouter.
O ID de produção no QwenCloud é qwen3.8-flash, não um ID de nuvem qwen3.8-flash-next. Os pesos abertos são Qwen/Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next é o mesmo que Qwen3.8-Flash?
Não. O Qwen3.8-Flash-Next é o preview de arquitetura de pesos abertos. O Qwen3.8-Flash é o SKU de produção no QwenCloud, listado a US$ 0,16 / US$ 0,47 por 1M de tokens, com contexto padrão de 1M e ferramentas oficiais integradas. Em 26 de agosto de 2026, a API estava marcada como em breve.
Editor de Ciência de Dados @ DataCamp | Fazer previsões e construir com APIs é a minha paixão.
