Pular para o conteúdo principal

GLM-5.3-Flash vs Qwen3.8-Flash-Next: codificação, custo e acesso

Os modelos mais novos da Z.ai e da Alibaba disputam o mesmo segmento. O GLM-5.3-Flash lidera os testes de codificação compartilhados e já está ativo; o Qwen3.8-Flash-Next é o preview leve do Qwen4 com API na fila.
Atualizado 31 de ago. de 2026  · 11 min lido

Explorar com IA

ChatGPTClaudePerplexity

Em 26 de agosto de 2026, a Z.ai lançou o GLM-5.3-Flash e a equipe Qwen da Alibaba abriu os pesos do Qwen3.8-Flash-Next. Ambos são modelos MoE (mixture-of-experts) de pesos abertos, nativamente multimodais, posicionados como ofertas da classe Flash pelo custo, não como sobras baratas.

Flash costumava significar "o magrinho". Esses dois são as apostas de eficiência dos laboratórios para agentes de codificação e atendimento de longo contexto, lançadas no mesmo intervalo de 24 horas. O emparelhamento é propositalmente desconfortável: eles não publicam os mesmos testes e só uma API própria está ativa hoje.

Resumo

  • O GLM-5.3-Flash lidera os testes de codificação e uso de ferramentas que ambos os laboratórios publicaram.
  • Escolha o GLM-5.3-Flash quando você precisar de uma API ativa, pesos sob licença MIT e uma janela de 1 milhão de tokens sem YaRN.
  • Escolha o Qwen3.8-Flash-Next se você puder fazer self-host (os pesos rodam hoje com llama.cpp) ou se puder esperar pela API gerenciada no QwenCloud.
  • Os preços de tabela ficam separados por alguns centavos; a promoção de 50% do GLM até 9 de setembro de 2026 é a única que muda a conta nesta semana.

Introdução aos agentes de IA

Aprenda os fundamentos dos agentes de IA, seus componentes e o uso no mundo real - não é necessário programar.
Explorar O Curso

O que é o GLM-5.3-Flash?

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da Z.ai na série GLM-5, lançado em 26 de agosto de 2026 com 320 bilhões de parâmetros totais e 18 bilhões ativos. O post de lançamento da Z.ai afirma que ele supera o GLM-5.2 em testes de codificação e agentes por cerca de um décimo do preço, e marca 57 no Artificial Analysis Intelligence Index v4.1.1 a US$ 0,045 por tarefa no nível com desconto.

A arquitetura é o verdadeiro destaque: atenção híbrida linear e esparsa, Manifold-Constrained Hyper-Connections (mHC), um corpus multimodal de 30 trilhões de tokens e 45 camadas em vez das 92 do GLM-4.5. A Z.ai o executou anonimamente como ox-alpha no OpenCode e no OpenRouter antes de batizá-lo, hospedado em chips de IA chineses. Os pesos estão no Hugging Face sob licença MIT, com receitas de serving para SGLang, vLLM e TokenSpeed.

Veja mais detalhes no nosso guia do GLM-5.3-Flash. Para a geração anterior, confira nosso guia do GLM-5.2 e o tutorial sobre rodar o GLM-5 localmente para codificação com agentes.

O que é o Qwen3.8-Flash-Next?

O Qwen3.8-Flash-Next é o preview de pesos abertos da equipe Qwen da Alibaba, lançado em 26 de agosto de 2026, com a arquitetura planejada para o Qwen4. O modelo principal tem 125 bilhões de parâmetros, mais uma tabela de embeddings n-gram de 51 bilhões de parâmetros, com 6 bilhões de parâmetros ativos por token. O contexto nativo é de 262.144 tokens, extensível para 1.000.000 com YaRN. A Qwen diz que o treinamento custou cerca de um nono do Qwen3.7-Plus.

O SKU de produção é o Qwen3.8-Flash no QwenCloud, listado a US$ 0,16 por 1M de tokens de entrada e US$ 0,47 por 1M de tokens de saída, com a API marcada como em breve. O ID do modelo na nuvem é qwen3.8-flash. Já publicamos um guia do Qwen3.8-Flash-Next e um tutorial de setup sobre como rodar o Qwen3.8-Flash-Next localmente como agente de código com OpenCode.

GLM-5.3-Flash vs Qwen3.8-Flash-Next: comparação direta

GLM lidera os testes de codificação compartilhados; Qwen é a API na fila

Nos benchmarks que ambos os laboratórios publicaram, o GLM-5.3-Flash está à frente, como esperado por ser o maior dos dois modelos. Os preços são muito semelhantes.

Recurso GLM-5.3-Flash Qwen3.8-Flash-Next
Lab / data Z.ai, 26 de agosto de 2026 Qwen (Alibaba), 26 de agosto de 2026
Tamanho 320B total, 18B ativos 125B principal + 51B n-gram, 6B ativos
Contexto 1M tokens nativos 262.144 nativos; 1.000.000 com YaRN
Modalidades Nativamente multimodal (texto, imagem, vídeo de entrada) MoE nativamente multimodal
Pesos MIT, zai-org/GLM-5.3-Flash Pesos abertos, Qwen/Qwen3.8-Flash-Next
Testes de codificação compartilhados Lidera DeepSWE, Toolathlon, NL2Repo Fica atrás nesses três; publicou SWE-bench Pro 62,5
Testes de agente de escritório AutomationBench 48,8; OfficeQA Pro 62,4 CoWorkBench 73,9; JobBench 55,7
Preço de tabela da API (por 1M) US$ 0,15 in / US$ 0,50 out US$ 0,16 in / US$ 0,47 out (Qwen3.8-Flash)
API própria Ativa, glm-5.3-flash Na fila, qwen3.8-flash

Codificação e fluxos agentic

O GLM-5.3-Flash lidera as pontuações de codificação e uso de ferramentas que ambos os fornecedores colocaram lado a lado. A tabela de 26 de agosto da Z.ai lista DeepSWE v1.1 em 63,4, Toolathlon Verified em 78,4 e NL2Repo em 56,3. A tabela da Qwen lista 58,7, 73,5 e 48,1 nesses mesmos testes.

Fora isso, a comparação é difícil porque os benchmarks escolhidos diferem entre os fornecedores. A Qwen publicou SWE-bench Pro em 62,5 e SWE-bench Multilingual em 81,0. A Z.ai publicou Terminal Bench 2.1 em 84,3 e AutomationBench em 48,8, além de um resultado interno Z.ai Code Bench v1.0 de 29,0 no esforço máximo contra 29,5 do Claude Opus 4.8, rodado no Claude Code 2.1.207.

Benchmark GLM-5.3-Flash Qwen3.8-Flash-Next Observações
DeepSWE v1.1 63,4 58,7 Tabelas dos fornecedores; GLM usou mini-swe-agent, Qwen reporta o maior entre Claude Code e mini-SWE-agent
Toolathlon Verified 78,4 73,5 Pass@1; GLM faz média de 3 execuções
NL2Repo 56,3 48,1 Qwen rotula como NL2Repo-Bench
SWE-bench Pro Não publicado 62,5 Qwen refez baselines no Claude Code
Terminal Bench 2.1 84,3 Não publicado Z.ai, Claude Code 2.1.207
Agents' Last Exam 26,3 24,3 pass@1 (score 51,2) Formatos de relatório diferentes

Eu trataria o GLM como o Flash de agente de código mais forte no conjunto sobreposto e evitaria coroar um vencedor no SWE-bench sem a pontuação publicada da Z.ai.

Trabalho de escritório e agentes de longo horizonte

A Qwen é o laboratório que publicou pontuações de longo horizonte para tarefas de escritório. CoWorkBench é 73,9 e JobBench é 55,7, bem à frente do Qwen3.7-Plus (65,1 e 27,6) e do Claude Opus 4.6 Max nessas linhas (68,2 e 36,6).

Os números de "trabalho" da Z.ai que se sobrepõem são AutomationBench 48,8 e OfficeQA Pro 62,4, além de ZCode Browser Use e Computer Use para trabalho visual em desktop.

Não são os mesmos testes, então não definem um vencedor. Se o seu modelo mental do trabalho é um agente de escritório multi-hora, a Qwen publicou os testes. Se é automação ao estilo Zapier ou QA de PDFs, a Z.ai publicou esses.

Arquitetura e custo de serving

O Qwen3.8-Flash-Next ativa 6 bilhões de parâmetros por token. O GLM-5.3-Flash ativa 18 bilhões. Essa diferença de 3x é o dado de hardware mais direto nessa dupla, e é por isso que a conversa de serving local tende a cair no Qwen. Na prática, o GGUF UD-Q4_K_XL (~111GB) roda em uma única placa de 96GB com offload para RAM — fizemos aqui.

Ambos usam atenção híbrida. A Z.ai diz que o GLM-5.3-Flash reduz o compute de atenção em 3,0x e o tamanho do cache KV em 4,4x versus o GLM-5.3. A Qwen afirma que o kernel de atenção do QSA é até 7,6x mais rápido no prefill e 4,9x no decode em 1M de tokens, e 8,6x a vazão de prefill do Qwen3.7-Plus com 90% de acerto no prefix-cache.

O truque extra de capacidade ao estilo 51B do GLM não é uma tabela de embeddings; a tabela n-gram de 51B do Qwen foi projetada para ficar na RAM do host e fazer prefetch. Receitas diferentes, mesma proposta: mais capacidade por watt.

Recursos multimodais e contexto

Ambos os modelos recebem imagens na mesma geração que texto. O GLM-5.3-Flash é explicitamente o primeiro membro nativamente multimodal do GLM-5, treinado em um corpus multimodal de 30 trilhões de tokens, com linhas de visão capazes de vídeo (MVBench 77,8, MMVU 80,5).

O Qwen3.8-Flash-Next publica AndroidWorld 84,5, LVBench 76,6, RealWorldQA 88,5 e CharXiv 84,6 sem ferramenta de uso de computador / 90,6 com uma.

O tamanho da janela de contexto é próximo o suficiente para não decidir sozinho. O GLM anuncia janela nativa de 1M de tokens. O Qwen é nativo em 262.144 e estica para 1.000.000 com YaRN. Análises nas notas de pesquisa ainda tratam o 1M do GLM como moderadamente testado em produção.

Preços: quanto você realmente paga

Preços de tabela empatam; o mais barato gira conforme a carga

Fora promoções, é quase impossível distinguir os preços dos dois modelos. Qwen e Z.ai estão mirando claramente o mesmo patamar aqui.

Taxas por token, lado a lado

Tarifa GLM-5.3-Flash Qwen3.8-Flash
Entrada, por 1M de tokens US$ 0,15 (US$ 0,075 promo) US$ 0,16
Saída, por 1M de tokens US$ 0,50 (US$ 0,25 promo) US$ 0,47
Entrada em cache, por 1M de tokens US$ 0,03 (US$ 0,015 promo) US$ 0,016
Saída em cache, por 1M de tokens Grátis durante a promoção US$ 0,20
Promo de lançamento 50% off até 9 de setembro de 2026, 24:00 UTC+8 Nenhuma publicada
Franquia do Coding Plan 3x GLM-5.3 em todos os níveis de plano Não publicado

O desenho é quase plano. A saída um pouco mais barata do Qwen ajuda em meses com muita geração; a entrada um pouco mais barata do GLM ajuda em recuperação. A Z.ai cobra tokens de raciocínio na tarifa de saída. A Qwen documenta enable_thinking e reasoning_effort no QwenCloud sem preço separado para tokens de raciocínio, então trate o raciocínio como saída até que digam o contrário.

Ambos publicam tarifas de cache, e precificam o trade de forma diferente. A Z.ai lista leitura de entrada em cache a US$ 0,03 por 1M (US$ 0,015 na promo) e torna as gravações em cache gratuitas durante a janela promocional. A Qwen lê cache a US$ 0,016, mas cobra US$ 0,20 por 1M de tokens para criar um cache explícito.

Assim, a Qwen reduz pela metade sua taxa de leitura de cache, e o GLM oferece a escrita. Se seus prefixos são estáveis e duradouros, a leitura da Qwen vence; se você reescreve caches com frequência, as escritas gratuitas do GLM vencem, pelo menos até 9 de setembro.

Quanto custa uma carga real

Fórmula: (volume ÷ 1M) × tarifa, somado entre entrada e saída, nas tarifas padrão de tabela. Valores promocionais ficam fora da tabela.

Carga GLM-5.3-Flash Qwen3.8-Flash Diferença
Assistente balanceado: 1M in / 250K out US$ 0,28 US$ 0,28 US$ 0,00 (0%)
Muito geração: 1M in / 4M out US$ 2,15 US$ 2,04 Qwen US$ 0,11 mais barato (5%)
Recuperação, abaixo do limiar: 10M in / 1M out US$ 2,00 US$ 2,07 GLM US$ 0,07 mais barato (3%)

O custo de tabela da API empata. A decisão recai sobre o ajuste à carga e se o endpoint existe. Ambos usam tokenizadores específicos do fornecedor, e nenhum publicou contagens de tokens para a mesma carga, então trate esses totais como comparação de tarifa, não de fatura. Até 9 de setembro de 2026, a promoção do GLM reduz à metade os totais da coluna GLM (US$ 0,14, US$ 1,08, US$ 1,00).

Quando escolher GLM-5.3-Flash vs Qwen3.8-Flash-Next

Escolha GLM por API ativa, Qwen para agentes de escritório

Se você precisa chamar uma API própria esta semana, o GLM-5.3-Flash é o único produto completo da dupla. Se você está avaliando a arquitetura do Qwen4, ou se se importa com CoWorkBench e JobBench, comece agora com os pesos do Qwen3.8-Flash-Next e adicione o qwen3.8-flash quando estiver disponível no QwenCloud.

Escolha GLM-5.3-Flash se...

  • Você precisa de glm-5.3-flash na Z.ai, ou z-ai/glm-5.3-flash no OpenRouter, sem esperar um SKU de nuvem na fila.

  • Seu conjunto de avaliação se parece com DeepSWE, Toolathlon, NL2Repo ou Terminal Bench 2.1, e você quer o laboratório que publicou as maiores pontuações sobrepostas.

  • Você quer pesos MIT e uma janela nativa de 1M de tokens, e tudo bem ativar 18B de parâmetros.

  • Você já está em um GLM Coding Plan e pode usar a franquia 3x versus GLM-5.3, incluindo a promoção até 9 de setembro de 2026.

  • Você quer agentes visuais de desktop. Browser Use e Computer Use do ZCode estão no post de lançamento, e o número de resposta da Qwen é OSWorld 2.0 em 19,4, que não é um troféu.

Escolha Qwen3.8-Flash-Next se...

  • Você está comprando um preview do Qwen4, não uma API gerenciada finalizada. Hoje, o produto são os pesos.

  • Os testes de agente de escritório são os que você realmente acompanha. CoWorkBench e JobBench são a história publicada da Qwen, não do GLM.

  • Você quer 6B de parâmetros ativos e uma tabela n-gram que pode ficar na memória do host, inclusive ao lado de um setup local do Qwen3.8-27B.

  • Você já vive no Qwen Chat, Qwen Studio, Qwen Code ou aponta qualquer agente compatível com OpenAI (OpenCode, Codex, Qwen Code) para um endpoint local do llama.cpp hoje. O Claude Code precisa de um proxy de tradução.

Como começar com GLM-5.3-Flash e Qwen3.8-Flash-Next

Superfície GLM-5.3-Flash Qwen3.8-Flash-Next
App para consumidor Playground web da Z.ai e GLM Coding Plan Qwen Chat e Qwen Studio
API própria Sim, Z.ai, glm-5.3-flash QwenCloud qwen3.8-flash (API em breve)
Plataformas de nuvem Indisponível em Bedrock, Vertex AI ou Azure AI Foundry Indisponível em Bedrock, Vertex AI ou Azure AI Foundry
Agentes de codificação ZCode; OpenRouter em IDEs que aceitam provedores customizados. Não é nativo em Claude Code, GitHub Copilot ou Cursor Funciona hoje via llama.cpp local + OpenCode; a mesma conexão vale para o QwenCloud quando estiver ativo. Não é nativo em Claude Code, GitHub Copilot ou Cursor
Roteadores de terceiros OpenRouter, DeepInfra, Together.ai OpenRouter
ID do modelo na API glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) qwen3.8-flash no QwenCloud e no OpenRouter; pesos Qwen/Qwen3.8-Flash-Next

O GLM-5.3-Flash pode ser chamado agora. O Qwen3.8-Flash-Next também, só que no seu próprio hardware ou via roteadores como o OpenRouter. O endpoint de API da própria Qwen deve chegar em breve.

Digite esses IDs exatamente. O ID do Qwen3.8-Flash-Next é qwen3.8-flash (sem o "next"), então não invente um ID de nuvem qwen3.8-flash-next a partir do nome do peso.

Fazendo sua primeira chamada de API

Ambos os modelos falam o formato de chat completions da OpenAI, então você reaproveita o cliente padrão em qualquer um. A forma mais rápida de testá-los lado a lado é o OpenRouter, onde ambos ficam atrás de uma base URL, e a string do modelo é a única coisa que você muda.

from openai import OpenAI
import os

# Um cliente, dois modelos. Troque a string do modelo na linha 12 — nada mais muda.
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",  # ou "qwen/qwen3.8-flash"
    messages=[{"role": "user", "content": "Refatore esta função..."}],
    extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)

Ir na API própria custa portabilidade. O endpoint da Z.ai vive em docs.z.ai e aceita thinking: {"type": "enabled"} com reasoning_effort definido como low, high ou max. O da Alibaba usa enable_thinking com reasoning_effort padrão xhigh, em uma base URL do DashScope (internacional, Pequim ou Virgínia). É o mesmo SDK em ambos, mas o controle de raciocínio não é portátil, então preveja um pequeno adaptador se pretende alternar.

Para um passo a passo completo do Qwen, leia nosso tutorial sobre como rodar o Qwen3.8-Flash-Next localmente e o tutorial do Qwen Code CLI. Para serving local da família GLM, use Run GLM-5 Locally For Agentic Coding. Se você já está em uma máquina com Qwen3.8-27B, nosso setup no RTX 5090 é o caminho local irmão, não este preview de 125B.

Considerações finais

Se você precisa publicar contra uma API Flash ativa esta semana, use o GLM-5.3-Flash. Se você está estudando o Qwen4 ou acredita mais no CoWorkBench do que no DeepSWE, use os pesos do Qwen3.8-Flash-Next localmente e mude para o qwen3.8-flash via API quando for lançado.

O que acho mais interessante é como os preços de tabela quase não divergem. A discussão é sobre acesso e qual linha não publicada você está disposto a ignorar, não sobre um penhasco de custo 2x.

Se você quer os conceitos por trás de ambos os MoEs, recomendo nosso curso Large Language Models (LLMs) Concepts e, em seguida, a trilha AI Agent Fundamentals. Para trabalho com hubs e pesos, Working with Hugging Face é o próximo passo prático.

Perguntas frequentes

Quando devo usar o GLM-5.3-Flash em vez do Qwen3.8-Flash-Next?

Use o GLM-5.3-Flash quando você precisar de uma API própria ativa esta semana, pesos sob licença MIT ou as maiores pontuações sobrepostas de codificação (DeepSWE v1.1 63,4; Toolathlon Verified 78,4; NL2Repo 56,3).

Use o Qwen3.8-Flash-Next quando quiser rodar localmente o preview da arquitetura do Qwen4, ter 6B de parâmetros ativos mais eficientes ou usar o modelo em um setup de agente de escritório (CoWorkBench 73,9; JobBench 55,7).

Onde posso acessar o GLM-5.3-Flash e o Qwen3.8-Flash-Next?

O GLM-5.3-Flash está ativo na Z.ai como glm-5.3-flash, no GLM Coding Plan, e no OpenRouter como z-ai/glm-5.3-flash. Os pesos estão no Hugging Face sob licença MIT.

Os pesos do Qwen3.8-Flash-Next estão no Hugging Face e no ModelScope. A API de produção é o Qwen3.8-Flash no QwenCloud como qwen3.8-flash, marcada como em breve, mas você já pode acessar o modelo via OpenRouter. Qwen Chat e Qwen Studio são as superfícies para consumidores.

Como GLM-5.3-Flash e Qwen3.8-Flash-Next se comparam em codificação?

Nos testes de codificação que ambos os labs publicaram, o GLM-5.3-Flash lidera: DeepSWE v1.1 63,4 vs 58,7; Toolathlon Verified 78,4 vs 73,5; e NL2Repo 56,3 vs 48,1. Os harnesses não são idênticos.

Quais são os IDs dos modelos na API para GLM-5.3-Flash e Qwen3.8-Flash-Next?

O GLM-5.3-Flash é glm-5.3-flash na Z.ai e z-ai/glm-5.3-flash no OpenRouter.

O ID de produção no QwenCloud é qwen3.8-flash, não um ID de nuvem qwen3.8-flash-next. Os pesos abertos são Qwen/Qwen3.8-Flash-Next.

Qwen3.8-Flash-Next é o mesmo que Qwen3.8-Flash?

Não. O Qwen3.8-Flash-Next é o preview de arquitetura de pesos abertos. O Qwen3.8-Flash é o SKU de produção no QwenCloud, listado a US$ 0,16 / US$ 0,47 por 1M de tokens, com contexto padrão de 1M e ferramentas oficiais integradas. Em 26 de agosto de 2026, a API estava marcada como em breve.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Editor de Ciência de Dados @ DataCamp | Fazer previsões e construir com APIs é a minha paixão.

Tópicos

Aprenda IA com a DataCamp!

Programa

Associate AI Engineer para desenvolvedores

26 h
Aprenda a integrar IA em aplicações de software usando APIs e bibliotecas de código aberto. Comece hoje sua jornada para se tornar um AI Engineer!
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow