programa
El 26 de agosto de 2026, Z.ai lanzó GLM-5.3-Flash y el equipo Qwen de Alibaba publicó los pesos de Qwen3.8-Flash-Next. Ambos son modelos MoE de pesos abiertos, nativamente multimodales, posicionados en la clase Flash por eficiencia de coste, no como versiones descafeinadas.
Antes, Flash significaba "el flaco". Estos dos son la apuesta de sus laboratorios por agentes de programación y servicio con contexto largo, lanzados en la misma ventana de 24 horas. La comparación es intencionadamente incómoda: no publican los mismos benchmarks y, hoy, solo uno tiene API propia en producción.
Resumen
- GLM-5.3-Flash lidera los benchmarks de programación y uso de herramientas que ambos laboratorios publicaron.
- Elige GLM-5.3-Flash si necesitas una API activa ya, pesos con licencia MIT y una ventana de 1M de tokens sin YaRN.
- Elige Qwen3.8-Flash-Next si puedes alojarlo tú mismo (los pesos ya corren con llama.cpp) o si puedes esperar a la API gestionada de QwenCloud.
- Los precios de lista están a céntimos de distancia; la promo del 50% de GLM hasta el 9 de septiembre de 2026 es el único cambio relevante en la factura esta semana.
Introducción a los agentes de IA
¿Qué es GLM-5.3-Flash?
GLM-5.3-Flash es el primer modelo nativamente multimodal de Z.ai en la serie GLM-5, lanzado el 26 de agosto de 2026 con 320 mil millones de parámetros totales y 18 mil millones activos. Según Z.ai, supera a GLM-5.2 en programación y benchmarks de agentes a aproximadamente una décima parte del precio, y obtiene 57 en el Artificial Analysis Intelligence Index v4.1.1 a $0.045 por tarea en el nivel con descuento.
La arquitectura es el verdadero titular: atención híbrida lineal y dispersa, Manifold-Constrained Hyper-Connections (mHC), un corpus multimodal de 30 billones de tokens y 45 capas en lugar de las 92 de GLM-4.5. Z.ai lo ejecutó de forma anónima como ox-alpha en OpenCode y OpenRouter antes de nombrarlo, servido en chips de IA chinos. Los pesos están en Hugging Face bajo licencia MIT, con recetas de servicio para SGLang, vLLM y TokenSpeed.
Consulta más detalles en nuestra guía de GLM-5.3-Flash. Para la generación anterior, revisa nuestra guía de GLM-5.2 y el tutorial sobre cómo ejecutar GLM-5 en local para programación con agentes.
¿Qué es Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next es la vista previa de pesos abiertos del 26 de agosto de 2026 del equipo Qwen de Alibaba para la arquitectura prevista de Qwen4. El modelo principal tiene 125 mil millones de parámetros, más una tabla de embeddings n-gram de 51 mil millones, con 6 mil millones de parámetros activos por token. El contexto nativo es de 262.144 tokens, ampliable a 1.000.000 con YaRN. Qwen afirma que el entrenamiento costó aproximadamente una novena parte de Qwen3.7-Plus.
La SKU de producción es Qwen3.8-Flash en QwenCloud, a $0.16 por 1M de tokens de entrada y $0.47 por 1M de salida, con la API marcada como próximamente. El ID de modelo en la nube es qwen3.8-flash. Ya publicamos una guía específica de Qwen3.8-Flash-Next y un tutorial de configuración sobre cómo ejecutar Qwen3.8-Flash-Next en local como agente de programación con OpenCode.
GLM-5.3-Flash vs Qwen3.8-Flash-Next: comparativa directa

En los benchmarks que ambos laboratorios publicaron, GLM-5.3-Flash va por delante, como cabría esperar siendo el modelo más grande de los dos. Los precios son muy similares.
| Característica | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Laboratorio / fecha | Z.ai, 26 de agosto de 2026 | Qwen (Alibaba), 26 de agosto de 2026 |
| Tamaño | 320B totales, 18B activos | 125B principal + 51B n-gram, 6B activos |
| Contexto | 1M de tokens nativo | 262.144 nativo; 1.000.000 con YaRN |
| Modalidades | Multimodal nativo (texto, imagen, vídeo de entrada) | MoE multimodal nativo |
| Pesos | MIT, zai-org/GLM-5.3-Flash |
Pesos abiertos, Qwen/Qwen3.8-Flash-Next |
| Benchmarks de código compartidos | Lidera DeepSWE, Toolathlon, NL2Repo | Por detrás en esos tres; publicó SWE-bench Pro 62.5 |
| Benchmarks de agentes de oficina | AutomationBench 48.8; OfficeQA Pro 62.4 | CoWorkBench 73.9; JobBench 55.7 |
| Precio de lista API (por 1M) | $0.15 entrada / $0.50 salida | $0.16 entrada / $0.47 salida (Qwen3.8-Flash) |
| API propia | Activa, glm-5.3-flash |
En cola, qwen3.8-flash |
Programación y flujos agentivos
GLM-5.3-Flash lidera las puntuaciones de programación y uso de herramientas que ambos proveedores comparan en la misma fila. La tabla del 26 de agosto de Z.ai lista DeepSWE v1.1 en 63.4, Toolathlon Verified en 78.4 y NL2Repo en 56.3. La tabla de Qwen reporta 58.7, 73.5 y 48.1 en esos mismos tests.
Más allá de eso, la comparación es complicada porque seleccionan benchmarks distintos. Qwen publicó SWE-bench Pro en 62.5 y SWE-bench Multilingual en 81.0. Z.ai publicó Terminal Bench 2.1 en 84.3 y AutomationBench en 48.8, además de un resultado interno Z.ai Code Bench v1.0 de 29.0 al máximo esfuerzo frente a 29.5 de Claude Opus 4.8, ejecutado en Claude Code 2.1.207.
| Benchmark | GLM-5.3-Flash | Qwen3.8-Flash-Next | Notas |
|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 58.7 | Tablas de proveedor; GLM usó mini-swe-agent, Qwen reporta el mayor de Claude Code y mini-SWE-agent |
| Toolathlon Verified | 78.4 | 73.5 | Pass@1; GLM promedia 3 ejecuciones |
| NL2Repo | 56.3 | 48.1 | Qwen lo etiqueta NL2Repo-Bench |
| SWE-bench Pro | No publicado | 62.5 | Qwen reejecutó baselines en Claude Code |
| Terminal Bench 2.1 | 84.3 | No publicado | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26.3 | 24.3 pass@1 (puntuación 51.2) | Los formatos de reporte difieren |
Yo trataría a GLM como el Flash de programación con resultados más fuertes en el conjunto solapado, y no declararía ganador en SWE-bench sin la puntuación publicada de Z.ai.
Trabajo de oficina y agentes de horizonte largo
Qwen es el laboratorio que publicó puntuaciones de oficina de horizonte largo. CoWorkBench marca 73.9 y JobBench 55.7, muy por delante de Qwen3.7-Plus (65.1 y 27.6) y de Claude Opus 4.6 Max en esas filas (68.2 y 36.6).
Los números de "trabajo" que se solapan en Z.ai son AutomationBench 48.8 y OfficeQA Pro 62.4, además de ZCode Browser Use y Computer Use para trabajo visual en escritorio.
No son las mismas pruebas, así que no deciden un ganador. Si tu modelo mental del trabajo es un agente de oficina de varias horas, Qwen te dio esos bancos de pruebas. Si es automatización estilo Zapier o QA de PDFs de oficina, GLM te dio esos.
Arquitectura y coste de servicio
Qwen3.8-Flash-Next activa 6 mil millones de parámetros por token. GLM-5.3-Flash activa 18 mil millones. Esa diferencia de 3x es el dato de hardware más claro en la comparación, y por eso las conversaciones de servicio local acaban girando hacia Qwen. En la práctica, el GGUF UD-Q4_K_XL (~111GB) corre en una sola tarjeta de 96GB con volcado a RAM — lo hicimos aquí.
Ambos usan atención híbrida. Z.ai afirma que GLM-5.3-Flash reduce el cómputo de atención 3,0x y el tamaño de la caché KV 4,4x frente a GLM-5.3. Qwen afirma que el kernel de atención de QSA es hasta 7,6x más rápido en prefill y 4,9x en decodificación a 1M de tokens, y 8,6x el throughput de prefill de Qwen3.7-Plus con una tasa de acierto de prefix-cache del 90%.
El truco extra de capacidad tipo 51B de GLM no es una tabla de embeddings; la tabla n-gram de 51B de Qwen está diseñada para residir en la RAM del host y prefetch. Recetas distintas, misma promesa: más capacidad por vatio.
Capacidades multimodales y contexto
Ambos modelos aceptan imágenes en la misma generación que texto. GLM-5.3-Flash es explícitamente el primer miembro multimodal nativo de GLM-5, entrenado en un corpus multimodal de 30 billones de tokens, con filas de visión aptas para vídeo (MVBench 77.8, MMVU 80.5).
Qwen3.8-Flash-Next publica AndroidWorld 84.5, LVBench 76.6, RealWorldQA 88.5 y CharXiv 84.6 sin herramienta de uso de ordenador / 90.6 con una.
El tamaño de la ventana de contexto es lo bastante parecido como para no decidir solo por eso. GLM anuncia 1M de tokens nativos. Qwen es nativo en 262.144 y estira a 1.000.000 con YaRN. En notas de investigación aún se trata el 1M de GLM como poco estresado en producción.
Precios: lo que realmente pagas

Sin contar promociones, es casi imposible distinguir los precios de ambos modelos. Qwen y Z.ai apuntan claramente al mismo segmento.
Tarifas por token, lado a lado
| Tarifa | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Entrada, por 1M de tokens | $0.15 ($0.075 promo) | $0.16 |
| Salida, por 1M de tokens | $0.50 ($0.25 promo) | $0.47 |
| Entrada en caché, por 1M de tokens | $0.03 ($0.015 promo) | $0.016 |
| Salida en caché, por 1M de tokens | Gratis durante la promo | $0.20 |
| Promo de lanzamiento | 50% de descuento hasta el 9 de septiembre de 2026, 24:00 UTC+8 | Ninguna publicada |
| Cuota del Coding Plan | 3x GLM-5.3 en todos los planes | No publicado |
La curva es casi plana. La salida ligeramente más barata de Qwen ayuda en meses con mucha generación; la entrada ligeramente más barata de GLM ayuda en recuperación. Z.ai factura los thinking tokens a la tarifa de salida. Qwen documenta enable_thinking y reasoning_effort en QwenCloud sin precio separado para thinking tokens, así que trata el razonamiento como salida hasta nuevo aviso.
Ambos publican precios de caché, y valúan la operación de forma distinta. Z.ai lista la lectura de entrada en caché a $0.03 por 1M de tokens ($0.015 en promo) y hace gratuitas las escrituras de caché durante la promo. Qwen cobra la lectura de caché a $0.016 pero cobra $0.20 por 1M de tokens por crear una caché explícita.
Así que Qwen te reduce a la mitad la lectura de caché, y GLM regala la escritura. Si tus prefijos son estables y de larga vida, gana la lectura de Qwen; si reescribes cachés a menudo, ganan las escrituras gratis de GLM, al menos hasta el 9 de septiembre.
Cuánto cuesta un caso real
Fórmula: (volumen ÷ 1M) × tarifa, sumado entre entrada y salida, a precios de lista estándar. Las promos se quedan fuera de la tabla.
| Carga de trabajo | GLM-5.3-Flash | Qwen3.8-Flash | Diferencia |
|---|---|---|---|
| Asistente equilibrado: 1M in / 250K out | $0.28 | $0.28 | $0.00 (0%) |
| Mucha generación: 1M in / 4M out | $2.15 | $2.04 | Qwen $0.11 más barato (5%) |
| Recuperación, bajo umbral: 10M in / 1M out | $2.00 | $2.07 | GLM $0.07 más barato (3%) |
El coste de lista por API está empatado. La decisión depende del ajuste a tu carga y de si el endpoint existe. Ambos modelos usan tokenizadores específicos del proveedor y ninguno publicó conteos de tokens para una carga compartida, así que toma estos totales como comparación de tarifas, no como factura. Hasta el 9 de septiembre de 2026, la promo de GLM reduce a la mitad esas columnas de GLM ($0.14, $1.08, $1.00).
Cuándo elegir GLM-5.3-Flash vs Qwen3.8-Flash-Next

Si necesitas llamar a una API propia esta semana, GLM-5.3-Flash es el único producto completo de la pareja. Si estás evaluando la arquitectura de Qwen4 o te importan CoWorkBench y JobBench, empieza con los pesos de Qwen3.8-Flash-Next ya y añade qwen3.8-flash cuando esté disponible en QwenCloud.
Elige GLM-5.3-Flash si...
-
Necesitas
glm-5.3-flashen Z.ai, oz-ai/glm-5.3-flashen OpenRouter, sin esperar a una SKU en la nube en cola. -
Tu conjunto de evaluación se parece a DeepSWE, Toolathlon, NL2Repo o Terminal Bench 2.1, y quieres el laboratorio con mejores resultados en el solapado.
-
Quieres pesos MIT y una ventana nativa de 1M de tokens, y te parece bien activar 18B de parámetros.
-
Ya estás en un GLM Coding Plan y puedes usar la cuota 3x frente a GLM-5.3, incluida la promo hasta el 9 de septiembre de 2026.
- Quieres agentes visuales de escritorio. Browser Use y Computer Use de ZCode aparecen en el post de lanzamiento, y el contra-índice de Qwen es OSWorld 2.0 con 19.4, que no es precisamente un trofeo.
Elige Qwen3.8-Flash-Next si...
-
Compras una vista previa de Qwen4, no una API gestionada final. Hoy el producto son los pesos.
-
Los benchmarks de agentes de oficina son los que realmente miras. CoWorkBench y JobBench son la historia publicada de Qwen, no la de GLM.
-
Quieres 6B de parámetros activos y una tabla n-gram que pueda vivir en la memoria del host, incluso junto a una configuración local de Qwen3.8-27B.
-
Ya usas Qwen Chat, Qwen Studio, Qwen Code, o apuntas cualquier agente compatible con OpenAI (OpenCode, Codex, Qwen Code) a un endpoint local de llama.cpp hoy. Claude Code necesita un proxy de traducción.
Cómo empezar con GLM-5.3-Flash y Qwen3.8-Flash-Next
| Superficie | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| App de consumo | Playground web de Z.ai y GLM Coding Plan | Qwen Chat y Qwen Studio |
| API propia | Sí, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API próximamente) |
| Plataformas cloud | No disponible en Bedrock, Vertex AI ni Azure AI Foundry | No disponible en Bedrock, Vertex AI ni Azure AI Foundry |
| Agentes de código | ZCode; OpenRouter hacia IDEs que aceptan proveedores personalizados. No es nativo en Claude Code, GitHub Copilot ni Cursor | Funciona hoy vía llama.cpp local + OpenCode; el mismo cableado aplicará a QwenCloud cuando esté activo. No es nativo en Claude Code, GitHub Copilot ni Cursor |
| Routers de terceros | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID de modelo API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash en QwenCloud y OpenRouter; pesos Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash se puede llamar ya. Qwen3.8-Flash-Next también, pero solo en tu propio hardware o a través de routers como OpenRouter. El endpoint de API propio de Qwen debería llegar pronto.
Escribe esos IDs tal cual. El ID de Qwen3.8-Flash-Next es qwen3.8-flash (sin "next"), así que no inventes un ID cloud qwen3.8-flash-next a partir del nombre de los pesos.
Tu primera llamada a la API
Ambos modelos hablan el formato de chat completions de OpenAI, así que puedes reutilizar el cliente estándar. La forma más rápida de probarlos en paralelo es OpenRouter, donde ambos comparten la misma base URL y solo cambias la cadena del modelo.
from openai import OpenAI
import os
# Un cliente, dos modelos. Cambia la cadena del modelo en la línea 12 — nada más.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # o "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Ir con la API propia te quita portabilidad. El endpoint de Z.ai vive en docs.z.ai y acepta thinking: {"type": "enabled"} con reasoning_effort en low, high o max. El de Alibaba usa enable_thinking con reasoning_effort por defecto en xhigh, sobre una base URL de DashScope (internacional, Pekín o Virginia). Es el mismo SDK, pero el control de razonamiento no es portátil, así que reserva un pequeño adaptador si planeas alternar.
Para un recorrido completo de Qwen, lee el tutorial sobre cómo ejecutar Qwen3.8-Flash-Next en local y el tutorial de la CLI de Qwen Code. Para servir localmente la familia GLM, usa Run GLM-5 Locally For Agentic Coding. Si ya trabajas con Qwen3.8-27B, nuestra configuración con RTX 5090 es el camino local hermano, no esta vista previa de 125B.
Conclusiones
Si necesitas desplegar contra una API Flash activa esta semana, usa GLM-5.3-Flash. Si estás estudiando Qwen4 o das más peso a CoWorkBench que a DeepSWE, usa los pesos de Qwen3.8-Flash-Next en local y cambia a qwen3.8-flash por API cuando salga.
Lo más interesante es lo poco que difieren los precios de lista. El debate va de accesos y de qué fila no publicada decides ignorar, no de un precipicio de coste 2x.
Si quieres los conceptos detrás de ambos MoE, te recomendamos el curso Large Language Models (LLMs) Concepts y luego el itinerario AI Agent Fundamentals. Para trabajo con hubs y pesos, Working with Hugging Face es el siguiente paso práctico.
Preguntas frecuentes
¿Cuándo debo usar GLM-5.3-Flash en lugar de Qwen3.8-Flash-Next?
Usa GLM-5.3-Flash cuando necesites una API propia activa esta semana, pesos con licencia MIT o las mejores puntuaciones solapadas en programación (DeepSWE v1.1 63.4, Toolathlon Verified 78.4, NL2Repo 56.3).
Usa Qwen3.8-Flash-Next cuando quieras ejecutar en local la vista previa de la arquitectura de Qwen4, prefieras 6B de parámetros activos más eficientes o quieras usar el modelo en un entorno de agente de oficina (CoWorkBench 73.9, JobBench 55.7).
¿Dónde puedo acceder a GLM-5.3-Flash y Qwen3.8-Flash-Next?
GLM-5.3-Flash está activo en Z.ai como glm-5.3-flash, en el GLM Coding Plan y en OpenRouter como z-ai/glm-5.3-flash. Los pesos están en Hugging Face bajo licencia MIT.
Los pesos de Qwen3.8-Flash-Next están en Hugging Face y ModelScope. La API de producción es Qwen3.8-Flash en QwenCloud como qwen3.8-flash, marcada como próximamente, pero ya puedes acceder al modelo vía OpenRouter. Qwen Chat y Qwen Studio son las superficies de consumo.
¿Cómo se comparan GLM-5.3-Flash y Qwen3.8-Flash-Next en programación?
En los benchmarks de programación que ambos laboratorios publicaron, GLM-5.3-Flash lidera: DeepSWE v1.1 63.4 vs 58.7, Toolathlon Verified 78.4 vs 73.5 y NL2Repo 56.3 vs 48.1. Los harnesses no son idénticos.
¿Cuáles son los IDs de modelo API de GLM-5.3-Flash y Qwen3.8-Flash-Next?
GLM-5.3-Flash es glm-5.3-flash en Z.ai y z-ai/glm-5.3-flash en OpenRouter.
El ID de producción en QwenCloud es qwen3.8-flash, no un qwen3.8-flash-next en la nube. Los pesos abiertos son Qwen/Qwen3.8-Flash-Next.
¿Qwen3.8-Flash-Next es lo mismo que Qwen3.8-Flash?
No. Qwen3.8-Flash-Next es la vista previa de arquitectura de pesos abiertos. Qwen3.8-Flash es la SKU de producción en QwenCloud, listada a $0.16 / $0.47 por 1M de tokens, con 1M de contexto por defecto y herramientas integradas oficiales. La API figuraba como próximamente el 26 de agosto de 2026.
Editor de ciencia de datos en DataCamp | Me encanta hacer previsiones y crear con API.


