Track
26 августа 2026 года Z.ai представила GLM-5.3-Flash, а команда Qwen из Alibaba открыла веса Qwen3.8-Flash-Next. Обе модели — с открытыми весами, изначально мультимодальные MoE, позиционируются как вариант класса Flash по эффективности, а не как «урезанный» дешевый вариант.
Раньше Flash означал «тонкий». Эти две модели — ставка лабораторий на эффективность для кодирующих агентов и обслуживания длинного контекста, выпущенные в один и тот же 24-часовой промежуток. Сопоставление намеренно неудобное: они публикуют разные бенчмарки, и только у одной сейчас есть рабочий собственный API.
Итоги кратко
- GLM-5.3-Flash лидирует на кодинговых и tool-use бенчмарках, которые опубликовали обе лаборатории.
- Выбирайте GLM-5.3-Flash, если вам нужен живой API, веса под MIT-лицензией и окно в 1 млн токенов без YaRN.
- Выбирайте Qwen3.8-Flash-Next, если можете развернуть у себя (веса уже работают с llama.cpp) или готовы подождать управляемый API QwenCloud.
- Прайсы почти одинаковые; 50% промо у GLM до 9 сентября 2026 — единственное, что заметно меняет счет в эту неделю.
Что такое GLM-5.3-Flash?
GLM-5.3-Flash — первая изначально мультимодальная модель Z.ai в серии GLM-5, выпущенная 26 августа 2026 года. Всего 320 млрд параметров, 18 млрд активных. В запускном посте Z.ai говорится, что она обходит GLM-5.2 на кодинге и агентных бенчмарках примерно за десятую часть цены и набирает 57 в Artificial Analysis Intelligence Index v4.1.1 при $0,045 за задачу на дисконтном тарифе.
Архитектура — главная новость: гибридное линейное и разреженное внимание, Manifold-Constrained Hyper-Connections (mHC), мультимодальный корпус в 30 трлн токенов и 45 слоев вместо 92 в GLM-4.5. До объявления названия Z.ai гоняла модель анонимно как ox-alpha на OpenCode и OpenRouter, обслуживая на китайских AI-чипах. Веса опубликованы на Hugging Face под MIT-лицензией, есть рецепты сервинга для SGLang, vLLM и TokenSpeed.
Подробнее — в нашем отдельном гайде по GLM-5.3-Flash. Про предыдущее поколение см. гайд по GLM-5.2 и наш турориал по локальному запуску GLM-5 для агентного кодинга.
Что такое Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next — превью архитектуры, намеченной для Qwen4, с открытыми весами от команды Qwen (Alibaba) от 26 августа 2026 года. Основная модель — 125 млрд параметров плюс n-граммная эмбеддинг-таблица на 51 млрд параметров, 6 млрд параметров активны на токен. Родной контекст — 262 144 токена, расширяем до 1 000 000 с YaRN. По словам Qwen, обучение стоило примерно одну девятую от Qwen3.7-Plus.
Продуктовый SKU — Qwen3.8-Flash в QwenCloud, по $0,16 за 1 млн входных токенов и $0,47 за 1 млн выходных токенов; API помечен как «скоро». Идентификатор облачной модели — qwen3.8-flash. Мы уже подготовили отдельный гайд по Qwen3.8-Flash-Next и пошаговую инструкцию как запустить Qwen3.8-Flash-Next локально как кодирующего агента с OpenCode.
GLM-5.3-Flash и Qwen3.8-Flash-Next: сравнение лицом к лицу

На бенчмарках, опубликованных обеими лабораториями, GLM-5.3-Flash впереди — что ожидаемо, учитывая ее больший размер. Цены у моделей очень похожи.
| Характеристика | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Лаборатория / дата | Z.ai, 26 августа 2026 | Qwen (Alibaba), 26 августа 2026 |
| Размер | 320B всего, 18B активных | 125B основная + 51B n-грамм, 6B активных |
| Контекст | 1 млн токенов нативно | 262 144 нативно; 1 000 000 с YaRN |
| Модальности | Изначально мультимодальная (текст, изображение, видео на входе) | Изначально мультимодальная MoE |
| Веса | MIT, zai-org/GLM-5.3-Flash |
Открытые веса, Qwen/Qwen3.8-Flash-Next |
| Общие кодинговые бенчмарки | Лидирует на DeepSWE, Toolathlon, NL2Repo | Отстает на этих трех; опубликован SWE-bench Pro 62,5 |
| Офисные агенты | AutomationBench 48,8; OfficeQA Pro 62,4 | CoWorkBench 73,9; JobBench 55,7 |
| Прайс API (за 1 млн) | $0,15 вход / $0,50 выход | $0,16 вход / $0,47 выход (Qwen3.8-Flash) |
| Собственный API | В работе, glm-5.3-flash |
В очереди, qwen3.8-flash |
Кодинг и агентные сценарии
GLM-5.3-Flash лидирует на кодинговых и tool-use показателях, которые оба вендора поставили в одни и те же строки. В таблице Z.ai от 26 августа указаны: DeepSWE v1.1 — 63,4; Toolathlon Verified — 78,4; NL2Repo — 56,3. В таблице Qwen по тем же названиям: 58,7; 73,5; 48,1.
За пределами этих строк сравнение затруднено, так как выбранные бенчмарки различаются. Qwen опубликовала SWE-bench Pro — 62,5 и SWE-bench Multilingual — 81,0. Z.ai опубликовала Terminal Bench 2.1 — 84,3 и AutomationBench — 48,8, а также внутренний Z.ai Code Bench v1.0 — 29,0 на максимальном усилии против 29,5 у Claude Opus 4.8, запущенного в Claude Code 2.1.207.
| Бенчмарк | GLM-5.3-Flash | Qwen3.8-Flash-Next | Примечания |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 58,7 | Таблицы вендоров; GLM — mini-swe-agent, Qwen — максимум из Claude Code и mini-SWE-agent |
| Toolathlon Verified | 78,4 | 73,5 | Pass@1; GLM усредняет 3 прогона |
| NL2Repo | 56,3 | 48,1 | У Qwen обозначен как NL2Repo-Bench |
| SWE-bench Pro | Не опубликовано | 62,5 | Qwen перезапустила бейзлайны в Claude Code |
| Terminal Bench 2.1 | 84,3 | Не опубликовано | Z.ai, Claude Code 2.1.207 |
| Agents' Last Exam | 26,3 | 24,3 pass@1 (оценка 51,2) | Форматы отчетности различаются |
Я бы считал GLM более сильным опубликованным Flash-агентом для кодинга на пересекающемся наборе и не стал бы назначать победителя SWE-bench без опубликованной оценки Z.ai.
Офисная работа и долгоживущие агенты
Дальние офисные сценарии опубликовала именно Qwen. CoWorkBench — 73,9 и JobBench — 55,7, что на голову выше Qwen3.7-Plus (65,1 и 27,6) и Claude Opus 4.6 Max в этих строках (68,2 и 36,6).
Пересекающиеся у Z.ai «рабочие» цифры — AutomationBench 48,8 и OfficeQA Pro 62,4, плюс ZCode Browser Use и Computer Use для визуальной десктопной работы.
Это не одни и те же тесты, значит, победителя они не определяют. Если ваш мысленный портрет задачи — многочасовой офисный агент, Qwen дала нужные бенчмарки. Если это автоматизация в духе Zapier или PDF Office QA — их дала GLM.
Архитектура и стоимость сервинга
Qwen3.8-Flash-Next активирует 6 млрд параметров на токен. GLM-5.3-Flash — 18 млрд. Этот разрыв в 3 раза — самый чистый «железный» факт в паре и объяснение, почему локальный сервинг чаще сводится к Qwen. На практике UD-Q4_K_XL GGUF (~111 ГБ) работает на одной 96-ГБ карте с выгрузкой в RAM — мы это сделали здесь.
Обе используют гибридное внимание. Z.ai заявляет, что GLM-5.3-Flash сокращает вычисления внимания в 3,0 раза и размер KV-кэша в 4,4 раза по сравнению с GLM-5.3. Qwen говорит, что ядро внимания QSA быстрее до 7,6x на префилле и 4,9x на декоде при 1 млн токенов, а пропускная способность префилла 8,6x от Qwen3.7-Plus при 90% попаданий в prefix-cache.
У GLM дополнительная «емкостная фишка в стиле 51B» — это не эмбеддинг-таблица; у Qwen 51B n-граммная таблица спроектирована для размещения в оперативной памяти хоста с префетчем. Рецепты разные, посыл один: больше возможностей на ватт.
Мультимодальность и контекст
Обе модели принимают изображения в том же поколении, что и текст. GLM-5.3-Flash — явно первый нативно мультимодальный участник GLM-5, обученный на мультимодальном корпусе в 30 трлн токенов, с «видеоспособными» визион-строками (MVBench 77,8; MMVU 80,5).
Qwen3.8-Flash-Next публикует AndroidWorld 84,5; LVBench 76,6; RealWorldQA 88,5 и CharXiv 84,6 без инструмента для компьютер-юза / 90,6 с ним.
Размер окон контекста достаточно близок, чтобы не выбирать только по нему. GLM заявляет нативное окно в 1 млн токенов. У Qwen нативно 262 144, растягивается до 1 000 000 с YaRN. В исследовательских заметках 1 млн у GLM пока считаются легкопроверенным в проде.
Цены: что вы платите на деле

Если не считать промо, различить цены почти невозможно. Qwen и Z.ai явно целятся в один и тот же эшелон.
Токен-ставки рядом
| Ставка | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| Вход, за 1 млн токенов | $0,15 ($0,075 промо) | $0,16 |
| Выход, за 1 млн токенов | $0,50 ($0,25 промо) | $0,47 |
| Кэшированный вход, за 1 млн токенов | $0,03 ($0,015 промо) | $0,016 |
| Кэшированный выход, за 1 млн токенов | Бесплатно во время промо | $0,20 |
| Промо на запуск | Скидка 50% до 9 сентября 2026, 24:00 UTC+8 | Не опубликовано |
| Квота Coding Plan | 3x GLM-5.3 на всех уровнях планов | Не опубликовано |
Картина почти плоская. Чуть более дешевый выход у Qwen помогает в месяцах с тяжелой генерацией; чуть более дешевый вход у GLM помогает ретривлу. Z.ai тарифицирует «thinking»-токены по выходной ставке. Qwen документирует enable_thinking и reasoning_effort в QwenCloud без отдельной цены за thinking-токены, так что пока считайте рассуждение выходом, пока не скажут иначе.
Обе лаборатории публикуют ставки кэша и по-разному оценивают обмен. Z.ai берет $0,03 за 1 млн токенов за чтение кэшированного входа ($0,015 в промо) и делает запись кэша бесплатной в промо-окно. Qwen читает кэш по $0,016, но берет $0,20 за 1 млн токенов за создание явного кэша.
Итак, Qwen вдвое дешевле по чтению кэша, а GLM дарит запись. Если ваши префиксы стабильны и долгоживущие — выигрывает чтение у Qwen; если вы часто переписываете кэши — у GLM выигрывают бесплатные записи, по крайней мере до 9 сентября.
Сколько стоит реальная нагрузка
Формула: (объем ÷ 1 млн) × ставка, суммируем по входу и выходу, по стандартным прайсам. Промо-доллары в таблицу не входят.
| Нагрузка | GLM-5.3-Flash | Qwen3.8-Flash | Разница |
|---|---|---|---|
| Сбалансированный ассистент: 1 млн вход / 250 тыс. выход | $0,28 | $0,28 | $0,00 (0%) |
| Генерация-тяжелая: 1 млн вход / 4 млн выход | $2,15 | $2,04 | Qwen дешевле на $0,11 (5%) |
| Ретривл, ниже порога: 10 млн вход / 1 млн выход | $2,00 | $2,07 | GLM дешевле на $0,07 (3%) |
Список цен в API — ничья. Решение зависит от соответствия нагрузке и наличия эндпоинта. Обе модели используют вендор-специфичные токенизаторы, и ни одна лаборатория не опубликовала подсчеты токенов для общего ворклоада, так что воспринимайте итоги как сравнение ставок, а не счета. До 9 сентября 2026 промо у GLM делит надвое итоги в колонке GLM ($0,14; $1,08; $1,00).
Когда выбрать GLM-5.3-Flash или Qwen3.8-Flash-Next

Если вам нужен звонок в собственный API уже на этой неделе, GLM-5.3-Flash — единственный завершенный продукт в паре. Если вы оцениваете архитектуру Qwen4 или вам важны CoWorkBench и JobBench, начинайте с весов Qwen3.8-Flash-Next сейчас и добавьте qwen3.8-flash, когда он появится в QwenCloud.
Выбирайте GLM-5.3-Flash, если…
-
Вам нужен
glm-5.3-flashна Z.ai илиz-ai/glm-5.3-flashна OpenRouter без ожидания облачного SKU в очереди. -
Ваш набор оценок похож на DeepSWE, Toolathlon, NL2Repo или Terminal Bench 2.1, и вы хотите вендора с более высокими пересекающимися результатами.
-
Вам нужны веса MIT и нативное окно в 1 млн токенов, и вам ок активировать 18 млрд параметров.
-
У вас уже есть GLM Coding Plan, и вы можете использовать квоту 3x против GLM-5.3, включая промо до 9 сентября 2026.
- Вам нужны визуальные десктопные агенты. В запускном посте у ZCode заявлены Browser Use и Computer Use, а встречное число у Qwen — OSWorld 2.0 со значением 19,4, что не трофей.
Выбирайте Qwen3.8-Flash-Next, если…
-
Вы «покупаете» превью Qwen4, а не готовый управляемый API. Сегодня продукт — это веса.
-
Именно офисные агентные бенчмарки — то, что вы реально читаете. CoWorkBench и JobBench — история Qwen, а не GLM.
-
Вам нужны 6 млрд активных параметров и n-граммная таблица, которую можно держать в памяти хоста, в том числе рядом с локальной установкой Qwen3.8-27B.
-
Вы уже работаете в Qwen Chat, Qwen Studio, Qwen Code или направляете любой OpenAI-совместимый агент (OpenCode, Codex, Qwen Code) на локальный эндпоинт llama.cpp сегодня. Claude Code нужен прокси-переводчик.
Как начать работу с GLM-5.3-Flash и Qwen3.8-Flash-Next
| Поверхность | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Пользовательское приложение | Веб-песочница Z.ai и GLM Coding Plan | Qwen Chat и Qwen Studio |
| Собственный API | Да, Z.ai, glm-5.3-flash |
QwenCloud qwen3.8-flash (API скоро) |
| Облачные платформы | Нет на Bedrock, Vertex AI или Azure AI Foundry | Нет на Bedrock, Vertex AI или Azure AI Foundry |
| Кодирующие агенты | ZCode; OpenRouter в IDE, принимающие кастомных провайдеров. Не нативно в Claude Code, GitHub Copilot или Cursor | Работает сегодня через локальный llama.cpp + OpenCode; та же схема применится к QwenCloud, когда запустится. Не нативно в Claude Code, GitHub Copilot или Cursor |
| Сторонние роутеры | OpenRouter, DeepInfra, Together.ai | OpenRouter |
| ID модели в API | glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) |
qwen3.8-flash в QwenCloud и OpenRouter; веса Qwen/Qwen3.8-Flash-Next |
GLM-5.3-Flash доступна к вызову уже сейчас. Qwen3.8-Flash-Next — тоже, только на вашем железе или через роутеры вроде OpenRouter. Собственный эндпоинт Qwen должен скоро последовать.
Пишите эти ID точно. У Qwen3.8-Flash-Next ID в облаке — qwen3.8-flash (без «next»), так что не выдумывайте qwen3.8-flash-next по имени весов.
Первый вызов API
Обе модели поддерживают формат chat completions от OpenAI, так что можно переиспользовать стандартный клиент. Самый быстрый способ попробовать их бок о бок — OpenRouter, где обе за одним base URL, и вы меняете только строку модели.
from openai import OpenAI
import os
# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
model="z-ai/glm-5.3-flash", # or "qwen/qwen3.8-flash"
messages=[{"role": "user", "content": "Refactor this function..."}],
extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)
Переход на собственные API лишает переносимости. Эндпоинт Z.ai живет на docs.z.ai и принимает thinking: {"type": "enabled"} с reasoning_effort, равным low, high или max. У Alibaba — enable_thinking с reasoning_effort по умолчанию xhigh, и базовым URL DashScope (international, Пекин или Вирджиния). SDK один и тот же, но регулятор рассуждения не переносим, так что заложите небольшой адаптер, если планируете переключения.
Полный разбор по Qwen — в нашем гайде как запустить Qwen3.8-Flash-Next локально и в CLI-руководстве по Qwen Code. Для локального сервинга семейства GLM используйте Run GLM-5 Locally For Agentic Coding. Если у вас уже стоит Qwen3.8-27B, наша настройка RTX 5090 — соседний локальный путь, а не это превью на 125B.
Заключение
Если вам нужно выпустить продукт на живом Flash API уже на этой неделе — используйте GLM-5.3-Flash. Если вы изучаете Qwen4 или больше доверяете CoWorkBench, чем DeepSWE, используйте локально веса Qwen3.8-Flash-Next и переключитесь на qwen3.8-flash через API, когда он выйдет.
Наиболее интересное — насколько мало расходятся прайсы. Вопрос упирается в доступность и в то, какую неопубликованную строку вы готовы игнорировать, а не в двукратную разницу в цене.
Если хотите разобраться в идеях, лежащих в основе обеих MoE, рекомендуем наш курс Large Language Models (LLMs) Concepts, затем трек AI Agent Fundamentals. Для работы с хабом и весами — практический курс Working with Hugging Face.
Вопросы и ответы
Когда стоит использовать GLM-5.3-Flash, а когда Qwen3.8-Flash-Next?
Используйте GLM-5.3-Flash, если вам нужен живой собственный API уже на этой неделе, веса под MIT-лицензией или более высокие пересекающиеся кодинговые результаты (DeepSWE v1.1 — 63,4; Toolathlon Verified — 78,4; NL2Repo — 56,3).
Используйте Qwen3.8-Flash-Next, если хотите локально запускать превью архитектуры Qwen4, иметь более эффективные 6 млрд активных параметров или применять модель в офисном агентном сценарии (CoWorkBench — 73,9; JobBench — 55,7).
Где получить доступ к GLM-5.3-Flash и Qwen3.8-Flash-Next?
GLM-5.3-Flash доступна на Z.ai как glm-5.3-flash, в GLM Coding Plan и на OpenRouter как z-ai/glm-5.3-flash. Веса — на Hugging Face под MIT-лицензией.
Веса Qwen3.8-Flash-Next доступны на Hugging Face и ModelScope. Продуктовый API — Qwen3.8-Flash в QwenCloud как qwen3.8-flash, помечен «скоро», но доступ к модели уже есть через OpenRouter. Потребительские поверхности — Qwen Chat и Qwen Studio.
Как GLM-5.3-Flash и Qwen3.8-Flash-Next сравниваются в кодинге?
На кодинговых бенчмарках, опубликованных обеими лабораториями, лидирует GLM-5.3-Flash: DeepSWE v1.1 — 63,4 против 58,7; Toolathlon Verified — 78,4 против 73,5; NL2Repo — 56,3 против 48,1. Харнессы не идентичны.
Какие ID моделей в API у GLM-5.3-Flash и Qwen3.8-Flash-Next?
GLM-5.3-Flash — это glm-5.3-flash на Z.ai и z-ai/glm-5.3-flash на OpenRouter.
Производственный ID в QwenCloud — qwen3.8-flash, а не qwen3.8-flash-next в облаке. Открытые веса — Qwen/Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next — это то же самое, что Qwen3.8-Flash?
Нет. Qwen3.8-Flash-Next — превью архитектуры с открытыми весами. Qwen3.8-Flash — продуктовый SKU в QwenCloud, по $0,16 / $0,47 за 1 млн токенов, с базовым контекстом 1 млн и официальными встроенными инструментами. На 26 августа 2026 API был помечен как «скоро».