Перейти к основному контенту

GLM-5.3-Flash и Qwen3.8-Flash-Next: кодинг, стоимость и доступ

Новые модели Z.ai и Alibaba нацелены на один сегмент. GLM-5.3-Flash лидирует на общих кодинговых бенчмарках и уже доступна; Qwen3.8-Flash-Next — облегчённое превью Qwen4 с API в очереди.
Обновлено 31 авг. 2026 г.  · 11 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

26 августа 2026 года Z.ai представила GLM-5.3-Flash, а команда Qwen из Alibaba открыла веса Qwen3.8-Flash-Next. Обе модели — с открытыми весами, изначально мультимодальные MoE, позиционируются как вариант класса Flash по эффективности, а не как «урезанный» дешевый вариант.

Раньше Flash означал «тонкий». Эти две модели — ставка лабораторий на эффективность для кодирующих агентов и обслуживания длинного контекста, выпущенные в один и тот же 24-часовой промежуток. Сопоставление намеренно неудобное: они публикуют разные бенчмарки, и только у одной сейчас есть рабочий собственный API.

Итоги кратко

  • GLM-5.3-Flash лидирует на кодинговых и tool-use бенчмарках, которые опубликовали обе лаборатории.
  • Выбирайте GLM-5.3-Flash, если вам нужен живой API, веса под MIT-лицензией и окно в 1 млн токенов без YaRN.
  • Выбирайте Qwen3.8-Flash-Next, если можете развернуть у себя (веса уже работают с llama.cpp) или готовы подождать управляемый API QwenCloud.
  • Прайсы почти одинаковые; 50% промо у GLM до 9 сентября 2026 — единственное, что заметно меняет счет в эту неделю.

Что такое GLM-5.3-Flash?

GLM-5.3-Flash — первая изначально мультимодальная модель Z.ai в серии GLM-5, выпущенная 26 августа 2026 года. Всего 320 млрд параметров, 18 млрд активных. В запускном посте Z.ai говорится, что она обходит GLM-5.2 на кодинге и агентных бенчмарках примерно за десятую часть цены и набирает 57 в Artificial Analysis Intelligence Index v4.1.1 при $0,045 за задачу на дисконтном тарифе.

Архитектура — главная новость: гибридное линейное и разреженное внимание, Manifold-Constrained Hyper-Connections (mHC), мультимодальный корпус в 30 трлн токенов и 45 слоев вместо 92 в GLM-4.5. До объявления названия Z.ai гоняла модель анонимно как ox-alpha на OpenCode и OpenRouter, обслуживая на китайских AI-чипах. Веса опубликованы на Hugging Face под MIT-лицензией, есть рецепты сервинга для SGLang, vLLM и TokenSpeed.

Подробнее — в нашем отдельном гайде по GLM-5.3-Flash. Про предыдущее поколение см. гайд по GLM-5.2 и наш турориал по локальному запуску GLM-5 для агентного кодинга.

Что такое Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next — превью архитектуры, намеченной для Qwen4, с открытыми весами от команды Qwen (Alibaba) от 26 августа 2026 года. Основная модель — 125 млрд параметров плюс n-граммная эмбеддинг-таблица на 51 млрд параметров, 6 млрд параметров активны на токен. Родной контекст — 262 144 токена, расширяем до 1 000 000 с YaRN. По словам Qwen, обучение стоило примерно одну девятую от Qwen3.7-Plus.

Продуктовый SKU — Qwen3.8-Flash в QwenCloud, по $0,16 за 1 млн входных токенов и $0,47 за 1 млн выходных токенов; API помечен как «скоро». Идентификатор облачной модели — qwen3.8-flash. Мы уже подготовили отдельный гайд по Qwen3.8-Flash-Next и пошаговую инструкцию как запустить Qwen3.8-Flash-Next локально как кодирующего агента с OpenCode.

GLM-5.3-Flash и Qwen3.8-Flash-Next: сравнение лицом к лицу

GLM лидирует на общих кодинговых бенчмарках; у Qwen API в очереди

На бенчмарках, опубликованных обеими лабораториями, GLM-5.3-Flash впереди — что ожидаемо, учитывая ее больший размер. Цены у моделей очень похожи.

Характеристика GLM-5.3-Flash Qwen3.8-Flash-Next
Лаборатория / дата Z.ai, 26 августа 2026 Qwen (Alibaba), 26 августа 2026
Размер 320B всего, 18B активных 125B основная + 51B n-грамм, 6B активных
Контекст 1 млн токенов нативно 262 144 нативно; 1 000 000 с YaRN
Модальности Изначально мультимодальная (текст, изображение, видео на входе) Изначально мультимодальная MoE
Веса MIT, zai-org/GLM-5.3-Flash Открытые веса, Qwen/Qwen3.8-Flash-Next
Общие кодинговые бенчмарки Лидирует на DeepSWE, Toolathlon, NL2Repo Отстает на этих трех; опубликован SWE-bench Pro 62,5
Офисные агенты AutomationBench 48,8; OfficeQA Pro 62,4 CoWorkBench 73,9; JobBench 55,7
Прайс API (за 1 млн) $0,15 вход / $0,50 выход $0,16 вход / $0,47 выход (Qwen3.8-Flash)
Собственный API В работе, glm-5.3-flash В очереди, qwen3.8-flash

Кодинг и агентные сценарии

GLM-5.3-Flash лидирует на кодинговых и tool-use показателях, которые оба вендора поставили в одни и те же строки. В таблице Z.ai от 26 августа указаны: DeepSWE v1.1 — 63,4; Toolathlon Verified — 78,4; NL2Repo — 56,3. В таблице Qwen по тем же названиям: 58,7; 73,5; 48,1.

За пределами этих строк сравнение затруднено, так как выбранные бенчмарки различаются. Qwen опубликовала SWE-bench Pro — 62,5 и SWE-bench Multilingual — 81,0. Z.ai опубликовала Terminal Bench 2.1 — 84,3 и AutomationBench — 48,8, а также внутренний Z.ai Code Bench v1.0 — 29,0 на максимальном усилии против 29,5 у Claude Opus 4.8, запущенного в Claude Code 2.1.207.

Бенчмарк GLM-5.3-Flash Qwen3.8-Flash-Next Примечания
DeepSWE v1.1 63,4 58,7 Таблицы вендоров; GLM — mini-swe-agent, Qwen — максимум из Claude Code и mini-SWE-agent
Toolathlon Verified 78,4 73,5 Pass@1; GLM усредняет 3 прогона
NL2Repo 56,3 48,1 У Qwen обозначен как NL2Repo-Bench
SWE-bench Pro Не опубликовано 62,5 Qwen перезапустила бейзлайны в Claude Code
Terminal Bench 2.1 84,3 Не опубликовано Z.ai, Claude Code 2.1.207
Agents' Last Exam 26,3 24,3 pass@1 (оценка 51,2) Форматы отчетности различаются

Я бы считал GLM более сильным опубликованным Flash-агентом для кодинга на пересекающемся наборе и не стал бы назначать победителя SWE-bench без опубликованной оценки Z.ai.

Офисная работа и долгоживущие агенты

Дальние офисные сценарии опубликовала именно Qwen. CoWorkBench — 73,9 и JobBench — 55,7, что на голову выше Qwen3.7-Plus (65,1 и 27,6) и Claude Opus 4.6 Max в этих строках (68,2 и 36,6).

Пересекающиеся у Z.ai «рабочие» цифры — AutomationBench 48,8 и OfficeQA Pro 62,4, плюс ZCode Browser Use и Computer Use для визуальной десктопной работы.

Это не одни и те же тесты, значит, победителя они не определяют. Если ваш мысленный портрет задачи — многочасовой офисный агент, Qwen дала нужные бенчмарки. Если это автоматизация в духе Zapier или PDF Office QA — их дала GLM.

Архитектура и стоимость сервинга

Qwen3.8-Flash-Next активирует 6 млрд параметров на токен. GLM-5.3-Flash — 18 млрд. Этот разрыв в 3 раза — самый чистый «железный» факт в паре и объяснение, почему локальный сервинг чаще сводится к Qwen. На практике UD-Q4_K_XL GGUF (~111 ГБ) работает на одной 96-ГБ карте с выгрузкой в RAM — мы это сделали здесь.

Обе используют гибридное внимание. Z.ai заявляет, что GLM-5.3-Flash сокращает вычисления внимания в 3,0 раза и размер KV-кэша в 4,4 раза по сравнению с GLM-5.3. Qwen говорит, что ядро внимания QSA быстрее до 7,6x на префилле и 4,9x на декоде при 1 млн токенов, а пропускная способность префилла 8,6x от Qwen3.7-Plus при 90% попаданий в prefix-cache.

У GLM дополнительная «емкостная фишка в стиле 51B» — это не эмбеддинг-таблица; у Qwen 51B n-граммная таблица спроектирована для размещения в оперативной памяти хоста с префетчем. Рецепты разные, посыл один: больше возможностей на ватт.

Мультимодальность и контекст

Обе модели принимают изображения в том же поколении, что и текст. GLM-5.3-Flash — явно первый нативно мультимодальный участник GLM-5, обученный на мультимодальном корпусе в 30 трлн токенов, с «видеоспособными» визион-строками (MVBench 77,8; MMVU 80,5).

Qwen3.8-Flash-Next публикует AndroidWorld 84,5; LVBench 76,6; RealWorldQA 88,5 и CharXiv 84,6 без инструмента для компьютер-юза / 90,6 с ним.

Размер окон контекста достаточно близок, чтобы не выбирать только по нему. GLM заявляет нативное окно в 1 млн токенов. У Qwen нативно 262 144, растягивается до 1 000 000 с YaRN. В исследовательских заметках 1 млн у GLM пока считаются легкопроверенным в проде.

Цены: что вы платите на деле

Список цен примерно равен, более дешевая модель меняется по нагрузке

Если не считать промо, различить цены почти невозможно. Qwen и Z.ai явно целятся в один и тот же эшелон.

Токен-ставки рядом

Ставка GLM-5.3-Flash Qwen3.8-Flash
Вход, за 1 млн токенов $0,15 ($0,075 промо) $0,16
Выход, за 1 млн токенов $0,50 ($0,25 промо) $0,47
Кэшированный вход, за 1 млн токенов $0,03 ($0,015 промо) $0,016
Кэшированный выход, за 1 млн токенов Бесплатно во время промо $0,20
Промо на запуск Скидка 50% до 9 сентября 2026, 24:00 UTC+8 Не опубликовано
Квота Coding Plan 3x GLM-5.3 на всех уровнях планов Не опубликовано

Картина почти плоская. Чуть более дешевый выход у Qwen помогает в месяцах с тяжелой генерацией; чуть более дешевый вход у GLM помогает ретривлу. Z.ai тарифицирует «thinking»-токены по выходной ставке. Qwen документирует enable_thinking и reasoning_effort в QwenCloud без отдельной цены за thinking-токены, так что пока считайте рассуждение выходом, пока не скажут иначе.

Обе лаборатории публикуют ставки кэша и по-разному оценивают обмен. Z.ai берет $0,03 за 1 млн токенов за чтение кэшированного входа ($0,015 в промо) и делает запись кэша бесплатной в промо-окно. Qwen читает кэш по $0,016, но берет $0,20 за 1 млн токенов за создание явного кэша.

Итак, Qwen вдвое дешевле по чтению кэша, а GLM дарит запись. Если ваши префиксы стабильны и долгоживущие — выигрывает чтение у Qwen; если вы часто переписываете кэши — у GLM выигрывают бесплатные записи, по крайней мере до 9 сентября.

Сколько стоит реальная нагрузка

Формула: (объем ÷ 1 млн) × ставка, суммируем по входу и выходу, по стандартным прайсам. Промо-доллары в таблицу не входят.

Нагрузка GLM-5.3-Flash Qwen3.8-Flash Разница
Сбалансированный ассистент: 1 млн вход / 250 тыс. выход $0,28 $0,28 $0,00 (0%)
Генерация-тяжелая: 1 млн вход / 4 млн выход $2,15 $2,04 Qwen дешевле на $0,11 (5%)
Ретривл, ниже порога: 10 млн вход / 1 млн выход $2,00 $2,07 GLM дешевле на $0,07 (3%)

Список цен в API — ничья. Решение зависит от соответствия нагрузке и наличия эндпоинта. Обе модели используют вендор-специфичные токенизаторы, и ни одна лаборатория не опубликовала подсчеты токенов для общего ворклоада, так что воспринимайте итоги как сравнение ставок, а не счета. До 9 сентября 2026 промо у GLM делит надвое итоги в колонке GLM ($0,14; $1,08; $1,00).

Когда выбрать GLM-5.3-Flash или Qwen3.8-Flash-Next

Берите GLM для живого API, Qwen — для офисных агентов

Если вам нужен звонок в собственный API уже на этой неделе, GLM-5.3-Flash — единственный завершенный продукт в паре. Если вы оцениваете архитектуру Qwen4 или вам важны CoWorkBench и JobBench, начинайте с весов Qwen3.8-Flash-Next сейчас и добавьте qwen3.8-flash, когда он появится в QwenCloud.

Выбирайте GLM-5.3-Flash, если…

  • Вам нужен glm-5.3-flash на Z.ai или z-ai/glm-5.3-flash на OpenRouter без ожидания облачного SKU в очереди.

  • Ваш набор оценок похож на DeepSWE, Toolathlon, NL2Repo или Terminal Bench 2.1, и вы хотите вендора с более высокими пересекающимися результатами.

  • Вам нужны веса MIT и нативное окно в 1 млн токенов, и вам ок активировать 18 млрд параметров.

  • У вас уже есть GLM Coding Plan, и вы можете использовать квоту 3x против GLM-5.3, включая промо до 9 сентября 2026.

  • Вам нужны визуальные десктопные агенты. В запускном посте у ZCode заявлены Browser Use и Computer Use, а встречное число у Qwen — OSWorld 2.0 со значением 19,4, что не трофей.

Выбирайте Qwen3.8-Flash-Next, если…

  • Вы «покупаете» превью Qwen4, а не готовый управляемый API. Сегодня продукт — это веса.

  • Именно офисные агентные бенчмарки — то, что вы реально читаете. CoWorkBench и JobBench — история Qwen, а не GLM.

  • Вам нужны 6 млрд активных параметров и n-граммная таблица, которую можно держать в памяти хоста, в том числе рядом с локальной установкой Qwen3.8-27B.

  • Вы уже работаете в Qwen Chat, Qwen Studio, Qwen Code или направляете любой OpenAI-совместимый агент (OpenCode, Codex, Qwen Code) на локальный эндпоинт llama.cpp сегодня. Claude Code нужен прокси-переводчик.

Как начать работу с GLM-5.3-Flash и Qwen3.8-Flash-Next

Поверхность GLM-5.3-Flash Qwen3.8-Flash-Next
Пользовательское приложение Веб-песочница Z.ai и GLM Coding Plan Qwen Chat и Qwen Studio
Собственный API Да, Z.ai, glm-5.3-flash QwenCloud qwen3.8-flash (API скоро)
Облачные платформы Нет на Bedrock, Vertex AI или Azure AI Foundry Нет на Bedrock, Vertex AI или Azure AI Foundry
Кодирующие агенты ZCode; OpenRouter в IDE, принимающие кастомных провайдеров. Не нативно в Claude Code, GitHub Copilot или Cursor Работает сегодня через локальный llama.cpp + OpenCode; та же схема применится к QwenCloud, когда запустится. Не нативно в Claude Code, GitHub Copilot или Cursor
Сторонние роутеры OpenRouter, DeepInfra, Together.ai OpenRouter
ID модели в API glm-5.3-flash (OpenRouter: z-ai/glm-5.3-flash) qwen3.8-flash в QwenCloud и OpenRouter; веса Qwen/Qwen3.8-Flash-Next

GLM-5.3-Flash доступна к вызову уже сейчас. Qwen3.8-Flash-Next — тоже, только на вашем железе или через роутеры вроде OpenRouter. Собственный эндпоинт Qwen должен скоро последовать.

Пишите эти ID точно. У Qwen3.8-Flash-Next ID в облакеqwen3.8-flash (без «next»), так что не выдумывайте qwen3.8-flash-next по имени весов.

Первый вызов API

Обе модели поддерживают формат chat completions от OpenAI, так что можно переиспользовать стандартный клиент. Самый быстрый способ попробовать их бок о бок — OpenRouter, где обе за одним base URL, и вы меняете только строку модели.

from openai import OpenAI
import os

# One client, both models. Swap the model string on line 12 — nothing else changes.
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)
completion = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",  # or "qwen/qwen3.8-flash"
    messages=[{"role": "user", "content": "Refactor this function..."}],
    extra_body={"reasoning": {"effort": "high"}},
)
print(completion.choices[0].message.content)

Переход на собственные API лишает переносимости. Эндпоинт Z.ai живет на docs.z.ai и принимает thinking: {"type": "enabled"} с reasoning_effort, равным low, high или max. У Alibaba — enable_thinking с reasoning_effort по умолчанию xhigh, и базовым URL DashScope (international, Пекин или Вирджиния). SDK один и тот же, но регулятор рассуждения не переносим, так что заложите небольшой адаптер, если планируете переключения.

Полный разбор по Qwen — в нашем гайде как запустить Qwen3.8-Flash-Next локально и в CLI-руководстве по Qwen Code. Для локального сервинга семейства GLM используйте Run GLM-5 Locally For Agentic Coding. Если у вас уже стоит Qwen3.8-27B, наша настройка RTX 5090 — соседний локальный путь, а не это превью на 125B.

Заключение

Если вам нужно выпустить продукт на живом Flash API уже на этой неделе — используйте GLM-5.3-Flash. Если вы изучаете Qwen4 или больше доверяете CoWorkBench, чем DeepSWE, используйте локально веса Qwen3.8-Flash-Next и переключитесь на qwen3.8-flash через API, когда он выйдет.

Наиболее интересное — насколько мало расходятся прайсы. Вопрос упирается в доступность и в то, какую неопубликованную строку вы готовы игнорировать, а не в двукратную разницу в цене.

Если хотите разобраться в идеях, лежащих в основе обеих MoE, рекомендуем наш курс Large Language Models (LLMs) Concepts, затем трек AI Agent Fundamentals. Для работы с хабом и весами — практический курс Working with Hugging Face.

Вопросы и ответы

Когда стоит использовать GLM-5.3-Flash, а когда Qwen3.8-Flash-Next?

Используйте GLM-5.3-Flash, если вам нужен живой собственный API уже на этой неделе, веса под MIT-лицензией или более высокие пересекающиеся кодинговые результаты (DeepSWE v1.1 — 63,4; Toolathlon Verified — 78,4; NL2Repo — 56,3).

Используйте Qwen3.8-Flash-Next, если хотите локально запускать превью архитектуры Qwen4, иметь более эффективные 6 млрд активных параметров или применять модель в офисном агентном сценарии (CoWorkBench — 73,9; JobBench — 55,7).

Где получить доступ к GLM-5.3-Flash и Qwen3.8-Flash-Next?

GLM-5.3-Flash доступна на Z.ai как glm-5.3-flash, в GLM Coding Plan и на OpenRouter как z-ai/glm-5.3-flash. Веса — на Hugging Face под MIT-лицензией.

Веса Qwen3.8-Flash-Next доступны на Hugging Face и ModelScope. Продуктовый API — Qwen3.8-Flash в QwenCloud как qwen3.8-flash, помечен «скоро», но доступ к модели уже есть через OpenRouter. Потребительские поверхности — Qwen Chat и Qwen Studio.

Как GLM-5.3-Flash и Qwen3.8-Flash-Next сравниваются в кодинге?

На кодинговых бенчмарках, опубликованных обеими лабораториями, лидирует GLM-5.3-Flash: DeepSWE v1.1 — 63,4 против 58,7; Toolathlon Verified — 78,4 против 73,5; NL2Repo — 56,3 против 48,1. Харнессы не идентичны.

Какие ID моделей в API у GLM-5.3-Flash и Qwen3.8-Flash-Next?

GLM-5.3-Flash — это glm-5.3-flash на Z.ai и z-ai/glm-5.3-flash на OpenRouter.

Производственный ID в QwenCloud — qwen3.8-flash, а не qwen3.8-flash-next в облаке. Открытые веса — Qwen/Qwen3.8-Flash-Next.

Qwen3.8-Flash-Next — это то же самое, что Qwen3.8-Flash?

Нет. Qwen3.8-Flash-Next — превью архитектуры с открытыми весами. Qwen3.8-Flash — продуктовый SKU в QwenCloud, по $0,16 / $0,47 за 1 млн токенов, с базовым контекстом 1 млн и официальными встроенными инструментами. На 26 августа 2026 API был помечен как «скоро».

Темы

Учитесь работать с ИИ на DataCamp!

Track

Ассоциированный AI-инженер для разработчиков

26 ч
Узнайте, как интегрировать ИИ в программные приложения с помощью API и библиотек с открытым исходным кодом. Начните свой путь к профессии AI Engineer уже сегодня!
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow