Track
Qwen3.8-Flash-Next — одна из самых любопытных локальных моделей, которые я тестировал в последнее время, особенно для задач кодирования и агентного режима. Спойлер: производительность модели приятно удивила.
В этом руководстве мы запустим квантование Unsloth UD-Q4_K_XL GGUF на одном RTX PRO 6000 с 96 ГБ видеопамяти, развернём локально с помощью llama.cpp, протестируем через встроенный WebUI и, наконец, подключим к OpenCode, чтобы использовать модель как полностью локального кодирующего агента.
Что такое Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next вышла 26 августа 2026 года. Это новая модель с открытыми весами в формате Mixture-of-Experts (MoE) от команды Qwen, а также ранний предварительный просмотр архитектуры, разрабатываемой для Qwen4.
Для более детального разбора модели, включая полный бенчмарк и обзор функций, информацию о ценах и доступности, а также сравнение с моделями конкурентов, рекомендуем прочитать наш гид по Qwen3.8-Flash-Next.
Архитектура Qwen3.8-Flash-Next
Это основная MoE‑модель на 125 млрд параметров, но на токен активируется лишь около 6 млрд параметров. Дополнительно используется ещё 51 млрд параметров в n‑граммных эмбеддингах.
Архитектура вводит несколько идей, которые Qwen исследует для Qwen4:
- Gated DeltaNet + Qwen Sparse Attention (QSA) для более эффективной работы с длинным контекстом
- Gated Residual‑соединения для улучшения передачи информации между слоями
- N‑граммные эмбеддинги, которые увеличивают ёмкость модели без необходимости активного вычисления всех этих параметров

Источник: Qwen
У модели нативная длина контекстного окна 262 144 токена и теоретически его можно расширить до 1 млн токенов с помощью YaRN.
Как Qwen3.8-Flash-Next справляется с кодированием?
Она неожиданно сильна и в программировании. Вот некоторые из опубликованных командой Qwen результатов по сравнению с Qwen3.8-27B:
|
Бенчмарк |
Qwen3.8-Flash-Next |
Qwen3.8-27B |
|
DeepSWE 1.1 |
58.7 |
42.2 |
|
SWE-bench Pro |
62.5 |
61.7 |
|
SWE-bench Multilingual |
81.0 |
73.8 |
|
Toolathlon Verified |
73.5 |
67.1 |
Это внутренние оценки Qwen, так что я бы относился к ним как к данным от вендора, но они хорошо совпадают с моим опытом использования модели для кодирования.
Подготовка GPU‑сервера для Qwen3.8-Flash-Next
Я использовал RTX PRO 6000 с 96 ГБ видеопамяти, но столько VRAM необязательно.

В этом на самом деле одна из интересных особенностей Qwen3.8-Flash-Next. Поскольку llama.cpp может выгружать части модели в системную RAM, можно использовать GPU с меньшей видеопамятью, если доступно много оперативной памяти.
Квантование Unsloth UD-Q4_K_XL, которое мы используем, занимает около 111 ГБ и разбито на четыре файла GGUF.
Для моей конфигурации рекомендовал бы иметь не менее 140 ГБ совокупной доступной RAM и VRAM, чтобы хватило места для модели, контекста, KV‑кэша и накладных расходов рантайма.
Если у вас что-то вроде H200, практически всё можно держать на GPU. Я выбрал компромиссный вариант.
Начните с проверки GPU:
nvidia-smi

Вы должны увидеть свой GPU, версию драйвера, версию CUDA и доступный объём VRAM.
Далее установите необходимые пакеты:
sudo apt update
sudo apt install -y \
git \
cmake \
build-essential \
curl \
libcurl4-openssl-dev \
python3-pip
Сборка llama.cpp с поддержкой Qwen3.8-Flash-Next
Qwen3.8-Flash-Next использует новую архитектуру qwen4_exp, что сильно отличается от простого загрузки ещё одной модели Qwen3.8.
Поддержка ещё совсем свежая, поэтому я использовал ветку Qwen3.8-Flash-Next, поддерживаемую Unsloth, а не полагался на старую сборку llama.cpp, которая могла бы не распознать архитектуру. Соответствующие изменения в llama.cpp добавляют новую архитектуру qwen4exp, QSA, n‑граммные эмбеддинги и другие компоненты модели.
Перейдите в рабочую директорию:
cd /workspace
Клонируйте ветку Unsloth:
git clone \
--branch qwen4exp/qwen3.8-flash-next \
https://github.com/unslothai/llama.cpp.git
Перейдите в каталог:
cd llama.cpp
Соберите llama.cpp с поддержкой CUDA:
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_BUILD_TYPE=Release
cmake --build build \
--config Release \
-j"$(nproc)"
В конце убедитесь, что llama-server собран корректно:
./build/bin/llama-server --version
Моя сборка вернула:
version: 0.3.0-dev (build 10656, commit 035e22731)
built with GNU 13.3.0 for Linux x86_64
Загрузка модели Qwen3.8-Flash-Next в формате GGUF
Загрузка модели оказалась одной из самых неприятных частей этого процесса.
Сначала попробовал ModelScope, но скорость была невысокой. На Hugging Face изначально скорость была нормальной, а затем внезапно упала до килобайт в секунду.
Hugging Face теперь использует бэкенд Xet для загрузки больших моделей и обычно автоматически включает адаптивную конкуррентность. Также предусмотрена переменная HF_HUB_DISABLE_XET для отключения Xet при проблемах.
В моём случае отключение Xet и параллельная загрузка четырёх шардов GGUF сработали гораздо лучше.
Установите CLI Hugging Face:
pip install -U huggingface_hub
Отключите Xet для этой загрузки:
export HF_HUB_DISABLE_XET=1
unset HF_XET_HIGH_PERFORMANCE
unset HF_XET_NUM_CONCURRENT_RANGE_GETS
unset HF_HUB_ENABLE_HF_TRANSFER
HF_HUB_ENABLE_HF_TRANSFER теперь всё равно устарела, поскольку Hugging Face перевёл крупные передачи на Xet.
Создайте каталог для модели:
cd /workspace
mkdir -p Qwen3.8-Flash-Next-GGUF
Теперь загрузите все четыре шарда параллельно:
for i in 1 2 3 4; do
shard=$(printf "%05d" "$i")
hf download unsloth/Qwen3.8-Flash-Next-GGUF \
"UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-${shard}-of-00004.gguf" \
--local-dir Qwen3.8-Flash-Next-GGUF &
done
wait

Полный квант UD-Q4_K_XL составляет примерно 111 ГБ.
Запуск Qwen3.8-Flash-Next с llama.cpp
Вернитесь в каталог llama.cpp:
cd /workspace/llama.cpp
Запустите сервер:
./build/bin/llama-server \
-m /workspace/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
--alias qwen3.8-flash-next \
--host 0.0.0.0 \
--port 8080 \
--ctx-size 131072 \
--parallel 1 \
--flash-attn on \
--fit on \
--fit-target 4096 \
--jinja \
--batch-size 1024 \
--ubatch-size 512 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0

Я намеренно использовал контекстное окно на 131 072 токена вместо полного нативного 262K.
Для кодирующих агентов 131K уже огромно и даёт OpenCode достаточно места для исходников, вывода инструментов, логов терминала и длинных диалогов, не тратя лишнюю память на контекст, который, вероятно, не понадобится.
Важные параметры здесь:
-
--fit onпозволяет llama.cpp автоматически определить, какая часть модели должна находиться на GPU. -
--fit-target 4096указывает оставить около 4 ГБ видеопамяти свободными, что даёт рантайму запас по памяти вместо работы вплотную к лимиту VRAM. В llama.cpp официально поддерживается автоматический подбор и настраиваемый запас по памяти. -
Параметры сэмплинга тоже не случайны. Qwen рекомендует
temperature=1.0,top_p=0.95,top_k=20иmin_p=0.0при использовании модели в режиме рассуждений.

Даже после загрузки всей модели осталось достаточно памяти: примерно 13 ГБ VRAM доступны для контекста, KV‑кэша и других приложений.
Тестирование сервера Qwen3.8-Flash-Next с помощью CURL
llama-server предоставляет API, совместимый с OpenAI.
Проверьте доступные модели:
curl http://127.0.0.1:8080/v1/models
Вы должны увидеть qwen3.8-flash-next.
Теперь протестируем генерацию ответа:
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next",
"messages": [
{
"role": "user",
"content": "Write a Python function that checks whether a number is prime."
}
]
}'
Если вы получили валидный ответ, локальный сервер готов.

На моей системе изначально было около 80 токенов в секунду, что удивило, учитывая, что часть модели находилась в системной RAM.
По мере роста контекста скорость снижалась ближе к 64 токенам в секунду.
Для модели такого размера это всё ещё очень комфортно, и архитектура помогает объяснить почему. Хотя у модели 125 млрд основных параметров, на токен активны лишь около 6 млрд.
Тестирование Qwen3.8-Flash-Next через WebUI llama.cpp
Одна из вещей, которая мне действительно нравится в llama.cpp, — llama-server сразу предоставляет простой WebUI.
Откройте http://localhost:8080. Если всё работает корректно, модель уже должна быть доступна.

Для первого серьёзного теста я попросил её создать полноценный сайт ИТ‑департамента государственного учреждения за один проход:
Create a modern, professional government IT department portfolio website in a single index.html file.
Use HTML, CSS, and JavaScript featuring a clean official design and responsive layout with smooth animations, interactive elements, and accessible government-style navigation.
It should display department overview, key services, digital transformation projects, achievements, technology initiatives, statistics, leadership/team section, latest updates, contact information,

Это была довольно большая генерация. Модель потратила много токенов на размышления, затем сгенерировала целый сайт в одном HTML‑файле. Это заняло примерно 13 минут, и скорость постепенно падала по мере роста контекста.
Но результат оказался гораздо лучше ожидаемого.

Там были графики, анимации, вкладки, разные секции, адаптивные стили, JavaScript‑интеракции и на удивление отполированный общий макет.

Интересно, что это была по сути генерация «с одного захода». Я не просил явно добавлять многие из этих мелких деталей.
В этот момент стало ясно, что модель особенно хороша для задач кодирования, где ей дают некоторую свободу, а не расписывают каждый нюанс реализации.
Подключение Qwen3.8-Flash-Next к OpenCode
Чат — это хорошо, но в основном я хотел протестировать Qwen3.8-Flash-Next как агентную модель для кодирования.
Для этого я использовал OpenCode. Сначала установите его:
curl -fsSL https://opencode.ai/install | bash
Перезапустите терминал и проверьте установку:
opencode --version
В моём случае это была версия 1.18.23.
Теперь создайте конфигурацию OpenCode:
mkdir -p ~/.config/opencode
Добавьте локального провайдера llama.cpp, которого мы собрали ранее:
printf '%s\n' '{"$schema":"https://opencode.ai/config.json","model":"llama.cpp/qwen3.8-flash-next","provider":{"llama.cpp":{"npm":"@ai-sdk/openai-compatible","name":"Qwen3.8 Flash Next Local","options":{"baseURL":"http://127.0.0.1:8080/v1"},"models":{"qwen3.8-flash-next":{"name":"Qwen3.8 Flash Next","limit":{"context":65536,"output":32768}}}}}}' > ~/.config/opencode/opencode.json
Самое важное — http://127.0.0.1:8080/v1.
OpenCode поддерживает кастомных провайдеров с OpenAI‑совместимым API через @ai-sdk/openai-compatible, что делает подключение llama.cpp очень простым.
Я задал для OpenCode рабочий контекст 65K, хотя на самом сервере llama.cpp доступно 131K.
Это оставляет хороший запас для длинных ответов и не позволяет агентским сессиям слишком агрессивно занимать всё серверное контекстное окно.
Использование Qwen3.8-Flash-Next как локального кодирующего агента
Перейдите в каталог проекта и запустите OpenCode:
cd /workspace/my-project
opencode

Теперь можно давать модели обычные агентные задачи по разработке. Например, я поручил Qwen собрать аналитическую панель:
Build a modern system analytics and task-management dashboard.
It should monitor CPU, RAM, VRAM, GPU usage, temperatures, disk usage, running processes, and temporary files.
Users should be able to safely terminate tasks, free unused RAM/VRAM, clear caches, and clean temporary files from one interface.

Модель начала с составления плана и списка задач, прежде чем приступить к написанию кода.

Через несколько минут появился первый рабочий дашборд. Первый UI мне не особо понравился: он был слишком «растянут», и было несколько проблем с удобством использования.
Поэтому я просто описал агенту, что именно не нравится, и попросил перестроить интерфейс в более компактный командный центр системы.
Вторая версия оказалась значительно лучше.

В итоге получилась компактная панель, где можно в реальном времени отслеживать использование CPU, RAM, VRAM, GPU, хранилища, сетевую активность и запущенные процессы. Также добавлены элементы управления для очистки кэшей, удаления временных файлов и управления процессами.
Интересно, как Qwen подходила к реализации. Я тестировал её на двух разных приложениях, и модель часто предпочитала простой ванильный HTML, CSS и JavaScript вместо того, чтобы сразу устанавливать React, пакеты Node или другой тяжёлый фреймворк.
Мне такое поведение понравилось. Если я не указывал фреймворк, модель старалась найти самую простую архитектуру, решающую задачу, вместо добавления лишних зависимостей.
Минус — она не спешит. Много рассуждений, много сгенерированных токенов и иногда немало отладки. Хорошо ощущается, как модель тратит токены на продумывание решения.
Но итоговые проекты в целом казались гораздо более завершёнными, чем обычно получается у меньших локальных моделей.
Итоги
После тестов Qwen3.8-Flash-Next на генерации сайтов и в агентном кодировании считаю, что это заметный шаг вперёд относительно Qwen3.8-27B. Главное отличие — в подходе к проектам. Модель больше внимания уделяет структуре, деталям и практической реализации, а не просто генерирует код. Если вы заинтересованы в локальном запуске этой модели, прочитайте наш туториал по Qwen3.8-27B.
Мне также понравилось, что она часто опирается на простой HTML, CSS, JavaScript и Python, а не добавляет лишние фреймворки и зависимости.
Основной минус — размер. UD-Q4_K_XL GGUF — около 111 ГБ, и модель может использовать много токенов на рассуждения и вывод, особенно при отладке.
В остальном настройка оказалась удивительно простой. Если у вас достаточно RAM и VRAM, Qwen3.8-Flash-Next — одна из самых сильных локальных моделей для кодирования из тех, что я тестировал.
FAQs
Какое оборудование нужно, чтобы запустить Qwen3.8-Flash-Next локально?
По таблице оборудования Unsloth, самая маленькая 1-битная квантовка занимает 75 ГБ, а 4-битная — 112 ГБ, измеряется как суммарная память (видеопамять и системная RAM вместе, либо унифицированная память на Mac). Вам не нужен GPU на 96 ГБ: llama.cpp делит модель между VRAM и RAM, так что подойдёт и видеокарта поменьше при достаточном объёме системной памяти — просто выгруженная часть будет работать медленнее.
Какую квантовку Qwen3.8-Flash-Next выбрать?
UD-Q4_K_XL — оптимальный вариант около 111,3 ГБ, он сохраняет примерно 93% совпадения по топ‑токенам с моделью полной точности. Если у вас ограничена память, UD-IQ4_XS (93,7 ГБ) и UD-Q3_K_XL (90 ГБ) остаются выше 90%, а UD-IQ1_S удерживает 80% при 72,5 ГБ. Учтите, что низкобитные кванты крупнее, чем можно ожидать для модели на 125B параметров, потому что слои n‑граммных эмбеддингов никогда не квантуются ниже 4 бит.
Можно ли использовать Qwen3.8-Flash-Next с Claude Code или Codex вместо OpenCode?
Да — для любых инструментов, которые принимают кастомный OpenAI‑совместимый base URL. Укажите http://127.0.0.1:8080/v1 и используйте тот --alias, который вы задали серверу, как ID модели. Claude Code ожидает запросы в формате Anthropic, поэтому ему нужен прокси‑транслятор, а не простая замена base‑URL. Вне зависимости от агента, задайте явный лимит контекста ниже серверного --ctx-size, чтобы длинные сессии не выходили за его рамки.
Как не дать Qwen3.8-Flash-Next тратить так много токенов на «размышления»?
По умолчанию усилие на рассуждения — xhigh. Передайте --chat-template-kwargs '{"reasoning_effort":"medium"}' в llama-server, чтобы снизить его; доступны также low и none. Модель по умолчанию сохраняет следы рассуждений из предыдущих ходов (preserve thinking), поэтому установка preserve_thinking в false ещё больше сокращает расход токенов в длинных агентных сессиях.