Перейти к основному контенту

Как запустить Qwen3.8-Flash-Next локально как кодирующего агента с OpenCode

Узнайте, как запустить Qwen3.8-Flash-Next в формате GGUF локально с llama.cpp на RTX PRO 6000, а затем подключить его к OpenCode для полностью локальной агентной разработки кода.
Обновлено 28 авг. 2026 г.  · 8 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

Qwen3.8-Flash-Next — одна из самых любопытных локальных моделей, которые я тестировал в последнее время, особенно для задач кодирования и агентного режима. Спойлер: производительность модели приятно удивила.

В этом руководстве мы запустим квантование Unsloth UD-Q4_K_XL GGUF на одном RTX PRO 6000 с 96 ГБ видеопамяти, развернём локально с помощью llama.cpp, протестируем через встроенный WebUI и, наконец, подключим к OpenCode, чтобы использовать модель как полностью локального кодирующего агента.

Что такое Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next вышла 26 августа 2026 года. Это новая модель с открытыми весами в формате Mixture-of-Experts (MoE) от команды Qwen, а также ранний предварительный просмотр архитектуры, разрабатываемой для Qwen4.

Для более детального разбора модели, включая полный бенчмарк и обзор функций, информацию о ценах и доступности, а также сравнение с моделями конкурентов, рекомендуем прочитать наш гид по Qwen3.8-Flash-Next.

Архитектура Qwen3.8-Flash-Next

Это основная MoE‑модель на 125 млрд параметров, но на токен активируется лишь около 6 млрд параметров. Дополнительно используется ещё 51 млрд параметров в n‑граммных эмбеддингах.

Архитектура вводит несколько идей, которые Qwen исследует для Qwen4:

  • Gated DeltaNet + Qwen Sparse Attention (QSA) для более эффективной работы с длинным контекстом
  • Gated Residual‑соединения для улучшения передачи информации между слоями
  • N‑граммные эмбеддинги, которые увеличивают ёмкость модели без необходимости активного вычисления всех этих параметров

Схема архитектуры Qwen3.8-Flash-Next

Источник: Qwen 

У модели нативная длина контекстного окна 262 144 токена и теоретически его можно расширить до 1 млн токенов с помощью YaRN.

Как Qwen3.8-Flash-Next справляется с кодированием?

Она неожиданно сильна и в программировании. Вот некоторые из опубликованных командой Qwen результатов по сравнению с Qwen3.8-27B:

Бенчмарк

Qwen3.8-Flash-Next

Qwen3.8-27B

DeepSWE 1.1

58.7

42.2

SWE-bench Pro

62.5

61.7

SWE-bench Multilingual

81.0

73.8

Toolathlon Verified

73.5

67.1

Это внутренние оценки Qwen, так что я бы относился к ним как к данным от вендора, но они хорошо совпадают с моим опытом использования модели для кодирования.

Подготовка GPU‑сервера для Qwen3.8-Flash-Next

Я использовал RTX PRO 6000 с 96 ГБ видеопамяти, но столько VRAM необязательно.

Развёртывание пода RTX Pro 6000 Pytorch в RunPod

В этом на самом деле одна из интересных особенностей Qwen3.8-Flash-Next. Поскольку llama.cpp может выгружать части модели в системную RAM, можно использовать GPU с меньшей видеопамятью, если доступно много оперативной памяти.

Квантование Unsloth UD-Q4_K_XL, которое мы используем, занимает около 111 ГБ и разбито на четыре файла GGUF.

Для моей конфигурации рекомендовал бы иметь не менее 140 ГБ совокупной доступной RAM и VRAM, чтобы хватило места для модели, контекста, KV‑кэша и накладных расходов рантайма.

Если у вас что-то вроде H200, практически всё можно держать на GPU. Я выбрал компромиссный вариант. 

Начните с проверки GPU:

nvidia-smi

Сводка по GPU RTX PRO 6000

Вы должны увидеть свой GPU, версию драйвера, версию CUDA и доступный объём VRAM.

Далее установите необходимые пакеты:

sudo apt update

sudo apt install -y \
  git \
  cmake \
  build-essential \
  curl \
  libcurl4-openssl-dev \
  python3-pip

Сборка llama.cpp с поддержкой Qwen3.8-Flash-Next

Qwen3.8-Flash-Next использует новую архитектуру qwen4_exp, что сильно отличается от простого загрузки ещё одной модели Qwen3.8.

Поддержка ещё совсем свежая, поэтому я использовал ветку Qwen3.8-Flash-Next, поддерживаемую Unsloth, а не полагался на старую сборку llama.cpp, которая могла бы не распознать архитектуру. Соответствующие изменения в llama.cpp добавляют новую архитектуру qwen4exp, QSA, n‑граммные эмбеддинги и другие компоненты модели.

Перейдите в рабочую директорию:

cd /workspace

Клонируйте ветку Unsloth:

git clone \
  --branch qwen4exp/qwen3.8-flash-next \
  https://github.com/unslothai/llama.cpp.git

Перейдите в каталог:

cd llama.cpp

Соберите llama.cpp с поддержкой CUDA:

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_BUILD_TYPE=Release

cmake --build build \
  --config Release \
  -j"$(nproc)"

В конце убедитесь, что llama-server собран корректно:

./build/bin/llama-server --version

Моя сборка вернула:

version: 0.3.0-dev (build 10656, commit 035e22731)
built with GNU 13.3.0 for Linux x86_64

Загрузка модели Qwen3.8-Flash-Next в формате GGUF

Загрузка модели оказалась одной из самых неприятных частей этого процесса.

Сначала попробовал ModelScope, но скорость была невысокой. На Hugging Face изначально скорость была нормальной, а затем внезапно упала до килобайт в секунду.

Hugging Face теперь использует бэкенд Xet для загрузки больших моделей и обычно автоматически включает адаптивную конкуррентность. Также предусмотрена переменная HF_HUB_DISABLE_XET для отключения Xet при проблемах.

В моём случае отключение Xet и параллельная загрузка четырёх шардов GGUF сработали гораздо лучше.

Установите CLI Hugging Face:

pip install -U huggingface_hub

Отключите Xet для этой загрузки:

export HF_HUB_DISABLE_XET=1
unset HF_XET_HIGH_PERFORMANCE
unset HF_XET_NUM_CONCURRENT_RANGE_GETS
unset HF_HUB_ENABLE_HF_TRANSFER

HF_HUB_ENABLE_HF_TRANSFER теперь всё равно устарела, поскольку Hugging Face перевёл крупные передачи на Xet.

Создайте каталог для модели:

cd /workspace
mkdir -p Qwen3.8-Flash-Next-GGUF

Теперь загрузите все четыре шарда параллельно:

for i in 1 2 3 4; do
  shard=$(printf "%05d" "$i")

  hf download unsloth/Qwen3.8-Flash-Next-GGUF \
    "UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-${shard}-of-00004.gguf" \
    --local-dir Qwen3.8-Flash-Next-GGUF &
done

wait

Downloading the Qwen3.8-Flash-Next GGUF Model

Полный квант UD-Q4_K_XL составляет примерно 111 ГБ.

Запуск Qwen3.8-Flash-Next с llama.cpp

Вернитесь в каталог llama.cpp:

cd /workspace/llama.cpp

Запустите сервер:

./build/bin/llama-server \
  -m /workspace/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
  --alias qwen3.8-flash-next \
  --host 0.0.0.0 \
  --port 8080 \
  --ctx-size 131072 \
  --parallel 1 \
  --flash-attn on \
  --fit on \
  --fit-target 4096 \
  --jinja \
  --batch-size 1024 \
  --ubatch-size 512 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0

Running Qwen3.8-Flash-Next with llama.cpp

Я намеренно использовал контекстное окно на 131 072 токена вместо полного нативного 262K.

Для кодирующих агентов 131K уже огромно и даёт OpenCode достаточно места для исходников, вывода инструментов, логов терминала и длинных диалогов, не тратя лишнюю память на контекст, который, вероятно, не понадобится.

Важные параметры здесь:

  1. --fit on позволяет llama.cpp автоматически определить, какая часть модели должна находиться на GPU.

  2. --fit-target 4096 указывает оставить около 4 ГБ видеопамяти свободными, что даёт рантайму запас по памяти вместо работы вплотную к лимиту VRAM. В llama.cpp официально поддерживается автоматический подбор и настраиваемый запас по памяти.

  3. Параметры сэмплинга тоже не случайны. Qwen рекомендует temperature=1.0, top_p=0.95, top_k=20 и min_p=0.0 при использовании модели в режиме рассуждений.

Сводка по GPU после загрузки модели Qwen3.8-Flash-Next в видеопамять

Даже после загрузки всей модели осталось достаточно памяти: примерно 13 ГБ VRAM доступны для контекста, KV‑кэша и других приложений.

Тестирование сервера Qwen3.8-Flash-Next с помощью CURL

llama-server предоставляет API, совместимый с OpenAI.

Проверьте доступные модели:

curl http://127.0.0.1:8080/v1/models

Вы должны увидеть qwen3.8-flash-next.

Теперь протестируем генерацию ответа:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next",
    "messages": [
      {
        "role": "user",
        "content": "Write a Python function that checks whether a number is prime."
      }
    ]
  }'

Если вы получили валидный ответ, локальный сервер готов.

Testing the Qwen3.8-Flash-Next using CURL

На моей системе изначально было около 80 токенов в секунду, что удивило, учитывая, что часть модели находилась в системной RAM.

По мере роста контекста скорость снижалась ближе к 64 токенам в секунду.

Для модели такого размера это всё ещё очень комфортно, и архитектура помогает объяснить почему. Хотя у модели 125 млрд основных параметров, на токен активны лишь около 6 млрд.

Тестирование Qwen3.8-Flash-Next через WebUI llama.cpp

Одна из вещей, которая мне действительно нравится в llama.cpp, — llama-server сразу предоставляет простой WebUI.

Откройте http://localhost:8080. Если всё работает корректно, модель уже должна быть доступна.

Testing the Qwen3.8-Flash-Next using llama.cpp WebUI

Для первого серьёзного теста я попросил её создать полноценный сайт ИТ‑департамента государственного учреждения за один проход:

Create a modern, professional government IT department portfolio website in a single index.html file.
Use HTML, CSS, and JavaScript featuring a clean official design and responsive layout with smooth animations, interactive elements, and accessible government-style navigation.
It should display department overview, key services, digital transformation projects, achievements, technology initiatives, statistics, leadership/team section, latest updates, contact information, 

Testing the Qwen3.8-Flash-Next using llama.cpp WebUI

Это была довольно большая генерация. Модель потратила много токенов на размышления, затем сгенерировала целый сайт в одном HTML‑файле. Это заняло примерно 13 минут, и скорость постепенно падала по мере роста контекста.

Но результат оказался гораздо лучше ожидаемого.

image10.png

Там были графики, анимации, вкладки, разные секции, адаптивные стили, JavaScript‑интеракции и на удивление отполированный общий макет.

image6.png

Интересно, что это была по сути генерация «с одного захода». Я не просил явно добавлять многие из этих мелких деталей.

В этот момент стало ясно, что модель особенно хороша для задач кодирования, где ей дают некоторую свободу, а не расписывают каждый нюанс реализации.

Подключение Qwen3.8-Flash-Next к OpenCode

Чат — это хорошо, но в основном я хотел протестировать Qwen3.8-Flash-Next как агентную модель для кодирования.

Для этого я использовал OpenCode. Сначала установите его:

curl -fsSL https://opencode.ai/install | bash

Перезапустите терминал и проверьте установку:

opencode --version

В моём случае это была версия 1.18.23.

Теперь создайте конфигурацию OpenCode:

mkdir -p ~/.config/opencode

Добавьте локального провайдера llama.cpp, которого мы собрали ранее:

printf '%s\n' '{"$schema":"https://opencode.ai/config.json","model":"llama.cpp/qwen3.8-flash-next","provider":{"llama.cpp":{"npm":"@ai-sdk/openai-compatible","name":"Qwen3.8 Flash Next Local","options":{"baseURL":"http://127.0.0.1:8080/v1"},"models":{"qwen3.8-flash-next":{"name":"Qwen3.8 Flash Next","limit":{"context":65536,"output":32768}}}}}}' > ~/.config/opencode/opencode.json

Самое важное — http://127.0.0.1:8080/v1

OpenCode поддерживает кастомных провайдеров с OpenAI‑совместимым API через @ai-sdk/openai-compatible, что делает подключение llama.cpp очень простым.

Я задал для OpenCode рабочий контекст 65K, хотя на самом сервере llama.cpp доступно 131K.

Это оставляет хороший запас для длинных ответов и не позволяет агентским сессиям слишком агрессивно занимать всё серверное контекстное окно.

Использование Qwen3.8-Flash-Next как локального кодирующего агента

Перейдите в каталог проекта и запустите OpenCode:

cd /workspace/my-project
opencode

Qwen3.8-Flash-Next интегрирован в OpenCode

Теперь можно давать модели обычные агентные задачи по разработке. Например, я поручил Qwen собрать аналитическую панель:

Build a modern system analytics and task-management dashboard. 
It should monitor CPU, RAM, VRAM, GPU usage, temperatures, disk usage, running processes, and temporary files. 
Users should be able to safely terminate tasks, free unused RAM/VRAM, clear caches, and clean temporary files from one interface.

Testing the Qwen3.8-Flash-Next in OpenCode

Модель начала с составления плана и списка задач, прежде чем приступить к написанию кода.

Testing the Qwen3.8-Flash-Next in OpenCode

Через несколько минут появился первый рабочий дашборд. Первый UI мне не особо понравился: он был слишком «растянут», и было несколько проблем с удобством использования.

Поэтому я просто описал агенту, что именно не нравится, и попросил перестроить интерфейс в более компактный командный центр системы.

Вторая версия оказалась значительно лучше.

Панель, сгенерированная Qwen3.8-Flash-Next

В итоге получилась компактная панель, где можно в реальном времени отслеживать использование CPU, RAM, VRAM, GPU, хранилища, сетевую активность и запущенные процессы. Также добавлены элементы управления для очистки кэшей, удаления временных файлов и управления процессами.

Интересно, как Qwen подходила к реализации. Я тестировал её на двух разных приложениях, и модель часто предпочитала простой ванильный HTML, CSS и JavaScript вместо того, чтобы сразу устанавливать React, пакеты Node или другой тяжёлый фреймворк.

Мне такое поведение понравилось. Если я не указывал фреймворк, модель старалась найти самую простую архитектуру, решающую задачу, вместо добавления лишних зависимостей.

Минус — она не спешит. Много рассуждений, много сгенерированных токенов и иногда немало отладки. Хорошо ощущается, как модель тратит токены на продумывание решения.

Но итоговые проекты в целом казались гораздо более завершёнными, чем обычно получается у меньших локальных моделей.

Итоги

После тестов Qwen3.8-Flash-Next на генерации сайтов и в агентном кодировании считаю, что это заметный шаг вперёд относительно Qwen3.8-27B. Главное отличие — в подходе к проектам. Модель больше внимания уделяет структуре, деталям и практической реализации, а не просто генерирует код. Если вы заинтересованы в локальном запуске этой модели, прочитайте наш туториал по Qwen3.8-27B.

Мне также понравилось, что она часто опирается на простой HTML, CSS, JavaScript и Python, а не добавляет лишние фреймворки и зависимости.

Основной минус — размер. UD-Q4_K_XL GGUF — около 111 ГБ, и модель может использовать много токенов на рассуждения и вывод, особенно при отладке.

В остальном настройка оказалась удивительно простой. Если у вас достаточно RAM и VRAM, Qwen3.8-Flash-Next — одна из самых сильных локальных моделей для кодирования из тех, что я тестировал.

FAQs

Какое оборудование нужно, чтобы запустить Qwen3.8-Flash-Next локально?

По таблице оборудования Unsloth, самая маленькая 1-битная квантовка занимает 75 ГБ, а 4-битная — 112 ГБ, измеряется как суммарная память (видеопамять и системная RAM вместе, либо унифицированная память на Mac). Вам не нужен GPU на 96 ГБ: llama.cpp делит модель между VRAM и RAM, так что подойдёт и видеокарта поменьше при достаточном объёме системной памяти — просто выгруженная часть будет работать медленнее.

Какую квантовку Qwen3.8-Flash-Next выбрать?

UD-Q4_K_XL — оптимальный вариант около 111,3 ГБ, он сохраняет примерно 93% совпадения по топ‑токенам с моделью полной точности. Если у вас ограничена память, UD-IQ4_XS (93,7 ГБ) и UD-Q3_K_XL (90 ГБ) остаются выше 90%, а UD-IQ1_S удерживает 80% при 72,5 ГБ. Учтите, что низкобитные кванты крупнее, чем можно ожидать для модели на 125B параметров, потому что слои n‑граммных эмбеддингов никогда не квантуются ниже 4 бит.

Можно ли использовать Qwen3.8-Flash-Next с Claude Code или Codex вместо OpenCode?

Да — для любых инструментов, которые принимают кастомный OpenAI‑совместимый base URL. Укажите http://127.0.0.1:8080/v1 и используйте тот --alias, который вы задали серверу, как ID модели. Claude Code ожидает запросы в формате Anthropic, поэтому ему нужен прокси‑транслятор, а не простая замена base‑URL. Вне зависимости от агента, задайте явный лимит контекста ниже серверного --ctx-size, чтобы длинные сессии не выходили за его рамки.

Как не дать Qwen3.8-Flash-Next тратить так много токенов на «размышления»?

По умолчанию усилие на рассуждения — xhigh. Передайте --chat-template-kwargs '{"reasoning_effort":"medium"}' в llama-server, чтобы снизить его; доступны также low и none. Модель по умолчанию сохраняет следы рассуждений из предыдущих ходов (preserve thinking), поэтому установка preserve_thinking в false ещё больше сокращает расход токенов в длинных агентных сессиях.

Темы

Изучайте ИИ с DataCamp!

Track

Ассоциированный AI-инженер для разработчиков

26 ч
Узнайте, как интегрировать ИИ в программные приложения с помощью API и библиотек с открытым исходным кодом. Начните свой путь к профессии AI Engineer уже сегодня!
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow