Tracks
Qwen3.8-27B 正迅速成为本地 AI 中最受欢迎的模型之一。尽管只有 270 亿参数,它在编码、推理、智能体与通用基准上展现的性能可与体量更大的模型相竞争。在多个方面它甚至正在逼近诸如 GLM-5.2 等模型,这使得它在尝试强大本地硬件的人群中尤为受欢迎。
RTX 5090 与 Qwen3.8-27B 天生契合,因为其 Blackwell 架构支持 NVFP4,既能保持较高输出质量,又能以极高速度运行。结合通过 多 token 预测(MTP)实现的推测解码、优化过的 llama.cpp 构建以及合适的 GGUF 模型,Qwen3.8-27B 在单张 RTX 5090 上可轻松超过每秒 100 个 token。
在本指南中,我们将搭建我认为在 RTX 5090 或其他 Blackwell GPU 上实现速度、准确性与长上下文支持三者平衡的最简单方案之一。我们将编译带原生 Blackwell 支持的 llama.cpp,下载 Qwen3.8-27B 的 NVFP4-MTP GGUF,在 GPU 加速与 MTP 推测解码下运行,测试其兼容 OpenAI 的 API 与内置网页界面,最后将其连接至 Pi,从而把 Qwen3.8-27B 用作完全本地的编码智能体。
1. 为 Blackwell GPU 配置 llama.cpp
首先,确保 GPU 被正确识别,并检查 NVIDIA 驱动与 CUDA 版本。
nvidia-smi
您应能看到 RTX 5090、驱动版本、CUDA 版本、GPU 显存及当前 GPU 使用情况。
注意:该配置专为 NVIDIA Blackwell GPU(如 RTX 5090)设计。下方的构建目标为 SM120,即 RTX 5090 所用的计算架构。
接下来,我们将下载并编译最新的、带 CUDA 支持的 llama.cpp。
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

此处的关键是 -DCMAKE_CUDA_ARCHITECTURES=120。这会指示 llama.cpp 针对 RTX 5090 使用的 Blackwell 架构进行构建。
构建完成后,我们将把 llama-server 放到全局路径,以便在任意目录运行:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
现在,检查一切是否正常:
llama-server --version
您应会看到类似如下的输出:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
就这样。我们已获得一个启用 CUDA 的 llama.cpp 构建,可利用 RTX 5090 及其原生 Blackwell NVFP4 支持。
2. 下载 Qwen3.8-27B NVFP4-MTP 模型
现在我们来下载 Qwen3.8-27B 模型。
首先,安装 Hugging Face CLI:
pip install -U huggingface_hub
创建一个用于存放模型的文件夹:
mkdir -p /workspace/models/qwen38
然后下载 NVFP4-MTP GGUF:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

这是我们在本次配置中所需的版本,因为它使用 NVFP4 并包含 MTP 支持,而后者正是 RTX 5090 上速度大幅提升的主要来源之一。
3. 启动 Qwen3.8-27B 服务器
有趣的部分来了。我们将把 Qwen3.8-27B 完全部署在 GPU 上,并启用 Flash Attention、131K 上下文窗口与 MTP 推测解码,以实现更快的生成速度。
运行:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
这里有不少选项,但大多都是为了充分发挥 5090 的性能。
需要重点了解的是:
-
--ctx-size 131072约等于 131K 的上下文窗口。 -
--n-gpu-layers all将模型完全放在 GPU 上。 -
--flash-attn on启用 Flash Attention。 -
--cache-type-k q8_0与--cache-type-v q8_0有助于降低 KV 缓存的内存占用。 -
--spec-type draft-mtp启用 Qwen3.8 的 MTP 推测解码。 -
--spec-draft-n-max 4控制 MTP 一次可生成的推测 token 数量。
在本次配置中,我们以 n-max 4 作为 RTX 5090 的起点。您也可以尝试 2(该 GGUF 的模型卡推荐)或 3 等数值,因为最快的设置可能会随您的系统略有不同。
当 llama-server 加载模型完成后,Qwen3.8 将可通过 http://127.0.0.1:8910 在本地访问。

我们现在已在本地运行 Qwen3.8-27B。接下来,将通过 API 与内置浏览器界面对模型进行测试。
4. 测试 Qwen3.8-27B 的速度与编码表现
在服务器运行的情况下,打开另一个终端,向兼容 OpenAI 的 API 发送测试请求:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

在此测试中,Qwen3.8-27B 以每秒 122 个 token 的速度生成了 2,000 个 token,MTP 接受率高达 84.9%。
llama.cpp 也包含浏览器界面,您无需通过 API 即可测试模型。
在浏览器中打开 http://127.0.0.1:8910 查看界面。

更复杂的测试中,我使用了以下提示词:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

在我的 RTX 5090 上,平均速度约为每秒 142 个 token,峰值有时可达每秒约 170 个 token,这对于在本地运行的 270 亿参数模型而言非常快。

Qwen3.8-27B 生成了一个打磨良好、可即开即用的完整网站。这是快速测试模型编码能力与本地环境速度的一个好办法。
5. 将 Qwen3.8-27B 与 Pi 搭配使用
在本节中,我们将把 Qwen3.8-27B 连接到 Pi,将其用作完全本地的编码智能体。
Pi 是一个轻量级、基于终端的编码智能体,可帮助您直接在命令行中构建、编辑、测试与调试项目。
使用以下命令安装 Pi:
curl -fsSL https://pi.dev/install.sh | sh
安装程序需要 Node.js 与 npm。它会将 Pi 安装到全局 npm 前缀。如果您尚未安装 Node,请先通过 nvm 或包管理器安装。
安装完成后,请重启终端。
接下来,安装 pi-llama 扩展,并将 Pi 指向我们的本地 llama.cpp 服务器:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
创建一个新项目并启动 Pi:
mkdir new-project
cd new-project
Pi

在 Pi 内运行 /model,搜索 llama-cpp 并选择 Qwen3.8-27B。
用于测试,我给出了如下提示词:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

它在几分钟内就构建了整个项目。

随后我让它启动服务器并测试前端与应用逻辑。它花了更多时间进行调试与测试,以确保一切正常运行。

当我亲自测试该仪表板时,应用运行良好,图表效果出色,整体体验也很流畅。

主要的短板在于精确的 UI 改动。经过多次追问后,它开始做一些无关调整,而不是准确理解我的需求,所以我就此作罢。
结语
Qwen3.8-27B 仍然非常新,社区正在积极探索量化与推测解码的最佳组合。MTP 表现极佳,但诸如 DFlash 2 和 DSpark 等新方法也在测试中,部分用户根据硬件与负载类型反馈了更高速度。
Unsloth 也刚刚为 Qwen3.8-27B 发布了 Dynamic v3.0 GGUF,声称在相同模型大小下相比此前的量化精度提升约 10%。如果您希望在保持大致相同本地推理配置的同时提升质量,Unsloth 也是非常有意思的选择。
就目前而言,我认为 NVFP4 + MTP + llama.cpp 是 RTX 5090 上最简单且最快的方案之一。用 270 亿参数模型在保持大上下文窗口与足够能力以运行真实编码智能体的同时,做到每秒约 140 个 token,已相当令人印象深刻。随着 llama.cpp、Unsloth、DFlash 2 与 DSpark 的持续改进,该方案可能还会更快。
本地运行 Qwen3.8-27B 的常见问题
本地运行 Qwen3.8-27B 是否必须使用 RTX 5090?
不需要。Qwen3.8-27B 的标准 4 位 GGUF 量化约占用 16–19 GB 显存,因此 RTX 5080、4090 或 24 GB 的 Mac 都能运行该模型。对于本文特定方案,RTX 5090 之所以重要,是因为 NVFP4 需要 Blackwell 张量核心。在旧卡上,NVFP4 文件可以运行,但只能带来显存节省,而不能带来加速。
该配置实际会用掉多少显存?
NVFP4-MTP GGUF 本体在磁盘上约 19 GB,随着上下文增长,推高总占用的是 KV 缓存。使用 q8_0 的 K/V 量化并在超长上下文下,已公开的 RTX 5090 运行通常落在 20 多 GB,因此 32 GB 显卡更从容。若是 24 GB,您需要将 --ctx-size 大幅降至低于 131072。
MTP 推测解码的作用是什么?它是无损的吗?
Qwen3.8 的 GGUF 内置多 token 预测层,充当内建的草稿模型,无需第二个文件。草稿头会一次性提议多个 token,再由完整模型进行验证,因此被接受的草稿仅消耗常规前向的一小部分计算。输出质量不变,因为主模型接受的每个 token 本就是它本来会生成的。
应选择 NVFP4 还是常规 Q4_K_M 量化?
若您拥有 Blackwell GPU 且追求极致速度,请选择 NVFP4;若您使用 Ampere 或 Ada,或更看重单位容量的输出质量,可选择标准 GGUF(如 Q4_K_M)或 Unsloth 的 UD-Q4_K_XL。此外,llama.cpp 中的 NVFP4 支持也比 K-quant 路径更新,转换与工具链周边可能略显粗糙。
该方案能处理图像吗?毕竟 Qwen3.8-27B 是视觉模型
Qwen3.8-27B 原生为多模态视觉-语言模型,但仅文本的 GGUF 转换会剥离视觉塔。要使用图像,您需要在模型旁通过 --mmproj 传入多模态投影器,通常是同一仓库或 Unsloth GGUF 仓库中发布的 mmproj 文件。
