跳至内容

如何在 NVIDIA RTX 5090 上本地运行 Qwen3.8-27B

了解如何使用原生 Blackwell 的 NVFP4 和 MTP 推测解码在本地运行 Qwen3.8-27B,结合 llama.cpp 实现最高每秒 170 个 token 的速度。
更新 2026年8月25日  · 6分钟

用 AI 探索

ChatGPTClaudePerplexity

Qwen3.8-27B 正迅速成为本地 AI 中最受欢迎的模型之一。尽管只有 270 亿参数,它在编码、推理、智能体与通用基准上展现的性能可与体量更大的模型相竞争。在多个方面它甚至正在逼近诸如 GLM-5.2 等模型,这使得它在尝试强大本地硬件的人群中尤为受欢迎。

RTX 5090 与 Qwen3.8-27B 天生契合,因为其 Blackwell 架构支持 NVFP4,既能保持较高输出质量,又能以极高速度运行。结合通过 多 token 预测(MTP)实现的推测解码、优化过的 llama.cpp 构建以及合适的 GGUF 模型,Qwen3.8-27B 在单张 RTX 5090 上可轻松超过每秒 100 个 token。

在本指南中,我们将搭建我认为在 RTX 5090 或其他 Blackwell GPU 上实现速度、准确性与长上下文支持三者平衡的最简单方案之一。我们将编译带原生 Blackwell 支持的 llama.cpp,下载 Qwen3.8-27B 的 NVFP4-MTP GGUF,在 GPU 加速与 MTP 推测解码下运行,测试其兼容 OpenAI 的 API 与内置网页界面,最后将其连接至 Pi,从而把 Qwen3.8-27B 用作完全本地的编码智能体。

1. 为 Blackwell GPU 配置 llama.cpp

首先,确保 GPU 被正确识别,并检查 NVIDIA 驱动与 CUDA 版本。

nvidia-smi

RTX 5090 GPU summary

您应能看到 RTX 5090、驱动版本、CUDA 版本、GPU 显存及当前 GPU 使用情况。

注意:该配置专为 NVIDIA Blackwell GPU(如 RTX 5090)设计。下方的构建目标为 SM120,即 RTX 5090 所用的计算架构。

接下来,我们将下载并编译最新的、带 CUDA 支持的 llama.cpp。

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

此处的关键是 -DCMAKE_CUDA_ARCHITECTURES=120。这会指示 llama.cpp 针对 RTX 5090 使用的 Blackwell 架构进行构建。

构建完成后,我们将把 llama-server 放到全局路径,以便在任意目录运行:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

现在,检查一切是否正常:

llama-server --version

您应会看到类似如下的输出:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

就这样。我们已获得一个启用 CUDA 的 llama.cpp 构建,可利用 RTX 5090 及其原生 Blackwell NVFP4 支持。

2. 下载 Qwen3.8-27B NVFP4-MTP 模型

现在我们来下载 Qwen3.8-27B 模型。

首先,安装 Hugging Face CLI:

pip install -U huggingface_hub

创建一个用于存放模型的文件夹:

mkdir -p /workspace/models/qwen38

然后下载 NVFP4-MTP GGUF:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

这是我们在本次配置中所需的版本,因为它使用 NVFP4 并包含 MTP 支持,而后者正是 RTX 5090 上速度大幅提升的主要来源之一。

3. 启动 Qwen3.8-27B 服务器

有趣的部分来了。我们将把 Qwen3.8-27B 完全部署在 GPU 上,并启用 Flash Attention、131K 上下文窗口与 MTP 推测解码,以实现更快的生成速度。

运行:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

这里有不少选项,但大多都是为了充分发挥 5090 的性能。

需要重点了解的是:

  • --ctx-size 131072 约等于 131K 的上下文窗口。

  • --n-gpu-layers all 将模型完全放在 GPU 上。

  • --flash-attn on 启用 Flash Attention

  • --cache-type-k q8_0--cache-type-v q8_0 有助于降低 KV 缓存的内存占用。

  • --spec-type draft-mtp 启用 Qwen3.8 的 MTP 推测解码。

  • --spec-draft-n-max 4 控制 MTP 一次可生成的推测 token 数量。

在本次配置中,我们以 n-max 4 作为 RTX 5090 的起点。您也可以尝试 2(该 GGUF 的模型卡推荐)或 3 等数值,因为最快的设置可能会随您的系统略有不同。

llama-server 加载模型完成后,Qwen3.8 将可通过 http://127.0.0.1:8910 在本地访问。

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

我们现在已在本地运行 Qwen3.8-27B。接下来,将通过 API 与内置浏览器界面对模型进行测试。

4. 测试 Qwen3.8-27B 的速度与编码表现

在服务器运行的情况下,打开另一个终端,向兼容 OpenAI 的 API 发送测试请求:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

在此测试中,Qwen3.8-27B 以每秒 122 个 token 的速度生成了 2,000 个 token,MTP 接受率高达 84.9%。 

llama.cpp 也包含浏览器界面,您无需通过 API 即可测试模型。

在浏览器中打开 http://127.0.0.1:8910 查看界面。

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

更复杂的测试中,我使用了以下提示词:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

在我的 RTX 5090 上,平均速度约为每秒 142 个 token,峰值有时可达每秒约 170 个 token,这对于在本地运行的 270 亿参数模型而言非常快。 

image4.png

Qwen3.8-27B 生成了一个打磨良好、可即开即用的完整网站。这是快速测试模型编码能力与本地环境速度的一个好办法。 

5. 将 Qwen3.8-27B 与 Pi 搭配使用

在本节中,我们将把 Qwen3.8-27B 连接到 Pi,将其用作完全本地的编码智能体。

Pi 是一个轻量级、基于终端的编码智能体,可帮助您直接在命令行中构建、编辑、测试与调试项目。

使用以下命令安装 Pi:

curl -fsSL https://pi.dev/install.sh | sh

安装程序需要 Node.js 与 npm。它会将 Pi 安装到全局 npm 前缀。如果您尚未安装 Node,请先通过 nvm 或包管理器安装。

安装完成后,请重启终端。

接下来,安装 pi-llama 扩展,并将 Pi 指向我们的本地 llama.cpp 服务器:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

创建一个新项目并启动 Pi:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

在 Pi 内运行 /model,搜索 llama-cpp 并选择 Qwen3.8-27B

用于测试,我给出了如下提示词:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

它在几分钟内就构建了整个项目。 

Testing the qwen3.8-27b model with Pi coding agent

随后我让它启动服务器并测试前端与应用逻辑。它花了更多时间进行调试与测试,以确保一切正常运行。

web dashboard generated with qwen3.8-27b model and Pi coding agent

当我亲自测试该仪表板时,应用运行良好,图表效果出色,整体体验也很流畅。

web dashboard generated with qwen3.8-27b model and Pi coding agent

主要的短板在于精确的 UI 改动。经过多次追问后,它开始做一些无关调整,而不是准确理解我的需求,所以我就此作罢。

结语

Qwen3.8-27B 仍然非常新,社区正在积极探索量化与推测解码的最佳组合。MTP 表现极佳,但诸如 DFlash 2 和 DSpark 等新方法也在测试中,部分用户根据硬件与负载类型反馈了更高速度。

Unsloth 也刚刚为 Qwen3.8-27B 发布了 Dynamic v3.0 GGUF,声称在相同模型大小下相比此前的量化精度提升约 10%。如果您希望在保持大致相同本地推理配置的同时提升质量,Unsloth 也是非常有意思的选择。

就目前而言,我认为 NVFP4 + MTP + llama.cpp 是 RTX 5090 上最简单且最快的方案之一。用 270 亿参数模型在保持大上下文窗口与足够能力以运行真实编码智能体的同时,做到每秒约 140 个 token,已相当令人印象深刻。随着 llama.cpp、Unsloth、DFlash 2 与 DSpark 的持续改进,该方案可能还会更快。

本地运行 Qwen3.8-27B 的常见问题

本地运行 Qwen3.8-27B 是否必须使用 RTX 5090?

不需要。Qwen3.8-27B 的标准 4 位 GGUF 量化约占用 16–19 GB 显存,因此 RTX 5080、4090 或 24 GB 的 Mac 都能运行该模型。对于本文特定方案,RTX 5090 之所以重要,是因为 NVFP4 需要 Blackwell 张量核心。在旧卡上,NVFP4 文件可以运行,但只能带来显存节省,而不能带来加速。

该配置实际会用掉多少显存?

NVFP4-MTP GGUF 本体在磁盘上约 19 GB,随着上下文增长,推高总占用的是 KV 缓存。使用 q8_0 的 K/V 量化并在超长上下文下,已公开的 RTX 5090 运行通常落在 20 多 GB,因此 32 GB 显卡更从容。若是 24 GB,您需要将 --ctx-size 大幅降至低于 131072

MTP 推测解码的作用是什么?它是无损的吗?

Qwen3.8 的 GGUF 内置多 token 预测层,充当内建的草稿模型,无需第二个文件。草稿头会一次性提议多个 token,再由完整模型进行验证,因此被接受的草稿仅消耗常规前向的一小部分计算。输出质量不变,因为主模型接受的每个 token 本就是它本来会生成的。

应选择 NVFP4 还是常规 Q4_K_M 量化?

若您拥有 Blackwell GPU 且追求极致速度,请选择 NVFP4;若您使用 Ampere 或 Ada,或更看重单位容量的输出质量,可选择标准 GGUF(如 Q4_K_M)或 Unsloth 的 UD-Q4_K_XL。此外,llama.cpp 中的 NVFP4 支持也比 K-quant 路径更新,转换与工具链周边可能略显粗糙。

该方案能处理图像吗?毕竟 Qwen3.8-27B 是视觉模型

Qwen3.8-27B 原生为多模态视觉-语言模型,但仅文本的 GGUF 转换会剥离视觉塔。要使用图像,您需要在模型旁通过 --mmproj 传入多模态投影器,通常是同一仓库或 Unsloth GGUF 仓库中发布的 mmproj 文件。

主题

在 DataCamp 成为 AI 工程师!

Tracks

面向开发者的 AI 工程师助理

26小时
了解如何使用 API 和开源库将 AI 集成到软件应用程序中。 今天就开始你的 AI 工程师之旅吧!
查看详情Right Arrow
开始课程
查看更多Right Arrow