跳至内容

如何在 NVIDIA RTX 5090 上本地运行 Qwen3.8-27B

了解如何使用原生 Blackwell 的 NVFP4 与 MTP 推测解码在本地运行 Qwen3.8-27B,借助 llama.cpp 实现高达每秒 170 个 token 的速度。
更新 2026年8月31日  · 6分钟

用 AI 探索

ChatGPTClaudePerplexity

Qwen3.8-27B 正迅速成为本地 AI 中最受欢迎的模型之一。尽管只有 270 亿参数,它在编码、推理、智能体和通用基准上展现出的性能足以与更大规模的模型竞争。在多个方面,它甚至正在逼近诸如 GLM-5.2 等模型,这使它在尝试强大发本地硬件的人群中格外受欢迎。

RTX 5090 尤其适合运行 Qwen3.8-27B,因为其 Blackwell 架构支持 NVFP4,在保持高输出质量的同时,模型可以以极高速度运行。再结合通过 多 token 预测(MTP) 的推测解码、优化过的 llama.cpp 构建,以及合适的 GGUF 模型,Qwen3.8-27B 在单张 RTX 5090 上即可达到每秒 100 个 token 以上的速度。

在本指南中,我们将搭建我认为在 RTX 5090 或其他 Blackwell GPU 上实现速度、准确率与长上下文支持最佳平衡的简便方案。我们会编译带原生 Blackwell 支持的 llama.cpp,下载 Qwen3.8-27B 的 NVFP4-MTP GGUF,以 GPU 加速与 MTP 推测解码运行它,测试 OpenAI 兼容 API 和内置网页界面,最后将其接入 Pi,从而把 Qwen3.8-27B 用作完全本地的编码智能体。

我也推荐查看我们的 Qwen3.8-Flash-Next 指南、更新版的 Qwen4 预览,以及如何在本地运行 Qwen3.8-Flash-Next 的教程。

1. 为 Blackwell GPU 配置 llama.cpp

首先,确保正确检测到 GPU,并检查 NVIDIA 驱动和 CUDA 版本。

nvidia-smi

RTX 5090 GPU summary

您应能看到 RTX 5090、驱动版本、CUDA 版本、GPU 显存以及当前 GPU 使用情况。

注意:此配置专为 NVIDIA Blackwell GPU(如 RTX 5090)准备。下面的构建目标为 SM120,即 RTX 5090 所用的计算架构。

接下来,我们将下载并编译带 CUDA 支持的最新版 llama.cpp。

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

这里的关键是 -DCMAKE_CUDA_ARCHITECTURES=120。它告诉 llama.cpp 针对 RTX 5090 使用的 Blackwell 架构进行构建。

构建完成后,我们将把 llama-server 放到全局路径,便于在任意文件夹运行:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

现在,检查一切是否正常:

llama-server --version

您应会看到类似输出:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

就这样。我们已经获得一个启用 CUDA 的 llama.cpp 构建,可利用 RTX 5090 及其原生 Blackwell NVFP4 支持。

2. 下载 Qwen3.8-27B NVFP4-MTP 模型

现在我们来下载 Qwen3.8-27B 模型。

首先安装 Hugging Face CLI:

pip install -U huggingface_hub

创建一个用于保存模型的文件夹:

mkdir -p /workspace/models/qwen38

然后下载 NVFP4-MTP GGUF:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

这是我们在本次配置中需要的版本,因为它采用 NVFP4 并包含 MTP 支持,这也是在 RTX 5090 上获得大幅加速的关键所在。

3. 启动 Qwen3.8-27B 服务

接下来就有趣了。我们将在 GPU 上完整加载 Qwen3.8-27B,启用 Flash Attention、131K 的上下文窗口,并使用 MTP 推测解码以更快生成。

运行:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

这里有不少参数,但大多只是为了从 5090 中榨取最佳性能。

需要重点了解的是:

  • --ctx-size 131072 提供约 131K 的上下文窗口。

  • --n-gpu-layers all 将模型完全放在 GPU 上。

  • --flash-attn on 启用 Flash Attention

  • --cache-type-k q8_0--cache-type-v q8_0 有助于降低 KV 缓存的显存占用。

  • --spec-type draft-mtp 启用 Qwen3.8 的 MTP 推测解码。

  • --spec-draft-n-max 4 控制 MTP 一次可推测生成的 token 数量。

在本次配置中,我们以 n-max 4 作为 RTX 5090 的起始设置。您可以进一步尝试 2(模型卡建议该 GGUF 使用)或 3,因为最快的设置会随系统略有差异。

llama-server 完成模型加载后,Qwen3.8 将在本地可用,地址为 http://127.0.0.1:8910

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

我们已经在本地运行起 Qwen3.8-27B。接下来,我们将通过 API 和内置浏览器界面测试该模型。

4. 测试 Qwen3.8-27B 的速度与编码表现

在服务运行的同时,打开另一个终端,向 OpenAI 兼容 API 发送测试请求:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

在这个测试中,Qwen3.8-27B 以每秒 122 个 token 的速度生成了 2,000 个 token,MTP 接受率高达 84.9%,表现相当出色。

llama.cpp 还包含一个浏览器界面,因此您无需使用 API 也能测试模型。

在浏览器中打开 http://127.0.0.1:8910 查看界面。

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

更复杂的测试中,我使用了以下提示词:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

在我的 RTX 5090 上,平均速度大约为每秒 142 个 token,峰值速度偶尔可达每秒约 170 个 token,对于本地运行的 270 亿参数模型来说极其迅猛。

image4.png

Qwen3.8-27B 生成了一个打磨精良、可直接运行的完整网站。这是快速测试模型编码能力与本地环境速度的好方法。

5. 将 Qwen3.8-27B 与 Pi 搭配使用

本节中,我们将把 Qwen3.8-27B 连接到 Pi,将其作为完全本地的编码智能体来使用。

Pi 是一款轻量级、基于终端的编码智能体,可帮助您直接在命令行中构建、编辑、测试与调试项目。

使用以下命令安装 Pi:

curl -fsSL https://pi.dev/install.sh | sh

安装程序需要 Node.js 和 npm。它会将 Pi 安装到您的全局 npm 前缀。如果您尚未安装 Node,请先使用 nvm 或软件包管理器进行安装。

安装完成后,请重启终端。

接下来安装 pi-llama 扩展,并将 Pi 指向我们的本地 llama.cpp 服务器:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

创建一个新项目并启动 Pi:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

在 Pi 内部运行 /model,搜索 llama-cpp 并选择 Qwen3.8-27B

用于测试时,我给出了如下提示词:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

它在几分钟内就构建了整个项目。

Testing the qwen3.8-27b model with Pi coding agent

随后我让它启动服务,并测试前端与应用逻辑。它花了更多时间进行调试和测试,以确保一切正常运行。

web dashboard generated with qwen3.8-27b model and Pi coding agent

当我自己测试该仪表板时,应用运行良好,图表观感不错,整体体验也很顺畅。

web dashboard generated with qwen3.8-27b model and Pi coding agent

主要的短板在于进行精确的 UI 改动。经过多次追问后,它开始做一些不相干的修改,而不是准确理解我的需求,于是我最终就此打住。

总结

Qwen3.8-27B 仍然很新,社区正在积极探索量化与推测解码的最佳组合。MTP 表现非常出色,但诸如 DFlash 2 和 DSpark 等更新方法也在测试中,一些用户根据硬件与工作负载的不同报告了更高的速度。

Unsloth 也刚为 Qwen3.8-27B 发布了 Dynamic v3.0 GGUF,声称在相同模型大小下相较其先前量化可带来约 10% 的精度提升。如果您希望在基本不改变本地推理配置的前提下获得更高质量,Unsloth 也是一个非常值得关注的选项。

目前来看,NVFP4 + MTP + llama.cpp 是在 RTX 5090 上最简单也最快的方案之一。从一个 270 亿参数模型中拿到约每秒 140 个 token 的速度,同时保有大上下文窗口,并具备运行真实编码智能体的能力,确实令人印象深刻。随着 llama.cpp、Unsloth、DFlash 2 和 DSpark 不断改进,这一配置大概率还会更快。

在本地运行 Qwen3.8-27B 的常见问题

在本地运行 Qwen3.8-27B 是否必须使用 RTX 5090?

不需要。Qwen3.8-27B 的标准 4 位 GGUF 量化约占用 16–19 GB VRAM,因此 RTX 5080、4090 或 24 GB 的 Mac 都可以运行该模型。针对本次方案,RTX 5090 之所以重要,是因为 NVFP4 需要 Blackwell 张量核心。在老款显卡上,NVFP4 文件可以运行,但只带来显存节省,不会有提速。

该配置实际会占用多少 VRAM?

NVFP4-MTP GGUF 在磁盘上约 19 GB,总占用会随着上下文长度增长主要由 KV 缓存推动。在极长上下文下配合 q8_0 的 K/V 量化,已发布的 RTX 5090 运行案例通常落在二十多 GB,因此 32 GB 显卡较为宽裕。若只有 24 GB,您需要将 --ctx-size 明显降到低于 131072

MTP 推测解码的作用是什么?是否无损?

Qwen3.8 自带集成进 GGUF 的多 token 预测层,充当内置草稿模型,无需第二个文件。草稿头一次性提出多个 token,完整模型负责验证;被接受的草稿仅需正常前向传播的少量开销。输出质量不变,因为主模型接受的每个 token 都是它本来也会生成的。

应使用 NVFP4 还是常规的 Q4_K_M 量化?

如果您有 Blackwell GPU 且追求最高速度,选 NVFP4;如果您使用 Ampere 或 Ada,或更关注单位显存的输出质量,可选择常规 GGUF(如 Q4_K_M)或 Unsloth 的 UD-Q4_K_XL。另外,llama.cpp 中对 NVFP4 的支持相较 K-quant 路径更为新近,因此在转换与工具链方面可能会有更多粗糙之处。

既然 Qwen3.8-27B 是视觉模型,这套方案能处理图像吗?

Qwen3.8-27B 是原生的视觉-语言模型,但文本版 GGUF 转换会移除视觉塔。若要处理图像,需要在加载模型时通过 --mmproj 传入多模态投影器,通常使用同仓库发布的 mmproj 文件或 Unsloth 的 GGUF 仓库中的相应文件。

主题
人工智能

通过 DataCamp 成为一名 AI 工程师!

Tracks

面向开发者的 AI 工程师助理

26小时
了解如何使用 API 和开源库将 AI 集成到软件应用程序中。 今天就开始你的 AI 工程师之旅吧!
查看详情Right Arrow
开始课程
查看更多Right Arrow