Tracks
Qwen3.8-27B はローカル AI 向けモデルとして急速に人気が高まっています。わずか 270 億パラメータでありながら、コーディング、推論、エージェント、汎用ベンチマークの多くで、はるかに大規模なモデルと競える性能を発揮します。いくつかの領域では GLM-5.2 にも迫っており、高性能なローカル環境で実験するユーザーの間で特に支持を集めています。
RTX 5090 は Blackwell アーキテクチャが NVFP4 をサポートしているため、Qwen3.8-27B に特に適しています。出力品質を維持しながら非常に高速に動作させられます。さらに、マルチトークン予測(MTP)による推測デコード、最適化された llama.cpp ビルド、適切な GGUF モデルを組み合わせることで、単一の RTX 5090 で毎秒 100 トークンを大きく超える速度が得られます。
本ガイドでは、RTX 5090 あるいは他の Blackwell GPU で、速度・精度・長文コンテキスト対応のバランスを簡単に最適化する手順を紹介します。Blackwell ネイティブ対応で llama.cpp をコンパイルし、Qwen3.8-27B の NVFP4-MTP GGUF をダウンロードして GPU アクセラレーションと MTP 推測デコードで実行し、OpenAI 互換 API と組み込み Web インターフェースをテストします。最後に Pi と接続して、Qwen3.8-27B を完全ローカルのコーディングエージェントとして使えるようにします。
また、Qwen4 の新しいプレビューである Qwen3.8-Flash-Next のガイドや、Qwen3.8-Flash-Next をローカルで実行する方法のチュートリアルもぜひご覧ください。
1. Blackwell GPU 向けに llama.cpp をセットアップする
まず、GPU が正しく検出されていることを確認し、NVIDIA ドライバと CUDA のバージョンを確認します。
nvidia-smi
RTX 5090、ドライバのバージョン、CUDA バージョン、GPU メモリ、現在の GPU 使用状況が表示されるはずです。
注意: ここでのセットアップは RTX 5090 など NVIDIA Blackwell GPU 専用です。以下のビルドは RTX 5090 が用いる計算アーキテクチャである SM120 を対象にしています。
次に、CUDA 対応で最新の llama.cpp をダウンロード・コンパイルします。
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

ここで重要なのは -DCMAKE_CUDA_ARCHITECTURES=120 です。これは RTX 5090 で使われている Blackwell アーキテクチャ向けに llama.cpp をビルドする指定です。
ビルドが完了したら、任意のフォルダから実行できるように llama-server をグローバルに使えるようにします:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
動作確認を行います:
llama-server --version
出力例:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
以上で、RTX 5090 とその Blackwell ネイティブ NVFP4 を活用できる CUDA 対応の llama.cpp ビルドが用意できました。
2. Qwen3.8-27B NVFP4-MTP モデルをダウンロードする
続いて、Qwen3.8-27B モデルをダウンロードします。
まず Hugging Face CLI をインストールします:
pip install -U huggingface_hub
モデルを保存するフォルダを作成します:
mkdir -p /workspace/models/qwen38
次に NVFP4-MTP GGUF をダウンロードします:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

このバージョンは NVFP4 を用い、MTP をサポートしているため、本セットアップに最適です。RTX 5090 での高速化の多くはここから得られます。
3. Qwen3.8-27B サーバーを起動する
ここからが本番です。Flash Attention、有効コンテキスト 131K のコンテキストウィンドウ、高速化のための MTP 推測デコードを使って、Qwen3.8-27B を完全に GPU 上で提供します。
次を実行します:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
オプションは多いですが、ほとんどは 5090 で最高の性能を引き出すためのものです。
主なポイントは次のとおりです:
-
--ctx-size 131072はおよそ 131K のコンテキストウィンドウを指定します。 -
--n-gpu-layers allはモデルを GPU 上に維持します。 -
--flash-attn onは Flash Attention を有効にします。 -
--cache-type-k q8_0と--cache-type-v q8_0は KV キャッシュのメモリ使用量を抑えます。 -
--spec-type draft-mtpは Qwen3.8 の MTP 推測デコードを有効化します。 -
--spec-draft-n-max 4は MTP が一度に生成する推測トークン数を制御します。
本セットアップでは RTX 5090 の初期値として n-max 4 を使っています。システムにより最速設定はわずかに変わるため、この GGUF のモデルカードが推奨する 2 や 3 なども試してみてください。
モデルの読み込みが完了すると、Qwen3.8 はローカルの http://127.0.0.1:8910 で利用可能になります。

これで Qwen3.8-27B をローカル実行できました。次に、API と組み込みブラウザー UI の両方でモデルをテストします。
4. Qwen3.8-27B の速度とコーディング性能をテストする
サーバーが起動している状態で、別のターミナルを開き、OpenAI 互換 API にテストリクエストを送ります:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

このテストでは、Qwen3.8-27B は 2,000 トークンを毎秒 122 トークンで生成し、MTP 受け入れ率は 84.9% と非常に良好でした。
llama.cpp にはブラウザーインターフェースも含まれているため、API を使わずにモデルを試すこともできます。
http://127.0.0.1:8910 をブラウザーで開くと UI が表示されます。

より複雑なテストとして、次のプロンプトを使用しました:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

私の RTX 5090 では平均で毎秒約 142 トークン、状況によっては毎秒約 170 トークンに達することもあり、ローカルで動く 27B モデルとしては非常に高速でした。

Qwen3.8-27B は、箱から出してすぐ動く洗練された完全動作のウェブサイトを生成しました。モデルのコーディング能力とローカル環境の速度を手早く確認するのに好適です。
5. Pi と組み合わせて Qwen3.8-27B を使う
このセクションでは、Qwen3.8-27B を Pi に接続し、完全ローカルのコーディングエージェントとして使用します。
Pi はターミナルベースの軽量コーディングエージェントで、コマンドラインから直接プロジェクトの構築・編集・テスト・デバッグを支援します。
Pi のインストール:
curl -fsSL https://pi.dev/install.sh | sh
インストーラーには Node.js と npm が必要です。Pi はグローバルな npm プレフィックスにインストールされます。Node が未導入の場合は、nvm かパッケージマネージャーで先にインストールしてください。
インストールが完了したら、ターミナルを再起動します。
次に、pi-llama 拡張をインストールし、Pi をローカルの llama.cpp サーバーに向けます:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
新しいプロジェクトを作成して Pi を起動します:
mkdir new-project
cd new-project
Pi

Pi の中で /model を実行し、llama-cpp を検索して Qwen3.8-27B を選択します。
テスト用に、次のプロンプトを与えました:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

数分でプロジェクト全体を構築しました。

その後、サーバーを起動し、フロントエンドとアプリケーションロジックの両方をテストするよう指示しました。すべてが正しく動くよう、デバッグとテストにより時間をかけていました。

自分でもダッシュボードを試しましたが、アプリは良好に動作し、グラフも見やすく、全体としてスムーズでした。

唯一の弱点は、UI をピンポイントに調整する作業でした。いくつか追加入力を重ねると、こちらの意図を正確に理解する代わりに無関係な変更を始めてしまったため、その時点で打ち切りました。
まとめ
Qwen3.8-27B はまだ非常に新しく、量子化と推測デコードの最適な組み合わせをコミュニティが積極的に模索している段階です。MTP は非常に良好に機能しますが、DFlash 2 や DSpark などの新手法も検証が進んでおり、ハードウェアやワークロードによってはさらに高速という報告もあります。
Unsloth からは Qwen3.8-27B 向け Dynamic v3.0 GGUF も公開されたばかりで、同一モデルサイズで前世代の量子化比で約 10% の精度向上をうたっています。ローカル推論の構成を大きく変えずに品質を高めたい場合、Unsloth も非常に有力な選択肢になります。
現時点では、NVFP4 + MTP + llama.cpp は RTX 5090 において、最も簡単かつ高速な構成の一つと考えます。27B モデルで約毎秒 140 トークンを達成しつつ、大きなコンテキストウィンドウと実用的なコーディングエージェント機能を両立できるのは驚異的です。llama.cpp、Unsloth、DFlash 2、DSpark の改良に伴い、今後さらに高速化が見込まれます。
Qwen3.8-27B をローカル実行する際のよくある質問
Qwen3.8-27B をローカルで動かすのに RTX 5090 は必須ですか?
不要です。Qwen3.8-27B の標準的な 4-bit GGUF 量子化はおよそ 16–19 GB の VRAM に収まり、RTX 5080、4090、24 GB 搭載の Mac でも実行できます。本セットアップで RTX 5090 が重要なのは、NVFP4 に Blackwell のテンソルコアが必要だからです。旧世代カードでも NVFP4 ファイルは動作しますが、得られるのはメモリ節約のみで速度向上はありません。
この構成で実際にどのくらい VRAM を使いますか?
NVFP4-MTP GGUF 自体はディスク上で約 19 GB で、コンテキストが伸びると全体容量を押し上げるのは KV キャッシュです。非常に長いコンテキストで q8_0 の K/V 量子化を用いると、公開されている RTX 5090 の実行例では合計で 20 数 GB 台に収まるため、32 GB のカードがあれば余裕があります。24 GB では --ctx-size を 131072 より十分小さくする必要があります。
MTP 推測デコードは何を行い、ロスレスですか?
Qwen3.8 には GGUF にマルチトークン予測レイヤーが組み込まれており、追加ファイル不要のビルトイン下書きモデルとして機能します。ドラフトヘッドが複数トークンをまとめて提案し、フルモデルがそれを検証するため、受理されたドラフトは通常のフォワードパスの一部のコストで済みます。出力品質は損なわれません。メインモデルが受け入れる各トークンは、もともと同モデルが生成していたものだからです。
NVFP4 と通常の Q4_K_M 量子化はどちらを使うべきですか?
最大速度を求める Blackwell GPU 環境なら NVFP4 を、Ampere や Ada 世代、または容量あたりの出力品質を重視するなら、Q4_K_M のような標準 GGUF か Unsloth の UD-Q4_K_XL を選びましょう。llama.cpp における NVFP4 サポートは K-quant 系より新しいため、変換やツール周りで粗削りな部分が残っている点にも留意してください。
Qwen3.8-27B はビジョンモデルですが、このセットアップで画像も扱えますか?
Qwen3.8-27B はネイティブな視覚言語モデルですが、テキスト専用の GGUF 変換ではビジョンタワーが取り除かれます。画像を扱うには、通常は同一リポジトリ、または Unsloth の GGUF リポジトリで公開されている mmproj ファイルを --mmproj でモデルと一緒に指定する必要があります。
