tracks
Qwen3.8-27B는 로컬 AI에서 가장 인기 있는 모델 중 하나로 빠르게 자리 잡고 있습니다. 파라미터가 270억 개에 불과하지만 코딩, 추론, 에이전트, 범용 벤치마크 전반에서 훨씬 더 큰 모델들과 견줄 만한 성능을 제공합니다. 심지어 여러 분야에서 GLM-5.2 같은 모델에 근접하고 있어, 강력한 로컬 하드웨어를 실험하는 사용자들 사이에서 특히 인기를 끌고 있습니다.
RTX 5090은 Blackwell 아키텍처가 NVFP4를 지원하기 때문에 Qwen3.8-27B에 특히 잘 맞습니다. 이를 통해 출력 품질을 유지하면서도 매우 높은 속도로 모델을 실행할 수 있습니다. 여기에 다중 토큰 예측(MTP)을 통한 추론 가속, 최적화된 llama.cpp 빌드, 적합한 GGUF 모델을 조합하면, 단일 RTX 5090에서 초당 100 토큰을 훌쩍 넘는 속도를 낼 수 있습니다.
이 가이드에서는 RTX 5090 또는 다른 Blackwell GPU에서 속도, 정확도, 긴 컨텍스트 지원 간의 균형을 가장 손쉽게 맞추는 방법을 설정합니다. Blackwell 네이티브 지원으로 llama.cpp를 컴파일하고, Qwen3.8-27B NVFP4-MTP GGUF를 다운로드한 뒤, GPU 가속과 MTP 추론 가속으로 실행합니다. 또한 OpenAI 호환 API와 내장 웹 인터페이스를 테스트하고, 마지막으로 Pi에 연결해 Qwen3.8-27B를 완전 로컬 코딩 에이전트로 사용해 보겠습니다.
1. Blackwell GPU용 llama.cpp 설정
먼저 GPU가 올바르게 감지되는지 확인하고 NVIDIA 드라이버 및 CUDA 버전을 점검합니다.
nvidia-smi
RTX 5090, 드라이버 버전, CUDA 버전, GPU 메모리, 현재 GPU 사용량이 표시되어야 합니다.
참고: 이 설정은 RTX 5090 같은 NVIDIA Blackwell GPU에 특화되어 있습니다. 아래 빌드는 RTX 5090이 사용하는 컴퓨트 아키텍처인 SM120을 대상으로 합니다.
다음으로 CUDA 지원을 포함한 최신 버전의 llama.cpp를 다운로드해 컴파일합니다.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

여기서 중요한 옵션은 -DCMAKE_CUDA_ARCHITECTURES=120입니다. 이는 RTX 5090에 사용되는 Blackwell 아키텍처에 맞춰 llama.cpp를 빌드하라는 의미입니다.
빌드가 완료되면, 어느 폴더에서나 실행할 수 있도록 llama-server를 전역으로 사용할 수 있게 만듭니다:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
이제 정상 동작하는지 확인합니다:
llama-server --version
출력은 다음과 비슷하게 표시됩니다:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
이제 완료되었습니다. RTX 5090과 그 네이티브 Blackwell NVFP4 지원을 활용할 수 있는 CUDA 활성화 llama.cpp 빌드를 갖췄습니다.
2. Qwen3.8-27B NVFP4-MTP 모델 다운로드
이제 Qwen3.8-27B 모델을 다운로드합니다.
먼저 Hugging Face CLI를 설치합니다:
pip install -U huggingface_hub
모델을 보관할 폴더를 만듭니다:
mkdir -p /workspace/models/qwen38
그다음 NVFP4-MTP GGUF를 다운로드합니다:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

이 버전은 NVFP4를 사용하고 MTP 지원을 포함하고 있어, RTX 5090에서 속도 향상의 많은 부분이 여기서 나오므로 본 설정에 적합합니다.
3. Qwen3.8-27B 서버 시작
이제 본격적으로 시작합니다. Flash Attention, 131K 컨텍스트 윈도우, MTP 추론 가속을 통해 GPU에서 Qwen3.8-27B를 완전히 구동합니다.
다음 명령을 실행하세요:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
옵션이 많아 보이지만, 대부분은 5090에서 최고의 성능을 끌어내기 위한 설정입니다.
핵심 옵션은 다음과 같습니다:
-
--ctx-size 131072는 대략 131K 컨텍스트 윈도우를 제공합니다. -
--n-gpu-layers all은 모델을 GPU에 상주시킵니다. -
--flash-attn on은 Flash Attention을 활성화합니다. -
--cache-type-k q8_0및--cache-type-v q8_0은 KV 캐시 메모리 사용량을 줄이는 데 도움이 됩니다. -
--spec-type draft-mtp는 Qwen3.8의 MTP 추론 가속을 활성화합니다. -
--spec-draft-n-max 4는 한 번에 MTP가 생성할 수 있는 추론 토큰 수를 제어합니다.
이 설정에서는 RTX 5090의 시작점으로 n-max 4를 사용합니다. (이 GGUF에 대해 모델 카드가 권장하는) 2나 3 등으로도 시도해 볼 수 있습니다. 시스템에 따라 최적의 값이 조금씩 달라질 수 있습니다.
모델 로딩이 끝나면 llama-server가 Qwen3.8을 로컬에서 http://127.0.0.1:8910 주소로 제공합니다.

이제 Qwen3.8-27B가 로컬에서 실행 중입니다. 다음으로 API와 내장 브라우저 인터페이스를 통해 모델을 테스트합니다.
4. Qwen3.8-27B 속도와 코딩 성능 테스트
서버가 실행 중인 상태에서, 다른 터미널을 열어 OpenAI 호환 API에 테스트 요청을 보냅니다:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

이 테스트에서 Qwen3.8-27B는 초당 122 토큰 속도로 2,000 토큰을 생성했으며, MTP 수용률은 인상적인 84.9%였습니다.
llama.cpp에는 브라우저 인터페이스도 포함되어 있어 API 없이도 모델을 시험해 볼 수 있습니다.
브라우저에서 http://127.0.0.1:8910 를 열어 UI를 확인하세요.

좀 더 복잡한 테스트로 다음 프롬프트를 사용했습니다:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

제 RTX 5090에서는 평균 초당 약 142 토큰이 나왔고, 때때로 약 170 토큰까지 도달했습니다. 로컬에서 구동하는 27B 모델로는 매우 빠른 속도입니다.

Qwen3.8-27B는 상자에서 바로 실행되는 깔끔하고 완전한 웹사이트를 생성했습니다. 모델의 코딩 능력과 로컬 설정의 속도를 빠르게 점검하는 좋은 방법입니다.
5. Pi와 함께 Qwen3.8-27B 사용
이 섹션에서는 Qwen3.8-27B를 Pi에 연결해 완전 로컬 코딩 에이전트로 사용합니다.
Pi는 터미널 기반의 경량 코딩 에이전트로, 명령줄에서 직접 프로젝트를 빌드, 편집, 테스트, 디버그하는 데 도움을 줍니다.
Pi는 아래 명령으로 설치합니다:
curl -fsSL https://pi.dev/install.sh | sh
설치 프로그램은 Node.js와 npm을 필요로 하며, Pi를 전역 npm 프리픽스에 설치합니다. Node가 없다면 nvm 또는 패키지 관리자로 먼저 설치하세요.
설치가 완료되면 터미널을 재시작합니다.
다음으로 pi-llama 확장을 설치하고 Pi가 로컬 llama.cpp 서버를 사용하도록 지정합니다:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
새 프로젝트를 만들고 Pi를 시작합니다:
mkdir new-project
cd new-project
Pi

Pi 안에서 /model을 실행하고 llama-cpp를 검색한 뒤 Qwen3.8-27B를 선택하세요.
테스트용으로 다음 프롬프트를 사용했습니다:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

몇 분 만에 전체 프로젝트를 구축했습니다.

이후 서버를 시작하고 프런트엔드와 애플리케이션 로직을 모두 테스트하라고 지시했습니다. 모든 기능이 제대로 동작하는지 확인하기 위해 디버깅과 테스트에 더 많은 시간을 들였습니다.

직접 대시보드를 테스트해 보니 앱이 잘 동작했고, 그래프도 보기 좋았으며 전반적인 사용감이 매끄러웠습니다.

유일한 약점은 정밀한 UI 변경이었습니다. 여러 차례 후속 프롬프트를 보낸 뒤에는 제가 원한 변경을 정확히 이해하지 못하고 관련 없는 수정에 나서서, 결국 그 지점에서 중단했습니다.
마무리 생각
Qwen3.8-27B는 아직 매우 새롭고, 커뮤니티에서는 최적의 양자화와 추론 가속 조합을 활발히 모색 중입니다. MTP는 매우 잘 동작하지만, DFlash 2와 DSpark 같은 최신 접근법도 시험 중이며, 하드웨어와 작업 부하에 따라 더 높은 속도를 보고하는 사용자들도 있습니다.
Unsloth도 Qwen3.8-27B용 Dynamic v3.0 GGUF를 방금 공개했으며, 이전 양자화 대비 동일한 모델 크기에서 약 10% 더 높은 정확도를 주장합니다. 로컬 추론 설정을 거의 그대로 유지하면서 품질을 높이고 싶다면 Unsloth도 매우 흥미로운 선택지입니다.
현재로서는 NVFP4 + MTP + llama.cpp 조합이 RTX 5090에서 가장 쉽고 빠른 설정 중 하나라고 봅니다. 27B 모델에서 큰 컨텍스트 윈도우를 유지하고 실제 코딩 에이전트를 구동할 만한 능력을 갖춘 상태로 초당 약 140 토큰을 얻는 것은 인상적입니다. llama.cpp, Unsloth, DFlash 2, DSpark가 계속 발전함에 따라 이 설정은 더욱 빨라질 가능성이 큽니다.
Qwen3.8-27B 로컬 실행 FAQ
Qwen3.8-27B를 로컬로 실행하려면 RTX 5090이 꼭 필요한가요?
아니요. Qwen3.8-27B의 표준 4비트 GGUF 양자화는 약 16–19GB VRAM에 들어가므로 RTX 5080, 4090, 24GB Mac에서도 모델을 실행할 수 있습니다. 이 가이드의 특정 설정에서 RTX 5090이 중요한 이유는 NVFP4가 Blackwell 텐서 코어를 필요로 하기 때문입니다. 구형 카드에서도 NVFP4 파일은 실행되지만, 메모리 절감만 있고 속도 향상은 없습니다.
이 구성은 실제로 VRAM을 얼마나 사용하나요?
NVFP4-MTP GGUF는 디스크 기준 약 19GB이며, 컨텍스트가 커질수록 총 사용량을 끌어올리는 것은 KV 캐시입니다. 매우 긴 컨텍스트에서 q8_0 K/V 양자화를 사용할 경우, 공개된 RTX 5090 실행 사례는 VRAM 사용량이 20GB대 중반에 형성되므로 32GB 카드가 여유롭습니다. 24GB 카드에서는 --ctx-size를 131072보다 상당히 낮춰야 합니다.
MTP 추론 가속은 무엇이며 손실이 없나요?
Qwen3.8은 GGUF에 다중 토큰 예측 레이어가 내장되어 있어, 별도 파일 없이도 내장 드래프트 모델처럼 동작합니다. 드래프트 헤드는 한 번에 여러 토큰을 제안하고, 전체 모델이 이를 검증합니다. 수용된 드래프트는 일반 포워드 패스의 일부만 비용이 들며, 출력 품질은 변하지 않습니다. 메인 모델이 수용한 각 토큰은 원래도 모델이 생성했을 토큰이기 때문입니다.
NVFP4와 일반 Q4_K_M 중 무엇을 써야 하나요?
최대 속도를 원하고 Blackwell GPU를 사용한다면 NVFP4를 선택하세요. Ampere나 Ada를 사용하거나, GB당 출력 품질을 더 중시한다면 Q4_K_M 같은 표준 GGUF 또는 Unsloth의 UD-Q4_K_XL을 선택하는 편이 좋습니다. 또한 llama.cpp에서 NVFP4 지원은 K-quant 경로보다 도입 시기가 더 최근이므로, 변환 및 도구 체인에서 미세한 이슈가 더 있을 수 있습니다.
Qwen3.8-27B가 비전 모델인 만큼, 이 설정으로 이미지도 처리할 수 있나요?
Qwen3.8-27B는 네이티브 비전-언어 모델이지만, 텍스트 전용 GGUF 변환에서는 비전 타워가 제거됩니다. 이미지를 사용하려면 보통 같은 저장소나 Unsloth의 GGUF 저장소에 게시된 mmproj 파일을 --mmproj와 함께 모델에 전달해 멀티모달 프로젝터를 함께 로드해야 합니다.
