tracks
Qwen3.8-27B는 로컬 AI에서 가장 인기 있는 모델 중 하나로 빠르게 자리 잡고 있습니다. 파라미터가 270억 개에 불과하지만, 코딩, 추론, 에이전트, 범용 벤치마크 전반에서 훨씬 큰 모델들과 경쟁하는 성능을 제공합니다. 심지어 여러 영역에서 GLM-5.2 같은 모델에 근접하고 있어, 강력한 로컬 하드웨어로 실험하는 사용자들 사이에서 특히 인기가 높습니다.
RTX 5090은 Blackwell 아키텍처가 NVFP4를 지원해 출력 품질을 유지하면서 매우 빠른 속도로 모델을 실행할 수 있기 때문에, Qwen3.8-27B와 특히 잘 맞습니다. 여기에 멀티 토큰 예측(MTP)을 통한 추측 디코딩, 최적화된 llama.cpp 빌드, 맞는 GGUF 모델을 결합하면, Qwen3.8-27B는 단일 RTX 5090에서 초당 100 토큰을 훌쩍 넘는 속도를 낼 수 있습니다.
이 가이드에서는 RTX 5090 또는 다른 Blackwell GPU에서 속도, 정확도, 롱 컨텍스트 지원의 균형을 가장 쉽게 맞추는 방법을 설정합니다. Blackwell 네이티브 지원으로 llama.cpp를 컴파일하고, Qwen3.8-27B NVFP4-MTP GGUF를 다운로드해 GPU 가속과 MTP 추측 디코딩으로 실행합니다. OpenAI 호환 API와 내장 웹 인터페이스를 테스트한 뒤, 마지막으로 Pi에 연결해 Qwen3.8-27B를 완전 로컬 코딩 에이전트로 활용해 보겠습니다.
또한 Qwen3.8-Flash-Next 가이드, 최신 Qwen4 프리뷰, 그리고 Qwen3.8-Flash-Next를 로컬로 실행하는 방법 튜토리얼도 참고하시기 바랍니다.
1. Blackwell GPU용 llama.cpp 설정
먼저 GPU가 제대로 인식되는지 확인하고 NVIDIA 드라이버와 CUDA 버전을 점검합니다.
nvidia-smi
RTX 5090, 드라이버 버전, CUDA 버전, GPU 메모리, 현재 GPU 사용량이 표시되어야 합니다.
참고: 이 설정은 RTX 5090과 같은 NVIDIA Blackwell GPU에 특화되어 있습니다. 아래 빌드는 RTX 5090이 사용하는 컴퓨트 아키텍처인 SM120을 대상으로 합니다.
다음으로 CUDA 지원을 포함한 최신 llama.cpp를 다운로드하고 컴파일합니다.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

여기서 중요한 부분은 -DCMAKE_CUDA_ARCHITECTURES=120입니다. 이는 RTX 5090에 사용되는 Blackwell 아키텍처를 대상으로 llama.cpp를 빌드하라는 의미입니다.
빌드가 완료되면, 임의 폴더에서 실행할 수 있도록 llama-server를 전역으로 사용 가능하게 만듭니다:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
이제 모든 것이 정상 동작하는지 확인합니다:
llama-server --version
다음과 유사한 출력이 표시됩니다:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
이제 끝입니다. RTX 5090과 Blackwell 네이티브 NVFP4를 활용할 수 있는 CUDA 활성화 llama.cpp 빌드를 준비했습니다.
2. Qwen3.8-27B NVFP4-MTP 모델 다운로드
이제 Qwen3.8-27B 모델을 다운로드합니다.
먼저 Hugging Face CLI를 설치합니다:
pip install -U huggingface_hub
모델을 보관할 폴더를 만듭니다:
mkdir -p /workspace/models/qwen38
그다음 NVFP4-MTP GGUF를 다운로드합니다:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

이 버전은 NVFP4를 사용하고 MTP 지원을 포함하고 있어, RTX 5090에서 속도 향상이 큰 이 설정에 적합합니다.
3. Qwen3.8-27B 서버 시작
이제 재미있는 부분입니다. GPU에서 완전히 서빙하면서 Flash Attention, 131K 컨텍스트 윈도우, 그리고 더 빠른 생성을 위한 MTP 추측 디코딩을 사용합니다.
다음 명령을 실행하세요:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
옵션이 많지만, 대부분은 5090에서 최고의 성능을 끌어내기 위한 설정입니다.
핵심 옵션은 다음과 같습니다:
-
--ctx-size 131072는 대략 131K 컨텍스트 윈도우를 제공합니다. -
--n-gpu-layers all은 모델을 GPU에 유지합니다. -
--flash-attn on은 Flash Attention을 활성화합니다. -
--cache-type-k q8_0및--cache-type-v q8_0는 KV 캐시 메모리 사용량을 줄이는 데 도움이 됩니다. -
--spec-type draft-mtp는 Qwen3.8의 MTP 추측 디코딩을 활성화합니다. -
--spec-draft-n-max 4는 MTP가 한 번에 생성할 수 있는 추측 토큰 수를 제어합니다.
이 설정에서는 RTX 5090의 시작점으로 n-max 4를 사용했습니다. 모델 카드가 이 GGUF에 권장하는 2나 3 같은 값으로도 시험해 보세요. 시스템에 따라 가장 빠른 설정이 조금씩 달라질 수 있습니다.
모델 로딩이 끝나면 llama-server를 통해 Qwen3.8을 http://127.0.0.1:8910에서 로컬로 사용할 수 있습니다.

이제 Qwen3.8-27B가 로컬에서 실행되고 있습니다. 다음으로 API와 내장 브라우저 인터페이스 두 가지 방식으로 모델을 테스트하겠습니다.
4. Qwen3.8-27B 속도와 코딩 성능 테스트
서버가 실행 중인 상태에서, 다른 터미널을 열어 OpenAI 호환 API에 테스트 요청을 보냅니다:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

이 테스트에서 Qwen3.8-27B는 2,000 토큰을 초당 122 토큰 속도로 생성했고, MTP 수용률은 인상적인 84.9%였습니다.
llama.cpp에는 브라우저 인터페이스도 포함되어 있어, API를 사용하지 않고도 모델을 시험해 볼 수 있습니다.
http://127.0.0.1:8910을 브라우저에서 열어 UI를 확인하세요.

좀 더 복잡한 테스트로, 다음 프롬프트를 사용했습니다:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

제 RTX 5090에서는 평균 초당 약 142 토큰을 기록했고, 생성 속도가 간혹 초당 약 170 토큰까지 도달했습니다. 로컬에서 실행되는 27B 모델로서는 매우 빠른 편입니다.

Qwen3.8-27B는 상자에서 바로 실행 가능한 깔끔하고 완성도 높은 웹사이트를 생성했습니다. 모델의 코딩 능력과 로컬 설정의 속도를 빠르게 점검하기에 좋은 방법입니다.
5. Pi와 함께 Qwen3.8-27B 사용하기
이 섹션에서는 Qwen3.8-27B를 Pi에 연결해 완전 로컬 코딩 에이전트로 사용합니다.
Pi는 터미널 기반의 경량 코딩 에이전트로, 커맨드라인에서 직접 프로젝트를 빌드, 편집, 테스트, 디버깅하는 데 도움을 줍니다.
Pi를 설치하세요:
curl -fsSL https://pi.dev/install.sh | sh
설치 프로그램은 Node.js와 npm을 필요로 하며, 전역 npm prefix에 Pi를 설치합니다. Node가 없다면 nvm 또는 패키지 관리자로 먼저 설치하세요.
설치가 완료되면 터미널을 재시작하세요.
다음으로 pi-llama 확장을 설치하고, Pi가 로컬 llama.cpp 서버를 사용하도록 지정합니다:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
새 프로젝트를 만들고 Pi를 시작합니다:
mkdir new-project
cd new-project
Pi

Pi 내부에서 /model을 실행해 llama-cpp를 검색하고 Qwen3.8-27B를 선택하세요.
테스트용으로 다음 프롬프트를 사용했습니다:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

몇 분 만에 전체 프로젝트를 빌드했습니다.

그다음 서버를 시작하고 프런트엔드와 애플리케이션 로직을 모두 테스트하도록 지시했습니다. 모든 기능이 제대로 동작하는지 확인하기 위해 디버깅과 테스트에 더 많은 시간을 썼습니다.

직접 대시보드를 테스트해 보니 앱이 잘 동작했고, 그래프도 보기 좋았으며 전반적인 경험이 매끄러웠습니다.

주된 약점은 UI를 정밀하게 수정하는 부분이었습니다. 여러 차례 후속 프롬프트를 보낸 뒤에는 제가 원하는 바를 정확히 파악하기보다 관계없는 변경을 시도하기 시작해, 결국 그 부분에서 멈췄습니다.
마무리 생각
Qwen3.8-27B는 아직 매우 새롭고, 커뮤니티는 최적의 양자화와 추측 디코딩 조합을 활발히 모색 중입니다. MTP는 매우 잘 작동하지만, DFlash 2와 DSpark 같은 최신 접근도 테스트되고 있으며, 하드웨어와 작업 부하에 따라 더 높은 속도를 보고하는 사용자도 있습니다.
Unsloth도 Qwen3.8-27B용 Dynamic v3.0 GGUF를 방금 출시해, 이전 양자화 대비 동일한 모델 크기에서 약 10% 더 높은 정확도를 주장하고 있습니다. 비슷한 로컬 추론 설정을 유지하면서 더 나은 품질을 원한다면 Unsloth도 매우 흥미로운 선택입니다.
현재로서는 NVFP4 + MTP + llama.cpp 조합이 RTX 5090에서 가장 쉽고 빠른 설정 중 하나라고 생각합니다. 27B 모델에서 큰 컨텍스트 윈도우를 유지하면서도 실전 코딩 에이전트를 구동할 만한 역량을 갖춘 상태로 초당 약 140 토큰을 뽑아내는 것은 인상적입니다. llama.cpp, Unsloth, DFlash 2, DSpark가 계속 발전하면서 이 설정은 더 빨라질 가능성이 큽니다.
Qwen3.8-27B 로컬 실행 FAQ
Qwen3.8-27B를 로컬로 실행하려면 RTX 5090이 꼭 필요한가요?
아니요. Qwen3.8-27B의 일반적인 4비트 GGUF 양자화는 대략 16–19 GB VRAM에 들어가므로 RTX 5080, 4090, 또는 24 GB Mac에서도 모델을 실행할 수 있습니다. 이 설정에서 RTX 5090이 중요한 이유는 NVFP4가 Blackwell 텐서 코어를 필요로 하기 때문입니다. 구형 카드에서는 NVFP4 파일이 실행되더라도 메모리 절감만 있고 속도 향상은 없습니다.
이 구성은 실제로 얼마나 많은 VRAM을 사용하나요?
NVFP4-MTP GGUF는 디스크에서 약 19 GB이며, 컨텍스트가 늘어남에 따라 총 사용량을 끌어올리는 것은 KV 캐시입니다. 매우 긴 컨텍스트에서 q8_0 K/V 양자화를 사용할 경우, 공개된 RTX 5090 실행 사례는 20GB대 중반에 도달하므로 32 GB 카드는 여유롭습니다. 24 GB에서는 --ctx-size를 131072보다 충분히 낮춰야 합니다.
MTP 추측 디코딩은 무엇이며, 손실이 없나요?
Qwen3.8에는 GGUF에 멀티 토큰 예측 레이어가 내장되어 있어, 별도의 초안(draft) 모델 파일 없이도 내장 초안 모델처럼 동작합니다. 드래프트 헤드는 한 번에 여러 토큰을 제안하고, 전체 모델이 이를 검증합니다. 수용된 드래프트는 일반 포워드 패스의 일부만 비용이 들기 때문에 훨씬 저렴합니다. 출력 품질은 변하지 않습니다. 메인 모델이 수용하는 모든 토큰은 어차피 메인 모델이 생성했을 토큰이기 때문입니다.
NVFP4와 일반 Q4_K_M 양자화 중 무엇을 써야 하나요?
최대 속도를 원하고 Blackwell GPU를 사용 중이라면 NVFP4를 선택하세요. Ampere나 Ada를 사용 중이거나, 기가바이트당 출력 품질을 더 중시한다면 Q4_K_M 같은 표준 GGUF나 Unsloth의 UD-Q4_K_XL을 선택하는 편이 좋습니다. 또한 llama.cpp의 NVFP4 지원은 K-quant 경로보다 도입 시점이 더 최근이므로, 변환과 도구 주변에서 아직 거친 부분이 있을 수 있습니다.
Qwen3.8-27B가 비전 모델이라면, 이 설정으로 이미지를 처리할 수 있나요?
Qwen3.8-27B는 네이티브 비전-언어 모델이지만, 텍스트 전용 GGUF 변환에서는 비전 타워가 제거됩니다. 이미지를 사용하려면 보통 같은 저장소나 Unsloth의 GGUF 저장소에 게시된 mmproj 파일을 --mmproj와 함께 모델과 나란히 전달해야 합니다.
