본문으로 바로가기

NVIDIA RTX 5090에서 Qwen3.8-27B를 로컬로 실행하는 방법

Blackwell 네이티브 NVFP4와 MTP 추측 디코딩으로 Qwen3.8-27B를 로컬에서 실행하는 방법을 알아보세요. llama.cpp로 초당 최대 170 토큰을 달성합니다.
업데이트됨 2026년 8월 31일  · 6분 읽다

AI로 탐색하기

ChatGPTClaudePerplexity

Qwen3.8-27B는 로컬 AI에서 가장 인기 있는 모델 중 하나로 빠르게 자리 잡고 있습니다. 파라미터가 270억 개에 불과하지만, 코딩, 추론, 에이전트, 범용 벤치마크 전반에서 훨씬 큰 모델들과 경쟁하는 성능을 제공합니다. 심지어 여러 영역에서 GLM-5.2 같은 모델에 근접하고 있어, 강력한 로컬 하드웨어로 실험하는 사용자들 사이에서 특히 인기가 높습니다.

RTX 5090은 Blackwell 아키텍처가 NVFP4를 지원해 출력 품질을 유지하면서 매우 빠른 속도로 모델을 실행할 수 있기 때문에, Qwen3.8-27B와 특히 잘 맞습니다. 여기에 멀티 토큰 예측(MTP)을 통한 추측 디코딩, 최적화된 llama.cpp 빌드, 맞는 GGUF 모델을 결합하면, Qwen3.8-27B는 단일 RTX 5090에서 초당 100 토큰을 훌쩍 넘는 속도를 낼 수 있습니다.

이 가이드에서는 RTX 5090 또는 다른 Blackwell GPU에서 속도, 정확도, 롱 컨텍스트 지원의 균형을 가장 쉽게 맞추는 방법을 설정합니다. Blackwell 네이티브 지원으로 llama.cpp를 컴파일하고, Qwen3.8-27B NVFP4-MTP GGUF를 다운로드해 GPU 가속과 MTP 추측 디코딩으로 실행합니다. OpenAI 호환 API와 내장 웹 인터페이스를 테스트한 뒤, 마지막으로 Pi에 연결해 Qwen3.8-27B를 완전 로컬 코딩 에이전트로 활용해 보겠습니다.

또한 Qwen3.8-Flash-Next 가이드, 최신 Qwen4 프리뷰, 그리고 Qwen3.8-Flash-Next를 로컬로 실행하는 방법 튜토리얼도 참고하시기 바랍니다.

1. Blackwell GPU용 llama.cpp 설정

먼저 GPU가 제대로 인식되는지 확인하고 NVIDIA 드라이버와 CUDA 버전을 점검합니다.

nvidia-smi

RTX 5090 GPU summary

RTX 5090, 드라이버 버전, CUDA 버전, GPU 메모리, 현재 GPU 사용량이 표시되어야 합니다.

참고: 이 설정은 RTX 5090과 같은 NVIDIA Blackwell GPU에 특화되어 있습니다. 아래 빌드는 RTX 5090이 사용하는 컴퓨트 아키텍처인 SM120을 대상으로 합니다.

다음으로 CUDA 지원을 포함한 최신 llama.cpp를 다운로드하고 컴파일합니다.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

여기서 중요한 부분은 -DCMAKE_CUDA_ARCHITECTURES=120입니다. 이는 RTX 5090에 사용되는 Blackwell 아키텍처를 대상으로 llama.cpp를 빌드하라는 의미입니다.

빌드가 완료되면, 임의 폴더에서 실행할 수 있도록 llama-server를 전역으로 사용 가능하게 만듭니다:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

이제 모든 것이 정상 동작하는지 확인합니다:

llama-server --version

다음과 유사한 출력이 표시됩니다:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

이제 끝입니다. RTX 5090과 Blackwell 네이티브 NVFP4를 활용할 수 있는 CUDA 활성화 llama.cpp 빌드를 준비했습니다.

2. Qwen3.8-27B NVFP4-MTP 모델 다운로드

이제 Qwen3.8-27B 모델을 다운로드합니다.

먼저 Hugging Face CLI를 설치합니다:

pip install -U huggingface_hub

모델을 보관할 폴더를 만듭니다:

mkdir -p /workspace/models/qwen38

그다음 NVFP4-MTP GGUF를 다운로드합니다:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

이 버전은 NVFP4를 사용하고 MTP 지원을 포함하고 있어, RTX 5090에서 속도 향상이 큰 이 설정에 적합합니다.

3. Qwen3.8-27B 서버 시작

이제 재미있는 부분입니다. GPU에서 완전히 서빙하면서 Flash Attention, 131K 컨텍스트 윈도우, 그리고 더 빠른 생성을 위한 MTP 추측 디코딩을 사용합니다. 

다음 명령을 실행하세요:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

옵션이 많지만, 대부분은 5090에서 최고의 성능을 끌어내기 위한 설정입니다.

핵심 옵션은 다음과 같습니다:

  • --ctx-size 131072는 대략 131K 컨텍스트 윈도우를 제공합니다.

  • --n-gpu-layers all은 모델을 GPU에 유지합니다.

  • --flash-attn onFlash Attention을 활성화합니다.

  • --cache-type-k q8_0--cache-type-v q8_0는 KV 캐시 메모리 사용량을 줄이는 데 도움이 됩니다.

  • --spec-type draft-mtp는 Qwen3.8의 MTP 추측 디코딩을 활성화합니다.

  • --spec-draft-n-max 4는 MTP가 한 번에 생성할 수 있는 추측 토큰 수를 제어합니다.

이 설정에서는 RTX 5090의 시작점으로 n-max 4를 사용했습니다. 모델 카드가 이 GGUF에 권장하는 23 같은 값으로도 시험해 보세요. 시스템에 따라 가장 빠른 설정이 조금씩 달라질 수 있습니다.

모델 로딩이 끝나면 llama-server를 통해 Qwen3.8을 http://127.0.0.1:8910에서 로컬로 사용할 수 있습니다.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

이제 Qwen3.8-27B가 로컬에서 실행되고 있습니다. 다음으로 API와 내장 브라우저 인터페이스 두 가지 방식으로 모델을 테스트하겠습니다.

4. Qwen3.8-27B 속도와 코딩 성능 테스트

서버가 실행 중인 상태에서, 다른 터미널을 열어 OpenAI 호환 API에 테스트 요청을 보냅니다:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

이 테스트에서 Qwen3.8-27B는 2,000 토큰을 초당 122 토큰 속도로 생성했고, MTP 수용률은 인상적인 84.9%였습니다. 

llama.cpp에는 브라우저 인터페이스도 포함되어 있어, API를 사용하지 않고도 모델을 시험해 볼 수 있습니다.

http://127.0.0.1:8910을 브라우저에서 열어 UI를 확인하세요.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

좀 더 복잡한 테스트로, 다음 프롬프트를 사용했습니다:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

제 RTX 5090에서는 평균 초당 약 142 토큰을 기록했고, 생성 속도가 간혹 초당 약 170 토큰까지 도달했습니다. 로컬에서 실행되는 27B 모델로서는 매우 빠른 편입니다. 

image4.png

Qwen3.8-27B는 상자에서 바로 실행 가능한 깔끔하고 완성도 높은 웹사이트를 생성했습니다. 모델의 코딩 능력과 로컬 설정의 속도를 빠르게 점검하기에 좋은 방법입니다. 

5. Pi와 함께 Qwen3.8-27B 사용하기

이 섹션에서는 Qwen3.8-27B를 Pi에 연결해 완전 로컬 코딩 에이전트로 사용합니다.

Pi는 터미널 기반의 경량 코딩 에이전트로, 커맨드라인에서 직접 프로젝트를 빌드, 편집, 테스트, 디버깅하는 데 도움을 줍니다.

Pi를 설치하세요:

curl -fsSL https://pi.dev/install.sh | sh

설치 프로그램은 Node.js와 npm을 필요로 하며, 전역 npm prefix에 Pi를 설치합니다. Node가 없다면 nvm 또는 패키지 관리자로 먼저 설치하세요.

설치가 완료되면 터미널을 재시작하세요.

다음으로 pi-llama 확장을 설치하고, Pi가 로컬 llama.cpp 서버를 사용하도록 지정합니다:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

새 프로젝트를 만들고 Pi를 시작합니다:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi 내부에서 /model을 실행해 llama-cpp를 검색하고 Qwen3.8-27B를 선택하세요.

테스트용으로 다음 프롬프트를 사용했습니다:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

몇 분 만에 전체 프로젝트를 빌드했습니다. 

Testing the qwen3.8-27b model with Pi coding agent

그다음 서버를 시작하고 프런트엔드와 애플리케이션 로직을 모두 테스트하도록 지시했습니다. 모든 기능이 제대로 동작하는지 확인하기 위해 디버깅과 테스트에 더 많은 시간을 썼습니다.

web dashboard generated with qwen3.8-27b model and Pi coding agent

직접 대시보드를 테스트해 보니 앱이 잘 동작했고, 그래프도 보기 좋았으며 전반적인 경험이 매끄러웠습니다.

web dashboard generated with qwen3.8-27b model and Pi coding agent

주된 약점은 UI를 정밀하게 수정하는 부분이었습니다. 여러 차례 후속 프롬프트를 보낸 뒤에는 제가 원하는 바를 정확히 파악하기보다 관계없는 변경을 시도하기 시작해, 결국 그 부분에서 멈췄습니다.

마무리 생각

Qwen3.8-27B는 아직 매우 새롭고, 커뮤니티는 최적의 양자화와 추측 디코딩 조합을 활발히 모색 중입니다. MTP는 매우 잘 작동하지만, DFlash 2와 DSpark 같은 최신 접근도 테스트되고 있으며, 하드웨어와 작업 부하에 따라 더 높은 속도를 보고하는 사용자도 있습니다. 

Unsloth도 Qwen3.8-27B용 Dynamic v3.0 GGUF를 방금 출시해, 이전 양자화 대비 동일한 모델 크기에서 약 10% 더 높은 정확도를 주장하고 있습니다. 비슷한 로컬 추론 설정을 유지하면서 더 나은 품질을 원한다면 Unsloth도 매우 흥미로운 선택입니다. 

현재로서는 NVFP4 + MTP + llama.cpp 조합이 RTX 5090에서 가장 쉽고 빠른 설정 중 하나라고 생각합니다. 27B 모델에서 큰 컨텍스트 윈도우를 유지하면서도 실전 코딩 에이전트를 구동할 만한 역량을 갖춘 상태로 초당 약 140 토큰을 뽑아내는 것은 인상적입니다. llama.cpp, Unsloth, DFlash 2, DSpark가 계속 발전하면서 이 설정은 더 빨라질 가능성이 큽니다.

Qwen3.8-27B 로컬 실행 FAQ

Qwen3.8-27B를 로컬로 실행하려면 RTX 5090이 꼭 필요한가요?

아니요. Qwen3.8-27B의 일반적인 4비트 GGUF 양자화는 대략 16–19 GB VRAM에 들어가므로 RTX 5080, 4090, 또는 24 GB Mac에서도 모델을 실행할 수 있습니다. 이 설정에서 RTX 5090이 중요한 이유는 NVFP4가 Blackwell 텐서 코어를 필요로 하기 때문입니다. 구형 카드에서는 NVFP4 파일이 실행되더라도 메모리 절감만 있고 속도 향상은 없습니다.

이 구성은 실제로 얼마나 많은 VRAM을 사용하나요?

NVFP4-MTP GGUF는 디스크에서 약 19 GB이며, 컨텍스트가 늘어남에 따라 총 사용량을 끌어올리는 것은 KV 캐시입니다. 매우 긴 컨텍스트에서 q8_0 K/V 양자화를 사용할 경우, 공개된 RTX 5090 실행 사례는 20GB대 중반에 도달하므로 32 GB 카드는 여유롭습니다. 24 GB에서는 --ctx-size131072보다 충분히 낮춰야 합니다.

MTP 추측 디코딩은 무엇이며, 손실이 없나요?

Qwen3.8에는 GGUF에 멀티 토큰 예측 레이어가 내장되어 있어, 별도의 초안(draft) 모델 파일 없이도 내장 초안 모델처럼 동작합니다. 드래프트 헤드는 한 번에 여러 토큰을 제안하고, 전체 모델이 이를 검증합니다. 수용된 드래프트는 일반 포워드 패스의 일부만 비용이 들기 때문에 훨씬 저렴합니다. 출력 품질은 변하지 않습니다. 메인 모델이 수용하는 모든 토큰은 어차피 메인 모델이 생성했을 토큰이기 때문입니다.

NVFP4와 일반 Q4_K_M 양자화 중 무엇을 써야 하나요?

최대 속도를 원하고 Blackwell GPU를 사용 중이라면 NVFP4를 선택하세요. Ampere나 Ada를 사용 중이거나, 기가바이트당 출력 품질을 더 중시한다면 Q4_K_M 같은 표준 GGUF나 Unsloth의 UD-Q4_K_XL을 선택하는 편이 좋습니다. 또한 llama.cpp의 NVFP4 지원은 K-quant 경로보다 도입 시점이 더 최근이므로, 변환과 도구 주변에서 아직 거친 부분이 있을 수 있습니다.

Qwen3.8-27B가 비전 모델이라면, 이 설정으로 이미지를 처리할 수 있나요?

Qwen3.8-27B는 네이티브 비전-언어 모델이지만, 텍스트 전용 GGUF 변환에서는 비전 타워가 제거됩니다. 이미지를 사용하려면 보통 같은 저장소나 Unsloth의 GGUF 저장소에 게시된 mmproj 파일을 --mmproj와 함께 모델과 나란히 전달해야 합니다.

주제
인공지능

DataCamp과 함께 AI 엔지니어가 되세요!

tracks

개발자를 위한 AI 엔지니어 보조

26
API와 오픈소스 라이브러리를 사용해 소프트웨어 애플리케이션에 AI를 통합하는 방법을 배우세요. 오늘 바로 AI 엔지니어가 되는 여정을 시작하세요!
자세히 보기Right Arrow
강좌 시작
더 보기Right Arrow