본문으로 바로가기

NVIDIA RTX 5090에서 Qwen3.8-27B를 로컬로 실행하는 방법

Blackwell 네이티브 NVFP4와 MTP 추론 가속으로 Qwen3.8-27B를 로컬에서 실행하고, llama.cpp로 초당 최대 170 토큰을 달성하세요.
업데이트됨 2026년 8월 25일  · 6분 읽다

AI로 탐색하기

ChatGPTClaudePerplexity

Qwen3.8-27B는 로컬 AI에서 가장 인기 있는 모델 중 하나로 빠르게 자리 잡고 있습니다. 파라미터가 270억 개에 불과하지만 코딩, 추론, 에이전트, 범용 벤치마크 전반에서 훨씬 더 큰 모델들과 견줄 만한 성능을 제공합니다. 심지어 여러 분야에서 GLM-5.2 같은 모델에 근접하고 있어, 강력한 로컬 하드웨어를 실험하는 사용자들 사이에서 특히 인기를 끌고 있습니다.

RTX 5090은 Blackwell 아키텍처가 NVFP4를 지원하기 때문에 Qwen3.8-27B에 특히 잘 맞습니다. 이를 통해 출력 품질을 유지하면서도 매우 높은 속도로 모델을 실행할 수 있습니다. 여기에 다중 토큰 예측(MTP)을 통한 추론 가속, 최적화된 llama.cpp 빌드, 적합한 GGUF 모델을 조합하면, 단일 RTX 5090에서 초당 100 토큰을 훌쩍 넘는 속도를 낼 수 있습니다.

이 가이드에서는 RTX 5090 또는 다른 Blackwell GPU에서 속도, 정확도, 긴 컨텍스트 지원 간의 균형을 가장 손쉽게 맞추는 방법을 설정합니다. Blackwell 네이티브 지원으로 llama.cpp를 컴파일하고, Qwen3.8-27B NVFP4-MTP GGUF를 다운로드한 뒤, GPU 가속과 MTP 추론 가속으로 실행합니다. 또한 OpenAI 호환 API와 내장 웹 인터페이스를 테스트하고, 마지막으로 Pi에 연결해 Qwen3.8-27B를 완전 로컬 코딩 에이전트로 사용해 보겠습니다.

1. Blackwell GPU용 llama.cpp 설정

먼저 GPU가 올바르게 감지되는지 확인하고 NVIDIA 드라이버 및 CUDA 버전을 점검합니다.

nvidia-smi

RTX 5090 GPU summary

RTX 5090, 드라이버 버전, CUDA 버전, GPU 메모리, 현재 GPU 사용량이 표시되어야 합니다.

참고: 이 설정은 RTX 5090 같은 NVIDIA Blackwell GPU에 특화되어 있습니다. 아래 빌드는 RTX 5090이 사용하는 컴퓨트 아키텍처인 SM120을 대상으로 합니다.

다음으로 CUDA 지원을 포함한 최신 버전의 llama.cpp를 다운로드해 컴파일합니다.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

여기서 중요한 옵션은 -DCMAKE_CUDA_ARCHITECTURES=120입니다. 이는 RTX 5090에 사용되는 Blackwell 아키텍처에 맞춰 llama.cpp를 빌드하라는 의미입니다.

빌드가 완료되면, 어느 폴더에서나 실행할 수 있도록 llama-server를 전역으로 사용할 수 있게 만듭니다:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

이제 정상 동작하는지 확인합니다:

llama-server --version

출력은 다음과 비슷하게 표시됩니다:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

이제 완료되었습니다. RTX 5090과 그 네이티브 Blackwell NVFP4 지원을 활용할 수 있는 CUDA 활성화 llama.cpp 빌드를 갖췄습니다.

2. Qwen3.8-27B NVFP4-MTP 모델 다운로드

이제 Qwen3.8-27B 모델을 다운로드합니다.

먼저 Hugging Face CLI를 설치합니다:

pip install -U huggingface_hub

모델을 보관할 폴더를 만듭니다:

mkdir -p /workspace/models/qwen38

그다음 NVFP4-MTP GGUF를 다운로드합니다:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

이 버전은 NVFP4를 사용하고 MTP 지원을 포함하고 있어, RTX 5090에서 속도 향상의 많은 부분이 여기서 나오므로 본 설정에 적합합니다.

3. Qwen3.8-27B 서버 시작

이제 본격적으로 시작합니다. Flash Attention, 131K 컨텍스트 윈도우, MTP 추론 가속을 통해 GPU에서 Qwen3.8-27B를 완전히 구동합니다. 

다음 명령을 실행하세요:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

옵션이 많아 보이지만, 대부분은 5090에서 최고의 성능을 끌어내기 위한 설정입니다.

핵심 옵션은 다음과 같습니다:

  • --ctx-size 131072는 대략 131K 컨텍스트 윈도우를 제공합니다.

  • --n-gpu-layers all은 모델을 GPU에 상주시킵니다.

  • --flash-attn onFlash Attention을 활성화합니다.

  • --cache-type-k q8_0--cache-type-v q8_0은 KV 캐시 메모리 사용량을 줄이는 데 도움이 됩니다.

  • --spec-type draft-mtp는 Qwen3.8의 MTP 추론 가속을 활성화합니다.

  • --spec-draft-n-max 4는 한 번에 MTP가 생성할 수 있는 추론 토큰 수를 제어합니다.

이 설정에서는 RTX 5090의 시작점으로 n-max 4를 사용합니다. (이 GGUF에 대해 모델 카드가 권장하는) 23 등으로도 시도해 볼 수 있습니다. 시스템에 따라 최적의 값이 조금씩 달라질 수 있습니다.

모델 로딩이 끝나면 llama-server가 Qwen3.8을 로컬에서 http://127.0.0.1:8910 주소로 제공합니다.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

이제 Qwen3.8-27B가 로컬에서 실행 중입니다. 다음으로 API와 내장 브라우저 인터페이스를 통해 모델을 테스트합니다.

4. Qwen3.8-27B 속도와 코딩 성능 테스트

서버가 실행 중인 상태에서, 다른 터미널을 열어 OpenAI 호환 API에 테스트 요청을 보냅니다:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

이 테스트에서 Qwen3.8-27B는 초당 122 토큰 속도로 2,000 토큰을 생성했으며, MTP 수용률은 인상적인 84.9%였습니다. 

llama.cpp에는 브라우저 인터페이스도 포함되어 있어 API 없이도 모델을 시험해 볼 수 있습니다.

브라우저에서 http://127.0.0.1:8910 를 열어 UI를 확인하세요.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

좀 더 복잡한 테스트로 다음 프롬프트를 사용했습니다:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

제 RTX 5090에서는 평균 초당 약 142 토큰이 나왔고, 때때로 약 170 토큰까지 도달했습니다. 로컬에서 구동하는 27B 모델로는 매우 빠른 속도입니다. 

image4.png

Qwen3.8-27B는 상자에서 바로 실행되는 깔끔하고 완전한 웹사이트를 생성했습니다. 모델의 코딩 능력과 로컬 설정의 속도를 빠르게 점검하는 좋은 방법입니다. 

5. Pi와 함께 Qwen3.8-27B 사용

이 섹션에서는 Qwen3.8-27B를 Pi에 연결해 완전 로컬 코딩 에이전트로 사용합니다.

Pi는 터미널 기반의 경량 코딩 에이전트로, 명령줄에서 직접 프로젝트를 빌드, 편집, 테스트, 디버그하는 데 도움을 줍니다.

Pi는 아래 명령으로 설치합니다:

curl -fsSL https://pi.dev/install.sh | sh

설치 프로그램은 Node.js와 npm을 필요로 하며, Pi를 전역 npm 프리픽스에 설치합니다. Node가 없다면 nvm 또는 패키지 관리자로 먼저 설치하세요.

설치가 완료되면 터미널을 재시작합니다.

다음으로 pi-llama 확장을 설치하고 Pi가 로컬 llama.cpp 서버를 사용하도록 지정합니다:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

새 프로젝트를 만들고 Pi를 시작합니다:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Pi 안에서 /model을 실행하고 llama-cpp를 검색한 뒤 Qwen3.8-27B를 선택하세요.

테스트용으로 다음 프롬프트를 사용했습니다:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

몇 분 만에 전체 프로젝트를 구축했습니다. 

Testing the qwen3.8-27b model with Pi coding agent

이후 서버를 시작하고 프런트엔드와 애플리케이션 로직을 모두 테스트하라고 지시했습니다. 모든 기능이 제대로 동작하는지 확인하기 위해 디버깅과 테스트에 더 많은 시간을 들였습니다.

web dashboard generated with qwen3.8-27b model and Pi coding agent

직접 대시보드를 테스트해 보니 앱이 잘 동작했고, 그래프도 보기 좋았으며 전반적인 사용감이 매끄러웠습니다.

web dashboard generated with qwen3.8-27b model and Pi coding agent

유일한 약점은 정밀한 UI 변경이었습니다. 여러 차례 후속 프롬프트를 보낸 뒤에는 제가 원한 변경을 정확히 이해하지 못하고 관련 없는 수정에 나서서, 결국 그 지점에서 중단했습니다.

마무리 생각

Qwen3.8-27B는 아직 매우 새롭고, 커뮤니티에서는 최적의 양자화와 추론 가속 조합을 활발히 모색 중입니다. MTP는 매우 잘 동작하지만, DFlash 2와 DSpark 같은 최신 접근법도 시험 중이며, 하드웨어와 작업 부하에 따라 더 높은 속도를 보고하는 사용자들도 있습니다. 

Unsloth도 Qwen3.8-27B용 Dynamic v3.0 GGUF를 방금 공개했으며, 이전 양자화 대비 동일한 모델 크기에서 약 10% 더 높은 정확도를 주장합니다. 로컬 추론 설정을 거의 그대로 유지하면서 품질을 높이고 싶다면 Unsloth도 매우 흥미로운 선택지입니다. 

현재로서는 NVFP4 + MTP + llama.cpp 조합이 RTX 5090에서 가장 쉽고 빠른 설정 중 하나라고 봅니다. 27B 모델에서 큰 컨텍스트 윈도우를 유지하고 실제 코딩 에이전트를 구동할 만한 능력을 갖춘 상태로 초당 약 140 토큰을 얻는 것은 인상적입니다. llama.cpp, Unsloth, DFlash 2, DSpark가 계속 발전함에 따라 이 설정은 더욱 빨라질 가능성이 큽니다.

Qwen3.8-27B 로컬 실행 FAQ

Qwen3.8-27B를 로컬로 실행하려면 RTX 5090이 꼭 필요한가요?

아니요. Qwen3.8-27B의 표준 4비트 GGUF 양자화는 약 16–19GB VRAM에 들어가므로 RTX 5080, 4090, 24GB Mac에서도 모델을 실행할 수 있습니다. 이 가이드의 특정 설정에서 RTX 5090이 중요한 이유는 NVFP4가 Blackwell 텐서 코어를 필요로 하기 때문입니다. 구형 카드에서도 NVFP4 파일은 실행되지만, 메모리 절감만 있고 속도 향상은 없습니다.

이 구성은 실제로 VRAM을 얼마나 사용하나요?

NVFP4-MTP GGUF는 디스크 기준 약 19GB이며, 컨텍스트가 커질수록 총 사용량을 끌어올리는 것은 KV 캐시입니다. 매우 긴 컨텍스트에서 q8_0 K/V 양자화를 사용할 경우, 공개된 RTX 5090 실행 사례는 VRAM 사용량이 20GB대 중반에 형성되므로 32GB 카드가 여유롭습니다. 24GB 카드에서는 --ctx-size131072보다 상당히 낮춰야 합니다.

MTP 추론 가속은 무엇이며 손실이 없나요?

Qwen3.8은 GGUF에 다중 토큰 예측 레이어가 내장되어 있어, 별도 파일 없이도 내장 드래프트 모델처럼 동작합니다. 드래프트 헤드는 한 번에 여러 토큰을 제안하고, 전체 모델이 이를 검증합니다. 수용된 드래프트는 일반 포워드 패스의 일부만 비용이 들며, 출력 품질은 변하지 않습니다. 메인 모델이 수용한 각 토큰은 원래도 모델이 생성했을 토큰이기 때문입니다.

NVFP4와 일반 Q4_K_M 중 무엇을 써야 하나요?

최대 속도를 원하고 Blackwell GPU를 사용한다면 NVFP4를 선택하세요. Ampere나 Ada를 사용하거나, GB당 출력 품질을 더 중시한다면 Q4_K_M 같은 표준 GGUF 또는 Unsloth의 UD-Q4_K_XL을 선택하는 편이 좋습니다. 또한 llama.cpp에서 NVFP4 지원은 K-quant 경로보다 도입 시기가 더 최근이므로, 변환 및 도구 체인에서 미세한 이슈가 더 있을 수 있습니다.

Qwen3.8-27B가 비전 모델인 만큼, 이 설정으로 이미지도 처리할 수 있나요?

Qwen3.8-27B는 네이티브 비전-언어 모델이지만, 텍스트 전용 GGUF 변환에서는 비전 타워가 제거됩니다. 이미지를 사용하려면 보통 같은 저장소나 Unsloth의 GGUF 저장소에 게시된 mmproj 파일을 --mmproj와 함께 모델에 전달해 멀티모달 프로젝터를 함께 로드해야 합니다.

주제

DataCamp과 함께 AI Engineer가 되어 보세요!

tracks

개발자를 위한 AI 엔지니어 보조

26
API와 오픈소스 라이브러리를 사용해 소프트웨어 애플리케이션에 AI를 통합하는 방법을 배우세요. 오늘 바로 AI 엔지니어가 되는 여정을 시작하세요!
자세히 보기Right Arrow
강좌 시작
더 보기Right Arrow