Lewati ke konten utama

Cara Menjalankan Qwen3.8-27B Secara Lokal di NVIDIA RTX 5090

Pelajari cara menjalankan Qwen3.8-27B secara lokal dengan NVFP4 native Blackwell dan decoding spekulatif MTP, mencapai hingga 170 token per detik dengan llama.cpp.
Diperbarui 25 Agu 2026  · 6 mnt baca

Jelajahi dengan AI

ChatGPTClaudePerplexity

Qwen3.8-27B dengan cepat menjadi salah satu model paling populer untuk AI lokal. Meski hanya memiliki 27 miliar parameter, model ini memberikan kinerja yang menyaingi model yang jauh lebih besar di berbagai tolok ukur pengkodean, penalaran, agen, dan tujuan umum. Model ini bahkan mendekati model seperti GLM-5.2 di beberapa area, sehingga sangat populer di kalangan pengguna yang bereksperimen dengan perangkat keras lokal yang bertenaga.

RTX 5090 sangat cocok untuk Qwen3.8-27B karena arsitektur Blackwell-nya mendukung NVFP4, memungkinkan model berjalan sangat cepat sambil mempertahankan kualitas keluaran yang kuat. Dikombinasikan dengan decoding spekulatif melalui prediksi multi-token (MTP), build llama.cpp yang dioptimalkan, dan model GGUF yang tepat, Qwen3.8-27B dapat menghasilkan lebih dari 100 token per detik pada satu RTX 5090.

Dalam panduan ini, kita akan menyiapkan salah satu cara termudah untuk mendapatkan keseimbangan terbaik antara kecepatan, akurasi, dan dukungan konteks panjang di RTX 5090 atau GPU Blackwell lainnya. Kita akan mengompilasi llama.cpp dengan dukungan Blackwell native, mengunduh Qwen3.8-27B NVFP4-MTP GGUF, menjalankannya dengan akselerasi GPU dan decoding spekulatif MTP, menguji API yang kompatibel dengan OpenAI dan antarmuka web bawaan, dan akhirnya menghubungkannya ke Pi agar kita bisa menggunakan Qwen3.8-27B sebagai agen pengodean lokal sepenuhnya.

1. Siapkan llama.cpp untuk GPU Blackwell

Pertama, kita pastikan GPU terdeteksi dengan benar dan periksa versi driver NVIDIA serta CUDA.

nvidia-smi

RTX 5090 GPU summary

Anda seharusnya melihat RTX 5090 Anda, versi driver, versi CUDA, memori GPU, dan penggunaan GPU saat ini.

Catatan: Penyiapan ini khusus untuk GPU NVIDIA Blackwell, seperti RTX 5090. Build di bawah ini menargetkan SM120, yaitu arsitektur komputasi yang digunakan oleh RTX 5090.

Selanjutnya, kita akan mengunduh dan mengompilasi versi terbaru llama.cpp dengan dukungan CUDA.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Building llama.cpp for the RTX 5090  GPU

Bagian penting di sini adalah -DCMAKE_CUDA_ARCHITECTURES=120. Ini memberi tahu llama.cpp untuk membangun khusus untuk arsitektur Blackwell yang digunakan oleh RTX 5090.

Setelah build selesai, kita akan membuat llama-server tersedia secara global sehingga bisa dijalankan dari folder mana pun:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Sekarang, periksa apakah semuanya berjalan dengan baik:

llama-server --version

Anda akan mendapatkan keluaran yang mirip dengan:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Selesai. Kita kini memiliki build llama.cpp berkemampuan CUDA yang dapat memanfaatkan RTX 5090 dan dukungan NVFP4 Blackwell native-nya.

2. Unduh Model Qwen3.8-27B NVFP4-MTP

Sekarang kita akan mengunduh model Qwen3.8-27B.

Pertama, instal Hugging Face CLI:

pip install -U huggingface_hub

Buat folder untuk menyimpan model:

mkdir -p /workspace/models/qwen38

Lalu unduh NVFP4-MTP GGUF:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Downloading the Qwen3.8-27B-NVFP4-MTP-GGUF

Ini adalah versi yang kita inginkan untuk penyiapan ini karena menggunakan NVFP4 dan menyertakan dukungan MTP, yang menjadi sumber utama peningkatan kecepatan pada RTX 5090.

3. Jalankan Server Qwen3.8-27B

Sekarang bagian yang menyenangkan. Kita akan menyajikan Qwen3.8-27B sepenuhnya di GPU dengan Flash Attention, jendela konteks 131K, dan decoding spekulatif MTP untuk generasi yang lebih cepat. 

Jalankan:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Ada banyak opsi di sini, namun sebagian besar ditujukan untuk mendapatkan performa terbaik dari 5090.

Opsi utama yang perlu diketahui:

  • --ctx-size 131072 memberi kita jendela konteks sekitar 131K.

  • --n-gpu-layers all menjaga model tetap di GPU.

  • --flash-attn on mengaktifkan Flash Attention.

  • --cache-type-k q8_0 dan --cache-type-v q8_0 membantu mengurangi penggunaan memori cache KV.

  • --spec-type draft-mtp mengaktifkan decoding spekulatif MTP milik Qwen3.8.

  • --spec-draft-n-max 4 mengatur berapa banyak token spekulatif yang dapat dihasilkan MTP sekaligus.

Untuk penyiapan ini, kita menggunakan n-max 4 sebagai titik awal untuk RTX 5090. Anda bisa bereksperimen dengan nilai seperti 2 (yang direkomendasikan kartu model untuk GGUF ini) atau 3 setelahnya, karena setelan tercepat bisa sedikit bervariasi tergantung sistem Anda.

Setelah llama-server selesai memuat model, Qwen3.8 akan tersedia secara lokal di http://127.0.0.1:8910.

Serving the Qwen3.8-27B-NVFP4-MTP-GGUF using the llama.cpp

Kini kita telah menjalankan Qwen3.8-27B secara lokal. Selanjutnya, kita akan menguji model melalui API dan antarmuka peramban bawaan.

4. Uji Kecepatan dan Performa Koding Qwen3.8-27B

Dengan server berjalan, buka terminal lain dan kirim permintaan uji ke API yang kompatibel dengan OpenAI:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF using the CURL command

Dalam pengujian ini, Qwen3.8-27B menghasilkan 2.000 token pada 122 token/detik dengan tingkat penerimaan MTP yang mengesankan sebesar 84,9%. 

llama.cpp juga menyertakan antarmuka peramban, sehingga Anda bisa menguji model tanpa menggunakan API.

Buka http://127.0.0.1:8910 di peramban Anda untuk melihat UI.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui

Untuk pengujian yang lebih kompleks, saya menggunakan prompt ini:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Testing the Qwen3.8-27B-NVFP4-MTP-GGUF inside the llama.cpp webui on coding task

Pada RTX 5090 saya, rata-rata kecepatan sekitar 142 token per detik, dengan kecepatan generasi sesekali mencapai sekitar 170 token per detik, yang sangat cepat untuk model 27B yang berjalan secara lokal. 

image4.png

Qwen3.8-27B menghasilkan situs web yang rapi dan berfungsi penuh yang langsung bisa dijalankan. Ini adalah cara yang baik untuk menguji kemampuan koding model sekaligus kecepatan penyiapan lokal.

5. Gunakan Qwen3.8-27B dengan Pi

Di bagian ini, kita akan menghubungkan Qwen3.8-27B ke Pi dan menggunakannya sebagai agen pengodean lokal sepenuhnya.

Pi adalah agen pengodean berbasis terminal yang ringan, yang dapat membantu Anda membangun, mengedit, menguji, dan men-debug proyek langsung dari command line.

Instal Pi dengan:

curl -fsSL https://pi.dev/install.sh | sh

Installer memerlukan Node.js dan npm. Ia memasang Pi ke prefix npm global Anda. Jika Anda belum memiliki Node, instal terlebih dahulu dengan nvm atau manajer paket Anda.

Setelah pemasangan selesai, mulai ulang terminal Anda.

Selanjutnya, instal ekstensi pi-llama dan arahkan Pi ke server llama.cpp lokal kita:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Buat proyek baru dan jalankan Pi:

mkdir new-project
cd new-project

Pi

Setting up the qwen3.8-27b in the Pi coding agent

Di dalam Pi, jalankan /model, cari llama-cpp dan pilih Qwen3.8-27B.

Untuk pengujian, saya memberinya prompt ini:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Testing the qwen3.8-27b model with Pi coding agent

Model ini membangun seluruh proyek dalam beberapa menit. 

Testing the qwen3.8-27b model with Pi coding agent

Saya kemudian memintanya untuk menjalankan server dan menguji frontend serta logika aplikasi. Ia menghabiskan lebih banyak waktu untuk debugging dan pengujian guna memastikan semuanya berjalan dengan baik.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Saat saya menguji dashboard sendiri, aplikasinya berjalan baik, grafiknya terlihat bagus, dan pengalaman keseluruhan terasa mulus.

web dashboard generated with qwen3.8-27b model and Pi coding agent

Kelemahan utamanya adalah membuat perubahan UI yang presisi. Setelah beberapa prompt lanjutan, model mulai membuat perubahan yang tidak terkait alih-alih memahami dengan tepat apa yang saya inginkan, jadi akhirnya saya berhenti di situ.

Penutup

Qwen3.8-27B masih sangat baru, dan komunitas sedang aktif mencari kombinasi terbaik antara kuantisasi dan decoding spekulatif. MTP bekerja sangat baik, tetapi pendekatan yang lebih baru seperti DFlash 2 dan DSpark juga sedang diuji, dengan beberapa pengguna melaporkan kecepatan yang lebih tinggi tergantung perangkat keras dan beban kerja. 

Unsloth juga baru merilis GGUF Dynamic v3.0 untuk Qwen3.8-27B, mengklaim sekitar 10% akurasi lebih tinggi pada ukuran model yang sama dibandingkan kuantisasi sebelumnya. Ini membuat Unsloth menjadi opsi lain yang sangat menarik jika Anda menginginkan kualitas lebih baik sambil mempertahankan penyiapan inferensi lokal yang kurang lebih sama. 

Untuk saat ini, saya rasa NVFP4 + MTP + llama.cpp adalah salah satu penyiapan termudah dan tercepat untuk RTX 5090. Mendapatkan sekitar 140 token per detik dari model 27B sambil tetap memiliki jendela konteks yang besar dan kemampuan yang cukup untuk menjalankan agen koding nyata sangatlah impresif. Penyiapan ini kemungkinan akan makin cepat seiring perbaikan pada llama.cpp, Unsloth, DFlash 2, dan DSpark.

FAQ Menjalankan Qwen3.8-27B Secara Lokal

Apakah Anda memerlukan RTX 5090 untuk menjalankan Qwen3.8-27B secara lokal?

Tidak. Kuantisasi GGUF 4-bit standar dari Qwen3.8-27B muat dalam sekitar 16–19 GB VRAM, jadi RTX 5080, 4090, atau Mac 24 GB akan dapat menjalankan modelnya. RTX 5090 penting untuk penyiapan spesifik ini karena NVFP4 memerlukan tensor core Blackwell. Pada kartu yang lebih lama, berkas NVFP4 bisa dijalankan tetapi hanya memberi penghematan memori, bukan peningkatan kecepatan.

Berapa banyak VRAM yang sebenarnya digunakan konfigurasi ini?

NVFP4-MTP GGUF berukuran sekitar 19 GB di disk, dan cache KV yang mendorong total penggunaan naik seiring pertumbuhan konteks. Dengan kuantisasi K/V q8_0 pada konteks yang sangat panjang, hasil yang dipublikasikan untuk RTX 5090 berada di kisaran pertengahan 20-an GB, jadi kartu 32 GB terasa lega. Pada 24 GB Anda perlu menurunkan --ctx-size jauh di bawah 131072.

Apa yang dilakukan decoding spekulatif MTP, dan apakah ini lossless?

Qwen3.8 hadir dengan lapisan prediksi multi-token yang sudah tertanam di GGUF, yang bertindak sebagai model draf bawaan, tanpa memerlukan berkas kedua. Kepala draf mengusulkan beberapa token sekaligus, dan model penuh memverifikasinya, sehingga draf yang diterima hanya memakan sebagian kecil dari biaya forward pass normal. Kualitas keluaran tidak berubah, karena setiap token yang diterima model utama adalah token yang memang akan dihasilkannya.

Haruskah Anda menggunakan NVFP4 atau kuantisasi Q4_K_M biasa?

Pilih NVFP4 jika Anda memiliki GPU Blackwell dan menginginkan kecepatan maksimum; pilih GGUF standar seperti Q4_K_M atau UD-Q4_K_XL dari Unsloth jika Anda menggunakan Ampere atau Ada, atau jika Anda lebih mementingkan kualitas keluaran per gigabyte. Dukungan NVFP4 di llama.cpp juga lebih baru dibandingkan jalur K-quant, jadi harapkan lebih banyak kekasaran di sekitar proses konversi dan tooling.

Bisakah penyiapan ini menangani gambar, mengingat Qwen3.8-27B adalah model visi?

Qwen3.8-27B adalah model vision-language native, tetapi konversi GGUF teks-saja menghapus vision tower. Untuk menggunakan gambar, Anda perlu meneruskan projector multimodal bersama model dengan --mmproj, biasanya berkas mmproj yang dipublikasikan di repo yang sama atau di repo GGUF milik Unsloth.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sebagai data scientist tersertifikasi, saya bersemangat memanfaatkan teknologi mutakhir untuk menciptakan aplikasi machine learning yang inovatif. Dengan latar belakang kuat di pengenalan ucapan, analisis dan pelaporan data, MLOps, conversational AI, dan NLP, saya mengasah keterampilan dalam mengembangkan sistem cerdas yang berdampak nyata. Selain keahlian teknis, saya juga komunikator andal yang mampu menyederhanakan konsep kompleks menjadi bahasa yang jelas dan ringkas. Karena itu, saya menjadi blogger yang dicari di bidang data science, membagikan wawasan dan pengalaman kepada komunitas profesional data yang terus berkembang. Saat ini, saya berfokus pada pembuatan dan penyuntingan konten, bekerja dengan large language model untuk mengembangkan konten yang kuat dan menarik agar membantu bisnis dan individu memaksimalkan data mereka.

Topik

Jadilah AI Engineer Bersama DataCamp!

Program

Insinyur Kecerdasan Buatan (AI) untuk Pengembang

26 Hr
Pelajari cara mengintegrasikan kecerdasan buatan (AI) ke dalam aplikasi perangkat lunak menggunakan antarmuka pemrograman aplikasi (API) dan perpustakaan sumber terbuka. Mulailah perjalanan Anda untuk menjadi seorang Insinyur Kecerdasan Buatan (AI) hari ini!
Lihat DetailRight Arrow
Mulai Kursus
Lihat Lebih BanyakRight Arrow