Lewati ke konten utama

Cara Menjalankan Qwen3.8-27B Secara Lokal di NVIDIA RTX 5090

Pelajari cara menjalankan Qwen3.8-27B secara lokal dengan NVFP4 native Blackwell dan decoding spekulatif MTP, mencapai hingga 170 token per detik dengan llama.cpp.
Diperbarui 31 Agu 2026  · 6 mnt baca

Jelajahi dengan AI

ChatGPTClaudePerplexity

Qwen3.8-27B dengan cepat menjadi salah satu model paling populer untuk AI lokal. Meski hanya memiliki 27 miliar parameter, model ini memberikan performa yang menyaingi model yang jauh lebih besar pada tolok ukur pengodean, penalaran, agen, dan tujuan umum. Model ini bahkan mendekati model seperti GLM-5.2 di beberapa area, yang membuatnya sangat populer di kalangan pengguna yang bereksperimen dengan perangkat keras lokal yang bertenaga.

RTX 5090 sangat cocok untuk Qwen3.8-27B karena arsitektur Blackwell-nya mendukung NVFP4, memungkinkan model berjalan dengan kecepatan sangat tinggi sambil mempertahankan kualitas keluaran yang kuat. Dikombinasikan dengan decoding spekulatif melalui multi-token prediction (MTP), build llama.cpp yang dioptimalkan, dan model GGUF yang tepat, Qwen3.8-27B dapat menghasilkan lebih dari 100 token per detik pada satu RTX 5090.

Dalam panduan ini, kita akan menyiapkan salah satu cara termudah menurut saya untuk mendapatkan keseimbangan terbaik antara kecepatan, akurasi, dan dukungan konteks panjang di RTX 5090 atau GPU Blackwell lainnya. Kita akan mengompilasi llama.cpp dengan dukungan native Blackwell, mengunduh Qwen3.8-27B NVFP4-MTP GGUF, menjalankannya dengan akselerasi GPU dan decoding spekulatif MTP, menguji API yang kompatibel dengan OpenAI dan antarmuka web bawaan, dan akhirnya menghubungkannya ke Pi sehingga kita dapat menggunakan Qwen3.8-27B sebagai agen pengodean sepenuhnya lokal.

Saya juga menyarankan untuk melihat panduan Qwen3.8-Flash-Next, pratinjau terbaru dari Qwen4, dan tutorial cara menjalankan Qwen3.8-Flash-Next secara lokal.

1. Siapkan llama.cpp untuk GPU Blackwell

Pertama, pastikan GPU terdeteksi dengan benar dan periksa versi driver NVIDIA serta CUDA.

nvidia-smi

Ringkasan GPU RTX 5090

Anda akan melihat RTX 5090 Anda, versi driver, versi CUDA, memori GPU, dan penggunaan GPU saat ini.

Catatan: Penyiapan ini khusus untuk GPU NVIDIA Blackwell, seperti RTX 5090. Build di bawah ini menargetkan SM120, yaitu arsitektur komputasi yang digunakan oleh RTX 5090.

Selanjutnya, kita akan mengunduh dan mengompilasi versi terbaru llama.cpp dengan dukungan CUDA.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Membangun llama.cpp untuk GPU RTX 5090

Bagian penting di sini adalah -DCMAKE_CUDA_ARCHITECTURES=120. Ini memberi tahu llama.cpp untuk membangun khusus untuk arsitektur Blackwell yang digunakan oleh RTX 5090.

Setelah build selesai, kita akan membuat llama-server tersedia secara global sehingga dapat dijalankan dari folder mana pun:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Sekarang, periksa apakah semuanya berfungsi:

llama-server --version

Anda akan mendapatkan keluaran serupa dengan:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Selesai. Kita sekarang memiliki build llama.cpp berkemampuan CUDA yang dapat memanfaatkan RTX 5090 dan dukungan NVFP4 native Blackwell.

2. Unduh Model Qwen3.8-27B NVFP4-MTP

Sekarang kita akan mengunduh model Qwen3.8-27B.

Pertama, instal Hugging Face CLI:

pip install -U huggingface_hub

Buat folder tempat kita akan menyimpan model:

mkdir -p /workspace/models/qwen38

Lalu unduh NVFP4-MTP GGUF:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Mengunduh Qwen3.8-27B-NVFP4-MTP-GGUF

Ini adalah versi yang kita inginkan untuk penyiapan ini karena menggunakan NVFP4 dan mencakup dukungan MTP, yang menjadi sumber utama peningkatan kecepatan pada RTX 5090.

3. Mulai Server Qwen3.8-27B

Sekarang bagian yang menyenangkan. Kita akan menyajikan Qwen3.8-27B sepenuhnya di GPU dengan Flash Attention, jendela konteks 131K, dan decoding spekulatif MTP untuk generasi yang lebih cepat. 

Jalankan:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Ada banyak opsi di sini, namun sebagian besar hanya untuk mendapatkan performa terbaik dari 5090.

Yang utama untuk diketahui adalah:

  • --ctx-size 131072 memberi kita jendela konteks sekitar 131K.

  • --n-gpu-layers all menjaga model tetap di GPU.

  • --flash-attn on mengaktifkan Flash Attention.

  • --cache-type-k q8_0 dan --cache-type-v q8_0 membantu mengurangi penggunaan memori KV cache.

  • --spec-type draft-mtp mengaktifkan decoding spekulatif MTP milik Qwen3.8.

  • --spec-draft-n-max 4 mengontrol berapa banyak token spekulatif yang dapat dihasilkan MTP sekaligus.

Untuk penyiapan ini, kita menggunakan n-max 4 sebagai titik awal untuk RTX 5090. Anda dapat bereksperimen dengan nilai seperti 2 (yang direkomendasikan kartu model untuk GGUF ini) atau 3 nanti, karena setelan tercepat dapat sedikit berbeda tergantung sistem Anda.

Setelah llama-server selesai memuat model, Qwen3.8 akan tersedia secara lokal di http://127.0.0.1:8910.

Menyajikan Qwen3.8-27B-NVFP4-MTP-GGUF menggunakan llama.cpp

Sekarang kita telah menjalankan Qwen3.8-27B secara lokal. Berikutnya, kita akan menguji model melalui API dan antarmuka browser bawaan.

4. Uji Kecepatan dan Performa Pengodean Qwen3.8-27B

Dengan server berjalan, buka terminal lain dan kirim permintaan uji ke API yang kompatibel dengan OpenAI:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Menguji Qwen3.8-27B-NVFP4-MTP-GGUF menggunakan perintah CURL

Dalam pengujian ini, Qwen3.8-27B menghasilkan 2.000 token pada 122 token/detik dengan tingkat penerimaan MTP yang impresif sebesar 84,9%. 

llama.cpp juga menyertakan antarmuka browser, sehingga Anda dapat menguji model tanpa menggunakan API.

Buka http://127.0.0.1:8910 di browser Anda untuk melihat UI.

Menguji Qwen3.8-27B-NVFP4-MTP-GGUF di dalam webui llama.cpp

Untuk uji yang lebih kompleks, saya menggunakan prompt ini:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Menguji Qwen3.8-27B-NVFP4-MTP-GGUF di webui llama.cpp pada tugas pengodean

Di RTX 5090 saya, saya mendapatkan sekitar 142 token per detik rata-rata, dengan kecepatan generasi sesekali mencapai sekitar 170 token per detik, yang sangat cepat untuk model 27B yang berjalan secara lokal. 

image4.png

Qwen3.8-27B menghasilkan situs web yang rapi dan sepenuhnya berfungsi yang langsung berjalan. Ini adalah cara yang baik untuk dengan cepat menguji kemampuan pengodean model dan kecepatan penyiapan lokal. 

5. Gunakan Qwen3.8-27B dengan Pi

Di bagian ini, kita akan menghubungkan Qwen3.8-27B ke Pi dan menggunakannya sebagai agen pengodean sepenuhnya lokal.

Pi adalah agen pengodean berbasis terminal yang ringan dan dapat membantu Anda membangun, mengedit, menguji, dan men-debug proyek langsung dari command line.

Instal Pi dengan:

curl -fsSL https://pi.dev/install.sh | sh

Installer memerlukan Node.js dan npm. Ini akan memasang Pi ke global npm prefix Anda. Jika Anda belum memiliki Node, instal dulu dengan nvm atau manajer paket Anda.

Setelah instalasi selesai, mulai ulang terminal Anda.

Selanjutnya, instal ekstensi pi-llama dan arahkan Pi ke server llama.cpp lokal kita:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Buat proyek baru dan mulai Pi:

mkdir new-project
cd new-project

Pi

Menyiapkan qwen3.8-27b di agen pengodean Pi

Di dalam Pi, jalankan /model, cari llama-cpp dan pilih Qwen3.8-27B.

Untuk pengujian, saya memberikan prompt ini:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Menguji model qwen3.8-27b dengan agen pengodean Pi

Model membangun seluruh proyek dalam beberapa menit. 

Menguji model qwen3.8-27b dengan agen pengodean Pi

Saya kemudian memintanya untuk memulai server dan menguji frontend serta logika aplikasi. Model menghabiskan lebih banyak waktu untuk debugging dan pengujian guna memastikan semuanya berjalan dengan baik.

dasbor web yang dihasilkan dengan model qwen3.8-27b dan agen pengodean Pi

Saat saya menguji dasbor sendiri, aplikasinya berjalan baik, grafiknya terlihat bagus, dan pengalaman keseluruhan terasa mulus.

dasbor web yang dihasilkan dengan model qwen3.8-27b dan agen pengodean Pi

Kelemahan utamanya adalah membuat perubahan UI yang presisi. Setelah beberapa prompt lanjutan, model mulai membuat perubahan yang tidak terkait alih-alih memahami tepatnya yang saya inginkan, jadi saya akhirnya berhenti di sana.

Pemikiran Akhir

Qwen3.8-27B masih sangat baru, dan komunitas sedang aktif mencari kombinasi terbaik antara kuantisasi dan decoding spekulatif. MTP bekerja sangat baik, tetapi pendekatan yang lebih baru seperti DFlash 2 dan DSpark juga sedang diuji, dengan beberapa pengguna melaporkan kecepatan yang lebih tinggi tergantung perangkat keras dan beban kerja. 

Unsloth juga baru saja merilis GGUF Dynamic v3.0 untuk Qwen3.8-27B, mengklaim sekitar 10% akurasi lebih tinggi pada ukuran model yang sama dibandingkan kuantisasi sebelumnya. Ini menjadikan Unsloth opsi lain yang sangat menarik jika Anda menginginkan kualitas lebih baik sambil tetap mempertahankan penyiapan inferensi lokal yang kurang lebih sama. 

Untuk saat ini, saya rasa NVFP4 + MTP + llama.cpp adalah salah satu penyiapan termudah dan tercepat untuk RTX 5090. Mendapatkan sekitar 140 token per detik dari model 27B sambil tetap memiliki jendela konteks besar dan kemampuan yang cukup untuk menjalankan agen pengodean nyata itu mengesankan. Penyiapan ini kemungkinan akan menjadi lebih cepat seiring llama.cpp, Unsloth, DFlash 2, dan DSpark terus berkembang.

FAQ Menjalankan Qwen3.8-27B Secara Lokal

Apakah Anda memerlukan RTX 5090 untuk menjalankan Qwen3.8-27B secara lokal?

Tidak. Kuantisasi GGUF 4-bit standar dari Qwen3.8-27B muat dalam sekitar 16–19 GB VRAM, jadi RTX 5080, 4090, atau Mac 24 GB akan dapat menjalankan model. RTX 5090 penting untuk penyiapan spesifik ini karena NVFP4 memerlukan tensor core Blackwell. Pada kartu yang lebih lama, file NVFP4 bisa dijalankan namun hanya memberi penghematan memori, bukan peningkatan kecepatan.

Berapa banyak VRAM yang sebenarnya digunakan konfigurasi ini?

NVFP4-MTP GGUF berukuran sekitar 19 GB di disk, dan KV cache yang mendorong totalnya naik seiring konteks bertambah. Dengan kuantisasi K/V q8_0 pada konteks sangat panjang, publikasi run RTX 5090 berada di kisaran pertengahan 20-an GB, jadi kartu 32 GB terasa lega. Pada 24 GB Anda perlu menurunkan --ctx-size jauh di bawah 131072.

Apa yang dilakukan decoding spekulatif MTP, dan apakah ini lossless?

Qwen3.8 dilengkapi lapisan multi-token prediction yang tertanam di GGUF, yang bertindak sebagai model draft bawaan, tanpa perlu file kedua. Draft head mengusulkan beberapa token sekaligus, dan model penuh memverifikasinya, sehingga draft yang diterima hanya memakan sebagian dari biaya forward pass normal. Kualitas keluaran tidak berubah, karena setiap token yang diterima model utama adalah token yang memang akan dihasilkannya.

Haruskah Anda menggunakan NVFP4 atau kuantisasi Q4_K_M biasa?

Pilih NVFP4 jika Anda memiliki GPU Blackwell dan menginginkan kecepatan maksimum; pilih GGUF standar seperti Q4_K_M atau UD-Q4_K_XL milik Unsloth jika Anda menggunakan Ampere atau Ada, atau jika Anda lebih mementingkan kualitas keluaran per gigabyte. Dukungan NVFP4 di llama.cpp juga lebih baru dibanding jalur K-quant, jadi harapkan lebih banyak kekasaran pada konversi dan tooling.

Bisakah penyiapan ini menangani gambar, karena Qwen3.8-27B adalah model vision?

Qwen3.8-27B adalah model vision-language native, tetapi konversi GGUF teks-saja akan menghapus vision tower. Untuk menggunakan gambar, Anda perlu menyertakan multimodal projector bersama model dengan --mmproj, biasanya file mmproj yang dipublikasikan di repo yang sama atau di repo GGUF Unsloth.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sebagai data scientist tersertifikasi, saya bersemangat memanfaatkan teknologi mutakhir untuk menciptakan aplikasi machine learning yang inovatif. Dengan latar belakang kuat di pengenalan ucapan, analisis dan pelaporan data, MLOps, conversational AI, dan NLP, saya mengasah keterampilan dalam mengembangkan sistem cerdas yang berdampak nyata. Selain keahlian teknis, saya juga komunikator andal yang mampu menyederhanakan konsep kompleks menjadi bahasa yang jelas dan ringkas. Karena itu, saya menjadi blogger yang dicari di bidang data science, membagikan wawasan dan pengalaman kepada komunitas profesional data yang terus berkembang. Saat ini, saya berfokus pada pembuatan dan penyuntingan konten, bekerja dengan large language model untuk mengembangkan konten yang kuat dan menarik agar membantu bisnis dan individu memaksimalkan data mereka.

Topik
Kecerdasan Buatan

Jadilah AI Engineer Bersama DataCamp!

Program

Insinyur Kecerdasan Buatan (AI) untuk Pengembang

26 Hr
Pelajari cara mengintegrasikan kecerdasan buatan (AI) ke dalam aplikasi perangkat lunak menggunakan antarmuka pemrograman aplikasi (API) dan perpustakaan sumber terbuka. Mulailah perjalanan Anda untuk menjadi seorang Insinyur Kecerdasan Buatan (AI) hari ini!
Lihat DetailRight Arrow
Mulai Kursus
Lihat Lebih BanyakRight Arrow
Terkait

blogs

12 Alternatif ChatGPT Terbaik yang Bisa Anda Coba pada 2026

Artikel ini menyajikan daftar alternatif ChatGPT yang akan meningkatkan produktivitas Anda.
Javier Canales Luna's photo

Javier Canales Luna

14 mnt

blogs

40 Pertanyaan Wawancara DBMS Teratas di 2026

Kuasai pertanyaan wawancara basis data, dari konsep SQL dasar hingga skenario desain sistem tingkat lanjut. Panduan mendalam ini mencakup semua yang Anda perlukan untuk sukses di wawancara DBMS dan meraih peran berikutnya.
Dario Radečić's photo

Dario Radečić

15 mnt

blogs

Tutorial Korelasi di R

Dapatkan pengenalan dasar-dasar korelasi di R: pelajari lebih lanjut tentang koefisien korelasi, matriks korelasi, plotting korelasi, dan sebagainya.
David Woods's photo

David Woods

13 mnt

blogs

Spaghetti Plot dan Jalur Badai

Temukan alasan mengapa Anda sebaiknya (tidak) menggunakan spaghetti plot untuk menyampaikan ketidakpastian jalur prediksi badai serta dampaknya terhadap interpretasi.
Hugo Bowne-Anderson's photo

Hugo Bowne-Anderson

13 mnt

Lihat Lebih BanyakLihat Lebih Banyak