Program
Qwen3.8-27B dengan cepat menjadi salah satu model paling populer untuk AI lokal. Meski hanya memiliki 27 miliar parameter, model ini memberikan performa yang menyaingi model yang jauh lebih besar pada tolok ukur pengodean, penalaran, agen, dan tujuan umum. Model ini bahkan mendekati model seperti GLM-5.2 di beberapa area, yang membuatnya sangat populer di kalangan pengguna yang bereksperimen dengan perangkat keras lokal yang bertenaga.
RTX 5090 sangat cocok untuk Qwen3.8-27B karena arsitektur Blackwell-nya mendukung NVFP4, memungkinkan model berjalan dengan kecepatan sangat tinggi sambil mempertahankan kualitas keluaran yang kuat. Dikombinasikan dengan decoding spekulatif melalui multi-token prediction (MTP), build llama.cpp yang dioptimalkan, dan model GGUF yang tepat, Qwen3.8-27B dapat menghasilkan lebih dari 100 token per detik pada satu RTX 5090.
Dalam panduan ini, kita akan menyiapkan salah satu cara termudah menurut saya untuk mendapatkan keseimbangan terbaik antara kecepatan, akurasi, dan dukungan konteks panjang di RTX 5090 atau GPU Blackwell lainnya. Kita akan mengompilasi llama.cpp dengan dukungan native Blackwell, mengunduh Qwen3.8-27B NVFP4-MTP GGUF, menjalankannya dengan akselerasi GPU dan decoding spekulatif MTP, menguji API yang kompatibel dengan OpenAI dan antarmuka web bawaan, dan akhirnya menghubungkannya ke Pi sehingga kita dapat menggunakan Qwen3.8-27B sebagai agen pengodean sepenuhnya lokal.
Saya juga menyarankan untuk melihat panduan Qwen3.8-Flash-Next, pratinjau terbaru dari Qwen4, dan tutorial cara menjalankan Qwen3.8-Flash-Next secara lokal.
1. Siapkan llama.cpp untuk GPU Blackwell
Pertama, pastikan GPU terdeteksi dengan benar dan periksa versi driver NVIDIA serta CUDA.
nvidia-smi
Anda akan melihat RTX 5090 Anda, versi driver, versi CUDA, memori GPU, dan penggunaan GPU saat ini.
Catatan: Penyiapan ini khusus untuk GPU NVIDIA Blackwell, seperti RTX 5090. Build di bawah ini menargetkan SM120, yaitu arsitektur komputasi yang digunakan oleh RTX 5090.
Selanjutnya, kita akan mengunduh dan mengompilasi versi terbaru llama.cpp dengan dukungan CUDA.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES=120
cmake --build build --config Release -j$(nproc)

Bagian penting di sini adalah -DCMAKE_CUDA_ARCHITECTURES=120. Ini memberi tahu llama.cpp untuk membangun khusus untuk arsitektur Blackwell yang digunakan oleh RTX 5090.
Setelah build selesai, kita akan membuat llama-server tersedia secara global sehingga dapat dijalankan dari folder mana pun:
sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server
Sekarang, periksa apakah semuanya berfungsi:
llama-server --version
Anda akan mendapatkan keluaran serupa dengan:
version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64
Selesai. Kita sekarang memiliki build llama.cpp berkemampuan CUDA yang dapat memanfaatkan RTX 5090 dan dukungan NVFP4 native Blackwell.
2. Unduh Model Qwen3.8-27B NVFP4-MTP
Sekarang kita akan mengunduh model Qwen3.8-27B.
Pertama, instal Hugging Face CLI:
pip install -U huggingface_hub
Buat folder tempat kita akan menyimpan model:
mkdir -p /workspace/models/qwen38
Lalu unduh NVFP4-MTP GGUF:
hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
--local-dir /workspace/models/qwen38

Ini adalah versi yang kita inginkan untuk penyiapan ini karena menggunakan NVFP4 dan mencakup dukungan MTP, yang menjadi sumber utama peningkatan kecepatan pada RTX 5090.
3. Mulai Server Qwen3.8-27B
Sekarang bagian yang menyenangkan. Kita akan menyajikan Qwen3.8-27B sepenuhnya di GPU dengan Flash Attention, jendela konteks 131K, dan decoding spekulatif MTP untuk generasi yang lebih cepat.
Jalankan:
cd /workspace/llama.cpp
llama-server \
-m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
--alias qwen3.8-27b \
--host 0.0.0.0 \
--port 8910 \
--ctx-size 131072 \
--n-gpu-layers all \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--spec-type draft-mtp \
--spec-draft-n-max 4 \
--spec-draft-p-min 0.75 \
--spec-draft-ngl all \
--spec-draft-type-k q8_0 \
--spec-draft-type-v q8_0 \
--reasoning-effort medium \
--jinja
Ada banyak opsi di sini, namun sebagian besar hanya untuk mendapatkan performa terbaik dari 5090.
Yang utama untuk diketahui adalah:
-
--ctx-size 131072memberi kita jendela konteks sekitar 131K. -
--n-gpu-layers allmenjaga model tetap di GPU. -
--flash-attn onmengaktifkan Flash Attention. -
--cache-type-k q8_0dan--cache-type-v q8_0membantu mengurangi penggunaan memori KV cache. -
--spec-type draft-mtpmengaktifkan decoding spekulatif MTP milik Qwen3.8. -
--spec-draft-n-max 4mengontrol berapa banyak token spekulatif yang dapat dihasilkan MTP sekaligus.
Untuk penyiapan ini, kita menggunakan n-max 4 sebagai titik awal untuk RTX 5090. Anda dapat bereksperimen dengan nilai seperti 2 (yang direkomendasikan kartu model untuk GGUF ini) atau 3 nanti, karena setelan tercepat dapat sedikit berbeda tergantung sistem Anda.
Setelah llama-server selesai memuat model, Qwen3.8 akan tersedia secara lokal di http://127.0.0.1:8910.

Sekarang kita telah menjalankan Qwen3.8-27B secara lokal. Berikutnya, kita akan menguji model melalui API dan antarmuka browser bawaan.
4. Uji Kecepatan dan Performa Pengodean Qwen3.8-27B
Dengan server berjalan, buka terminal lain dan kirim permintaan uji ke API yang kompatibel dengan OpenAI:
curl http://127.0.0.1:8910/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-27b",
"messages": [
{
"role": "user",
"content": "Write a Python FastAPI application that monitors GPU usage."
}
],
"max_tokens": 2000
}'

Dalam pengujian ini, Qwen3.8-27B menghasilkan 2.000 token pada 122 token/detik dengan tingkat penerimaan MTP yang impresif sebesar 84,9%.
llama.cpp juga menyertakan antarmuka browser, sehingga Anda dapat menguji model tanpa menggunakan API.
Buka http://127.0.0.1:8910 di browser Anda untuk melihat UI.

Untuk uji yang lebih kompleks, saya menggunakan prompt ini:
Create a stunning single-file animated HTML website with a dark futuristic
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Di RTX 5090 saya, saya mendapatkan sekitar 142 token per detik rata-rata, dengan kecepatan generasi sesekali mencapai sekitar 170 token per detik, yang sangat cepat untuk model 27B yang berjalan secara lokal.

Qwen3.8-27B menghasilkan situs web yang rapi dan sepenuhnya berfungsi yang langsung berjalan. Ini adalah cara yang baik untuk dengan cepat menguji kemampuan pengodean model dan kecepatan penyiapan lokal.
5. Gunakan Qwen3.8-27B dengan Pi
Di bagian ini, kita akan menghubungkan Qwen3.8-27B ke Pi dan menggunakannya sebagai agen pengodean sepenuhnya lokal.
Pi adalah agen pengodean berbasis terminal yang ringan dan dapat membantu Anda membangun, mengedit, menguji, dan men-debug proyek langsung dari command line.
Instal Pi dengan:
curl -fsSL https://pi.dev/install.sh | sh
Installer memerlukan Node.js dan npm. Ini akan memasang Pi ke global npm prefix Anda. Jika Anda belum memiliki Node, instal dulu dengan nvm atau manajer paket Anda.
Setelah instalasi selesai, mulai ulang terminal Anda.
Selanjutnya, instal ekstensi pi-llama dan arahkan Pi ke server llama.cpp lokal kita:
pi install git:github.com/huggingface/pi-llama
export LLAMA_BASE_URL=http://127.0.0.1:8910/v1
Buat proyek baru dan mulai Pi:
mkdir new-project
cd new-project
Pi

Di dalam Pi, jalankan /model, cari llama-cpp dan pilih Qwen3.8-27B.
Untuk pengujian, saya memberikan prompt ini:
Build a polished personal finance dashboard from scratch that imports CSV
bank statements, categorizes spending, shows monthly trends and charts, and
detects unusual expenses; also generate a realistic sample CSV, import it,
test the full app end-to-end, and fix any errors automatically.

Model membangun seluruh proyek dalam beberapa menit.

Saya kemudian memintanya untuk memulai server dan menguji frontend serta logika aplikasi. Model menghabiskan lebih banyak waktu untuk debugging dan pengujian guna memastikan semuanya berjalan dengan baik.

Saat saya menguji dasbor sendiri, aplikasinya berjalan baik, grafiknya terlihat bagus, dan pengalaman keseluruhan terasa mulus.

Kelemahan utamanya adalah membuat perubahan UI yang presisi. Setelah beberapa prompt lanjutan, model mulai membuat perubahan yang tidak terkait alih-alih memahami tepatnya yang saya inginkan, jadi saya akhirnya berhenti di sana.
Pemikiran Akhir
Qwen3.8-27B masih sangat baru, dan komunitas sedang aktif mencari kombinasi terbaik antara kuantisasi dan decoding spekulatif. MTP bekerja sangat baik, tetapi pendekatan yang lebih baru seperti DFlash 2 dan DSpark juga sedang diuji, dengan beberapa pengguna melaporkan kecepatan yang lebih tinggi tergantung perangkat keras dan beban kerja.
Unsloth juga baru saja merilis GGUF Dynamic v3.0 untuk Qwen3.8-27B, mengklaim sekitar 10% akurasi lebih tinggi pada ukuran model yang sama dibandingkan kuantisasi sebelumnya. Ini menjadikan Unsloth opsi lain yang sangat menarik jika Anda menginginkan kualitas lebih baik sambil tetap mempertahankan penyiapan inferensi lokal yang kurang lebih sama.
Untuk saat ini, saya rasa NVFP4 + MTP + llama.cpp adalah salah satu penyiapan termudah dan tercepat untuk RTX 5090. Mendapatkan sekitar 140 token per detik dari model 27B sambil tetap memiliki jendela konteks besar dan kemampuan yang cukup untuk menjalankan agen pengodean nyata itu mengesankan. Penyiapan ini kemungkinan akan menjadi lebih cepat seiring llama.cpp, Unsloth, DFlash 2, dan DSpark terus berkembang.
FAQ Menjalankan Qwen3.8-27B Secara Lokal
Apakah Anda memerlukan RTX 5090 untuk menjalankan Qwen3.8-27B secara lokal?
Tidak. Kuantisasi GGUF 4-bit standar dari Qwen3.8-27B muat dalam sekitar 16–19 GB VRAM, jadi RTX 5080, 4090, atau Mac 24 GB akan dapat menjalankan model. RTX 5090 penting untuk penyiapan spesifik ini karena NVFP4 memerlukan tensor core Blackwell. Pada kartu yang lebih lama, file NVFP4 bisa dijalankan namun hanya memberi penghematan memori, bukan peningkatan kecepatan.
Berapa banyak VRAM yang sebenarnya digunakan konfigurasi ini?
NVFP4-MTP GGUF berukuran sekitar 19 GB di disk, dan KV cache yang mendorong totalnya naik seiring konteks bertambah. Dengan kuantisasi K/V q8_0 pada konteks sangat panjang, publikasi run RTX 5090 berada di kisaran pertengahan 20-an GB, jadi kartu 32 GB terasa lega. Pada 24 GB Anda perlu menurunkan --ctx-size jauh di bawah 131072.
Apa yang dilakukan decoding spekulatif MTP, dan apakah ini lossless?
Qwen3.8 dilengkapi lapisan multi-token prediction yang tertanam di GGUF, yang bertindak sebagai model draft bawaan, tanpa perlu file kedua. Draft head mengusulkan beberapa token sekaligus, dan model penuh memverifikasinya, sehingga draft yang diterima hanya memakan sebagian dari biaya forward pass normal. Kualitas keluaran tidak berubah, karena setiap token yang diterima model utama adalah token yang memang akan dihasilkannya.
Haruskah Anda menggunakan NVFP4 atau kuantisasi Q4_K_M biasa?
Pilih NVFP4 jika Anda memiliki GPU Blackwell dan menginginkan kecepatan maksimum; pilih GGUF standar seperti Q4_K_M atau UD-Q4_K_XL milik Unsloth jika Anda menggunakan Ampere atau Ada, atau jika Anda lebih mementingkan kualitas keluaran per gigabyte. Dukungan NVFP4 di llama.cpp juga lebih baru dibanding jalur K-quant, jadi harapkan lebih banyak kekasaran pada konversi dan tooling.
Bisakah penyiapan ini menangani gambar, karena Qwen3.8-27B adalah model vision?
Qwen3.8-27B adalah model vision-language native, tetapi konversi GGUF teks-saja akan menghapus vision tower. Untuk menggunakan gambar, Anda perlu menyertakan multimodal projector bersama model dengan --mmproj, biasanya file mmproj yang dipublikasikan di repo yang sama atau di repo GGUF Unsloth.
Sebagai data scientist tersertifikasi, saya bersemangat memanfaatkan teknologi mutakhir untuk menciptakan aplikasi machine learning yang inovatif. Dengan latar belakang kuat di pengenalan ucapan, analisis dan pelaporan data, MLOps, conversational AI, dan NLP, saya mengasah keterampilan dalam mengembangkan sistem cerdas yang berdampak nyata. Selain keahlian teknis, saya juga komunikator andal yang mampu menyederhanakan konsep kompleks menjadi bahasa yang jelas dan ringkas. Karena itu, saya menjadi blogger yang dicari di bidang data science, membagikan wawasan dan pengalaman kepada komunitas profesional data yang terus berkembang. Saat ini, saya berfokus pada pembuatan dan penyuntingan konten, bekerja dengan large language model untuk mengembangkan konten yang kuat dan menarik agar membantu bisnis dan individu memaksimalkan data mereka.


