Chuyển đến nội dung chính

Cách chạy Muse Glimmer 30B tại chỗ cho AI Coding

Chạy mô hình agentic cục bộ Muse Glimmer của Meta bằng llama.cpp, lượng tử hóa động, giải mã suy đoán DFlash, hỗ trợ thị giác và OpenCode để vận hành một trợ lý code AI nhanh, riêng tư và chi phí thấp.
Đã cập nhật 5 thg 10, 2026  · 9 phút đọc

Khám phá cùng AI

ChatGPTClaudePerplexity

Như chúng tôi đã đề cập trong bài viết blog, Muse Glimmer 30B là một mô hình mã nguồn mở mới được xây dựng cho tác vụ agentic và lập trình. 

Điểm đặc biệt thú vị là bạn có thể chạy toàn bộ thiết lập này tại chỗ trên một NVIDIA RTX 5090 với 32 GB VRAM bằng llama.cpp.

Mô hình có sẵn ở định dạng GGUF, và trong hướng dẫn này, tôi sẽ dùng lượng tử hóa động cho chất lượng cao hơn. 

Thiết lập hoàn chỉnh gồm có:

  • muse-glimmer-30B-kquant-dynamic.gguf: 19,7 GB mô hình chính
  • dflash-kquant.gguf: 1,63 GB mô hình nháp cho giải mã suy đoán
  • mmproj-kquant.gguf: 1,4 GB bộ mã hóa thị giác và nhận thức

Theo mô tả mô hình, lượng tử hóa động 19,7 GB chỉ có khoảng 0,2% suy giảm điểm chuẩn so với độ chính xác đầy đủ. 

Trong thử nghiệm của tôi, chạy mô hình với cửa sổ ngữ cảnh 64K sử dụng khoảng 24 GB VRAM, để lại khoảng trống hữu ích trên RTX 5090.

Trong hướng dẫn này, bạn sẽ học cách:

  1. Biên dịch llama.cpp với hỗ trợ CUDA
  2. Tải về và chạy Muse Glimmer 30B tại chỗ
  3. Bật giải mã suy đoán DFlash và đầu vào thị giác
  4. Kiểm thử mô hình qua API và Web UI tích hợp
  5. Kết nối mô hình cục bộ với OpenCode
  6. Dùng Muse Glimmer để xây dựng và gỡ lỗi một ứng dụng hoàn chỉnh

Cuối cùng, chúng ta cũng sẽ có cái nhìn thực tế về những điểm Muse Glimmer làm tốt với vai trò mô hình code cục bộ và nơi nó còn gặp khó. Tôi cũng khuyến nghị xem hướng dẫn về Muse Spark 1.3 để tìm hiểu các tính năng mới nhất.

1. Thiết lập llama.cpp cho suy luận trên GPU

Trước khi chạy Muse Glimmer tại chỗ, trước hết chúng ta cần biên dịch llama.cpp với hỗ trợ CUDA để mô hình có thể dùng GPU RTX 5090.

Bắt đầu bằng cách cài đặt các gói hệ thống cần thiết:

apt-get update

apt-get install -y \
    build-essential \
    cmake \
    curl \
    git \
    libcurl4-openssl-dev

Tiếp theo, nhân bản kho llama.cpp và chuyển vào thư mục dự án:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

Cấu hình build với CUDA bật:

cmake -B build \
    -DBUILD_SHARED_LIBS=OFF \
    -DGGML_CUDA=ON

Giờ hãy biên dịch công cụ dòng lệnh, CLI đa phương thức và server:

cmake --build build --config Release -j \
    --target llama-cli llama-mtmd-cli llama-server

Khi build xong, hãy tạo liên kết để llama-server khả dụng toàn hệ thống để bạn có thể chạy từ bất kỳ thư mục nào:

ln -sf "$(pwd)/build/bin/llama-server" /usr/local/bin/llama-server

Cuối cùng, xác nhận cài đặt hoạt động:

llama-server --version

Bạn sẽ thấy đầu ra tương tự:

version: 10373 (38406d597)
built with GNU 13.3.0 for Linux x86_64

Tại thời điểm này, llama.cpp đã được biên dịch với hỗ trợ CUDA và llama-server sẵn sàng chạy Muse Glimmer trên GPU.

2. Tải Muse Glimmer

Tiếp theo, tải mô hình Muse Glimmer chính cùng các tệp GGUF bổ sung cần cho giải mã suy đoán và đầu vào thị giác.

Đầu tiên, cài đặt Hugging Face CLI:

pip install -U huggingface_hub

Sau đó đăng nhập vào tài khoản Hugging Face của bạn:

hf auth login

Đăng nhập bằng HF CLI

Chọn tùy chọn đăng nhập qua trình duyệt, mở trang ủy quyền và chấp thuận kết nối trong trình duyệt của bạn.

Giờ hãy tải ba tệp bắt buộc:

hf download meta-models/Muse-Glimmer-30B-GGUF \
    --local-dir Muse-Glimmer-30B-GGUF \
    --include "muse-glimmer-30B-kquant-dynamic.gguf" \
    --include "dflash-kquant.gguf" \
    --include "mmproj-kquant.gguf"

Lệnh này tải về:

  • muse-glimmer-30B-kquant-dynamic.gguf: mô hình 19,7 GB chính
  • dflash-kquant.gguf: mô hình nháp dùng cho giải mã suy đoán
  • mmproj-kquant.gguf: bộ mã hóa nhận thức cần cho đầu vào hình ảnh

Các tệp khá lớn, nên thời gian tải có thể lâu tùy vào kết nối internet của bạn.

Đang tải Muse-Glimmer-30B-GGUF

Khi cả ba tệp đã được tải, bạn có đầy đủ mọi thứ để chạy Muse Glimmer với sinh văn bản, hỗ trợ thị giác và giải mã suy đoán DFlash.

3. Phục vụ Muse Glimmer với Thị giác và Giải mã Suy đoán

Sau khi tải ba tệp GGUF, chúng ta có thể khởi chạy Muse Glimmer bằng llama-server.

Lệnh dưới đây nạp mô hình chính, bật mô hình nháp DFlash cho giải mã suy đoán và thêm bộ mã hóa nhận thức cho đầu vào thị giác:

llama-server \
    -m /workspace/Muse-Glimmer-30B-GGUF/muse-glimmer-30B-kquant-dynamic.gguf \
    -md /workspace/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf \
    --mmproj /workspace/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf \
    --spec-type draft-dflash \
    --spec-draft-n-max 15 \
    -ngl 99 \
    --spec-draft-ngl all \
    -fa on \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 64 \
    --ctx-size 64000 \
    --alias muse-glimmer-30B \
    --host 0.0.0.0 \
    --port 8910 \
    --jinja

Phục vụ Muse Glimmer với Thị giác và Giải mã Suy đoán

Cấu hình này dùng cửa sổ ngữ cảnh 64K, offload mô hình lên GPU, bật Flash Attention và chạy server trên cổng 8910.

Khi mô hình đã nạp xong, nó sẽ khả dụng tại:

http://127.0.0.1:8910

Bạn có thể xác nhận mọi thứ chạy đúng bằng cách gửi một yêu cầu đơn giản tới API tương thích OpenAI:

curl -s http://127.0.0.1:8910/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
        "model": "muse-glimmer-30B",
        "messages": [
            {
                "role": "user",
                "content": "Explain speculative decoding in three simple sentences."
            }
        ]
    }'

Trong thử nghiệm này, Muse Glimmer tạo 364 token hoàn thành ở tốc độ 83,94 token/giây, trong khi prompt được xử lý ở tốc độ 147,48 token/giây. 

Với giải mã suy đoán DFlash bật, mô hình nháp đề xuất 1.665 token, trong đó 253 được chấp nhận, cho tỷ lệ chấp nhận khoảng 15,2%. 

Prompt 64 token được xử lý trong khoảng 434 ms, còn phần sinh mất khoảng 4,34 giây. 

Phản hồi xác nhận mô hình đang chạy đúng qua API cục bộ.

Bạn cũng có thể kiểm tra lượng bộ nhớ GPU mà toàn bộ thiết lập đang dùng:

nvidia-smi

Với mô hình lượng tử hóa động 30B, mô hình nháp DFlash, bộ mã hóa thị giác và cửa sổ ngữ cảnh 64K được nạp cùng nhau, thiết lập của tôi dùng khoảng 23,8 GB VRAM trên RTX 5090.

Tóm tắt GPU RTX 5090 khi mô hình Muse Glimmer được nạp với DFlash và bộ mã hóa thị giác.

Như vậy còn khoảng 8 GB VRAM trống, cho phép chúng ta thử nghiệm với các cửa sổ ngữ cảnh lớn hơn sau này.

4. Kiểm thử Muse Glimmer trong Web UI với prompt Thị giác và Lập trình

llama-server đi kèm Web UI tích hợp, giúp bạn dễ dàng kiểm thử mô hình mà không cần tự gửi yêu cầu API.

Mở:

http://127.0.0.1:8910

Bạn có thể dùng giao diện cho prompt văn bản thường, hiểu hình ảnh và thử nghiệm code nhanh.

Bởi vì chúng ta đã nạp bộ mã hóa thị giác với:

--mmproj /workspace/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf

Muse Glimmer cũng có thể nhận đầu vào hình ảnh.

Để kiểm thử khả năng thị giác, tôi đã tải ảnh bìa một cuốn sách của mình và dùng prompt sau:

Describe what you see in this image and point out the most important details.

Kiểm thử khả năng thị giác của Muse Glimmer

Mô hình đã tạo mô tả chi tiết về bìa và nhận ra một số yếu tố thị giác nhỏ hơn. 

Đây là một bài kiểm thử ban đầu hữu ích để xác nhận bộ mã hóa thị giác hoạt động đúng.

Tiếp đó, tôi thử khả năng lập trình của nó với một tác vụ tạo website đơn giản:

Build a modern luxury watch website for VELORÉ, 
with a minimalist V logo, black/ivory/deep-green palette, 
cinematic hero, premium watches, smooth animations, 
and elegant Swiss-inspired styling.

Trong tác vụ lập trình này, tốc độ sinh trung bình khoảng 121 token mỗi giây, nhanh hơn đáng kể so với bài kiểm thử văn bản tổng quát trước đó. 

Giải mã suy đoán DFlash có vẻ hoạt động đặc biệt hiệu quả trên loại tác vụ sinh mã tuần tự này.

Kiểm thử Muse Glimmer trên tác vụ lập trình

Mô hình đã tạo ra một website đồng hồ cao cấp có thể sử dụng được. 

Vẫn còn một vài vấn đề trong đầu ra cuối, điều này không quá ngạc nhiên với một mô hình 30B, nhưng nó có thể tạo một dự án hoàn chỉnh rất nhanh.

Website được tạo với Muse Glimmer 30B

Muse Glimmer được định vị là mô hình lập trình kiểu agentic, vì vậy bài kiểm thử quan trọng hơn là khả năng khi phải tạo tệp, chạy lệnh, tự kiểm thử và sửa lỗi. Chúng ta sẽ kiểm thử điều đó tiếp theo bằng cách kết nối với OpenCode.

5. Kết nối Muse Glimmer với OpenCode và kiểm thử lập trình agentic

Giờ Muse Glimmer đã chạy tại chỗ, bước tiếp theo là kết nối nó với OpenCode và xem hiệu năng của nó với vai trò mô hình lập trình agentic.

Trước hết, cài đặt OpenCode:

curl -fsSL https://opencode.ai/install | bash

Cài đặt OpenCode

Nạp lại shell và xác nhận cài đặt:

exec bash
opencode --version

Trong thử nghiệm này, tôi dùng phiên bản:

1.18.16

Tạo thư mục cấu hình OpenCode:

mkdir -p ~/.config/opencode

Thay vì mở trình soạn thảo, hãy tạo tệp cấu hình trực tiếp từ terminal:

cat > ~/.config/opencode/opencode.json <<'EOF'
{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "llama.cpp": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Muse Glimmer Local",
      "options": {
        "baseURL": "http://127.0.0.1:8910/v1"
      },
      "models": {
        "muse-glimmer-30B": {
          "name": "Muse Glimmer 30B"
        }
      }
    }
  },
  "model": "llama.cpp/muse-glimmer-30B"
}
EOF

Thiết lập này yêu cầu OpenCode dùng API tương thích OpenAI do llama-server cục bộ của chúng ta cung cấp.

Tiếp theo, tạo một dự án mới:

mkdir muse-app
cd muse-app
git init
opencode

OpenCode với Muse Glimmer 30B đã nạp

OpenCode sẽ khởi chạy giao diện terminal của nó với Muse Glimmer 30B đã được cấu hình làm mô hình chính.

Xây dựng một ứng dụng hoàn chỉnh

Để kiểm thử mô hình với bài toán thực tế hơn, tôi yêu cầu nó xây dựng một ứng dụng nghiên cứu y khoa:

Build a modern medical AI web app called MedSearch AI.
Use Python FastAPI for the backend and HTML, CSS and JavaScript for the frontend.
Create a clean dark interface where users can ask medical research questions. 
Send prompts to my local Muse Glimmer server at:http://127.0.0.1:8910/v1/chat/completions
Add web search for the latest reliable medical information, show sources clearly, 
support streaming responses and Markdown, and include a clear-chat button and server status indicator.

Create all files, install dependencies, test the app, and tell me how to run it.

Ứng dụng AI y tế được tạo bởi Muse Glimmer 30B trên OpenCode

Kết quả ban đầu rất ấn tượng. Chỉ mất khoảng một phút để tạo toàn bộ dự án. 

Nó tạo backend, frontend, phụ thuộc và cấu trúc ứng dụng tổng thể rất nhanh.

Sau đó tôi yêu cầu nó kiểm thử cả backend và UI.

Đây là lúc tôi bắt đầu nhận thấy điểm yếu của mô hình.

Nhanh khi xây dựng, yếu hơn khi gỡ lỗi

Trên các bộ điểm chuẩn lập trình nhân tạo, Muse Glimmer có xếp hạng tương tự mô hình Qwen3.6 27B nhưng theo thử nghiệm của riêng tôi, tôi cho rằng nó kém hơn thấy rõ khi thực sự làm việc qua một tác vụ lập trình.

Vấn đề lớn nhất là gỡ lỗi.

Muse Glimmer rất nhanh khi tạo một dự án hoàn chỉnh từ đầu, nhưng khi có sự cố, nó gặp khó trong việc tự xử lý vấn đề. Nó có thể mất nhiều thời gian thử nhiều cách mà không tiến triển mấy.

Cuối cùng tôi phải chỉ dẫn chính xác cần làm gì. 

Ví dụ, tôi đã chỉ định rõ ràng rằng nó phải:

  1. Khởi động server backend ở chế độ nền.
  2. Chờ cho server sẵn sàng.
  3. Gửi một yêu cầu tới ứng dụng đang chạy.
  4. Kiểm tra phản hồi.
  5. Sửa mọi lỗi gặp phải.
  6. Kiểm thử ứng dụng lại.

Khi tôi đưa ra các bước cụ thể đó, nó hiểu nhiệm vụ và làm theo thành công.

Gỡ lỗi ứng dụng AI bằng Muse Glimmer 30B

Có lẽ đó là điều tôi rút ra lớn nhất khi dùng Muse Glimmer với OpenCode. 

Bạn cần nêu thật rõ ràng bạn muốn nó làm gì. 

Thay vì nói "kiểm thử ứng dụng" hay "sửa lỗi", cách tốt hơn nhiều là mô tả chính xác chuỗi hành động nó cần thực hiện.

Vì vậy, kỹ thuật prompt đặc biệt quan trọng với mô hình này.

Ứng dụng cuối cùng

Sau khi xử lý các vấn đề gỡ lỗi, ứng dụng MedSearch AI thu được hoạt động rất tốt.

Ứng dụng MedSearch AI do Muse Glimmer 30B tạo

Ứng dụng nhanh, nhiều tính năng và đáng ngạc nhiên là đơn giản. 

Nó dùng backend FastAPI gọn nhẹ với HTML, CSS và JavaScript thuần, thay vì dựa vào một framework frontend lớn.

Sự đơn giản đó thực ra là một điểm tôi thích ở kết quả. 

Muse Glimmer tạo một ứng dụng AI hoạt động được mà không đưa vào sự phức tạp không cần thiết.

Trải nghiệm của tôi đến giờ là Muse Glimmer rất xuất sắc trong việc tạo nhanh nhiều mã chạy được, nhưng kém tin cậy hơn khi cần chẩn đoán vấn đề, lập kế hoạch gỡ lỗi nhiều bước và tự phục hồi sau lỗi.

Với lập trình cục bộ, sự khác biệt đó là quan trọng. 

Nếu bạn đưa chỉ dẫn rõ ràng, chi tiết, nó có thể rất mạnh. 

Nếu bạn kỳ vọng nó tự tìm ra mọi bước, đặc biệt trong gỡ lỗi, các giới hạn sẽ lộ rõ hơn nhiều.

Nhận xét cuối

Muse Glimmer 30B vẫn là mô hình rất mới, và điều đó thể hiện trong thử nghiệm của tôi. 

Nó rất nhanh trong việc sinh mã, nhưng gặp khó hơn với gỡ lỗi và tác vụ nhiều bước. Tôi thường phải chỉ chính xác cần làm gì trước khi nó có thể tiếp tục.

Dù có những vấn đề đó, tôi nghĩ mô hình có tiềm năng lớn. 

Với prompt tốt hơn và các cải tiến trong tương lai, tôi có thể thấy nó trở thành một mô hình lập trình cục bộ rất hữu dụng, tương tự trải nghiệm của tôi với Qwen3.6 27B.

Tôi cũng cho rằng đây là một hướng đi tuyệt vời cho Meta AI. 

Có sự quan tâm rõ ràng tới các tác tử lập trình cục bộ vì chúng có thể mang lại:

  • Chi phí thấp hơn, không có phí API
  • Quyền riêng tư tốt hơn cho mã và dữ liệu của bạn
  • Kiểm soát đầu ra nhiều hơn
  • Khả năng làm việc cục bộ mà không phụ thuộc vào API mô hình bên ngoài

Trong thiết lập của tôi, mô hình dùng khoảng 24 GB bộ nhớ GPU, điều này khiến nó khả thi cho phần cứng cục bộ cao cấp. 

Bạn cũng có thể chạy các mô hình như vậy với bộ nhớ hệ thống hoặc bộ nhớ hợp nhất, dù hiệu năng sẽ chậm hơn.

Trong hướng dẫn này, chúng ta đã build llama.cpp, tải các tệp GGUF của Muse Glimmer, bật thị giác và giải mã suy đoán, kiểm thử API và Web UI, và kết nối mô hình với OpenCode. 

Chúng ta cũng đã dùng nó để xây dựng và kiểm thử một ứng dụng hoàn chỉnh. 

Điểm chính tôi rút ra là Muse Glimmer rất nhanh khi tạo mã, nhưng vẫn cần chỉ dẫn rõ ràng khi gỡ lỗi hoặc xử lý các tác vụ agentic phức tạp hơn.

FAQs

DFlash speculative decoding trong llama.cpp là gì và tại sao tôi cần một tệp GGUF riêng?

DFlash (draft-dflash) là kỹ thuật giải mã suy đoán dạng khuếch tán theo khối, dự đoán cả một khối token nháp đi trước mô hình chính trong một lần lan truyền tiến. Bằng cách đoán các đoạn văn bản theo cụm và để mô hình lớn hơn xác minh nhanh, nó tăng tốc đáng kể quá trình sinh văn bản. Tệp dflash-kquant.gguf riêng là mô hình nháp gọn nhẹ được huấn luyện đặc biệt để dự đoán đầu ra của Muse Glimmer.

Tôi có thể chạy Muse Glimmer 30B trên GPU AMD hoặc Mac Apple Silicon không, hay bắt buộc phải dùng NVIDIA?

Vì mô hình chạy trên llama.cpp, bạn không nhất thiết phải cần GPU NVIDIA. Meta đã xác nhận hiệu năng cục bộ mạnh mẽ ngay từ đầu trên bộ xử lý AMD Ryzen AI Max+ và card đồ họa Radeon PRO R9700. Người dùng Apple Silicon (M2/M3/M4 Max hoặc Ultra) cũng có thể chạy mô hình hiệu quả nhờ tận dụng Bộ nhớ Hợp nhất của macOS, dù họ sẽ cần biên dịch llama.cpp với hỗ trợ Apple Metal (-DGGML_METAL=ON) thay vì CUDA.

Cửa sổ ngữ cảnh tối đa của Muse Glimmer 30B là bao nhiêu?

Mô hình hỗ trợ cửa sổ ngữ cảnh gốc lên tới 131.072 (128K) token. Tuy nhiên, sử dụng toàn bộ 128K sẽ cần nhiều VRAM hơn đáng kể để lưu KV cache. Để chạy cửa sổ ngữ cảnh tối đa tại chỗ trên card đồ họa 32 GB, bạn có thể cần bật lượng tử hóa KV cache (chẳng hạn kiểu cache 8-bit hoặc 4-bit) trong llama.cpp hoặc offload một số tầng của mô hình sang RAM hệ thống.

Muse Glimmer 30B so với Qwen3.6 27B: Cái nào tốt hơn cho lập trình cục bộ?

Dù cả hai đều là mô hình rất mạnh trong cùng hạng cân, chúng nổi trội ở các lĩnh vực khác nhau. Muse Glimmer 30B cực nhanh trong sinh mã zero-shot và nhanh chóng dựng cấu trúc ứng dụng hoàn chỉnh từ đầu. Tuy nhiên, Qwen3.6 27B hiện đáng tin cậy hơn cho gỡ lỗi độc lập nhiều bước và giải quyết vấn đề theo kiểu agentic. Nếu bạn dùng Muse Glimmer cho gỡ lỗi, bạn sẽ đạt kết quả tốt nhất khi cung cấp hướng dẫn khắc phục sự cố rất rõ ràng theo từng bước.

Chủ đề
Trí tuệ Nhân tạo
AI Agents

Các khóa học hàng đầu trên DataCamp

Khóa học

Lập trình với AI dành cho Developer

1 giờ 30 phút
10.5K
Nâng cao kỹ năng lập trình của bạn với trí tuệ nhân tạo — hướng dẫn trợ lý lập trình của bạn để viết, kiểm thử và tài liệu hóa mã nguồn một cách hiệu quả.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow
Liên quan

blog

Claude Opus 4.6: Tính năng, Điểm chuẩn, Bài kiểm tra thực hành và hơn thế nữa

Mô hình mới nhất của Anthropic dẫn đầu ở mã hóa tác tử và lập luận phức tạp. Thêm vào đó, nó có cửa sổ ngữ cảnh 1M.
Matt Crabtree's photo

Matt Crabtree

10 phút

Xem ThêmXem Thêm