Chuyển đến nội dung chính

Cách chạy Fable 5-Enhanced Gemma 4 trên máy cục bộ

Tìm hiểu cách chạy Fable 5-Enhanced Gemma 4 cục bộ với binary llama.cpp dựng sẵn trên RTX 5070 Ti, thử nghiệm MTP speculative decoding, kết nối Pi cho quy trình tác tử mã hóa AI riêng tư, và khắc phục các lỗi thiết lập thường gặp.
Đã cập nhật 5 thg 10, 2026  · 12 phút đọc

Khám phá cùng AI

ChatGPTClaudePerplexity

Sau khi Fable 5 và Mythos 5 bị đóng cửa, cộng đồng mã nguồn mở bắt đầu thử nghiệm các mô hình nhỏ chạy cục bộ, được huấn luyện trên dữ liệu mã hóa tổng hợp chất lượng cao và dữ liệu tác tử. Fable 5-Enhanced Gemma 4 là một ví dụ.

Đây là bản fine-tune của Gemma 4 12B, được huấn luyện trên các bộ dữ liệu do Fable 5 và Composer 2.5 tạo ra. Mục tiêu là chuyển giao các hành vi mã hóa và tác tử hữu ích vào một mô hình nhỏ hơn có thể chạy cục bộ.

Quá trình huấn luyện tập trung vào các quy trình làm việc thực tiễn như hiểu nhiệm vụ, đọc tệp, sử dụng công cụ, chỉnh sửa mã, chạy lệnh và xác minh kết quả cuối cùng.

Trong hướng dẫn này, tôi sẽ chỉ bạn cách chạy mô hình Gemma 4 tăng cường bởi Fable 5 trên máy cục bộ với RTX 5070 Ti bằng llama.cpp. 

Chúng ta sẽ cài đặt llama.cpp, tải xuống mô hình GGUF và mô hình nháp MTP, khởi chạy máy chủ cục bộ tương thích OpenAI, và kiểm thử bằng cURL và WebUI tích hợp sẵn.

Cuối cùng, chúng ta sẽ kết nối mô hình với Pi Coding Agent và giao cho nó một tác vụ mã hóa thực tế. Câu hỏi chính là liệu mô hình 12B gọn nhẹ này có thể mang lại hành vi tác tử mã hóa hữu ích và cạnh tranh với các mô hình cục bộ lớn hơn như Qwen 3.6 27B hoặc Gemma 4 31B.

Fable 5-Enhanced Gemma 4 12B là gì?

Fable 5-Enhanced Gemma 4 là mô hình mã hóa và tác tử gọn nhẹ dựa trên mô hình hướng dẫn Gemma 4 12B của Google. Nó được tạo bởi Yuxin Lu và phát hành dưới định dạng GGUF để dùng cục bộ với llama.cpp và các công cụ tương thích khác.

hồ sơ yuxinlu1 trên Hugging Face

Nguồn: yuxinlu1 (Yuxin Lu) 

Hướng dẫn này sử dụng bản phát hành v2. Nó tiếp nối mô hình mã hóa v1 nhưng tập trung mạnh hơn vào công việc kỹ thuật kiểu tác tử. 

Thay vì chỉ sinh mã, mô hình được thiết kế để kiểm tra tệp, lý giải vấn đề, sử dụng công cụ, chỉnh sửa mã, chạy lệnh và xác minh kết quả cuối cùng.

Dữ liệu huấn luyện: Composer 2.5 và mã hóa tổng hợp

Mô hình gốc được fine-tune trên dữ liệu mã Python đã xác minh, do Composer 2.5 và Fable 5 tạo ra.

Bộ huấn luyện chính sử dụng các vết suy luận và lời giải mã cho các tác vụ Python với bài kiểm thử xác định. Chỉ giữ lại các ví dụ mà mã sinh ra vượt qua bài kiểm thử.

Fable 5 được dùng cho các tác vụ khó hơn nơi Composer 2.5 thất bại. Nó tạo ra quy trình suy luận mới và lời giải đã hiệu chỉnh cho các ví dụ này, cũng được xác minh qua thực thi trước khi thêm vào dữ liệu huấn luyện.

Với v2, mô hình bổ sung các quỹ đạo nhiều bước cho terminal và sử dụng công cụ. Điều này dạy mô hình tuân theo quy trình đọc, lý giải, hành động và xác minh thay vì đưa ra một câu trả lời rồi dừng lại. 

Sau khi Fable 5 không còn khả dụng, một số vết suy luận phong cách Fable 5 bị thiếu đã được tái tạo bằng Opus 4.8.

Tính năng chính của mô hình tác tử V2

  • Mã hóa và dùng công cụ: Thiết kế cho việc đọc tệp, chạy lệnh, chỉnh sửa mã, gỡ lỗi và kiểm tra kết quả.
  • Nền tảng mã hóa đã xác minh: Ví dụ huấn luyện sử dụng lời giải Python vượt qua bài kiểm thử xác định.
  • Nâng cấp tác tử: v2 bổ sung quy trình sử dụng công cụ nhiều bước cho tác vụ terminal và tác tử mã hóa.
  • Triển khai ưu tiên cục bộ: Định lượng Q4_K_M khuyến nghị khoảng 7 GB, phù hợp với nhiều GPU tiêu dùng hiện đại.
  • Suy nghĩ và lời gọi công cụ có cấu trúc: Giữ --jinja bật trong llama.cpp để mô hình dùng đúng mẫu chat và định dạng lời gọi công cụ của Gemma 4.
  • Hỗ trợ ngữ cảnh dài: Mô hình hỗ trợ tới 256K ngữ cảnh, dù giới hạn thực tế phụ thuộc vào VRAM, cài đặt KV-cache và định lượng đã chọn.

Hiệu năng benchmark so với Gemma 4 gốc

Trong so sánh cục bộ tau2-bench mảng viễn thông, mô hình v2 đạt khoảng 55%, so với khoảng 15% của mô hình hướng dẫn Gemma 4 12B gốc.

Điều này gợi ý cải thiện chính đến từ hành vi tác tử. Mô hình fine-tune giỏi hơn trong việc kiểm tra nhiệm vụ, thực hiện hành động kế tiếp, dùng công cụ và xác minh kết quả thay vì dừng lại sau phản hồi ban đầu.

Bước 1: Cài đặt llama.cpp trên Linux qua cURL

Đây là cách nhanh và đơn giản nhất để cài đặt llama.cpp trên máy Linux. Thay vì clone repo và biên dịch từ mã nguồn, trình cài đặt sẽ tải binary dựng sẵn và thiết lập cho bạn.

Chạy lệnh sau trong terminal:

curl -LsSf https://llama.app/install.sh | sh

Trong vài giây, trình cài đặt sẽ tải binary llama.cpp và hoàn tất thiết lập. 

Cài đặt llama.cpp bằng binary dựng sẵn

Tiếp theo, thêm llama.cpp vào PATH để bạn có thể chạy lệnh llama từ bất kỳ thư mục nào, ngay cả sau khi khởi động lại terminal:

echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc

Cuối cùng, kiểm tra cài đặt đã thành công: 

llama help

Bạn sẽ thấy các lệnh có sẵn của llama.cpp. 

Kiểm thử lệnh trợ giúp của llama.cpp

Bước 2: Tải Gemma 4 GGUF và MTP Draft Models

Tiếp theo, cài đặt Hugging Face CLI và hf-xet. Điều này cho phép bạn tải trực tiếp tệp mô hình từ Hugging Face, bao gồm cả các kho sử dụng lưu trữ Xet cho tệp lớn. 

pip install -U "huggingface_hub[cli]" hf-xet 

Tạo thư mục lưu tệp mô hình: 

MODEL_DIR="/workspace/Fable5-Gemma4"
mkdir -p "$MODEL_DIR" 

Bật tải Xet nhanh hơn, rồi chỉ tải các tệp cần cho hướng dẫn này: 

export HF_XET_HIGH_PERFORMANCE=1


hf download \
  yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF \
  --include "gemma4-v2-Q4_K_M.gguf" \
  --include "MTP/gemma-4-12B-it-MTP-Q8_0.gguf" \
  --local-dir "$MODEL_DIR"

tải thing the : yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF

Lệnh này tải hai tệp:

  • gemma4-v2-Q4_K_M.gguf, mô hình Fable 5 Enhanced Gemma 4 chính.
  • MTP/gemma-4-12B-it-MTP-Q8_0.gguf, mô hình nháp dùng sau cho MTP speculative decoding.

Mô hình Q4_K_M khoảng 7 GB. Thời gian tải phụ thuộc vào kết nối mạng của bạn, nhưng dùng Xet có thể cải thiện hiệu năng truyền đối với tệp mô hình lớn.

Sau khi tải xong, tệp của bạn sẽ nằm tại:

/workspace/Fable5-Gemma4

Bước 3: Khởi chạy máy chủ AI cục bộ với MTP Speculative Decoding

Giờ hãy khởi chạy máy chủ cục bộ với mô hình chính và mô hình nháp MTP: 

MODEL_DIR="/workspace/Fable5-Gemma4"

llama serve \
  --model "$MODEL_DIR/gemma4-v2-Q4_K_M.gguf" \
  --alias Fable5-Gemma4 \
  --model-draft "$MODEL_DIR/MTP/gemma-4-12B-it-MTP-Q8_0.gguf" \
  --spec-type draft-mtp \
  --spec-draft-n-max 2 \
  -ngl 99 \
  -ngld 99 \
  --ctx-size 262144 \
  --parallel 1 \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --flash-attn on \
  --jinja \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 64 \
  --repeat-penalty 1.1 \
  --host 0.0.0.0 \
  --port 8910

Mô hình mã hóa Fable 5–Enhanced chạy cục bộ

Tham số --model-draft nạp mô hình nháp MTP. 

MTP là Multi Token Prediction. Mô hình nháp nhỏ hơn dự đoán trước vài token sắp tới, và mô hình chính kiểm chứng song song. Điều này có thể cải thiện tốc độ sinh mà không thay đổi vai trò của mô hình chính.

--spec-type draft-mtp bật cấu hình MTP speculative decoding. --spec-draft-n-max 2 cho phép mô hình nháp đề xuất tối đa hai token mỗi lần. Hai là điểm khởi đầu hợp lý vì giá trị lớn hơn không phải lúc nào cũng tăng tốc độ.

-ngl 99 chuyển mô hình chính lên GPU, trong khi -ngld 99 làm điều tương tự cho mô hình nháp MTP. Giá trị 99 đơn giản có nghĩa là offload mọi lớp có thể.

--ctx-size 262144 đặt cửa sổ ngữ cảnh tối đa 256K token. Điều này hữu ích cho codebase lớn và phiên terminal dài, nhưng cũng cần nhiều VRAM hơn. --parallel 1 dành toàn bộ ngữ cảnh cho một yêu cầu hoạt động thay vì chia cho nhiều người dùng.

Cài đặt KV-cache Q8 giúp giảm bộ nhớ cần cho cửa sổ ngữ cảnh dài. --flash-attn on giúp tính toán attention hiệu quả hơn, đặc biệt với prompt dài.

Giữ --jinja bật. Nó áp dụng mẫu chat tích hợp của mô hình để định dạng đúng prompt, suy luận và lời gọi công cụ.

Các thiết lập sampling còn lại kiểm soát cách mô hình sinh văn bản. --temp 1.0, --top-p 0.95 và --top-k 64 cho phép phản hồi đa dạng, trong khi --repeat-penalty 1.1 giúp giảm lặp lại.

Khi máy chủ đã nạp xong, mở WebUI:

http://localhost:8910 

Bạn cũng có thể kiểm tra mức sử dụng GPU từ một terminal khác:

nvidia-smi

Thống kê GPU sau khi nạp gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2

Trên thiết lập RTX 5070 Ti của tôi, mô hình dùng khoảng 11,8 GB VRAM với cấu hình ngữ cảnh 256K, còn dư hơn 4 GB. 

Mức sử dụng bộ nhớ của bạn có thể khác tùy bản build llama.cpp, driver GPU và cài đặt ngữ cảnh. 

Bước 4: Kiểm thử Fable 5–Enhanced Gemma 4 bằng cURL và WebUI

Giữ terminal chạy llama serve, rồi mở terminal thứ ba để thử API cục bộ. 

curl http://127.0.0.1:8910/v1/messages \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Fable5-Gemma4",
    "max_tokens": 512,
    "messages": [
      {
        "role": "user",
        "content": "Create a simple Python script that prints Hello, I am running locally! "
      }
    ]
  }'

Phản hồi sẽ chứa văn bản do mô hình sinh, cùng phần suy nghĩ của nó. Trong thử nghiệm này, mô hình trả về đoạn mã Python sau:

print("Hello, I am running locally!")

Phản hồi JSON xác nhận máy chủ cục bộ hoạt động đúng. Trong thử nhanh của tôi, mô hình sinh với tốc độ khoảng 54 token/giây.

Bạn cũng có thể dùng giao diện chat tích hợp. Mở địa chỉ sau trong trình duyệt:

http://localhost:8910

WebUI hoạt động như một ứng dụng chat bình thường. Chọn mô hình Fable5-Gemma4, nhập prompt và gửi đến máy chủ cục bộ.

Kiểm thử mô hình Fable 5–Enhanced Gemma 4 trong WebUI

Với một bài kiểm thử mã hóa lớn hơn, dùng prompt này: 

Create a calming, premium spa treatment center website in one self-contained HTML file 
with all CSS and JavaScript included inline, elegant booking CTAs, treatment packages, 
therapist profiles, testimonials, and high-quality spa imagery.

Kiểm thử mô hình Fable 5–Enhanced Gemma 4 trong WebUI

Với tác vụ sinh HTML dài hơn này, tôi thấy khoảng 66 đến 70 token/giây. Tác vụ mã dài đôi khi cho hiệu năng speculative decoding tốt hơn vì mô hình sinh chuỗi token mã liên tục và dễ dự đoán hơn. 

Kết quả đầu tiên dưới đây được sinh khi bật suy luận ở mức Medium. Nó tạo trang đích spa gọn gàng với bố cục tối giản, liên kết điều hướng và nút kêu gọi đặt lịch nổi bật. 

Trang web tạo bởi mô hình Fable 5–Enhanced Gemma 4

Kết quả thứ hai được tạo khi không bật suy luận. Nó cho hướng thiết kế khác, với tiêu đề lớn và phong cách trang đích mang tính biên tập hơn. 

Trang web tạo bởi mô hình Fable 5–Enhanced Gemma 4

Cả hai kết quả đều trau chuốt về mặt hình ảnh, nhưng phiên bản bật suy luận cho kết quả có cấu trúc hơn trong thử nghiệm này. 

Tốc độ token có thể thay đổi tùy độ dài prompt, phong cách đầu ra, tải GPU, và tần suất mô hình chính chấp nhận các token nháp do MTP đề xuất. 

Bước 5: Kết nối Pi Coding Agent với máy chủ llama.cpp cục bộ

Pi là tác tử mã hóa chạy trong terminal, gọn nhẹ. Nó có thể kết nối tới máy chủ Fable 5-Enhanced Gemma 4 cục bộ và dùng để đọc tệp, chỉnh sửa mã, chạy lệnh, hoàn thành tác vụ mã hóa.

Mở terminal thứ tư và cài đặt Pi:

curl -fsSL https://pi.dev/install.sh | sh

Cài đặt Pi Coding AgentTrình cài đặt có thể yêu cầu cài Node.js. Hãy chấp nhận và chờ quá trình hoàn tất.

Nạp lại cấu hình terminal, rồi xác nhận Pi đã sẵn sàng:

source ~/.bashrc
pi --version

Tiếp theo, cài plugin pi-llama: 

pi install git:github.com/huggingface/pi-llama

Plugin này kết nối Pi với một máy chủ llama.cpp đang chạy và tự động phát hiện các mô hình cục bộ có sẵn. 

Mặc định, plugin tìm llama.cpp ở cổng 8080. Máy chủ của chúng ta dùng cổng 8910, vì vậy hãy đặt đúng địa chỉ API cục bộ trước khi khởi chạy Pi: 

export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"

Bước 6: Chạy tác vụ mã hóa AI với Pi và Fable 5–Enhanced Gemma 4

Tạo thư mục dự án mới, khởi tạo Git và chạy Pi: 

mkdir -p /workspace/data-app
cd /workspace/data-app
git init
pi

Bên trong Pi, gõ:

/model

Chọn mô hình “Fable5-Gemma4”.

Chọn mô hình AI cục bộ trong Pi Coding Agent

Tiếp theo, giao cho tác tử một nhiệm vụ mã hóa thực tiễn: 

Create a simple data analytics dashboard using Streamlit that lets users 
upload a CSV file, view the data, and explore clear visualizations. 
Include a sample CSV file and test the full app to make sure it works correctly.

Tác tử Pi dùng công cụ write

Cuối cùng mô hình đã tạo một dashboard Streamlit hoạt động, hỗ trợ tải CSV và trực quan hóa. 

Tuy nhiên, quá trình này khó khăn hơn nhiều so với kỳ vọng. 

Dashboard Streamlit do mô hình mã hóa Fable 5–Enhanced tạo

Mô hình liên tục gặp khó với lời gọi công cụ, lệnh terminal và ghi tệp dự án. 

Nó thường không hoàn tất hành động kế tiếp sau khi đã lập kế hoạch, nên tôi phải liên tục hướng dẫn xử lý lỗi và chạy lại lệnh. 

Tôi không thể xác nhận vấn đề do mô hình, do tích hợp Pi, do quyền cục bộ hay là kết hợp các yếu tố này. 

Sau khoảng 20 phút thử lại, nó tạo ra kết quả hoạt động. Với một tác vụ Streamlit khá đơn giản, điều này là quá chậm và thiếu ổn định. 

Cùng tác vụ này chỉ mất khoảng một phút với GLM 5.2 trong thử nghiệm riêng của tôi. 

Việc so sánh mô hình cục bộ 12B với mô hình tuyến đầu lớn hơn là không hoàn toàn công bằng. 

Tuy vậy, khoảng cách vẫn rất rõ ràng. 

Fable 5-Enhanced Gemma 4 có thể tạo mã trau chuốt và đầu ra đơn lượt mạnh, nhưng hiệu năng tác tử thực sự thiếu ổn định trong thử nghiệm này. Nó cần quá nhiều can thiệp cho một tác vụ mà một tác tử mã hóa có năng lực nên hoàn thành nhanh và tự chủ.

Kết luận của tôi là mô hình này thú vị cho việc thử nghiệm cục bộ, sinh mã riêng tư và các quy trình gọn nhẹ. 

Nhưng dựa trên thử nghiệm này, tôi chưa khuyến nghị dựa vào nó cho các tác vụ tác tử mã hóa nhiều bước yêu cầu độ tin cậy.

Khắc phục sự cố Fable 5 và thiết lập llama.cpp

Mặc dù hướng dẫn này cung cấp cách đơn giản để thử mô hình, bạn có thể gặp vấn đề tùy vào phần cứng, thiết lập cục bộ và bản build llama.cpp.

1. Mô hình nháp MTP không nạp được

Nếu máy chủ sập khi nạp mô hình nháp MTP và hiển thị lỗi như:

invalid vector subscript

Vấn đề có thể do bản build llama.cpp của bạn, không phải tệp mô hình.

Kho mô hình báo rằng bản build llama.cpp b9553 hoạt động với mô hình nháp Gemma 4 MTP, trong khi các bản mới hơn như b9702 và b9717 có thể lỗi khi nạp mô hình nháp.

Giải pháp nhanh: bỏ các tham số MTP khỏi lệnh máy chủ và chỉ chạy mô hình chính. Mô hình vẫn hoạt động, nhưng tốc độ sinh có thể chậm hơn.

Bỏ các dòng sau:

--model-draft "$MODEL_DIR/MTP/gemma-4-12B-it-MTP-Q8_0.gguf"
--spec-type draft-mtp
--spec-draft-n-max 2
-ngld 99

2. Token công cụ thô xuất hiện trong đầu ra

Nếu bạn thấy các token như <|tool_call> hoặc <|channel> trong phản hồi, client không áp dụng đúng định dạng lời gọi công cụ gốc của Gemma 4.

Hãy chắc chắn lệnh máy chủ của bạn có:

--jinja

Sau đó khởi động lại máy chủ. Lệnh này áp dụng đúng mẫu chat cho suy luận và lời gọi công cụ có cấu trúc của mô hình.

3. Pi không tìm thấy mô hình cục bộ

Đầu tiên, kiểm tra máy chủ llama.cpp vẫn đang chạy:

curl http://127.0.0.1:8910/v1/models

Bạn sẽ thấy Fable5-Gemma4 trong phản hồi.

Tiếp theo, đảm bảo Pi trỏ tới cổng 8910 thay vì cổng mặc định 8080 của llama.cpp:

export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"
pi

Chạy cả hai lệnh trong cùng một phiên terminal.

4. Pi không thể ghi hoặc chỉnh sửa tệp

Khởi chạy Pi bên trong một thư mục dự án có quyền ghi:

cd /workspace/data-app
pi

Bạn có thể kiểm tra thư mục hiện tại có cho phép tạo tệp không:

touch write-test.txt && rm write-test.txt

Nếu lệnh này thất bại, vấn đề là quyền workspace chứ không phải mô hình. Hãy chuyển tới thư mục có quyền ghi trước khi khởi chạy Pi.

5. Đầu ra lặp lại hoặc sai lệch

Nếu mô hình bắt đầu lặp lại văn bản, số, hoặc ký hiệu, hãy kiểm tra cài đặt sampling trong lệnh máy chủ.

Dùng các giá trị sau:

--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--repeat-penalty 1.1

Tham số phạt lặp lại đặc biệt quan trọng. Thiếu nó, mô hình có thể sinh đầu ra lặp lại hoặc sai lệch.

6. Lỗi thiếu bộ nhớ

Cửa sổ ngữ cảnh 256K cần KV cache lớn. Nếu máy chủ hết VRAM, trước tiên hãy giảm kích thước ngữ cảnh:

--ctx-size 32768

Bạn cũng có thể tắt mô hình nháp MTP để giải phóng thêm VRAM. Kiểm tra mức dùng bộ nhớ GPU hiện tại bằng:

nvidia-smi

7. Tác tử liên tục thất bại ở tác vụ nhiều bước

Mô hình có thể sinh mã mạnh, nhưng vẫn có thể chật vật hoàn thành tác vụ dài mà không cần can thiệp. Trong thử nghiệm của tôi, đôi khi nó lập kế hoạch đúng nhưng thất bại khi chạy lệnh, ghi tệp, hoặc tiếp tục sau lỗi.

Để kết quả tốt hơn, hãy chia yêu cầu lớn thành các tác vụ nhỏ:

  1. Tạo tệp dự án và CSV mẫu
  2. Xây dựng giao diện Streamlit
  3. Thêm biểu đồ và hỗ trợ tải CSV
  4. Chạy ứng dụng và sửa lỗi

Điều này giúp mô hình có mục tiêu nhỏ hơn ở mỗi bước và dễ xác định hơn thất bại đến từ mô hình, Pi, máy chủ hay quyền workspace.

Lời kết

Tôi không nghĩ sự cường điệu quanh mô hình này là hoàn toàn hợp lý, ít nhất dựa trên thử nghiệm của tôi. Có và không có MTP, tôi nhận được gần như cùng tốc độ cho tác vụ chung. Khi làm tác vụ mã hóa, MTP có ích và tôi thấy tăng tốc khoảng 20% đến 30%. Điều đó hữu ích, nhưng không khắc phục vấn đề lớn hơn: độ tin cậy.

Tôi cũng thử mô hình trong WebUI. 

Đôi khi, trong khi viết mã cho một tệp, nó đột ngột dừng mà không rõ lý do. Khi tôi yêu cầu tiếp tục, nó viết phần tiếp theo như văn bản trong phản hồi chat kế tiếp thay vì thực sự tiếp tục tệp. 

Tôi cũng nhận thấy bật suy nghĩ đôi lúc làm đầu ra tệ hơn, điều này khá bất ngờ.

Tôi cũng thử với Claude Code, và trải nghiệm còn bực bội hơn. 

Mô hình liên tục tạo thêm tệp phụ, tệp tạm và những thứ không liên quan mà một dự án đơn giản không cần. Cuối cùng nó hoàn thành, nhưng mất quá nhiều hướng dẫn và thời gian.

Tôi biết việc so sánh mô hình cục bộ 12B với GPT-5.5 hay GLM 5.2 là không hoàn toàn công bằng. Nhưng ngay cả so với các mô hình cục bộ nhỏ hơn, tôi vẫn không ấn tượng.

 Theo trải nghiệm của tôi, Qwen3.6 27B tốt hơn nhiều cho tác vụ mã hóa và tác tử, dù nó lớn hơn.

Hiện tại, tôi xem mô hình này là một thử nghiệm thú vị hơn là một tác tử mã hóa đáng tin cậy. 

Tôi quan tâm hơn tới mô hình Qwen3.6 27B tinh chỉnh theo Fable sắp ra mắt từ cùng tác giả. Tôi cũng thấy vài nhà đóng góp mã nguồn mở khác phát hành các mô hình mã hóa chưng cất tương tự, nhưng đến nay tôi chưa thấy cải thiện lớn trong các tác vụ tác tử mã hóa thực tế.

Mô hình có thể sinh mã đẹp và đầu ra đơn lượt trau chuốt. Nhưng khi bạn yêu cầu nó làm việc như một tác tử, dùng công cụ, tạo tệp, sửa lỗi và xác minh kết quả, trải nghiệm vẫn thiếu nhất quán và gây nản.

FAQs

Tôi có thể dùng Fable 5-Enhanced Gemma 4 cho dự án thương mại không?

Có. Không giống các điều khoản hạn chế hơn của Gemma 1, 2 và 3, Google đã phát hành mô hình Gemma 4 gốc theo giấy phép Apache 2.0. Vì bản fine-tune này được xây dựng trên mô hình gốc đó, nó kế thừa giấy phép Apache 2.0, nghĩa là hoàn toàn miễn phí sử dụng, chỉnh sửa và phân phối lại cho mục đích thương mại.

Tôi có thể dùng Ollama hoặc LM Studio thay cho llama.cpp không?

Có. Các tệp GGUF tương thích hoàn toàn với Ollama, LM Studio, Jan và các client AI cục bộ khác. Tuy nhiên, do Gemma 4 dùng kiến trúc mới gemma4_unified, bạn phải đảm bảo phần mềm client được cập nhật lên phiên bản mới nhất; các bản cũ sẽ báo lỗi và không nạp được trọng số.

Mô hình chỉ viết được Python thôi à?

Dù có thể xuất ra các ngôn ngữ web như HTML, CSS và JavaScript (như trong bài kiểm thử trang spa), tập huấn luyện cốt lõi của nó gần như hoàn toàn là các tác vụ thuật toán Python có thể xác minh. Do đó, khả năng suy luận sâu, phát hiện edge-case và độ tin cậy khi dùng công cụ của nó mạnh hơn đáng kể với Python so với ngôn ngữ khác.

Mô hình này có cơ chế từ chối vì lý do an toàn tích hợp sẵn không?

Rất ít. Vì nó được fine-tune nặng trên các vết suy luận tổng hợp tập trung vào nhiệm vụ từ Composer 2.5 và Fable 5, không có các rào chắn an toàn tiêu chuẩn, nên nó từ chối prompt ít hơn nhiều so với Gemma 4 gốc. Nó không được căn chỉnh an toàn, có nghĩa là nhà phát triển phải tự triển khai hàng rào bảo vệ nếu đóng gói mô hình này vào ứng dụng sản xuất.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Là một nhà khoa học dữ liệu được chứng nhận, tôi đam mê tận dụng công nghệ tiên tiến để tạo ra các ứng dụng học máy đổi mới. Với nền tảng vững chắc về nhận dạng giọng nói, phân tích và báo cáo dữ liệu, MLOps, AI hội thoại và NLP, tôi đã rèn giũa kỹ năng phát triển các hệ thống thông minh có thể tạo ra tác động thực sự. Bên cạnh chuyên môn kỹ thuật, tôi cũng là một người truyền đạt tốt, có khả năng chắt lọc các khái niệm phức tạp thành ngôn ngữ rõ ràng, súc tích. Nhờ đó, tôi trở thành một blogger được nhiều người quan tâm trong lĩnh vực khoa học dữ liệu, chia sẻ góc nhìn và kinh nghiệm với cộng đồng các chuyên gia dữ liệu ngày càng lớn. Hiện tại, tôi tập trung vào sáng tạo và biên tập nội dung, làm việc với các mô hình ngôn ngữ lớn để phát triển nội dung mạnh mẽ và hấp dẫn, giúp doanh nghiệp và cá nhân tận dụng tối đa dữ liệu của mình.

Chủ đề
Trí tuệ Nhân tạo
Mô hình Ngôn ngữ Lớn

Khóa học hàng đầu trên DataCamp

Khóa học

Lập trình hỗ trợ bởi AI nâng cao cho nhà phát triển

1 giờ 30 phút
1.8K
Học cách dùng AI như một đối tác kỹ thuật cấp cao cho phân tích mã, tối ưu hiệu năng, bảo mật và quyết định kiến trúc phần mềm.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow