Tracks
Nhỏ hơn và nhanh hơn không còn đồng nghĩa tự động với kém khả năng hơn. Theo các đánh giá đã công bố của DeepSeek, DeepSeek-V4-Flash-0731 sử dụng lượng tham số kích hoạt nhỏ hơn nhiều so với DeepSeek-V4-Pro nhưng vẫn cho hiệu năng tác tử gần mức tiên tiến: đạt 82,7 trên Terminal Bench 2.1, so với 81,0 của GLM-5.2 và 85,0 của Opus 4.8; đồng thời điểm 25,2 ở Agents’ Last Exam của nó cũng sát với 25,7 của Opus 4.8.
Vì trọng số được công bố công khai, về lý thuyết bạn có thể chạy mô hình trên phần cứng của riêng mình khi có đủ RAM hoặc VRAM tổng hợp, giữ việc suy luận và dữ liệu dự án dưới quyền kiểm soát của bạn.
Trong hướng dẫn này, chúng ta sẽ cấu hình môi trường RunPod với ba GPU, cài đặt và khởi chạy Unsloth Studio, tải và nạp phiên bản Q8 của DeepSeek-V4-Flash-0731 lên các GPU, kiểm thử mô hình qua Studio, kết nối máy chủ suy luận cục bộ với OpenCode, và dùng tác tử lập trình để xây dựng và khởi chạy một website phân tích cổ phiếu tương tác.
Điểm khác biệt của DeepSeek-V4-Flash-0731 là gì?
DeepSeek-V4-Flash-0731 là bản phát hành chính thức thay thế bản xem trước trước đó, với các cải tiến lớn về lập trình, sử dụng công cụ, và các nhiệm vụ tác tử tự động. Kiến trúc Mixture-of-Experts của nó chỉ kích hoạt một phần mô hình cho mỗi token. Điều này giúp mô hình hiệu quả hơn trong khi vẫn duy trì hiệu năng mạnh.

Nguồn: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
DeepSeek cho biết mô hình đã cải thiện từ 61,8 lên 82,7 trên Terminal Bench 2.1 và từ 7,3 lên 54,4 trên DeepSWE. Nó cũng vượt qua DeepSeek-V4-Pro Preview lớn hơn ở một số benchmark cho tác tử.
Mô hình hỗ trợ cửa sổ ngữ cảnh lên tới một triệu token. Điều này phù hợp với các codebase lớn, tài liệu dài, và quy trình phức tạp cần nhiều ngữ cảnh. Người dùng cũng có thể chọn giữa mức nỗ lực lập luận thấp, cao, và tối đa, tùy thuộc vào thời gian mô hình nên dành để giải quyết một tác vụ.
DeepSeek-V4-Flash-0731 cũng bao gồm giải mã suy đoán DSpark. DSpark phác thảo trước vài token rồi mô hình chính xác minh, theo DeepSeek điều này có thể cải thiện tốc độ sinh từ 60% đến 85% khi dùng với engine suy luận tương thích.
1. Cấu hình Pod trên RunPod
Chúng ta sẽ bắt đầu bằng cách tạo môi trường RunPod với đủ bộ nhớ GPU và lưu trữ để chạy phiên bản Q8 của DeepSeek-V4-Flash-0731 và lưu trữ cả Unsloth Studio lẫn website do OpenCode tạo ra.
Cấu hình Pod với:
- 3× NVIDIA A100 SXM 80GB GPU
- Mẫu RunPod PyTorch mới nhất
- Ít nhất 250GB lưu trữ volume persistent
- Ít nhất 50GB lưu trữ container
/workspacelà đường dẫn mount của volume persistent- Thêm token truy cập Hugging Face là
HF_TOKEN - Mở cổng HTTP
8910và9101

Cổng 8910 sẽ dùng cho Unsloth Studio và API suy luận cục bộ của nó. Cổng 9101 sẽ lưu trữ website tương tác do OpenCode tạo.
RunPod công khai các dịch vụ này qua HTTP proxy, vì vậy cả hai ứng dụng phải lắng nghe trên 0.0.0.0 thay vì chỉ 127.0.0.1.

Sau khi triển khai Pod, mở thẻ Connect, khởi chạy JupyterLab, và tạo ba phiên terminal:
Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode
Giữ các tác vụ trong các terminal riêng giúp bạn dễ theo dõi GPU, khắc phục sự cố mô hình và chạy tác tử lập trình cùng lúc.
2. Cài đặt và khởi chạy Unsloth Studio
Tiếp theo, chúng ta sẽ cài đặt Unsloth Studio, cấu hình bộ nhớ đệm Hugging Face persistent và khởi chạy giao diện trên cổng 8910.
Trong Terminal 1, xác nhận rằng cả ba GPU đều khả dụng:
nvidia-smi
Bạn sẽ thấy cả ba GPU A100 được liệt kê trên máy chủ Linux.

Tạo bộ nhớ đệm Hugging Face persistent trong /workspace để các mô hình đã tải vẫn có sẵn trên volume RunPod:
mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface
echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc
Tiếp theo, cài đặt các gói hệ thống cần thiết và Unsloth Studio:
cd /workspace
apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev
curl -fsSL https://unsloth.ai/install.sh | sh

Trình cài đặt cấu hình giao diện Studio, môi trường Python, các phụ thuộc và thành phần suy luận cục bộ.
Lần cài đặt đầu tiên có thể mất vài phút.

Khi trình cài đặt hỏi bạn có muốn khởi động Unsloth Studio ngay không, hãy nhập “n”.
Chúng ta sẽ khởi chạy thủ công để dùng cổng 8910 và lắng nghe đúng địa chỉ mạng.
Khởi động lại shell để các lệnh mới khả dụng:
exec bash
cd /workspace
Trước khi mở Studio, hãy đặt lại mật khẩu mặc định:
unsloth studio reset-password
Sao chép mật khẩu tạm thời hiển thị trong quá trình thiết lập, vì bạn có thể cần nó để hoàn tất việc đặt lại.
Bây giờ khởi chạy Unsloth Studio:
unsloth studio \
-H 0.0.0.0 \
-p 8910

Studio lúc này sẽ báo đang chạy trên cổng 8910. Giữ Terminal 1 mở khi sử dụng Unsloth Studio và OpenCode.
Quay lại trang Connect của RunPod và mở HTTP Service cho cổng 8910.

Dùng mật khẩu tạm thời đã tạo trước đó để hoàn tất đặt lại, rồi đăng nhập với mật khẩu mới bạn vừa tạo.
Hoàn tất hoặc bỏ qua các bước onboarding và mở trang Chat.

3. Tải và chạy DeepSeek-V4-Flash-0731
Giờ Unsloth Studio đã chạy, chúng ta có thể tải mô hình Q8, nạp nó lên ba GPU và kiểm thử khả năng trò chuyện và dùng công cụ.
Mở bộ chọn mô hình ở góc trên bên trái và tìm unsloth/DeepSeek-V4-Flash-0731-GGUF rồi chọn lượng tử hóa Q8 UD-Q8_K_XL.

Chúng ta dùng Q8 vì ba GPU A100 cung cấp đủ VRAM tổng. Q8 giữ chất lượng gần với mô hình gốc hơn, trong khi các mức lượng tử thấp hữu ích khi bộ nhớ phần cứng hạn chế.
Khi tải xong, Unsloth Studio sẽ tự động bắt đầu nạp mô hình vào bộ nhớ GPU. Việc này có thể mất vài phút vì mô hình Q8 rất lớn.

Sau khi nạp, dùng trang Chat để kiểm thử mô hình với vài prompt đơn giản.
Trong thử nghiệm của chúng tôi, tốc độ sinh đạt khoảng 33 token/giây mà không bật giải mã suy đoán, đây là kết quả hợp lý cho một mô hình cỡ này.

Bạn cũng có thể bật công cụ tìm kiếm web của Studio và yêu cầu mô hình tra cứu thông tin hiện tại, như giá vàng và bạc mới nhất. Đây là cách hữu ích để xác nhận mô hình có thể gọi công cụ bên ngoài thay vì chỉ dựa vào kiến thức nội bộ.

Trong Terminal 2, kiểm tra mô hình được phân bổ trên các GPU như thế nào:
nvidia-smi

Bạn sẽ thấy lượng sử dụng bộ nhớ đáng kể trên cả ba GPU.
Trong thử nghiệm của chúng tôi, mỗi GPU đầy khoảng 70%. Tuy nhiên, điều này không nhất thiết có nghĩa toàn bộ mô hình Q8 sẽ vừa vặn trên chỉ hai GPU 80GB, vì vẫn cần thêm VRAM cho cửa sổ ngữ cảnh, KV cache, và bộ đệm suy luận.
Cuối cùng, hãy kiểm thử mô hình với prompt lên kế hoạch cho ứng dụng chúng ta sẽ xây dựng:
Create a concise architecture plan for an interactive stock analytics website
using Next.js, financial charts, technical indicators, portfolio tracking,
and responsive animations.
Mô hình trả về một kế hoạch phát triển có cấu trúc bao quát kiến trúc ứng dụng, thành phần, luồng dữ liệu, thư viện biểu đồ, tính toán tài chính, và thiết kế giao diện.

4. Kết nối DeepSeek-V4-Flash-0731 với OpenCode và xây dựng website
Giờ mô hình đã chạy trong Unsloth Studio, chúng ta có thể kết nối nó với OpenCode và dùng như một tác tử lập trình cục bộ.
Trong Terminal 3, đặt URL của Studio:
echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc
Tạo thư mục dự án mới:
mkdir -p /workspace/market-pulse
cd /workspace/market-pulse
Khởi động OpenCode thông qua Unsloth Studio:
unsloth start opencode
Lần đầu chạy lệnh này, hệ thống sẽ yêu cầu quyền cài đặt OpenCode. Nhập “y”.

Sau khi cài đặt xong, OpenCode sẽ khởi chạy với mô hình DeepSeek-V4-Flash-0731 đang chạy cục bộ đã được cấu hình sẵn.

Dán prompt hai dòng sau vào OpenCode:
Build a polished, highly interactive stock analytics website using Bun, Next.js App Router,
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API,
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking,
comparisons, responsive design, animations, loading states, and error handling.
Work autonomously: install everything, create every file, test and fix the complete application,
and run the finished website on 0.0.0.0:9101.
Trong vài giây, tác tử lập trình sẽ tạo danh sách nhiệm vụ chi tiết và bắt đầu thực hiện dự án từng bước.

Toàn bộ quá trình build mất khoảng 20 phút trong thử nghiệm của chúng tôi. Trong khi chạy, bạn có thể quay lại Unsloth Studio và mở trang giám sát API trong Settings để theo dõi mức sử dụng mô hình và tốc độ sinh.
Chúng tôi ghi nhận trung bình khoảng 22,6 token/giây trong quá trình lập trình. Tốc độ có thể giảm khi hội thoại và ngữ cảnh dự án tăng lên.

Sau khi hoàn tất các nhiệm vụ, OpenCode sẽ cung cấp bản tóm tắt các tệp, tính năng và lệnh đã tạo. Nó cũng sẽ khởi chạy website hoàn chỉnh trên cổng 9101.

Quay lại trang Connect của RunPod và mở HTTP Service cho cổng 9101.
Kết quả thật đáng ngạc nhiên về độ chỉn chu. Website trông sạch sẽ, có hoạt ảnh, và giống một bảng điều khiển giao dịch chuyên nghiệp. Mô hình đã hoàn thành ứng dụng web chỉ với một prompt, bao gồm giao diện, chế độ xem dữ liệu, biểu đồ và điều hướng.

Bạn có thể chọn từng mã cổ phiếu để xem biểu đồ nến, hiệu suất lịch sử, chỉ báo và thông tin doanh nghiệp bổ sung.

Thẻ Compare cũng cho phép bạn so sánh nhiều cổ phiếu và xem cổ phiếu nào có hiệu suất tốt hơn trong khoảng thời gian đã chọn.

Tôi thực sự ngạc nhiên khi một mô hình cục bộ nhỏ hơn có thể xây dựng toàn bộ website chỉ từ một prompt.
Sau khi kiểm thử ứng dụng, mọi tính năng chính đều hoạt động như mong đợi, gồm giá cổ phiếu theo thời gian thực, dữ liệu thị trường lịch sử, biểu đồ, chỉ báo và công cụ so sánh.
Thật ấn tượng khi các mô hình cục bộ đang cải thiện nhanh đến vậy và trở nên đủ mạnh để hoàn thành các nhiệm vụ phát triển phức tạp, đầu-cuối.
Kết luận
Với tôi, DeepSeek-V4-Flash-0731 là mô hình cục bộ tốt nhất tôi từng thử đến nay.
Nó hoạt động tốt hơn Inkling, lượng tử hóa GLM-5.2 2-bit và Qwen3.6-27B, vốn trước đây là lựa chọn ưa thích của tôi. Điều này dựa trên trải nghiệm cá nhân thay vì benchmark chính thức, nhưng hiện đây là mô hình cục bộ tôi ưa dùng nhất.
Với hầu hết khối lượng công việc thực tế, tôi vẫn sẽ bắt đầu với API chính thức của DeepSeek vì chi phí cực kỳ phải chăng.
Hiện V4 Flash có giá $0,14 cho mỗi triệu token đầu vào chưa được cache, $0,0028 cho mỗi triệu token đầu vào đã cache, và $0,28 cho mỗi triệu token đầu ra. Với mức này, một tỷ token đầu vào đã cache sẽ tốn khoảng $2,80 trước chi phí đầu ra.
Trước khi chọn Unsloth Studio, tôi đã thử chạy mô hình qua llama.cpp. Trình cài đặt dựng sẵn không cung cấp binary CUDA đủ mới cho môi trường của tôi, và dù đã biên dịch phiên bản mới nhất từ mã nguồn, tôi vẫn gặp thêm vấn đề khi bật giải mã suy đoán DSpark.
Cuối cùng, Unsloth Studio mang lại thiết lập đơn giản nhất và loại bỏ hầu hết cấu hình thủ công. Nó hoạt động tốt với OpenCode, dù việc build toàn bộ ứng dụng mất khoảng 20 phút.
Là một nhà khoa học dữ liệu được chứng nhận, tôi đam mê tận dụng công nghệ tiên tiến để tạo ra các ứng dụng học máy đổi mới. Với nền tảng vững chắc về nhận dạng giọng nói, phân tích và báo cáo dữ liệu, MLOps, AI hội thoại và NLP, tôi đã rèn giũa kỹ năng phát triển các hệ thống thông minh có thể tạo ra tác động thực sự. Bên cạnh chuyên môn kỹ thuật, tôi cũng là một người truyền đạt tốt, có khả năng chắt lọc các khái niệm phức tạp thành ngôn ngữ rõ ràng, súc tích. Nhờ đó, tôi trở thành một blogger được nhiều người quan tâm trong lĩnh vực khoa học dữ liệu, chia sẻ góc nhìn và kinh nghiệm với cộng đồng các chuyên gia dữ liệu ngày càng lớn. Hiện tại, tôi tập trung vào sáng tạo và biên tập nội dung, làm việc với các mô hình ngôn ngữ lớn để phát triển nội dung mạnh mẽ và hấp dẫn, giúp doanh nghiệp và cá nhân tận dụng tối đa dữ liệu của mình.
