course
Mniejsze i szybsze nie musi już automatycznie oznaczać mniej wydajne. Według opublikowanych ocen DeepSeek, DeepSeek-V4-Flash-0731 używa znacznie mniejszej liczby aktywowanych parametrów niż DeepSeek-V4-Pro, jednocześnie osiągając wydajność zbliżoną do czołówki w zadaniach agentowych: uzyskuje wynik 82,7 w Terminal Bench 2.1, w porównaniu z 81,0 dla GLM-5.2 i 85,0 dla Opus 4.8, a jego wynik 25,2 w Agents’ Last Exam jest zbliżony do 25,7 modelu Opus 4.8.
Ponieważ wagi są publicznie dostępne, teoretycznie możesz uruchomić model na własnym sprzęcie, jeśli masz wystarczającą łączną ilość RAM lub VRAM, zachowując w ten sposób kontrolę nad inferencją i danymi projektu.
W tym przewodniku skonfigurujemy środowisko RunPod z trzema GPU, zainstalujemy i uruchomimy Unsloth Studio, pobierzemy i załadujemy wersję Q8 modelu DeepSeek-V4-Flash-0731 na wiele GPU, przetestujemy model w Studio, podłączymy lokalny serwer inferencji do OpenCode i użyjemy agenta kodującego do zbudowania i uruchomienia interaktywnej strony do analizy akcji.
Czym wyróżnia się DeepSeek-V4-Flash-0731?
DeepSeek-V4-Flash-0731 to oficjalne wydanie zastępujące wcześniejszą wersję preview, z dużymi usprawnieniami w kodowaniu, korzystaniu z narzędzi i zadaniach autonomicznych agentów. Jego architektura Mixture-of-Experts aktywuje tylko część modelu dla każdego tokena. Dzięki temu pozostaje bardziej wydajny, zachowując jednocześnie wysoką skuteczność.

Źródło: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
DeepSeek informuje, że model poprawił wynik z 61,8 do 82,7 w Terminal Bench 2.1 oraz z 7,3 do 54,4 w DeepSWE. Przewyższył też większy model DeepSeek-V4-Pro Preview w kilku benchmarkach agentowych.
Model obsługuje okna kontekstu do miliona tokenów. Dzięki temu nadaje się do dużych baz kodu, długich dokumentów i złożonych przepływów pracy wymagających obszernego kontekstu. Użytkownik może też wybrać niski, wysoki lub maksymalny wysiłek rozumowania, w zależności od tego, ile czasu model ma poświęcić na rozwiązanie zadania.
DeepSeek-V4-Flash-0731 zawiera także DSpark, czyli spekulatywne dekodowanie. DSpark szkicuje kilka tokenów, zanim główny model je zweryfikuje, co według DeepSeek może zwiększyć szybkość generowania o 60%–85% przy użyciu kompatybilnego silnika inferencji.
1. Skonfiguruj pod RunPod
Zaczniemy od utworzenia środowiska RunPod z wystarczającą pamięcią GPU i przestrzenią dyskową, aby uruchomić wersję Q8 modelu DeepSeek-V4-Flash-0731 oraz hostować Unsloth Studio i stronę wygenerowaną przez OpenCode.
Skonfiguruj pod w następujący sposób:
- 3× NVIDIA A100 SXM 80GB
- Najnowszy szablon RunPod PyTorch
- Co najmniej 250 GB trwałej pamięci wolumenowej
- Co najmniej 50 GB pamięci kontenera
/workspacejako punkt montowania trwałego wolumenu- Token dostępu Hugging Face dodany jako
HF_TOKEN - Wystawione porty HTTP
8910i9101

Port 8910 będzie używany przez Unsloth Studio i jego lokalne API inferencji. Port 9101 będzie hostować interaktywną stronę utworzoną przez OpenCode.
RunPod wystawia te usługi przez swój serwer proxy HTTP, więc obie aplikacje muszą nasłuchiwać na 0.0.0.0, a nie tylko na 127.0.0.1.

Po wdrożeniu poda otwórz zakładkę Connect, uruchom JupyterLab i utwórz trzy sesje terminala:
Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode
Rozdzielenie zadań na osobne terminale ułatwia monitorowanie GPU, rozwiązywanie problemów z modelem i jednoczesne uruchamianie agenta kodującego.
2. Zainstaluj i uruchom Unsloth Studio
Następnie zainstalujemy Unsloth Studio, skonfigurujemy trwały cache Hugging Face i uruchomimy interfejs na porcie 8910.
W Terminalu 1 potwierdź, że wszystkie trzy GPU są dostępne:
nvidia-smi
Powinieneś zobaczyć wszystkie trzy A100 na serwerze Linux.

Utwórz trwały cache Hugging Face w /workspace, aby pobrane modele pozostały dostępne na wolumenie RunPod:
mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface
echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc
Następnie zainstaluj wymagane pakiety systemowe i Unsloth Studio:
cd /workspace
apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev
curl -fsSL https://unsloth.ai/install.sh | sh

Instalator konfiguruje interfejs Studio, środowisko Pythona, zależności i lokalne komponenty inferencji.
Pierwsza instalacja może potrwać kilka minut.

Gdy instalator zapyta, czy chcesz od razu uruchomić Unsloth Studio, wpisz „n”.
Uruchomimy je ręcznie, aby używało portu 8910 i nasłuchiwało na właściwym adresie sieciowym.
Zrestartuj powłokę, aby nowe polecenia były dostępne:
exec bash
cd /workspace
Przed uruchomieniem Studio zresetuj domyślne hasło:
unsloth studio reset-password
Skopiuj tymczasowe hasło wyświetlone podczas konfiguracji — może być potrzebne do zakończenia resetu.
Teraz uruchom Unsloth Studio:
unsloth studio \
-H 0.0.0.0 \
-p 8910

Studio powinno teraz zgłosić, że działa na porcie 8910. Pozostaw Terminal 1 otwarty podczas korzystania z Unsloth Studio i OpenCode.
Wróć do strony Connect w RunPod i otwórz usługę HTTP dla portu 8910.

Użyj wcześniej wygenerowanego tymczasowego hasła, aby dokończyć reset, a następnie zaloguj się nowo utworzonym hasłem.
Ukończ lub pomiń kroki onboardingu i otwórz stronę Chat.

3. Pobierz i uruchom DeepSeek-V4-Flash-0731
Skoro Unsloth Studio działa, możemy pobrać model Q8, załadować go na trzy GPU i przetestować jego możliwości rozmowy i użycia narzędzi.
Otwórz selektor modeli w lewym górnym rogu, wyszukaj unsloth/DeepSeek-V4-Flash-0731-GGUF i wybierz kwantyzację Q8 UD-Q8_K_XL.

Używamy Q8, ponieważ trzy A100 zapewniają wystarczającą łączną ilość VRAM. Zachowuje ona jakość bliższą oryginalnemu modelowi, podczas gdy niższe kwantyzacje są przydatniejsze przy ograniczonej pamięci sprzętowej.
Po zakończeniu pobierania Unsloth Studio automatycznie zacznie ładować model do pamięci GPU. Może to potrwać kilka minut, ponieważ model Q8 jest bardzo duży.

Po załadowaniu użyj strony Chat, aby przetestować model kilkoma prostymi poleceniami.
W naszych testach generowanie osiągało około 33 tokeny na sekundę bez spekulatywnego dekodowania, co jest rozsądnym wynikiem dla modelu tej wielkości.

Możesz też włączyć narzędzie wyszukiwania sieci w Studio i poprosić model o sprawdzenie bieżących informacji, np. najnowszych cen złota i srebra. To przydatny sposób, aby potwierdzić, że model potrafi wywoływać zewnętrzne narzędzia, a nie polega wyłącznie na wiedzy wewnętrznej.

W Terminalu 2 sprawdź, jak model jest rozłożony na GPU:
nvidia-smi

Powinieneś zobaczyć znaczne użycie pamięci na wszystkich trzech GPU.
W naszym teście każdy GPU był zajęty w około 70%. Nie oznacza to jednak, że cały model Q8 zmieści się komfortowo na zaledwie dwóch 80‑gigabajtowych GPU, ponieważ dodatkowy VRAM jest nadal potrzebny na okno kontekstu, pamięć KV i bufory inferencji.
Na koniec przetestuj model, używając polecenia planowania aplikacji, którą zbudujemy:
Create a concise architecture plan for an interactive stock analytics website
using Next.js, financial charts, technical indicators, portfolio tracking,
and responsive animations.
Model zwraca uporządkowany plan rozwoju obejmujący architekturę aplikacji, komponenty, przepływ danych, biblioteki wykresów, obliczenia finansowe i projekt interfejsu.

4. Połącz DeepSeek-V4-Flash-0731 z OpenCode i zbuduj stronę
Skoro model działa w Unsloth Studio, możemy połączyć go z OpenCode i użyć jako lokalnego agenta kodującego.
W Terminalu 3 ustaw URL Studio:
echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc
Utwórz nowy katalog projektu:
mkdir -p /workspace/market-pulse
cd /workspace/market-pulse
Uruchom OpenCode przez Unsloth Studio:
unsloth start opencode
Przy pierwszym uruchomieniu polecenie poprosi o zgodę na instalację OpenCode. Wpisz „y”.

Po zakończeniu instalacji OpenCode uruchomi się z już skonfigurowanym lokalnie działającym modelem DeepSeek-V4-Flash-0731.

Wklej do OpenCode następujący, dwuliniowy prompt:
Build a polished, highly interactive stock analytics website using Bun, Next.js App Router,
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API,
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking,
comparisons, responsive design, animations, loading states, and error handling.
Work autonomously: install everything, create every file, test and fix the complete application,
and run the finished website on 0.0.0.0:9101.
Po kilku sekundach agent kodujący powinien utworzyć szczegółową listę zadań i zacząć realizować projekt krok po kroku.

Pełna kompilacja zajęła w naszym teście około 20 minut. W trakcie możesz wrócić do Unsloth Studio i w Settings otworzyć stronę monitorowania API, aby śledzić użycie modelu i szybkość generowania.
Zaobserwowaliśmy średnio około 22,6 tokena na sekundę podczas pracy nad kodem. Szybkość może spadać wraz ze wzrostem kontekstu rozmowy i projektu.

Po zakończeniu zadań OpenCode powinien podać podsumowanie utworzonych plików, funkcji i poleceń. Powinien też uruchomić gotową stronę na porcie 9101.

Wróć do strony Connect w RunPod i otwórz usługę HTTP dla portu 9101.
Efekt był zaskakująco dopracowany. Strona wyglądała czysto, była animowana i przypominała profesjonalny pulpit tradera. Model ukończył aplikację webową na podstawie jednego promptu, włącznie z interfejsem, widokami danych, wykresami i nawigacją.

Możesz wybierać pojedyncze tickery giełdowe, aby zobaczyć wykresy świecowe, historyczne wyniki, wskaźniki i dodatkowe informacje o spółkach.

Karta Compare pozwala też porównywać kilka akcji i sprawdzić, które wypadły lepiej w wybranym okresie.

Byłem szczerze zaskoczony, że mniejszy lokalny model potrafił zbudować całą stronę na podstawie pojedynczego promptu.
Po przetestowaniu aplikacji wszystkie kluczowe funkcje działały zgodnie z założeniami, w tym aktualne ceny akcji, historyczne dane rynkowe, wykresy, wskaźniki i narzędzia porównawcze.
Imponujące jest, jak szybko poprawiają się lokalne modele i jak bardzo stały się zdolne do realizacji złożonych, kompleksowych zadań deweloperskich.
Końcowe przemyślenia
Dla mnie DeepSeek-V4-Flash-0731 to najlepszy lokalny model, jaki dotąd testowałem.
Wypadł lepiej niż Inkling, 2‑bitowa kwantyzacja GLM-5.2 i Qwen3.6‑27B, który wcześniej był moim faworytem. To wnioski z mojego własnego doświadczenia, a nie formalnego benchmarku, ale jest to teraz mój preferowany lokalny model.
W większości praktycznych zastosowań zacząłbym jednak od oficjalnego API DeepSeek, ponieważ jest niezwykle niedrogie.
V4 Flash kosztuje obecnie 0,14 USD za milion niebuforowanych tokenów wejściowych, 0,0028 USD za milion buforowanych tokenów wejściowych i 0,28 USD za milion tokenów wyjściowych. Przy takiej stawce miliard buforowanych tokenów wejściowych kosztowałby około 2,80 USD, bez opłat za wyjście.
Zanim zdecydowałem się na Unsloth Studio, próbowałem uruchomić model przez llama.cpp. Gotowy instalator nie dostarczał odpowiedniego, świeżego binarium CUDA dla mojego środowiska, a mimo że skompilowałem najnowszą wersję ze źródeł, napotkałem kolejne problemy przy włączaniu spekulatywnego dekodowania DSpark.
Ostatecznie Unsloth Studio zapewniło najprostsze wdrożenie i wyeliminowało większość ręcznej konfiguracji. Dobrze współpracowało z OpenCode, choć zbudowanie kompletnej aplikacji zajęło około 20 minut.