Przejdź do głównej treści

Uruchom DeepSeek-V4-Flash-0731 z Unsloth Studio i OpenCode

Uruchom najnowszy model DeepSeek V4 Flash w konfiguracji z wieloma GPU przy użyciu Unsloth Studio, połącz go z OpenCode i użyj lokalnego agenta AI do zbudowania interaktywnej strony do analizy akcji.
Zaktualizowano 6 sie 2026  · 8 min Czytać

Eksploruj z AI

ChatGPTClaudePerplexity

Mniejsze i szybsze nie musi już automatycznie oznaczać mniej wydajne. Według opublikowanych ocen DeepSeek, DeepSeek-V4-Flash-0731 używa znacznie mniejszej liczby aktywowanych parametrów niż DeepSeek-V4-Pro, jednocześnie osiągając wydajność zbliżoną do czołówki w zadaniach agentowych: uzyskuje wynik 82,7 w Terminal Bench 2.1, w porównaniu z 81,0 dla GLM-5.2 i 85,0 dla Opus 4.8, a jego wynik 25,2 w Agents’ Last Exam jest zbliżony do 25,7 modelu Opus 4.8. 

Ponieważ wagi są publicznie dostępne, teoretycznie możesz uruchomić model na własnym sprzęcie, jeśli masz wystarczającą łączną ilość RAM lub VRAM, zachowując w ten sposób kontrolę nad inferencją i danymi projektu. 

W tym przewodniku skonfigurujemy środowisko RunPod z trzema GPU, zainstalujemy i uruchomimy Unsloth Studio, pobierzemy i załadujemy wersję Q8 modelu DeepSeek-V4-Flash-0731 na wiele GPU, przetestujemy model w Studio, podłączymy lokalny serwer inferencji do OpenCode i użyjemy agenta kodującego do zbudowania i uruchomienia interaktywnej strony do analizy akcji.

Czym wyróżnia się DeepSeek-V4-Flash-0731?

DeepSeek-V4-Flash-0731 to oficjalne wydanie zastępujące wcześniejszą wersję preview, z dużymi usprawnieniami w kodowaniu, korzystaniu z narzędzi i zadaniach autonomicznych agentów. Jego architektura Mixture-of-Experts aktywuje tylko część modelu dla każdego tokena. Dzięki temu pozostaje bardziej wydajny, zachowując jednocześnie wysoką skuteczność.

Tabela porównawcza benchmarków DeepSeek-V4-Flash-0731

Źródło: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek informuje, że model poprawił wynik z 61,8 do 82,7 w Terminal Bench 2.1 oraz z 7,3 do 54,4 w DeepSWE. Przewyższył też większy model DeepSeek-V4-Pro Preview w kilku benchmarkach agentowych.

Model obsługuje okna kontekstu do miliona tokenów. Dzięki temu nadaje się do dużych baz kodu, długich dokumentów i złożonych przepływów pracy wymagających obszernego kontekstu. Użytkownik może też wybrać niski, wysoki lub maksymalny wysiłek rozumowania, w zależności od tego, ile czasu model ma poświęcić na rozwiązanie zadania.

DeepSeek-V4-Flash-0731 zawiera także DSpark, czyli spekulatywne dekodowanie. DSpark szkicuje kilka tokenów, zanim główny model je zweryfikuje, co według DeepSeek może zwiększyć szybkość generowania o 60%–85% przy użyciu kompatybilnego silnika inferencji.

1. Skonfiguruj pod RunPod

Zaczniemy od utworzenia środowiska RunPod z wystarczającą pamięcią GPU i przestrzenią dyskową, aby uruchomić wersję Q8 modelu DeepSeek-V4-Flash-0731 oraz hostować Unsloth Studio i stronę wygenerowaną przez OpenCode.

Skonfiguruj pod w następujący sposób:

  • 3× NVIDIA A100 SXM 80GB
  • Najnowszy szablon RunPod PyTorch
  • Co najmniej 250 GB trwałej pamięci wolumenowej
  • Co najmniej 50 GB pamięci kontenera
  • /workspace jako punkt montowania trwałego wolumenu
  • Token dostępu Hugging Face dodany jako HF_TOKEN
  • Wystawione porty HTTP 8910 i 9101

Edycja szablonu Pytorch Runpod

Port 8910 będzie używany przez Unsloth Studio i jego lokalne API inferencji. Port 9101 będzie hostować interaktywną stronę utworzoną przez OpenCode.

RunPod wystawia te usługi przez swój serwer proxy HTTP, więc obie aplikacje muszą nasłuchiwać na 0.0.0.0, a nie tylko na 127.0.0.1

Wdrażanie poda 3x A100 GPU w runpod

Po wdrożeniu poda otwórz zakładkę Connect, uruchom JupyterLab i utwórz trzy sesje terminala:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Rozdzielenie zadań na osobne terminale ułatwia monitorowanie GPU, rozwiązywanie problemów z modelem i jednoczesne uruchamianie agenta kodującego.

2. Zainstaluj i uruchom Unsloth Studio

Następnie zainstalujemy Unsloth Studio, skonfigurujemy trwały cache Hugging Face i uruchomimy interfejs na porcie 8910.

W Terminalu 1 potwierdź, że wszystkie trzy GPU są dostępne:

nvidia-smi

Powinieneś zobaczyć wszystkie trzy A100 na serwerze Linux.

Podsumowanie 3x A100 GPU

Utwórz trwały cache Hugging Face w /workspace, aby pobrane modele pozostały dostępne na wolumenie RunPod:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Następnie zainstaluj wymagane pakiety systemowe i Unsloth Studio:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Instalator Unsloth Studio

Instalator konfiguruje interfejs Studio, środowisko Pythona, zależności i lokalne komponenty inferencji. 

Pierwsza instalacja może potrwać kilka minut.

Instalator Unsloth Studio

Gdy instalator zapyta, czy chcesz od razu uruchomić Unsloth Studio, wpisz „n”.

Uruchomimy je ręcznie, aby używało portu 8910 i nasłuchiwało na właściwym adresie sieciowym.

Zrestartuj powłokę, aby nowe polecenia były dostępne:

exec bash
cd /workspace

Przed uruchomieniem Studio zresetuj domyślne hasło:

unsloth studio reset-password

Skopiuj tymczasowe hasło wyświetlone podczas konfiguracji — może być potrzebne do zakończenia resetu.

Teraz uruchom Unsloth Studio:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Uruchamianie Unsloth Studio

Studio powinno teraz zgłosić, że działa na porcie 8910. Pozostaw Terminal 1 otwarty podczas korzystania z Unsloth Studio i OpenCode.

Wróć do strony Connect w RunPod i otwórz usługę HTTP dla portu 8910

Dostęp do tunelu Unsloth Studio w Runpod

Użyj wcześniej wygenerowanego tymczasowego hasła, aby dokończyć reset, a następnie zaloguj się nowo utworzonym hasłem. 

Ukończ lub pomiń kroki onboardingu i otwórz stronę Chat.

Menu czatu Unsloth Studio

3. Pobierz i uruchom DeepSeek-V4-Flash-0731

Skoro Unsloth Studio działa, możemy pobrać model Q8, załadować go na trzy GPU i przetestować jego możliwości rozmowy i użycia narzędzi.

Otwórz selektor modeli w lewym górnym rogu, wyszukaj unsloth/DeepSeek-V4-Flash-0731-GGUF i wybierz kwantyzację Q8 UD-Q8_K_XL.

Pobieranie wersji Q8 modelu Deepseek v4 flash w Unsloth Studio

Używamy Q8, ponieważ trzy A100 zapewniają wystarczającą łączną ilość VRAM. Zachowuje ona jakość bliższą oryginalnemu modelowi, podczas gdy niższe kwantyzacje są przydatniejsze przy ograniczonej pamięci sprzętowej.

Po zakończeniu pobierania Unsloth Studio automatycznie zacznie ładować model do pamięci GPU. Może to potrwać kilka minut, ponieważ model Q8 jest bardzo duży.

Ładowanie modelu Deepseek v4 flash w Unsloth Studio

Po załadowaniu użyj strony Chat, aby przetestować model kilkoma prostymi poleceniami. 

W naszych testach generowanie osiągało około 33 tokeny na sekundę bez spekulatywnego dekodowania, co jest rozsądnym wynikiem dla modelu tej wielkości.

Testowanie modelu Deepseek v4 flash w Unsloth Studio

Możesz też włączyć narzędzie wyszukiwania sieci w Studio i poprosić model o sprawdzenie bieżących informacji, np. najnowszych cen złota i srebra. To przydatny sposób, aby potwierdzić, że model potrafi wywoływać zewnętrzne narzędzia, a nie polega wyłącznie na wiedzy wewnętrznej.

Testowanie modelu Deepseek v4 flash w Unsloth Studio z narzędziem web

W Terminalu 2 sprawdź, jak model jest rozłożony na GPU:

nvidia-smi

Podsumowanie GPU z modelem Deepseek v4 flash Q8 załadowanym do pamięci GPU

Powinieneś zobaczyć znaczne użycie pamięci na wszystkich trzech GPU. 

W naszym teście każdy GPU był zajęty w około 70%. Nie oznacza to jednak, że cały model Q8 zmieści się komfortowo na zaledwie dwóch 80‑gigabajtowych GPU, ponieważ dodatkowy VRAM jest nadal potrzebny na okno kontekstu, pamięć KV i bufory inferencji.

Na koniec przetestuj model, używając polecenia planowania aplikacji, którą zbudujemy:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Model zwraca uporządkowany plan rozwoju obejmujący architekturę aplikacji, komponenty, przepływ danych, biblioteki wykresów, obliczenia finansowe i projekt interfejsu.

Testowanie modelu Deepseek v4 flash w Unsloth Studio z złożonym poleceniem

4. Połącz DeepSeek-V4-Flash-0731 z OpenCode i zbuduj stronę

Skoro model działa w Unsloth Studio, możemy połączyć go z OpenCode i użyć jako lokalnego agenta kodującego.

W Terminalu 3 ustaw URL Studio:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Utwórz nowy katalog projektu:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Uruchom OpenCode przez Unsloth Studio:

unsloth start opencode

Przy pierwszym uruchomieniu polecenie poprosi o zgodę na instalację OpenCode. Wpisz „y”.

Instalowanie i uruchamianie Opencode

Po zakończeniu instalacji OpenCode uruchomi się z już skonfigurowanym lokalnie działającym modelem DeepSeek-V4-Flash-0731.

OpenCode zintegrowany z lokalnie uruchomionym modelem DeepSeek v4 Flash

Wklej do OpenCode następujący, dwuliniowy prompt:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

Po kilku sekundach agent kodujący powinien utworzyć szczegółową listę zadań i zacząć realizować projekt krok po kroku.

Budowanie interaktywnej strony do analizy akcji w Opencode z serwerem inferencji Unsloth

Pełna kompilacja zajęła w naszym teście około 20 minut. W trakcie możesz wrócić do Unsloth Studio i w Settings otworzyć stronę monitorowania API, aby śledzić użycie modelu i szybkość generowania.

Zaobserwowaliśmy średnio około 22,6 tokena na sekundę podczas pracy nad kodem. Szybkość może spadać wraz ze wzrostem kontekstu rozmowy i projektu.

Panel monitorowania serwera inferencji Unsloth

Po zakończeniu zadań OpenCode powinien podać podsumowanie utworzonych plików, funkcji i poleceń. Powinien też uruchomić gotową stronę na porcie 9101.

Podsumowanie interaktywnej strony do analizy akcji w Opencode

Wróć do strony Connect w RunPod i otwórz usługę HTTP dla portu 9101.

Efekt był zaskakująco dopracowany. Strona wyglądała czysto, była animowana i przypominała profesjonalny pulpit tradera. Model ukończył aplikację webową na podstawie jednego promptu, włącznie z interfejsem, widokami danych, wykresami i nawigacją.

Testowanie interaktywnej strony do analizy akcji stworzonej z DeepSeek-V4-Flash-0731

Możesz wybierać pojedyncze tickery giełdowe, aby zobaczyć wykresy świecowe, historyczne wyniki, wskaźniki i dodatkowe informacje o spółkach.

Testowanie interaktywnej strony do analizy akcji stworzonej z DeepSeek-V4-Flash-0731

Karta Compare pozwala też porównywać kilka akcji i sprawdzić, które wypadły lepiej w wybranym okresie.

Testowanie interaktywnej strony do analizy akcji stworzonej z DeepSeek-V4-Flash-0731

Byłem szczerze zaskoczony, że mniejszy lokalny model potrafił zbudować całą stronę na podstawie pojedynczego promptu. 

Po przetestowaniu aplikacji wszystkie kluczowe funkcje działały zgodnie z założeniami, w tym aktualne ceny akcji, historyczne dane rynkowe, wykresy, wskaźniki i narzędzia porównawcze.

Imponujące jest, jak szybko poprawiają się lokalne modele i jak bardzo stały się zdolne do realizacji złożonych, kompleksowych zadań deweloperskich. 

Końcowe przemyślenia

Dla mnie DeepSeek-V4-Flash-0731 to najlepszy lokalny model, jaki dotąd testowałem. 

Wypadł lepiej niż Inkling, 2‑bitowa kwantyzacja GLM-5.2 i Qwen3.6‑27B, który wcześniej był moim faworytem. To wnioski z mojego własnego doświadczenia, a nie formalnego benchmarku, ale jest to teraz mój preferowany lokalny model.

W większości praktycznych zastosowań zacząłbym jednak od oficjalnego API DeepSeek, ponieważ jest niezwykle niedrogie. 

V4 Flash kosztuje obecnie 0,14 USD za milion niebuforowanych tokenów wejściowych, 0,0028 USD za milion buforowanych tokenów wejściowych i 0,28 USD za milion tokenów wyjściowych. Przy takiej stawce miliard buforowanych tokenów wejściowych kosztowałby około 2,80 USD, bez opłat za wyjście.

Zanim zdecydowałem się na Unsloth Studio, próbowałem uruchomić model przez llama.cpp. Gotowy instalator nie dostarczał odpowiedniego, świeżego binarium CUDA dla mojego środowiska, a mimo że skompilowałem najnowszą wersję ze źródeł, napotkałem kolejne problemy przy włączaniu spekulatywnego dekodowania DSpark.

Ostatecznie Unsloth Studio zapewniło najprostsze wdrożenie i wyeliminowało większość ręcznej konfiguracji. Dobrze współpracowało z OpenCode, choć zbudowanie kompletnej aplikacji zajęło około 20 minut.

Tematy
Sztuczna inteligencja
Duże modele językowe

Najlepsze kursy DataCamp

course

Kodowanie wspomagane przez AI dla programistów

1 godz. 30 min
9.9K
Wzmocnij kodowanie dzięki AI — naucz asystenta kodowania pisać, testować i dokumentować kod skutecznie.
Zobacz szczegółyRight Arrow
Rozpocznij Kurs
Zobacz więcejRight Arrow