course
Mai mic și mai rapid nu mai înseamnă automat mai puțin capabil. Conform evaluărilor publicate de DeepSeek, DeepSeek-V4-Flash-0731 folosește mult mai puțini parametri activați decât DeepSeek-V4-Pro, oferind în același timp performanță agentică aproape de frontieră: obține 82,7 pe Terminal Bench 2.1, comparativ cu 81,0 pentru GLM-5.2 și 85,0 pentru Opus 4.8, iar scorul la Agents’ Last Exam de 25,2 este aproape de 25,7 al lui Opus 4.8.
Pentru că greutățile sunt disponibile deschis, teoretic poți rula modelul pe propriul hardware dacă ai suficientă RAM sau VRAM combinată, păstrând inferența și datele proiectului sub controlul tău.
În acest ghid, vom configura un mediu RunPod cu trei GPU-uri, vom instala și lansa Unsloth Studio, vom descărca și încărca versiunea Q8 a DeepSeek-V4-Flash-0731 pe GPU-uri, vom testa modelul prin Studio, vom conecta serverul local de inferență la OpenCode și vom folosi agentul de cod pentru a construi și lansa un site interactiv de analiză a acțiunilor.
Ce face DeepSeek-V4-Flash-0731 diferit?
DeepSeek-V4-Flash-0731 este versiunea oficială care înlocuiește previzualizarea anterioară, cu îmbunătățiri majore la codare, utilizarea de unelte și sarcini autonome de agent. Arhitectura Mixture-of-Experts activează doar o parte din model pentru fiecare token. Asta îl ajută să rămână eficient, oferind totuși performanțe solide.

Sursă: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
DeepSeek raportează că modelul a crescut de la 61,8 la 82,7 pe Terminal Bench 2.1 și de la 7,3 la 54,4 pe DeepSWE. De asemenea, a depășit modelul mai mare DeepSeek-V4-Pro Preview pe mai multe benchmark-uri pentru agenți.
Modelul suportă ferestre de context de până la un milion de tokeni. Asta îl face potrivit pentru coduri mari, documente lungi și fluxuri complexe care necesită mult context. Utilizatorii pot alege, de asemenea, între efort de raționare redus, ridicat și maxim, în funcție de cât timp ar trebui să petreacă modelul pentru a rezolva o sarcină.
DeepSeek-V4-Flash-0731 include și decodare speculativă DSpark. DSpark propune mai mulți tokeni înainte ca modelul principal să-i verifice, ceea ce, potrivit DeepSeek, poate îmbunătăți viteza de generare cu 60%–85% când este folosit cu un motor de inferență compatibil.
1. Configurează Pod-ul RunPod
Vom începe prin a crea un mediu RunPod cu suficientă memorie GPU și stocare pentru a rula versiunea Q8 a DeepSeek-V4-Flash-0731 și a găzdui atât Unsloth Studio, cât și website-ul generat de OpenCode.
Configurează Pod-ul cu:
- 3× NVIDIA A100 SXM 80GB GPU-uri
- Cel mai recent șablon RunPod PyTorch
- Cel puțin 250GB stocare pe volumul persistent
- Cel puțin 50GB stocare pentru container
/workspaceca cale de montare pentru volumul persistent- Un token de acces Hugging Face adăugat ca
HF_TOKEN - Porturi HTTP
8910și9101expuse

Portul 8910 va fi folosit pentru Unsloth Studio și API-ul său local de inferență. Portul 9101 va găzdui website-ul interactiv creat de OpenCode.
RunPod expune aceste servicii prin proxy-ul său HTTP, așa că ambele aplicații trebuie să asculte pe 0.0.0.0, nu doar pe 127.0.0.1.

După ce ai lansat Pod-ul, deschide fila Connect, pornește JupyterLab și creează trei sesiuni de terminal:
Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode
Păstrarea sarcinilor în terminale separate face mai ușoară monitorizarea GPU-urilor, depanarea modelului și rularea agentului de cod în același timp.
2. Instalează și lansează Unsloth Studio
În continuare, vom instala Unsloth Studio, vom configura un cache Hugging Face persistent și vom lansa interfața pe portul 8910.
În Terminalul 1, confirmă că toate cele trei GPU-uri sunt disponibile:
nvidia-smi
Ar trebui să vezi toate cele trei GPU-uri A100 listate pe serverul Linux.

Creează un cache Hugging Face persistent în /workspace pentru ca modelele descărcate să rămână disponibile pe volumul RunPod:
mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface
echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc
Apoi, instalează pachetele de sistem necesare și Unsloth Studio:
cd /workspace
apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev
curl -fsSL https://unsloth.ai/install.sh | sh

Instalatorul configurează interfața Studio, mediul Python, dependențele și componentele locale de inferență.
Prima instalare poate dura câteva minute.

Când instalatorul întreabă dacă vrei să pornești Unsloth Studio imediat, introdu „n”.
Îl vom lansa manual ca să folosească portul 8910 și să asculte pe adresa de rețea corectă.
Repornește shell-ul ca noile comenzi să fie disponibile:
exec bash
cd /workspace
Înainte de a lansa Studio, resetează parola implicită:
unsloth studio reset-password
Copiază parola temporară afișată în timpul configurării, deoarece s-ar putea să ai nevoie de ea pentru a finaliza resetarea.
Acum lansează Unsloth Studio:
unsloth studio \
-H 0.0.0.0 \
-p 8910

Studio ar trebui acum să raporteze că rulează pe portul 8910. Ține Terminalul 1 deschis cât timp folosești Unsloth Studio și OpenCode.
Întoarce-te la pagina Connect din RunPod și deschide serviciul HTTP pentru portul 8910.

Folosește parola temporară generată mai devreme pentru a finaliza resetarea, apoi autentifică-te cu noua parolă pe care ai creat-o.
Parcurge sau sari pașii de onboarding și deschide pagina Chat.

3. Descarcă și rulează DeepSeek-V4-Flash-0731
Acum că Unsloth Studio rulează, putem descărca modelul Q8, îl putem încărca pe cele trei GPU-uri și îi putem testa capabilitățile de chat și utilizare a uneltelor.
Deschide selectorul de modele din colțul stânga sus și caută unsloth/DeepSeek-V4-Flash-0731-GGUF apoi selectează cuantizarea Q8 UD-Q8_K_XL.

Folosim Q8 deoarece cele trei GPU-uri A100 oferă suficientă VRAM combinată. Aceasta păstrează o calitate mai apropiată de modelul original, în timp ce cuantizările mai joase sunt mai utile când memoria hardware este limitată.
După finalizarea descărcării, Unsloth Studio va începe automat să încarce modelul în memoria GPU. Acest lucru poate dura câteva minute deoarece modelul Q8 este foarte mare.

După încărcare, folosește pagina Chat pentru a testa modelul cu câteva prompturi simple.
În testele noastre, generarea a atins aproximativ 33 de tokeni pe secundă fără decodare speculativă, ceea ce este un rezultat rezonabil pentru un model de această dimensiune.

Poți activa și instrumentul de căutare web al Studio și îi poți cere modelului să caute informații actuale, cum ar fi cele mai recente prețuri la aur și argint. Acesta este un mod util de a confirma că modelul poate apela unelte externe, nu doar să se bazeze pe cunoștințele interne.

În Terminalul 2, verifică modul în care este distribuit modelul pe GPU-uri:
nvidia-smi

Ar trebui să vezi o utilizare substanțială a memoriei pe toate cele trei GPU-uri.
În testul nostru, fiecare GPU era aproximativ 70% plin. Totuși, asta nu înseamnă neapărat că întregul model Q8 va încăpea confortabil doar pe două GPU-uri de 80GB, deoarece este necesară VRAM suplimentară pentru fereastra de context, cache-ul KV și bufferele de inferență.
În final, testează modelul cu promptul de planificare pentru aplicația pe care o vom construi:
Create a concise architecture plan for an interactive stock analytics website
using Next.js, financial charts, technical indicators, portfolio tracking,
and responsive animations.
Modelul returnează un plan de dezvoltare structurat care acoperă arhitectura aplicației, componentele, fluxul de date, bibliotecile de charting, calculele financiare și designul interfeței.

4. Conectează DeepSeek-V4-Flash-0731 la OpenCode și construiește website-ul
Acum că modelul rulează în Unsloth Studio, îl putem conecta la OpenCode și îl putem folosi ca agent local de codare.
În Terminalul 3, setează URL-ul Studio:
echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc
Creează un nou director de proiect:
mkdir -p /workspace/market-pulse
cd /workspace/market-pulse
Pornește OpenCode prin Unsloth Studio:
unsloth start opencode
Prima dată când rulezi această comandă, va cere permisiunea de a instala OpenCode. Introdu „y”.

După finalizarea instalării, OpenCode va porni cu modelul DeepSeek-V4-Flash-0731 care rulează local deja configurat.

Lipește următorul prompt din două linii în OpenCode:
Build a polished, highly interactive stock analytics website using Bun, Next.js App Router,
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API,
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking,
comparisons, responsive design, animations, loading states, and error handling.
Work autonomously: install everything, create every file, test and fix the complete application,
and run the finished website on 0.0.0.0:9101.
În câteva secunde, agentul de cod ar trebui să creeze o listă detaliată de sarcini și să înceapă să parcurgă proiectul pas cu pas.

Construirea completă a durat aproximativ 20 de minute în testul nostru. În timp ce rulează, te poți întoarce în Unsloth Studio și poți deschide pagina de monitorizare a API-ului din Settings pentru a urmări utilizarea modelului și viteza de generare.
Am observat o medie de aproximativ 22,6 tokeni pe secundă în timpul fluxului de codare. Viteza poate scădea pe măsură ce conversația și contextul proiectului cresc.

După finalizarea sarcinilor, OpenCode ar trebui să ofere un rezumat al fișierelor, funcționalităților și comenzilor create. Ar trebui, de asemenea, să pornească website-ul finalizat pe portul 9101.

Întoarce-te la pagina Connect din RunPod și deschide serviciul HTTP pentru portul 9101.
Rezultatul a fost surprinzător de finisat. Website-ul arăta curat, animat și similar cu un dashboard profesional de tranzacționare. Modelul a finalizat aplicația web dintr-un singur prompt, incluzând interfața, vizualizările de date, graficele și navigarea.

Poți selecta simboluri bursiere individuale pentru a vedea grafice tip lumânare, performanța istorică, indicatori și informații suplimentare despre companie.

Fila Compare îți permite, de asemenea, să compari mai multe acțiuni și să vezi care a performat mai bine în perioada selectată.

Am fost cu adevărat surprins că un model local mai mic a putut construi întregul website dintr-un singur prompt.
După testarea aplicației, fiecare funcție majoră a funcționat conform așteptărilor, inclusiv prețurile live ale acțiunilor, datele istorice de piață, graficele, indicatorii și instrumentele de comparație.
Este remarcabil cât de repede se îmbunătățesc modelele locale și cât de capabile au devenit în a finaliza sarcini complexe, cap-coadă, de dezvoltare.
Gânduri finale
Pentru mine, DeepSeek-V4-Flash-0731 este cel mai bun model local pe care l-am testat până acum.
A performat mai bine decât Inkling, cuantizarea GLM-5.2 pe 2 biți și Qwen3.6-27B, care fusese anterior preferatul meu. Asta pe baza propriei mele experiențe, nu a unui benchmark formal, dar acum este modelul meu local preferat.
Pentru majoritatea volumelor de lucru practice, tot aș începe cu API-ul oficial DeepSeek deoarece este extrem de accesibil ca preț.
V4 Flash costă în prezent 0,14 $ per milion de tokeni de intrare necachuiți, 0,0028 $ per milion de tokeni de intrare cachuiți și 0,28 $ per milion de tokeni de ieșire. La acest tarif, un miliard de tokeni de intrare cachuiți ar costa aproximativ 2,80 $ înainte de costurile pentru ieșire.
Înainte de a mă opri la Unsloth Studio, am încercat să rulez modelul prin llama.cpp. Instalatorul precompilat nu a furnizat un binar CUDA recent potrivit pentru mediul meu și, deși am compilat ultima versiune din sursă, am întâmpinat probleme suplimentare la activarea decodării speculative DSpark.
În final, Unsloth Studio a oferit cea mai simplă configurare și a eliminat majoritatea setărilor manuale. A funcționat bine cu OpenCode, deși construirea aplicației complete a durat aproximativ 20 de minute.