Sari la conținutul principal

Rulează DeepSeek-V4-Flash-0731 cu Unsloth Studio și OpenCode

Rulează cel mai nou model DeepSeek V4 Flash pe un setup multi-GPU cu Unsloth Studio, conectează-l la OpenCode și folosește un agent AI local de codare pentru a construi un website interactiv de analiză a acțiunilor.
Actualizat 6 aug. 2026  · 8 min. citire

Explorează cu AI

ChatGPTClaudePerplexity

Mai mic și mai rapid nu mai înseamnă automat mai puțin capabil. Conform evaluărilor publicate de DeepSeek, DeepSeek-V4-Flash-0731 folosește mult mai puțini parametri activați decât DeepSeek-V4-Pro, oferind în același timp performanță agentică aproape de frontieră: obține 82,7 pe Terminal Bench 2.1, comparativ cu 81,0 pentru GLM-5.2 și 85,0 pentru Opus 4.8, iar scorul la Agents’ Last Exam de 25,2 este aproape de 25,7 al lui Opus 4.8. 

Pentru că greutățile sunt disponibile deschis, teoretic poți rula modelul pe propriul hardware dacă ai suficientă RAM sau VRAM combinată, păstrând inferența și datele proiectului sub controlul tău. 

În acest ghid, vom configura un mediu RunPod cu trei GPU-uri, vom instala și lansa Unsloth Studio, vom descărca și încărca versiunea Q8 a DeepSeek-V4-Flash-0731 pe GPU-uri, vom testa modelul prin Studio, vom conecta serverul local de inferență la OpenCode și vom folosi agentul de cod pentru a construi și lansa un site interactiv de analiză a acțiunilor.

Ce face DeepSeek-V4-Flash-0731 diferit?

DeepSeek-V4-Flash-0731 este versiunea oficială care înlocuiește previzualizarea anterioară, cu îmbunătățiri majore la codare, utilizarea de unelte și sarcini autonome de agent. Arhitectura Mixture-of-Experts activează doar o parte din model pentru fiecare token. Asta îl ajută să rămână eficient, oferind totuși performanțe solide.

Tabel de comparație a benchmark-urilor pentru DeepSeek-V4-Flash-0731

Sursă: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek raportează că modelul a crescut de la 61,8 la 82,7 pe Terminal Bench 2.1 și de la 7,3 la 54,4 pe DeepSWE. De asemenea, a depășit modelul mai mare DeepSeek-V4-Pro Preview pe mai multe benchmark-uri pentru agenți.

Modelul suportă ferestre de context de până la un milion de tokeni. Asta îl face potrivit pentru coduri mari, documente lungi și fluxuri complexe care necesită mult context. Utilizatorii pot alege, de asemenea, între efort de raționare redus, ridicat și maxim, în funcție de cât timp ar trebui să petreacă modelul pentru a rezolva o sarcină.

DeepSeek-V4-Flash-0731 include și decodare speculativă DSpark. DSpark propune mai mulți tokeni înainte ca modelul principal să-i verifice, ceea ce, potrivit DeepSeek, poate îmbunătăți viteza de generare cu 60%–85% când este folosit cu un motor de inferență compatibil.

1. Configurează Pod-ul RunPod

Vom începe prin a crea un mediu RunPod cu suficientă memorie GPU și stocare pentru a rula versiunea Q8 a DeepSeek-V4-Flash-0731 și a găzdui atât Unsloth Studio, cât și website-ul generat de OpenCode.

Configurează Pod-ul cu:

  • 3× NVIDIA A100 SXM 80GB GPU-uri
  • Cel mai recent șablon RunPod PyTorch
  • Cel puțin 250GB stocare pe volumul persistent
  • Cel puțin 50GB stocare pentru container
  • /workspace ca cale de montare pentru volumul persistent
  • Un token de acces Hugging Face adăugat ca HF_TOKEN
  • Porturi HTTP 8910 și 9101 expuse

Editarea șablonului Pytorch Runpod

Portul 8910 va fi folosit pentru Unsloth Studio și API-ul său local de inferență. Portul 9101 va găzdui website-ul interactiv creat de OpenCode.

RunPod expune aceste servicii prin proxy-ul său HTTP, așa că ambele aplicații trebuie să asculte pe 0.0.0.0, nu doar pe 127.0.0.1

Dezvoltarea pod-ului cu 3x A100 GPU pe runpod

După ce ai lansat Pod-ul, deschide fila Connect, pornește JupyterLab și creează trei sesiuni de terminal:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Păstrarea sarcinilor în terminale separate face mai ușoară monitorizarea GPU-urilor, depanarea modelului și rularea agentului de cod în același timp.

2. Instalează și lansează Unsloth Studio

În continuare, vom instala Unsloth Studio, vom configura un cache Hugging Face persistent și vom lansa interfața pe portul 8910.

În Terminalul 1, confirmă că toate cele trei GPU-uri sunt disponibile:

nvidia-smi

Ar trebui să vezi toate cele trei GPU-uri A100 listate pe serverul Linux.

Rezumat 3x A100 GPU

Creează un cache Hugging Face persistent în /workspace pentru ca modelele descărcate să rămână disponibile pe volumul RunPod:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Apoi, instalează pachetele de sistem necesare și Unsloth Studio:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Instalatorul Unsloth Studio

Instalatorul configurează interfața Studio, mediul Python, dependențele și componentele locale de inferență. 

Prima instalare poate dura câteva minute.

Instalatorul Unsloth Studio

Când instalatorul întreabă dacă vrei să pornești Unsloth Studio imediat, introdu „n”.

Îl vom lansa manual ca să folosească portul 8910 și să asculte pe adresa de rețea corectă.

Repornește shell-ul ca noile comenzi să fie disponibile:

exec bash
cd /workspace

Înainte de a lansa Studio, resetează parola implicită:

unsloth studio reset-password

Copiază parola temporară afișată în timpul configurării, deoarece s-ar putea să ai nevoie de ea pentru a finaliza resetarea.

Acum lansează Unsloth Studio:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Pornirea Unsloth Studio

Studio ar trebui acum să raporteze că rulează pe portul 8910. Ține Terminalul 1 deschis cât timp folosești Unsloth Studio și OpenCode.

Întoarce-te la pagina Connect din RunPod și deschide serviciul HTTP pentru portul 8910

Accesarea tunelului Runpod pentru Unsloth Studio

Folosește parola temporară generată mai devreme pentru a finaliza resetarea, apoi autentifică-te cu noua parolă pe care ai creat-o. 

Parcurge sau sari pașii de onboarding și deschide pagina Chat.

Meniul Chat din Unsloth Studio

3. Descarcă și rulează DeepSeek-V4-Flash-0731

Acum că Unsloth Studio rulează, putem descărca modelul Q8, îl putem încărca pe cele trei GPU-uri și îi putem testa capabilitățile de chat și utilizare a uneltelor.

Deschide selectorul de modele din colțul stânga sus și caută unsloth/DeepSeek-V4-Flash-0731-GGUF apoi selectează cuantizarea Q8 UD-Q8_K_XL.

Descărcarea versiunii Q8 a modelului Deepseek v4 flash în Unsloth Studio

Folosim Q8 deoarece cele trei GPU-uri A100 oferă suficientă VRAM combinată. Aceasta păstrează o calitate mai apropiată de modelul original, în timp ce cuantizările mai joase sunt mai utile când memoria hardware este limitată.

După finalizarea descărcării, Unsloth Studio va începe automat să încarce modelul în memoria GPU. Acest lucru poate dura câteva minute deoarece modelul Q8 este foarte mare.

Încărcarea modelului Deepseek v4 flash în Unsloth Studio

După încărcare, folosește pagina Chat pentru a testa modelul cu câteva prompturi simple. 

În testele noastre, generarea a atins aproximativ 33 de tokeni pe secundă fără decodare speculativă, ceea ce este un rezultat rezonabil pentru un model de această dimensiune.

Testarea modelului Deepseek v4 flash în Unsloth Studio

Poți activa și instrumentul de căutare web al Studio și îi poți cere modelului să caute informații actuale, cum ar fi cele mai recente prețuri la aur și argint. Acesta este un mod util de a confirma că modelul poate apela unelte externe, nu doar să se bazeze pe cunoștințele interne.

Testarea modelului Deepseek v4 flash în Unsloth Studio cu unealta web

În Terminalul 2, verifică modul în care este distribuit modelul pe GPU-uri:

nvidia-smi

Rezumat GPU al modelului Deepseek v4 flash Q8 încărcat în memoria GPU

Ar trebui să vezi o utilizare substanțială a memoriei pe toate cele trei GPU-uri. 

În testul nostru, fiecare GPU era aproximativ 70% plin. Totuși, asta nu înseamnă neapărat că întregul model Q8 va încăpea confortabil doar pe două GPU-uri de 80GB, deoarece este necesară VRAM suplimentară pentru fereastra de context, cache-ul KV și bufferele de inferență.

În final, testează modelul cu promptul de planificare pentru aplicația pe care o vom construi:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Modelul returnează un plan de dezvoltare structurat care acoperă arhitectura aplicației, componentele, fluxul de date, bibliotecile de charting, calculele financiare și designul interfeței.

Testarea modelului Deepseek v4 flash în Unsloth Studio cu prompt complex

4. Conectează DeepSeek-V4-Flash-0731 la OpenCode și construiește website-ul

Acum că modelul rulează în Unsloth Studio, îl putem conecta la OpenCode și îl putem folosi ca agent local de codare.

În Terminalul 3, setează URL-ul Studio:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Creează un nou director de proiect:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Pornește OpenCode prin Unsloth Studio:

unsloth start opencode

Prima dată când rulezi această comandă, va cere permisiunea de a instala OpenCode. Introdu „y”.

Instalarea și pornirea Opencode

După finalizarea instalării, OpenCode va porni cu modelul DeepSeek-V4-Flash-0731 care rulează local deja configurat.

OpenCode integrat cu modelul DeepSeek v4 Flash rulat local

Lipește următorul prompt din două linii în OpenCode:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

În câteva secunde, agentul de cod ar trebui să creeze o listă detaliată de sarcini și să înceapă să parcurgă proiectul pas cu pas.

Construirea unui website interactiv de analiză a acțiunilor în Opencode cu serverul de inferență Unsloth

Construirea completă a durat aproximativ 20 de minute în testul nostru. În timp ce rulează, te poți întoarce în Unsloth Studio și poți deschide pagina de monitorizare a API-ului din Settings pentru a urmări utilizarea modelului și viteza de generare.

Am observat o medie de aproximativ 22,6 tokeni pe secundă în timpul fluxului de codare. Viteza poate scădea pe măsură ce conversația și contextul proiectului cresc.

Tablou de bord de monitorizare al serverului de inferență Unsloth

După finalizarea sarcinilor, OpenCode ar trebui să ofere un rezumat al fișierelor, funcționalităților și comenzilor create. Ar trebui, de asemenea, să pornească website-ul finalizat pe portul 9101.

Rezumatul website-ului interactiv de analiză a acțiunilor în Opencode

Întoarce-te la pagina Connect din RunPod și deschide serviciul HTTP pentru portul 9101.

Rezultatul a fost surprinzător de finisat. Website-ul arăta curat, animat și similar cu un dashboard profesional de tranzacționare. Modelul a finalizat aplicația web dintr-un singur prompt, incluzând interfața, vizualizările de date, graficele și navigarea.

Testarea website-ului interactiv de analiză a acțiunilor creat cu DeepSeek-V4-Flash-0731

Poți selecta simboluri bursiere individuale pentru a vedea grafice tip lumânare, performanța istorică, indicatori și informații suplimentare despre companie.

Testarea website-ului interactiv de analiză a acțiunilor creat cu DeepSeek-V4-Flash-0731

Fila Compare îți permite, de asemenea, să compari mai multe acțiuni și să vezi care a performat mai bine în perioada selectată.

Testarea website-ului interactiv de analiză a acțiunilor creat cu DeepSeek-V4-Flash-0731

Am fost cu adevărat surprins că un model local mai mic a putut construi întregul website dintr-un singur prompt. 

După testarea aplicației, fiecare funcție majoră a funcționat conform așteptărilor, inclusiv prețurile live ale acțiunilor, datele istorice de piață, graficele, indicatorii și instrumentele de comparație.

Este remarcabil cât de repede se îmbunătățesc modelele locale și cât de capabile au devenit în a finaliza sarcini complexe, cap-coadă, de dezvoltare. 

Gânduri finale

Pentru mine, DeepSeek-V4-Flash-0731 este cel mai bun model local pe care l-am testat până acum. 

A performat mai bine decât Inkling, cuantizarea GLM-5.2 pe 2 biți și Qwen3.6-27B, care fusese anterior preferatul meu. Asta pe baza propriei mele experiențe, nu a unui benchmark formal, dar acum este modelul meu local preferat.

Pentru majoritatea volumelor de lucru practice, tot aș începe cu API-ul oficial DeepSeek deoarece este extrem de accesibil ca preț. 

V4 Flash costă în prezent 0,14 $ per milion de tokeni de intrare necachuiți, 0,0028 $ per milion de tokeni de intrare cachuiți și 0,28 $ per milion de tokeni de ieșire. La acest tarif, un miliard de tokeni de intrare cachuiți ar costa aproximativ 2,80 $ înainte de costurile pentru ieșire.

Înainte de a mă opri la Unsloth Studio, am încercat să rulez modelul prin llama.cpp. Instalatorul precompilat nu a furnizat un binar CUDA recent potrivit pentru mediul meu și, deși am compilat ultima versiune din sursă, am întâmpinat probleme suplimentare la activarea decodării speculative DSpark.

În final, Unsloth Studio a oferit cea mai simplă configurare și a eliminat majoritatea setărilor manuale. A funcționat bine cu OpenCode, deși construirea aplicației complete a durat aproximativ 20 de minute.

Subiecte
Inteligență artificială
Modele mari de limbaj

Top cursuri DataCamp

course

Programare asistată de AI pentru dezvoltatori

1 oră 30 min
9.9K
Îmbunătățește-ți codarea cu AI—ghidează-ți asistentul de codare să scrie, testeze și documenteze cod eficient.
Vezi detaliiRight Arrow
Începeți Cursul
Vezi mai multRight Arrow