Programma
Più piccolo e veloce non significa più automaticamente meno capace. Secondo le valutazioni pubblicate da DeepSeek, DeepSeek-V4-Flash-0731 usa un numero di parametri attivati molto inferiore rispetto a DeepSeek-V4-Pro pur offrendo prestazioni agentiche quasi di frontiera: totalizza 82,7 su Terminal Bench 2.1, contro 81,0 per GLM-5.2 e 85,0 per Opus 4.8, mentre il suo punteggio di 25,2 su Agents’ Last Exam è vicino ai 25,7 di Opus 4.8.
Poiché i pesi sono disponibili apertamente, in teoria puoi eseguire il modello sul tuo hardware quando disponi di sufficiente RAM o VRAM combinata, mantenendo inferenza e dati di progetto sotto il tuo controllo.
In questa guida, configureremo un ambiente RunPod con tre GPU, installeremo e avvieremo Unsloth Studio, scaricheremo e caricheremo la versione Q8 di DeepSeek-V4-Flash-0731 sulle GPU, testeremo il modello tramite Studio, collegheremo il server di inferenza locale a OpenCode e useremo l'agente di coding per creare e lanciare un sito web interattivo di analisi azionaria.
Cosa rende diverso DeepSeek-V4-Flash-0731?
DeepSeek-V4-Flash-0731 è la release ufficiale che sostituisce l'anteprima precedente, con notevoli miglioramenti in coding, uso di strumenti e attività di agenti autonomi. La sua architettura Mixture-of-Experts attiva solo una parte del modello per ciascun token. Questo lo aiuta a rimanere più efficiente pur offrendo prestazioni elevate.

Fonte: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face
DeepSeek riporta che il modello è migliorato da 61,8 a 82,7 su Terminal Bench 2.1 e da 7,3 a 54,4 su DeepSWE. Ha inoltre superato il più grande DeepSeek-V4-Pro Preview in diversi benchmark per agenti.
Il modello supporta finestre di contesto fino a un milione di token. Questo lo rende adatto per grandi codebase, documenti lunghi e workflow complessi che richiedono molto contesto. Gli utenti possono anche scegliere tra sforzo di ragionamento basso, alto e massimo, a seconda di quanto tempo il modello dovrebbe impiegare per risolvere un compito.
DeepSeek-V4-Flash-0731 include anche la decodifica speculativa DSpark. DSpark redige diversi token prima che il modello principale li verifichi, il che, secondo DeepSeek, può migliorare la velocità di generazione dal 60% all'85% quando usato con un motore di inferenza compatibile.
1. Configura il Pod RunPod
Inizieremo creando un ambiente RunPod con memoria GPU e storage sufficienti per eseguire la versione Q8 di DeepSeek-V4-Flash-0731 e ospitare sia Unsloth Studio sia il sito web generato da OpenCode.
Configura il Pod con:
- 3× GPU NVIDIA A100 SXM 80GB
- Ultimo template RunPod PyTorch
- Almeno 250GB di storage a volume persistente
- Almeno 50GB di storage del container
/workspacecome percorso di mount del volume persistente- Un token di accesso Hugging Face aggiunto come
HF_TOKEN - Porte HTTP
8910e9101esposte

La porta 8910 verrà usata per Unsloth Studio e la sua API di inferenza locale. La porta 9101 ospiterà il sito web interattivo creato da OpenCode.
RunPod espone questi servizi tramite il suo proxy HTTP, quindi entrambe le applicazioni devono mettersi in ascolto su 0.0.0.0 invece che solo su 127.0.0.1.

Dopo aver distribuito il Pod, apri la scheda Connect, avvia JupyterLab e crea tre sessioni terminale:
Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode
Mantenere le attività in terminali separati rende più facile monitorare le GPU, risolvere i problemi del modello ed eseguire l'agente di coding contemporaneamente.
2. Installa e avvia Unsloth Studio
Ora installeremo Unsloth Studio, configureremo una cache Hugging Face persistente e lanceremo l'interfaccia sulla porta 8910.
In Terminal 1, conferma che tutte e tre le GPU sono disponibili:
nvidia-smi
Dovresti vedere elencate tutte e tre le GPU A100 sul server Linux.

Crea una cache Hugging Face persistente dentro /workspace in modo che i modelli scaricati restino disponibili sul volume RunPod:
mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface
echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc
Ora installa i pacchetti di sistema richiesti e Unsloth Studio:
cd /workspace
apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev
curl -fsSL https://unsloth.ai/install.sh | sh

L'installer configura l'interfaccia di Studio, l'ambiente Python, le dipendenze e i componenti di inferenza locale.
La prima installazione può richiedere diversi minuti.

Quando l'installer chiede se vuoi avviare subito Unsloth Studio, inserisci “n”.
Lo avvieremo manualmente così userà la porta 8910 e ascolterà sull'indirizzo di rete corretto.
Riavvia la shell così i nuovi comandi sono disponibili:
exec bash
cd /workspace
Prima di avviare Studio, reimposta la password predefinita:
unsloth studio reset-password
Copia la password temporanea mostrata durante la configurazione, perché potresti averne bisogno per completare il reset.
Ora avvia Unsloth Studio:
unsloth studio \
-H 0.0.0.0 \
-p 8910

Studio dovrebbe ora indicare che è in esecuzione sulla porta 8910. Tieni Terminal 1 aperto mentre usi Unsloth Studio e OpenCode.
Torna alla pagina Connect di RunPod e apri l'HTTP Service per la porta 8910.

Usa la password temporanea generata in precedenza per completare il reset, quindi accedi con la nuova password che hai creato.
Completa o salta i passaggi di onboarding e apri la pagina Chat.

3. Scarica ed esegui DeepSeek-V4-Flash-0731
Ora che Unsloth Studio è in esecuzione, possiamo scaricare il modello Q8, caricarlo sulle tre GPU e testarne le capacità di chat e uso degli strumenti.
Apri il selettore del modello nell'angolo in alto a sinistra e cerca unsloth/DeepSeek-V4-Flash-0731-GGUF quindi seleziona la quantizzazione Q8 UD-Q8_K_XL.

Usiamo Q8 perché le tre GPU A100 forniscono VRAM combinata sufficiente. Conserva una qualità più vicina al modello originale, mentre le quantizzazioni inferiori sono più utili quando la memoria hardware è limitata.
Una volta terminato il download, Unsloth Studio inizierà automaticamente a caricare il modello nella memoria GPU. Questo può richiedere diversi minuti perché il modello Q8 è molto grande.

Dopo il caricamento, usa la pagina Chat per testare il modello con qualche prompt semplice.
Nei nostri test, la generazione ha raggiunto circa 33 token al secondo senza decodifica speculativa, un risultato ragionevole per un modello di queste dimensioni.

Puoi anche abilitare lo strumento di ricerca web di Studio e chiedere al modello di cercare informazioni aggiornate, come gli ultimi prezzi di oro e argento. È un modo utile per confermare che il modello può chiamare strumenti esterni invece di affidarsi solo alla sua conoscenza interna.

In Terminal 2, verifica come il modello è distribuito tra le GPU:
nvidia-smi

Dovresti vedere un uso di memoria consistente su tutte e tre le GPU.
Nel nostro test, ciascuna GPU era intorno al 70% di utilizzo. Tuttavia, questo non significa necessariamente che l'intero modello Q8 entrerà comodamente su sole due GPU da 80GB, perché è richiesta ulteriore VRAM per finestra di contesto, KV cache e buffer di inferenza.
Infine, testa il modello con il prompt di pianificazione per l'applicazione che costruiremo:
Create a concise architecture plan for an interactive stock analytics website
using Next.js, financial charts, technical indicators, portfolio tracking,
and responsive animations.
Il modello restituisce un piano di sviluppo strutturato che copre architettura dell'applicazione, componenti, flusso dei dati, librerie di grafici, calcoli finanziari e design dell'interfaccia.

4. Collega DeepSeek-V4-Flash-0731 a OpenCode e crea il sito
Ora che il modello è in esecuzione in Unsloth Studio, possiamo collegarlo a OpenCode e usarlo come agente di coding locale.
In Terminal 3, imposta l'URL di Studio:
echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc
Crea una nuova directory di progetto:
mkdir -p /workspace/market-pulse
cd /workspace/market-pulse
Avvia OpenCode tramite Unsloth Studio:
unsloth start opencode
La prima volta che esegui questo comando, chiederà il permesso di installare OpenCode. Inserisci “y”.

Una volta completata l'installazione, OpenCode si avvierà con il modello DeepSeek-V4-Flash-0731 in esecuzione locale già configurato.

Incolla il seguente prompt in due righe in OpenCode:
Build a polished, highly interactive stock analytics website using Bun, Next.js App Router,
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API,
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking,
comparisons, responsive design, animations, loading states, and error handling.
Work autonomously: install everything, create every file, test and fix the complete application,
and run the finished website on 0.0.0.0:9101.
Entro pochi secondi, l'agente di coding dovrebbe creare un elenco di task dettagliato e iniziare a lavorare sul progetto passo dopo passo.

L'intera build ha richiesto circa 20 minuti nel nostro test. Durante l'esecuzione, puoi tornare a Unsloth Studio e aprire la pagina di monitoraggio API nelle Settings per tracciare utilizzo del modello e velocità di generazione.
Abbiamo osservato una media di circa 22,6 token al secondo durante il workflow di coding. La velocità può diminuire man mano che crescono la conversazione e il contesto del progetto.

Dopo aver completato i task, OpenCode dovrebbe fornire un riepilogo dei file, delle funzionalità e dei comandi creati. Dovrebbe anche avviare il sito web finito sulla porta 9101.

Torna alla pagina Connect di RunPod e apri l'HTTP Service per la porta 9101.
Il risultato è stato sorprendentemente rifinito. Il sito appariva pulito, animato e simile a una dashboard di trading professionale. Il modello ha completato l'app web con un solo prompt, includendo interfaccia, viste dati, grafici e navigazione.

Puoi selezionare singoli ticker per visualizzare grafici a candele, performance storica, indicatori e ulteriori informazioni sull'azienda.

La scheda Compare ti consente anche di confrontare più titoli e vedere quale ha performato meglio nel periodo selezionato.

Sono rimasto sinceramente sorpreso che un modello locale più piccolo potesse costruire l'intero sito da un singolo prompt.
Dopo il test dell'applicazione, ogni funzionalità principale ha funzionato come previsto, inclusi prezzi in tempo reale, dati di mercato storici, grafici, indicatori e strumenti di confronto.
È notevole quanto rapidamente i modelli locali stiano migliorando e quanto siano diventati capaci nel completare task di sviluppo complessi end-to-end.
Considerazioni finali
Per me, DeepSeek-V4-Flash-0731 è il miglior modello locale che abbia testato finora.
Ha performato meglio di Inkling, della quantizzazione GLM-5.2 a 2 bit e di Qwen3.6-27B, che in precedenza era il mio preferito. Questo si basa sulla mia esperienza personale e non su un benchmark formale, ma è ora il mio modello locale di riferimento.
Per la maggior parte dei carichi di lavoro pratici, inizierei comunque con la DeepSeek API ufficiale perché è estremamente economica.
V4 Flash attualmente costa $0,14 per milione di token di input non in cache, $0,0028 per milione di token di input in cache e $0,28 per milione di token di output. A questa tariffa, un miliardo di token di input in cache costerebbe circa $2,80 prima dei costi di output.
Prima di scegliere Unsloth Studio, ho provato a eseguire il modello tramite llama.cpp. L'installer precompilato non forniva un binario CUDA recente adatto al mio ambiente e, sebbene abbia compilato l'ultima versione dai sorgenti, ho riscontrato ulteriori problemi attivando la decodifica speculativa DSpark.
Unsloth Studio alla fine ha offerto la configurazione più semplice e ha eliminato gran parte della configurazione manuale. Ha funzionato bene con OpenCode, anche se la build completa dell'applicazione ha richiesto circa 20 minuti.
In quanto data scientist certificato, sono appassionato di sfruttare tecnologie all’avanguardia per creare applicazioni di machine learning innovative. Con una solida esperienza in riconoscimento vocale, analisi e reportistica dei dati, MLOps, AI conversazionale e NLP, ho affinato le mie competenze nello sviluppo di sistemi intelligenti in grado di avere un impatto concreto. Oltre alla mia expertise tecnica, sono anche un comunicatore efficace, con il talento di rendere chiari e sintetici concetti complessi. Di conseguenza, sono diventato un blogger molto seguito in ambito data science, condividendo idee ed esperienze con una community in crescita di professionisti dei dati. Attualmente mi concentro sulla creazione e sull’editing di contenuti, lavorando con large language model per sviluppare contenuti potenti e coinvolgenti che possano aiutare aziende e singoli a valorizzare al meglio i propri dati.


