Vai al contenuto principale

Esegui DeepSeek-V4-Flash-0731 con Unsloth Studio e OpenCode

Esegui l'ultimo modello DeepSeek V4 Flash su un setup multi-GPU con Unsloth Studio, connettilo a OpenCode e usa un agente di coding AI locale per costruire un sito web interattivo di analisi azionaria.
Aggiornato 6 ago 2026  · 8 min leggi

Esplora con l'AI

Apri in ChatGPTApri in ClaudeApri in Perplexity

Più piccolo e veloce non significa più automaticamente meno capace. Secondo le valutazioni pubblicate da DeepSeek, DeepSeek-V4-Flash-0731 usa un numero di parametri attivati molto inferiore rispetto a DeepSeek-V4-Pro pur offrendo prestazioni agentiche quasi di frontiera: totalizza 82,7 su Terminal Bench 2.1, contro 81,0 per GLM-5.2 e 85,0 per Opus 4.8, mentre il suo punteggio di 25,2 su Agents’ Last Exam è vicino ai 25,7 di Opus 4.8. 

Poiché i pesi sono disponibili apertamente, in teoria puoi eseguire il modello sul tuo hardware quando disponi di sufficiente RAM o VRAM combinata, mantenendo inferenza e dati di progetto sotto il tuo controllo. 

In questa guida, configureremo un ambiente RunPod con tre GPU, installeremo e avvieremo Unsloth Studio, scaricheremo e caricheremo la versione Q8 di DeepSeek-V4-Flash-0731 sulle GPU, testeremo il modello tramite Studio, collegheremo il server di inferenza locale a OpenCode e useremo l'agente di coding per creare e lanciare un sito web interattivo di analisi azionaria.

Cosa rende diverso DeepSeek-V4-Flash-0731?

DeepSeek-V4-Flash-0731 è la release ufficiale che sostituisce l'anteprima precedente, con notevoli miglioramenti in coding, uso di strumenti e attività di agenti autonomi. La sua architettura Mixture-of-Experts attiva solo una parte del modello per ciascun token. Questo lo aiuta a rimanere più efficiente pur offrendo prestazioni elevate.

Tabella di confronto dei benchmark di DeepSeek-V4-Flash-0731

Fonte: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek riporta che il modello è migliorato da 61,8 a 82,7 su Terminal Bench 2.1 e da 7,3 a 54,4 su DeepSWE. Ha inoltre superato il più grande DeepSeek-V4-Pro Preview in diversi benchmark per agenti.

Il modello supporta finestre di contesto fino a un milione di token. Questo lo rende adatto per grandi codebase, documenti lunghi e workflow complessi che richiedono molto contesto. Gli utenti possono anche scegliere tra sforzo di ragionamento basso, alto e massimo, a seconda di quanto tempo il modello dovrebbe impiegare per risolvere un compito.

DeepSeek-V4-Flash-0731 include anche la decodifica speculativa DSpark. DSpark redige diversi token prima che il modello principale li verifichi, il che, secondo DeepSeek, può migliorare la velocità di generazione dal 60% all'85% quando usato con un motore di inferenza compatibile.

1. Configura il Pod RunPod

Inizieremo creando un ambiente RunPod con memoria GPU e storage sufficienti per eseguire la versione Q8 di DeepSeek-V4-Flash-0731 e ospitare sia Unsloth Studio sia il sito web generato da OpenCode.

Configura il Pod con:

  • 3× GPU NVIDIA A100 SXM 80GB
  • Ultimo template RunPod PyTorch
  • Almeno 250GB di storage a volume persistente
  • Almeno 50GB di storage del container
  • /workspace come percorso di mount del volume persistente
  • Un token di accesso Hugging Face aggiunto come HF_TOKEN
  • Porte HTTP 8910 e 9101 esposte

Modifica del template Pytorch Runpod

La porta 8910 verrà usata per Unsloth Studio e la sua API di inferenza locale. La porta 9101 ospiterà il sito web interattivo creato da OpenCode.

RunPod espone questi servizi tramite il suo proxy HTTP, quindi entrambe le applicazioni devono mettersi in ascolto su 0.0.0.0 invece che solo su 127.0.0.1

Distribuzione del pod con 3x A100 GPU su runpod

Dopo aver distribuito il Pod, apri la scheda Connect, avvia JupyterLab e crea tre sessioni terminale:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Mantenere le attività in terminali separati rende più facile monitorare le GPU, risolvere i problemi del modello ed eseguire l'agente di coding contemporaneamente.

2. Installa e avvia Unsloth Studio

Ora installeremo Unsloth Studio, configureremo una cache Hugging Face persistente e lanceremo l'interfaccia sulla porta 8910.

In Terminal 1, conferma che tutte e tre le GPU sono disponibili:

nvidia-smi

Dovresti vedere elencate tutte e tre le GPU A100 sul server Linux.

Riepilogo 3x A100 GPU

Crea una cache Hugging Face persistente dentro /workspace in modo che i modelli scaricati restino disponibili sul volume RunPod:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Ora installa i pacchetti di sistema richiesti e Unsloth Studio:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Installazione di Unsloth Studio

L'installer configura l'interfaccia di Studio, l'ambiente Python, le dipendenze e i componenti di inferenza locale. 

La prima installazione può richiedere diversi minuti.

Installazione di Unsloth Studio

Quando l'installer chiede se vuoi avviare subito Unsloth Studio, inserisci “n”.

Lo avvieremo manualmente così userà la porta 8910 e ascolterà sull'indirizzo di rete corretto.

Riavvia la shell così i nuovi comandi sono disponibili:

exec bash
cd /workspace

Prima di avviare Studio, reimposta la password predefinita:

unsloth studio reset-password

Copia la password temporanea mostrata durante la configurazione, perché potresti averne bisogno per completare il reset.

Ora avvia Unsloth Studio:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Avvio di Unsloth Studio

Studio dovrebbe ora indicare che è in esecuzione sulla porta 8910. Tieni Terminal 1 aperto mentre usi Unsloth Studio e OpenCode.

Torna alla pagina Connect di RunPod e apri l'HTTP Service per la porta 8910

Accesso al tunnel Runpod di Unsloth Studio

Usa la password temporanea generata in precedenza per completare il reset, quindi accedi con la nuova password che hai creato. 

Completa o salta i passaggi di onboarding e apri la pagina Chat.

Menu Chat di Unsloth Studio

3. Scarica ed esegui DeepSeek-V4-Flash-0731

Ora che Unsloth Studio è in esecuzione, possiamo scaricare il modello Q8, caricarlo sulle tre GPU e testarne le capacità di chat e uso degli strumenti.

Apri il selettore del modello nell'angolo in alto a sinistra e cerca unsloth/DeepSeek-V4-Flash-0731-GGUF quindi seleziona la quantizzazione Q8 UD-Q8_K_XL.

Download della versione Q8 del modello Deepseek v4 flash in Unsloth Studio

Usiamo Q8 perché le tre GPU A100 forniscono VRAM combinata sufficiente. Conserva una qualità più vicina al modello originale, mentre le quantizzazioni inferiori sono più utili quando la memoria hardware è limitata.

Una volta terminato il download, Unsloth Studio inizierà automaticamente a caricare il modello nella memoria GPU. Questo può richiedere diversi minuti perché il modello Q8 è molto grande.

Caricamento del modello Deepseek v4 flash in Unsloth Studio

Dopo il caricamento, usa la pagina Chat per testare il modello con qualche prompt semplice. 

Nei nostri test, la generazione ha raggiunto circa 33 token al secondo senza decodifica speculativa, un risultato ragionevole per un modello di queste dimensioni.

Test del modello Deepseek v4 flash in Unsloth Studio

Puoi anche abilitare lo strumento di ricerca web di Studio e chiedere al modello di cercare informazioni aggiornate, come gli ultimi prezzi di oro e argento. È un modo utile per confermare che il modello può chiamare strumenti esterni invece di affidarsi solo alla sua conoscenza interna.

Test del modello Deepseek v4 flash in Unsloth Studio con strumento web

In Terminal 2, verifica come il modello è distribuito tra le GPU:

nvidia-smi

Riepilogo GPU del modello Deepseek v4 flash Q8 caricato in memoria GPU

Dovresti vedere un uso di memoria consistente su tutte e tre le GPU. 

Nel nostro test, ciascuna GPU era intorno al 70% di utilizzo. Tuttavia, questo non significa necessariamente che l'intero modello Q8 entrerà comodamente su sole due GPU da 80GB, perché è richiesta ulteriore VRAM per finestra di contesto, KV cache e buffer di inferenza.

Infine, testa il modello con il prompt di pianificazione per l'applicazione che costruiremo:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Il modello restituisce un piano di sviluppo strutturato che copre architettura dell'applicazione, componenti, flusso dei dati, librerie di grafici, calcoli finanziari e design dell'interfaccia.

Test del modello Deepseek v4 flash in Unsloth Studio con prompt complesso

4. Collega DeepSeek-V4-Flash-0731 a OpenCode e crea il sito

Ora che il modello è in esecuzione in Unsloth Studio, possiamo collegarlo a OpenCode e usarlo come agente di coding locale.

In Terminal 3, imposta l'URL di Studio:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Crea una nuova directory di progetto:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Avvia OpenCode tramite Unsloth Studio:

unsloth start opencode

La prima volta che esegui questo comando, chiederà il permesso di installare OpenCode. Inserisci “y”.

Installazione e avvio di Opencode

Una volta completata l'installazione, OpenCode si avvierà con il modello DeepSeek-V4-Flash-0731 in esecuzione locale già configurato.

OpenCode integrato con il modello DeepSeek v4 Flash eseguito in locale

Incolla il seguente prompt in due righe in OpenCode:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

Entro pochi secondi, l'agente di coding dovrebbe creare un elenco di task dettagliato e iniziare a lavorare sul progetto passo dopo passo.

Creazione del sito web interattivo di analisi azionaria in Opencode con server di inferenza Unsloth

L'intera build ha richiesto circa 20 minuti nel nostro test. Durante l'esecuzione, puoi tornare a Unsloth Studio e aprire la pagina di monitoraggio API nelle Settings per tracciare utilizzo del modello e velocità di generazione.

Abbiamo osservato una media di circa 22,6 token al secondo durante il workflow di coding. La velocità può diminuire man mano che crescono la conversazione e il contesto del progetto.

Dashboard di monitoraggio del server di inferenza Unsloth

Dopo aver completato i task, OpenCode dovrebbe fornire un riepilogo dei file, delle funzionalità e dei comandi creati. Dovrebbe anche avviare il sito web finito sulla porta 9101.

Riepilogo del sito interattivo di analisi azionaria in Opencode

Torna alla pagina Connect di RunPod e apri l'HTTP Service per la porta 9101.

Il risultato è stato sorprendentemente rifinito. Il sito appariva pulito, animato e simile a una dashboard di trading professionale. Il modello ha completato l'app web con un solo prompt, includendo interfaccia, viste dati, grafici e navigazione.

Test del sito interattivo di analisi azionaria creato con DeepSeek-V4-Flash-0731

Puoi selezionare singoli ticker per visualizzare grafici a candele, performance storica, indicatori e ulteriori informazioni sull'azienda.

Test del sito interattivo di analisi azionaria creato con DeepSeek-V4-Flash-0731

La scheda Compare ti consente anche di confrontare più titoli e vedere quale ha performato meglio nel periodo selezionato.

Test del sito interattivo di analisi azionaria creato con DeepSeek-V4-Flash-0731

Sono rimasto sinceramente sorpreso che un modello locale più piccolo potesse costruire l'intero sito da un singolo prompt. 

Dopo il test dell'applicazione, ogni funzionalità principale ha funzionato come previsto, inclusi prezzi in tempo reale, dati di mercato storici, grafici, indicatori e strumenti di confronto.

È notevole quanto rapidamente i modelli locali stiano migliorando e quanto siano diventati capaci nel completare task di sviluppo complessi end-to-end. 

Considerazioni finali

Per me, DeepSeek-V4-Flash-0731 è il miglior modello locale che abbia testato finora. 

Ha performato meglio di Inkling, della quantizzazione GLM-5.2 a 2 bit e di Qwen3.6-27B, che in precedenza era il mio preferito. Questo si basa sulla mia esperienza personale e non su un benchmark formale, ma è ora il mio modello locale di riferimento.

Per la maggior parte dei carichi di lavoro pratici, inizierei comunque con la DeepSeek API ufficiale perché è estremamente economica. 

V4 Flash attualmente costa $0,14 per milione di token di input non in cache, $0,0028 per milione di token di input in cache e $0,28 per milione di token di output. A questa tariffa, un miliardo di token di input in cache costerebbe circa $2,80 prima dei costi di output.

Prima di scegliere Unsloth Studio, ho provato a eseguire il modello tramite llama.cpp. L'installer precompilato non forniva un binario CUDA recente adatto al mio ambiente e, sebbene abbia compilato l'ultima versione dai sorgenti, ho riscontrato ulteriori problemi attivando la decodifica speculativa DSpark.

Unsloth Studio alla fine ha offerto la configurazione più semplice e ha eliminato gran parte della configurazione manuale. Ha funzionato bene con OpenCode, anche se la build completa dell'applicazione ha richiesto circa 20 minuti.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

In quanto data scientist certificato, sono appassionato di sfruttare tecnologie all’avanguardia per creare applicazioni di machine learning innovative. Con una solida esperienza in riconoscimento vocale, analisi e reportistica dei dati, MLOps, AI conversazionale e NLP, ho affinato le mie competenze nello sviluppo di sistemi intelligenti in grado di avere un impatto concreto. Oltre alla mia expertise tecnica, sono anche un comunicatore efficace, con il talento di rendere chiari e sintetici concetti complessi. Di conseguenza, sono diventato un blogger molto seguito in ambito data science, condividendo idee ed esperienze con una community in crescita di professionisti dei dati. Attualmente mi concentro sulla creazione e sull’editing di contenuti, lavorando con large language model per sviluppare contenuti potenti e coinvolgenti che possano aiutare aziende e singoli a valorizzare al meglio i propri dati.

Argomenti

I migliori corsi DataCamp

Programma

Ingegnere AI associato per scienziati dei dati

40 h
Addestrare e mettere a punto i più recenti modelli di intelligenza artificiale per la produzione, compresi gli LLM come Llama 3. Inizia oggi il tuo percorso per diventare un ingegnere AI!
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro