Ga naar hoofdinhoud

Draai DeepSeek-V4-Flash-0731 met Unsloth Studio en OpenCode

Draai het nieuwste DeepSeek V4 Flash-model op een multi-GPU-setup met Unsloth Studio, koppel het aan OpenCode en gebruik een lokale AI-code-agent om een interactieve website voor stockanalyse te bouwen.
Bijgewerkt 6 aug 2026  · 8 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

Kleiner en sneller betekent niet langer automatisch minder capabel. Volgens de gepubliceerde evaluaties van DeepSeek gebruikt DeepSeek-V4-Flash-0731 een veel kleinere geactiveerde parameterfootprint dan DeepSeek-V4-Pro, terwijl het bijna frontlinie agent-prestaties levert: het scoort 82,7 op Terminal Bench 2.1, vergeleken met 81,0 voor GLM-5.2 en 85,0 voor Opus 4.8, terwijl de score 25,2 op Agents’ Last Exam dicht in de buurt komt van de 25,7 van Opus 4.8. 

Omdat de gewichten openlijk beschikbaar zijn, kun je het model in theorie op je eigen hardware draaien wanneer je genoeg gecombineerde RAM of VRAM hebt, zodat inferentie en projectgegevens onder jouw controle blijven. 

In deze gids configureren we een RunPod-omgeving met drie GPU’s, installeren en starten we Unsloth Studio, downloaden en laden we de Q8-versie van DeepSeek-V4-Flash-0731 over de GPU’s, testen we het model via Studio, koppelen we de lokale inferentieserver aan OpenCode en gebruiken we de code-agent om een interactieve website voor stockanalyse te bouwen en te lanceren.

Wat maakt DeepSeek-V4-Flash-0731 anders?

DeepSeek-V4-Flash-0731 is de officiële release die de eerdere preview vervangt, met grote verbeteringen in coderen, toolgebruik en autonome agenttaken. De Mixture-of-Experts-architectuur activeert slechts een deel van het model per token. Dit helpt om efficiënter te blijven en toch sterke prestaties te leveren.

Vergelijkingstabel met benchmarks voor DeepSeek-V4-Flash-0731

Bron: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek meldt dat het model is verbeterd van 61,8 naar 82,7 op Terminal Bench 2.1 en van 7,3 naar 54,4 op DeepSWE. Het presteerde ook beter dan de grotere DeepSeek-V4-Pro Preview op verschillende agentbenchmarks.

Het model ondersteunt contextvensters tot één miljoen tokens. Dit maakt het geschikt voor grote codebases, lange documenten en complexe workflows die veel context vereisen. Gebruikers kunnen ook kiezen tussen lage, hoge en maximale redeneerinspanning, afhankelijk van hoeveel tijd het model aan een taak moet besteden.

DeepSeek-V4-Flash-0731 bevat ook DSpark speculative decoding. DSpark maakt eerst een concept van meerdere tokens voordat het hoofdmodel ze verifieert, wat volgens DeepSeek de genereersnelheid met 60% tot 85% kan verbeteren wanneer dit wordt gebruikt met een compatibele inferentie-engine.

1. Configureer de RunPod Pod

We beginnen met het creëren van een RunPod-omgeving met genoeg GPU-geheugen en opslag om de Q8-versie van DeepSeek-V4-Flash-0731 te draaien en zowel Unsloth Studio als de website die door OpenCode wordt gegenereerd te hosten.

Configureer de Pod met:

  • 3× NVIDIA A100 SXM 80GB GPU’s
  • Nieuwste RunPod PyTorch-template
  • Minstens 250GB persistente volumestorage
  • Minstens 50GB containeropslag
  • /workspace als het pad voor het mounten van het persistent volume
  • Een Hugging Face-toegangstoken toegevoegd als HF_TOKEN
  • HTTP-poorten 8910 en 9101 opengezet

De Pytorch Runpod-template bewerken

Poort 8910 wordt gebruikt voor Unsloth Studio en de lokale inferentie-API. Poort 9101 host de interactieve website die door OpenCode is gemaakt.

RunPod stelt deze services bloot via de HTTP-proxy, dus beide applicaties moeten luisteren op 0.0.0.0 in plaats van alleen op 127.0.0.1

De 3x A100 GPU-pod op runpod inzetten

Na het deployen van de Pod, open je het tabblad Connect, start je JupyterLab en maak je drie terminalsessies aan:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

De taken in afzonderlijke terminals houden maakt het eenvoudiger om de GPU’s te monitoren, problemen met het model op te lossen en tegelijkertijd de code-agent te draaien.

2. Installeer en start Unsloth Studio

Vervolgens installeren we Unsloth Studio, configureren we een persistente Hugging Face-cache en starten we de interface op poort 8910.

In Terminal 1 controleer je of alle drie de GPU’s beschikbaar zijn:

nvidia-smi

Je zou alle drie de A100 GPU’s op de Linux-server moeten zien staan.

Samenvatting van 3x A100 GPU

Maak een persistente Hugging Face-cache in /workspace zodat gedownloade modellen beschikbaar blijven op het RunPod-volume:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Installeer vervolgens de vereiste systeempakketten en Unsloth Studio:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Unsloth Studio Installer

De installer configureert de Studio-interface, Python-omgeving, dependencies en lokale inferentiecomponenten. 

De eerste installatie kan enkele minuten duren.

Unsloth Studio Installer

Wanneer de installer vraagt of je Unsloth Studio meteen wilt starten, voer dan “n” in.

We starten het handmatig zodat het poort 8910 gebruikt en op het juiste netwerkadres luistert.

Herstart de shell zodat de nieuwe commando’s beschikbaar zijn:

exec bash
cd /workspace

Reset voor het starten van Studio het standaardwachtwoord:

unsloth studio reset-password

Kopieer het tijdelijke wachtwoord dat tijdens de setup wordt getoond, want je hebt het mogelijk nodig om de reset te voltooien.

Start nu Unsloth Studio:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Unsloth Studio starten

Studio zou nu moeten melden dat het draait op poort 8910. Houd Terminal 1 open tijdens het gebruik van Unsloth Studio en OpenCode.

Ga terug naar de RunPod-pagina Connect en open de HTTP Service voor poort 8910

Toegang tot de Unsloth Studio Runpod-tunnel

Gebruik het eerder gegenereerde tijdelijke wachtwoord om de reset te voltooien en meld je daarna aan met het nieuwe wachtwoord dat je hebt aangemaakt. 

Voltooi of sla de onboarding-stappen over en open de Chat-pagina.

Unsloth Studio Chat-menu

3. Download en draai DeepSeek-V4-Flash-0731

Nu Unsloth Studio draait, kunnen we het Q8-model downloaden, over de drie GPU’s laden en de chat- en toolgebruikmogelijkheden testen.

Open de modelkiezer linksboven en zoek naar unsloth/DeepSeek-V4-Flash-0731-GGUF en selecteer vervolgens de Q8-kwantisatie UD-Q8_K_XL.

De Q8-versie van het Deepseek v4 flash-model downloaden in Unsloth Studio

We gebruiken Q8 omdat de drie A100 GPU’s samen genoeg VRAM bieden. Dit behoudt de kwaliteit dichter bij het oorspronkelijke model, terwijl lagere kwantisaties nuttiger zijn wanneer het hardwaregeheugen beperkt is.

Zodra het downloaden is voltooid, begint Unsloth Studio automatisch met het laden van het model in GPU-geheugen. Dit kan enkele minuten duren omdat het Q8-model erg groot is.

Het Deepseek v4 flash-model laden in Unsloth Studio

Na het laden kun je op de pagina Chat het model testen met een paar simpele prompts. 

In onze tests haalde de generatie ongeveer 33 tokens per seconde zonder speculative decoding, wat een redelijk resultaat is voor een model van deze grootte.

Het Deepseek v4 flash-model testen in Unsloth Studio

Je kunt ook de webzoektool van Studio inschakelen en het model vragen om actuele informatie op te zoeken, zoals de laatste goud- en zilverprijzen. Dit is een handige manier om te bevestigen dat het model externe tools kan aanroepen in plaats van alleen op de interne kennis te vertrouwen.

Het Deepseek v4 flash-model testen in Unsloth Studio met webtool

Controleer in Terminal 2 hoe het model over de GPU’s is verdeeld:

nvidia-smi

GPU-samenvatting van het Q8 Deepseek v4 flash-model geladen in GPU-geheugen

Je zou op alle drie de GPU’s aanzienlijk geheugengebruik moeten zien. 

In onze test was elke GPU voor rond de 70% vol. Dit betekent echter niet per se dat het complete Q8-model comfortabel op slechts twee 80GB GPU’s past, omdat er aanvullende VRAM nodig is voor het contextvenster, de KV-cache en inferentiebuffers.

Test het model ten slotte met de planningsprompt voor de applicatie die we gaan bouwen:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Het model geeft een gestructureerd ontwikkelplan terug dat de applicatie-architectuur, componenten, datastroom, chartingbibliotheken, financiële berekeningen en interfaceontwerp behandelt.

Het Deepseek v4 flash-model testen in Unsloth Studio met complexe prompt

4. Verbind DeepSeek-V4-Flash-0731 met OpenCode en bouw de website

Nu het model in Unsloth Studio draait, kunnen we het koppelen aan OpenCode en het gebruiken als lokale code-agent.

Stel in Terminal 3 de Studio-URL in:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Maak een nieuwe projectmap aan:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Start OpenCode via Unsloth Studio:

unsloth start opencode

De eerste keer dat je dit commando uitvoert, zal het vragen om toestemming om OpenCode te installeren. Voer “y” in.

Opencode installeren en starten

Zodra de installatie is voltooid, wordt OpenCode gestart met het lokaal draaiende DeepSeek-V4-Flash-0731-model al geconfigureerd.

OpenCode geïntegreerd met het lokaal draaiende DeepSeek v4 Flash-model

Plak de volgende tweeregelige prompt in OpenCode:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

Binnen enkele seconden zou de code-agent een gedetailleerde takenlijst moeten maken en stap voor stap aan het project beginnen.

Interactieve website voor stockanalyse bouwen in Opencode met Unsloth-inferentieserver

De volledige build duurde in onze test ongeveer 20 minuten. Terwijl deze draait, kun je teruggaan naar Unsloth Studio en in Settings de API-monitoringpagina openen om het modelgebruik en de genereersnelheid te volgen.

We zagen tijdens de codeworkflow een gemiddelde van ongeveer 22,6 tokens per seconde. De snelheid kan afnemen naarmate het gesprek en de projectcontext groeien.

Monitordashboard van de Unsloth-inferentieserver

Na het voltooien van de taken zou OpenCode een samenvatting moeten geven van de bestanden, features en commando’s die zijn aangemaakt. Ook zou de voltooide website moeten worden gestart op poort 9101.

Samenvatting van de interactieve website voor stockanalyse in Opencode

Ga terug naar de RunPod-pagina Connect en open de HTTP Service voor poort 9101.

Het resultaat was verrassend gepolijst. De website zag er strak uit, met animaties, en leek op een professionele tradingdashboard. Het model voltooide de webapplicatie met één prompt, inclusief de interface, dataviews, grafieken en navigatie.

De interactieve website voor stockanalyse testen die is gemaakt met DeepSeek-V4-Flash-0731

Je kunt afzonderlijke tickers selecteren om candlestick-grafieken, historische prestaties, indicatoren en extra bedrijfsinformatie te bekijken.

De interactieve website voor stockanalyse testen die is gemaakt met DeepSeek-V4-Flash-0731

Het tabblad Compare laat je ook meerdere aandelen vergelijken en zien welke beter presteerden over de geselecteerde periode.

De interactieve website voor stockanalyse testen die is gemaakt met DeepSeek-V4-Flash-0731

Ik was oprecht verrast dat een kleiner lokaal model de hele website kon bouwen vanuit één prompt. 

Na het testen van de applicatie werkte elke belangrijke feature zoals bedoeld, inclusief live aandelenkoersen, historische marktdata, grafieken, indicatoren en vergelijkingstools.

Het is opmerkelijk hoe snel lokale modellen verbeteren en hoe capabel ze zijn geworden in het voltooien van complexe end-to-end ontwikkeltaken. 

Tot slot

Voor mij is DeepSeek-V4-Flash-0731 het beste lokale model dat ik tot nu toe heb getest. 

Het presteerde beter dan Inkling, de 2-bit GLM-5.2-kwantisatie en Qwen3.6-27B, die eerder mijn favoriet was. Dit is gebaseerd op mijn eigen ervaring en niet op een formele benchmark, maar het is nu mijn voorkeursmodel voor lokaal gebruik.

Voor de meeste praktische workloads zou ik nog steeds beginnen met de officiële DeepSeek API omdat die extreem betaalbaar is. 

V4 Flash kost momenteel $0,14 per miljoen niet-gecachte inputtokens, $0,0028 per miljoen gecachte inputtokens en $0,28 per miljoen outputtokens. Tegen dat tarief kosten één miljard gecachte inputtokens ongeveer $2,80, exclusief outputkosten.

Voordat ik voor Unsloth Studio koos, probeerde ik het model te draaien via llama.cpp. De kant-en-klare installer bood geen geschikte recente CUDA-binary voor mijn omgeving, en hoewel ik de nieuwste versie uit broncode compileerde, liep ik verdere problemen tegen het lijf bij het inschakelen van DSpark speculative decoding.

Unsloth Studio bood uiteindelijk de eenvoudigste setup en haalde het meeste handmatige configuratiewerk weg. Het werkte goed met OpenCode, al duurde het bouwen van de complete applicatie ongeveer 20 minuten.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als gecertificeerd data scientist haal ik met passie het maximale uit de nieuwste technologie om innovatieve machinelearning-toepassingen te bouwen. Met een sterke achtergrond in spraakherkenning, data-analyse en -rapportage, MLOps, conversationele AI en NLP heb ik mijn vaardigheden aangescherpt in het ontwikkelen van intelligente systemen die echt impact maken. Naast mijn technische expertise ben ik ook een sterke communicator met een talent om complexe concepten terug te brengen tot heldere, beknopte taal. Daardoor ben ik uitgegroeid tot een veelgelezen blogger over data science, waar ik mijn inzichten en ervaringen deel met een groeiende community van data-professionals. Op dit moment richt ik me op contentcreatie en redactie, waarbij ik met large language models werk aan krachtige en aansprekende content die zowel bedrijven als individuen helpt het beste uit hun data te halen.

Onderwerpen
Kunstmatige intelligentie
Large Language Models

Topcursussen bij DataCamp

Cursus

AI-ondersteund coderen voor developers

1 Hr 30 Min
9.9K
Maak je codering nog beter met AI – laat je codeerassistent je helpen om code op een slimme manier te schrijven, testen en documenteren.
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow
Gerelateerd

blog

AI vanaf nul leren in 2026: een complete gids van de experts

Ontdek alles wat je moet weten om in 2026 AI te leren, van tips om te beginnen tot handige resources en inzichten van industrie-experts.
Adel Nehme's photo

Adel Nehme

15 min

Meer ZienMeer Zien