Accéder au contenu principal

Exécuter DeepSeek-V4-Flash-0731 avec Unsloth Studio et OpenCode

Exécutez le dernier modèle DeepSeek V4 Flash sur une configuration multi-GPU avec Unsloth Studio, connectez-le à OpenCode et utilisez un agent IA local pour créer un site web interactif d’analyse boursière.
Actualisé 6 août 2026  · 8 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Plus petit et plus rapide ne rime plus automatiquement avec moins performant. D’après les évaluations publiées par DeepSeek, DeepSeek-V4-Flash-0731 utilise bien moins de paramètres activés que DeepSeek-V4-Pro tout en offrant des performances agentiques proches de l’état de l’art : il obtient 82,7 sur Terminal Bench 2.1, contre 81,0 pour GLM-5.2 et 85,0 pour Opus 4.8. Son score à Agents’ Last Exam de 25,2 est proche des 25,7 d’Opus 4.8. 

Comme les poids sont disponibles ouvertement, vous pouvez en théorie exécuter le modèle sur votre propre matériel si vous disposez de suffisamment de RAM ou de VRAM combinée, en gardant l’inférence et les données de vos projets sous votre contrôle. 

Dans ce guide, nous allons configurer un environnement RunPod à trois GPU, installer et lancer Unsloth Studio, télécharger et charger la version Q8 de DeepSeek-V4-Flash-0731 sur les GPU, tester le modèle via Studio, connecter le serveur d’inférence local à OpenCode et utiliser l’agent de code pour créer et lancer un site web interactif d’analyse boursière.

Qu’est-ce qui distingue DeepSeek-V4-Flash-0731 ?

DeepSeek-V4-Flash-0731 est la version officielle qui remplace l’aperçu précédent, avec de grandes améliorations en codage, en utilisation d’outils et en tâches d’agents autonomes. Son architecture Mixture-of-Experts n’active qu’une partie du modèle pour chaque jeton, ce qui le rend plus efficace tout en conservant d’excellentes performances.

Tableau comparatif des benchmarks DeepSeek-V4-Flash-0731

Source : deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek indique que le modèle est passé de 61,8 à 82,7 sur Terminal Bench 2.1 et de 7,3 à 54,4 sur DeepSWE. Il a également surpassé le plus grand DeepSeek-V4-Pro Preview sur plusieurs benchmarks d’agents.

Le modèle prend en charge des fenêtres de contexte allant jusqu’à un million de jetons. Il convient donc aux larges bases de code, aux documents longs et aux workflows complexes nécessitant un important contexte. Les utilisateurs peuvent aussi choisir entre un effort de raisonnement faible, élevé ou maximal selon le temps à consacrer à la résolution d’une tâche.

DeepSeek-V4-Flash-0731 inclut également le décodage spéculatif DSpark. DSpark prépare plusieurs jetons avant que le modèle principal ne les valide, ce qui, selon DeepSeek, peut améliorer la vitesse de génération de 60 % à 85 % avec un moteur d’inférence compatible.

1. Configurer le Pod RunPod

Nous allons commencer par créer un environnement RunPod avec suffisamment de mémoire GPU et de stockage pour exécuter la version Q8 de DeepSeek-V4-Flash-0731 et héberger à la fois Unsloth Studio et le site généré par OpenCode.

Configurez le Pod avec :

  • 3× GPU NVIDIA A100 SXM 80 GB
  • Dernier template RunPod PyTorch
  • Au moins 250 Go de stockage en volume persistant
  • Au moins 50 Go de stockage pour le conteneur
  • /workspace comme chemin de montage du volume persistant
  • Un jeton d’accès Hugging Face ajouté en tant que HF_TOKEN
  • Ports HTTP 8910 et 9101 exposés

Modification du template Pytorch Runpod

Le port 8910 sera utilisé par Unsloth Studio et son API d’inférence locale. Le port 9101 hébergera le site interactif créé par OpenCode.

RunPod expose ces services via son proxy HTTP ; les deux applications doivent donc écouter sur 0.0.0.0 plutôt que sur 127.0.0.1 uniquement. 

Déploiement du pod 3x A100 sur Runpod

Après le déploiement du Pod, ouvrez l’onglet Connect, lancez JupyterLab et créez trois sessions terminal :

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Séparer les tâches dans différents terminaux facilite le suivi des GPU, le diagnostic du modèle et l’exécution de l’agent de code en parallèle.

2. Installer et lancer Unsloth Studio

Nous allons maintenant installer Unsloth Studio, configurer un cache Hugging Face persistant et lancer l’interface sur le port 8910.

Dans le Terminal 1, vérifiez que les trois GPU sont disponibles :

nvidia-smi

Vous devriez voir les trois GPU A100 listés sur le serveur Linux.

Résumé 3x A100 GPU

Créez un cache Hugging Face persistant dans /workspace afin que les modèles téléchargés restent disponibles sur le volume RunPod :

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Ensuite, installez les paquets systèmes requis et Unsloth Studio :

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Programme d’installation d’Unsloth Studio

L’installeur configure l’interface Studio, l’environnement Python, les dépendances et les composants d’inférence locale. 

La première installation peut prendre plusieurs minutes.

Programme d’installation d’Unsloth Studio

Lorsque l’installeur vous demande si vous souhaitez démarrer Unsloth Studio immédiatement, saisissez « n ».

Nous allons le lancer manuellement afin d’utiliser le port 8910 et d’écouter sur la bonne adresse réseau.

Redémarrez le shell pour rendre les nouvelles commandes disponibles :

exec bash
cd /workspace

Avant de lancer Studio, réinitialisez le mot de passe par défaut :

unsloth studio reset-password

Copiez le mot de passe temporaire affiché pendant la configuration, il pourra être nécessaire pour finaliser la réinitialisation.

Lancez maintenant Unsloth Studio :

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Démarrage d’Unsloth Studio

Studio devrait maintenant indiquer qu’il fonctionne sur le port 8910. Gardez le Terminal 1 ouvert pendant l’utilisation d’Unsloth Studio et d’OpenCode.

Revenez à la page Connect de RunPod et ouvrez le service HTTP pour le port 8910

Accès au tunnel Runpod d’Unsloth Studio

Utilisez le mot de passe temporaire généré précédemment pour finaliser la réinitialisation, puis connectez-vous avec le nouveau mot de passe que vous avez créé. 

Terminez ou ignorez l’onboarding et ouvrez la page Chat.

Menu Chat d’Unsloth Studio

3. Téléchargement et exécution de DeepSeek-V4-Flash-0731

Maintenant qu’Unsloth Studio fonctionne, nous pouvons télécharger le modèle Q8, le charger sur les trois GPU et tester ses capacités de conversation et d’usage d’outils.

Ouvrez le sélecteur de modèles en haut à gauche, recherchez unsloth/DeepSeek-V4-Flash-0731-GGUF puis choisissez la quantification Q8 UD-Q8_K_XL.

Téléchargement de la version Q8 du modèle Deepseek v4 flash dans Unsloth Studio

Nous utilisons Q8 car les trois GPU A100 offrent suffisamment de VRAM combinée. Cette option préserve une qualité proche du modèle d’origine, tandis que les quantifications plus basses sont plus adaptées lorsque la mémoire matérielle est limitée.

Une fois le téléchargement terminé, Unsloth Studio commencera automatiquement à charger le modèle en mémoire GPU. Cela peut prendre plusieurs minutes, la version Q8 étant très volumineuse.

Chargement du modèle Deepseek v4 flash dans Unsloth Studio

Après le chargement, utilisez la page Chat pour tester le modèle avec quelques invites simples. 

Dans nos tests, la génération a atteint environ 33 jetons par seconde sans décodage spéculatif, ce qui est raisonnable pour un modèle de cette taille.

Test du modèle Deepseek v4 flash dans Unsloth Studio

Vous pouvez également activer l’outil de recherche web de Studio et demander au modèle de consulter des informations récentes, comme les derniers cours de l’or et de l’argent. C’est une bonne façon de vérifier que le modèle sait appeler des outils externes au-delà de ses connaissances internes.

Test du modèle Deepseek v4 flash dans Unsloth Studio avec l’outil web

Dans le Terminal 2, vérifiez la répartition du modèle entre les GPU :

nvidia-smi

Résumé GPU du modèle Deepseek v4 flash Q8 chargé en mémoire GPU

Vous devriez constater une forte utilisation mémoire sur les trois GPU. 

Dans notre test, chaque GPU était rempli à environ 70 %. Cela ne signifie pas pour autant que l’intégralité du modèle Q8 tiendra confortablement sur seulement deux GPU de 80 Go, car il faut encore de la VRAM pour la fenêtre de contexte, le cache KV et les tampons d’inférence.

Enfin, testez le modèle avec l’invite de planification de l’application que nous allons construire :

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Le modèle renvoie un plan de développement structuré couvrant l’architecture, les composants, les flux de données, les bibliothèques de graphiques, les calculs financiers et la conception d’interface.

Test du modèle Deepseek v4 flash dans Unsloth Studio avec une invite complexe

4. Connecter DeepSeek-V4-Flash-0731 à OpenCode et créer le site

Maintenant que le modèle tourne dans Unsloth Studio, nous pouvons le connecter à OpenCode et l’utiliser comme agent de codage local.

Dans le Terminal 3, définissez l’URL de Studio :

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Créez un nouveau répertoire de projet :

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Démarrez OpenCode via Unsloth Studio :

unsloth start opencode

Lors de la première exécution, la commande demandera l’autorisation d’installer OpenCode. Saisissez « y ».

Installation et démarrage d’Opencode

Une fois l’installation terminée, OpenCode se lancera avec le modèle DeepSeek-V4-Flash-0731 local déjà configuré.

OpenCode intégré au modèle DeepSeek v4 Flash exécuté localement

Collez l’invite en deux lignes suivante dans OpenCode :

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

En quelques secondes, l’agent de code devrait créer une liste de tâches détaillée et commencer à dérouler le projet étape par étape.

Création d’un site interactif d’analyse boursière dans Opencode avec le serveur d’inférence Unsloth

L’ensemble de la construction a pris environ 20 minutes dans notre test. Pendant l’exécution, vous pouvez revenir dans Unsloth Studio et ouvrir la page de suivi de l’API dans Settings pour suivre l’usage du modèle et la vitesse de génération.

Nous avons observé une moyenne d’environ 22,6 jetons par seconde pendant le workflow de codage. La vitesse peut diminuer à mesure que la conversation et le contexte du projet s’étoffent.

Tableau de bord de suivi du serveur d’inférence Unsloth

Une fois les tâches terminées, OpenCode devrait fournir un récapitulatif des fichiers, fonctionnalités et commandes créés. Il devrait également démarrer le site finalisé sur le port 9101.

Récapitulatif du site interactif d’analyse boursière dans Opencode

Revenez à la page Connect de RunPod et ouvrez le service HTTP pour le port 9101.

Le résultat est étonnamment soigné. Le site est propre, animé et proche d’un tableau de bord de trading professionnel. Le modèle a mené à bien l’application web en un seul prompt, interface, vues de données, graphiques et navigation compris.

Test du site interactif d’analyse boursière créé avec DeepSeek-V4-Flash-0731

Vous pouvez sélectionner des tickers individuels pour afficher des chandeliers, la performance historique, des indicateurs et des informations complémentaires sur l’entreprise.

Test du site interactif d’analyse boursière créé avec DeepSeek-V4-Flash-0731

L’onglet Compare vous permet aussi de comparer plusieurs actions et d’identifier celles qui ont le mieux performé sur la période sélectionnée.

Test du site interactif d’analyse boursière créé avec DeepSeek-V4-Flash-0731

J’ai été sincèrement surpris qu’un modèle local plus petit puisse construire l’ensemble du site à partir d’un seul prompt. 

Après tests, toutes les fonctionnalités majeures ont fonctionné comme prévu, y compris les cours en direct, les données de marché historiques, les graphiques, les indicateurs et les outils de comparaison.

La vitesse à laquelle les modèles locaux progressent est remarquable, tout comme leur capacité à mener des développements complexes de bout en bout. 

Dernières réflexions

À mes yeux, DeepSeek-V4-Flash-0731 est le meilleur modèle local que j’aie testé à ce jour. 

Il a mieux performé qu’Inkling, la quantification GLM-5.2 en 2 bits et Qwen3.6-27B, qui était jusqu’alors mon favori. Cela repose sur mon expérience plutôt que sur un benchmark formel, mais c’est désormais mon modèle local préféré.

Pour la plupart des charges de travail, je commencerais tout de même par l’API officielle de DeepSeek, car elle est extrêmement abordable. 

V4 Flash coûte actuellement 0,14 $ par million de jetons d’entrée non mis en cache, 0,0028 $ par million de jetons d’entrée mis en cache et 0,28 $ par million de jetons de sortie. À ce tarif, un milliard de jetons d’entrée mis en cache coûterait environ 2,80 $, hors coûts de sortie.

Avant d’opter pour Unsloth Studio, j’ai tenté d’exécuter le modèle via llama.cpp. L’installeur précompilé ne fournissait pas de binaire CUDA récent compatible avec mon environnement et, même après compilation de la dernière version depuis les sources, j’ai rencontré d’autres problèmes en activant le décodage spéculatif DSpark.

Unsloth Studio s’est finalement avéré être la solution la plus simple, en supprimant la plupart des configurations manuelles. Il a très bien fonctionné avec OpenCode, même si la construction complète de l’application a pris environ 20 minutes.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

En tant que data scientist certifié, je suis passionné par l'utilisation des technologies de pointe pour créer des applications innovantes d'apprentissage automatique. Avec une solide expérience en reconnaissance vocale, en analyse de données et en reporting, en MLOps, en IA conversationnelle et en NLP, j'ai affiné mes compétences dans le développement de systèmes intelligents qui peuvent avoir un impact réel. En plus de mon expertise technique, je suis également un communicateur compétent, doué pour distiller des concepts complexes dans un langage clair et concis. En conséquence, je suis devenu un blogueur recherché dans le domaine de la science des données, partageant mes idées et mes expériences avec une communauté grandissante de professionnels des données. Actuellement, je me concentre sur la création et l'édition de contenu, en travaillant avec de grands modèles linguistiques pour développer un contenu puissant et attrayant qui peut aider les entreprises et les particuliers à tirer le meilleur parti de leurs données.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Meilleures formations DataCamp

Cours

Coder avec l’aide de l’IA pour les développeurs

1 h 30 min
9.9K
Améliorez vos compétences en codage grâce à l'IA : guidez votre assistant de codage pour qu'il écrive, teste et documente efficacement le code.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow
Contenus associés

blog

Comprendre les TPU et les GPU dans l'IA : Un guide complet

L'essor du développement de l'intelligence artificielle (IA) a entraîné une augmentation notable de la demande en matière de calcul, d'où la nécessité de disposer de solutions matérielles robustes. Les unités de traitement graphique (GPU) et les unités de traitement tensoriel (TPU) sont devenues des technologies essentielles pour répondre à ces demandes.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

blog

ROI de l'IA en 2026 : pourquoi les compétences des équipes déterminent le retour sur investissement

Seuls 21 % des dirigeants font état d'un retour sur investissement « significatif » de leurs investissements dans l'IA.
Lynn Heidmann's photo

Lynn Heidmann

blog

Architecture de l'entrepôt de données : Tendances, outils et techniques

Apprenez l'essentiel de l'architecture d'un entrepôt de données, des composants clés aux meilleures pratiques, pour construire un système de données évolutif et efficace !
Kurtis Pykes 's photo

Kurtis Pykes

15 min

blog

Célébration de Saghar Hazinyar : Une boursière de DataCamp Donates et une diplômée de Code to Inspire

Découvrez le parcours inspirant de Saghar Hazinyar, diplômée de Code to Inspire, qui a surmonté les défis en Afghanistan et s'est épanouie grâce à une bourse de DataCamp Donates.
Fereshteh Forough's photo

Fereshteh Forough

4 min

blog

Types d'agents d'intelligence artificielle : Comprendre leurs rôles, leurs structures et leurs applications

Découvrez les principaux types d'agents d'intelligence artificielle, comment ils interagissent avec les environnements et comment ils sont utilisés dans les différents secteurs d'activité. Comprendre les agents réflexes simples, les agents basés sur un modèle, les agents basés sur un but, les agents basés sur l'utilité, les agents d'apprentissage, etc.
cursor ai code editor

Tutoriel

Cursor AI : Un guide avec 10 exemples pratiques

Apprenez à installer Cursor AI sur Windows, macOS et Linux, et découvrez comment l'utiliser à travers 10 cas d'utilisation différents.
Voir PlusVoir Plus