Accéder au contenu principal

DeepSeek V4.1 Flash vs Gemini 3.8 Flash : benchmarks, prix et cas d'usage

Les poids ouverts de DeepSeek V4.1 Flash égalent Gemini 3.8 Flash sur les benchmarks agentiques de code pour un tiers du prix. Nous comparons spécs, coûts et un test de build pratique.
Actualisé 17 sept. 2026  · 14 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, sa troisième version Flash en six semaines. Huit jours plus tard, DeepSeek a répondu avec DeepSeek V4.1 Flash, un modèle mixture-of-experts de 552B sous licence MIT qui active 8B de paramètres en entrée et 16B en sortie.

Les deux éditeurs présentent leur modèle comme un cheval de bataille pour les agents de code et affichent des scores proches sur les benchmarks les plus importants. Le choix est donc plus nuancé que l'habituel débat open vs. closed : le modèle le moins cher n'est pas le plus faible sur les tests que les deux partagent.

Dans cet article, je compare DeepSeek V4.1 Flash et Gemini 3.8 Flash : benchmarks, tarification, ouverture, multimodalité, et un test de build pratique exécuté sur les deux.

Pour un portrait détaillé de chaque modèle, consultez notre guide DeepSeek V4.1 Flash et notre guide Gemini 3.8 Flash et 3.8 Flash Cyber.

En bref

  • DeepSeek V4.1 Flash égale ou devance Gemini 3.8 Flash sur tous les benchmarks d'agent de code publiés par les deux éditeurs, et a remporté notre test pratique de scheduler en deux fois moins d'échanges.
  • Gemini 3.8 Flash coûte aujourd'hui 2,5 fois plus par jeton d'entrée et 3,1 fois plus par jeton de sortie, et son prix double le 1er janvier 2027.
  • Gemini 3.8 Flash est plus polyvalent : il accepte l'audio, la vidéo et les PDF, et s'accompagne des outils hébergés de Google.
  • Choisissez DeepSeek V4.1 Flash pour des agents de code à fort volume, des jobs batch, des boucles très cacheées, ou tout ce que vous devez auto-héberger.
  • Choisissez Gemini 3.8 Flash si vos entrées sont multimodales, si vous développez dans Google AI Studio ou Antigravity, ou si vous avez besoin d'agents de connaissance avec scores sectoriels publiés.

Qu'est-ce que DeepSeek V4.1 Flash ?

DeepSeek V4.1 Flash est un modèle open-weight, sous licence MIT, de type mixture-of-experts, publié par DeepSeek le 10 septembre 2026, et le plus petit membre d'une nouvelle famille d'architectures.

Selon le rapport technique V4.1, son cache KV requiert 890 octets par jeton, soit environ un quart de DeepSeek V4 Flash, ce qui explique l'essentiel des économies.

Pour une analyse complète, lisez notre guide DeepSeek V4.1 Flash, et pour une mise en place locale de la génération précédente, notre tutoriel sur l'exécution de DeepSeek V4 Flash avec Unsloth Studio et OpenCode.

Qu'est-ce que Gemini 3.8 Flash ?

Gemini 3.8 Flash est le modèle le plus performant de la gamme Flash de Google, publié le 2 septembre 2026, trois semaines après Gemini 3.7 Flash, dont il est l'évolution.

Son choix de conception clef est de « travailler plus » : sur les tâches complexes, il exécute des étapes de raisonnement supplémentaires et appelle des outils de façon itérative ; Google indique qu'il peut consommer davantage de jetons à des niveaux d'effort plus élevés.

Notre guide Gemini 3.8 Flash couvre le lancement et la variante Cyber à accès limité, et notre tutoriel API Gemini 3.8 Flash détaille l'Interactions API, les niveaux de raisonnement et les appels de fonctions en Python.

DeepSeek V4.1 Flash vs Gemini 3.8 Flash : comparaison directe

Sur les six dimensions ci-dessous, DeepSeek V4.1 Flash gagne sur le prix et l'ouverture et fait jeu égal en codage, tandis que Gemini 3.8 Flash l'emporte sur les types d'entrée, l'outillage et les résultats publiés pour les tâches de connaissance.

DeepSeek V4.1 Flash égale Gemini 3.8 Flash en codage pour un tiers du prix

Fonction DeepSeek V4.1 Flash Gemini 3.8 Flash
Sortie 10 septembre 2026 2 septembre 2026
Poids et licence Ouverts, MIT Fermés, hébergés
Architecture MoE 552B, 8B actifs en pré-remplissage, 16B en décodage Non divulguée ; basée sur Gemini 3.7 Flash
Contexte / sortie max 1M de jetons / 384K 1M de jetons / 64K
Types d'entrée Texte, image Texte, image, vidéo, audio, PDF
Terminal-Bench 2.1 90,6 % 89,4 %
DeepSWE v1.1 74,2 % 73,7 %
Niveaux d'effort de raisonnement low, high, max sur l'API (entier 1–100 en interne) low, medium, high
Prix API, entrée / sortie par 1M 0,30 $ / 1,20 $ (heures pleines) 0,75 $ / 3,75 $ (jusqu'en 2026 ; ensuite x2)

Codage et workflows agentiques

DeepSeek V4.1 Flash mène sur les trois benchmarks d'agents présents dans les deux tableaux éditeurs, même si deux écarts sont assez faibles pour parler d'égalité.

L'écart qui compte vraiment est Terminal-Bench 4.0, la suite généraliste la plus dure : 31,2 % pour DeepSeek contre 19,1 % pour Gemini. Les deux admettent que cette suite les met en difficulté ; DeepSeek indique qu'un écart subsiste face aux très grands modèles sur des tâches scientifiques, et le propre tableau de Google place Claude Opus 5 à 51,8 %.

Benchmark DeepSeek V4.1 Flash Gemini 3.8 Flash Notes
Terminal-Bench 2.1 90,6 % 89,4 % Mesurés par les éditeurs ; les deux tableaux placent Claude Opus 5 à 89,1 %
DeepSWE v1.1 74,2 % 73,7 % Mesurés par les éditeurs ; les deux tableaux placent Claude Opus 5 à 74,0 %
Terminal-Bench 4.0 31,2 % 19,1 % Suite partagée la plus difficile ; Opus 5 à 51,8 % dans les deux tableaux

Deux bémols :

  • Les scores de DeepSeek sont à son palier d'effort maximal, que le rapport technique estime à environ 2,5 fois les jetons de sortie d'un réglage bas. Le même rapport note que des efforts de 60 à 80 récupèrent l'essentiel de la précision pour moins de la moitié des jetons : réservez le max aux tâches difficiles.
  • Les harnais diffèrent, mais les colonnes rivales s'alignent presque exactement ; ces tableaux sont donc plus comparables que la plupart des paires inter-éditeurs.

Pour des agents de code très orientés terminal, considérez-les à égalité et laissez le prix et le déploiement trancher ; sur les tâches d'agents les plus dures, l'avantage publié de DeepSeek est le seul différenciateur.

Tarifs : ce que vous payez vraiment

La tarification est la seule dimension sans débat ; la vraie question est l'ampleur de l'écart selon le profil de votre charge.

Gemini 3.8 Flash coûte de 2,8x à 4,5x plus que DeepSeek V4.1 Flash sur toutes les formes de charge

DeepSeek V4.1 Flash est moins cher sur toute la ligne, et l'écart s'accentue si votre charge s'appuie davantage sur les jetons de sortie ou les préfixes mis en cache. Le multiple n'est pas uniforme : 2,5x en entrée, 3,1x en sortie et 12,5x en lectures cache.

Tarifs par type de jeton

Tarif DeepSeek V4.1 Flash (heures pleines) Gemini 3.8 Flash (jusqu'au 31 déc. 2026)
Entrée, par 1M de jetons 0,30 $ 0,75 $
Sortie, par 1M de jetons 1,20 $ 3,75 $
Lecture d'entrée en cache, par 1M de jetons 0,006 $ 0,075 $, plus 0,50 $ par 1M de jetons et par heure de stockage
Voie de remise Heures creuses : −50 % en dehors de 01 h–04 h et 06 h–10 h UTC en semaine Batch ou Flex : −50 % (0,375 $ / 1,875 $)
Jetons de raisonnement facturés comme Sortie Sortie
Au 1er janvier 2027 Aucun changement annoncé 1,50 $ / 7,50 $ ; lecture cache 0,15 $

La différence ressemble à une prime sur la sortie. Le tarif de sortie de Gemini est 3,1 fois celui de DeepSeek, contre 2,5 fois sur l'entrée ; les charges gourmandes en génération et en raisonnement paient donc le plus, et les deux facturent les jetons de raisonnement au tarif sortie.

Combien coûte une charge réelle

Charge DeepSeek V4.1 Flash Gemini 3.8 Flash Différence
Assistant équilibré : 1M entrée / 250K sortie 0,60 $ 1,69 $ 1,09 $ ; Gemini +181 %
Génération intensive : 1M entrée / 4M sortie 5,10 $ 15,75 $ 10,65 $ ; Gemini +209 %
Boucle très cacheée : préfixe 100K écrit une fois, 1 000 lectures cache, + 5K entrées / 1K sorties par requête 3,33 $ 15,13 $ 11,80 $ ; Gemini +354 %

Formule : (volume ÷ 1M) × tarif, sommé sur entrée et sortie, avec les tarifs heures pleines de DeepSeek et les tarifs d'introduction de Gemini. La ligne « très cacheée » utilise le tarif de lecture cache de chaque éditeur pour les 1 000 lectures et suppose que le cache Gemini est conservé 1 heure, ajoutant 0,05 $ de stockage.

C'est la ligne à retenir : le tarif de lecture cache à 0,006 $ de DeepSeek rend presque gratuit la relecture d'un préfixe de 100K jetons, tandis que Gemini facture 7,50 $ pour les mêmes 100M de jetons lus en cache.

Planifiez DeepSeek en heures creuses et chaque ligne est divisée par deux ; attendez janvier et chaque ligne Gemini double : l'assistant équilibré devient 3,38 $ contre 0,60 $.

Ouverture, architecture et déploiement

DeepSeek V4.1 Flash est le seul des deux que vous pouvez télécharger, et son architecture explique son coût réduit. Le rapport technique décrit un encodeur causal de 20 couches alimentant un décodeur de 20 couches, Compressed Sparse Attention 2 avec cache KV en FP4, et un cache KV de 890 octets par jeton, contre 3 514 octets pour V4 Flash.

La mise en service de ces poids sous licence MIT en est encore à ses débuts : prise en charge vLLM et SGLang dans des versions nightly et preview, et Transformers pas encore supporté.

Si vous avez des exigences de résidence des données, d'inférence on-prem ou de fine-tuning, DeepSeek est votre seule option ici. Si vous voulez zéro infrastructure, l'endpoint hébergé GA de Gemini est le chemin le plus simple.

Multimodalité, contexte et outils intégrés

Gemini 3.8 Flash accepte texte, images, vidéos, audio et PDF, tandis que DeepSeek V4.1 Flash accepte texte et images. Les deux offrent une fenêtre de contexte de 1M de jetons, mais DeepSeek permet jusqu'à 384K jetons de sortie, contre 64K pour Gemini, ce qui compte pour la génération de code longue et les réécritures intégrales de documents.

La page du modèle Gemini liste aussi des outils hébergés sans équivalent chez DeepSeek : exécution de code, ancrage à Google Search et Maps, recherche de fichiers, contexte via URL, et contrôle de l'ordinateur en preview. Côté API DeepSeek : sortie JSON, appels d'outils, Responses API, endpoint au format Anthropic, complétion par préfixe et fill-in-the-middle.

Si vos entrées incluent audio ou vidéo, ou si vous voulez de l'ancrage sans construire de retrieval, choisissez Gemini ; si vous avez besoin de sorties très longues et d'une compatibilité plug-and-play avec les clients OpenAI ou Anthropic, c'est DeepSeek.

Performances de DeepSeek V4.1 Flash et Gemini 3.8 Flash

Les benchmarks de deux éditeurs différents ont leurs limites, donc j'ai exécuté une tâche de build identique sur les deux modèles, avec le même prompt et le même outillage.

Le test

Je leur ai demandé de construire une application web monofichier avec état pour planifier les répétitions d'un orchestre amateur. Deux exigences explicites : détection de conflits par chevauchement d'intervalles et persistance. Les deux modèles frôlent 90 % sur Terminal-Bench 2.1, mais les 31,2 % de DeepSeek contre 19,1 % de Gemini sur Terminal-Bench 4.0 laissent envisager un écart en agentique plus dure ; cette tâche est un moyen compact de le détecter.

Les deux ont tourné dans OpenCode avec une surface d'outils identique et figée : lecture et édition de fichiers uniquement, pas de shell ni de réseau. Les deux à l'effort de raisonnement high, une tentative chacun, sans retry, prompt identique transmis à une session neuve.

Une asymétrie à garder en tête : high est le palier d'effort maximal de Gemini, alors que chez DeepSeek, il correspond à 75 sur une échelle 1–100, dont le maximum sert aux scores de benchmark publiés.

Voici le prompt :

Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra. 
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.

Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome). 
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.

J'ai noté les deux sur l'exécutabilité (échec/succès) et sur trois critères, scores de 1 à 5 :

  • Respect du cahier des charges : toutes les fonctionnalités demandées sont-elles présentes ?
  • Logique de conflit : détecte et affiche-t-elle correctement les chevauchements, tout en traitant les réservations adjacentes ou dans des salles différentes comme non conflictuelles ?
  • Ergonomie et mise en page : tient-elle sur une page, est-elle intuitive et esthétique ?

Ce que DeepSeek V4.1 Flash a produit

DeepSeek a terminé en 2 tours avec un seul appel d'outil : écriture d'un index.html de 13 Ko et fin. Page sombre à deux panneaux : à gauche, le formulaire d'ajout ; à droite, la grille lundi–dimanche ; en dessous, un panneau de vérification des conflits. Le commentaire d'en-tête énonce la règle de chevauchement : chevauchement strict, les enchaînements dos-à-dos sont exclus ; la sonde confirme qu'il ne signale que la paire qui se chevauche.

Planificateur de répétitions DeepSeek V4.1 Flash après ajout : drapeaux de chevauchement, semaine préchargée avec conflit de salle le jeudi, et réservations adjacentes et différentes salles le lundi.

Toutes les demandes sont présentes et fonctionnent, la mise en page se lit d'un coup d'œil, et l'extra non demandé (suppression d'entrées) est utile. Pas d'édition d'entrée, non demandée non plus. Un 5 net sur les trois axes.

Ce que Gemini 3.8 Flash a produit

Gemini a pris 4 tours et 3 appels d'outils (glob, read, puis write) pour livrer un index.html de 76 Ko (presque 6 fois DeepSeek), bien plus lent. Le rendu est plus poli : en-tête brandé avec compteur de chevauchements en direct, semaine d'exemple préchargée avec double réservation volontaire le mercredi pour afficher immédiatement l'indicateur, filtres par section et salle, bascule « conflits uniquement », vues colonnes et chronologique, édition et suppression, champ notes de répertoire, et avertissement en direct pendant la saisie.

Planificateur Gemini 3.8 Flash au chargement : en-tête Sinfonia avec indicateurs, semaine préchargée avec conflit le mercredi, filtres et panneau Sections et équilibre

La logique de conflit est correcte, et la sonde ne signale que la paire en chevauchement. Le problème vient des extras : un panneau « Sections et équilibre » avec des compteurs par section force le défilement de la colonne formulaire (contraire au prompt) et tranche avec le reste ; la profusion de contrôles nuit à la lisibilité de la semaine par rapport à DeepSeek. D'où un point en moins sur le respect du cahier et sur la mise en page, malgré un résultat globalement très bon.

Résultats

Mesure DeepSeek V4.1 Flash Gemini 3.8 Flash
Tours 2 4
Appels d'outils 1 3
Exécutabilité succès succès
Respect du cahier des charges 5 4
Logique de conflit 5 5
Ergonomie et mise en page 5 4
Score (moyenne des trois axes) 5,0 4,3

DeepSeek V4.1 Flash remporte ce test. Les deux réussissent la partie difficile : la logique de chevauchement d'intervalles. La différence tient au jugement : DeepSeek a construit ce qui était demandé en un écrit, tandis que Gemini a construit un petit produit, et une fonctionnalité non demandée a dégradé la mise en page évaluée. La version Gemini est celle que je démontrerais à un manager d'orchestre ; celle de DeepSeek est celle que je préférerais recevoir d'un collègue.

Ce n'est qu'une exécution unique d'une tâche, à un niveau d'effort ; cela ne dit rien des jetons consommés ni du coût, et ne sonde que l'UI avec état et la logique de chevauchement, pas le travail sur de longs horizons dans des dépôts.

Quand choisir DeepSeek V4.1 Flash ou Gemini 3.8 Flash

Aucun modèle n'est le choix par défaut pour tous ; voilà comment décider selon votre charge.

Choisir selon la charge : DeepSeek V4.1 Flash pour le coût et le contrôle, Gemini 3.8 Flash pour la multimodalité et les outils hébergés

Le choix se joue sur les entrées, l'infrastructure et le budget : les deux sont à niveau en agentique de code, donc DeepSeek gagne dès que le coût ou le contrôle priment, et Gemini gagne dès que vos données ou votre stack exigent ce que DeepSeek ne peut ni ingérer ni héberger pour vous.

Choisissez DeepSeek V4.1 Flash si ...

  • Vous exécutez des agents de code à grande échelle. À niveau avec Gemini sur Terminal-Bench 2.1 et DeepSWE v1.1, devant sur Terminal-Bench 4.0, et facture 1,20 $ plutôt que 3,75 $ par 1M de jetons de sortie.
  • Votre boucle d'agent relit un grand préfixe. Lecture cache : 0,006 $ par 1M de jetons contre 0,075 $ chez Gemini plus stockage horaire ; un écart de 12,5x qui a dominé notre scénario très cacheé.
  • Vous devez auto-héberger ou affiner, et vous avez le matériel pour. Poids MIT exploitables avec vLLM et SGLang via images nightly/preview, mais le checkpoint fait ≈ 511 Go, et les layouts vérifiés sont un tiroir GB200 NVL4 ou un nœud 8×H200.
  • Vous pouvez planifier en heures creuses ou avez besoin de sorties très longues. Les heures creuses divisent tous les tarifs par deux, et le plafond de 384K jetons de sortie est 6 fois celui de Gemini (64K).

Choisissez Gemini 3.8 Flash si ...

  • Vos entrées incluent audio, vidéo ou PDF. DeepSeek V4.1 Flash accepte uniquement texte et images.
  • Vous voulez des outils hébergés sans les construire. Exécution de code, ancrage Google Search et Maps, recherche de fichiers, contexte via URL et contrôle de l'ordinateur disponibles sous le même ID.
  • Vous développez dans l'écosystème Google. GA dans AI Studio et Gemini Enterprise, et modèle par défaut dans Antigravity.
  • Vous avez besoin d'agents de connaissance avec preuves publiées. Google annonce 61,4 % sur Vals Finance Agent v2 et 10,0 % sur le benchmark juridique de Harvey ; DeepSeek ne publie rien de comparable.

Comment démarrer avec DeepSeek V4.1 Flash et Gemini 3.8 Flash

Les surfaces d'accès diffèrent plus que les capacités ; vérifiez la matrice avant les benchmarks.

Surface DeepSeek V4.1 Flash Gemini 3.8 Flash
Appli grand public DeepSeek app et chat.deepseek.com Appli Gemini (Google AI Pro et Ultra), mode IA dans Search, Gemini dans Sheets
API propriétaire Oui, DeepSeek API (formats de requêtes OpenAI et Anthropic) Oui, Gemini API via Google AI Studio (GA)
Plateformes cloud Pas de listing cloud premier parti ; servi par Databricks et autres, ou auto-hébergez les poids MIT Gemini Enterprise sur Google Cloud
Agents de code DeepSeek Harness ; OpenCode, WorkBuddy et CodeBuddy (partenaires officiels) Google Antigravity (modèle par défaut), Android Studio, Stitch ; Cursor, OpenCode
Routeurs tiers OpenRouter OpenRouter
ID de modèle API deepseek-flash gemini-3.8-flash

La plus grande différence de disponibilité : DeepSeek est téléchargeable et Gemini non, tandis que Gemini dispose d'une application grand public et d'une plateforme entreprise managée. Les IDs à utiliser sont deepseek-flash et gemini-3.8-flash ; l'ancien deepseek-v4-flash résout encore mais pointe sur V4.1 Flash.

Faire votre premier appel API

Les SDK diffèrent, ce n'est donc pas un simple remplacement de chaîne. L'endpoint de DeepSeek est compatible OpenAI, donc le client standard openai fonctionne avec un changement d'URL de base, tandis que Gemini 3.8 Flash utilise l'Interactions API de google-genai avec un réglage thinking_level au lieu de paramètres d'échantillonnage.

from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
    model="deepseek-flash",  # DeepSeek V4.1 Flash
    messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai

client = genai.Client()  # reads your Google AI Studio API key
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Refactor this function...",
    generation_config={"thinking_level": "medium"},  # low, medium, or high
)
print(interaction.output_text)

Pour l'installation complète, l'extraction de PDF et les appels de fonctions sur Gemini, suivez notre tutoriel API Gemini 3.8 Flash ; pour le mode raisonnement de DeepSeek et un déploiement local de la génération précédente, consultez notre tutoriel DeepSeek V4 API et notre guide sur l'exécution de DeepSeek V4 Flash avec Unsloth Studio et OpenCode.

Pour conclure

Si votre charge concerne des agents de code, des jobs batch ou des boucles qui relisent de longs préfixes, utilisez DeepSeek V4.1 Flash : à niveau avec Gemini 3.8 Flash sur les benchmarks agentiques publiés, vainqueur de notre test de build en 2 tours, et coûte un tiers du prix avant la hausse de janvier chez Gemini. Si vos entrées sont audio, vidéo ou PDF, ou si vous voulez ancrage, exécution de code et contrôle d'ordinateur depuis un endpoint hébergé unique, utilisez Gemini 3.8 Flash et acceptez la prime.

Pour bâtir des systèmes d'agents autour de tels modèles, notre parcours Associate AI Engineer for Developers couvre APIs, usage d'outils et Model Context Protocol en 29 heures, et notre cours Building AI Agents with Google ADK est une mise en route d'1 heure côté Gemini.

FAQs

DeepSeek V4.1 Flash est-il meilleur que Gemini 3.8 Flash pour coder ?

Sur les benchmarks d'agent de code publiés par les deux éditeurs, ils sont à niveau ou DeepSeek V4.1 Flash est légèrement devant : 90,6 % vs 89,4 % sur Terminal-Bench 2.1, 74,2 % vs 73,7 % sur DeepSWE v1.1, et 31,2 % vs 19,1 % sur Terminal-Bench 4.0. Dans notre build pratique de scheduler, DeepSeek a obtenu 5/5/5 en 2 tours et Gemini 4/5/4 en 4 tours. Les deux séries de scores sont produites par les éditeurs.

De combien DeepSeek V4.1 Flash est-il moins cher que Gemini 3.8 Flash ?

DeepSeek V4.1 Flash coûte 0,30 $ par 1M de jetons d'entrée et 1,20 $ par 1M de jetons de sortie en heures pleines, et la moitié en heures creuses. Gemini 3.8 Flash coûte 0,75 $ et 3,75 $ jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $ à partir du 1er janvier 2027. Soit Gemini à 2,5 fois plus en entrée et 3,1 fois plus en sortie aujourd'hui, et 5x et 6,25x l'an prochain.

Puis-je auto-héberger DeepSeek V4.1 Flash ou Gemini 3.8 Flash ?

Vous ne pouvez auto-héberger que DeepSeek V4.1 Flash. Ses poids sont publiés sur Hugging Face sous licence MIT, et vLLM et SGLang peuvent déjà les servir depuis des images Docker nightly et preview respectivement, même si aucun ne le supporte encore en version stable, et la prise en charge Transformers reste en PR ouverte. Prévoyez un nœud complet : le checkpoint pèse environ 511 Go sur 48 shards, et la recette vLLM fixe un minimum de 614 Go de VRAM.

Quels sont les IDs de modèle API pour DeepSeek V4.1 Flash et Gemini 3.8 Flash ?

DeepSeek V4.1 Flash est deepseek-flash sur l'API DeepSeek, qui accepte les requêtes au format OpenAI via https://api.deepseek.com et au format Anthropic via https://api.deepseek.com/anthropic. Gemini 3.8 Flash est gemini-3.8-flash sur l'API Gemini. Les deux sont également listés sur OpenRouter.

Quel modèle gère l'audio, la vidéo et les PDF : DeepSeek V4.1 Flash ou Gemini 3.8 Flash ?

Gemini 3.8 Flash accepte texte, image, vidéo, audio et PDF et ajoute des outils hébergés comme l'exécution de code, l'ancrage à Google Search et l'usage de l'ordinateur en preview. DeepSeek V4.1 Flash accepte texte et images uniquement, mais permet jusqu'à 384K jetons de sortie contre 64K pour Gemini, et les deux offrent une fenêtre de 1M de jetons.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Rédacteur en chef Data Science chez DataCamp | Je suis passionné par la prévision et le développement à l'aide d'API.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Formez-vous à l'IA avec DataCamp !

Cursus

Principes fondamentaux des agents IA

6 h
Découvrez comment les agents IA peuvent transformer votre façon de travailler et créer de la valeur pour votre organisation !
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow