Ga naar hoofdinhoud

DeepSeek V4.1 Flash vs Gemini 3.8 Flash: Benchmarks, prijzen en wanneer je welke gebruikt

DeepSeek’s open-weight V4.1 Flash evenaart Gemini 3.8 Flash op agentische code-benchmarks voor een derde van de prijs. We vergelijken specs, kosten en een praktische buildtest.
Bijgewerkt 17 sep 2026  · 14 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

Google bracht op 2 september 2026 Gemini 3.8 Flash uit, de derde Flash-release in zes weken. Acht dagen later antwoordde DeepSeek met DeepSeek V4.1 Flash, een MIT-gelicentieerd 552B mixture-of-experts-model dat 8B parameters activeert op input en 16B op output.

Beide aanbieders noemen hun model een werkpaard voor code-agents en halen vergelijkbare scores op de belangrijkste benchmarks. Dat maakt de keuze lastiger dan het gebruikelijke open-versus-gesloten frame suggereert, omdat het goedkopere model niet het zwakkere is op de gedeelde benchmarks.

In dit artikel vergelijk ik DeepSeek V4.1 Flash en Gemini 3.8 Flash op benchmarks, prijs, openheid, multimodaliteit en in een praktische buildtest die ik op beide draaide.

Voor diepere coverage van elk model afzonderlijk, zie onze DeepSeek V4.1 Flash-gids en onze Gemini 3.8 Flash- en 3.8 Flash Cyber-gids.

TL;DR

  • DeepSeek V4.1 Flash evenaart of overtreft Gemini 3.8 Flash op elke agentische code-benchmark die beide aanbieders publiceren, en won onze praktische scheduler-test in de helft van het aantal turns.
  • Gemini 3.8 Flash kost nu 2,5x meer per inputtoken en 3,1x meer per outputtoken, en de prijs verdubbelt op 1 januari 2027.
  • Gemini 3.8 Flash is breder: accepteert audio-, video- en PDF-input en wordt geleverd met Google's gehoste tools.
  • Kies DeepSeek V4.1 Flash voor grootschalige code-agents, batch-jobs, cache-zware loops of alles wat je zelf wilt hosten.
  • Kies Gemini 3.8 Flash als je input multimodaal is, als je bouwt binnen Google AI Studio of Antigravity, of als je kenniswerk-agents nodig hebt met gepubliceerde domeinscores.

Wat is DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash is een open-weight, MIT-gelicentieerd mixture-of-experts-model, uitgebracht door DeepSeek op 10 september 2026, en het kleinste lid van een nieuwe architectuurfamilie.

Volgens het V4.1-technisch rapport heeft de KV-cache 890 bytes per token nodig, ongeveer een kwart van wat DeepSeek V4 Flash nodig had; daar komt het grootste deel van de kostenbesparing vandaan.

Voor de volledige uiteenzetting, lees onze DeepSeek V4.1 Flash-gids, en voor een lokale setup van de vorige generatie, onze tutorial over DeepSeek V4 Flash draaien met Unsloth Studio en OpenCode.

Wat is Gemini 3.8 Flash?

Gemini 3.8 Flash is Google’s capabelste Flash-tier-model, uitgebracht op 2 september 2026, drie weken na Gemini 3.7 Flash en erop voortbouwend.

De bepalende ontwerpkeuze is dat het "harder werkt": bij complexe taken voert het extra redeneerstappen uit en roept het tools iteratief aan, en Google zegt dat het bij hogere inspanningsniveaus meer tokens kan besteden.

Onze Gemini 3.8 Flash-gids behandelt de lancering en de variant Cyber met beperkte toegang, en onze Gemini 3.8 Flash API-tutorial loopt door de Interactions API, denklevels en function calling in Python.

DeepSeek V4.1 Flash vs Gemini 3.8 Flash: rechtstreekse vergelijking

Over de zes dimensies hieronder wint DeepSeek V4.1 Flash op prijs en openheid en speelt gelijk op coding, terwijl Gemini 3.8 Flash wint op inputtypen, tooling en gepubliceerde resultaten voor kenniswerk.

DeepSeek V4.1 Flash evenaart Gemini 3.8 Flash op coding voor een derde van de prijs

Kenmerk DeepSeek V4.1 Flash Gemini 3.8 Flash
Release 10 september 2026 2 september 2026
Gewichten en licentie Open, MIT Gesloten, gehost
Architectuur 552B MoE, 8B actief op prefill, 16B op decode Niet bekendgemaakt; gebaseerd op Gemini 3.7 Flash
Context / max output 1M tokens / 384K 1M tokens / 64K
Inputtypen Tekst, afbeelding Tekst, afbeelding, video, audio, PDF
Terminal-Bench 2.1 90,6% 89,4%
DeepSWE v1.1 74,2% 73,7%
Instellingen redeneerinspanning low, high, max op de API (onderliggend geheel getal 1-100) low, medium, high
API-prijs, input / output per 1M $0,30 / $1,20 (piek) $0,75 / $3,75 (tot en met 2026; daarna 2x)

Coding en agentische workflows

DeepSeek V4.1 Flash leidt op alle drie de agentische benchmarks die in beide tabellen voorkomen, al zijn twee van de verschillen klein genoeg om als gelijkspel te tellen.

Het gat dat echt telt is Terminal-Bench 4.0, de moeilijkere general-agent-suite: 31,2% voor DeepSeek tegenover 19,1% voor Gemini. Beide aanbieders geven toe dat deze suite ze blootlegt; DeepSeek zegt dat er een kloof met gigantische modellen blijft bij wetenschap-georiënteerde agenttaken, en Google’s eigen tabel zet Claude Opus 5 op 51,8%.

Benchmark DeepSeek V4.1 Flash Gemini 3.8 Flash Notities
Terminal-Bench 2.1 90,6% 89,4% Beide door de aanbieder gerund; beide tabellen zetten Claude Opus 5 op 89,1%
DeepSWE v1.1 74,2% 73,7% Beide door de aanbieder gerund; beide tabellen zetten Claude Opus 5 op 74,0%
Terminal-Bench 4.0 31,2% 19,1% Moeilijkste gedeelde suite; Opus 5 op 51,8% in beide tabellen

Twee kanttekeningen:

  • DeepSeek’s scores zijn op de maximale inspanningsstand, die volgens het technisch rapport ruwweg 2,5x de outputtokens van een lage stand kost. Datzelfde rapport merkt op dat inspanningen van 60 tot 80 het meeste van die nauwkeurigheid terugwinnen met ruim onder de helft van de tokens, dus max is het beste te bewaren voor moeilijke taken.
  • De harnesses verschillen, maar de rivaliserende kolommen komen bijna exact overeen, dus deze tabellen zijn dichter bij vergelijkbaar dan de meeste cross-vendor-paren.

Voor terminal-zware code-agents kun je de twee als gelijk behandelen en prijs en deployment laten beslissen; op de moeilijkste agenttaken is DeepSeek’s gepubliceerde voorsprong de enige op het bord.

Prijzen: wat je daadwerkelijk betaalt

Prijs is de ene dimensie zonder discussie, dus de interessante vraag is hoeveel het gat verandert met de vorm van je workload.

Gemini 3.8 Flash kost 2,8x tot 4,5x meer dan DeepSeek V4.1 Flash bij elke workloadvorm

DeepSeek V4.1 Flash is op elke regel goedkoper, en het gat wordt groter naarmate je workload leunt op outputtokens of gecachete prefixes. De factor is niet uniform, en dát is de bevinding: 2,5x op input, 3,1x op output en 12,5x op cached reads.

Token-tarieven naast elkaar

Tarief DeepSeek V4.1 Flash (piek) Gemini 3.8 Flash (t/m 31 dec 2026)
Input, per 1M tokens $0,30 $0,75
Output, per 1M tokens $1,20 $3,75
Gecachete inputread, per 1M tokens $0,006 $0,075, plus $0,50 per 1M tokens per uur opslag
Kortingsroute Off-peak: 50% korting op alle tarieven buiten 01:00-04:00 en 06:00-10:00 UTC op weekdagen Batch of Flex: 50% korting ($0,375 / $1,875)
Redeneertokens gefactureerd als Output Output
Vanaf 1 januari 2027 Geen wijziging aangekondigd $1,50 / $7,50; cached read $0,15

Het verschil ziet eruit als een outputpremie. Gemini’s outputtarief is 3,1x dat van DeepSeek terwijl het inputtarief 2,5x is, dus generatie- en denkzware taken betalen het meest, en beide leveranciers rekenen redeneertokens als output.

Wat een echte workload kost

Workload DeepSeek V4.1 Flash Gemini 3.8 Flash Verschil
Gebalanceerde assistent: 1M in / 250K out $0,60 $1,69 $1,09, Gemini 181% meer
Generatie-zwaar: 1M in / 4M out $5,10 $15,75 $10,65, Gemini 209% meer
Cache-zware loop: 100K prefix één keer geschreven, 1.000 gecachete reads, plus 5K vers in / 1K out per request $3,33 $15,13 $11,80, Gemini 354% meer

De formule is (volume ÷ 1M) × tarief, opgeteld over input en output, tegen DeepSeek’s piektarieven en Gemini’s introductietarieven. De cache-zware rij gebruikt het cached-read-tarief van elke aanbieder voor de 1.000 reads en gaat uit van 1 uur aanhouden van de Gemini-cache, wat $0,05 opslag toevoegt.

De cache-zware rij is de kop, omdat DeepSeek’s cached-read-tarief van $0,006 een prefix van 100K tokens bijna gratis maakt om opnieuw te lezen, terwijl Gemini $7,50 rekent voor dezelfde 100M gecachete tokens.

Plan DeepSeek off-peak in en elke rij halveert; wacht tot januari en elke Gemini-rij verdubbelt, zodat de gebalanceerde assistent $3,38 tegenover $0,60 wordt.

Openheid, architectuur en deployment

DeepSeek V4.1 Flash is de enige van de twee die je kunt downloaden, en de architectuur verklaart waarom het goedkoop is. Het technisch rapport beschrijft een 20-laags causale encoder die een 20-laags decoder voedt, Compressed Sparse Attention 2 met FP4 KV-caching, en een KV-cache van 890 bytes per token, omlaag van 3.514 bytes voor V4 Flash.

Het serveren van die MIT-gelicentieerde gewichten staat nog in de kinderschoenen, met vLLM- en SGLang-ondersteuning nog in nightly- en preview-builds, en Transformers nog niet ondersteund.

Als je dataresidency, on-prem inference of fine-tuning nodig hebt, is DeepSeek hier de enige kandidaat. Wil je nul infrastructuur, dan is Gemini’s GA-gehoste endpoint het eenvoudigere pad.

Multimodaliteit, context en ingebouwde tools

Gemini 3.8 Flash accepteert tekst, afbeeldingen, video, audio en PDF, terwijl DeepSeek V4.1 Flash tekst en afbeeldingen accepteert. Beide bieden een contextvenster van 1M tokens, maar DeepSeek staat tot 384K outputtokens toe, vergeleken met 64K bij Gemini, wat telt voor lange codegeneratie en volledige document-herschrijvingen.

De modelpagina van Gemini vermeldt ook gehoste tools waarvoor DeepSeek geen equivalent heeft: code-executie, grounding via Google Search en Maps, bestandszoekfunctie, URL-context en computergebruik in preview. Aan DeepSeek-zijde biedt de API JSON-output, tool calls, een Responses API, een Anthropic-formaat-endpoint en prefix- en fill-in-the-middle-completion.

Als je input audio of video bevat, of je grounding wilt zonder retrieval te bouwen, kies dan Gemini; wil je lange outputs en drop-in compatibiliteit met bestaande OpenAI- of Anthropic-clientcode, dan is het DeepSeek.

Hoe DeepSeek V4.1 Flash en Gemini 3.8 Flash presteerden

Benchmarks van twee verschillende aanbieders gaan maar tot zover, dus ik draaide één bouwtaak tegen beide modellen met een identieke prompt en identieke tooling.

De test

Ik vroeg beide een stateful single-file webapp te bouwen voor een repetitiescheduler van een community-orkest. Twee functies waar we expliciet om vroegen zijn interval-overlapconflictdetectie en persistente opslag. Beide modellen zitten rond 90% op Terminal-Bench 2.1, maar DeepSeek’s 31,2% tegenover Gemini’s 19,1% op Terminal-Bench 4.0 suggereert een kloof in zwaarder agentwerk, en deze taak is een compacte manier om ernaar te zoeken.

Beide modellen draaiden binnen OpenCode met een identiek vastgezette toolomgeving: alleen bestanden lezen en bewerken, geen shell en geen netwerk. Beide draaiden op high redeneerinspanning, één poging elk, geen retries, en de prompt werd byte-voor-byte aan een verse sessie geleverd.

Eén asymmetrie om in gedachten te houden: high is Gemini’s hoogste inspanningsstand, terwijl het bij DeepSeek overeenkomt met 75 op een schaal van 1 tot 100, waarvan het maximum overeenkomt met dat voor de gepubliceerde benchmark-scores.

Dit was de prompt:

Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra. 
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.

Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome). 
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.

Ik beoordeelde beide op uitvoerbaarheid (fail/pass) en op de volgende drie rubrieken, met scores van 1 tot 5:

  • Naleving van de specificatie: Implementeert het alle functies waar ik om vroeg?
  • Conflictl o gica: Detecteert en toont het overlappingen correct, maar behandelt het aangrenzende boekingen of boekingen in verschillende kamers als niet-conflicterend?
  • Gebruiksvriendelijkheid en lay-out: Past het op één pagina, is het intuïtief te gebruiken en ziet het er goed uit?

Wat DeepSeek V4.1 Flash produceerde

DeepSeek rondde af in 2 turns met één tool call: het schreef een index.html van 13 KB en verklaarde klaar. De pagina heeft een donkere tweepanelslay-out, een formulier om repetities toe te voegen links, een maandag-tot-zondagraster rechts, met een conflictdetectiepaneel eronder. De headercomment beschrijft de overlapregel, strikte overlap met back-to-back boekingen uitgezonderd, en de probe bevestigde dat het alleen het overlappende paar markeert.

DeepSeek V4.1 Flash repetitiescheduler na toevoegen van items: Overlapvlaggen, vooringeladen week met een kamerconflict op donderdag, en aangrenzende en verschillende-kamerboekingen op maandag.

Alles waar om gevraagd is, is aanwezig en werkt, de lay-out is in één oogopslag te lezen, en het ene extraatje waar niet om gevraagd is, verwijderen van items, helpt. Bewerken van een item kan niet, maar dat vroeg de prompt ook niet. Dit is een zuivere 5 op alle drie de rubrieken.

Wat Gemini 3.8 Flash produceerde

Gemini deed er 4 turns en 3 tool calls over (een glob, een read, daarna een write) om een index.html van 76 KB te leveren (bijna 6x het bestand van DeepSeek), en het was veel trager. Het resultaat oogt gepolijster: een merkheader met een live teller voor overlapvlaggen, een vooringeladen voorbeeldweek met een opzettelijke dubbele boeking op woensdag zodat de conflictaanduiding meteen zichtbaar is, sectie- en kamerfilters, een alleen-conflicten-toggle, kolom- en tijdlijnweergaven, bewerken en verwijderen van items, een repertoriumnotitieveld en een live waarschuwingspreview terwijl je een nieuwe boeking typt.

Gemini 3.8 Flash repetitiescheduler bij laden: Sinfonia-header met overlapvlaggen, vooringeladen week met een kamerconflict op woensdag, filters en een panel Sections and Balance

De conflictl ogica is correct, en de probe markeerde alleen het overlappende paar. De extra’s zijn het probleem: een panel Sections and Balance met sessietellingen per sectie dwong de formulierkolom tot scrollen (in strijd met de prompt) en zit onhandig onder de rest, en het grote aantal bedieningselementen maakt de week lastiger te lezen dan bij DeepSeek. Daarom trek ik één punt af voor specificatienaleving en één voor lay-out, hoewel het geheel erg goed is.

Resultaten

Maatstaf DeepSeek V4.1 Flash Gemini 3.8 Flash
Turns 2 4
Tool calls 1 3
Uitvoerbaarheid pass pass
Naleving specificatie 5 4
Conflictl o gica 5 5
Gebruiksvriendelijkheid en lay-out 5 4
Rubricscore (gemiddelde van drie assen) 5,0 4,3

DeepSeek V4.1 Flash wint deze test. Beiden hadden het moeilijke deel goed, de interval-overlaplogica, dus het verschil kwam neer op oordeel: DeepSeek bouwde wat gevraagd was in één write, terwijl Gemini een klein product bouwde, en één niet-gevraagde feature schaadde de lay-out waarop het werd beoordeeld. De versie van Gemini is degene die ik zou demo’en aan een orkestmanager; die van DeepSeek is degene die ik liever van een collega krijg.

Dit is één run van één taak op één inspanningsstand, dus het zegt niets over tokenverbruik of kosten, en het prikt alleen in stateful UI plus overlaplogica, niet in langetermijn-werk op repositories.

Wanneer kies je DeepSeek V4.1 Flash vs Gemini 3.8 Flash

Geen van beide modellen is de standaard voor iedereen, dus hier is de keuze per workload.

Kiezen per workload: DeepSeek V4.1 Flash voor kosten en controle, Gemini 3.8 Flash voor multimodaal en gehoste tooling

De splitsing zit in input, infrastructuur en budget: de twee zijn gelijk op agentische coding, dus DeepSeek wint wanneer kosten of controle beslissen, en Gemini wint wanneer je data of je stack iets is dat DeepSeek niet voor je kan inlezen of hosten.

Kies DeepSeek V4.1 Flash als...

  • Je code-agents op schaal draait. Het staat gelijk met Gemini op Terminal-Bench 2.1 en DeepSWE v1.1, ligt voor op Terminal-Bench 4.0, en rekent $1,20 in plaats van $3,75 per 1M outputtokens.
  • Je agentloop een grote prefix herleest. Gecachete input kost $0,006 per 1M tokens tegenover $0,075 bij Gemini plus uurlijkse opslag; een 12,5x gat dat onze cache-zware rij domineerde.
  • Je zelf moet hosten of fine-tunen, en je een node hebt. De MIT-gelicentieerde gewichten draaien op vLLM en SGLang vanuit hun nightly- en preview-images, maar het checkpoint is ~511 GB, en de geverifieerde layouts zijn één GB200 NVL4-tray of één 8×H200-node.
  • Je werk off-peak kunt inplannen of heel lange outputs nodig hebt. Off-peak halveert elk tarief, en het outputplafond van 384K is 6x Gemini’s 64K.

Kies Gemini 3.8 Flash als...

  • Je input audio, video of PDF’s zijn. DeepSeek V4.1 Flash accepteert alleen tekst en afbeeldingen.
  • Je gehoste tools wilt zonder ze te bouwen. Code-executie, grounding via Google Search en Maps, bestandszoekfunctie, URL-context en computergebruik zijn allemaal beschikbaar op dezelfde model-ID.
  • Je in Google’s stack bouwt. Het is GA in AI Studio en Gemini Enterprise, en nu het standaardmodel in Antigravity.
  • Je kenniswerk-agents met gepubliceerd bewijs nodig hebt. Google rapporteert 61,4% op Vals Finance Agent v2 en 10,0% op Harvey’s Legal Agent Benchmark; DeepSeek publiceert niets vergelijkbaars.

Hoe je begint met DeepSeek V4.1 Flash en Gemini 3.8 Flash

Waar je elk model kunt bereiken verschilt meer dan wat het kan, dus check de matrix vóór de benchmarks.

Surface DeepSeek V4.1 Flash Gemini 3.8 Flash
Consumentenapp DeepSeek-app en chat.deepseek.com Gemini-app (Google AI Pro en Ultra), AI Mode in Search, Gemini in Sheets
Eerste-partij API Ja, DeepSeek API (OpenAI- en Anthropic-aanvraagformaten) Ja, Gemini API via Google AI Studio (GA)
Cloudplatformen Geen first-party cloudvermelding; geserveerd door Databricks en anderen, of host de MIT-gewichten zelf Gemini Enterprise op Google Cloud
Code-agents DeepSeek Harness; OpenCode, WorkBuddy en CodeBuddy (officiële partners) Google Antigravity (standaardmodel), Android Studio, Stitch; Cursor, OpenCode
Third-party routers OpenRouter OpenRouter
API-model-ID deepseek-flash gemini-3.8-flash

Het grootste beschikbaarheidsverschil is dat DeepSeek downloadbaar is en Gemini niet, terwijl Gemini degene is met een consumentenapp en een beheerd enterpriseplatform. De IDs die je typt zijn deepseek-flash en gemini-3.8-flash; de verouderde naam deepseek-v4-flash resolveert nog maar wordt geserveerd door V4.1 Flash.

Je eerste API-call maken

De twee SDK’s verschillen, dus dit is geen one-string swap. DeepSeek’s endpoint is OpenAI-compatibel, wat betekent dat de standaardclient openai werkt met een wijziging van de base URL, terwijl Gemini 3.8 Flash de google-genai Interactions API gebruikt met een instelling thinking_level in plaats van samplingparameters.

from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
    model="deepseek-flash",  # DeepSeek V4.1 Flash
    messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai

client = genai.Client()  # reads your Google AI Studio API key
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Refactor this function...",
    generation_config={"thinking_level": "medium"},  # low, medium, or high
)
print(interaction.output_text)

Voor de volledige setup, PDF-extractie en function calling op Gemini, volg onze Gemini 3.8 Flash API-tutorial; voor DeepSeek’s thinking-modus en een lokale deployment van de vorige generatie, zie onze DeepSeek V4 API-tutorial en onze gids voor DeepSeek V4 Flash draaien met Unsloth Studio en OpenCode.

Slotgedachten

Als je workload code-agents, batch-jobs of iets is dat lange prefixes herleest, gebruik dan DeepSeek V4.1 Flash: het staat gelijk met Gemini 3.8 Flash op de gepubliceerde agentische benchmarks, het won onze buildtest in 2 turns, en het kost een derde zoveel vóór de prijsstijging van Gemini in januari. Als je input audio, video of PDF’s zijn, of je grounding, code-executie en computergebruik vanaf één gehost endpoint wilt, gebruik dan Gemini 3.8 Flash en accepteer de premie.

Als je agent-systemen wilt bouwen rond dit soort modellen, behandelt onze Associate AI Engineer for Developers-track API’s, tool use en het Model Context Protocol in 29 uur, en onze cursus Building AI Agents with Google ADK is een start van 1 uur aan de Gemini-kant.

FAQs

Is DeepSeek V4.1 Flash beter dan Gemini 3.8 Flash voor coding?

Op de agentische code-benchmarks die beide aanbieders publiceren, zijn de twee gelijk of ligt DeepSeek V4.1 Flash iets voor: 90,6% vs 89,4% op Terminal-Bench 2.1, 74,2% vs 73,7% op DeepSWE v1.1, en 31,2% vs 19,1% op Terminal-Bench 4.0. In onze praktische scheduler-build scoorde DeepSeek 5/5/5 in 2 turns en Gemini 4/5/4 in 4 turns. Beide sets benchmarkscores zijn door de aanbieders zelf gerund.

Hoeveel goedkoper is DeepSeek V4.1 Flash dan Gemini 3.8 Flash?

DeepSeek V4.1 Flash kost $0,30 per 1M inputtokens en $1,20 per 1M outputtokens op piek, en de helft daarvan off-peak. Gemini 3.8 Flash kost $0,75 en $3,75 tot en met 31 december 2026, oplopend naar $1,50 en $7,50 vanaf 1 januari 2027. Dat maakt Gemini nu 2,5x duurder op input en 3,1x op output, en volgend jaar 5x en 6,25x duurder.

Kan ik DeepSeek V4.1 Flash of Gemini 3.8 Flash zelf hosten?

Je kunt alleen DeepSeek V4.1 Flash zelf hosten. De gewichten zijn gepubliceerd op Hugging Face onder de MIT-licentie, en vLLM en SGLang kunnen ze vandaag al serveren vanuit respectievelijk nightly- en preview-Dockerimages, al ondersteunt geen van beide het nog in een releaseversie, en Transformers-ondersteuning is nog een open PR. Reken op een volledige node: het checkpoint is ongeveer 511 GB over 48 shards, en het vLLM-recept zet het VRAM-minimum op 614 GB.

Wat zijn de API-model-ID’s voor DeepSeek V4.1 Flash en Gemini 3.8 Flash?

DeepSeek V4.1 Flash is deepseek-flash op de DeepSeek API, die OpenAI-formaatverzoeken accepteert op https://api.deepseek.com en Anthropic-formaatverzoeken op https://api.deepseek.com/anthropic. Gemini 3.8 Flash is gemini-3.8-flash op de Gemini API. Beide staan ook op OpenRouter.

Welk model verwerkt audio, video en PDF’s: DeepSeek V4.1 Flash of Gemini 3.8 Flash?

Gemini 3.8 Flash accepteert tekst-, afbeelding-, video-, audio- en PDF-input en voegt gehoste tools toe zoals code-executie, grounding via Google Search en computergebruik in preview. DeepSeek V4.1 Flash accepteert alleen tekst en afbeeldingen, maar staat tot 384K outputtokens toe tegenover 64K bij Gemini, en beide bieden een contextvenster van 1M tokens.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom is data scientist en technisch docent. Hij schrijft en beheert de data science-tutorials en blogposts van DataCamp. Eerder werkte Tom in data science bij Deutsche Telekom.

Onderwerpen
Kunstmatige intelligentie
Large Language Models

Leer AI met DataCamp!

Leerpad

Basisprincipes van AI-agenten

6 Hr
Ontdek hoe AI-agenten je manier van werken kunnen veranderen en waarde kunnen toevoegen aan je organisatie!
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow