track
Google a lansat Gemini 3.8 Flash pe 2 septembrie 2026, a treia versiune Flash în șase săptămâni. Opt zile mai târziu, DeepSeek a răspuns cu DeepSeek V4.1 Flash, un model mixture-of-experts cu 552B parametri, licențiat MIT, care activează 8B parametri la input și 16B la output.
Ambii furnizori își prezintă modelul ca pe un cal de povară pentru agenți de programare și obțin scoruri similare în cele mai importante benchmark-uri. Asta face alegerea mai dificilă decât obișnuitul cadru deschis-versus-închis sugerează, pentru că modelul mai ieftin nu este și cel mai slab pe benchmark-urile pe care le au în comun.
În acest articol, compar DeepSeek V4.1 Flash și Gemini 3.8 Flash la nivel de benchmark-uri, prețuri, deschidere, multimodalitate și într-un test practic de construire pe care l-am rulat pe ambele.
Pentru o acoperire mai detaliată a fiecărui model în parte, vezi ghidul DeepSeek V4.1 Flash și ghidul Gemini 3.8 Flash și 3.8 Flash Cyber.
TL;DR
- DeepSeek V4.1 Flash egalează sau depășește ușor Gemini 3.8 Flash la fiecare benchmark de programare agentică publicat de ambii furnizori și a câștigat testul nostru practic de scheduler în jumătate din numărul de iterații.
- Gemini 3.8 Flash costă de 2,5x mai mult pe token de input și de 3,1x mai mult pe token de output în prezent, iar prețul se dublează pe 1 ianuarie 2027.
- Gemini 3.8 Flash este modelul mai cuprinzător: acceptă input audio, video și PDF și vine cu tooluri găzduite de Google.
- Alege DeepSeek V4.1 Flash pentru agenți de programare cu volum mare, joburi batch, bucle cu cache intens sau orice ai nevoie să găzduiești local.
- Alege Gemini 3.8 Flash când inputurile tale sunt multimodale, când construiești în Google AI Studio sau Antigravity, sau când ai nevoie de agenți de knowledge work cu scoruri pe domenii publicate.
Ce este DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash este un model open-weight, licențiat MIT, de tip mixture-of-experts, lansat de DeepSeek pe 10 septembrie 2026, și cel mai mic membru al unei noi familii de arhitecturi.
Conform raportului tehnic V4.1, cache-ul KV are nevoie de 890 de bytes per token, aproximativ un sfert față de cât necesita DeepSeek V4 Flash, ceea ce explică mare parte din economiile de cost.
Pentru detalii complete, citește ghidul DeepSeek V4.1 Flash, iar pentru o instalare locală a generației anterioare, tutorialul nostru despre rularea DeepSeek V4 Flash cu Unsloth Studio și OpenCode.
Ce este Gemini 3.8 Flash?
Gemini 3.8 Flash este cel mai capabil model din nivelul Flash al Google, lansat pe 2 septembrie 2026, la trei săptămâni după Gemini 3.7 Flash și construit pe baza acestuia.
Alegerea de design definitorie este că „muncește mai mult”: pe taskuri complexe, rulează pași suplimentari de raționament și apelează tooluri în mod iterativ, iar Google spune că poate consuma mai mulți tokeni la niveluri mai ridicate de efort.
Ghidul nostru Gemini 3.8 Flash acoperă lansarea și varianta Cyber cu acces limitat, iar tutorialul API pentru Gemini 3.8 Flash trece prin Interactions API, nivelurile de gândire și apelarea de funcții în Python.
DeepSeek V4.1 Flash vs Gemini 3.8 Flash: comparație directă
Pe cele șase dimensiuni de mai jos, DeepSeek V4.1 Flash câștigă la preț și deschidere și egalează la programare, în timp ce Gemini 3.8 Flash câștigă la tipuri de input, tooluri și rezultate publicate pentru knowledge work.

| Caracteristică | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Lansare | 10 septembrie 2026 | 2 septembrie 2026 |
| Greutăți și licență | Deschise, MIT | Închise, găzduite |
| Arhitectură | 552B MoE, 8B activi la prefill, 16B la decode | Nedezvăluită; bazată pe Gemini 3.7 Flash |
| Context / output max | 1M tokeni / 384K | 1M tokeni / 64K |
| Tipuri de input | Text, imagine | Text, imagine, video, audio, PDF |
| Terminal-Bench 2.1 | 90,6% | 89,4% |
| DeepSWE v1.1 | 74,2% | 73,7% |
| Setări efort de raționare | low, high, max pe API (întreg 1-100 dedesubt) |
low, medium, high |
| Preț API, input / output per 1M | $0,30 / $1,20 (peak) | $0,75 / $3,75 (până în 2026; după aceea 2x) |
Programare și fluxuri de lucru agentice
DeepSeek V4.1 Flash conduce în toate cele trei benchmark-uri agentice care apar în tabelele ambilor furnizori, deși două dintre diferențe sunt suficient de mici încât să fie considerate egalitate.
Diferența care contează cu adevărat este la Terminal-Bench 4.0, suita generală mai dificilă: 31,2% pentru DeepSeek față de 19,1% pentru Gemini. Ambii furnizori admit că această suită le evidențiază limitele; DeepSeek spune că rămâne un decalaj față de modelele uriașe pe taskuri agentice orientate spre știință, iar propriul tabel al Google îl plasează pe Claude Opus 5 la 51,8%.
| Benchmark | DeepSeek V4.1 Flash | Gemini 3.8 Flash | Note |
|---|---|---|---|
| Terminal-Bench 2.1 | 90,6% | 89,4% | Ambele rulate de furnizori; ambele tabele îl plasează pe Claude Opus 5 la 89,1% |
| DeepSWE v1.1 | 74,2% | 73,7% | Ambele rulate de furnizori; ambele tabele îl plasează pe Claude Opus 5 la 74,0% |
| Terminal-Bench 4.0 | 31,2% | 19,1% | Cea mai dificilă suită comună; Opus 5 la 51,8% în ambele tabele |
Două atenționări:
- Scorurile DeepSeek sunt la nivelul maxim de efort, care, conform raportului tehnic, costă aproximativ de 2,5x mai mulți tokeni de output decât setarea joasă. Același raport notează că eforturi între 60 și 80 recuperează cea mai mare parte din acuratețe cu bine sub jumătate din tokeni, deci merită să rezervi nivelul maxim pentru taskuri grele.
- Harnașamentele diferă, dar coloanele rivale se aliniază aproape exact, astfel că aceste tabele sunt mai comparabile decât majoritatea perechilor între furnizori.
Pentru agenți de programare orientați pe terminal, tratează-le ca egale și lasă prețul și modul de implementare să decidă; pe cele mai dificile taskuri agentice, avantajul publicat de DeepSeek este singurul de pe tabelă.
Prețuri: cât plătești de fapt
Prețul este singura dimensiune fără dispută, așa că întrebarea interesantă este cât de mult se schimbă diferența în funcție de forma încărcării tale.

DeepSeek V4.1 Flash este mai ieftin la fiecare rând, iar diferența crește cu cât încărcarea ta se bazează mai mult pe tokeni de output sau pe prefixe din cache. Multiplicatorul nu este uniform, ceea ce este concluzia: 2,5x la input, 3,1x la output și 12,5x la citiri din cache.
Tarife pe token, alăturat
| Tarif | DeepSeek V4.1 Flash (peak) | Gemini 3.8 Flash (până la 31 dec 2026) |
|---|---|---|
| Input, per 1M tokeni | $0,30 | $0,75 |
| Output, per 1M tokeni | $1,20 | $3,75 |
| Citire input din cache, per 1M tokeni | $0,006 | $0,075, plus $0,50 per 1M tokeni per oră de stocare |
| Rută de discount | Off-peak: -50% la toate tarifele în afara 01:00-04:00 și 06:00-10:00 UTC în zilele lucrătoare | Batch sau Flex: -50% ($0,375 / $1,875) |
| Tokeni de raționare facturați ca | Output | Output |
| Din 1 ianuarie 2027 | Nicio schimbare anunțată | $1,50 / $7,50; citire din cache $0,15 |
Diferența are forma unei prime pe output. Tariful de output al Gemini este de 3,1x față de DeepSeek, în timp ce tariful de input este de 2,5x, astfel încât munca intensă în generare și gândire plătește cel mai mult, iar ambii furnizori facturează tokenii de raționare la tariful de output.
Cât costă o încărcare reală
| Încărcare | DeepSeek V4.1 Flash | Gemini 3.8 Flash | Diferență |
|---|---|---|---|
| Asistent echilibrat: 1M in / 250K out | $0,60 | $1,69 | $1,09, Gemini cu 181% mai mult |
| Generare intensă: 1M in / 4M out | $5,10 | $15,75 | $10,65, Gemini cu 209% mai mult |
| Buclă cu cache intens: prefix 100K scris o dată, 1.000 citiri din cache, plus 5K in proaspăt / 1K out per cerere | $3,33 | $15,13 | $11,80, Gemini cu 354% mai mult |
Formula este (volum ÷ 1M) × tarif, însumat pe input și output, la tarifele peak ale DeepSeek și la tarifele introductive ale Gemini. Rândul cu cache intens folosește tariful fiecărui furnizor pentru citire din cache la cele 1.000 de citiri și presupune că cache-ul Gemini este păstrat timp de 1 oră, ceea ce adaugă $0,05 de stocare.
Rândul cu cache intens este titlul, pentru că tariful de $0,006 al DeepSeek pentru citire din cache face ca un prefix de 100K tokeni să fie aproape gratis de recitit, în timp ce Gemini percepe $7,50 pentru aceiași 100M tokeni citiți din cache.
Programează DeepSeek în off-peak și fiecare rând se înjumătățește; așteaptă până în ianuarie și fiecare rând pentru Gemini se dublează, astfel încât asistentul echilibrat devine $3,38 față de $0,60.
Deschidere, arhitectură și implementare
DeepSeek V4.1 Flash este singurul dintre cele două pe care îl poți descărca, iar arhitectura lui explică de ce e ieftin. Raportul tehnic descrie un encoder cauzal cu 20 de straturi care alimentează un decoder cu 20 de straturi, Compressed Sparse Attention 2 cu cache KV FP4 și un cache KV de 890 de bytes per token, în scădere de la 3.514 bytes pentru V4 Flash.
Servirea acelor greutăți licențiate MIT este încă la început, însă, cu suport vLLM și SGLang încă în builduri nightly și preview, iar Transformers încă nesuportat.
Dacă ai nevoie de rezidența datelor, inferență on-prem sau fine-tuning, DeepSeek este singurul candidat aici. Dacă vrei zero infrastructură, endpoint-ul GA găzduit de Gemini este calea mai simplă.
Multimodalitate, context și tooluri integrate
Gemini 3.8 Flash acceptă text, imagini, video, audio și PDF, în timp ce DeepSeek V4.1 Flash acceptă text și imagini. Ambele oferă o fereastră de context de 1M tokeni, dar DeepSeek permite până la 384K tokeni de output, comparativ cu 64K la Gemini, ceea ce contează pentru generare de cod lungă și rescrieri de documente întregi.
Pagina modelului a lui Gemini listează, de asemenea, tooluri găzduite pentru care DeepSeek nu are echivalent: execuție de cod, grounding în Google Search și Maps, căutare în fișiere, context din URL și computer use în preview. Pe partea de API, DeepSeek oferă output JSON, apeluri de tooluri, un Responses API, un endpoint în format Anthropic și completare cu prefix și fill-in-the-middle.
Dacă inputurile tale includ audio sau video, sau vrei grounding fără să construiești retrieval, alege Gemini; dacă vrei outputuri lungi și compatibilitate drop-in cu codul client existent pentru OpenAI sau Anthropic, alege DeepSeek.
Cum s-au descurcat DeepSeek V4.1 Flash și Gemini 3.8 Flash
Benchmark-urile de la doi furnizori diferiți merg doar până la un punct, așa că am rulat un task de construire pe ambele modele, cu prompt și tooluri identice.
Testul
Le-am cerut amândurora să construiască o aplicație web stateful într-un singur fișier pentru un scheduler de repetiții al unei orchestre de comunitate. Două funcții cerute explicit au fost detectarea conflictelor prin suprapunere de intervale și persistența. Ambele modele sunt aproape de 90% pe Terminal-Bench 2.1, dar 31,2% al DeepSeek față de 19,1% al Gemini pe Terminal-Bench 4.0 sugerează un decalaj pe munca agentică mai grea, iar acest task este o modalitate compactă de a-l căuta.
Ambele modele au rulat în OpenCode cu aceeași suprafață de tooluri fixată: doar citire și editare de fișiere, fără shell și fără rețea. Ambele au rulat la efort de raționare high, o singură încercare fiecare, fără retry, iar promptul a fost trimis byte-cu-byte într-o sesiune nouă.
O asimetrie de reținut: high este nivelul de efort maxim la Gemini, în timp ce la DeepSeek corespunde valorii 75 pe o scară de la 1 la 100, al cărei maxim corespunde celui folosit pentru scorurile de benchmark publicate.
Acesta a fost promptul:
Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra.
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.
Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome).
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Le-am notat pe ambele la rulabilitate (fail/pass) și pe următoarele trei rubrici, cu scoruri de la 1 la 5:
- Respectarea specificației: Implementează toate funcțiile cerute?
- Logica conflictelor: Detectează și afișează corect suprapunerile, dar tratează rezervările adiacente sau în camere diferite ca neconflictuale?
- Uzabilitate și layout: Încape pe o singură pagină, poate fi folosit intuitiv și arată bine?
Ce a produs DeepSeek V4.1 Flash
DeepSeek a terminat în 2 iterații cu un singur apel de tool: a scris un index.html de 13 KB și a declarat finalizat. Pagina are un layout întunecat cu două panouri: un formular de adăugare repetiție în stânga, o grilă de luni-duminică în dreapta, cu un panou de verificare a conflictelor dedesubt. Comentariul din antet explică regula de suprapunere, suprapunere strictă cu rezervări back-to-back exceptate, iar proba a confirmat că marchează doar perechea suprapusă.

Tot ce s-a cerut este prezent și funcționează, layout-ul se citește dintr-o privire, iar singurul extra necerut, ștergerea intrărilor, ajută. Nu permite editarea unei intrări, ceea ce promptul nu a cerut oricum. Este un 5 curat la toate cele trei rubrici.
Ce a produs Gemini 3.8 Flash
Gemini a avut nevoie de 4 iterații și 3 apeluri de tool (un glob, un read, apoi un write) pentru a livra un index.html de 76 KB (de aproape 6x fișierul DeepSeek) și a fost mult mai lent. Rezultatul arată mai finisat: un antet branduit cu un contor live de suprapuneri, o săptămână de exemplu preîncărcată cu o dublă rezervare intenționată miercuri pentru ca indicatorul de conflict să apară imediat, filtre pentru secțiune și cameră, un toggle doar-conflicte, vizualizări pe coloane și pe cronologie, editare și ștergere de intrări, un câmp de note de repertoriu și un avertisment live în timp ce tastezi o rezervare nouă.

Logica conflictelor este corectă, iar proba a marcat doar perechea suprapusă. Extra-urile sunt problema: un panou Sections and Balance cu numărări de sesiuni pe secțiune a forțat coloana formularului să deruleze (ceea ce contrazice promptul) și stă stingher sub restul, iar numărul mare de controale face săptămâna mai greu de citit decât la DeepSeek. De aceea trebuie să scad un punct la respectarea specificației și la layout, deși rezultatul general este foarte bun.
Rezultate
| Măsură | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Iterații | 2 | 4 |
| Apeluri de tool | 1 | 3 |
| Rulabilitate | pass | pass |
| Respectarea specificației | 5 | 4 |
| Logica conflictelor | 5 | 5 |
| Uzabilitate și layout | 5 | 4 |
| Scor pe rubrici (media celor trei axe) | 5,0 | 4,3 |
DeepSeek V4.1 Flash câștigă acest test. Ambele au rezolvat partea grea, logica de suprapunere a intervalelor, astfel că diferența a ținut de judecată: DeepSeek a construit ce s-a cerut într-o singură scriere, în timp ce Gemini a construit un mic produs, iar o funcție necerută a stricat layout-ul pe care a fost notat. Versiunea Gemini e cea pe care aș demo-o unui manager de orchestră; versiunea DeepSeek e cea pe care aș prefera să mi-o înmâneze un coleg.
Aceasta este o singură rulare a unui singur task la un singur nivel de efort, deci nu spune nimic despre consumul de tokeni sau cost și sondează doar UI stateful plus logica de suprapunere, nu lucru pe repo pe orizont lung.
Când să alegi DeepSeek V4.1 Flash vs Gemini 3.8 Flash
Niciunul nu este implicitul pentru toată lumea, așa că iată decizia după tipul de încărcare.

Răscrucea este inputurile, infrastructura și bugetul: cele două sunt la același nivel pe programare agentică, deci DeepSeek câștigă ori de câte ori costul sau controlul decid, iar Gemini câștigă ori de câte ori datele sau stack-ul tău sunt ceva ce DeepSeek nu poate ingera sau găzdui pentru tine.
Alege DeepSeek V4.1 Flash dacă...
- Rulezi agenți de programare la volum. Este la nivel cu Gemini pe Terminal-Bench 2.1 și DeepSWE v1.1, înainte pe Terminal-Bench 4.0 și taxează $1,20 în loc de $3,75 per 1M tokeni de output.
- Bucla agentului tău recitește un prefix mare. Inputul din cache costă $0,006 per 1M tokeni față de $0,075 la Gemini plus stocare orară, un raport de 12,5x care a dominat rândul nostru cu încărcare intensă pe cache.
- Ai nevoie să găzduiești local sau de fine-tuning, și ai un nod pentru asta. Greutățile licențiate MIT rulează pe vLLM și SGLang din imaginile lor nightly și preview, dar checkpoint-ul are ~511 GB, iar layout-urile verificate sunt un tray GB200 NVL4 sau un nod 8×H200.
- Poți programa munca în off-peak sau ai nevoie de outputuri foarte lungi. Off-peak înjumătățește toate tarifele, iar plafonul de 384K la output este 6x cei 64K ai Gemini.
Alege Gemini 3.8 Flash dacă...
- Inputurile tale sunt audio, video sau PDF-uri. DeepSeek V4.1 Flash acceptă doar text și imagini.
- Vrei tooluri găzduite fără să le construiești. Execuție de cod, grounding în Google Search și Maps, căutare în fișiere, context din URL și computer use sunt toate disponibile pe același ID de model.
- Construiești în stack-ul Google. Este GA în AI Studio și Gemini Enterprise și este acum modelul implicit în Antigravity.
- Ai nevoie de agenți de knowledge work cu dovezi publicate. Google raportează 61,4% pe Vals Finance Agent v2 și 10,0% pe Harvey's Legal Agent Benchmark; DeepSeek nu publică nimic comparabil.
Cum să începi cu DeepSeek V4.1 Flash și Gemini 3.8 Flash
Unde poți accesa fiecare model diferă mai mult decât ce poate face, așa că verifică matricea înainte de benchmark-uri.
| Suprafață | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Aplicație pentru consumatori | Aplicația DeepSeek și chat.deepseek.com | Aplicația Gemini (Google AI Pro și Ultra), AI Mode în Search, Gemini în Sheets |
| API first-party | Da, DeepSeek API (formate de cereri OpenAI și Anthropic) | Da, Gemini API prin Google AI Studio (GA) |
| Platforme cloud | Fără listare cloud first-party; servit de Databricks și alții, sau găzduiești local greutățile MIT | Gemini Enterprise pe Google Cloud |
| Agenți de programare | DeepSeek Harness; OpenCode, WorkBuddy și CodeBuddy (parteneri oficiali) | Google Antigravity (model implicit), Android Studio, Stitch; Cursor, OpenCode |
| Routere terțe | OpenRouter | OpenRouter |
| ID model API | deepseek-flash |
gemini-3.8-flash |
Cea mai mare diferență de disponibilitate este că DeepSeek poate fi descărcat, iar Gemini nu, în timp ce Gemini este cel cu o aplicație pentru consumatori și o platformă enterprise gestionată, cu istoric. ID-urile pe care le tastezi sunt deepseek-flash și gemini-3.8-flash; numele vechi deepseek-v4-flash încă se rezolvă, dar este servit de V4.1 Flash.
Prima ta apelare de API
SDK-urile diferă, deci nu e un simplu schimb de șiruri. Endpoint-ul DeepSeek este compatibil cu OpenAI, ceea ce înseamnă că clientul standard openai funcționează cu o schimbare de base URL, în timp ce Gemini 3.8 Flash folosește Interactions API din google-genai cu o setare thinking_level în locul parametrilor de sampling.
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-flash", # DeepSeek V4.1 Flash
messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai
client = genai.Client() # reads your Google AI Studio API key
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Refactor this function...",
generation_config={"thinking_level": "medium"}, # low, medium, or high
)
print(interaction.output_text)
Pentru instalarea completă, extragere PDF și apelare de funcții pe Gemini, urmează tutorialul nostru API pentru Gemini 3.8 Flash; pentru modul de gândire al DeepSeek și o implementare locală a generației anterioare, vezi tutorialul API DeepSeek V4 și ghidul nostru pentru rularea DeepSeek V4 Flash cu Unsloth Studio și OpenCode.
Gânduri finale
Dacă încărcarea ta este cu agenți de programare, joburi batch sau orice recitește prefixe lungi, folosește DeepSeek V4.1 Flash: este la nivel cu Gemini 3.8 Flash pe benchmark-urile agentice publicate, a câștigat testul nostru de construire în 2 iterații și costă o treime înainte de creșterea de preț a Gemini din ianuarie. Dacă inputurile tale sunt audio, video sau PDF-uri, sau vrei grounding, execuție de cod și computer use dintr-un singur endpoint găzduit, folosește Gemini 3.8 Flash și acceptă prima.
Dacă vrei să construiești sisteme de agenți în jurul unor astfel de modele, track-ul nostru Associate AI Engineer for Developers acoperă API-uri, folosirea de tooluri și Model Context Protocol în 29 de ore, iar cursul Building AI Agents with Google ADK este un start de 1 oră pe partea Gemini.
Întrebări frecvente
Este DeepSeek V4.1 Flash mai bun decât Gemini 3.8 Flash pentru programare?
Pe benchmark-urile de programare agentică publicate de ambii furnizori, cele două sunt la același nivel sau DeepSeek V4.1 Flash e ușor înainte: 90,6% vs 89,4% pe Terminal-Bench 2.1, 74,2% vs 73,7% pe DeepSWE v1.1 și 31,2% vs 19,1% pe Terminal-Bench 4.0. În testul nostru practic de construire a scheduler-ului, DeepSeek a obținut 5/5/5 în 2 iterații, iar Gemini 4/5/4 în 4 iterații. Ambele seturi de scoruri de benchmark sunt rulate de furnizori.
Cât de mult mai ieftin este DeepSeek V4.1 Flash decât Gemini 3.8 Flash?
DeepSeek V4.1 Flash costă $0,30 per 1M tokeni de input și $1,20 per 1M tokeni de output la peak, și jumătate în off-peak. Gemini 3.8 Flash costă $0,75 și $3,75 până pe 31 decembrie 2026, crescând la $1,50 și $7,50 de la 1 ianuarie 2027. Asta face ca Gemini să fie astăzi de 2,5x mai scump la input și de 3,1x la output, iar anul viitor de 5x și 6,25x.
Pot găzdui local DeepSeek V4.1 Flash sau Gemini 3.8 Flash?
Doar DeepSeek V4.1 Flash poate fi găzduit local. Greutățile sale sunt publicate pe Hugging Face sub licența MIT, iar vLLM și SGLang le pot servi astăzi din imagini Docker nightly și, respectiv, preview, deși niciunul nu îl suportă încă într-o versiune lansată, iar suportul Transformers este încă un PR deschis. Fă-ți buget pentru un nod complet: checkpoint-ul are aproximativ 511 GB în 48 de sharduri, iar rețeta vLLM plasează minimul de VRAM la 614 GB.
Care sunt ID-urile de model API pentru DeepSeek V4.1 Flash și Gemini 3.8 Flash?
DeepSeek V4.1 Flash este deepseek-flash pe DeepSeek API, care acceptă cereri în format OpenAI la https://api.deepseek.com și cereri în format Anthropic la https://api.deepseek.com/anthropic. Gemini 3.8 Flash este gemini-3.8-flash pe Gemini API. Ambele sunt listate și pe OpenRouter.
Care model gestionează audio, video și PDF-uri: DeepSeek V4.1 Flash sau Gemini 3.8 Flash?
Gemini 3.8 Flash acceptă input text, imagine, video, audio și PDF și adaugă tooluri găzduite precum execuție de cod, grounding în Google Search și computer use în preview. DeepSeek V4.1 Flash acceptă doar text și imagini, dar permite până la 384K tokeni de output față de 64K la Gemini, iar ambele oferă o fereastră de context de 1M tokeni.