Ir al contenido principal

DeepSeek V4.1 Flash vs Gemini 3.8 Flash: benchmarks, precios y cuál usar

Los pesos abiertos de DeepSeek V4.1 Flash igualan a Gemini 3.8 Flash en benchmarks de agentes de código a un tercio del precio. Comparamos especificaciones, costes y una prueba práctica.
Actualizado 17 sept 2026  · 14 min leer

Explorar con IA

ChatGPTClaudePerplexity

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, su tercera versión Flash en seis semanas. Ocho días después, DeepSeek respondió con DeepSeek V4.1 Flash, un modelo mixture-of-experts con licencia MIT de 552B que activa 8B parámetros en la entrada y 16B en la salida.

Ambos proveedores presentan su modelo como caballo de batalla para agentes de código y logran puntuaciones similares en los benchmarks más importantes. Esto complica la elección más allá del típico marco abierto vs cerrado, porque el modelo más barato no es el más débil en las pruebas que comparten.

En este artículo, comparo DeepSeek V4.1 Flash y Gemini 3.8 Flash en benchmarks, precios, apertura, multimodalidad y en una prueba práctica de construcción que ejecuté en ambos.

Si quieres un análisis más a fondo de cada modelo por separado, consulta nuestra guía de DeepSeek V4.1 Flash y nuestra guía de Gemini 3.8 Flash y 3.8 Flash Cyber.

Resumen

  • DeepSeek V4.1 Flash iguala o supera ligeramente a Gemini 3.8 Flash en todos los benchmarks de agentes de código que ambos publican, y ganó nuestra prueba práctica del planificador en la mitad de los turnos.
  • Gemini 3.8 Flash cuesta 2,5 veces más por token de entrada y 3,1 veces más por token de salida hoy, y su precio se duplica el 1 de enero de 2027.
  • Gemini 3.8 Flash es más amplio: acepta audio, vídeo y PDF como entrada, y viene con herramientas alojadas de Google.
  • Elige DeepSeek V4.1 Flash para agentes de código a gran escala, trabajos por lotes, bucles con mucho uso de caché o cuando necesites autoalojamiento.
  • Elige Gemini 3.8 Flash si tus entradas son multimodales, si construyes dentro de Google AI Studio o Antigravity, o si necesitas agentes de trabajo del conocimiento con resultados publicados por dominio.

¿Qué es DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash es un modelo de pesos abiertos con licencia MIT, de tipo mixture-of-experts, publicado por DeepSeek el 10 de septiembre de 2026, y el miembro más pequeño de una nueva familia de arquitectura.

Según el informe técnico de V4.1, su caché KV necesita 890 bytes por token, aproximadamente una cuarta parte de lo que requería DeepSeek V4 Flash, de donde proviene la mayor parte del ahorro de costes.

Para un desglose completo, lee nuestra guía de DeepSeek V4.1 Flash y, para una instalación local de la generación anterior, nuestro tutorial sobre cómo ejecutar DeepSeek V4 Flash con Unsloth Studio y OpenCode.

¿Qué es Gemini 3.8 Flash?

Gemini 3.8 Flash es el modelo más capaz de la gama Flash de Google, lanzado el 2 de septiembre de 2026, tres semanas después de Gemini 3.7 Flash y construido sobre él.

Su rasgo de diseño distintivo es que "trabaja más": en tareas complejas, ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa, y Google indica que puede consumir más tokens a mayores niveles de esfuerzo.

Nuestra guía de Gemini 3.8 Flash cubre el lanzamiento y la variante Cyber de acceso limitado, y nuestro tutorial de la API de Gemini 3.8 Flash repasa la Interactions API, los niveles de pensamiento y las llamadas a funciones en Python.

DeepSeek V4.1 Flash vs Gemini 3.8 Flash: comparación directa

En las seis dimensiones siguientes, DeepSeek V4.1 Flash gana en precio y apertura y empata en programación, mientras que Gemini 3.8 Flash gana en tipos de entrada, herramientas y resultados publicados en trabajo del conocimiento.

DeepSeek V4.1 Flash iguala a Gemini 3.8 Flash en programación a un tercio del precio

Característica DeepSeek V4.1 Flash Gemini 3.8 Flash
Lanzamiento 10 de septiembre de 2026 2 de septiembre de 2026
Pesos y licencia Abiertos, MIT Cerrado, alojado
Arquitectura 552B MoE, 8B activos en prefill, 16B en decodificación No divulgada; basada en Gemini 3.7 Flash
Contexto / salida máx. 1M tokens / 384K 1M tokens / 64K
Tipos de entrada Texto, imagen Texto, imagen, vídeo, audio, PDF
Terminal-Bench 2.1 90,6% 89,4%
DeepSWE v1.1 74,2% 73,7%
Ajustes de esfuerzo de razonamiento low, high, max en la API (entero 1-100 por debajo) low, medium, high
Precio API, entrada / salida por 1M $0,30 / $1,20 (horas punta) $0,75 / $3,75 (hasta 2026; después 2x)

Programación y flujos de trabajo con agentes

DeepSeek V4.1 Flash lidera en los tres benchmarks de agentes que aparecen en las tablas de ambos proveedores, aunque dos diferencias son lo bastante pequeñas como para considerarlas un empate.

La brecha que realmente importa es Terminal-Bench 4.0, la batería más dura de agente generalista: 31,2% para DeepSeek frente a 19,1% para Gemini. Ambos reconocen que esta suite los pone a prueba; DeepSeek admite que persiste una brecha frente a modelos gigantes en tareas científicas con agentes, y la propia tabla de Google sitúa a Claude Opus 5 en 51,8%.

Benchmark DeepSeek V4.1 Flash Gemini 3.8 Flash Notas
Terminal-Bench 2.1 90,6% 89,4% Ambos ejecutados por los proveedores; ambas tablas sitúan a Claude Opus 5 en 89,1%
DeepSWE v1.1 74,2% 73,7% Ambos ejecutados por los proveedores; ambas tablas sitúan a Claude Opus 5 en 74,0%
Terminal-Bench 4.0 31,2% 19,1% Suite compartida más difícil; Opus 5 en 51,8% en ambas tablas

Dos matices:

  • Las puntuaciones de DeepSeek son en su nivel máximo de esfuerzo, que según el informe técnico cuesta aproximadamente 2,5 veces los tokens de salida de un ajuste bajo. El mismo informe indica que esfuerzos de 60 a 80 recuperan la mayor parte de esa precisión con bastante menos de la mitad de tokens, así que conviene reservar el máximo para tareas difíciles.
  • Los harness difieren, pero las columnas rivales se alinean casi exactamente, así que estas tablas están más cerca de ser comparables que la mayoría de pares entre proveedores.

Para agentes de programación centrados en terminal, trátalos como equivalentes y deja que decidan el precio y el despliegue; en las tareas de agente más duras, la ventaja publicada de DeepSeek es la única diferencia clara.

Precios: lo que pagarás de verdad

El precio es la única dimensión sin discusión, así que la pregunta interesante es cuánto cambia la brecha según el perfil de tu carga.

Gemini 3.8 Flash cuesta entre 2,8x y 4,5x más que DeepSeek V4.1 Flash en todas las formas de carga

DeepSeek V4.1 Flash es más barato en todas las líneas, y la brecha se amplía cuanto más depende tu carga de tokens de salida o de prefijos en caché. El múltiplo no es uniforme, y ahí está la clave: 2,5x en entrada, 3,1x en salida y 12,5x en lecturas en caché.

Tarifas por token, lado a lado

Tarifa DeepSeek V4.1 Flash (horas punta) Gemini 3.8 Flash (hasta 31 dic 2026)
Entrada, por 1M tokens $0,30 $0,75
Salida, por 1M tokens $1,20 $3,75
Lectura de entrada en caché, por 1M tokens $0,006 $0,075, más $0,50 por 1M tokens por hora de almacenamiento
Ruta con descuento Fuera de punta: 50% de descuento en todas las tarifas fuera de 01:00-04:00 y 06:00-10:00 UTC en días laborables Batch o Flex: 50% de descuento ($0,375 / $1,875)
Tokens de razonamiento facturados como Salida Salida
Desde el 1 de enero de 2027 Sin cambios anunciados $1,50 / $7,50; lectura en caché $0,15

La diferencia tiene forma de prima en la salida. La tarifa de salida de Gemini es 3,1x la de DeepSeek, mientras que la de entrada es 2,5x, así que el trabajo con mucha generación y razonamiento paga más, y ambos facturan los tokens de razonamiento a la tarifa de salida.

Cuánto cuesta una carga real

Carga DeepSeek V4.1 Flash Gemini 3.8 Flash Diferencia
Asistente equilibrado: 1M in / 250K out $0,60 $1,69 $1,09, Gemini un 181% más
Mucha generación: 1M in / 4M out $5,10 $15,75 $10,65, Gemini un 209% más
Bucle con mucha caché: prefijo de 100K escrito una vez, 1.000 lecturas en caché, más 5K nuevos in / 1K out por petición $3,33 $15,13 $11,80, Gemini un 354% más

La fórmula es (volumen ÷ 1M) × tarifa, sumado entre entrada y salida, con las tarifas punta de DeepSeek y las introductorias de Gemini. La fila con mucha caché usa la tarifa de lectura en caché de cada proveedor para las 1.000 lecturas y asume que la caché de Gemini se mantiene 1 hora, lo que añade $0,05 de almacenamiento.

La fila con mucha caché es la titular, porque la tarifa de $0,006 por 1M tokens en lectura en caché de DeepSeek hace que un prefijo de 100K tokens sea casi gratis de releer, mientras que Gemini cobra $7,50 por esos mismos 100M tokens en caché.

Si programas DeepSeek fuera de horas punta, cada fila se reduce a la mitad; si esperas a enero, cada fila de Gemini se duplica, así que el asistente equilibrado pasa a $3,38 frente a $0,60.

Apertura, arquitectura y despliegue

DeepSeek V4.1 Flash es el único de los dos que puedes descargar, y su arquitectura explica por qué es barato. El informe técnico describe un codificador causal de 20 capas que alimenta a un decodificador de 20 capas, Compressed Sparse Attention 2 con caché KV en FP4, y una caché KV de 890 bytes por token, frente a 3.514 bytes en V4 Flash.

Servir esos pesos con licencia MIT aún está verde: vLLM y SGLang los soportan en builds nocturnas y de vista previa, y Transformers todavía no los soporta.

Si necesitas residencia de datos, inferencia on-prem o ajuste fino, DeepSeek es el único candidato aquí. Si quieres cero infraestructura, el endpoint alojado GA de Gemini es el camino más sencillo.

Multimodalidad, contexto y herramientas integradas

Gemini 3.8 Flash acepta texto, imágenes, vídeo, audio y PDF, mientras que DeepSeek V4.1 Flash acepta texto e imágenes. Ambos ofrecen una ventana de contexto de 1M de tokens, pero DeepSeek permite hasta 384K tokens de salida, frente a los 64K de Gemini, algo clave para generar código largo y reescrituras de documentos completos.

La página del modelo de Gemini también lista herramientas alojadas para las que DeepSeek no tiene equivalente: ejecución de código, grounding con Google Search y Maps, búsqueda de archivos, contexto por URL y control del ordenador en vista previa. En el lado de la API de DeepSeek hay salida JSON, llamadas a herramientas, una Responses API, un endpoint con formato Anthropic y completado por prefijo y fill-in-the-middle.

Si tus entradas incluyen audio o vídeo, o quieres grounding sin construir un sistema de recuperación, la elección es Gemini; si quieres salidas largas y compatibilidad inmediata con clientes existentes de OpenAI o Anthropic, es DeepSeek.

Cómo rindieron DeepSeek V4.1 Flash y Gemini 3.8 Flash

Los benchmarks de dos proveedores distintos llegan hasta cierto punto, así que ejecuté una tarea de construcción en ambos modelos con el mismo prompt y las mismas herramientas.

La prueba

Pedí a ambos que construyeran una aplicación web de una sola página y con estado para un planificador de ensayos de una orquesta comunitaria. Dos funciones solicitadas explícitamente fueron la detección de conflictos por solapamiento de intervalos y la persistencia. Ambos modelos rondan el 90% en Terminal-Bench 2.1, pero el 31,2% de DeepSeek frente al 19,1% de Gemini en Terminal-Bench 4.0 sugiere una brecha en trabajos de agente más difíciles, y esta tarea es una forma compacta de buscarla.

Ambos modelos se ejecutaron dentro de OpenCode con la misma superficie de herramientas fijada: solo lectura y edición de archivos, sin shell y sin red. Ambos se ejecutaron con esfuerzo de razonamiento high, un intento cada uno, sin reintentos, y el prompt se entregó byte a byte en una sesión nueva.

Una asimetría a tener en cuenta: high es el nivel de esfuerzo más alto de Gemini, mientras que en DeepSeek equivale a 75 en una escala de 1 a 100, cuyo máximo coincide con el usado en sus puntuaciones publicadas de benchmarks.

Este fue el prompt:

Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra. 
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.

Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome). 
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.

Evalué ambos por capacidad de ejecución (falla/pasa) y en las siguientes tres rúbricas, con puntuaciones de 1 a 5:

  • Adherencia a especificaciones: ¿Implementa todas las funciones solicitadas?
  • Lógica de conflictos: ¿Detecta y muestra correctamente solapes, pero trata como no conflictivas las reservas adyacentes o en salas distintas?
  • Usabilidad y diseño: ¿Cabe en una página, se usa de forma intuitiva y se ve bien?

Qué produjo DeepSeek V4.1 Flash

DeepSeek terminó en 2 turnos con una única llamada a herramienta: escribió un index.html de 13 KB y dio por finalizado. La página es un diseño oscuro de dos paneles: un formulario para añadir ensayos a la izquierda, una cuadrícula de lunes a domingo a la derecha, con un panel de comprobación de conflictos debajo. Su comentario de cabecera explica la regla de solape: solape estricto con reservas consecutivas exentas, y la prueba confirmó que solo marca el par que se solapa.

Planificador de ensayos de DeepSeek V4.1 Flash tras añadir entradas: indicadores de solape, semana precargada con conflicto el jueves, y reservas adyacentes y en salas distintas el lunes.

Todo lo solicitado está presente y funciona, el diseño se entiende de un vistazo y su único extra no pedido, borrar entradas, ayuda. No permite editar una entrada, que tampoco se pidió. Es un 5 limpio en las tres rúbricas.

Qué produjo Gemini 3.8 Flash

Gemini necesitó 4 turnos y 3 llamadas a herramientas (un glob, una lectura y una escritura) para entregar un index.html de 76 KB (casi 6 veces el archivo de DeepSeek), y fue mucho más lento. El resultado se ve más pulido: cabecera con marca y contador en vivo de solapes, una semana de ejemplo precargada con una doble reserva intencional el miércoles para que el indicador de conflicto aparezca de inmediato, filtros por sección y sala, un conmutador de solo conflictos, vistas de columna y de cronograma, edición y borrado de entradas, un campo de notas de repertorio y un aviso en vivo mientras escribes una nueva reserva.

Planificador de ensayos de Gemini 3.8 Flash al cargar: cabecera Sinfonia con indicadores de solape, semana precargada con conflicto el miércoles, filtros y un panel de Sections and Balance

La lógica de conflictos es correcta y la prueba solo marcó el par que se solapa. El problema son los extras: un panel Sections and Balance con recuentos por sección obligó a que la columna del formulario hiciera scroll (algo en contra del prompt) y queda desubicado respecto al resto, y la cantidad de controles dificulta leer la semana frente a la versión de DeepSeek. Por eso tengo que restar un punto en adherencia a especificaciones y en diseño, aunque el resultado general es muy bueno.

Resultados

Medida DeepSeek V4.1 Flash Gemini 3.8 Flash
Turnos 2 4
Llamadas a herramientas 1 3
Capacidad de ejecución pasa pasa
Adherencia a especificaciones 5 4
Lógica de conflictos 5 5
Usabilidad y diseño 5 4
Puntuación de rúbrica (media de tres ejes) 5,0 4,3

DeepSeek V4.1 Flash gana esta prueba. Ambos resolvieron la parte difícil, la lógica de solape de intervalos, así que la diferencia fue de criterio: DeepSeek construyó lo pedido en una sola escritura, mientras Gemini construyó un pequeño producto, y una función no solicitada perjudicó el diseño sobre el que se evaluaba. La versión de Gemini es la que enseñaría a un gerente de orquesta; la de DeepSeek es la que preferiría que me entregara un colega.

Es una sola ejecución de una tarea a un nivel de esfuerzo, así que no dice nada de uso de tokens o coste, y solo explora UI con estado más lógica de solapes, no trabajo de largo recorrido en repositorios.

Cuándo elegir DeepSeek V4.1 Flash vs Gemini 3.8 Flash

Ningún modelo es la opción por defecto para todo el mundo, así que aquí tienes la decisión por tipo de carga.

Elige según la carga: DeepSeek V4.1 Flash para coste y control, Gemini 3.8 Flash para multimodalidad y herramientas alojadas

El cruce está en entradas, infraestructura y presupuesto: están igualados en programación con agentes, así que DeepSeek gana siempre que el coste o el control decidan, y Gemini gana cuando tus datos o tu stack son algo que DeepSeek no puede ingerir o alojar por ti.

Elige DeepSeek V4.1 Flash si...

  • Ejecutas agentes de código a gran escala. Está a la par con Gemini en Terminal-Bench 2.1 y DeepSWE v1.1, por delante en Terminal-Bench 4.0, y cobra $1,20 en lugar de $3,75 por cada 1M de tokens de salida.
  • Tu bucle de agente relee un prefijo grande. La entrada en caché cuesta $0,006 por 1M tokens frente a $0,075 de Gemini más almacenamiento por hora, una brecha de 12,5x que domina nuestra fila de carga con mucha caché.
  • Necesitas autoalojar o afinar el modelo, y tienes un nodo para ello. Los pesos con licencia MIT se ejecutan en vLLM y SGLang desde sus imágenes nocturnas y de vista previa, pero el checkpoint ronda los ~511 GB, y los despliegues verificados son una bandeja GB200 NVL4 o un nodo de 8×H200.
  • Puedes programar trabajo fuera de punta o necesitas salidas muy largas. Fuera de punta, todas las tarifas se reducen a la mitad, y el tope de 384K tokens de salida es 6x los 64K de Gemini.

Elige Gemini 3.8 Flash si...

  • Tus entradas son audio, vídeo o PDFs. DeepSeek V4.1 Flash solo acepta texto e imágenes.
  • Quieres herramientas alojadas sin construirlas. Ejecución de código, grounding con Google Search y Maps, búsqueda de archivos, contexto por URL y control del ordenador están disponibles con el mismo ID de modelo.
  • Construyes sobre el stack de Google. Está en GA en AI Studio y Gemini Enterprise, y ahora es el modelo por defecto en Antigravity.
  • Necesitas agentes de trabajo del conocimiento con evidencias publicadas. Google reporta 61,4% en Vals Finance Agent v2 y 10,0% en el benchmark legal de Harvey; DeepSeek no publica nada comparable.

Cómo empezar con DeepSeek V4.1 Flash y Gemini 3.8 Flash

Dónde puedes usar cada modelo difiere más que lo que pueden hacer, así que revisa la matriz antes de los benchmarks.

Superficie DeepSeek V4.1 Flash Gemini 3.8 Flash
App para consumidor DeepSeek app y chat.deepseek.com App de Gemini (Google AI Pro y Ultra), modo IA en Search, Gemini en Sheets
API de primer nivel Sí, DeepSeek API (formatos de solicitud tipo OpenAI y Anthropic) Sí, Gemini API vía Google AI Studio (GA)
Plataformas cloud Sin listado propio en cloud; servido por Databricks y otros, o autoalojar los pesos MIT Gemini Enterprise en Google Cloud
Agentes de código DeepSeek Harness; OpenCode, WorkBuddy y CodeBuddy (socios oficiales) Google Antigravity (modelo por defecto), Android Studio, Stitch; Cursor, OpenCode
Routers de terceros OpenRouter OpenRouter
ID de modelo en API deepseek-flash gemini-3.8-flash

La mayor diferencia de disponibilidad es que DeepSeek se puede descargar y Gemini no, mientras que Gemini es el que cuenta con una app para consumidores y una plataforma empresarial gestionada. Los IDs que debes usar son deepseek-flash y gemini-3.8-flash; el nombre heredado deepseek-v4-flash sigue resolviendo pero ya sirve V4.1 Flash.

Hacer tu primera llamada a la API

Los dos SDK difieren, así que no es un simple cambio de cadena. El endpoint de DeepSeek es compatible con OpenAI, lo que significa que el cliente estándar openai funciona con un cambio de base URL, mientras que Gemini 3.8 Flash usa la Interactions API de google-genai con un ajuste thinking_level en lugar de parámetros de muestreo.

from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
    model="deepseek-flash",  # DeepSeek V4.1 Flash
    messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai

client = genai.Client()  # reads your Google AI Studio API key
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Refactor this function...",
    generation_config={"thinking_level": "medium"},  # low, medium, or high
)
print(interaction.output_text)

Para la configuración completa, extracción de PDF y llamadas a funciones en Gemini, sigue nuestro tutorial de la API de Gemini 3.8 Flash; para el modo de pensamiento de DeepSeek y un despliegue local de la generación anterior, consulta nuestro tutorial de la API de DeepSeek V4 y nuestra guía para ejecutar DeepSeek V4 Flash con Unsloth Studio y OpenCode.

Conclusiones

Si tu carga son agentes de código, trabajos por lotes o cualquier cosa que relea prefijos largos, utiliza DeepSeek V4.1 Flash: está a la par con Gemini 3.8 Flash en los benchmarks de agentes publicados, ganó nuestra prueba de construcción en 2 turnos y cuesta un tercio antes de la subida de precio de Gemini en enero. Si tus entradas son audio, vídeo o PDFs, o quieres grounding, ejecución de código y control del ordenador desde un único endpoint alojado, usa Gemini 3.8 Flash y asume la prima.

Si quieres construir sistemas de agentes alrededor de modelos como estos, nuestro itinerario Associate AI Engineer for Developers cubre APIs, uso de herramientas y el Model Context Protocol en 29 horas, y nuestro curso Building AI Agents with Google ADK es una introducción de 1 hora en el lado de Gemini.

FAQs

¿Es mejor DeepSeek V4.1 Flash que Gemini 3.8 Flash para programar?

En los benchmarks de agentes de código que ambos publican, están igualados o DeepSeek V4.1 Flash va ligeramente por delante: 90,6% vs 89,4% en Terminal-Bench 2.1, 74,2% vs 73,7% en DeepSWE v1.1 y 31,2% vs 19,1% en Terminal-Bench 4.0. En nuestra construcción práctica del planificador, DeepSeek obtuvo 5/5/5 en 2 turnos y Gemini 4/5/4 en 4 turnos. Ambos conjuntos de puntuaciones de benchmark fueron ejecutados por los propios proveedores.

¿Cuánto más barato es DeepSeek V4.1 Flash que Gemini 3.8 Flash?

DeepSeek V4.1 Flash cuesta $0,30 por cada 1M de tokens de entrada y $1,20 por cada 1M de tokens de salida en horas punta, y la mitad fuera de punta. Gemini 3.8 Flash cuesta $0,75 y $3,75 hasta el 31 de diciembre de 2026, subiendo a $1,50 y $7,50 desde el 1 de enero de 2027. Eso hace que Gemini sea hoy 2,5x más caro en entrada y 3,1x más en salida, y 5x y 6,25x más el año que viene.

¿Puedo autoalojar DeepSeek V4.1 Flash o Gemini 3.8 Flash?

Solo puedes autoalojar DeepSeek V4.1 Flash. Sus pesos están publicados en Hugging Face bajo licencia MIT, y vLLM y SGLang pueden servirlos hoy desde imágenes Docker nocturnas y de vista previa, respectivamente, aunque ninguno lo soporta aún en una versión estable, y el soporte en Transformers sigue como PR abierto. Cuenta con un nodo completo: el checkpoint son aproximadamente 511 GB en 48 shards, y la receta de vLLM sitúa el mínimo de VRAM en 614 GB.

¿Cuáles son los IDs de modelo en API de DeepSeek V4.1 Flash y Gemini 3.8 Flash?

DeepSeek V4.1 Flash es deepseek-flash en la API de DeepSeek, que acepta solicitudes en formato OpenAI en https://api.deepseek.com y en formato Anthropic en https://api.deepseek.com/anthropic. Gemini 3.8 Flash es gemini-3.8-flash en la API de Gemini. Ambos también están listados en OpenRouter.

¿Qué modelo maneja audio, vídeo y PDFs: DeepSeek V4.1 Flash o Gemini 3.8 Flash?

Gemini 3.8 Flash acepta entradas de texto, imagen, vídeo, audio y PDF y añade herramientas alojadas como ejecución de código, grounding con Google Search y control del ordenador en vista previa. DeepSeek V4.1 Flash acepta solo texto e imágenes, pero permite hasta 384K tokens de salida frente a los 64K de Gemini, y ambos ofrecen una ventana de contexto de 1M de tokens.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Editor de ciencia de datos en DataCamp | Me encanta hacer previsiones y crear con API.

Temas
Inteligencia Artificial
Grandes modelos lingüísticos

¡Aprende IA con DataCamp!

programa

Fundamentos de agentes de IA

6 h
¡Descubre cómo los agentes de IA pueden transformar tu forma de trabajar y aportar valor a tu organización!
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow