跳至内容

DeepSeek V4.1 Flash vs Gemini 3.8 Flash:基准、定价与使用场景

DeepSeek 的开源权重 V4.1 Flash 以三分之一成本在编码智能体基准上匹配 Gemini 3.8 Flash。我们对比规格、成本,并进行了一次实操构建测试。
更新 2026年9月17日  · 14分钟

用 AI 探索

ChatGPTClaudePerplexity

Google 于 2026 年 9 月 2 日发布了 Gemini 3.8 Flash,这是其六周内第三次更新 Flash 级别模型。八天后,DeepSeek 推出 DeepSeek V4.1 Flash,一款采用 MIT 许可、552B 专家混合(MoE)模型,输入阶段激活 80 亿参数,输出阶段激活 160 亿参数。

两家厂商都将其模型定位为编码智能体的“主力机型”,并在关键基准上取得相近成绩。这让选择更具难度,不再是常见的开源对闭源的简单叙事,因为更便宜的那款并未在两者共有的基准上表现更弱。

本文将从基准测试、价格、开放性、多模态能力,以及我在两者上进行的一次实操构建测试,全面比较 DeepSeek V4.1 Flash 与 Gemini 3.8 Flash。

如需分别了解各模型的更深入内容,请参阅我们的 DeepSeek V4.1 Flash 指南Gemini 3.8 Flash 与 3.8 Flash Cyber 指南

要点速览

  • 在两家同时公布的所有编码智能体基准上,DeepSeek V4.1 Flash 与 Gemini 3.8 Flash 旗鼓相当或略胜一筹,并在我们的排班器实测中以一半轮次取胜。
  • 目前 Gemini 3.8 Flash 的输入 token 单价高 2.5 倍、输出 token 单价高 3.1 倍;其价格将于 2027 年 1 月 1 日翻倍。
  • Gemini 3.8 Flash 覆盖更广:支持音频、视频、PDF 输入,并内置 Google 托管工具。
  • 高并发编码智能体、批处理、重缓存循环,或任何需要自托管的场景,优先选择 DeepSeek V4.1 Flash。
  • 当输入是多模态、您构建在 Google AI Studio 或 Antigravity 内,或需要具备公开领域成绩的知识型智能体时,选择 Gemini 3.8 Flash。

什么是 DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的开源权重、MIT 许可的专家混合模型,是一套新架构家族中最小的成员。

根据其 V4.1 技术报告,其 KV 缓存每个 token 需要 890 字节,约为 DeepSeek V4 Flash 的四分之一,这也是其大幅节省成本的主要来源。

完整解析请阅读我们的 DeepSeek V4.1 Flash 指南;上一代本地部署教程见 使用 Unsloth Studio 与 OpenCode 运行 DeepSeek V4 Flash

什么是 Gemini 3.8 Flash?

Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日发布的最强 Flash 级模型,基于 Gemini 3.7 Flash 打造,于其发布后三周推出。

其核心设计取向是“更努力”:面对复杂任务,会执行额外的推理步骤并迭代调用工具;Google 表示在更高“努力等级”下可能消耗更多 token。

我们的 Gemini 3.8 Flash 指南 涵盖了发布详情及限量访问的 Cyber 变体;Gemini 3.8 Flash API 教程 则讲解了 Interactions API、思考等级以及 Python 中的函数调用。

DeepSeek V4.1 Flash vs Gemini 3.8 Flash:正面交锋

从下述六个维度看,DeepSeek V4.1 Flash 在价格与开放性上取胜,并在编码方面打成平手;Gemini 3.8 Flash 则在输入类型、工具链与公开的知识型任务结果上占优。

DeepSeek V4.1 Flash 以约三分之一价格在编码上匹配 Gemini 3.8 Flash

特性 DeepSeek V4.1 Flash Gemini 3.8 Flash
发布日期 2026 年 9 月 10 日 2026 年 9 月 2 日
权重与许可 开源,MIT 闭源,托管
架构 552B MoE,预填充激活 8B,解码激活 16B 未披露;基于 Gemini 3.7 Flash
上下文/最大输出 100 万 tokens / 38.4 万 100 万 tokens / 6.4 万
输入类型 文本、图像 文本、图像、视频、音频、PDF
Terminal-Bench 2.1 90.6% 89.4%
DeepSWE v1.1 74.2% 73.7%
推理努力等级 lowhighmax(API 上层,底层为 1-100 的整数) lowmediumhigh
API 价格,输入/输出(每 100 万) $0.30 / $1.20(高峰) $0.75 / $3.75(至 2026 年底;之后翻倍)

编码与智能体工作流

在两家表格同时出现的三项智能体基准上,DeepSeek V4.1 Flash 均领先,尽管其中两项差距小到可视为持平。

真正拉开差距的是更难的一般智能体套件 Terminal-Bench 4.0:DeepSeek 为 31.2%,Gemini 为 19.1%。两家都承认该套件暴露短板;DeepSeek 表示在科学类智能体任务上与巨型模型仍有差距,而 Google 自己的表格显示 Claude Opus 5 为 51.8%。

基准 DeepSeek V4.1 Flash Gemini 3.8 Flash 备注
Terminal-Bench 2.1 90.6% 89.4% 均为厂商自测;两表均显示 Claude Opus 5 为 89.1%
DeepSWE v1.1 74.2% 73.7% 均为厂商自测;两表均显示 Claude Opus 5 为 74.0%
Terminal-Bench 4.0 31.2% 19.1% 最难的共同套件;两表均显示 Opus 5 为 51.8%

两点注意:

  • DeepSeek 的分数基于其最高手段等级;技术报告称相较低等级,其输出 token 成本约为 2.5 倍。同一报告指出,60 到 80 的努力等级能以远低于一半的 token 恢复大部分准确率,因此“max”应保留给高难任务。
  • 测试框架不同,但对照列几乎完全对齐,因此这些表格比多数跨厂商对比更具可比性。

对于以终端为主的编码智能体,两者可视为并驾齐驱,让价格与部署方式来决定;在最难的智能体任务上,DeepSeek 的已公布优势是唯一上榜的差异。

定价:您实际要付多少钱

价格这一维度没有悬念,更有价值的问题是:差距会随您的工作负载形态发生多大变化。

在所有工作负载形态下,Gemini 3.8 Flash 的成本是 DeepSeek V4.1 Flash 的 2.8x 到 4.5x

DeepSeek V4.1 Flash 在每一行都更便宜,且工作负载越依赖输出 token 或缓存前缀,差距越大。倍数并不均一:输入为 2.5 倍,输出为 3.1 倍,缓存读取为 12.5 倍。

Token 费率并排对比

费率 DeepSeek V4.1 Flash(高峰) Gemini 3.8 Flash(至 2026-12-31)
输入,每 100 万 tokens $0.30 $0.75
输出,每 100 万 tokens $1.20 $3.75
缓存输入读取,每 100 万 tokens $0.006 $0.075,另加每小时每 100 万 tokens $0.50 的存储费
折扣通道 非高峰:除工作日 UTC 01:00-04:00 与 06:00-10:00 外全部半价 Batch 或 Flex:五折($0.375 / $1.875)
推理 tokens 计费为 输出 输出
自 2027 年 1 月 1 日起 未宣布变更 $1.50 / $7.50;缓存读取 $0.15

差异主要体现在“输出溢价”上。Gemini 的输出费率是 DeepSeek 的 3.1 倍,而输入是 2.5 倍,因此生成密集与思考密集的任务付费更高,且两家均按输出费率计费推理 tokens。

真实工作负载要花多少钱

工作负载 DeepSeek V4.1 Flash Gemini 3.8 Flash 差额
均衡助理:100 万入 / 25 万出 $0.60 $1.69 $1.09,Gemini 高 181%
生成密集:100 万入 / 400 万出 $5.10 $15.75 $10.65,Gemini 高 209%
重缓存循环:10 万前缀写入一次,读取缓存 1,000 次,且每次另有 5K 新入 / 1K 新出 $3.33 $15.13 $11.80,Gemini 高 354%

计算公式为(体量 ÷ 100 万)× 费率,对输入与输出分别求和,DeepSeek 按高峰价、Gemini 按优惠期价。重缓存一行对 1,000 次读取使用各自的缓存读取费率,并假设 Gemini 缓存保存 1 小时,增加 $0.05 存储费。

重缓存这一行最具看点,因为 DeepSeek $0.006 的缓存读取价让 10 万 token 的前缀几乎免费重读,而 Gemini 对同样的 1 亿缓存 tokens 收取 $7.50。

将 DeepSeek 安排在非高峰时段,上述每一行费用减半;等到明年 1 月,Gemini 的每一行费用翻倍,均衡助理就变成 $3.38 对 $0.60。

开放性、架构与部署

两者之中,只有 DeepSeek V4.1 Flash 可下载,其架构也是其低价的原因。技术报告描述为 20 层因果编码器接 20 层解码器,采用 Compressed Sparse Attention 2、FP4 KV 缓存,KV 缓存从 V4 Flash 的每 token 3,514 字节降至 890 字节。

不过,这些 MIT 许可权重 的服务化仍处早期:vLLM 与 SGLang 还在 nightly 与预览版本中支持,Transformers 尚未支持。

如果您需要数据属地、在本地机房推理或微调,只有 DeepSeek 可选;如果您想零基础设施使用,Gemini 的 GA 托管端点更简单。

多模态、上下文与内置工具

Gemini 3.8 Flash 接受文本、图像、视频、音频与 PDF,而 DeepSeek V4.1 Flash 接受文本与图像。两者均提供 100 万 token 的上下文窗口,但 DeepSeek 允许最高 38.4 万输出 tokens,Gemini 为 6.4 万,这对长代码生成与整文改写意义重大。

Gemini 的 模型页面 还列出了 DeepSeek 尚无等价物的托管工具:代码执行、Google 搜索与地图校准、文件搜索、URL 上下文,以及预览中的计算机使用。DeepSeek 的 API 侧则提供 JSON 输出、工具调用、Responses API、Anthropic 格式端点,以及前缀与中间填充式补全。

如果您的输入包含音频或视频,或希望无需自建检索就能获得校准,选 Gemini;如果您需要长输出,并希望与现有 OpenAI 或 Anthropic 客户端代码即插即用,则选 DeepSeek。

DeepSeek V4.1 Flash 与 Gemini 3.8 Flash 的实测表现

来自两家厂商的基准仅能说明一部分,因此我在两者上用相同提示与相同工具,跑了一次构建任务。

测试内容

我要求两者构建一个社区乐团排练日程的有状态单文件 Web 应用。我们明确要求的两项功能是区间重叠冲突检测与持久化。两者在 Terminal-Bench 2.1 上都接近 90%,但 DeepSeek 在 Terminal-Bench 4.0 上为 31.2%,Gemini 为 19.1%,暗示在更难的智能体工作上存在差距,此任务是个紧凑的检验方式。

两者均在 OpenCode 中运行,工具面板完全一致且固定:仅允许读写文件,无 shell、无网络。两者均以 high 推理努力等级运行,各一次机会、无重试,提示逐字节发送至全新会话。

需要注意一个不对称:high 是 Gemini 的最高努力等级,而在 DeepSeek 上对应 1 到 100 标尺中的 75,其最高值才与其公布基准分数时使用的相同。

提示如下:

Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra. 
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.

Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome). 
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.

我从可运行性(失败/通过)以及以下三项量表进行评分,每项 1 到 5 分:

  • 规格符合度:是否实现了我要求的全部功能?
  • 冲突逻辑:能否成功检测并展示重叠,同时将相邻预订或不同房间的预订视为不冲突?
  • 可用性与布局:是否单页可视、直观易用、观感良好?

DeepSeek V4.1 Flash 的产出

DeepSeek 用 2 个回合、1 次工具调用完成:写出一个 13 KB 的 index.html 并宣告结束。页面为深色的双栏布局,左侧为添加排练表单,右侧为周一至周日网格,下方为冲突检查面板。其头部注释清楚写明重叠规则:仅严格重叠算冲突、背靠背不算;探测确认仅标记了重叠的那一对。

添加条目后 DeepSeek V4.1 Flash 的排练排程器:冲突标记、预置一周数据(周四房间冲突),以及周一的相邻与不同房间预订。

所要求的内容一应俱全且运作正常,布局一目了然;其唯一的“额外”——删除条目——也有帮助。不支持编辑条目,但提示也未要求。三项量表均为满分 5 分。

Gemini 3.8 Flash 的产出

Gemini 用了 4 个回合与 3 次工具调用(glob、读取、然后写入),最终交付一个 76 KB 的 index.html(几乎是 DeepSeek 文件的 6 倍),速度也慢得多。成品观感更精致:带品牌的页眉与实时冲突计数器、预置一周示例(周三故意双订以便立即显示冲突)、分部与房间筛选、仅看冲突开关、列视图与时间轴视图、编辑与删除条目、曲目备注字段,以及新建预订时的实时警告预览。

Gemini 3.8 Flash 的排练排程器加载界面:Sinfonia 页眉带冲突标记、预置一周(周三房间冲突)、筛选器,以及“分部与平衡”面板

冲突逻辑正确,探测仅标记重叠的一对。问题在于“加料”:带每个分部场次计数的“分部与平衡”面板迫使表单列出现滚动(与提示相悖),且在整体布局下显得突兀;同时控件数量过多,使得周视图不如 DeepSeek 的清爽易读。因此我在规格符合度与布局各扣 1 分,不过总体质量仍然很高。

结果

指标 DeepSeek V4.1 Flash Gemini 3.8 Flash
回合数 2 4
工具调用 1 3
可运行性 通过 通过
规格符合度 5 4
冲突逻辑 5 5
可用性与布局 5 4
量表分(3 轴均值) 5.0 4.3

本次测试由 DeepSeek V4.1 Flash 取胜。两者都搞定了难点(区间重叠逻辑),差异归于取舍:DeepSeek 一次写就按需构建;Gemini 做成了一个“小产品”,而某个未请求的功能影响了评分所依据的布局。若要向乐团经理演示,我会选 Gemini 的版本;若要同事交付给我继续迭代,我更愿意拿到 DeepSeek 的版本。

这只是一次、在一个努力等级下的单项任务测试,未涵盖 token 使用或成本,也仅检验了有状态 UI 与重叠逻辑,不涉及长周期的代码库工作。

何时选择 DeepSeek V4.1 Flash 或 Gemini 3.8 Flash

两者都不是对所有人的“默认之选”,因此按工作负载给出建议。

按工作负载选择:DeepSeek V4.1 Flash 适合成本与可控性,Gemini 3.8 Flash 适合多模态与托管工具链

分叉点在输入、基础设施与预算:两者在编码智能体上势均力敌,因此当成本或可控性决定胜负时,DeepSeek 取胜;当您的数据或技术栈是 DeepSeek 无法摄入或托管的,Gemini 取胜。

如符合以下情形,选择 DeepSeek V4.1 Flash:

  • 您要大规模运行编码智能体。 它在 Terminal-Bench 2.1 与 DeepSWE v1.1 上与 Gemini 持平,在 Terminal-Bench 4.0 上领先,且每 100 万输出 tokens 收费 $1.20,而非 $3.75。
  • 您的智能体循环会多次重读大型前缀。 缓存读取每 100 万 tokens 收费 $0.006,而 Gemini 为 $0.075 且叠加小时存储费,12.5 倍差距在重缓存场景中占主导。
  • 您需要自托管或微调,且手头有节点。 MIT 许可权重可用 vLLM 与 SGLang 的 nightly/preview 镜像服务,但检查点约 511 GB,已验证部署为一台 GB200 NVL4 机箱或一台 8×H200 节点。
  • 您能在非高峰调度,或需要超长输出。 非高峰全部费率减半,且 38.4 万的输出上限是 Gemini 6.4 万的 6 倍。

如符合以下情形,选择 Gemini 3.8 Flash:

  • 您的输入包含音频、视频或 PDF。 DeepSeek V4.1 Flash 仅支持文本与图像。
  • 您希望直接使用托管工具而非自建。 代码执行、Google 搜索与地图校准、文件搜索、URL 上下文与预览中的计算机使用,均在同一模型 ID 下可用。
  • 您构建在 Google 的栈上。 它已在 AI Studio 与 Gemini Enterprise GA,且如今是 Antigravity 的默认模型。
  • 您需要有公开证据的知识型智能体。 Google 报告在 Vals Finance Agent v2 上为 61.4%,在 Harvey 的 Legal Agent Benchmark 上为 10.0%;DeepSeek 未公布可比数据。

如何开始使用 DeepSeek V4.1 Flash 与 Gemini 3.8 Flash

能在哪些界面触达两款模型的差异,远大于它们功能的差异,因此在看基准前请先看此矩阵。

使用界面 DeepSeek V4.1 Flash Gemini 3.8 Flash
消费者应用 DeepSeek 应用与 chat.deepseek.com Gemini 应用(Google AI Pro 与 Ultra)、搜索中的 AI 模式、Gemini for Sheets
第一方 API 有,DeepSeek API(兼容 OpenAI 与 Anthropic 请求格式) 有,经由 Google AI Studio 的 Gemini API(GA)
云平台 无第一方云上架;可由 Databricks 等提供,或自托管 MIT 权重 Google Cloud 上的 Gemini Enterprise
编码智能体 DeepSeek Harness;OpenCode、WorkBuddy 与 CodeBuddy(官方合作) Google Antigravity(默认模型)、Android Studio、Stitch;Cursor、OpenCode
第三方路由器 OpenRouter OpenRouter
API 模型 ID deepseek-flash gemini-3.8-flash

最大的可用性差异是 DeepSeek 可下载而 Gemini 不可,而 Gemini 拥有消费者应用与托管的企业平台。您需要填写的 ID 分别是 deepseek-flashgemini-3.8-flash;旧名 deepseek-v4-flash 仍可解析,但已由 V4.1 Flash 提供服务。

发出您的第一条 API 调用

两者 SDK 不同,因此并非“一行替换”。DeepSeek 的端点兼容 OpenAI,这意味着更改 base URL 后可直接使用标准的 openai 客户端;Gemini 3.8 Flash 则使用 google-genai 的 Interactions API,并以 thinking_level 代替采样参数。

from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
    model="deepseek-flash",  # DeepSeek V4.1 Flash
    messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai

client = genai.Client()  # reads your Google AI Studio API key
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Refactor this function...",
    generation_config={"thinking_level": "medium"},  # low, medium, or high
)
print(interaction.output_text)

完整的安装配置、PDF 提取与 Gemini 上的函数调用,请参阅我们的 Gemini 3.8 Flash API 教程;关于 DeepSeek 的思考模式与上一代的本地部署,请参阅我们的 DeepSeek V4 API 教程 以及 使用 Unsloth Studio 与 OpenCode 运行 DeepSeek V4 Flash 指南。

最后的想法

如果您的工作负载是编码智能体、批处理,或任何需要多次重读长前缀的任务,请选 DeepSeek V4.1 Flash:它在已公布的智能体基准上与 Gemini 3.8 Flash 持平,在我们的构建测试中以 2 个回合取胜,且在 Gemini 明年涨价前其成本仅为后者的三分之一。若您的输入是音频、视频或 PDF,或您希望从一个托管端点获得校准、代码执行与计算机使用,请选 Gemini 3.8 Flash,并接受其溢价。

如果您希望围绕此类模型搭建智能体系统,我们的 面向开发者的 AI 工程师(入门) 路线用 29 小时覆盖 API、工具使用与模型上下文协议(MCP);我们的 使用 Google ADK 构建 AI 智能体 课程可在 Gemini 侧以 1 小时上手。

常见问题

DeepSeek V4.1 Flash 是否比 Gemini 3.8 Flash 更适合编码?

在两家同时公布的编码智能体基准上,两者持平或由 DeepSeek V4.1 Flash 略胜:Terminal-Bench 2.1 为 90.6% vs 89.4%,DeepSWE v1.1 为 74.2% vs 73.7%,Terminal-Bench 4.0 为 31.2% vs 19.1%。在我们的排班器实操中,DeepSeek 以 2 个回合拿到 5/5/5,Gemini 以 4 个回合拿到 4/5/4。两组基准分均为厂商自测。

DeepSeek V4.1 Flash 比 Gemini 3.8 Flash 便宜多少?

DeepSeek V4.1 Flash 在高峰时段每 100 万输入 tokens 收费 $0.30、每 100 万输出 tokens 收费 $1.20,非高峰半价。Gemini 3.8 Flash 至 2026 年 12 月 31 日为 $0.75 与 $3.75,自 2027 年 1 月 1 日起涨至 $1.50 与 $7.50。这意味着目前 Gemini 的输入与输出分别贵 2.5 倍与 3.1 倍,明年将分别贵 5 倍与 6.25 倍。

我能自托管 DeepSeek V4.1 Flash 或 Gemini 3.8 Flash 吗?

只有 DeepSeek V4.1 Flash 可以自托管。其权重以 MIT 许可发布在 Hugging Face 上,vLLM 与 SGLang 今日即可通过各自的 nightly 与预览版 Docker 镜像提供服务,但两者均尚未在正式版中支持,Transformers 支持仍为开放 PR。请预留整机预算:检查点约 511 GB、48 片分片,vLLM 的配方将 VRAM 下限设为 614 GB。

DeepSeek V4.1 Flash 与 Gemini 3.8 Flash 的 API 模型 ID 是什么?

DeepSeek V4.1 Flash 在 DeepSeek API 上的模型 ID 为 deepseek-flash,该 API 在 https://api.deepseek.com 接受 OpenAI 格式请求、在 https://api.deepseek.com/anthropic 接受 Anthropic 格式请求。Gemini 3.8 Flash 在 Gemini API 上的模型 ID 为 gemini-3.8-flash。两者也都在 OpenRouter 上线。

哪款模型能处理音频、视频和 PDF:DeepSeek V4.1 Flash 还是 Gemini 3.8 Flash?

Gemini 3.8 Flash 接受文本、图像、视频、音频与 PDF 输入,并提供托管工具,如代码执行、Google 搜索校准与预览中的计算机使用。DeepSeek V4.1 Flash 仅支持文本与图像,但允许最高 38.4 万输出 tokens,相较 Gemini 的 6.4 万更长;两者的上下文窗口均为 100 万 tokens。

主题
人工智能
大语言模型

在 DataCamp 学习 AI!

Tracks

AI智能体基础知识

6小时
了解 AI 智能体如何改变你的工作方式,并为你的组织创造价值!
查看详情Right Arrow
开始课程
查看更多Right Arrow