DeepSeek-V4-Flash:跑得快没奖励,跑得慢有惩罚

DeepSeek-V4-Flash 正式版,是怎么把整个 AI 行业逼到墙角的

DeepSeek-V4-Flash:跑得快没奖励,跑得慢有惩罚

2026 年 7 月 31 日下午,DeepSeek 干了一件很"DeepSeek"的事。

没有发布会,没有倒计时海报,没有 CEO 站在聚光灯下说"这是我们迄今为止最激动人心的模型"。他们只是在 API 文档的更新日志里,加了一行字:DeepSeek-V4-Flash 正式版 API 上线公测。

然后全球开发者社区就炸了。

有意思的是,就在前一天,OpenAI 刚刚紧急宣布 GPT-5.6 Luna 全线降价 80%——上线才三周的模型,输入价格从 1 美元砍到 0.2 美元,输出从 6 美元砍到 1.2 美元。这个时间点巧得让人起疑:一边是硅谷连夜挥刀自砍,一边是杭州轻描淡写更新日志。

结果是:OpenAI 砍完 80% 之后,跑同样的任务,还是比 DeepSeek 贵大约 60%。

这就很尴尬了。

一、先看这件事有多离谱:模型没换,脑子换了

在讲行业影响之前,得先把技术上那个"反直觉"的点说清楚,因为它是后面一切的地基。

V4-Flash 正式版(版本号 0731),和 4 月发的预览版,是同一个模型。

不是"架构微调",不是"扩了点参数",是完全一样

项目 V4-Flash-Preview(4月) V4-Flash-0731(正式版)
总参数 2840 亿 2840 亿
激活参数 130 亿 130 亿
架构 MoE MoE
上下文 100 万 token 100 万 token
价格 输入 $0.14 / 输出 $0.28 一分钱没涨

那到底改了什么?官方说得很朴素:重新做了一遍后训练(Post-Training)。

就这。骨架没动,发动机没换,只是重新调了一遍油路和电控。

然后成绩单变成了这样:

基准测试 预览版 正式版 变化
DeepSWE(真实代码仓库修复) 7.3 54.4 涨了 6 倍多
Terminal Bench 2.1(终端连续操作) 61.8 82.7 +20.9
Cybergym(网络安全攻防) 76.7
Toolathlon Verified(多工具协同) 70.3
DSBench-FullStack(全栈开发) 68.7
DSBench-Hard(高难编码) 59.6

DeepSWE 从 7.3 涨到 54.4 是什么概念?打个不太严谨的比方:一个学生上学期期末考 7 分,这学期考了 54 分,中间他没换脑子、没补课本,只是终于学会了怎么答题

更炸裂的是横向对比。官方公布的九项 Agent 与代码基准,V4-Flash 正式版全部超过了自家的 V4-Pro 预览版——那个总参数 1.6 万亿、激活 490 亿的旗舰。

也就是说:用 Pro 六分之一的总参数、不到四分之一的激活参数,把自家旗舰按在地上摩擦。 在 DeepSWE 这一项上,分差高达 41.6 分。

行业里"Pro 强、Flash 弱"的分层信仰,当场碎了一地。

这说明了什么?

一个被严重低估的事实:预训练决定能力上限,后训练决定这个上限能兑现多少。

过去两年,所有人都在卷预训练——卷参数、卷算力、卷数据量。2026 年上半年更是进入"万亿参数时代":4 月 DeepSeek V4-Pro 预览版 1.6 万亿开局,7 月阿里 Qwen 3.8-Max 推到 2.4 万亿,同月月之暗面 Kimi K3 以 2.8 万亿登顶开源模型规模之王。

大家默认的逻辑是:更大 = 更强

V4-Flash-0731 说:不一定。它在 4 月的时候,脑子里其实已经装着这些能力了,只是不知道怎么用。后训练做的事情,是教它"打开终端 → 调用工具 → 改代码 → 跑测试 → 修 Bug → 继续改"这套 Agent 完整链路——从"回答问题"变成"完成任务"。

同时首次亮相的还有 DeepSeek 自研的 Agent 测试框架 DeepSeek Harness,用极简模式跑分。工程侧的优化和训练侧的优化产生了协同效应。

用一位分析师的说法:AI 发展不只需要大力出奇迹,还得慢工出细活。

二、真正的核弹:那张价格表

技术上的惊喜是"哇好厉害",价格上的冲击才是"卧槽这怎么活"。

V4-Flash 正式版定价(每百万 Token):

类型 美元 人民币
输入(缓存未命中) $0.14 约 1 元
输入(缓存命中) $0.0028 约 0.02 元
输出 $0.28 约 2 元

注意那个缓存命中价:0.02 元/百万 Token。缓存折扣高达 98%,而行业大多数厂商是 90%。在 Agent 场景下——固定系统提示词反复复用、多轮工具调用——这个折扣是能吃满的。

现在把它和"厉害的那些"放一起:

模型 输入($/M) 输出($/M) 智能指数 (AAII)
DeepSeek V4-Flash 0.14 0.28 50
GPT-5.6 Luna(已降价80%) 0.20 1.20 51
Anthropic Haiku 4.5 1.00 5.00
Claude Opus 4.8 85 倍 V4-Flash 约 56
Gemini 3.6 Flash 50(打平)

第三方评测机构 Artificial Analysis 给 V4-Flash 的智能指数打了 50 分,比自己上一代高 10 分,比 V4-Pro 预览版高 6 分,追平 Gemini 3.6 Flash,只落后 GPT-5.6 Luna 一分

而在 ALE 基准上,V4-Flash 和全球顶级的 Claude Opus 4.8 只差半分

半分。价格差 85 倍。

再翻译一遍:Opus 多拿了那 6 分综合智能,但跑完同一套评测的账单,高出约 52 倍。

这已经不是性价比的差距了,这是计量单位级别的错位。就像有人跟你比谁跑得快,你报的是"秒",他报的是"分钟"。

开发者的真实账单,比参数表更有说服力

跑分终究是实验室数据,真正让海外开发者集体破防的,是他们自己刷卡时看到的数字:

  • @tonbistudio:整整一天,用 V4-Flash 跑了一堆多小时的复杂任务,总共花了 0.31 美元。而上周同样的任务用 Kimi K3 之类的模型,花了 35 美元。“剧透一下:贵的那些也没强 100 倍。”
  • @CommandCodeAI:同一个游戏设计提示词,Kimi K3 单次调用 0.0740 美元,GLM 5.2 是 0.0480 美元,V4-Flash 是 0.0005 美元——便宜 150 倍。(诚实地说,V4-Flash 在边缘细节上确实糙了点。)
  • @SciTechera:在 Terminal-Bench 2.1 上完成单个基准任务,估算成本 0.03 美元
  • @RoundtableSpace:对比刚发布的 Opus 5——Opus 一次成功,DeepSeek 试了三次。但 Opus 输出了 3000 行代码,DeepSeek 用约 900 行就搞定了,单次成本约 1 美分。

最后这条特别有意思:贵的模型一次搞定,便宜的模型试三次。但便宜的模型试三次的总成本,还不到贵模型的百分之一——而且代码更精简。

在 Agent 时代,"一次做对"不再是唯一的美德,"错了也无所谓,反正重来一次只要一分钱"变成了一种全新的工程哲学。

Bold Metrics 的 CTO Morgan Linton 说得更直白:对于需要成千上万次 API 调用的工业级 Agent 工作流,这种价格让"大批量自动化试错"第一次具备了财务可行性。

以前你不敢让 AI 反复尝试,因为每一次尝试都在烧钱。现在你可以了。这不是省钱,这是换了一种做事方式

三、“斩杀线”:这个词是怎么来的,又为什么这么准

发布之后,中英文社区不约而同地造出了同一个概念。

中文叫斩杀线,英文叫 Kill Line

它的定义特别精确,值得逐字读:

斩杀线不是性能分水岭,而是性能与价格的平衡临界值。

  • 同一能力梯队中,定价显著高于 DeepSeek 的模型,将持续流失中小开发者;
  • 性能弱于 DeepSeek、成本却更高的产品,生存空间快速萎缩。

北京市社会科学院副研究员王鹏在接受《环球时报》采访时的表述更简洁:Codex 和 Claude 划定上限,DeepSeek 划定"斩杀线"——追平它,你就没有溢价空间了;落后它,你就出局了。

这就回到了本文开头那句话。用一个游戏化的说法:

跑得快没奖励,跑得慢有惩罚

这是一个残酷到近乎优雅的博弈结构:

如果你比 DeepSeek 强一点点(跑得快):

  • 你得证明"多出来的那几分能力",值得客户多付 50 倍的钱
  • 但 80% 的日常任务根本用不上那几分
  • 所以你拿不到与投入成正比的市场份额 → 没奖励

如果你比 DeepSeek 弱、还比它贵(跑得慢):

  • 你没有任何存在的理由
  • 中小开发者用脚投票,一夜之间迁移完毕
  • 有惩罚,而且是死刑

如果你和它差不多贵、差不多强:

  • 恭喜,你成了一个可被随时替换的商品(commodity)

海外社区把这个感受表达得更生动。X 用户 @FoxRick01 说:

“Anthropic 被 Codex 打了一整周,现在又被便宜 100 倍的 DeepSeek 打。他们现在看起来像是卖菲亚特、收法拉利价钱的销售员。”

于是"法拉利的性能,自行车的价格"成了这次发布的标志性调侃。

一位从事 AI 创业孵化的人士说得更狠:

“梁文锋似乎站在了市面上所有模型玩家的对立面。所有 AI 公司都在他前面奔跑——不管用什么方式,它们必须跑到 DeepSeek 前面,才能活着。”

四、48 小时之内,整个行业开始重新算账

嘴上说说是一回事,Token 流向是另一回事。数据不会撒谎。

调用量:一个模型,打赢了一群模型

OpenRouter(全球最大的模型聚合平台)7 月 27 日 – 8 月 2 日的周度数据:

排名 模型 周调用量
🥇 1 DeepSeek-V4-Flash 7.22 万亿 Token
🥈 2 小米 MiMo-V2.5 6.30 万亿
🥉 3 腾讯 HY3 4.82 万亿
4 DeepSeek-V4-Pro 3.28 万亿
5 智谱 GLM-5.2 2.89 万亿

前五名,全部是中国模型。

再看总量:全球总调用 56.8 万亿 Token,其中上榜的中国大模型周调用量 28.13 万亿,美国大模型 4.38 万亿。中国模型的周调用量已经连续 14 周超过美国。

编程平台 OpenCode 的 CEO Jay 在 8 月 1 日发文:V4-Flash 上线后,平台单日调用量增长 30%,OpenCode Go 的新订阅用户也增长了 30%。"DeepSeek 一天消耗 8 万亿"直接冲上热搜——不是烧掉 8 万亿资金,是单日处理 8 万亿 Token。

单一模型、单一入口的单日消耗,超过了海外数百款模型加起来的日均总和。

硅谷的反应:连夜改价格表

这波价格战的猛烈程度,是 AI 史上前所未见的:

厂商 动作
OpenAI GPT-5.6 Luna 降价 80%(上线仅三周);Terra 降 20%;旗舰 Sol 维持不动
Anthropic Claude Opus 5 降价
Google 推出低价 Gemini Flash 系列应对
Mistral 重新调整商业化方案,靠开源免费 + 云端优惠守住开发者盘
中小开源服务商 被迫重算成本,放弃"靠 API 毛利盈利"的幻想

OpenAI 的策略写在脸上:旗舰 Sol 的溢价一分不让,用中低端产品的激进降价,拦截客户流失。 保住高端护城河,把中端市场当防线来打。

问题是——这条防线,砍完 80% 之后依然比 DeepSeek 贵 60%。

企业侧:Token 经济学的崩塌

真正的压力其实来自更早,V4-Flash 只是压垮骆驼的最后一根稻草:

  • Uber:5000 名工程师中 84% 启用了 Agent 式编码,人均月度 API 成本飙到 500–2000 美元区间,四个月烧光全年 AI 预算。CTO Praveen Neppalli Naga 坦言"原定预算已被彻底击穿"。
  • Lindy(旧金山,25 人 AI 创业公司):把 100% 的流量从 Anthropic 全面切向 DeepSeek,预计省下数百万美元。
  • 微软:悄悄把 DeepSeek 塞进了 Copilot 底层引擎的评估名单。
  • CNBC 调查:自 2026 年 2 月 8 日起,中国模型在 OpenRouter 上的美国企业 Token 用量占比每周稳定在 30% 以上,峰值 46%

为什么企业撑不住了?因为 Agent 改变了消耗结构。OpenRouter 数据显示:Agent 式工作流每个请求的 Token 消耗量,是人机对话的 15 倍。

一个看似简单的自然语言指令,实际要拆解成:意图理解 → 环境感知 → 文件检索 → 工具调用 → 代码生成 → 自我修正 → 再来一遍。乘数效应瞬间放大 Token 消耗。

在这个结构下,单价的微小差异会被放大成账单上的天文数字。于是"能力溢价"的旧范式,输给了"成本效率"的新范式。

五、它到底扮演什么角色?三个身份

聊到这里,可以给 V4-Flash 在 AI 产业里的位置下个判断了。它不是"最强模型",也不只是"最便宜的模型",它同时扮演着三个更微妙的角色。

角色一:定价的"锚",而不是性能的"顶"

顶不是它的。上限依然由 Claude Opus 4.8、GPT-5.6 Sol、Kimi K3 这些巨兽划定。

是它划的。而且这个底一旦划下来,就变成了所有人的参照系。

这才是最要命的地方:一个定价锚点,比一个性能冠军更能改变行业结构。 性能冠军只影响"最难的那 5% 任务",定价锚点影响"所有任务"。

DeepSeek 走的也不是烧钱补贴的路子。它的低价来自底层工程优化——高效推理架构、动态 KV 缓存、流量峰谷调度、长文本优化——是把成本真的做下来了,不是亏钱换市场。这意味着这条线不会因为补贴结束而回弹

《财富》杂志还指出,V4 系列的研发与华为底层芯片生态做了紧密适配。随着昇腾系列软硬件协同效率提升,推理成本还有进一步下探空间

角色二:默认选项的重新分配者

"斩杀线"真正斩掉的,不是所有高端模型,而是——

对旗舰模型"不计成本"的默认调用习惯。

这句话值得再读一遍。

以前的工作流是:默认上最强的,反正能力越强越保险。 现在的工作流是:先问一句,这活儿真的需要旗舰吗?

写一段代码、改一份文案、整理会议纪要、跑一轮自动化测试——先交给低成本且完成率足够的模型;只有遇到复杂推理、长链路 Agent、高风险场景,才升级到昂贵旗舰。

高价模型仍然有位置,但它必须证明:多出来的那点能力差距,足以覆盖多出来的调用成本。

这就是"跑得快没奖励"的精确含义——不是快没用,而是快的边际收益,被巨大的边际成本吃掉了

一个合理的生产架构长这样:

┌─────────────────────────────────────────┐
│  80% 高频常态任务  →  V4-Flash($0.28/M)│
│  ├─ 代码补全、重构、测试                  │
│  ├─ 终端运维、批量处理                    │
│  └─ 文本分类、格式转换                    │
├─────────────────────────────────────────┤
│  15% 中等复杂任务  →  中端模型 / Flash高档 │
├─────────────────────────────────────────┤
│  5%  极难推理任务  →  Opus / Sol / K3     │
│  └─ 高难算法、长逻辑链、高风险决策         │
└─────────────────────────────────────────┘

一位开发者的实践更精妙:V4-Flash 目前不支持原生视觉输入,于是 @hqmank 先让 Kimi K3 读参考图、提取布局与颜色规范,再把结构化文本交给 V4-Flash 生成代码。布局与间距还原得不错,整体成本远低于全程调用顶级多模态模型

跨模型组合,正在成为一门新手艺。

角色三:AI 普惠的"降门槛器"

这一层可能是最被低估的。

天风证券计算机团队在发布当天给出"大超预期"的定调,并做了一个反常识的判断:看好软件公司受益

反常在哪?过去市场普遍认为 AI 模型越强,越利空 SaaS 类企业——AI 会把它们吃掉。

但现在逻辑反过来了:DeepSeek 的性价比已经足够让软件公司自己用起来提效。更重要的是,那些过去因为 Token 账单太贵而不敢碰 AI 的公司,现在可以开发高性价比的 AI 服务了。过去无法被满足的 Agent 需求,第一次变成了可以被满足的。

0xSupergemma 创始人宋骏从全球经济视角补了一刀:全球有大量低收入群体和初创团队,根本负担不起高昂的模型订阅费。DeepSeek 极低的 API 定价,会通过下游开发者转化成极便宜的 SaaS 工具与服务,让更广泛的终端用户间接享受技术红利。

一位微博用户的比喻更远:AI 最终可能不是一个独立工具,而是像电力一样的基础设施层——嵌入工厂、医院、车辆、办公系统,成为每个行业的默认能力。它最大的影响,也许不是给人们又一个聊天机器人,而是提供了重塑社会运作方式的算力底座。

而电力普及的前提,从来都是便宜

六、泼一点冷水:它并不是万能的

写到这里如果全是彩虹屁,那就不是科普是软文了。V4-Flash 的边界同样清晰,而且比很多人想象的明显。

1. 硬推理能力,差距是真实存在的

  • HLE(博士级推理基准):V4-Flash 8.1%,Claude Sonnet 5 是 57.4%。这不是差一点,这是差一个物种。
  • 在那九项它"全面反超 Pro"的基准上,它依然全部输给 Claude Opus 4.8,平均落后 5.7 分。仓库生成类任务上,差距超过 15 分。
  • 开发者 @OmedVibeCodes 实测:面对 GPT-5.6 Sol、Kimi K3 这类顶级模型,V4-Flash 在极其复杂的长逻辑链求解上仍有明显差距。

所以那句"厉害的没它便宜,也没厉害多少"——在 80% 的日常任务上成立,在最后 5% 的硬骨头上,不成立。

2. 跑分本身要打折看

  • 九项基准是 DeepSeek 自己报的,用的是自研的 DeepSeek Harness 框架,该框架尚未公开,目前无法独立复现。
  • 第三方复现显示,Terminal-Bench 分数与厂商自报值有约 4 分的差距。
  • Terminal Bench 2.0 与 2.1 并非同一版本,直接跨版本对比不完全公平。
  • 公开基准存在过拟合风险,跑分 ≠ 真实业务表现

3. 工程上的坑

  • 部分海外开发者反映:输入缓存命中率偏低、安全分类器经常超时。这在一定程度上说明,算力和参数储备不足,仍然是能力上限的瓶颈。
  • 98% 的缓存折扣是平台机制口径,不是你的实际成本。 真实命中率取决于 prompt 前缀复用率——Agent 多轮调用、固定系统提示的场景容易吃满;一对一开放式对话可能差得很远。别拿"成本低 60%"直接套自家预算。
  • 峰谷差异化定价:官方公布高峰时段(北京时间 9:00–12:00、14:00–18:00)价格会上浮。对欧美时区团队,这对应的是美东晚上 9 点至凌晨、凌晨 2–6 点,成本模型需要重算。
  • Artificial Analysis 测出它比较"话痨":跑完整个智能指数消耗 2.06–2.1 亿输出 Token,而中位数约 1 亿。单价便宜但输出更多,实际账单要按 token 总量算,不能只看单价。
  • 暂不支持原生视觉输入,图文混排任务需要外部模型前置解析。
  • 目前仅 API 开放,App 和网页端还用不上,普通用户暂时体验不到。

4. 也别把"Scaling Law 失灵"当结论

这可能是最容易被误读的一点。

看到"2840 亿打赢 1.6 万亿",很容易得出"规模法则失效了"的结论。但没人真的这么认为——包括 DeepSeek 自己。

梁文锋在一份流传甚广的融资会议纪要中说得很明确:

规模法则远未到上限,国内模型规模受限只是算力不足,不是规律走到尽头。

但他补了一句关键的:规模不再是唯一杠杆,思维链和智能体将会是下一个杠杆。

市场也是这么反应的:V4-Flash 上线后,英伟达、博通、AMD 在 7 月 31 日的股价并未出现剧烈波动。这和 2025 年 1 月 R1 发布后英伟达单日蒸发 5000 亿美元市值形成鲜明对比。

市场已经学会了:AI 工程效率的提升,不是算力需求的利空。 摩根大通的判断是,DeepSeek 强化了"算力供应扩张、定价纪律、结构性成本曲线压缩"三大支柱,对行业是顺风,不是零和

便宜了,用得起的人多了,总消耗反而涨了。这就是杰文斯悖论在 AI 上的演绎。

5. 一个未解的插曲

正在小范围灰度的 V4-Pro 正式版,有部分开发者反馈其生成的复杂代码风格与某些高价旗舰模型相似,甚至触发过疑似特定模型的安全拒绝响应,引发"是否使用了混合路由"的猜测。社区调侃为"矿泉水瓶里掺茅台"。

需要说明:这些目前都是社区反馈,官方尚无进一步复现说明。技术专家 @TeksCreate 从架构层面分析认为,V4-Pro 的 1.6 万亿 MoE 架构 + 混合注意力系统(CSA 历史压缩 + HCA 超长文本压缩 + SWA 全保真跟踪),使处理 100 万上下文时计算量降至前代 27%,本身就具备达到该水平的技术条件(Codeforces 3206 分、SWE-bench Verified 80.6%、1M 长上下文 MRCR 83.5%)。

真相如何,等官方回应。

七、给不同人的实操建议

如果你是开发者:

  • 已有 Agent 工作流 → 先小流量切换测试,别一把梭
  • 高并发、重复性任务(自动化测试、代码修复、批量处理)→ 强烈建议上
  • 高难数学、复杂逻辑推理 → 等 V4-Pro 正式版,或继续用旗舰
  • 务必把缓存命中率纳入成本测算,prompt 前缀归一化正在变成和模型质量同等重要的工程杠杆
  • 接入很简单:模型名仍是 deepseek-v4-flash,已有调用自动获得 0731 版本;想用 Responses API 格式则设置 wire_api = "responses",可直接接入 Codex CLI、ChatGPT 桌面端、VS Code Codex 插件

如果你是创业者:

  • 那些"因为 Token 太贵所以做不了"的产品想法,现在值得重新拿出来算一遍账
  • 权重是 MIT 许可,可商用、可修改、可再分发,也可自托管彻底消除单 Token 成本

如果你是投资人:

  • 竞争的核心标尺已经从"参数量、训练算力、Benchmark 跑分"迁移到"单位成本能换取多少有效输出"
  • 别再用"模型能力"单一维度做估值

如果你只是吃瓜群众:

  • 记住一句话就够了:AI 变便宜了,而且是数量级级别的便宜。 这件事对世界的影响,可能比"AI 又变聪明了"更大。

八、结语:一台永不停止的收割机

回到最开始那句话。

便宜的模型没它厉害,厉害的模型没它便宜,也没厉害多少。 跑得快没奖励,跑得慢有惩罚。

这句话之所以精准,是因为它描述的不是一个模型,而是一种市场结构

在这个结构里,DeepSeek V4-Flash 不是赛道上跑得最快的那个选手。它是站在赛道中间,用一根杆子把及格线抬到所有人头顶的那个人。

你比它快?恭喜,但观众不一定为那点速度买单。 你比它慢?抱歉,出局。 你和它一样快、一样便宜?那你就是个可替代品。

有人调侃:“梁文锋的 DeepSeek 成了一台永不停止的收割机。”

某种程度上,这句话对每个人都成立——它收割的是行业的定价权,是"AI 就该很贵"的默认假设,也是所有靠信息差和成本不透明赚的钱。

但换个角度看,被"收割"掉的这些,本来也不该由用户来承担。

2025 年春天,DeepSeek 让世界重新思考"AI 需要多少算力"。 2026 年夏天,它让世界重新思考"AI 应该卖多少钱"。

这两个问题,最终指向的是同一件事:智能,究竟应该属于少数人,还是属于所有人。

至于这条斩杀线会不会被别人越过——

Kimi K3 的 2.8 万亿参数还在那儿,Qwen 3.8-Max 的 2.4 万亿也在那儿,V4-Pro 正式版还没发布,OpenAI 的刀刚砍完第一轮。

没人知道下一个 48 小时会发生什么。这大概就是 2026 年的 AI 行业最有意思的地方。

关键信息速查

项目 内容
发布时间 2026 年 7 月 31 日下午(API 文档更新日志)
版本号 DeepSeek-V4-Flash-0731
架构 MoE,总参 2840 亿 / 激活 130 亿
上下文 100 万 Token
定价 输入 $0.14 / 缓存命中 $0.0028 / 输出 $0.28(每百万 Token)
缓存折扣 约 98%
并发限制 2500 并发请求(Pro 为 500)
权重许可 MIT,可商用
核心变化 架构尺寸不变,仅重做后训练
代表成绩 Terminal Bench 2.1: 82.7|DeepSWE: 54.4|AAII: 50
主要短板 硬推理(HLE 8.1%)、无原生视觉、缓存命中率待验证
接入方式 官方 API、OpenRouter、DeepInfra、Fireworks AI、Vercel AI Gateway、Hugging Face 自托管

主要资料来源

  • DeepSeek 官方 API 文档更新日志(2026-07-31)
  • 21 世纪经济报道《DeepSeek 又发重磅更新,行业梦回 2025 年春天》
  • Global Times《DeepSeek V4 Flash hailed as ‘Ferrari at bicycle prices’》
  • 凤凰网科技《口碑持续逆转,DeepSeek 成全球 AI 斩杀线》
  • 网易科技《DeepSeek V4 Flash 刷屏海外,"像魔法一样"的 AI,只卖几分钱》
  • 新浪财经《85 倍价差:DeepSeek 逼着硅谷巨头重算"性价比"》
  • TechFlow《OpenAI 上线三周降价 80%》、CNBC 相关调查报道
  • 北京日报、环球网、潮新闻、太平洋科技相关报道

本文数据截至 2026 年 8 月 5 日。基准测试分数多为厂商自报或第三方初步评测,实际业务表现请以自有场景实测为准。价格随时可能变动,决策前请核对官方最新定价。

KEEP READING