DeepSeek-V4-Flash:跑得快没奖励,跑得慢有惩罚
DeepSeek-V4-Flash 正式版,是怎么把整个 AI 行业逼到墙角的

2026 年 7 月 31 日下午,DeepSeek 干了一件很"DeepSeek"的事。
没有发布会,没有倒计时海报,没有 CEO 站在聚光灯下说"这是我们迄今为止最激动人心的模型"。他们只是在 API 文档的更新日志里,加了一行字:DeepSeek-V4-Flash 正式版 API 上线公测。
然后全球开发者社区就炸了。
有意思的是,就在前一天,OpenAI 刚刚紧急宣布 GPT-5.6 Luna 全线降价 80%——上线才三周的模型,输入价格从 1 美元砍到 0.2 美元,输出从 6 美元砍到 1.2 美元。这个时间点巧得让人起疑:一边是硅谷连夜挥刀自砍,一边是杭州轻描淡写更新日志。
结果是:OpenAI 砍完 80% 之后,跑同样的任务,还是比 DeepSeek 贵大约 60%。
这就很尴尬了。
一、先看这件事有多离谱:模型没换,脑子换了
在讲行业影响之前,得先把技术上那个"反直觉"的点说清楚,因为它是后面一切的地基。
V4-Flash 正式版(版本号 0731),和 4 月发的预览版,是同一个模型。
不是"架构微调",不是"扩了点参数",是完全一样:
| 项目 | V4-Flash-Preview(4月) | V4-Flash-0731(正式版) |
|---|---|---|
| 总参数 | 2840 亿 | 2840 亿 |
| 激活参数 | 130 亿 | 130 亿 |
| 架构 | MoE | MoE |
| 上下文 | 100 万 token | 100 万 token |
| 价格 | 输入 $0.14 / 输出 $0.28 | 一分钱没涨 |
那到底改了什么?官方说得很朴素:重新做了一遍后训练(Post-Training)。
就这。骨架没动,发动机没换,只是重新调了一遍油路和电控。
然后成绩单变成了这样:
| 基准测试 | 预览版 | 正式版 | 变化 |
|---|---|---|---|
| DeepSWE(真实代码仓库修复) | 7.3 | 54.4 | 涨了 6 倍多 |
| Terminal Bench 2.1(终端连续操作) | 61.8 | 82.7 | +20.9 |
| Cybergym(网络安全攻防) | — | 76.7 | — |
| Toolathlon Verified(多工具协同) | — | 70.3 | — |
| DSBench-FullStack(全栈开发) | — | 68.7 | — |
| DSBench-Hard(高难编码) | — | 59.6 | — |
DeepSWE 从 7.3 涨到 54.4 是什么概念?打个不太严谨的比方:一个学生上学期期末考 7 分,这学期考了 54 分,中间他没换脑子、没补课本,只是终于学会了怎么答题。
更炸裂的是横向对比。官方公布的九项 Agent 与代码基准,V4-Flash 正式版全部超过了自家的 V4-Pro 预览版——那个总参数 1.6 万亿、激活 490 亿的旗舰。
也就是说:用 Pro 六分之一的总参数、不到四分之一的激活参数,把自家旗舰按在地上摩擦。 在 DeepSWE 这一项上,分差高达 41.6 分。
行业里"Pro 强、Flash 弱"的分层信仰,当场碎了一地。
这说明了什么?
一个被严重低估的事实:预训练决定能力上限,后训练决定这个上限能兑现多少。
过去两年,所有人都在卷预训练——卷参数、卷算力、卷数据量。2026 年上半年更是进入"万亿参数时代":4 月 DeepSeek V4-Pro 预览版 1.6 万亿开局,7 月阿里 Qwen 3.8-Max 推到 2.4 万亿,同月月之暗面 Kimi K3 以 2.8 万亿登顶开源模型规模之王。
大家默认的逻辑是:更大 = 更强。
V4-Flash-0731 说:不一定。它在 4 月的时候,脑子里其实已经装着这些能力了,只是不知道怎么用。后训练做的事情,是教它"打开终端 → 调用工具 → 改代码 → 跑测试 → 修 Bug → 继续改"这套 Agent 完整链路——从"回答问题"变成"完成任务"。
同时首次亮相的还有 DeepSeek 自研的 Agent 测试框架 DeepSeek Harness,用极简模式跑分。工程侧的优化和训练侧的优化产生了协同效应。
用一位分析师的说法:AI 发展不只需要大力出奇迹,还得慢工出细活。
二、真正的核弹:那张价格表
技术上的惊喜是"哇好厉害",价格上的冲击才是"卧槽这怎么活"。
V4-Flash 正式版定价(每百万 Token):
| 类型 | 美元 | 人民币 |
|---|---|---|
| 输入(缓存未命中) | $0.14 | 约 1 元 |
| 输入(缓存命中) | $0.0028 | 约 0.02 元 |
| 输出 | $0.28 | 约 2 元 |
注意那个缓存命中价:0.02 元/百万 Token。缓存折扣高达 98%,而行业大多数厂商是 90%。在 Agent 场景下——固定系统提示词反复复用、多轮工具调用——这个折扣是能吃满的。
现在把它和"厉害的那些"放一起:
| 模型 | 输入($/M) | 输出($/M) | 智能指数 (AAII) |
|---|---|---|---|
| DeepSeek V4-Flash | 0.14 | 0.28 | 50 |
| GPT-5.6 Luna(已降价80%) | 0.20 | 1.20 | 51 |
| Anthropic Haiku 4.5 | 1.00 | 5.00 | — |
| Claude Opus 4.8 | — | 约 85 倍 V4-Flash | 约 56 |
| Gemini 3.6 Flash | — | — | 50(打平) |
第三方评测机构 Artificial Analysis 给 V4-Flash 的智能指数打了 50 分,比自己上一代高 10 分,比 V4-Pro 预览版高 6 分,追平 Gemini 3.6 Flash,只落后 GPT-5.6 Luna 一分。
而在 ALE 基准上,V4-Flash 和全球顶级的 Claude Opus 4.8 只差半分。
半分。价格差 85 倍。
再翻译一遍:Opus 多拿了那 6 分综合智能,但跑完同一套评测的账单,高出约 52 倍。
这已经不是性价比的差距了,这是计量单位级别的错位。就像有人跟你比谁跑得快,你报的是"秒",他报的是"分钟"。
开发者的真实账单,比参数表更有说服力
跑分终究是实验室数据,真正让海外开发者集体破防的,是他们自己刷卡时看到的数字:
- @tonbistudio:整整一天,用 V4-Flash 跑了一堆多小时的复杂任务,总共花了 0.31 美元。而上周同样的任务用 Kimi K3 之类的模型,花了 35 美元。“剧透一下:贵的那些也没强 100 倍。”
- @CommandCodeAI:同一个游戏设计提示词,Kimi K3 单次调用 0.0740 美元,GLM 5.2 是 0.0480 美元,V4-Flash 是 0.0005 美元——便宜 150 倍。(诚实地说,V4-Flash 在边缘细节上确实糙了点。)
- @SciTechera:在 Terminal-Bench 2.1 上完成单个基准任务,估算成本 0.03 美元。
- @RoundtableSpace:对比刚发布的 Opus 5——Opus 一次成功,DeepSeek 试了三次。但 Opus 输出了 3000 行代码,DeepSeek 用约 900 行就搞定了,单次成本约 1 美分。
最后这条特别有意思:贵的模型一次搞定,便宜的模型试三次。但便宜的模型试三次的总成本,还不到贵模型的百分之一——而且代码更精简。
在 Agent 时代,"一次做对"不再是唯一的美德,"错了也无所谓,反正重来一次只要一分钱"变成了一种全新的工程哲学。
Bold Metrics 的 CTO Morgan Linton 说得更直白:对于需要成千上万次 API 调用的工业级 Agent 工作流,这种价格让"大批量自动化试错"第一次具备了财务可行性。
以前你不敢让 AI 反复尝试,因为每一次尝试都在烧钱。现在你可以了。这不是省钱,这是换了一种做事方式。
三、“斩杀线”:这个词是怎么来的,又为什么这么准
发布之后,中英文社区不约而同地造出了同一个概念。
中文叫斩杀线,英文叫 Kill Line。
它的定义特别精确,值得逐字读:
斩杀线不是性能分水岭,而是性能与价格的平衡临界值。
- 同一能力梯队中,定价显著高于 DeepSeek 的模型,将持续流失中小开发者;
- 性能弱于 DeepSeek、成本却更高的产品,生存空间快速萎缩。
北京市社会科学院副研究员王鹏在接受《环球时报》采访时的表述更简洁:Codex 和 Claude 划定上限,DeepSeek 划定"斩杀线"——追平它,你就没有溢价空间了;落后它,你就出局了。
这就回到了本文开头那句话。用一个游戏化的说法:
跑得快没奖励,跑得慢有惩罚
这是一个残酷到近乎优雅的博弈结构:
如果你比 DeepSeek 强一点点(跑得快):
- 你得证明"多出来的那几分能力",值得客户多付 50 倍的钱
- 但 80% 的日常任务根本用不上那几分
- 所以你拿不到与投入成正比的市场份额 → 没奖励
如果你比 DeepSeek 弱、还比它贵(跑得慢):
- 你没有任何存在的理由
- 中小开发者用脚投票,一夜之间迁移完毕
- → 有惩罚,而且是死刑
如果你和它差不多贵、差不多强:
- 恭喜,你成了一个可被随时替换的商品(commodity)
海外社区把这个感受表达得更生动。X 用户 @FoxRick01 说:
“Anthropic 被 Codex 打了一整周,现在又被便宜 100 倍的 DeepSeek 打。他们现在看起来像是卖菲亚特、收法拉利价钱的销售员。”
于是"法拉利的性能,自行车的价格"成了这次发布的标志性调侃。
一位从事 AI 创业孵化的人士说得更狠:
“梁文锋似乎站在了市面上所有模型玩家的对立面。所有 AI 公司都在他前面奔跑——不管用什么方式,它们必须跑到 DeepSeek 前面,才能活着。”
四、48 小时之内,整个行业开始重新算账
嘴上说说是一回事,Token 流向是另一回事。数据不会撒谎。
调用量:一个模型,打赢了一群模型
OpenRouter(全球最大的模型聚合平台)7 月 27 日 – 8 月 2 日的周度数据:
| 排名 | 模型 | 周调用量 |
|---|---|---|
| 🥇 1 | DeepSeek-V4-Flash | 7.22 万亿 Token |
| 🥈 2 | 小米 MiMo-V2.5 | 6.30 万亿 |
| 🥉 3 | 腾讯 HY3 | 4.82 万亿 |
| 4 | DeepSeek-V4-Pro | 3.28 万亿 |
| 5 | 智谱 GLM-5.2 | 2.89 万亿 |
前五名,全部是中国模型。
再看总量:全球总调用 56.8 万亿 Token,其中上榜的中国大模型周调用量 28.13 万亿,美国大模型 4.38 万亿。中国模型的周调用量已经连续 14 周超过美国。
编程平台 OpenCode 的 CEO Jay 在 8 月 1 日发文:V4-Flash 上线后,平台单日调用量增长 30%,OpenCode Go 的新订阅用户也增长了 30%。"DeepSeek 一天消耗 8 万亿"直接冲上热搜——不是烧掉 8 万亿资金,是单日处理 8 万亿 Token。
单一模型、单一入口的单日消耗,超过了海外数百款模型加起来的日均总和。
硅谷的反应:连夜改价格表
这波价格战的猛烈程度,是 AI 史上前所未见的:
| 厂商 | 动作 |
|---|---|
| OpenAI | GPT-5.6 Luna 降价 80%(上线仅三周);Terra 降 20%;旗舰 Sol 维持不动 |
| Anthropic | Claude Opus 5 降价 |
| 推出低价 Gemini Flash 系列应对 | |
| Mistral | 重新调整商业化方案,靠开源免费 + 云端优惠守住开发者盘 |
| 中小开源服务商 | 被迫重算成本,放弃"靠 API 毛利盈利"的幻想 |
OpenAI 的策略写在脸上:旗舰 Sol 的溢价一分不让,用中低端产品的激进降价,拦截客户流失。 保住高端护城河,把中端市场当防线来打。
问题是——这条防线,砍完 80% 之后依然比 DeepSeek 贵 60%。
企业侧:Token 经济学的崩塌
真正的压力其实来自更早,V4-Flash 只是压垮骆驼的最后一根稻草:
- Uber:5000 名工程师中 84% 启用了 Agent 式编码,人均月度 API 成本飙到 500–2000 美元区间,四个月烧光全年 AI 预算。CTO Praveen Neppalli Naga 坦言"原定预算已被彻底击穿"。
- Lindy(旧金山,25 人 AI 创业公司):把 100% 的流量从 Anthropic 全面切向 DeepSeek,预计省下数百万美元。
- 微软:悄悄把 DeepSeek 塞进了 Copilot 底层引擎的评估名单。
- CNBC 调查:自 2026 年 2 月 8 日起,中国模型在 OpenRouter 上的美国企业 Token 用量占比每周稳定在 30% 以上,峰值 46%。
为什么企业撑不住了?因为 Agent 改变了消耗结构。OpenRouter 数据显示:Agent 式工作流每个请求的 Token 消耗量,是人机对话的 15 倍。
一个看似简单的自然语言指令,实际要拆解成:意图理解 → 环境感知 → 文件检索 → 工具调用 → 代码生成 → 自我修正 → 再来一遍。乘数效应瞬间放大 Token 消耗。
在这个结构下,单价的微小差异会被放大成账单上的天文数字。于是"能力溢价"的旧范式,输给了"成本效率"的新范式。
五、它到底扮演什么角色?三个身份
聊到这里,可以给 V4-Flash 在 AI 产业里的位置下个判断了。它不是"最强模型",也不只是"最便宜的模型",它同时扮演着三个更微妙的角色。
角色一:定价的"锚",而不是性能的"顶"
顶不是它的。上限依然由 Claude Opus 4.8、GPT-5.6 Sol、Kimi K3 这些巨兽划定。
但底是它划的。而且这个底一旦划下来,就变成了所有人的参照系。
这才是最要命的地方:一个定价锚点,比一个性能冠军更能改变行业结构。 性能冠军只影响"最难的那 5% 任务",定价锚点影响"所有任务"。
DeepSeek 走的也不是烧钱补贴的路子。它的低价来自底层工程优化——高效推理架构、动态 KV 缓存、流量峰谷调度、长文本优化——是把成本真的做下来了,不是亏钱换市场。这意味着这条线不会因为补贴结束而回弹。
《财富》杂志还指出,V4 系列的研发与华为底层芯片生态做了紧密适配。随着昇腾系列软硬件协同效率提升,推理成本还有进一步下探空间。
角色二:默认选项的重新分配者
"斩杀线"真正斩掉的,不是所有高端模型,而是——
对旗舰模型"不计成本"的默认调用习惯。
这句话值得再读一遍。
以前的工作流是:默认上最强的,反正能力越强越保险。 现在的工作流是:先问一句,这活儿真的需要旗舰吗?
写一段代码、改一份文案、整理会议纪要、跑一轮自动化测试——先交给低成本且完成率足够的模型;只有遇到复杂推理、长链路 Agent、高风险场景,才升级到昂贵旗舰。
高价模型仍然有位置,但它必须证明:多出来的那点能力差距,足以覆盖多出来的调用成本。
这就是"跑得快没奖励"的精确含义——不是快没用,而是快的边际收益,被巨大的边际成本吃掉了。
一个合理的生产架构长这样:
┌─────────────────────────────────────────┐
│ 80% 高频常态任务 → V4-Flash($0.28/M)│
│ ├─ 代码补全、重构、测试 │
│ ├─ 终端运维、批量处理 │
│ └─ 文本分类、格式转换 │
├─────────────────────────────────────────┤
│ 15% 中等复杂任务 → 中端模型 / Flash高档 │
├─────────────────────────────────────────┤
│ 5% 极难推理任务 → Opus / Sol / K3 │
│ └─ 高难算法、长逻辑链、高风险决策 │
└─────────────────────────────────────────┘
一位开发者的实践更精妙:V4-Flash 目前不支持原生视觉输入,于是 @hqmank 先让 Kimi K3 读参考图、提取布局与颜色规范,再把结构化文本交给 V4-Flash 生成代码。布局与间距还原得不错,整体成本远低于全程调用顶级多模态模型。
跨模型组合,正在成为一门新手艺。
角色三:AI 普惠的"降门槛器"
这一层可能是最被低估的。
天风证券计算机团队在发布当天给出"大超预期"的定调,并做了一个反常识的判断:看好软件公司受益。
反常在哪?过去市场普遍认为 AI 模型越强,越利空 SaaS 类企业——AI 会把它们吃掉。
但现在逻辑反过来了:DeepSeek 的性价比已经足够让软件公司自己用起来提效。更重要的是,那些过去因为 Token 账单太贵而不敢碰 AI 的公司,现在可以开发高性价比的 AI 服务了。过去无法被满足的 Agent 需求,第一次变成了可以被满足的。
0xSupergemma 创始人宋骏从全球经济视角补了一刀:全球有大量低收入群体和初创团队,根本负担不起高昂的模型订阅费。DeepSeek 极低的 API 定价,会通过下游开发者转化成极便宜的 SaaS 工具与服务,让更广泛的终端用户间接享受技术红利。
一位微博用户的比喻更远:AI 最终可能不是一个独立工具,而是像电力一样的基础设施层——嵌入工厂、医院、车辆、办公系统,成为每个行业的默认能力。它最大的影响,也许不是给人们又一个聊天机器人,而是提供了重塑社会运作方式的算力底座。
而电力普及的前提,从来都是便宜。
六、泼一点冷水:它并不是万能的
写到这里如果全是彩虹屁,那就不是科普是软文了。V4-Flash 的边界同样清晰,而且比很多人想象的明显。
1. 硬推理能力,差距是真实存在的
- HLE(博士级推理基准):V4-Flash 8.1%,Claude Sonnet 5 是 57.4%。这不是差一点,这是差一个物种。
- 在那九项它"全面反超 Pro"的基准上,它依然全部输给 Claude Opus 4.8,平均落后 5.7 分。仓库生成类任务上,差距超过 15 分。
- 开发者 @OmedVibeCodes 实测:面对 GPT-5.6 Sol、Kimi K3 这类顶级模型,V4-Flash 在极其复杂的长逻辑链求解上仍有明显差距。
所以那句"厉害的没它便宜,也没厉害多少"——在 80% 的日常任务上成立,在最后 5% 的硬骨头上,不成立。
2. 跑分本身要打折看
- 九项基准是 DeepSeek 自己报的,用的是自研的 DeepSeek Harness 框架,该框架尚未公开,目前无法独立复现。
- 第三方复现显示,Terminal-Bench 分数与厂商自报值有约 4 分的差距。
- Terminal Bench 2.0 与 2.1 并非同一版本,直接跨版本对比不完全公平。
- 公开基准存在过拟合风险,跑分 ≠ 真实业务表现。
3. 工程上的坑
- 部分海外开发者反映:输入缓存命中率偏低、安全分类器经常超时。这在一定程度上说明,算力和参数储备不足,仍然是能力上限的瓶颈。
- 98% 的缓存折扣是平台机制口径,不是你的实际成本。 真实命中率取决于 prompt 前缀复用率——Agent 多轮调用、固定系统提示的场景容易吃满;一对一开放式对话可能差得很远。别拿"成本低 60%"直接套自家预算。
- 峰谷差异化定价:官方公布高峰时段(北京时间 9:00–12:00、14:00–18:00)价格会上浮。对欧美时区团队,这对应的是美东晚上 9 点至凌晨、凌晨 2–6 点,成本模型需要重算。
- Artificial Analysis 测出它比较"话痨":跑完整个智能指数消耗 2.06–2.1 亿输出 Token,而中位数约 1 亿。单价便宜但输出更多,实际账单要按 token 总量算,不能只看单价。
- 暂不支持原生视觉输入,图文混排任务需要外部模型前置解析。
- 目前仅 API 开放,App 和网页端还用不上,普通用户暂时体验不到。
4. 也别把"Scaling Law 失灵"当结论
这可能是最容易被误读的一点。
看到"2840 亿打赢 1.6 万亿",很容易得出"规模法则失效了"的结论。但没人真的这么认为——包括 DeepSeek 自己。
梁文锋在一份流传甚广的融资会议纪要中说得很明确:
“规模法则远未到上限,国内模型规模受限只是算力不足,不是规律走到尽头。”
但他补了一句关键的:规模不再是唯一杠杆,思维链和智能体将会是下一个杠杆。
市场也是这么反应的:V4-Flash 上线后,英伟达、博通、AMD 在 7 月 31 日的股价并未出现剧烈波动。这和 2025 年 1 月 R1 发布后英伟达单日蒸发 5000 亿美元市值形成鲜明对比。
市场已经学会了:AI 工程效率的提升,不是算力需求的利空。 摩根大通的判断是,DeepSeek 强化了"算力供应扩张、定价纪律、结构性成本曲线压缩"三大支柱,对行业是顺风,不是零和。
便宜了,用得起的人多了,总消耗反而涨了。这就是杰文斯悖论在 AI 上的演绎。
5. 一个未解的插曲
正在小范围灰度的 V4-Pro 正式版,有部分开发者反馈其生成的复杂代码风格与某些高价旗舰模型相似,甚至触发过疑似特定模型的安全拒绝响应,引发"是否使用了混合路由"的猜测。社区调侃为"矿泉水瓶里掺茅台"。
需要说明:这些目前都是社区反馈,官方尚无进一步复现说明。技术专家 @TeksCreate 从架构层面分析认为,V4-Pro 的 1.6 万亿 MoE 架构 + 混合注意力系统(CSA 历史压缩 + HCA 超长文本压缩 + SWA 全保真跟踪),使处理 100 万上下文时计算量降至前代 27%,本身就具备达到该水平的技术条件(Codeforces 3206 分、SWE-bench Verified 80.6%、1M 长上下文 MRCR 83.5%)。
真相如何,等官方回应。
七、给不同人的实操建议
如果你是开发者:
- 已有 Agent 工作流 → 先小流量切换测试,别一把梭
- 高并发、重复性任务(自动化测试、代码修复、批量处理)→ 强烈建议上
- 高难数学、复杂逻辑推理 → 等 V4-Pro 正式版,或继续用旗舰
- 务必把缓存命中率纳入成本测算,prompt 前缀归一化正在变成和模型质量同等重要的工程杠杆
- 接入很简单:模型名仍是
deepseek-v4-flash,已有调用自动获得 0731 版本;想用 Responses API 格式则设置wire_api = "responses",可直接接入 Codex CLI、ChatGPT 桌面端、VS Code Codex 插件
如果你是创业者:
- 那些"因为 Token 太贵所以做不了"的产品想法,现在值得重新拿出来算一遍账
- 权重是 MIT 许可,可商用、可修改、可再分发,也可自托管彻底消除单 Token 成本
如果你是投资人:
- 竞争的核心标尺已经从"参数量、训练算力、Benchmark 跑分"迁移到"单位成本能换取多少有效输出"
- 别再用"模型能力"单一维度做估值
如果你只是吃瓜群众:
- 记住一句话就够了:AI 变便宜了,而且是数量级级别的便宜。 这件事对世界的影响,可能比"AI 又变聪明了"更大。
八、结语:一台永不停止的收割机
回到最开始那句话。
便宜的模型没它厉害,厉害的模型没它便宜,也没厉害多少。 跑得快没奖励,跑得慢有惩罚。
这句话之所以精准,是因为它描述的不是一个模型,而是一种市场结构。
在这个结构里,DeepSeek V4-Flash 不是赛道上跑得最快的那个选手。它是站在赛道中间,用一根杆子把及格线抬到所有人头顶的那个人。
你比它快?恭喜,但观众不一定为那点速度买单。 你比它慢?抱歉,出局。 你和它一样快、一样便宜?那你就是个可替代品。
有人调侃:“梁文锋的 DeepSeek 成了一台永不停止的收割机。”
某种程度上,这句话对每个人都成立——它收割的是行业的定价权,是"AI 就该很贵"的默认假设,也是所有靠信息差和成本不透明赚的钱。
但换个角度看,被"收割"掉的这些,本来也不该由用户来承担。
2025 年春天,DeepSeek 让世界重新思考"AI 需要多少算力"。 2026 年夏天,它让世界重新思考"AI 应该卖多少钱"。
这两个问题,最终指向的是同一件事:智能,究竟应该属于少数人,还是属于所有人。
至于这条斩杀线会不会被别人越过——
Kimi K3 的 2.8 万亿参数还在那儿,Qwen 3.8-Max 的 2.4 万亿也在那儿,V4-Pro 正式版还没发布,OpenAI 的刀刚砍完第一轮。
没人知道下一个 48 小时会发生什么。这大概就是 2026 年的 AI 行业最有意思的地方。
关键信息速查
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026 年 7 月 31 日下午(API 文档更新日志) |
| 版本号 | DeepSeek-V4-Flash-0731 |
| 架构 | MoE,总参 2840 亿 / 激活 130 亿 |
| 上下文 | 100 万 Token |
| 定价 | 输入 $0.14 / 缓存命中 $0.0028 / 输出 $0.28(每百万 Token) |
| 缓存折扣 | 约 98% |
| 并发限制 | 2500 并发请求(Pro 为 500) |
| 权重许可 | MIT,可商用 |
| 核心变化 | 架构尺寸不变,仅重做后训练 |
| 代表成绩 | Terminal Bench 2.1: 82.7|DeepSWE: 54.4|AAII: 50 |
| 主要短板 | 硬推理(HLE 8.1%)、无原生视觉、缓存命中率待验证 |
| 接入方式 | 官方 API、OpenRouter、DeepInfra、Fireworks AI、Vercel AI Gateway、Hugging Face 自托管 |
主要资料来源
- DeepSeek 官方 API 文档更新日志(2026-07-31)
- 21 世纪经济报道《DeepSeek 又发重磅更新,行业梦回 2025 年春天》
- Global Times《DeepSeek V4 Flash hailed as ‘Ferrari at bicycle prices’》
- 凤凰网科技《口碑持续逆转,DeepSeek 成全球 AI 斩杀线》
- 网易科技《DeepSeek V4 Flash 刷屏海外,"像魔法一样"的 AI,只卖几分钱》
- 新浪财经《85 倍价差:DeepSeek 逼着硅谷巨头重算"性价比"》
- TechFlow《OpenAI 上线三周降价 80%》、CNBC 相关调查报道
- 北京日报、环球网、潮新闻、太平洋科技相关报道
本文数据截至 2026 年 8 月 5 日。基准测试分数多为厂商自报或第三方初步评测,实际业务表现请以自有场景实测为准。价格随时可能变动,决策前请核对官方最新定价。



