DeepSeek-V4-Flash 半月复盘:Agent 能力大涨、8/17 涨价,现在还香吗

8 月 14 日了。V4-Flash 正式版上线已经过去整整两周,这半个月里它拿下了「全球调用量第一」的宝座,也迎来了第一次官方涨价公告。如果你还在纠结要不要用它、怎么用,这篇把版本、性能、价格、性价比一次说清楚。

版本状态:0731 还是最新,8 月没有新版本

先给结论:V4-Flash 目前最新版本仍是 7 月 31 日的 DeepSeek-V4-Flash-0731,8 月官方没有发布新版本。

  • 7/31:官方更新日志宣布正式版 API 公测,模型名不变,还是 deepseek-v4-flash
  • 8/1:超聚变 AI Lab 上线 0731
  • 8/5:腾讯云侧 V4-Flash GA 上线,与官方 7/31 版本同步

架构还是那个老底子:总参 284B、激活 13B 的 MoE,原生 100 万 token 上下文,和 4 月的预览版一模一样,改的只有后训练。DeepSeek 把资源都压在 Pro 上了(8 月 13 日凌晨 V4-Pro-0813 静默上线,后面单独讲),Flash 这边就是「调教完就稳定跑量」的节奏。

性能:Agent 能力是真涨了,不是营销话术

0731 版最硬核的验证来自官方给的 Agent 基准,以及一个侧面数据——7/27 到 8/2 一周,V4-Flash 调用量 7.22 万亿 token,跃居全球第一;8/3 单日处理 8 万亿 token。开发者用脚投票,比任何榜单都实在。

官方基准(正式版 vs 预览版的关键变化):

  • Terminal Bench 2.1:82.7(预览版 61.8 → 正式版 82.7,暴涨 20+ 分,反超 V4-Pro-Preview 的 72.1)
  • NL2Repo: 54.2
  • Cybergym: 76.7
  • DeepSWE: 54.4
  • Toolathlon verified: 70.3
  • Agent Last Exam: 25.2
  • Automation Bench (Public): 25.1
  • DSBench-FullStack: 68.7(内部全栈测试集)
  • DSBench-Hard: 59.6(内部 Coding Agent 难题集)

通用能力(参考 4 月预览版技术报告数据,0731 官方未单独公布通用分):MMLU 88.7、C-Eval 92.1、HumanEval 69.5、GSM8K 90.8,均优于 V3.2。

一句话:能力相比预览版明显提升,提升集中在 Agent 场景(终端操作、代码生成、工具调用),通用问答本来就强,这次是把短板补齐了。再加上原生支持 Responses API、针对性适配 Codex,从别的编程 Agent 生态迁过来成本很低。

价格:8 月 17 日起全面涨价

这是今天最值得注意的变化。当前价(8/17 前):

项目价格(元/百万 token)
输入(缓存命中)0.02
输入(缓存未命中)1
输出2

8 月 17 日 00:00 起改峰谷定价,全面涨价(高峰时段 9:00-12:00、14:00-18:00):

时段缓存命中输入未命中输入输出
空闲时段0.051.54.5
高峰时段0.103.09.0

换算一下:输出价格从 2 元涨到 4.5 元(空闲)/ 9 元(高峰),涨幅 125%~350%;未命中输入从 1 元涨到 1.5~3 元。官方说原因是推理算力不足,还预告未来可能继续涨。

值不值得用?

我的判断:涨价前(8/16 前)该跑的实验赶紧跑,涨价后它依然是性价比第一梯队

理由很简单:即使按高峰价 9 元/百万输出 token 算,V4-Flash 依然是全球最便宜的顶级模型之一——竞品同档次的输出价格普遍是它的 5~10 倍。它的定位本来就是「量大管饱的 Agent 工作马」,便宜 + Agent 能力强 + 100 万上下文,这个组合在涨价后依然没有对手。

适合:高频 API 调用、批量 Agent 任务、编程辅助、长上下文处理。不适合:需要极致推理深度(那等 Pro)。

  • 现在就用:趁 8/17 前老价格,直接上,模型名 deepseek-v4-flash
  • 涨价后用:把高峰时段的调用挪到空闲时段,成本能砍一半
  • 并发 2500,个人开发者基本不会撞限

Flash 讲完。同一天另一件大事是 V4-Pro 正式版静默上线了——那篇信息量更大,DeepSWE 暴涨 5 倍,去看 Pro 的复盘。


← Back to blog