DeepSeek-V4-Flash 半月复盘:Agent 能力大涨、8/17 涨价,现在还香吗
8 月 14 日了。V4-Flash 正式版上线已经过去整整两周,这半个月里它拿下了「全球调用量第一」的宝座,也迎来了第一次官方涨价公告。如果你还在纠结要不要用它、怎么用,这篇把版本、性能、价格、性价比一次说清楚。
版本状态:0731 还是最新,8 月没有新版本
先给结论:V4-Flash 目前最新版本仍是 7 月 31 日的 DeepSeek-V4-Flash-0731,8 月官方没有发布新版本。
- 7/31:官方更新日志宣布正式版 API 公测,模型名不变,还是
deepseek-v4-flash - 8/1:超聚变 AI Lab 上线 0731
- 8/5:腾讯云侧 V4-Flash GA 上线,与官方 7/31 版本同步
架构还是那个老底子:总参 284B、激活 13B 的 MoE,原生 100 万 token 上下文,和 4 月的预览版一模一样,改的只有后训练。DeepSeek 把资源都压在 Pro 上了(8 月 13 日凌晨 V4-Pro-0813 静默上线,后面单独讲),Flash 这边就是「调教完就稳定跑量」的节奏。
性能:Agent 能力是真涨了,不是营销话术
0731 版最硬核的验证来自官方给的 Agent 基准,以及一个侧面数据——7/27 到 8/2 一周,V4-Flash 调用量 7.22 万亿 token,跃居全球第一;8/3 单日处理 8 万亿 token。开发者用脚投票,比任何榜单都实在。
官方基准(正式版 vs 预览版的关键变化):
- Terminal Bench 2.1:82.7(预览版 61.8 → 正式版 82.7,暴涨 20+ 分,反超 V4-Pro-Preview 的 72.1)
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench (Public): 25.1
- DSBench-FullStack: 68.7(内部全栈测试集)
- DSBench-Hard: 59.6(内部 Coding Agent 难题集)
通用能力(参考 4 月预览版技术报告数据,0731 官方未单独公布通用分):MMLU 88.7、C-Eval 92.1、HumanEval 69.5、GSM8K 90.8,均优于 V3.2。
一句话:能力相比预览版明显提升,提升集中在 Agent 场景(终端操作、代码生成、工具调用),通用问答本来就强,这次是把短板补齐了。再加上原生支持 Responses API、针对性适配 Codex,从别的编程 Agent 生态迁过来成本很低。
价格:8 月 17 日起全面涨价
这是今天最值得注意的变化。当前价(8/17 前):
| 项目 | 价格(元/百万 token) |
|---|---|
| 输入(缓存命中) | 0.02 |
| 输入(缓存未命中) | 1 |
| 输出 | 2 |
8 月 17 日 00:00 起改峰谷定价,全面涨价(高峰时段 9:00-12:00、14:00-18:00):
| 时段 | 缓存命中输入 | 未命中输入 | 输出 |
|---|---|---|---|
| 空闲时段 | 0.05 | 1.5 | 4.5 |
| 高峰时段 | 0.10 | 3.0 | 9.0 |
换算一下:输出价格从 2 元涨到 4.5 元(空闲)/ 9 元(高峰),涨幅 125%~350%;未命中输入从 1 元涨到 1.5~3 元。官方说原因是推理算力不足,还预告未来可能继续涨。
值不值得用?
我的判断:涨价前(8/16 前)该跑的实验赶紧跑,涨价后它依然是性价比第一梯队。
理由很简单:即使按高峰价 9 元/百万输出 token 算,V4-Flash 依然是全球最便宜的顶级模型之一——竞品同档次的输出价格普遍是它的 5~10 倍。它的定位本来就是「量大管饱的 Agent 工作马」,便宜 + Agent 能力强 + 100 万上下文,这个组合在涨价后依然没有对手。
适合:高频 API 调用、批量 Agent 任务、编程辅助、长上下文处理。不适合:需要极致推理深度(那等 Pro)。
- 现在就用:趁 8/17 前老价格,直接上,模型名
deepseek-v4-flash - 涨价后用:把高峰时段的调用挪到空闲时段,成本能砍一半
- 并发 2500,个人开发者基本不会撞限
Flash 讲完。同一天另一件大事是 V4-Pro 正式版静默上线了——那篇信息量更大,DeepSWE 暴涨 5 倍,去看 Pro 的复盘。
← Back to blog