DeepSeek-V4-Pro 正式版静默上线:DeepSWE 暴涨 5 倍,但官方还没发公告

先说个反常识的事实:DeepSeek-V4-Pro 正式版已经上线了,而且上线了快两天,官方更新日志上连一行字都没有。

8 月 12 日深夜(北京时间 13 日凌晨),DeepSeek-V4-Pro-0813 通过 API 静默上线。没有发布会、没有博客、没有公告——最先变化的是 API 文档价格页,模型版本从 Preview 悄悄换成了 0813。直到多家媒体跟进报道,这件事才被扒出来。

它是什么:1.6T 参数的大家伙

  • 总参数 1.6T、激活约 49B 的 MoE,预训练 33T tokens
  • 100 万 token 上下文,最大输出 384K
  • 思考 + 非思考双模式(Non-Think / Think High / Think Max)
  • 支持 Responses API、Anthropic API、JSON、Tool Calls、FIM
  • MIT 许可开源,权重已上 Hugging Face
  • fingerprint: fp_v4pro_20260812

架构和 4 月的预览版一致(1.6T/49B),但能力完全是两个量级。

性能:预览版到正式版,直接换了一档

数据来自 DeepSeek 官方群流出的评测表 + 媒体转引(注意:官方正式公告还没发,以下数字以官方公告为准):

基准预览版V4-Pro-0813变化
Terminal-Bench 2.172.187.9+15.8,几乎追平 Claude Fable 5 的 88.0
CyberGym52.783.3+30.6,反超 Fable 5
DeepSWE12.862.7暴涨近 5 倍,超越 Claude Opus 4.8
DSBench-FullStack41.871.1+29.3

和 Claude Fable 5 的 10 项 Agent 基准对比,平均只差 2.8%(剔除极端样本后);CyberGym、AutomationBench 两项反超。HN 上有开发者用 Codex CLI 做同功能开发实测:V4-Pro-0813 用时 12 分 02 秒、成本 $0.12;Grok 4.6 用时 3 分 18 秒、成本 $1.41。性能差一档,成本差一个数量级。

Artificial Analysis 的性价比榜上,V4-Pro 直接登顶——AI 指数基准成本 $268,GPT-5.5 大约是它的 12 倍,Claude Opus 4.7 约 19 倍。

一句话:能力提升是实打实的,尤其长周期软件工程(DeepSWE)和终端操作,这是它这次最吓人的两个点。

价格:便宜是真的,但 8 月 17 日要涨

当前价(8/17 前):

项目价格(元/百万 token)
输入(缓存命中)0.025
输入(缓存未命中)3
输出6

8 月 17 日 00:00 起峰谷定价(高峰时段 9:00-12:00、14:00-18:00):

时段缓存命中输入未命中输入输出
空闲时段0.154.513.5
高峰时段0.309.027.0

高峰输出 27 元/百万 token,比现在的 6 元涨了 350%。缓存命中涨价 500%。官方预告未来还可能整体大幅涨价(推理算力不够,Flash 上线后 API 已经多次性能下降)。并发限制:Pro 500、Flash 2500。

值不值得用?

分情况:

  • 追求极致能力、预算敏感的团队:现在到 8/16 是窗口期,老价格 + 顶级性能,该上的实验赶紧上。8/17 涨价后,高峰时段 27 元的输出价格对高频 Agent 任务就不太友好了,建议把重活排到空闲时段(18:00 后、早 9 点前)。
  • 用 Flash 已经够用的:别急着升 Pro。Flash 的 Agent 能力已经很强(Terminal Bench 82.7),涨价后 Flash 高峰输出 9 元 vs Pro 高峰 27 元,三倍差价,用不上 Pro 的深度就是浪费。
  • 开发者:模型名 deepseek-v4-pro,记得盯官方更新日志——正式公告和完整基准表还没发,现在的数字是流出版。

最后泼盆冷水:V4-Pro-0813 的评测数据目前没有官方背书,DeepSWE 12.8 → 62.7 这种涨幅太夸张,等官方公告出来再下最终结论。但无论数据有没有水分,Pro 正式版来了、涨价也要来了,这两件事是确定的。8 月 17 日之前,是这轮 DeepSeek 性价比最后的窗口。


← Back to blog