DeepSeek 悄然上线 V4-Pro 正式版
截至 2026-08-13,DeepSeek V4-Pro 正式版已经上线,版本号为 DeepSeek-V4-Pro-0813。
调用方式没有变化。开发者仍使用 deepseek-v4-pro,OpenAI 格式与 Anthropic 格式的 base URL 也保持不变。V4-Pro 默认使用思考模式,并可切换为非思考模式。
这次正式版发布相当低调。DeepSeek 尚未发布单独的新闻或更新日志条目,但官方价格页已经切换至 0813,配套评测也明确标注为 V4-Pro 正式版。API 用户无需修改模型名,服务端会直接使用正式版。
正式版重点补强了 Agent 能力
DeepSeek 给出的对比表显示,V4-Pro 正式版在十项 Agent 相关评测上全部超过 Preview。
这组正式版成绩同时纳入 V4-Flash 0731、GLM-5.2、Kimi-K3、Opus-4.8 和 Fable 5,比 Preview 发布时的旧模型横评更接近当前竞争格局。
| 评测 | V4-Pro 正式版 0813 | V4-Flash 0731 | V4-Pro Preview | V4-Flash Preview | GLM-5.2 | Kimi-K3 | Opus-4.8 | Fable 5(含 fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE(无工具 / 有工具) | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | 34.8 / 45.1 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 61.8 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 39.4 | 48.9 | — | 69.7 | — |
| Cybergym | 83.3 | 76.7 | 52.7 | 38.7 | — | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 7.3 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 49.7 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents' Last Exam | 25.7 | 25.2 | 16.5 | 15.8 | 23.8 | 27.6 | 25.7 | — |
| AutomationBench(Public) | 31.8 | 25.1 | 12.8 | 10.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack | 71.1 | 68.7 | 41.8 | 37.0 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard | 67.2 | 59.6 | 31.1 | 25.8 | 54.5 | 63.0 | 71.7 | 68.3 |
相较 V4-Pro Preview,正式版在 Terminal Bench 2.1 上从 72.1 升至 87.9,在 DeepSWE 上从 12.8 升至 62.7;Cybergym 从 52.7 升至 83.3,AutomationBench 从 12.8 升至 31.8。提升最明显的部分集中在软件工程、终端操作和自动化 Agent 任务。
正式版多项成绩追上第一梯队
V4-Pro 正式版在 Cybergym 和 AutomationBench 的已报告成绩中居首,其他项目则与头部模型互有胜负。
Terminal Bench 2.1 的 87.9 接近 Kimi-K3 的 88.3 和 Fable 5 的 88.0,并高于 Opus-4.8 的 85.0;DeepSWE 的 62.7 高于 Opus-4.8 和 GLM-5.2,但低于 Kimi-K3 与 Fable 5。DSBench-Hard 达到 67.2,高于 Kimi-K3 和 GLM-5.2,仍低于 Opus-4.8 的 71.7。
HLE 呈现混合结果:V4-Pro 正式版的无工具成绩为 42.7,低于 Kimi-K3、Opus-4.8 与 Fable 5;接入工具后升至 60.0,高于 Kimi-K3 和 Opus-4.8,仅低于 Fable 5 的 63.0。
正式版沿用原有模型名和接口
V4-Pro 正式版保留原有接入方式,支持 1M 上下文和 384K 最大输出,当前每百万输出 Token 价格为 0.87 美元。
官方文档显示,模型支持 JSON 输出、工具调用、Responses API、Anthropic API、Chat Prefix Completion 和 FIM Completion,其中 FIM 仅支持非思考模式。缓存命中输入价格为每百万 Token 0.003625 美元,缓存未命中输入为 0.435 美元,并发上限为 500。
DeepSeek 已提示 API 总体价格可能在近期上调。已经使用 deepseek-v4-pro 的团队无需修改模型名,但应重新跑代码库任务、工具调用回归、长上下文稳定性和成本测试,确认服务端版本切换没有改变关键工作流。