重新后训练与 Agent 性能表现
人工智能研究机构 DeepSeek 宣布其轻量级混合专家模型(MoE)deepseek-v4-flash 的官方正式版 API 开启公共测试。该版本维持了其原本的参数规模,但通过重新进行后训练(Re-post-trained),显著强化了模型在 Agentic 任务中的推理表现。
参数规模与 Agent 基准跑分
-
284B
新版本模型在架构设计上所拥有的总参数规模。
-
13B
新版本模型在单次前向传播中所激活的参数规模。
-
82.7
在 Terminal Bench 2.1 基准测试中,新模型在终端命令生成和任务执行上取得的跑分。
-
70.3
在 Toolathlon 评测集上,新模型在多工具调用和链路整合能力上取得的跑分。
下表展示了新版模型与前代预览版及行业主流模型在多项 Agent 核心基准测试中的对比跑分:
| 基准测试 (Benchmark) | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash-Preview | DeepSeek-V4-Pro-Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | - | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench (Public) | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
新版模型经过重新后训练,其 Agent 核心能力大幅提升,在 Terminal Bench 2.1 和 Toolathlon 等多项基准测试上已接近甚至超越早期 V4-Pro 预览版。 这一更新极大拓展了轻量级 MoE 模型在自动化系统和复杂工作流中的实用边界。
极低 API 定价与高峰期计费变动
随着新版模型的公测,DeepSeek 依然维持了其极其低廉且具竞争力的 API 定价。同时,新版本完整支持 1M 字符的超长上下文窗口,以及最长 384K 字符的输出限制,且默认开启支持推理过程计费的思考模式(Thinking Mode)。
DeepSeek-V4-Flash 维持了极具竞争力的低廉价格,但官方宣布未来即将在每天的北京时间高峰时段实行价格翻倍的计费调整。 具体的阶梯收费生效时间将以官方后续公告为准,开发者需在高峰期合理规划高并发请求。
API 调用标识符与遗留别名下线
开发者可在 API 调用中直接将 model 参数设为 deepseek-v4-flash 来体验新版。目前此次更新仅限 API 接口,官方网页端和应用界面暂未同步,V4-Pro 正式版也仍在筹备中。
所有 API 调用必须使用具体的模型标识符,因为原有的通用别名已于 2026 年 7 月 24 日彻底停用。 团队建议现有应用尽快完成代码中参数的全局替换。