三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

DeepSeek V4 Pro 正式版发布:Agent 能力跃升、双协议兼容,全面拆解 0813 版本

DeepSeek V4 Pro 正式版发布:Agent 能力跃升、双协议兼容,全面拆解 0813 版本

DeepSeek-V4-Pro-0813 于 2026 年 8 月 13 日凌晨无预告发布,是 V4 系列旗舰模型的首个正式版本,承接 4 月 24 日上线的预览版;核心变化是 Agent 能力的大幅跃升——DeepSWE 从 12.8 跳至 62.7(+390%)、NL2Repo 从 38.5 升至 61.5、DSBench-Hard 升至 67.2——架构与参数量未变(1.6T MoE、激活 ~49B),改变来自针对性后训练;定价维持 ¥3 元/百万 token(输入)、¥6 元/百万 token(输出),官方同步宣告"近期将大幅涨价";API 新增 Responses API 与 Anthropic API 双协议支持,已兼容 Codex 和 Claude Code 等主流编程工具;同期 DeepSeek Harness 极简模式亦随文档首次亮相。


这次更新了什么:不是新模型,是新后训练

V4-Pro-0813 与 4 月的预览版共用同一模型架构和参数规模,官方说明变化来自后训练阶段的重做:

  • 参数量:总参数 1.6T(MoE 架构),每 token 激活约 49B
  • 上下文窗口:1M token,最大输出 384K token
  • 推理模式:三档——Non-Think(快速响应)/ Think High(复杂分支)/ Think Max(最深推理)
  • 架构特性:CSA(压缩稀疏注意力)+ HCA(高度压缩注意力)混合,相较 V3.2 架构,FLOPs 降至约 27%,KV Cache 需求降至约 10%

模型结构没有变,但 Agent 相关的后训练数据和策略做了针对性改造。DeepSWE +390% 的跳升,是后训练而非架构升级所驱动的。


Agent 基准:从不及格到领跑

官方公布了与预览版的对比数据:

测试集预览版(4月)正式版(0813)涨幅
DeepSWE(软件工程 Agent)12.862.7+390%
NL2Repo(自然语言生成仓库)38.561.5+60%
DSBench-Hard(全栈高难编码)~33(推算)67.2~翻倍

DeepSWE 是 DeepSeek 自研的软件工程 Agent 基准,以复杂多步骤代码修改任务为主,12.8 分意味着几乎无法完成自主编码任务,62.7 分已进入主流 Agent 产品的竞争区间。

参照系:此前 V4-Flash 正式版(7 月 31 日)在 DeepSWE 上得分 54.4,V4-Pro 正式版的 62.7 比 Flash 还高出约 8 个百分点。

第三方 BenchLM 数据(V4 Pro High 模式):

类别测试集分数
编程SWE-bench Verified79.4%
编程LiveCodeBench COT89.8%
编程Codeforces Rating2919
推理GPQA Diamond89.1%
长上下文MRCR 1M token83.3%
智能体BrowseComp80.4%
数学HMMT Feb 202694.0%
数学IMOAnswerBench88.0%

价格:3 倍于 V4-Flash,官方预告涨价

V4-Pro 维持预览版定价,与 V4-Flash 正式版的对比:

计费类型V4-FlashV4-Pro倍数
输入(缓存未命中)¥1/M¥3/M
输入(缓存命中)¥0.008/M¥0.025/M~3×
输出¥2/M¥6/M
并发限制25005001/5

注意:官方文档在 V4-Pro 发布的同一天明确提示:“We plan to raise the overall pricing for DeepSeek API services in the near future, with asignificant increaseexpected.”

如果有大量 V4-Pro 调用计划,当前时间窗口锁定用量可能有意义。


API 接入方式变化:Responses API + Anthropic 双协议

V4-Pro 正式版新增了两个 API 协议层的兼容:

1. OpenAI Responses API(新)

fromopenaiimportOpenAI client=OpenAI(api_key="你的 DeepSeek Key",base_url="https://api.deepseek.com/v1",)response=client.responses.create(model="deepseek-v4-pro",input="分析这段代码并生成测试用例",)print(response.output_text)

2. Anthropic API 协议(新)

importanthropic client=anthropic.Anthropic(api_key="你的 DeepSeek Key",base_url="https://api.deepseek.com",)message=client.messages.create(model="deepseek-v4-pro",max_tokens=4096,messages=[{"role":"user","content":"分析这段代码并生成测试用例"}],)print(message.content[0].text)

3. 标准 OpenAI Chat Completions(不变)

原有 OpenAI 格式调用无需修改,model字段填deepseek-v4-pro即自动指向最新版本。

这意味着:现有 Claude Code、Codex 的工作流,可以通过切换 base_url 和 api_key 直接测试 V4-Pro 能力,代码零改动。


推理强度调节

V4-Pro 支持三档推理模式,通过reasoning_effort参数控制:

completion=client.chat.completions.create(model="deepseek-v4-pro",reasoning_effort="high",# "none" / "high" / "max"messages=[{"role":"user","content":"设计一个分布式任务队列的架构方案"}],)
档位API 值适用场景Token 消耗
Non-Think"none"快速问答、代码补全、格式转换最少
Think High"high"代码审查、多步推理、调试
Think Max"max"复杂架构设计、竞赛题、长链路 Agent最多

企业生产环境建议按任务类型动态设置——简单任务用"none"可将成本和延迟降低 50% 以上。


V4-Pro vs V4-Flash:怎么选

两款模型现在同时在线,核心区别:

维度V4-FlashV4-Pro
参数量284B MoE1.6T MoE
激活参数~13B~49B
价格¥1/¥2/M¥3/¥6/M
并发限制2500500
DeepSWE54.462.7
NL2Repo54.261.5
适用场景高并发、低延迟、成本敏感复杂推理、多步 Agent、代码生成

选型建议

  • 代码生成、自主 Agent 任务 → V4-Pro(Agent 能力高 8–10 个百分点)
  • 高并发 RAG、实时问答、批量处理 → V4-Flash(并发 5 倍,成本 1/3)
  • 不确定的场景 → 先用 Flash 测出延迟和质量基线,再决定是否升级 Pro

配套:Harness 极简模式首次亮相

V4-Pro 发布文档中首次正式提及 DeepSeek Harness:

“正式版 DeepSeek-V4-Pro 使用DeepSeek Harness 极简模式(即将发布)作为 Agent 测试框架”

这意味着上述所有 Agent 基准(DeepSWE 62.7、NL2Repo 61.5 等)是在 Harness 极简模式下跑出来的。完整 Harness 产品包含更丰富的上下文管理、工具编排和测试回传闭环——实际 Agent 场景下的表现有望进一步提升。(DeepSeek Harness 的完整背景详见团队介绍。)


常见问题

Q:V4-Pro-0813 和之前的deepseek-v4-pro模型 ID 是什么关系?
无缝兼容。API 调用时使用deepseek-v4-pro即自动路由到最新正式版(0813),无需修改代码。0813 是版本号标识,API 层面透明。

Q:官方提示的"大幅涨价"是什么时候?
截至 2026 年 8 月 13 日,官方未给出具体涨价时间,仅说"near future"(近期)。建议关注官方 API 文档更新日志(api-docs.deepseek.com)。

Q:V4-Pro 的并发限制 500 对企业场景够用吗?
取决于请求量。500 并发对于大多数中型企业日常用量足够,但高并发批处理场景(如离线数据分析、大规模代码审查流水线)可能触顶,此时需要混合使用 V4-Flash 或通过多 Key 分流。通过多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)统一接入 DeepSeek 和其他国产模型,可以在 V4-Pro 触达并发上限时自动降级到其他模型,降低业务中断风险。

Q:Anthropic API 格式接入 DeepSeek 会有行为差异吗?
接口层协议兼容,但 DeepSeek V4-Pro 的 thinking 模式与 Claude 的 extended thinking 实现不同,streaming 的reasoning_content字段格式也有差异。建议在迁移前测试关键提示词的输出一致性。

Q:DeepSWE 62.7 是什么水平?
DeepSWE 是 DeepSeek 的内部 Agent 基准,外部独立复现数据有限。作为参照:BenchLM 第三方数据显示 V4-Pro 在 SWE-bench Verified(业界通用基准)上得分 79.4%,处于同级别模型第一梯队,但仍低于 Claude Opus 5 的 96%。


小结

V4-Pro-0813 是一次重点在后训练的 Agent 能力升级:架构不变,DeepSWE 从 12.8 升至 62.7,Agent 编排能力从"几乎无法完成"跨越到"可与主流产品竞争";双协议支持(OpenAI + Anthropic)让现有 Claude Code / Codex 工作流可以零改动接入测试;价格维持 ¥3/¥6 per million token,但官方涨价预告已经发出,当前是锁定用量的时间窗口。

DeepSeek V4 系列至此首次形成完整正式版矩阵——Flash 负责高并发低延迟,Pro 负责复杂推理和深度 Agent,Harness 作为配套工程框架即将补位。

本文信息截至 2026 年 8 月 13 日,以 DeepSeek 官方 API 文档为准。


延伸阅读

  • DeepSeek API 官方更新日志:https://api-docs.deepseek.com/zh-cn/updates
  • DeepSeek API 价格页:https://api-docs.deepseek.com/quick_start/pricing
  • BenchLM V4 Pro High 测评数据:https://benchlm.ai/models/deepseek-v4-pro-high
  • 七牛云 Token Plan(含 DeepSeek V4 Pro 多模型接入):https://qiniu.com/ai/plan
← 返回列表