DeepSeek V4-Flash 0731 基准测试解读:Agent 能力跃升与横向对比

📅 2026/8/2 12:12:57 👁️ 阅读次数 📝 编程学习
DeepSeek V4-Flash 0731 基准测试解读:Agent 能力跃升与横向对比

DeepSeek V4-Flash 0731 基准测试解读:Agent 能力跃升与横向对比

1. 更新概述

DeepSeek V4-Flash 0731 正式版发布,大幅增强了 Agent 能力。模型架构和尺寸不变,仍是 284B 总参数、13B 激活参数,这次只做了后训练(post-training)。9 项基准测试全部上涨,涨幅远超小版本修修补补的幅度。


2. 纵向对比:与自己比

把所有旧版本和当前版本的成绩放在一起对比,9 项测试全部上涨。

基准测试旧版本V4-Flash 0731涨幅
DeepSWE7.354.4+47.1
CyberGym+38
DSBench-Hard+33.8
DSBench-FullStack+31.7
Terminal-Bench 2.161.882.7+20.9

涨幅最大的三项:DeepSWE 增加 47.1 分,CyberGym 增加 38 分,DSBench-Hard 增加 33.8 分。Terminal-Bench 2.1 从 61.8 涨到 82.7,增加 20.9 分。

核心结论:DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。


3. 横向对比:与同期最强模型比

对比对象包括 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2、MiniMax M3。以下选取 5 个重合度最高的 Agent 基准。

Terminal-Bench 2.1

模型分数
GPT-5.6 Sol领先 5-6 分
Kimi K3领先 5-6 分
V4-Flash 073182.7

GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5-6 分。

DeepSWE

模型分数差距
GPT-5.6 Sol+18.6
Claude Opus 5+14.4
Kimi K3+13.1
V4-Flash 073154.4

这是差距最大的一个基准,V4-Flash 在这个维度上还有明显追赶空间。

Toolathlon-Verified

模型分数
Claude Opus 580.6
Kimi K376.5
V4-Flash 073170.3
GLM-5.2低于 70.3

V4-Flash 的 70.3 已超过 GLM-5.2,距离 Kimi K3 只差 6.2 分。

Agents’ Last Exam 和 AutomationBench

在这两个基准上,V4-Flash 紧咬第一梯队,但尚未拿到第一。

基准结论
Agents’ Last Exam紧咬第一梯队
AutomationBench紧咬第一梯队

核心结论:V4-Flash 已经进入第一梯队的讨论范围,但还没有把最强的几个模型干下去。最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选。


4. 性价比分析

能力大涨,价格一分没涨。

价格维度V4-Flash 0731GPT-5.6 Luna差距
缓存未命中输入0.14 美元0.20 美元便宜 30%
缓存命中输入0.0028 美元0.02 美元便宜 86%
输出0.28 美元1.20 美元便宜 77%,约 1/4.3

单位:每百万 token。

核心结论:大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。


5. 选型建议

场景推荐模型
最难的长链条工程任务GPT-5.6 Sol / Claude Opus 5 / Kimi K3
大批量代码检查、仓库分析、工具调用V4-Flash 0731
关注性价比的场景V4-Flash 0731 为首选
等待最终版本DeepSeek V4-Pro 正式版

6. 总结

  • V4-Flash 0731 通过后训练而非增大底座实现 Agent 能力大幅跃升,9 项测试全部上涨
  • 已进入第一梯队讨论范围,但尚未登顶
  • 价格优势明显,大批量场景性价比突出
  • 最难的长链条工程任务,第一梯队模型依然首选;大批量跑代码检查、工具调用,V4-Flash 极具吸引力