DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了

📅 2026/8/2 18:59:27 👁️ 阅读次数 📝 编程学习
DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了

一个 284B 的"廉价版",没换架构、没加参数,只靠重新训练,就在 9 项 Agent 测试里整体超过了自家 1.6T 的旗舰。这件事正在改写一个你以为理所当然的判断:贵的不一定是对的。

7 月 31 日,DeepSeek 做了一件反直觉的事。

他们把自家 V4 系列里最便宜的 Flash 模型重新训练了一遍——没换架构,没加参数,连模型尺寸都没动。然后,这个只有 284B 总参数的"廉价版",在 9 项 Agent 能力测试里整体超过了自家 1.6T 参数的旗舰 V4-Pro 预览版。

知名 AI 博主宝玉在 X 上的原话是:「便宜的那个模型(Flash)经过后训练调优之后,在编程和工具调用任务上反超了贵的那个模型(Pro)的预览版。」

到底发生了什么

DeepSeek-V4-Flash 正式版 API 在 7 月 31 日上线公测,版本号 0731。

这次更新最特殊的地方在于:模型本身没变,变的是训练方式。

Flash 还是那个 Flash——284B 总参数、13B 激活的混合专家架构(MoE),和 4 月份的预览版一模一样。变的是"后训练"环节:用新的指令数据、强化学习和工具使用轨迹,重新教模型怎么在实际任务里"动手"。

相当于同一个人去集训了一圈,脑容量没变,但出手突然变老练了。

DeepSeek 官方一口气公布了 9 项 Agent 基准成绩,并明确表示:正式版 Flash 在这些测试上整体超越了 V4-Pro-Preview。

9 项测试,数字有多离谱

最直观的冲击来自一个叫 DeepSWE 的基准——它专门测试 AI 能不能像真正的工程师一样,在一个真实代码仓库里定位 bug、改代码、跑测试、提交结果。

Flash 预览版的成绩是7.3

正式版直接跳到了54.4——涨幅645%

这不是"提升了一点",是"从不太会变成了真的能干"。

其他几项同样值得注意:

  • Terminal Bench 2.1(终端操作能力):82.7。V4-Pro 预览版是 72.1,Flash 预览版只有 61.8。

这个测试衡量的是 AI 能不能在真实的命令行环境里完成多步骤任务——不是"写一个命令给你看",而是自己跑命令、看反馈、处理报错、继续修复。

  • Toolathlon(工具编排能力):70.3。测试的是 AI 能不能从一堆工具里选对工具、按对参数、串成一条完整流程。
  • DSBench-Hard(高难度开发任务):59.6。全栈开发任务,前端后端 API 测试一起改。

这个便宜模型不只是在"写代码",而是在"跑环境"。

最反常的地方:进步不靠堆参数,靠训练方法

过去两年,AI 行业有一个近乎共识的直觉:模型越大越强。参数翻倍,能力上一台阶。

但这次 DeepSeek 做的事情恰好相反。

284B 的 Flash,总参数只有 1.6T 旗舰 V4-Pro 的不到五分之一。每次推理只激活 13B 参数,成本大约只有 Pro 的一个零头——API 定价 $0.14/百万输入 token、$0.28/百万输出 token。

按传统逻辑,它应该在旗舰面前被碾压。

但后训练改变了一切。同一个基础模型,本来可能已经"知道"Git 怎么用、Linux 怎么操作,但如果没经过足够的工具使用训练,它就会反复执行失败的命令、选对工具但传错参数。

后训练解决的不是"知不知道",而是"会不会用"。

这对开发者意味着什么:选模型的逻辑要变了

以前团队选模型的默认动作是:先用最贵最大的,跑不动了再找便宜的降级。

如果 Flash 正式版的能力可以持续验证,更合理的做法可能是反过来:大部分日常任务用 Flash 跑,反复失败或需要密集知识推理时才升级到 Pro。

这直接影响 Agent 产品的账本。一个 Agent 任务往往涉及几十轮模型推理、工具调用和错误纠正——成本不是"聊一轮多少钱",而是"成功交付一个任务总共花多少钱"。

一个单价低但老出错的模型,算下来未必便宜;一个单价更低但一次就做对的模型,才是真的省钱。

这正是我们「AI 落地账本」系列一直在追的主线:AI 的成本竞赛,已经从"谁的模型更便宜"变成"谁的便宜模型更能干活"。

对普通人意味着什么:你为 AI 付的钱,正在被重新定价

如果你不是开发者,这件事和你仍然有关。

AI 公司正在用两种方式压低成本:一是把模型做小(Flash 只激活 13B),二是把训练做精(后训练提升效率)。两条路叠加的效果是:同样能力的 AI 服务,价格正在快速下降。

你用的 AI 写作工具、代码助手、客服系统,背后的推理成本在变低。这意味着更多免费额度、更低的订阅价格、更多原本收费的功能变成标配。

但也别急着欢呼。DeepSeek 官方也承认,Flash 在复杂运动物理合理性、极多主体交互等场景上仍有短板。Agent 基准跑分高,不等于在生产环境里一定可靠——第三方复测、真实仓库任务成功率、单任务综合成本,这些数据还需要时间验证。

现在可以怎么做

  • 开发者:把deepseek-v4-flash接进你的 Codex 或 Agent 工作流试跑。Flash 正式版原生兼容 Responses API,VS Code 和 Codex CLI 可直接配置。建议先在非关键任务上对比 Flash 和 Pro 的交付成功率,再决定默认模型。
  • 创业者:如果你的产品重度依赖 AI 执行能力(而不只是对话),Flash 的成本结构值得重新算一遍账。便宜模型 + 好的训练,可能比贵模型 + 粗放调用更划算。
  • 普通用户:不用纠结用哪个模型。但记住一个判断——"贵=好"在 AI 领域正在失效,选工具时别被"我们用的是最贵的大模型"这种话术唬住。

结语

DeepSeek 这次做的事情,本质上是给整个行业提了个醒:

你可能不需要一个更大的大脑,而是需要一个训练得更好的大脑。

当 284B 的便宜模型在 Agent 任务上跑赢了 1.6T 的旗舰,"参数军备竞赛"就不再是唯一主线了。下一个值得关注的,不是谁的模型又大了多少倍,而是谁用同样的模型,训练出了更强的执行力。