倒反天罡!DeepSeek V4-Flash 正式版悄然上线:130亿激活参数,把自家1.6万亿旗舰「以下克上」

📅 2026/7/31 21:25:00 👁️ 阅读次数 📝 编程学习
倒反天罡!DeepSeek V4-Flash 正式版悄然上线:130亿激活参数,把自家1.6万亿旗舰「以下克上」

2026年7月31日,DeepSeek 在 API 更新日志里悄悄官宣:DeepSeek-V4-Flash-0731 正式版上线公测。没有发布会、没有预告,却让全球开发者圈直接沸腾——一个轻量版模型,在 Agent 能力上全面反超自家 Pro 旗舰,还把 OpenAI 的 Codex 生态给「策反」了。


一、事件速览:一场「悄无声息」的重磅发布

2026年7月31日下午,DeepSeek 在官方 API 文档的更新日志中宣布:DeepSeek-V4-Flash 正式版 API 上线公测(版本号 V4-Flash-0731)。

几个关键事实:

  • 没有新架构:模型结构、尺寸与 4 月 24 日发布的 V4-Flash 预览版完全一致,仅重新进行了后训练
  • 无需改代码:开发者继续用 deepseek-v4-flash 模型名调用,后台自动切换到新版本
  • 仅限 API:DeepSeek App、网页端以及 V4-Pro API 均未变化,普通用户今天打开 DeepSeek,体验和昨天一模一样
  • V4-Pro 正式版仍在路上:官方表示将「尽快发布」,预计 8 月初上线

也就是说,这是一次只给开发者看的升级。但信息量之大,让整个行业都坐不住了。


二、核心看点:Flash 把 Pro 给「以下克上」了

按照行业惯例,Pro 负责性能天花板,Flash 负责便宜大碗。但这次 DeepSeek 直接掀翻了这张桌子——V4-Flash 正式版在 Agent 能力上,多项基准测试全面反超三个月前的 V4-Pro 预览版

2.1 官方公布的 9 项基准测试成绩

测试项目 V4-Flash 正式版 (0731) 说明
Terminal Bench 2.1 82.7 终端操作测试(预览版仅 61.8,暴涨 20.9 分)
Cybergym 76.7 网络安全攻防模拟
Toolathlon Verified 70.3 工具调用综合测试
NL2Repo 54.2 自然语言生成代码仓库
DeepSWE 54.4 代码 Agent 任务(预览版仅 7.3,暴增近 7.5 倍)
DSBench-FullStack 68.7 内部全栈开发测试
DSBench-Hard 59.6 高难度编码专项测试
Agent Last Exam 25.2 智能体综合测试
Automation Bench (Public) 25.1 自动化基准测试

横向对比更有冲击力:

模型 Terminal Bench Toolathlon Verified
DeepSeek V4-Flash 正式版 82.7 70.3
GLM-5.2 81.0
Claude Opus 4.8 85.0 76.2
V4-Pro 预览版 67.9(Terminal Bench 2.0)

一个开源轻量版,在终端操作测试上反超 GLM-5.2,距离 Opus 4.8 只差 2.3 分;工具调用差距也在快速收窄。注意 Terminal Bench 2.0 与 2.1 不是同一套测试集,直接对比不完全公平——但一个激活参数仅 130 亿的轻量模型跑出这个成绩,已经足以说明问题。

翻译成人话:新版 Flash 不只更会写代码,也更擅长「自己动手干活」——拆解任务、调用工具、发现错误、从头到尾把一件事做完。

2.2 最恐怖的一句话:「仅重新进行了后训练」

DeepSeek 在更新日志中的原话:

「DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。」

也就是说,骨架完全没变,只是更会「练」了

打个比方:基础训练像「上学」,后训练更像「入职后的专项练习」——模型原本就会写代码、读文档,现在要反复练习怎么拆解任务、选择工具、发现错误,把一件事从头做到尾。身板没变,做事的习惯变了。

这传递了一个极其深刻的信号:在特定任务上,模型规模可能不再是决定性因素,训练方法和数据质量的权重正在快速上升。 谁说后训练只是「锦上添花」?在 DeepSeek 手里,这是化腐朽为神奇。


三、技术底牌:百万上下文背后的工程细节

V4-Flash 的能力暴增不是凭空来的,它站在 V4 系列强大的架构基础上。回顾 4 月发布的 V4 技术报告(《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),可以看到四个核心技术突破:

3.1 模型规格

参数 V4-Pro V4-Flash
总参数 1.6T(1.6万亿) 284B(2840亿)
激活参数 49B(490亿) 13B(130亿)
架构 MoE 混合专家 MoE 混合专家
上下文长度 1M tokens(原生) 1M tokens(原生)
最大输出长度 384K tokens 384K tokens
预训练数据 33T tokens 32T tokens
网络层数 未公布 43 层

两者在模型规模上相差一个数量级——但 Flash 通过后训练把 Agent 能力拉到了接近 Pro 的水平,这本身就是对「参数至上论」的有力反驳。

3.2 核心架构创新(V4 系列共通)

① CSA + HCA 混合稀疏注意力 —— 把 KV Cache 沿序列维度「叠罗汉」

  • CSA(压缩稀疏注意力):把每 m 个相邻 token 的 KV 压缩成 1 个「摘要条目」(V4-Pro 中 m=4),再用一个轻量 Lightning Indexer 给每个 query 选 top-k 个最相关的压缩条目精读(top-k=1024)。相当于「先粗读,再精读」。
  • HCA(重度压缩注意力):压缩比拉到 128,不做稀疏选择、保留 dense attention,把 1M tokens 压成约 7800 个 entry,所有 query 都能看——相当于一个「永远在线的全局摘要通道」。
  • 两者交错排布,构成局部精读 + 全局浏览的双轨注意力,配合滑窗分支(保留最近 128 个 token 未压缩 KV)和 Attention Sink,兼顾细节与全局。

效率数据(1M token 场景下 vs V3.2):

指标 V4-Pro V4-Flash
单 token 推理 FLOPs V3.2 的 27% V3.2 的 10%
KV Cache 占用 V3.2 的 10% V3.2 的 7%

百万 token 上下文,从「演示用 demo」变成了「可以日常跑的工作负载」。

② mHC(流形约束超连接)—— 给残差通路加一条「信息守恒律」

V4 没有沿用标准残差连接,而是引入 Hyper-Connections 的演进版 mHC:把残差流宽度拓宽 4 倍,并强制将残差映射矩阵约束在 Birkhoff 多胞体(双随机矩阵流形)上——每行每列和为 1、元素非负。收益有两个:谱范数 ≤ 1,前向不会爆、反向梯度不会炸;双随机矩阵在乘法下封闭,深层堆叠的稳定性可以传递。这解决了 1.6T 参数规模训练不收敛/不稳定的世界级难题。

③ Muon 优化器 —— 方向更稳、收敛更快

替换主流的 AdamW,把「逐元素估计」换成「对整梯度矩阵做正交化」(通过 Newton-Schulz 迭代近似,前 8 步激进系数快速逼近、后 2 步保守系数稳定到 1),搭配 GRPO 强化学习 + KL 散度修正。Embedding、prediction head、RMSNorm 等仍用 AdamW。

④ FP4 QAT —— 把 MoE 权重再砍一半

对 MoE 专家权重和 CSA indexer 的 QK 路径引入 MXFP4 量化感知训练,推理时直接用真 FP4 权重,显存和带宽压力大幅下降,在国产 AI 芯片上也能稳定部署。

3.3 长上下文效率的意义

过去两年大模型的进步沿着两条主线:reasoning 模型靠更长思考链做 test-time scaling;agentic 工作流动辄处理跨多文档、多工具调用的长 horizon 任务。两条路都极度依赖上下文长度,而 vanilla attention 是 O(n²)——上下文翻一倍,算力和显存翻四倍。

DeepSeek V4 用这套组合拳,把 1M 上下文的边际成本压到了「能用、好用、日常用」的程度。同样一张显卡,以前只能跑 32K 上下文,现在可以稳定跑 1M。


四、定价与并发:不只是便宜,是「降维打击」

4.1 价格对比

计费项 V4-Flash 正式版 V4-Pro GPT-4o 系列
输入(缓存命中) 0.2 元 / 百万 tokens 1 元
输入(未命中) 1 元 / 百万 tokens($0.14) 12 元($0.435) 约 10 倍于 Flash
输出 2 元 / 百万 tokens($0.28) 24 元($0.87)

V4-Flash 的价格约为 V4-Pro 的 三分之一

4.2 并发能力:5 倍差距

指标 V4-Flash V4-Pro
并发请求上限 2,500 500

对跑 Agent 任务来说,2500 vs 500 的并发差距比任何跑分都实在——Agent 场景对推理速度和成本极度敏感,多轮任务要反复调用工具,Flash 的低价 + 高并发在规模化落地时是压倒性优势。

4.3 隐藏信息:峰谷定价要来了

DeepSeek 还预告了峰谷定价政策:高峰时段(北京时间 09:00-12:00、14:00-18:00)价格按常规的 2 倍计费,具体生效日期未公布。高频调用团队需要提前评估账单影响。


五、生态攻势:把 OpenAI 的 Codex「策反」了

这次发布最让开发者兴奋的,是生态层面的动作:

5.1 原生支持 OpenAI Responses API(且是 Flash 独占)

  • V4-Flash 正式版原生支持 OpenAI 力推的 Responses API 格式
  • 关键点:Responses API 目前仅 Flash 支持,V4-Pro 要等到 8 月初
  • 开发者无需修改 Base URL 即可切换模型

5.2 针对性适配 Codex

OpenAI 开源的 Codex 现在能直接接入 deepseek-v4-flash

  • Codex CLI
  • ChatGPT 桌面端
  • VS Code 的 Codex IDE 扩展

三者共用同一份配置文件,完成一次配置,即可在不同客户端中选择 DeepSeek-V4-Flash。等于把 OpenAI 自家生态的 Agent 应用,低成本「平移」到了 DeepSeek 平台上。

5.3 既有 Agent 生态全覆盖

V4 预览版已完成对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等主流 Agent 产品的适配优化。加上思考/非思考双模式切换、Tool Calls、JSON 输出、Anthropic API 格式,开发者的接入自由度很高。


六、彩蛋:DeepSeek Harness 首次亮相

这次更新还悄悄放出了一个「隐藏武器」——DeepSeek Harness

官方注明:本次公开基准测试中的 Code Agent 任务,使用的是 DeepSeek Harness 极简模式作为测试框架(max 档位,topp=0.95,temperature=1.0)。该框架为模型提供终端操作、代码编辑、工具调用和任务验证环境,相关内容后续将正式公布。

背景信息:DeepSeek 的 Agent Harness 团队成立于 今年 3 月,负责人崔添翼是 90 后浙大计算机出身,手握 6 枚 ACM 亚洲区域赛金牌,曾在顶尖量化机构 Jane Street 任职九年,今年 3 月加入 DeepSeek,5 月大力招兵买马。

一个专门搞 Agent 评测的自研框架浮出水面,暗示 DeepSeek 在 Agent 能力上还有大量后手。


七、实测:3 块钱干完 5 件事

跑分终究是跑分,真实场景表现如何?爱范儿把 V4-Flash 接入自家 Agent 工具 Proma,做了 5 个从简单到复杂的实测任务(不追加提示、不人工干预):

# 任务 表现
1 分析 320 篇早报数据并生成交互式 HTML 报告 数字卡片 + 柱状图、折线图、环形图、雷达图、散点图,深色主题 UI 完成度极高
2 编写打砖块游戏(含物理引擎、4 种砖块、道具系统、粒子特效) 弹性碰撞、动量传递、金属砖裂纹、爆炸砖波及、多球/激光/粘性挡板全部可触发
3 三体轨道模拟器(RK4 积分) 四阶龙格-库塔法 + 引力软化 + 自适应步长,内置 figure-8、Lagrange 轨道预设
4 科幻控制舱仪表盘(实时波形、环形进度、超载模式) 主次层级清晰,发光效果没有盖过数据,Web Audio 合成警报音
5 调用 GitHub API 生成开源 AI 项目周报 创建 Python 脚本、实际运行、检查结果,交付脚本 + Markdown 周报 + JSON 数据 + 网页

费用账单:393 次 API 请求,累计消耗约 3422 万 token,总花费 2.85 元。 测试前充的 10 元,连三分之一都没用完。

开发者们的评价也很直接:「V4-Flash 对我的使用场景来说,简直是性能溢出了」「这就是我想要的模型——够便宜,也够聪明」。


八、行业信号:AI 竞争进入「智价比」时代

8.1 同一天的两颗炸弹

7月31日这一天,行业里发生了一件戏剧性的事:

  • DeepSeek:V4-Flash 正式版上线,能力大涨、价格不变
  • OpenAI:突然宣布 GPT-5.6 系列大幅降价——Luna 价格下调约 80%,Terra 下调 20%(Luna 降至每百万 token 输入 0.2 美元、输出 1.2 美元),OpenRouter 上还有 5 折

顶级模型的竞争,正在从单纯比拼能力上限,转向争夺「智价比」。对厂商这是利润压力,对开发者和用户则是利好——Agent 可以调用更多次、思考更长时间,承担过去因成本过高而无法落地的任务。

8.2 「后训练」正在成为主战场

Flash 正式版「仅重训、不动架构」的成绩单,给整个行业上了一课:预训练决定了天花板,但后训练决定了你能摸到多高。 数据质量、强化学习、推理策略和训练方法,依然能从现有模型里挖出更多能力。

8.3 Agent 能力才是决赛圈

价格战打到现在,API 调用成本已不再是开发者选模型的决定性因素,真正稀缺的是能交付的 Agent 能力。DeepSeek 用轻量版证明:低价不等于低能。

8.4 国产大模型开始「各有所长」

  • Kimi K3:2.8T 超大 MoE、原生多模态、主打全能综合推理
  • V4-Flash:轻量 MoE、专攻文本效率与 Agent 落地、适配国产芯片、私有化门槛低
  • GLM-5.2、MiniMax 新模型:各自卡位

国产模型不再是一个模子刻出来的「GPT 仿制品」,差异化竞争的格局正在形成,也正在打破海外闭源模型的定价垄断。

8.5 资本加持后的第一次技术兑现

今年 6 月,DeepSeek 完成首轮外部融资,总额超 74 亿美元(约合 500 亿元人民币),投后估值超 500 亿美元(约合 3380 亿元),创下中国 AI 行业单轮融资纪录(部分媒体报道估值已达 710 亿美元)。这次 Flash 正式版,是资本加持后的第一次技术兑现。


九、客观看待:还有哪些待解问题

写稿不易,理性吃瓜。这篇报道也要列出「泼冷水」的部分:

  1. 仅限 API 端:App 和网页端暂时无法体验,普通用户今天打开 DeepSeek 和昨天一样
  2. 权重尚未开源:Hugging Face 上目前还是 4 月的预览版权重(MIT 许可),V4-Flash-0731 的权重是否开源、何时开源,官方尚未明确
  3. 基准测试均为官方自测:9 项成绩来自 DeepSeek 自己的 Harness,截至 7 月 31 日尚无第三方独立复现
  4. 高推理强度依赖:好成绩多依赖高推理强度档位,单价优势可能被更长任务轨迹消耗的更多 token 抵消,实际任务总成本优势还需独立评测验证
  5. 能力上限仍低于 Pro:超复杂多步骤智能体任务、高精数理难题仍是 Flash 的短板
  6. 缺失原生多模态:V4-Flash 专注文本场景,图文混合分析需搭配 Kimi K3 或海外模型

写在最后

DeepSeek V4-Flash 正式版的发布,不是一次「小版本迭代」,而是对「规模至上」论的一次有力反击。

130 亿激活参数的模型,在 Agent 任务上足以与自家旗舰掰手腕、与闭源顶级模型叫板。这对整个行业的意义是:通往 AGI 的路不止「堆参数」这一条。更聪明的训练方法、更高质量的数据、更极致的工程优化——这些同样能带来质的飞跃。

而 DeepSeek 的战略意图也很清晰:用高性价比的轻量模型切入 Agent 应用市场,把百万 token 长上下文、函数调用、工具使用这些高阶能力「下放」到人人用得起的价格带。

对于开发者而言,一个 Agent 能力拉满、调用成本低到任性、原生兼容 OpenAI 生态、还能本地私有化部署的模型,意味着什么?

意味着「人人都能用上 Agent」的时代,真的来了。