三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

DeepSeek V4 Pro 正式版深夜突袭:0.1分差距,60倍价差,AI价格战打到新高度

DeepSeek V4 Pro 正式版深夜突袭:0.1分差距,60倍价差,AI价格战打到新高度

8月12日深夜,DeepSeek又一次选择了“悄无声息”的方式。

没有发布会,没有官宣推文,没有媒体通稿。DeepSeek只是默默更新了API文档,把模型版本号从预览版换成了DeepSeek-V4-Pro-0813

但在AI圈,这已经是今夜最大的新闻。

因为就在几个小时前,马斯克的xAI刚发布了Grok 4.6;而DeepSeek V4 Pro正式版,带着一份刷屏的评测对比表,把全球最强模型Claude Fable 5逼到了墙角。

一、产品速览:1.6T参数,1M上下文,38.4万输出

先说硬参数。

DeepSeek V4 Pro正式版采用了混合专家(MoE)架构,总参数量约1.6万亿,每次推理激活约490亿参数。支持100万Token上下文窗口和最高38.4万Token的单次输出

这意味着一口气吞下一整部《三体》三部曲还有富余,一次输出能生成一篇中篇小说。

模型默认开启思考模式(thinking mode),同时支持切换为非思考模式,开发者可以在推理深度和响应速度之间灵活选择。接口层面同时兼容OpenAI和Anthropic两套API格式,接入Claude Code这类Agent框架可以直接换base_url。

功能上,Tool Calls、Responses API、JSON Output全部支持——DeepSeek在接口层面已经完整对齐了当前主流的Agent开发工具链。

二、性能炸裂:0.1分差距,两项反超

参数只是背景,真正让外界兴奋的是性能数据。

DeepSeek官方群流出的一份覆盖10项智能体基准测试的横向对比表,在开发者社区刷屏。

Terminal Bench 2.1:考察AI在真实终端环境中执行命令、解决系统问题的能力。V4 Pro正式版拿到87.9分,全球第一的Anthropic Fable 5是88.0分差距只剩0.1分。作为参照,预览版只有72.1分——三个月,跃升了15.8分。

更令人振奋的是两项反超

  • Cybergym(AI安全智能体基准):V4 Pro83.3分vs Fable 583.1分,以0.2分的微弱优势压过;

  • AutomationBench(工作流智能体测试):V4 Pro31.8分vs Fable 529.1分

DeepSWE(长周期软件工程能力测试)上,V4 Pro从预览版的12.8分暴涨至62.7分,接近原来的五倍,超过了Anthropic上一代旗舰Opus 4.8的58.0分。

综合所有测试,Fable 5平均领先幅度为5.3%;如果剔除“无工具版人类终极考试”这一极端样本,**剩余项目平均差距仅2.8%**。

这些测试考察的不是“会不会聊天”,而是AI能不能真正干活——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛

三、价格战打到新高度:57倍价差

性能只差0.1分,价格差多少?

目前,Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元

而DeepSeek V4 Pro是多少?6元人民币——以当前汇率换算,不到1美元

同样是每百万输出Token:

  • Fable 5:50美元

  • GPT-5.6 Sol Max:30美元

  • Grok 4.6:6美元

  • DeepSeek V4 Pro:约0.83美元

0.1分的性能差距背后,是近60倍的价格鸿沟

具体定价方面,V4 Pro缓存未命中输入3元/百万Token、输出6元/百万Token,缓存命中输入低至0.025元/百万Token。同为V4系列的Flash版分别为1元、2元和0.02元,两者价差恰好三倍,形成了“高频轻量任务走Flash、复杂推理任务走Pro”的清晰产品分层。

不过需要注意,DeepSeek已经在官方页面预告即将涨价,且涨幅较大。这也意味着,当前“地板价”的V4 Pro,可以看作DeepSeek在新模型上线初期引流的一场“临时价格战”

一边是性能追平全球顶尖模型,一边是预告大幅涨价。这家以性价比横扫市场的公司,正在讲述一个截然不同的新故事

四、同日撞车:梁文锋对垒马斯克

这次发布的时间点极为微妙。

就在V4 Pro上线前几个小时,马斯克旗下xAI发布了Grok 4.6,在面向真实知识工作的GDPval-AA v2评估中以1753 Elo登顶,超过Fable 5的1741和GPT-5.6 Sol Max的1728。

两款主打高性价比的模型同夜撞车,不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果

另一边,阿里在同一天正式开放了Qwen 3.8 Max的模型权重,首次将旗舰级模型对外开放。一天之内,中国AI阵营密集出手——DeepSeek打性能价格战,阿里打开源牌。

梁文锋与马斯克双强对垒,纷纷拿出兼具高性能与高性价比的产品。真正感到有压力的,恐怕还是OpenAI与Anthropic。

五、背后深意:三个信号

信号一:Agent能力正在重新定义“强模型”

V4 Pro的升级,核心词是“Agent”。从“更会答题”到“更会把一件事干完”——这是DeepSeek官方叙事的关键转变。Terminal Bench、DeepSWE这类测试,考察的不是模型的知识储备,而是它能不能像工程师一样持续干活。大模型正在从“聊天玩具”走向“生产工具”。

信号二:“性价比”正在成为新的竞争维度

0.1分的性能差距,60倍的价格差。当DeepSeek能用不到1美元的价格做到Fable 5用50美元才能做到的事,全球开发者的技术选型逻辑将被彻底改写。过去,高性能模型遥遥领先,即便是性能较差的模型也可能依靠低价拿下一定市场份额。但在DeepSeek V4系列、Grok 4.6这类主打性价比的高性能模型发布后,这种单纯的发展路线大概是要正式告吹了。

信号三:涨价预告背后的自信

就在V4 Pro正式发布六天前,DeepSeek刚刚宣布计划近期整体上调API服务定价,“预计涨幅较大”。此次V4 Pro的性能表现,在某种程度上解释了涨价的底气。DeepSeek正在从“烧钱换市场”走向“用实力定价”它的第一仗,不是再赢一张榜单,而是证明DeepSeek可以持续改变全球模型的成本曲线

六、给创业者的启示

1. 重新评估技术选型的经济账

0.1分的性能差距、60倍的价格差——这个等式足以让每一个开发者重新审视自己的技术选型。如果你的应用场景对推理成本敏感,DeepSeek V4 Pro提供了一个极具竞争力的选项。

2. 关注Agent能力的商业化落地

V4 Pro的升级核心是Agent能力。DeepSWE从12.8分暴涨至62.7分,意味着AI已经能够在复杂的开源代码仓库中自主理解代码、修改多个文件、运行测试并不断修正。如果你的业务涉及软件开发、自动化运维、数据分析等需要“持续干活”的场景,现在正是评估AI Agent替代方案的时候。

3. 警惕“涨价”信号背后的成本曲线变化

DeepSeek预告涨价,意味着“永远的地板价”不可持续。但即便如此,6元 vs 50美元的价差依然悬殊。创业者在做成本规划时,既要利用当前的低价红利,也要为未来的价格调整预留弹性。

4. “双API兼容”降低了迁移成本

V4 Pro同时兼容OpenAI和Anthropic两套API格式。这意味着切换模型的工程成本大幅降低。创业者可以更灵活地在不同模型之间做A/B测试,找到最适合自己场景的“性能/价格”平衡点。

5. 中国AI阵营的集体崛起

同一天,DeepSeek发模型、阿里开源Qwen 3.8 Max。中国AI公司正在从“追赶者”变成“并跑者”,甚至在部分领域成为“领跑者”。对国内创业者来说,这意味着本土模型的选择越来越多、越来越好、越来越便宜

写在最后

2026年8月13日凌晨,DeepSeek V4 Pro正式版的上线,也许会被写进AI发展史。

不是因为它的参数有多大——1.6T的MoE模型在今天已经不稀奇。也不是因为它的上下文有多长——100万Token早已不是独家卖点。

而是因为,它第一次用0.1分的性能差距和60倍的价格鸿沟,向全世界证明了:高性能和低成本可以同时存在

从“便宜”到“能干活”,DeepSeek V4 Pro-0813与Grok 4.6的同日亮相,某种程度上标志着AI竞争正在进入一个新阶段:比拼的不再只是参数和聊天能力,而是模型能不能真正干活、能不能让开发者用得起

这或许才是DeepSeek V4 Pro正式版,最值得被记住的地方。

关键词标签:#DeepSeek #V4Pro #AI大模型 #Agent #性价比 #梁文锋 #马斯克 #Grok4.6 #ClaudeFable5 #AI价格战 #国产AI

获取更多AI咨询、一人公司、创业读书笔记、OpenclawClaude Code实战干货,欢迎关注「Rubin智造社」

← 返回列表