三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

DeepSeek V4 Flash悄无声息炸场,Agent能力暴涨6倍,价格直接卷到地板

DeepSeek V4 Flash悄无声息炸场,Agent能力暴涨6倍,价格直接卷到地板

文章目录

  • 1. 悄咪咪上线的狠角色
    • 1.1 最炸裂的成绩:能力直接涨6倍
    • 1.2 其他榜单也一路杀穿
    • 1.3 最可怕的是:底座没动,全靠后天教育
  • 2. 技术底座:硬实力本来就够打
    • 2.1 基础参数拉满
    • 2.2 三项核心技术撑场
    • 2.3 长文本痛点直接打穿
  • 3. 价格屠夫:真·白菜价
    • 3.1 低到离谱的单价
    • 3.2 缓存折扣才是隐藏杀招
  • 4. 生态已经动起来了
    • 4.1 大厂第一时间接入
    • 4.2 开发者社区已经玩出花
  • 5. 到底谁该用这个模型
    • 5.1 Flash的适用场景
    • 5.2 真正的王炸还在后面

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

1. 悄咪咪上线的狠角色

这年头大厂发新模型,标配都是开发布会、上热搜、KOL齐转发。

恨不得提前半个月就把悬念拉满,生怕没人知道。

结果DeepSeek倒好,7月31号下午,悄咪咪在API文档里更了一行日志。

V4 Flash正式版,就这么上线公测了。

连个预热推文都没有,低调得像上班摸鱼改需求的程序员。

不知道的还以为是偷偷修复bug,结果是放了个王炸。

1.1 最炸裂的成绩:能力直接涨6倍

先给大家上硬数据。

正式版跟预览版比,模型结构、参数规模完全没动。总参数2840亿,激活参数130亿,底层基座原封不动。

就做了一轮后训练优化,Agent能力直接实现质的飞跃。

最夸张的是DeepSWE基准测试,专门考AI Agent真实长周期多步骤编程的。

预览版才7.3分,正式版直接干到54.4分,暴涨超过6倍。

什么概念?上次考试考7分的中等生,三个月后冲到54分。

还不是靠抄答案,是真的会解复杂大题了,步骤还不带错的。

1.2 其他榜单也一路杀穿

不光是这一项,其他基准测试成绩全线飘红。

Terminal Bench 2.1拿了82.7分,比自家V4 Pro预览版高,也超过了GLM‑5.2,离Opus‑4.8的85分只差一线。

海外机构的智能指数测试,最高档位拿到50分。

比四月份的V4 Flash高10分,比V4 Pro高6分,离GPT‑5.6 Luna的最高分只差1分。

就这表现,谁能想到是个主打廉价的模型跑出来的。

相当于千元机跑出旗舰机的跑分,离大谱。

1.3 最可怕的是:底座没动,全靠后天教育

这次升级最吓人的,不是分数高,是分数怎么来的。

基座一点没改,就靠更精细的后训练策略,两阶段范式练了一遍。

相当于同一个学生,没换脑子没换智商,就换了套复习方法,直接从及格线冲进尖子生行列。

别人提分靠堆参数、换架构,相当于换个更聪明的脑袋。

DeepSeek提分靠刷题、讲方法,把同一个脑袋的潜力挖到底。

这说明什么?后训练的优化空间,比所有人想象的都大得多。

那这套方法平移到Pro版上,效果还不得炸上天?也难怪官方说Pro正式版会尽快发。

2. 技术底座:硬实力本来就够打

能有这个表现,底子本来就不差。

2.1 基础参数拉满

上下文长度100万token,最大输出384K tokens。

支持切换思考/非思考模式,原生支持Responses API格式,代码场景做了专项适配。

接口还同时兼容OpenAI和Anthropic格式,上手零成本,换个密钥就能用。

对开发者来说,等于不用改代码,直接白嫖性能升级。

2.2 三项核心技术撑场

第一项是混合注意力架构。

传统注意力看长文本,字越多算得越慢,复杂度平方级上涨。

这套架构就是,强关联的内容精读,弱关联的压缩跳过,直接突破了长文本的算力瓶颈。

说白了就是看书抓重点,没用的一扫而过,有用的仔细琢磨,效率自然高。

第二项是流形约束超连接。

解决模型叠深了数值不稳的问题,训练稳定性提升6.7%,叠再深也不塌。

第三项是Muon优化器,全链路推理加速最高接近2倍,跑起来又快又省。

2.3 长文本痛点直接打穿

实际效果有多夸张?

100万token场景下,单token推理算力只有V3.2的10%,KV缓存占用只有7%。

以前长文本跑不动、记不住、用不起的老三样问题,直接全给解决了。

以前处理百万字文档得等半天还烧钱,现在又快又便宜,跟喝白开水似的。

3. 价格屠夫:真·白菜价

性能卷完了,接下来就是价格,这才是DeepSeek的传统艺能。

3.1 低到离谱的单价

先看价格表:平时缓存命中的输入,0.02元一百万token。

算笔账,处理一篇10万字的文章,成本不到1分钱。

有媒体测算,这价格大概是Claude的九十分之一。

以前用大模型处理长文档,得攥着预算精打细算,生怕超支。

现在?随便造,敞开用,跑一天可能都花不了一杯蜜雪冰城的钱。

3.2 缓存折扣才是隐藏杀招

更狠的是缓存策略。

别家缓存命中折扣大多90%,DeepSeek直接干到98%,命中和未命中输入价差50倍。

有开发者实测,重构完缓存策略,单次请求成本从1.2元降到0.17元,直接砍掉85%。

相当于平时喝20块的奶茶,突然变成3块钱一杯,还天天有这价。

对高频调用的Agent工作流、RAG应用、批量生成场景来说,这成本基本等于可以忽略不计。

企业级AI能力的门槛,直接被压到了地板上,还带摩擦的那种。

4. 生态已经动起来了

正式版刚上线,行业反应比谁都快。

4.1 大厂第一时间接入

网易有道直接宣布旗下AI Agent产品矩阵全面接入。

办公助手、词典、翻译、同传、答疑笔,连企业级大模型聚合平台都全覆盖了。

嗅觉是真的灵敏,好处先占上再说,晚一步都怕亏了。

4.2 开发者社区已经玩出花

Codex代码场景专项适配完,配合原生Responses API,写代码调用又顺又准。

社区里已经有人拿它搭配Claude Code做终端原生编程Agent,速度快得离谱。

开源社区的创造力,永远比你想的快一步。

价格打下来了,玩法自然就多了,毕竟谁不爱便宜又好用的东西。

5. 到底谁该用这个模型

最后说点实用的,给大家捋清楚选型逻辑,别瞎选浪费钱。

5.1 Flash的适用场景

一句话总结V4双版本定位:重推理、长文档、复杂自动化任务选Pro;高并发、低成本、批量轻任务选Flash。

简单Agent任务上,Flash正式版跟Pro已经旗鼓相当。

日常问答、内容生成、轻中度代码开发、高频Agent步骤、批量数据处理,还有对成本敏感的产品功能,选Flash就对了。

中文写作还尤其自然,日常用完全够用,性价比拉满。

5.2 真正的王炸还在后面

特意提一句,这次升级的只有V4‑Flash的API。

V4‑Pro的API还有APP、网页端都没动,正式版还在路上。

现在的Flash就已经这么能打了,等Pro正式版用上同款后训练优化,那才是真正的炸场时刻。

现在只是开胃小菜,大菜还在后头呢。

最后说两句。

DeepSeek的路子一直很明确:拿不到顶级芯片,就靠工程优化把价格炸穿地板。

不盲目堆参数,就把每一分算力、每一分钱都用到极致。

当百万上下文、130亿激活参数、白菜价、接近顶级的Agent能力凑到同一款模型上的时候。

行业的价格体系,怕是又要重新洗牌了。

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

← 返回列表