阿里Qwen3.8突然杀进全球第二梯队:陈宇森46天,钉钉AI的胜负手不在模型层
46天前,陈宇森接钉钉CEO的时候,很多人还在观望:一个92年的技术极客,能hold住2000万企业客户的盘子吗?
今天他用一场发布会,把答案甩在了台面上。
8月3日,阿里连发两大动作:新一代基座大模型Qwen3.8正式上线,总参数量2.4万亿,Arena榜单仅次于Claude系列,冲进全球第一梯队;同一天,企业级Agent产品"千问办公"开启公测。
看起来只是又一家大厂发新模型+新产品,没什么稀奇的。
但你把几条线放在一起看,味道就不一样了——
旗舰模型全球第二梯队,下周开源;
千问办公由QoderWork、MuleRun、悟空三款产品整合而成;
钉钉IM已经初步打通,未来要全面连接企业数据库和工作流;
国内输入12元/百万token、输出36元,隐式缓存命中只要1.5元,国际价格只有Opus 5的40%和24%。
这不是一次常规的模型迭代。
这是一套组合拳。
而这套组合拳的核心,不在模型有多强,而在——阿里要把AI从"你问它答"的聊天机器人,变成真正钻进企业工作流里干活的人。
一、先搞懂Qwen3.8到底有多强?
先说模型本身的硬指标我快速过一下,重点说几个关键数字。
总参数量2.4万亿,MoE架构,激活95B。稀疏激活的好处是参数量看起来大,但实际跑的时候只激活一小部分,推理效率和成本都更优。这已经是前沿大模型的标准路线了,不新鲜,但阿里把它做到了2.4T这个量级。
Arena榜单全球第二,仅次于Claude系列。这是最硬的指标。编程榜里前端编程能力超过了Claude Opus 5和Fable 5 High版本。
几个细分能力:
- 编程:CodeArena全球第四,PaperBench编程智能体评测93分(上代涨了28.2分
- 办公:数百种高频专业任务全面提升,法务一周工作量→1小时
- 长程任务:数千轮交互不跑偏,数字芯片设计、商业模拟都能hold住
- 多模态:Vision Arena全球第二,能读200页财报、看懂100小时长视频
但这些都不是最让我在意的。
最炸裂的是那个16天自主编程的案例。
官方给的案例是这样的:给Qwen3.8一句话指令——"创建一个自进化的智能体Harness",然后它就从一个空文件夹出发,自己搭循环工程框架、自己编排智能体、自己写代码、自己跑测试、自己修bug,独立运行了约16天,做出了一个Hermes Agent级别的真实可用项目"oh-my-cli"。
全程没人干预过。
代码已经在GitHub开源了,整个过程开着记录器,每一步都公开可查。
两年前沿模型能写好函数、补全代码,当程序员的助手。两年后的今天,它能自己从0到1交付一个完整项目。
这中间差的不是写代码能力强了多少。
差的是"从工具变成了同事。
二、但真正的杀招,是千问办公+钉钉
如果只有模型强,那Qwen3.8也不过是又一个"又大又强的模型而已。国内不缺大模型。
真正值得说道说道的,是同一天发布的千问办公。
这款产品是怎么来的?三款产品整合的:QoderWork(编程Agent)、MuleRun(流程自动化)、悟空(桌面Agent),三合一。
这三款产品,以前是阿里内部不同团队各自孵化的,各有各的定位,各有各的赛道。陈宇森上来46天,把它们捏到了一起。
而且捏的不是简单地"合并同类项"。**是按"人怎么干活"的逻辑重新拼的——
一个人在公司里干活,需要什么?
- 需要写代码、做方案→编程Agent;
- 需要跑流程、连系统→流程自动化;
- 需要操作电脑、处理文件→桌面Agent。 三款产品,分别对应这三个能力维度。 然后下面用同一个基座模型(Qwen3.8),上面用同一个入口(千问办公),旁边靠着钉钉这个最大的企业协作入口。 这才是真正的战略意图。 **别的厂商还在比谁模型强不强,阿里已经在比谁的Agent能真的干活了。
而且千问办公里有一个功能我特别想拎出来说——"组织级Skill"。
举个例子:一家20人的律所,资深律师用千问办公做完一份并购尽调报告,整个过程可以一键沉淀成一个"组织级Skill",全团队共享。新人进来不用问东问西,调用这个Skill选好执行路径,直接出报告。
这个东西厉害了。
它不是个人效率提升了多少,它是把组织里的隐性知识、工作方法、经验积累,第一次可以被结构化、复用、规模化。
一个资深员工的经验,以前只能靠带新人、写文档、开分享会传递。现在可以沉淀成一个Skill,全公司调用。
这才是企业级Agent的核心价值——不是帮你写邮件更快,是帮整个组织的能力水位整体往上提。
而这一切,钉钉都已经初步打通了。钉钉有2000万企业组织、近8亿用户的基本盘。当Agent能力接上钉钉的工作流、数据库、知识库之后,想象空间有多大?
三、价格战的底层逻辑
再说价格。
国内每百万token输入12元、输出36元,隐式缓存命中只要1.5元。国际价格是Opus 5的40%和24%。
很多人第一反应是:又打价格战了。
但你仔细品,这个价格战跟之前的价格战不一样。
之前的价格战是什么?大家都在比谁更便宜。因为本质上是同一维度的竞争——你降一块,我降五毛。
这次不一样。这次的价格战,背后是"用得起"和"用不起"的分界线。
为什么?因为Agent时代跟聊天不一样。
聊天你一天跟它聊几十句,顶天了几千token。但Agent不一样——它要连续工作几个小时、几天、甚至几周。它要读几百页文档、跑几十个步骤、调用N轮迭代。
**消耗量根本不在一个数量级上。
如果token价格贵,Agent根本跑不起来。不是不想用,是用不起。
你想让企业真的用Agent干活,前提是token价格必须打到"随便用不心疼"的程度。
所以你看阿里的定价逻辑:输入12块输出36块,缓存命中1块5。这个价格就是奔着"让Agent能规模化商用"去的。
不是降本是结果,不是手段。
四、下周开源才是真正的狠活
还有一件事很多人没注意——Qwen3.8-Max下周开源,同时开源Qwen3.8-27B。
这件事的分量,怎么强调都不过分。
2.4万亿参数的旗舰级MoE模型,开源。
这意味着什么?意味着全球任何一个开发者、任何一家公司,都可以拿到这个量级的模型自己部署、自己微调、自己做二次开发。
以前你想做一个企业级Agent,要么调用API,受限于别人的模型能力和价格。现在你可以自己拿一个全球第二梯队水平的模型,自己改。
整个生态会发生什么变化?
- 创业公司可以基于Qwen做垂直领域模型的成本直接清零;
- 有数据的传统行业,可以在自己数据上微调,数据不出境、不出内网;
- 开源社区会基于这个基座,涌现出大量衍生模型和工具。 阿里从2023年开始开源,到现在累计开源了400多个模型,衍生模型20多万个,下载量破10亿次。已经是全球最大的开源大模型家族了。 这次Max版本继续开源,相当于把"全球第二梯队水平的模型能力,免费撒给全行业。 这一步棋,下的不是今天的市场,下的是三年后的生态。
五、最后说几句回到我对这件事的判断
最后聊回最开始说的那个判断:陈宇森46天,钉钉AI的胜负手不在模型层。
Qwen3.8很强,这是基础,是地基。但地基不是房子。
真正的胜负手在哪里?在三层:
第一层,模型能力到Agent能力的跃迁。从"能回答问题"到"能交付结果",这是质的变化。16天自主编程交付一个完整项目,这不是写代码能力的提升,这是工作范式的改变。
第二层,Agent能力到组织能力的跃迁。千问办公+钉钉,不是做一个更好用的聊天机器人,是做一套能钻进企业工作流里的生产工具。组织级Skill这个东西,瞄准的是整个组织能力的整体升级。
第三层,闭源API到开源生态的跃迁。下周开源Max版本,把全球第二梯队的模型能力免费开放,这是在给整个行业铺基础设施。等生态起来了,上面的应用、工具、解决方案,都会自然长出来。
三层叠在一起,才是完整的战略。
很多人看大模型竞争,还停留在"谁家模型跑分更高"的维度上。
但真实的竞争,早已经从模型层,往下沉到了应用层、生态层、产业层。
谁的模型跑分更高,当然重要。
但更重要的是——谁的模型真的在帮人干活,真的在帮企业创造价值,真的在被千万个组织里跑起来。
从这个角度看,阿里这波,走的有点快。