阿里Qwen3.8突然杀进全球第二梯队:陈宇森46天,钉钉AI的胜负手不在模型层

📅 2026/8/4 3:36:24 👁️ 阅读次数 📝 编程学习
阿里Qwen3.8突然杀进全球第二梯队:陈宇森46天,钉钉AI的胜负手不在模型层

46天前,陈宇森接钉钉CEO的时候,很多人还在观望:一个92年的技术极客,能hold住2000万企业客户的盘子吗?

今天他用一场发布会,把答案甩在了台面上。

8月3日,阿里连发两大动作:新一代基座大模型Qwen3.8正式上线,总参数量2.4万亿,Arena榜单仅次于Claude系列,冲进全球第一梯队;同一天,企业级Agent产品"千问办公"开启公测。

看起来只是又一家大厂发新模型+新产品,没什么稀奇的。

但你把几条线放在一起看,味道就不一样了——

旗舰模型全球第二梯队,下周开源;

千问办公由QoderWork、MuleRun、悟空三款产品整合而成;

钉钉IM已经初步打通,未来要全面连接企业数据库和工作流;

国内输入12元/百万token、输出36元,隐式缓存命中只要1.5元,国际价格只有Opus 5的40%和24%。

这不是一次常规的模型迭代。

这是一套组合拳。

而这套组合拳的核心,不在模型有多强,而在——阿里要把AI从"你问它答"的聊天机器人,变成真正钻进企业工作流里干活的人。

一、先搞懂Qwen3.8到底有多强?

先说模型本身的硬指标我快速过一下,重点说几个关键数字。

总参数量2.4万亿,MoE架构,激活95B。稀疏激活的好处是参数量看起来大,但实际跑的时候只激活一小部分,推理效率和成本都更优。这已经是前沿大模型的标准路线了,不新鲜,但阿里把它做到了2.4T这个量级。

Arena榜单全球第二,仅次于Claude系列。这是最硬的指标。编程榜里前端编程能力超过了Claude Opus 5和Fable 5 High版本。

几个细分能力:

  • 编程:CodeArena全球第四,PaperBench编程智能体评测93分(上代涨了28.2分
  • 办公:数百种高频专业任务全面提升,法务一周工作量→1小时
  • 长程任务:数千轮交互不跑偏,数字芯片设计、商业模拟都能hold住
  • 多模态:Vision Arena全球第二,能读200页财报、看懂100小时长视频

但这些都不是最让我在意的。

最炸裂的是那个16天自主编程的案例。

官方给的案例是这样的:给Qwen3.8一句话指令——"创建一个自进化的智能体Harness",然后它就从一个空文件夹出发,自己搭循环工程框架、自己编排智能体、自己写代码、自己跑测试、自己修bug,独立运行了约16天,做出了一个Hermes Agent级别的真实可用项目"oh-my-cli"。

全程没人干预过。

代码已经在GitHub开源了,整个过程开着记录器,每一步都公开可查。

两年前沿模型能写好函数、补全代码,当程序员的助手。两年后的今天,它能自己从0到1交付一个完整项目。

这中间差的不是写代码能力强了多少。

差的是"从工具变成了同事。

二、但真正的杀招,是千问办公+钉钉

如果只有模型强,那Qwen3.8也不过是又一个"又大又强的模型而已。国内不缺大模型。

真正值得说道说道的,是同一天发布的千问办公。

这款产品是怎么来的?三款产品整合的:QoderWork(编程Agent)、MuleRun(流程自动化)、悟空(桌面Agent),三合一。

这三款产品,以前是阿里内部不同团队各自孵化的,各有各的定位,各有各的赛道。陈宇森上来46天,把它们捏到了一起。

而且捏的不是简单地"合并同类项"。**是按"人怎么干活"的逻辑重新拼的——

一个人在公司里干活,需要什么?

  • 需要写代码、做方案→编程Agent;
  • 需要跑流程、连系统→流程自动化;
  • 需要操作电脑、处理文件→桌面Agent。 三款产品,分别对应这三个能力维度。 然后下面用同一个基座模型(Qwen3.8),上面用同一个入口(千问办公),旁边靠着钉钉这个最大的企业协作入口。 这才是真正的战略意图。 **别的厂商还在比谁模型强不强,阿里已经在比谁的Agent能真的干活了。

而且千问办公里有一个功能我特别想拎出来说——"组织级Skill"。

举个例子:一家20人的律所,资深律师用千问办公做完一份并购尽调报告,整个过程可以一键沉淀成一个"组织级Skill",全团队共享。新人进来不用问东问西,调用这个Skill选好执行路径,直接出报告。

这个东西厉害了。

它不是个人效率提升了多少,它是把组织里的隐性知识、工作方法、经验积累,第一次可以被结构化、复用、规模化。

一个资深员工的经验,以前只能靠带新人、写文档、开分享会传递。现在可以沉淀成一个Skill,全公司调用。

这才是企业级Agent的核心价值——不是帮你写邮件更快,是帮整个组织的能力水位整体往上提。

而这一切,钉钉都已经初步打通了。钉钉有2000万企业组织、近8亿用户的基本盘。当Agent能力接上钉钉的工作流、数据库、知识库之后,想象空间有多大?

三、价格战的底层逻辑

再说价格。

国内每百万token输入12元、输出36元,隐式缓存命中只要1.5元。国际价格是Opus 5的40%和24%。

很多人第一反应是:又打价格战了。

但你仔细品,这个价格战跟之前的价格战不一样。

之前的价格战是什么?大家都在比谁更便宜。因为本质上是同一维度的竞争——你降一块,我降五毛。

这次不一样。这次的价格战,背后是"用得起"和"用不起"的分界线。

为什么?因为Agent时代跟聊天不一样。

聊天你一天跟它聊几十句,顶天了几千token。但Agent不一样——它要连续工作几个小时、几天、甚至几周。它要读几百页文档、跑几十个步骤、调用N轮迭代。

**消耗量根本不在一个数量级上。

如果token价格贵,Agent根本跑不起来。不是不想用,是用不起。

你想让企业真的用Agent干活,前提是token价格必须打到"随便用不心疼"的程度。

所以你看阿里的定价逻辑:输入12块输出36块,缓存命中1块5。这个价格就是奔着"让Agent能规模化商用"去的。

不是降本是结果,不是手段。

四、下周开源才是真正的狠活

还有一件事很多人没注意——Qwen3.8-Max下周开源,同时开源Qwen3.8-27B。

这件事的分量,怎么强调都不过分。

2.4万亿参数的旗舰级MoE模型,开源。

这意味着什么?意味着全球任何一个开发者、任何一家公司,都可以拿到这个量级的模型自己部署、自己微调、自己做二次开发。

以前你想做一个企业级Agent,要么调用API,受限于别人的模型能力和价格。现在你可以自己拿一个全球第二梯队水平的模型,自己改。

整个生态会发生什么变化?

  • 创业公司可以基于Qwen做垂直领域模型的成本直接清零;
  • 有数据的传统行业,可以在自己数据上微调,数据不出境、不出内网;
  • 开源社区会基于这个基座,涌现出大量衍生模型和工具。 阿里从2023年开始开源,到现在累计开源了400多个模型,衍生模型20多万个,下载量破10亿次。已经是全球最大的开源大模型家族了。 这次Max版本继续开源,相当于把"全球第二梯队水平的模型能力,免费撒给全行业。 这一步棋,下的不是今天的市场,下的是三年后的生态。

五、最后说几句回到我对这件事的判断

最后聊回最开始说的那个判断:陈宇森46天,钉钉AI的胜负手不在模型层。

Qwen3.8很强,这是基础,是地基。但地基不是房子。

真正的胜负手在哪里?在三层:

第一层,模型能力到Agent能力的跃迁。从"能回答问题"到"能交付结果",这是质的变化。16天自主编程交付一个完整项目,这不是写代码能力的提升,这是工作范式的改变。

第二层,Agent能力到组织能力的跃迁。千问办公+钉钉,不是做一个更好用的聊天机器人,是做一套能钻进企业工作流里的生产工具。组织级Skill这个东西,瞄准的是整个组织能力的整体升级。

第三层,闭源API到开源生态的跃迁。下周开源Max版本,把全球第二梯队的模型能力免费开放,这是在给整个行业铺基础设施。等生态起来了,上面的应用、工具、解决方案,都会自然长出来。

三层叠在一起,才是完整的战略。

很多人看大模型竞争,还停留在"谁家模型跑分更高"的维度上。

但真实的竞争,早已经从模型层,往下沉到了应用层、生态层、产业层。

谁的模型跑分更高,当然重要。

但更重要的是——谁的模型真的在帮人干活,真的在帮企业创造价值,真的在被千万个组织里跑起来。

从这个角度看,阿里这波,走的有点快。