腾讯混元领衔:当AI训练“开小差“,找到了让它重新“上轨道“的方法
这项研究由腾讯混元大模型前沿团队、新加坡国立大学、马里兰大学帕克分校、佐治亚大学及印第安纳大学的研究人员联合完成,论文于2026年7月22日发布,编号为arXiv:2607.18722,感兴趣的读者可通过该编号查询完整原文。
一、训练大模型,就像让一个学生边考试边备考
要理解这篇论文在解决什么问题,先从一个生活场景说起。
假设你正在辅导一个学生备考,但你没有时间等他把所有题目都做完再讲解,于是你决定让他一边做题,另一边由你批改前一批答卷并给出讲解。这样效率高多了——他做题,你批改,两件事同时进行,互不耽误。
训练大型AI模型的做法与此如出一辙。研究人员把这种方式叫做"异步强化学习":让AI一边生成答案(就像学生做题),另一边让训练系统优化参数(就像老师批改讲解)。两个过程在不同的计算资源上同时运行,效率大幅提升,GPU的利用率也更高。
然而,这里有一个微妙但严重的问题:当老师批改的那批卷子,是这个学生几天前做的,而学生在这几天里已经进步了不少——老师根据那批"陈年卷子"给出的指导,对现在的学生来说可能已经不够准确,甚至会把他带偏。这个"时间差"在AI训练里叫做"滞后"(lag),而由此产生的"陈旧数据问题"就是这篇论文的核心战场。
研究团队把这种现象正式命名为"滞后关联的异步强化学习不稳定性"。简单说就是:数据越旧,AI训练越容易出问题,严重时甚至会让训练好的模型突然崩溃、性能一落千丈。
二、"陈旧"到底有多大的危害?数据说话
为了直观说明这个问题有多严重,研究团队做了一组对照实验,对比"滞后1步"和"滞后8步"两种场景下的训练情况。
所谓"滞后1步",相当于老师批改的是学生昨天做的卷子,数据比较新鲜;"滞后8步"则相当于批改的是学生八天前的卷子,数据明显陈旧。两组实验除了这一点不同,其余设置完全相同。
结果非常触目惊心。在衡量"AI现在的版本"和"生成数据时的版本"之间差异的指标上,滞后1步的情况始终保持在一个很窄的范围内波动,就像一个稳定的心跳图;而滞后8步的情况则会出现剧烈的尖峰,就像心跳突然失控。
更糟糕的是,在实际数学解题能力的评估上(研究团队使用的是AIME24这个权威数学竞赛题库),滞后1步的模型表现稳定,一直在0.30分左右徘徊;而滞后8步的模型先是冲到0.34的高点,然后在第449步附近急剧崩溃,跌至0.14左右,几乎折损了一半的能力。这就像一个运动员在比赛中突然腿软,之前的所有训练成果瞬间归零。
这组实验清晰地证明:滞后问题不只是理论上的隐患,它会造成真实且严重的训练崩溃。
三、问题的根源:固定的"容忍边界"遇上了变化的"误差分布"
要理解这篇论文提出的解决方案,需要先搞清楚现有方法为什么不够用。
目前主流的AI训练算法里,有一个叫PPO(近端策略优化)的方法,它是保证训练稳定的核心工具。PPO的做法可以用一个生动的比喻来理解:想象你在参加一场跳远比赛,裁判规定每次起跳都不能比上一次落点偏离太远——如果偏得太厉害,这次起跳就不算数。这个"不能偏太远"的规定就是PPO里的"裁剪"机制,它给每个训练步骤设置了一个固定的"容忍区间",比如上下各0.2,超出这个范围的大幅更新就会被截断。
PPO的逻辑在同步训练中很有效——因为数据是新鲜的,偏差主要来自自然的策略探索。但在异步训练中,数据本身就已经"陈旧"了,而PPO给每个数据点设置的是同样的固定边界。这就好比:无论这张卷子是学生昨天做的还是八天前做的,老师都用同一把尺子量——这显然不公平,也不准确。
研究团队指出,PPO的裁剪有一个根本性的局限:它只检查了那个被实际采样到的行动,对于AI模型输出词汇表里所有其他可能的词,它完全不管。这就像裁判只看你这次起跳,完全不管你脚下的地是否平坦——而在异步训练中,地面(数据质量)是显著不平坦的。
更深入一层,有一个来自强化学习理论的"有限视野策略改进界"告诉我们:训练误差受到"行为策略"(生成数据时的AI)和"目标策略"(正在优化的AI)之间差距的控制,差距越大,误差累积就越严重。PPO的固定边界对这个差距的控制是间接且不完整的,在数据陈旧的情况下更是力不从心。
四、SAT登场:一把会自动调节松紧的弹性尺
正是在这个背景下,研究团队提出了他们的核心贡献:SAT(滞后自适应信任域,Staleness-Adaptive Trust Region)。
如果PPO是一把固定刻度的刻度尺,那SAT就是一把会根据当前数据新鲜度自动调节松紧的弹性尺。对于新鲜、可靠的数据,这把尺允许较大的更新幅度;对于陈旧、不可靠的数据,它会自动收紧,不让训练在这些不可信的基础上走得太远。
SAT的工作流程可以分为三个环环相扣的步骤,每一步都有清晰的逻辑依据。
第一步,为每个数据点打一个"陈旧度分数"。SAT使用的是一个叫做"对数重要性比率"的量,简单说就是:当前训练版本的AI觉得某个词有多大可能,除以生成这个词时的AI版本觉得它有多大可能,取对数。这个比值如果接近0,说明两个版本差不多,数据比较新鲜;如果偏离0很远,说明数据比较陈旧,生成时和训练时的AI差异较大。关键的是,这个分数在训练过程中本来就已经计算好了,SAT只是把它拿过来当作额外的参考,不需要额外的计算开销。
第二步,在一批数据里找出"陈旧度异常"的那些数据点。SAT会计算这批数据里陈旧度分数的第90百分位数(可以理解为:把所有数据按陈旧程度从低到高排列,找到排在90%位置的那个值,记作分界线q)。陈旧度超过这条线的,就是这批数据里最"陈旧"的那10%左右,属于高风险区域。之所以用相对分位数而不是一个固定绝对阈值,是因为数据的整体陈旧程度会随着训练进行而变化,用固定阈值很快就会失灵,而相对分位数能自动适应当前批次的实际情况。
第三步,对高风险数据点,收紧训练的"容忍边界",而且只在"推着AI往更远处走"的那个方向上收紧。这里有一个精妙的方向性设计:如果当前更新是让AI变得"更大胆"(即让采样比率往大于1的方向走),SAT只收紧上界;如果是让AI变得"更保守"(往小于1的方向走),SAT只收紧下界。这样做的原因是:把AI往回拉向原来的行为,其实是在减少偏差,这是好事,不应该被限制;只有把AI往更远处推、可能加剧偏差的更新,才需要被更严格地控制。
收紧的幅度通过一个叫"核函数"的数学工具来计算,它的形状类似一条下坡曲线:陈旧度刚好等于分界线q时,紧缩因子等于0.5(收紧一半);陈旧度越高,紧缩越严,但不会完全归零。这个设计保证了过渡的平滑性,不会产生突兀的断点。
对于普通数据点(不在高风险区的那90%),SAT完全不做任何改动,和原来的PPO训练一模一样。这意味着SAT不会因为引入额外的保守性而损害正常的学习效率——它的干预是精准的、外科手术式的。
五、从理论到证明:SAT有哪些数学上的保证?
研究团队不只是提出了一个直觉上合理的方法,他们还严格证明了SAT的几个关键性质,让这把弹性尺的可靠性有了理论背书。
第一条保证叫做"区间包含性":SAT的有效容忍区间,永远是PPO原始容忍区间的子集。换句话说,SAT对更新幅度的限制永远不会比PPO更宽松,只会更严格或持平。这确保了SAT不可能在PPO的基础上"放水"。
第二条保证叫做"逐点悲观性":在每一个具体的数据点上,SAT计算出的训练目标值都不会超过PPO的对应值。用大白话说,对于同一批数据,SAT的训练信号更保守,不会让AI在可疑数据上过度更新。
第三条保证是关于"改变发生的精确位置":SAT和PPO的差异,仅仅发生在一个非常具体的区域——就是那些被新收紧边界截断、但原来PPO边界还没截断的那部分高风险更新上。这条证明让研究人员能够精确地解释SAT在做什么,它不是一个黑盒,每一步影响都是透明可追溯的。
这三条保证合在一起说明了一件事:SAT是PPO的一个严格的、局部的加强版,它不会破坏PPO原有的任何保护机制,只是在高风险区域额外加了一道防护网。
六、把SAT用于真实的大模型训练:GSPO和R3的配合
在实际实验中,研究团队将SAT与另外两个已有技术结合使用,形成了一套组合方案。
其中一个搭档叫GSPO(序列级策略优化),它是PPO在大语言模型场景下的一种变体。GSPO把衡量"更新幅度"的单位从单个词(token)提升到整个回答(sequence)。具体来说,它计算的是整句话的平均更新幅度,而不是每个词的更新幅度。好处是:长答案里个别词的偏差不会被过度放大,整体评估更稳定。SAT被无缝地集成进GSPO,当用于GSPO时,SAT用整句话的平均陈旧度分数来代替单个词的分数,逻辑完全一致。
另一个搭档叫R3(路由回放,Rollout Routing Replay)。这个方法专门针对MoE(专家混合模型)架构中的一个特殊问题。MoE模型的工作方式是:对于每个输入,模型内部会有一个"路由器"决定调用哪几个"专家模块"来处理。问题在于,生成数据时的路由器和训练时的路由器可能做出不同的选择,即使模型参数完全相同——因为两个系统的底层计算细节(浮点精度、内核实现等)可能略有差异,而路由器的决策是不连续的(要么选这个专家,要么不选),微小的差异可能导致完全不同的专家组合。R3的做法是:在训练时强制使用生成数据时的路由决策,以此消除这一来源的额外偏差。
在实验中,研究团队使用的基础模型是Qwen3-30B-A3B-Base,这是腾讯旗下的一个300亿参数的MoE大语言模型。训练框架使用了slime(一个专为异步强化学习设计的框架),推理端使用SGLang,训练端使用Megatron,两者运行在完全独立的GPU集群上,真正实现了解耦。训练数据来自DAPO-Math-17k和Dolci-RL-Zero-Math-7B两个数学数据集,合计约30712个题目,评估指标是AIME24数学竞赛题库上的avg@8分数(每道题生成8个答案,取平均)。
七、实验结果:组合拳打出最佳成绩
研究团队在"滞后1步"和"滞后8步"两种场景下,对比了十几种不同的方法组合,结果非常清晰。
在滞后1步的场景下,纯GRPO(一种基础训练算法)得分31.25,纯GSPO为32.25,加入DPPO(另一种信任域方法)后提升到33.96,而SAT-GSPO(SAT加GSPO)达到34.17,加上R3之后的SAT-GSPO w/R3更是达到35.83,是所有方法中最高的。
在更难的滞后8步场景下,未加保护的GRPO和GSPO都在训练400步左右发生了崩溃,最终分数跌至30.17和31.46。而SAT-GSPO w/R3没有崩溃,最终稳定在34.79,是所有方法里最高的。
从"陈旧度"指标来看,加了R3的方法普遍维持在0.006-0.008左右,而没有R3的方法则漂移到0.01以上,在滞后8步时甚至达到0.011-0.022的高位。SAT-GSPO w/R3的陈旧度最低,为0.0056(滞后1步)和0.0076(滞后8步),在所有方法里是最"稳"的。
这个结果揭示了一个有趣的互补关系:R3负责把整体陈旧度的基准线压低(从根源上减少路由不匹配),而SAT负责在这个基础上进一步处理高陈旧度的尾部数据(防止少数极端陈旧的数据扰乱训练)。两者分工不同、相互配合,共同构成了一个更稳健的保护机制。
研究团队还将SAT与另一个相关方法DPPO做了仔细对比。DPPO和SAT同属"不对称裁剪"家族——它们都只限制"推着AI往更远走"的更新,而不限制"往回走"的更新。区别在于,DPPO根据每个词被采样的实际概率来决定容忍边界(概率高的词限制严,概率低的词限制松),而SAT根据每批数据观察到的实际陈旧度尾部来动态确定边界。实验结果显示,SAT在两种滞后场景下都优于DPPO,差距约为1.87至2.08分,说明从"观察到的陈旧度"而不是"采样概率"来设定边界,在异步训练场景下更有效。
八、坦诚的局限性:这把弹性尺也不是万能的
研究团队在论文中诚实地列出了SAT的几条局限性,这种自我审视的态度使研究结论更加可信。
首先,SAT的控制是在"代理目标"层面,而不是在真实策略层面。SAT收紧了训练目标函数里的裁剪边界,但AI在这个边界之外如何运动,SAT无法完全控制——尤其是对于词汇表里那些没有被采样到的词,SAT完全不知道训练前后它们的概率发生了多大变化。这就像调整了合同的条款,但无法控制合同执行过程中的每一个细节。
其次,SAT使用的陈旧度代理指标(对数重要性比率)并不完全等同于理论上的"全词汇表总变差距离"。一个罕见的词可能有极大的比率偏差,但因为它本来就很少被选中,对整体概率分布的影响微乎其微。SAT对这种情况的处理并不精确,这是一个已知的理论缺口。
此外,由于SAT的分界线q是相对于当前批次动态计算的,它响应的是"当前批次内的相对陈旧度",而不是一个绝对的陈旧程度标准。这意味着,如果整批数据都很陈旧,SAT只会相对地收紧那最陈旧的10%,而不是对整体陈旧情况做出绝对判断。研究团队诚实地指出,这不意味着SAT会随着配置滞后的增加而单调地缩小裁剪半径——当PPO原有的边界已经足够紧时,SAT的额外收紧效果会减弱。
说到底,AI模型的训练稳定性是一个系统性问题,没有任何单一工具能够包打天下。SAT是一把精准的手术刀,而不是万能药。
归根结底,这项研究做的事情可以用一句话概括:让AI的训练监督系统学会根据数据的新鲜程度调整自己的要求,对陈旧数据更保守,对新鲜数据更开放,从而在高效异步训练的同时保持稳定性。
这听起来简单,但实现起来需要严密的理论推导、精巧的工程设计,以及大量的实验验证。研究团队用Qwen3-30B-A3B-Base这样一个真实的大规模MoE模型验证了这一点,结果令人信服。对于正在或计划构建大型AI训练系统的团队来说,SAT提供了一个轻量级、可插拔的改进选项——额外的计算开销仅仅是每批次多做一次分位数计算和几个元素级张量操作,几乎可以忽略不计。
当然,有一个问题值得继续思考:如果未来的AI模型变得更大、滞后更严重,当前这种基于采样代理的方法是否依然足够?研究团队在论文末尾也坦言,基于全词汇表概率质量加权的改进方案是自然的下一步,这个方向值得进一步探索。感兴趣的读者可以通过arXiv编号2607.18722查阅完整论文,深入了解所有理论证明和实验细节。
Q&A
Q1:异步强化学习中的"滞后"问题会导致什么后果?
A:滞后问题的核心危害是训练崩溃。当AI生成数据时用的是旧版本的模型,而训练时用的是新版本,两者差距越大,训练信号就越不准确。实验显示,滞后8步时模型性能会先短暂上升,随后急剧崩溃,最终数学解题能力从0.34跌至0.14,几乎损失一半,而同等条件下滞后1步的模型始终保持稳定。
Q2:SAT和PPO有什么本质区别?
A:PPO给每个训练数据点设置相同的固定容忍边界,不管这个数据是新鲜的还是陈旧的。SAT的改进在于,它会先计算当前批次数据的陈旧度分布,找出最陈旧的那约10%数据,然后对这些数据单独收紧容忍边界,而且只收紧"把AI推得更远"的那一侧,"把AI往回拉"的方向不受影响。对于普通数据,SAT和PPO完全一致。
Q3:SAT-GSPO w/R3组合在实验中具体表现如何?
A:在AIME24数学竞赛题库评测中,SAT-GSPO w/R3在滞后1步时达到35.83分,在更难的滞后8步条件下达到34.79分,是所有测试方法中最高的。相比之下,未加保护的GSPO在滞后8步时最终崩溃,分数跌至31.46。SAT-GSPO w/R3同时维持了最低的训练陈旧度指标,在滞后8步时仅为0.0076。