腾讯混元领衔:当AI训练“开小差“,找到了让它重新“上轨道“的方法
这项研究由腾讯混元大模型前沿团队、新加坡国立大学、马里兰大学帕克分校、佐治亚大学及印第安纳大学的研究人员联合完成论文于2026年7月22日发布编号为arXiv:2607.18722感兴趣的读者可通过该编号查询完整原文。一、训练大模型就像让一个学生边考试边备考要理解这篇论文在解决什么问题先从一个生活场景说起。假设你正在辅导一个学生备考但你没有时间等他把所有题目都做完再讲解于是你决定让他一边做题另一边由你批改前一批答卷并给出讲解。这样效率高多了——他做题你批改两件事同时进行互不耽误。训练大型AI模型的做法与此如出一辙。研究人员把这种方式叫做异步强化学习让AI一边生成答案就像学生做题另一边让训练系统优化参数就像老师批改讲解。两个过程在不同的计算资源上同时运行效率大幅提升GPU的利用率也更高。然而这里有一个微妙但严重的问题当老师批改的那批卷子是这个学生几天前做的而学生在这几天里已经进步了不少——老师根据那批陈年卷子给出的指导对现在的学生来说可能已经不够准确甚至会把他带偏。这个时间差在AI训练里叫做滞后lag而由此产生的陈旧数据问题就是这篇论文的核心战场。研究团队把这种现象正式命名为滞后关联的异步强化学习不稳定性。简单说就是数据越旧AI训练越容易出问题严重时甚至会让训练好的模型突然崩溃、性能一落千丈。二、陈旧到底有多大的危害数据说话为了直观说明这个问题有多严重研究团队做了一组对照实验对比滞后1步和滞后8步两种场景下的训练情况。所谓滞后1步相当于老师批改的是学生昨天做的卷子数据比较新鲜滞后8步则相当于批改的是学生八天前的卷子数据明显陈旧。两组实验除了这一点不同其余设置完全相同。结果非常触目惊心。在衡量AI现在的版本和生成数据时的版本之间差异的指标上滞后1步的情况始终保持在一个很窄的范围内波动就像一个稳定的心跳图而滞后8步的情况则会出现剧烈的尖峰就像心跳突然失控。更糟糕的是在实际数学解题能力的评估上研究团队使用的是AIME24这个权威数学竞赛题库滞后1步的模型表现稳定一直在0.30分左右徘徊而滞后8步的模型先是冲到0.34的高点然后在第449步附近急剧崩溃跌至0.14左右几乎折损了一半的能力。这就像一个运动员在比赛中突然腿软之前的所有训练成果瞬间归零。这组实验清晰地证明滞后问题不只是理论上的隐患它会造成真实且严重的训练崩溃。三、问题的根源固定的容忍边界遇上了变化的误差分布要理解这篇论文提出的解决方案需要先搞清楚现有方法为什么不够用。目前主流的AI训练算法里有一个叫PPO近端策略优化的方法它是保证训练稳定的核心工具。PPO的做法可以用一个生动的比喻来理解想象你在参加一场跳远比赛裁判规定每次起跳都不能比上一次落点偏离太远——如果偏得太厉害这次起跳就不算数。这个不能偏太远的规定就是PPO里的裁剪机制它给每个训练步骤设置了一个固定的容忍区间比如上下各0.2超出这个范围的大幅更新就会被截断。PPO的逻辑在同步训练中很有效——因为数据是新鲜的偏差主要来自自然的策略探索。但在异步训练中数据本身就已经陈旧了而PPO给每个数据点设置的是同样的固定边界。这就好比无论这张卷子是学生昨天做的还是八天前做的老师都用同一把尺子量——这显然不公平也不准确。研究团队指出PPO的裁剪有一个根本性的局限它只检查了那个被实际采样到的行动对于AI模型输出词汇表里所有其他可能的词它完全不管。这就像裁判只看你这次起跳完全不管你脚下的地是否平坦——而在异步训练中地面数据质量是显著不平坦的。更深入一层有一个来自强化学习理论的有限视野策略改进界告诉我们训练误差受到行为策略生成数据时的AI和目标策略正在优化的AI之间差距的控制差距越大误差累积就越严重。PPO的固定边界对这个差距的控制是间接且不完整的在数据陈旧的情况下更是力不从心。四、SAT登场一把会自动调节松紧的弹性尺正是在这个背景下研究团队提出了他们的核心贡献SAT滞后自适应信任域Staleness-Adaptive Trust Region。如果PPO是一把固定刻度的刻度尺那SAT就是一把会根据当前数据新鲜度自动调节松紧的弹性尺。对于新鲜、可靠的数据这把尺允许较大的更新幅度对于陈旧、不可靠的数据它会自动收紧不让训练在这些不可信的基础上走得太远。SAT的工作流程可以分为三个环环相扣的步骤每一步都有清晰的逻辑依据。第一步为每个数据点打一个陈旧度分数。SAT使用的是一个叫做对数重要性比率的量简单说就是当前训练版本的AI觉得某个词有多大可能除以生成这个词时的AI版本觉得它有多大可能取对数。这个比值如果接近0说明两个版本差不多数据比较新鲜如果偏离0很远说明数据比较陈旧生成时和训练时的AI差异较大。关键的是这个分数在训练过程中本来就已经计算好了SAT只是把它拿过来当作额外的参考不需要额外的计算开销。第二步在一批数据里找出陈旧度异常的那些数据点。SAT会计算这批数据里陈旧度分数的第90百分位数可以理解为把所有数据按陈旧程度从低到高排列找到排在90%位置的那个值记作分界线q。陈旧度超过这条线的就是这批数据里最陈旧的那10%左右属于高风险区域。之所以用相对分位数而不是一个固定绝对阈值是因为数据的整体陈旧程度会随着训练进行而变化用固定阈值很快就会失灵而相对分位数能自动适应当前批次的实际情况。第三步对高风险数据点收紧训练的容忍边界而且只在推着AI往更远处走的那个方向上收紧。这里有一个精妙的方向性设计如果当前更新是让AI变得更大胆即让采样比率往大于1的方向走SAT只收紧上界如果是让AI变得更保守往小于1的方向走SAT只收紧下界。这样做的原因是把AI往回拉向原来的行为其实是在减少偏差这是好事不应该被限制只有把AI往更远处推、可能加剧偏差的更新才需要被更严格地控制。收紧的幅度通过一个叫核函数的数学工具来计算它的形状类似一条下坡曲线陈旧度刚好等于分界线q时紧缩因子等于0.5收紧一半陈旧度越高紧缩越严但不会完全归零。这个设计保证了过渡的平滑性不会产生突兀的断点。对于普通数据点不在高风险区的那90%SAT完全不做任何改动和原来的PPO训练一模一样。这意味着SAT不会因为引入额外的保守性而损害正常的学习效率——它的干预是精准的、外科手术式的。五、从理论到证明SAT有哪些数学上的保证研究团队不只是提出了一个直觉上合理的方法他们还严格证明了SAT的几个关键性质让这把弹性尺的可靠性有了理论背书。第一条保证叫做区间包含性SAT的有效容忍区间永远是PPO原始容忍区间的子集。换句话说SAT对更新幅度的限制永远不会比PPO更宽松只会更严格或持平。这确保了SAT不可能在PPO的基础上放水。第二条保证叫做逐点悲观性在每一个具体的数据点上SAT计算出的训练目标值都不会超过PPO的对应值。用大白话说对于同一批数据SAT的训练信号更保守不会让AI在可疑数据上过度更新。第三条保证是关于改变发生的精确位置SAT和PPO的差异仅仅发生在一个非常具体的区域——就是那些被新收紧边界截断、但原来PPO边界还没截断的那部分高风险更新上。这条证明让研究人员能够精确地解释SAT在做什么它不是一个黑盒每一步影响都是透明可追溯的。这三条保证合在一起说明了一件事SAT是PPO的一个严格的、局部的加强版它不会破坏PPO原有的任何保护机制只是在高风险区域额外加了一道防护网。六、把SAT用于真实的大模型训练GSPO和R3的配合在实际实验中研究团队将SAT与另外两个已有技术结合使用形成了一套组合方案。其中一个搭档叫GSPO序列级策略优化它是PPO在大语言模型场景下的一种变体。GSPO把衡量更新幅度的单位从单个词token提升到整个回答sequence。具体来说它计算的是整句话的平均更新幅度而不是每个词的更新幅度。好处是长答案里个别词的偏差不会被过度放大整体评估更稳定。SAT被无缝地集成进GSPO当用于GSPO时SAT用整句话的平均陈旧度分数来代替单个词的分数逻辑完全一致。另一个搭档叫R3路由回放Rollout Routing Replay。这个方法专门针对MoE专家混合模型架构中的一个特殊问题。MoE模型的工作方式是对于每个输入模型内部会有一个路由器决定调用哪几个专家模块来处理。问题在于生成数据时的路由器和训练时的路由器可能做出不同的选择即使模型参数完全相同——因为两个系统的底层计算细节浮点精度、内核实现等可能略有差异而路由器的决策是不连续的要么选这个专家要么不选微小的差异可能导致完全不同的专家组合。R3的做法是在训练时强制使用生成数据时的路由决策以此消除这一来源的额外偏差。在实验中研究团队使用的基础模型是Qwen3-30B-A3B-Base这是腾讯旗下的一个300亿参数的MoE大语言模型。训练框架使用了slime一个专为异步强化学习设计的框架推理端使用SGLang训练端使用Megatron两者运行在完全独立的GPU集群上真正实现了解耦。训练数据来自DAPO-Math-17k和Dolci-RL-Zero-Math-7B两个数学数据集合计约30712个题目评估指标是AIME24数学竞赛题库上的avg8分数每道题生成8个答案取平均。七、实验结果组合拳打出最佳成绩研究团队在滞后1步和滞后8步两种场景下对比了十几种不同的方法组合结果非常清晰。在滞后1步的场景下纯GRPO一种基础训练算法得分31.25纯GSPO为32.25加入DPPO另一种信任域方法后提升到33.96而SAT-GSPOSAT加GSPO达到34.17加上R3之后的SAT-GSPO w/R3更是达到35.83是所有方法中最高的。在更难的滞后8步场景下未加保护的GRPO和GSPO都在训练400步左右发生了崩溃最终分数跌至30.17和31.46。而SAT-GSPO w/R3没有崩溃最终稳定在34.79是所有方法里最高的。从陈旧度指标来看加了R3的方法普遍维持在0.006-0.008左右而没有R3的方法则漂移到0.01以上在滞后8步时甚至达到0.011-0.022的高位。SAT-GSPO w/R3的陈旧度最低为0.0056滞后1步和0.0076滞后8步在所有方法里是最稳的。这个结果揭示了一个有趣的互补关系R3负责把整体陈旧度的基准线压低从根源上减少路由不匹配而SAT负责在这个基础上进一步处理高陈旧度的尾部数据防止少数极端陈旧的数据扰乱训练。两者分工不同、相互配合共同构成了一个更稳健的保护机制。研究团队还将SAT与另一个相关方法DPPO做了仔细对比。DPPO和SAT同属不对称裁剪家族——它们都只限制推着AI往更远走的更新而不限制往回走的更新。区别在于DPPO根据每个词被采样的实际概率来决定容忍边界概率高的词限制严概率低的词限制松而SAT根据每批数据观察到的实际陈旧度尾部来动态确定边界。实验结果显示SAT在两种滞后场景下都优于DPPO差距约为1.87至2.08分说明从观察到的陈旧度而不是采样概率来设定边界在异步训练场景下更有效。八、坦诚的局限性这把弹性尺也不是万能的研究团队在论文中诚实地列出了SAT的几条局限性这种自我审视的态度使研究结论更加可信。首先SAT的控制是在代理目标层面而不是在真实策略层面。SAT收紧了训练目标函数里的裁剪边界但AI在这个边界之外如何运动SAT无法完全控制——尤其是对于词汇表里那些没有被采样到的词SAT完全不知道训练前后它们的概率发生了多大变化。这就像调整了合同的条款但无法控制合同执行过程中的每一个细节。其次SAT使用的陈旧度代理指标对数重要性比率并不完全等同于理论上的全词汇表总变差距离。一个罕见的词可能有极大的比率偏差但因为它本来就很少被选中对整体概率分布的影响微乎其微。SAT对这种情况的处理并不精确这是一个已知的理论缺口。此外由于SAT的分界线q是相对于当前批次动态计算的它响应的是当前批次内的相对陈旧度而不是一个绝对的陈旧程度标准。这意味着如果整批数据都很陈旧SAT只会相对地收紧那最陈旧的10%而不是对整体陈旧情况做出绝对判断。研究团队诚实地指出这不意味着SAT会随着配置滞后的增加而单调地缩小裁剪半径——当PPO原有的边界已经足够紧时SAT的额外收紧效果会减弱。说到底AI模型的训练稳定性是一个系统性问题没有任何单一工具能够包打天下。SAT是一把精准的手术刀而不是万能药。归根结底这项研究做的事情可以用一句话概括让AI的训练监督系统学会根据数据的新鲜程度调整自己的要求对陈旧数据更保守对新鲜数据更开放从而在高效异步训练的同时保持稳定性。这听起来简单但实现起来需要严密的理论推导、精巧的工程设计以及大量的实验验证。研究团队用Qwen3-30B-A3B-Base这样一个真实的大规模MoE模型验证了这一点结果令人信服。对于正在或计划构建大型AI训练系统的团队来说SAT提供了一个轻量级、可插拔的改进选项——额外的计算开销仅仅是每批次多做一次分位数计算和几个元素级张量操作几乎可以忽略不计。当然有一个问题值得继续思考如果未来的AI模型变得更大、滞后更严重当前这种基于采样代理的方法是否依然足够研究团队在论文末尾也坦言基于全词汇表概率质量加权的改进方案是自然的下一步这个方向值得进一步探索。感兴趣的读者可以通过arXiv编号2607.18722查阅完整论文深入了解所有理论证明和实验细节。QAQ1异步强化学习中的滞后问题会导致什么后果A滞后问题的核心危害是训练崩溃。当AI生成数据时用的是旧版本的模型而训练时用的是新版本两者差距越大训练信号就越不准确。实验显示滞后8步时模型性能会先短暂上升随后急剧崩溃最终数学解题能力从0.34跌至0.14几乎损失一半而同等条件下滞后1步的模型始终保持稳定。Q2SAT和PPO有什么本质区别APPO给每个训练数据点设置相同的固定容忍边界不管这个数据是新鲜的还是陈旧的。SAT的改进在于它会先计算当前批次数据的陈旧度分布找出最陈旧的那约10%数据然后对这些数据单独收紧容忍边界而且只收紧把AI推得更远的那一侧把AI往回拉的方向不受影响。对于普通数据SAT和PPO完全一致。Q3SAT-GSPO w/R3组合在实验中具体表现如何A在AIME24数学竞赛题库评测中SAT-GSPO w/R3在滞后1步时达到35.83分在更难的滞后8步条件下达到34.79分是所有测试方法中最高的。相比之下未加保护的GSPO在滞后8步时最终崩溃分数跌至31.46。SAT-GSPO w/R3同时维持了最低的训练陈旧度指标在滞后8步时仅为0.0076。

相关新闻

最新新闻

日新闻

周新闻

月新闻