当前位置:主页 > 财经频道 > 正文
强化学习教会AI"讨好裁判"之后,它还会做题吗?_每日速看
来源:科技行者作者:洞察网2026-08-24 17:31:09

你有没有想过这样一个问题:一个学生如果一直被同一个老师用同一套标准打分,久而久之,他会不会只学会了怎么迎合这个老师的评分习惯,而不是真正学会了知识本身?


(相关资料图)

这个问题放在人工智能训练里,正在变成一个越来越棘手的现实。

2026年,一群来自北京大学和北京邮电大学的研究者做了一件挺有意思的事:他们让同一个AI模型,先专攻数学题,再去测试它听不听话;又反过来,先训练它听话,再看它还会不会做数学题。结果发现了一个此前很少被人正视的现象:模型在一个任务上进步了,代价却是让它在另一个任务上"失忆"的方式,跟我们熟悉的"遗忘"完全不一样。

这篇论文的名字叫《Verifier-Induced Support Reshaping in On-Policy Optimization》,翻译过来大致是"验证器诱导的策略优化中的支持集重塑"。这个标题听起来挺绕,但背后的故事其实很好懂。

先搞懂一个概念:什么是"遗忘",什么不是"遗忘"

要理解这篇论文在讲什么,得先弄清楚一个长期困扰AI训练的老问题:灾难性遗忘。

**灾难性遗忘**:指AI模型在学习新任务后,之前学会的旧任务能力大幅下降,就像学了法语之后突然忘记了怎么说英语。

这个问题从2017年就有专门的研究了,业内的普遍应对思路是:用强化学习训练模型,会比用监督微调更能保留旧能力。换句话说,之前的共识是——用"做题拿奖励"这种方式训练AI,比"照着标准答案抄"更不容易让AI忘掉别的本事。

这篇论文提出了一个新的视角,说这个共识可能只讲对了一半。

它说,之前大家研究"遗忘"的方式,都是回头看:训练完新任务之后,回过头检查旧任务的分数掉了没有。这是一种"事后诸葛亮"式的诊断。

但这篇论文问的是一个完全不同方向的问题:训练完新任务之后,模型有没有可能,表面上旧任务的能力"看起来"还在,但实际上已经很难被再次激发出来了?

这就引出了论文的核心概念。

**有效可奖励支持集**:指在给定的采样次数限制下,模型依然能够被抽样出来、并被打分为"成功"的那些回答轨迹的集合。

打个比方,你让一个学生做100道题,他理论上还是会做,但如果你只允许他尝试1次,他大概率答错;如果允许他尝试32次,他大概率能蒙对一次。这个"允许尝试的次数"就是采样预算,而"在这个预算下依然能蒙对"的能力范围,就是"有效可奖励支持集"。

这个概念听起来抽象,但它揭示了一个此前被忽略的裂缝:**能力还在,但已经很难被抽出来了**。

这跟传统的"遗忘"完全不是一回事。传统遗忘是"这道题他真的不会做了",而这篇论文说的问题是"这道题他理论上还会做,但你让他随便发挥的话,他基本上不会选择那条正确的路"。

这就好比一个人依然记得某种小众语言的语法规则,但因为长期不用,说话时嘴巴已经不会主动切换到那种语言的表达习惯了。语言知识可能还压在脑子深处,但"张嘴就说"这件事已经变得极其低概率。

实验怎么设计的:两个任务、互相拧巴

为了验证这个想法,研究者选了两个很有代表性的AI训练任务,做了一个"双向对照实验"。

**RLVR**:全称是"带可验证奖励的强化学习"(Reinforcement Learning with Verifiable Rewards),简单说就是让AI自己生成一堆答案,然后用一个自动化的裁判(叫"验证器")去判断对错,答对了给奖励,答错了不给,然后根据这个奖励信号去调整AI的行为倾向。

这个裁判可以是判断数学题答案对不对,也可以是判断一段话有没有遵守用户提出的格式要求(比如"必须用大写字母回答"、"必须分成三段")。这两种裁判标准完全不同,一个看重"结果对不对",一个看重"有没有守规矩"。

研究者用两个模型家族做实验:Qwen3-8B-Base 和 Qwen2.5-Math-7B。他们设计了两条训练路径:一条先用数学题训练(论文里叫Math-RLVR),再去看模型听不听话;另一条先用"听话训练"(论文里叫IF-RLVR,IF就是Instruction Following,指令遵循),再去看模型还会不会做数学题。

这个设计很聪明,因为它同时测了两个方向。如果只测一个方向,你很难判断这是巧合还是普遍规律。两个方向都测了,而且都发现了类似的问题,这才有说服力。

第一个反直觉发现:分数涨了,但"能蒙对"的题变少了

先说数学训练对听话能力的影响。

论文里给出的数据很扎实:在Qwen3-8B-Base模型上,用数学题训练之后,模型在IFEval(一个指令遵循测试集)上的pass@1(单次尝试的成功率)上升了6.5个百分点,听起来是个进步。

**pass@1**:指模型只抽样生成一次答案时,答对的概率,相当于"一次性做对的成功率"。

**best@32**:指模型抽样生成32次答案,只要其中有一次做对就算成功,衡量的是"只要多试几次,能不能蒙对"。

但同一个实验里,best@32却下降了9.8个百分点。也就是说,如果你让模型只试一次,它现在表现更好了;但如果你允许它试32次,它反而比训练前更难找到正确答案。

这个反差挺让人意外的。你可能会想,既然平均表现变好了,为什么"多试几次"反而更难蒙对了?

论文给出的解释是:训练把原本"有时对有时错"的那批题目,往两个极端方向推了。一部分题目变成了"每次都对",另一部分题目变成了"每次都错",中间那批"混合"的题目大量消失了。

具体的数字是这样的:在32次抽样里,答对次数在1到31次之间的"混合型"题目,训练之后有13.0%的比例转移到了"全对"的那一类,但同时也有10.7%转移到了"全错"的那一类。表面上平均分升高了,实际上是把"模糊地带"清空了,模型变得更极端了。

这就好比一个考生原本对某类题目"一半时候能想清楚思路,一半时候会卡壳",经过一段针对性训练之后,他要么彻底吃透了这类题的套路(每次都能做对),要么彻底放弃了这类题(每次都做错),中间那种"有概率蒙对"的模糊状态消失了。如果这类题目其实需要灵活应变而不是死记硬背,那这种"两极化"反而是个隐患,因为一旦题目稍微变个样子,那部分"全对"的题目可能瞬间变成"全错"。

第二个发现:教AI听话,会让它数学题不会"多角度尝试"了

反过来的实验更值得细看。

用指令遵循数据训练之后,模型在数学题上的best@k(无论k取4、8、16还是32)全都下降了。也就是说,无论你给模型多少次尝试机会,它找到正确数学答案的概率都变低了。

研究者进一步去看模型生成答案时"怎么开头",发现了一个很有意思的现象。他们把模型的回答开头分成了两类。

**DRI(深思熟虑式开头)**:回答一开始就用"让我们来解一下"、"第一步"这类逐步推理的语言,先展开思考过程再给答案。

**DAI(直接作答式开头)**:回答一开始就直接给出结论,比如"答案是"、"最终答案:",跳过了展开推理的步骤。

训练之前,模型做数学题时倾向于用DRI式开头,先一步步推导。但随着"听话训练"的进行,DAI式开头的比例越来越高,最后几乎完全取代了DRI。研究者算了一下这两者的相关性:DAI开头的比例越高,数学题的best@32越低,相关系数达到了-0.85,这是个相当强的负相关。

为什么会这样?大概的逻辑是这样的:指令遵循任务本身经常要求"简洁"、"直接给答案"、"不要啰嗦",这种训练压力会让模型形成一种习惯,先把结论甩出来。而数学题恰恰需要那种"边想边写"的展开式推理,一步步排查、验证、修正。如果模型养成了"张口就是结论"的习惯,它就失去了那种慢慢摸索、不断试错、最终逼近正确答案的空间。

这就像一个原本习惯打草稿、反复演算的学生,被要求"回答问题必须简明扼要、直奔主题"训练久了之后,遇到需要复杂推理的题目,他也下意识地想直接蒙一个答案,而不是老老实实地把过程写出来。可数学题的正确率往往就藏在那个"写过程"的环节里,跳过它,正确率自然就掉了。

顺着训练下去会怎样:两种顺序都有麻烦

研究者接着做了一个更狠的实验:既然单独训练一个任务会影响另一个任务,那如果先训练A再训练B,会不会更糟?

先说"先教听话,再教数学"这条路径。

论文发现,切换到数学训练之后,模型在数学题上确实进步了:全错的题目比例从65.6%降到了50.8%。但那些原本"混合型"(有时对有时错)的题目占比,从33.6%骤降到了1.6%,取而代之的是"全对"题目比例暴涨到47.7%。

这个数字乍一看是好消息,但仔细想想问题很大。

**分组相对策略优化(GRPO)**:这篇论文里提到的一种强化学习训练方法,它的更新机制依赖于同一批采样里"既有对的也有错的"这种差异化的反馈信号来调整模型。

如果一个题目的32次抽样要么全对要么全错,那这个题目根本没法给模型提供有效的训练信号,因为没有"对比"可言。这就意味着,那些混合型题目消失之后,后续的数学训练几乎没有素材可用了。20步训练之后,几乎所有题目都掉进了"全对"或"全错"这两个极端,能提供学习信号的"中间地带"基本被清空了。

这就像一个刚从填鸭式训练里出来的学生,突然被要求做开放性思考题。他要么是那种"闭着眼睛都会"的送分题,要么是那种"完全摸不着头脑"的难题,中间那种"努力一下就能突破"的题目消失了,老师想因材施教都找不到抓手。

再看反过来的路径:"先教数学,再教听话"。

这条路更直接:训练继续用"听话验证器"打分之后,指令遵循的分数确实涨了,但数学能力断崖式下跌。研究者试着加了一个约束手段。

**KL散度约束(reference KL)**:一种在强化学习训练里常用的技术,让新模型的行为分布不要离原始模型太远,相当于给模型的"改变幅度"上了个紧箍咒。

研究者试了0、0.04、0.08、0.12四档约束强度。结果是:约束越强,数学能力保留得越好,但指令遵循的进步也越小。在最强的0.12档,数学分数基本保住了,可指令遵循的提升幅度是四档里最小的。没有一档能做到"数学不掉分,同时听话训练的效果跟不加约束一样好"。

这暴露了一个挺现实的矛盾:想要两头都要,鱼和熊掌不可兼得,至少在这篇论文测试的方法范围内是这样。

追根溯源:问题出在回答的头几个字上

到这里,一个自然的问题冒出来了:这种能力退化,到底是模型整体的推理逻辑被破坏了,还是仅仅是"开场白"变了?

研究者用了一个很精细的分析方法去追踪这个问题。

**JS散度(Jensen-Shannon divergence)**:一种衡量两个概率分布有多不一样的数学指标,这里用来比较训练前后模型在每个位置上"想说哪个词"的概率分布差异有多大。

他们把训练前后的模型,放在同一个问题的同一段已生成文字后面,看它们对"下一个该输出什么词"的判断差异有多大,然后按回答中的位置(第1个字、第2到4个字、第5到16个字……)分组统计这个差异。

结果非常集中:不管是哪个模型、哪种训练方式、哪个测试集,差异最大的永远是第一个生成的字。在AIME数学题上,第一个字的分布差异,是回答中间部分差异的9.8倍到106.7倍不等。往后的位置,差异迅速衰减到很小。

这个发现非常关键,它说明训练带来的改变,主要发生在"怎么起笔"这件事上,而不是整个推理过程都被重写了。

进一步地,研究者还想搞清楚:训练是提拔了一个原本模型压根不会想到的新选项,还是仅仅把原本就存在、只是排名靠后的选项往前挪了?

他们做了个"候选词重叠"分析:在差异最大的10%位置上,看训练前后模型各自认为的"前10个最可能的词"重合度有多高。结果显示,平均有6.88到8.96个词是重合的(满分10个),而且89.3%到99.4%的训练后模型"最想说的词",在训练前的模型眼里就已经排在前三名了。

这说明大多数情况下,训练只是在"洗牌",把模型本来就知道的几个候选选项重新排了个序,而不是凭空造出了一个全新的行为模式。

但有一个例外值得单独说:在数学题的开头位置,"听话训练"之后模型最想说的那个词(往往是DAI式的"答案是"),在训练前的模型眼中,排名中位数是第14.5位到第18位,出现概率只有1.9%到0.4%。这说明,虽然大部分重排是"熟悉套路里的洗牌",但确实也有把一个原本很冷门的选项直接提拔成第一名的情况发生。

打个比方,这就像一个厨师本来炒菜时手法丰富,做同一道菜会有好几种下锅顺序可以选,训练之后他大概率还是会用原本就熟悉的几种顺序里的一种,只是习惯性地更偏爱其中一种了。但偶尔也会出现这种情况:厨师突然固定用一种此前极少采用的冷门手法,而这种手法恰好不适合这道菜。

因果验证:换个开头,真的会影响做题能力

光看到"开头变了"和"做题能力变差"这两件事同时发生,还不能证明是开头导致了做题能力下降,也可能只是两件事凑巧一起发生。研究者接下来做了一个真正的因果实验。

他们的思路很直接:不改模型的参数,只在推理的时候,强行把回答的开头换成另一种风格,然后看后续的做题正确率会不会跟着变。

具体做法是,在"听话训练"后的模型上,人为地把第一个词或者整个开头替换成数学训练模型偏好的DRI式(深思熟虑式)风格,看看数学题的正确率会不会回升。

结果确实回升了。在两个模型家族的AIME和MATH-500测试集上,强行换成"数学训练偏好的开头"之后,best@32普遍上升,有的场景提升幅度接近60个百分点。

反过来的实验则没那么对称。把开头强行换成"听话训练偏好的DAI式"风格,在Qwen3-8B-Base上确实会降低做题正确率,但在Qwen2.5-Math-7B上却是持平甚至更好。这提示我们,这个因果关系可能跟具体的模型底子也有关系,不是一个放之四海皆准的死规则。

研究者还做了一个更细致的位置扫描实验:把同一个"听话式"的词,硬塞到回答的不同位置(第1个位置、第2个位置……一直到第100个位置),观察对DRI风格占比和做题正确率的影响。结果发现,只有塞在最开头附近才会明显压制DRI式推理,往后塞的话,DRI风格会自己恢复,虽然做题正确率的表现依然会有波动。

这一整套实验证实了:回答的开头选择,确实对后续的数学题搜索能力有实质性的因果影响。这不是巧合,是一个真实的机制。这就好比走迷宫,你在入口处往左走还是往右走,会决定后面能不能顺利摸到通往终点的那条路。入口选错了,哪怕迷宫内部的路你都认识,也很难走到出口。

想补救?两条路都只能救急,救不了命

既然找到了"开头"这个关键的杠杆点,研究者自然想问:能不能想办法保住这个开头习惯,从而保住数学能力?

他们试了两种思路。

第一种是"提前打预防针":在正式做"听话训练"之前,先用少量数学正确回答(只有50条),对模型做一次小规模的监督微调,让它先养成DRI式开头的习惯,然后再进行"听话训练",看这个"预防针"能撑多久。

他们设计了四种对照组:一种是"温和版DRI预防针",一种是"强化版DRI预防针",还有两个对照组分别是纯DAI式开头和随机混合式开头。四组之后都接受相同的100步"听话训练"。

结果是,温和版DRI预防针撑得最久:在训练进行到第70步时,它还能保持AIME24 best@32为0.400,IFEval best@16为0.948,DAI风格占比只有3.3%。但到了第100步,所有四组无一例外,DAI占比全部冲到了100%。更有意思的是,那个"强化版"预防针反而没有"温和版"撑得久。

这说明,提前打的预防针只能推迟问题发生的时间,没法从根本上阻止最终的结果。就像给一个即将退休的老习惯打了一针强心剂,它确实能多撑一阵子,但终究扛不住持续不断的新压力。

第二种思路是"在线蒸馏"。

**在线策略蒸馏(OPD, On-Policy Distillation)**:一种训练方法,让一个学生模型去模仿一个老师模型对同样问题给出的答案概率分布,用意是让学生更精确地学到老师的行为模式,而不只是学到最终的对错结果。

研究者先用"听话训练"练到收敛的最终模型当老师,让一个从零开始的学生模型去模仿它,练了50步。结果MATH-500的正确率从0.3433掉到了0.0879,而且"走捷径式回答"(表面符合规则但内容空洞)的比例从4.5%涨到了18.8%。

这个结果说明,即使换成更细粒度的蒸馏监督,只要老师本身已经"学坏了",学生也照单全收,没能避开老师身上的问题。

研究者又试了用训练过程中更早期的几个"老师快照"(第20、40、60、80步)去做蒸馏,看不同阶段的老师会不会效果不一样。结果确实不一样:第40步的老师训出的学生在指令遵循分数上表现最好,但只有第20步的老师训出的学生,是唯一一个数学分数不降反升的(提升了0.93个百分点)。

也就是说,"哪个阶段的老师最合适"这件事,没有一个简单的判断标准,指令遵循分数最高的老师,反而未必是保留数学能力最好的老师。这就像挑选导师,你不能只看这位导师带出来的学生某一门课考得多好,还得看这位导师本身有没有把别的重要习惯也一起带偏。

一个更扎心的检验:正确又听话,到底有多难同时做到

前面所有的分析,都是分开看数学能力和听话能力。但现实里用户真正想要的是"既做对题又守规矩"的回答,这两件事得同时发生在同一次回答里才算数。

研究者专门找了两个"联合能力"测试集来做压力测试。

**MathIF**:一个专门测试"数学答案是否同时满足格式类约束"的测试集,比如要求数学解答必须用大写字母写、或者必须控制在多少字以内。

**ReasonIF**:跟MathIF类似,但它约束的是推理过程本身,而不是最终答案,最终答案会单独用标签框出来,不受约束影响。

论文用独立训练到第720步的三个模型(未训练的基线、数学训练模型、听话训练模型)做了这个测试,每个题目采样16次。

结果很说明问题。在MathIF和ReasonIF上,数学训练模型的正确率分别提高了11.3和5.6个百分点,但"守规矩"的比例几乎没变。同时满足"既对又守规矩"的比例,只提高了2.4和1.7个百分点。

反过来,听话训练模型的"守规矩"比例大幅提升了18.1和15.3个百分点,但正确率在MathIF上只是略微提高,在ReasonIF上反而下降了。"既对又守规矩"的比例,提升幅度是5.5和6.2个百分点。

这组数据揭示的规律很清楚:不管你训练哪个方向,那个"没被针对性训练"的指标,进步都非常有限,有时候还会倒退。这直接导致了"两者兼顾"的比例,涨幅永远比单项指标涨幅小得多。

换句话说,单项能力涨了,不代表这两种能力真的能同时出现在同一个回答里。

表格看数据:几个关键实验结果汇总

| 模型 | 测试集 | pass@1变化 | best@32变化 |

| Qwen3-8B-Base | IFEval | +6.5个百分点 | **-9.8个百分点** |

| Qwen3-8B-Base | IFBench | +3.2个百分点 | -6.7个百分点 |

| Qwen2.5-Math-7B | IFEval | +7.9个百分点 | **-11.4个百分点** |

| Qwen2.5-Math-7B | IFBench | +1.6个百分点 | -3.7个百分点 |

这张表说的是"数学训练"对"听话能力"造成的影响,单次尝试的分数都涨了,但多次尝试的成功率全线下降。

| 测试集 | 检查点 | 正确率 | 守规矩率 | 同时满足比例 |

| MathIF | 基线 | 0.359 | 0.250 | 0.094 |

| MathIF | 数学训练 | **0.472** | 0.253 | 0.118 |

| MathIF | 听话训练 | 0.377 | **0.431** | **0.148** |

| ReasonIF | 基线 | 0.467 | 0.239 | 0.109 |

| ReasonIF | 数学训练 | **0.522** | 0.235 | 0.126 |

| ReasonIF | 听话训练 | 0.438 | **0.391** | **0.171** |

这张表说的是"联合能力"检验,两种训练方式都能把自己主攻的那个指标推高,但对方向的指标基本原地踏步甚至倒退,"同时满足"的比例始终是三个数字里最小的那个。

写在后面

读完这篇论文,最让我改变想法的一点是:我们习惯用"记不记得"来衡量AI有没有遗忘一项能力,但这篇论文说,还有一种更隐蔽的丢失方式,能力压根没消失,但已经很难被随机抽样这种方式激发出来了。这跟"忘记怎么骑自行车"不一样,更像是一个技能被压到了脑子最深处,你偶尔还能用上,但正常情况下大脑根本不会主动往那个方向调用。

另一个让我意外的细节是那个负相关系数-0.85。DAI式开头占比和数学正确率之间这么强的负相关,说明"怎么起笔"这件小事的影响力,远比我们直觉里以为的要大。一个模型选择先写"答案是"还是先写"让我们来看看",几乎决定了它后面还能不能找到正确答案。这让我想到,很多时候看似无关紧要的"习惯性开场",其实悄悄决定了整个思考过程能不能展开。

论文里那个"强化版DRI预防针反而不如温和版撑得久"的结果,我想了很久也没完全想明白背后的机制,是不是训练太猛烈反而让模型对这个开头习惯产生了某种抵触?还是这只是这一次实验的偶然?这大概是论文本身也没有回答的地方,值得后续研究继续追问。

如果一个AI系统需要不停地被不同的验证器打分调教,那它内心深处那些还没被验证过的能力,会不会正在悄悄地变得越来越难被叫醒?

Q&A

Q1:验证器诱导的支持集重塑到底是什么意思?

A:指AI模型经过某个任务的强化学习训练后,虽然理论上还保留着完成其他任务的能力,但这些能力变得极难在有限的采样次数内被激发出来,跟传统的"能力彻底消失"的遗忘完全不同。

Q2:为什么数学训练会让AI变得不听话,听话训练又会让AI数学变差?

A:论文发现关键在于回答的开头几个字。数学训练让模型偏爱"深思熟虑式"开头(先展开推理再给答案),指令遵循训练则让模型偏爱"直接作答式"开头(先给结论)。这两种开头风格互相冲突,直接影响了后续的做题正确率。

Q3:有没有办法同时保住两种能力,不用二选一?

A:论文测试的几种方法,包括提前打"开头习惯预防针"和在线策略蒸馏,都只能延缓问题发生或者部分缓解,没有一种方法能完全避免这种此消彼长的现象,作者认为这仍是一个需要继续研究的开放问题。

[责任编辑:linlin]

标签: 做题 实验 教会 数学题 强化学习 高中物理

相关文章

评论排行
评论排行
热门话题
最近更新