
2024年前后AI训练圈子里流行起一种新玩法让一个强大的教师模型手把手教一个学生模型做题教师不是简单打个对错分数而是逐字逐句地告诉学生每个字该怎么写。这种方法叫做在线策略蒸馏在线策略蒸馏一种让学生模型模仿学生自己生成的答案同时由教师模型逐词打分指导的训练方式英文缩写OPD。听起来很美好对吧教师全程盯着字字纠正学生想学不好都难。可Purdue大学的两位研究者Yi Ding和Ruqi Zhang做了一件挺较真的事他们把教师打的分数一条条拆开检查结果发现了一件让人后背发凉的事情。教师的批改很多时候是错的。而且教师越厉害错得越离谱。这事儿要是放在人类补习班里家长早就把老师投诉了。可离谱的是学生成绩居然照样在涨。这篇论文要讲的就是这场错批改却教出好学生的乌龙是怎么回事以及研究者们顺藤摸瓜发现的一个更朴素的真相。教师打分为什么会错先说清楚这套打分机制到底怎么运作的。学生模型自己生成一段回答每写一个字教师模型就在旁边看着这个字给出一个优势值优势值在强化学习里表示某个动作比平均水平好还是差的数值正数代表这个词该被强化负数代表该被压制。具体算法是拿教师对这个字的偏好概率和学生自己对这个字的偏好概率做一个比值再取对数如果教师觉得这个字比学生想的更该出现优势值就是正的反之就是负的。这套东西背后有个专业名字叫反向KL散度反向KL散度一种衡量两个概率分布差异的数学工具这里用来衡量学生生成的文字序列和教师预期的差距K1估计器是它的一种具体计算方式。问题出在哪儿教师看到的这段文字压根不是教师自己会写出来的东西而是学生写出来之后甩给教师去评判的。这就好比请一位数学教授去批改一份不认识的学生用他从没见过的解题思路写出来的卷子教授看到中间某一步的时候可能因为思路完全不熟悉就下意识觉得这一步写得不对即使最终答案是对的。研究者们专门盯着答案框里的最终结果做了统计。他们定义了一种噪声如果学生最终答案是对的但教师却给这个答案的关键字打了负分或者学生答案错了教师反而打了正分这就是一次噪声打分。统计结果相当扎眼。用40亿参数规模的教师模型去批改30.6%的批改是噪声的。换成300亿参数规模的教师噪声率涨到34.7%。而当教师换成2350亿参数的超大模型时噪声率飙升到50.6%几乎是随手一批就有一半是错的。更离谱的是这个最大的教师几乎对所有答案框里的内容都打负分不管学生到底做对没做对97.8%的正确答案都被打了负分96.6%的错误答案居然也被打了负分。如果不这样细究会发生什么大家会继续以为教师模型越大越好越大教得越准可实际上教师规模越大它对学生这种陌生笔迹的解读反而越走偏因为教师和学生的语言习惯差得越来越远教师看学生的答案就像一个只会说标准普通话的人去批改带浓重方言口音的作文越是资深的普通话专家可能越难适应这种偏差反而给出更极端的判断。学生对错误批改毫不在意按理说接近一半的批改都是错的学生应该被带偏才对。研究者接下来做了个挺聪明的对照实验他们把训练数据分成三组一组只用有噪声的批改来训练一组只用干净的批改来训练一组按标准流程混着用。结果三组学生最后考出来的成绩几乎一样。这个发现相当反直觉。一个正常人的预期是喂给学生错误的反馈学生应该学得更差才对就像给学生一份写满错误批注的作业本学生对着这些批注去改错改出来的东西大概率更糟。可这里学生并没有变糟甚至进步速度和吃干净饭的学生差不多。这说明了一件挺颠覆的事学生的进步可能压根就不是靠理解和吸收教师那些逐字逐句的批注在起作用。那真正起作用的到底是什么呢拆解到底是哪些字在起作用研究者们没有停在这个疑问上而是往下深挖了一层去看训练过程中每个字对应的梯度。梯度梯度神经网络训练时用来指导参数更新方向和大小的数值梯度越大代表这个地方对模型的调整影响越大梯度接近零就意味着这个地方基本没在起作用。他们发现整个批改分数的分布长得很奇怪29.2%的字拿到的优势值恰好是0还有51.7%的字优势值小到几乎可以忽略不计也就是说超过一半的批改根本没在起作用等于白改了。再往下追问这些白改的字都长什么样答案是都是学生自己写得特别有把握的字。学生对这个字信心爆棚概率值特别高教师看到这种字的时候往往也会给出差不多高的概率两边一减差值自然趋近于零批改也就没意义了。这就好比一个学生做1加1等于2这种题老师看了也确实觉得没问题批注自然是空白的这道题根本用不上老师。研究者干脆做了个实验验证只挑学生最有把握的那些字来训练不管用真实批改分数还是随便乱给的分数学生成绩纹丝不动。也就是说教师在这些字上批不批、批得对不对压根不重要因为这些地方本来就没有信息量可传递。真正撬动进步的杠杆那问题的重心自然就转移到了另一端学生自己都拿不准、写得犹豫的那些字上。这些字往往拿到的是负分因为学生生成的东西对教师来说本来就是陌生的教师大概率会觉得这不是它想要的写法。研究者干脆做了个更狠的测试干脆把教师撤掉不管学生写的是什么只要是那20%概率最低的字一律给一个固定的负分比如统一给负0.5分。结果这么简单粗暴的操作效果居然能追上正常的教师批改。反过来如果给这些字统一打正分模型直接崩了前40步之内回答长度就从正常水平掉到接近于零梯度爆炸输出全是乱码。这个对比说明了一件事真正在起作用的从来不是教师那些精细的字词级点评而是一个简单的动作压制学生自己都没把握、随口冒出来的那些低概率词。这就像健身教练发现学员进步的真正原因不是每次纠正握杠角度的细节反馈而是每次学员动作走形、发力点飘忽的时候及时喊一声停这个姿势不对光是这一声制止比一堆细致入微的纠正动作还管用。一个更精细的开关熵发现压低概率就管用之后研究者又往前走了一步既然低概率的字都该被压一压那是不是应该一视同仁给每个字一样大小的压力这里引入了另一个关键概念。熵熵在这里指模型对下一个字该写什么的不确定程度熵高说明模型面前有好几个差不多合理的选项熵低说明模型几乎认定了唯一答案。同样是低概率的字背后的情况可能完全不同。有的地方模型压根拿不准好几个词的概率都差不多随便一个都算低概率这种是高熵位置。有的地方模型其实很自信只是这次运气不好抽到了一个概率很小的候选词这种是低熵位置但抽中了尾部词。研究者设计了一个动态调整机制让压制力度和熵挂钩熵越高的位置压得越狠。他们做了正反两组对照实验一组是熵越高压得越狠一组反过来熵越低压得越狠。结果正相关那组的表现直接把标准的教师蒸馏方法甩在身后AIME24这个高难度数学竞赛测试集上的准确率冲到50%而标准教师蒸馏方法只有35.13%。反过来那组不但效果差训练过程还不稳定中途出现明显震荡。这就是全文最核心的方法研究者给它起名叫自适应策略自适应自适应策略自适应一种不需要任何外部教师、不需要标准答案、也不需要验证器的训练方法英文缩写OPSA核心做法是只压制学生自己生成内容里概率最低的那20%的字并且根据这些字所在位置的不确定程度动态调整压制力度。这套方法完全不需要外部监督不需要教师模型不需要提示答案也不需要可验证的奖励信号全靠模型自己审视自己写出来的东西把没把握的地方压一压同时视情况区别对待。为什么压制反而不会让模型变得死板这里有个自然会冒出来的疑问一直压低概率词模型会不会变得越来越保守最后翻来覆去只会说那几句话丧失多样性论文给出了很细致的分析。在高熵位置也就是那种模型本来就犹豫不决的分叉路口压制某个被抽中的尾部词之后概率并不是简单地全部涌向唯一的头部词而是在几个原本就有竞争力的候选词之间重新分配。这就好比一个班级选班长本来五个候选人里有一个明显不靠谱的人偶尔被提名把这个不靠谱的人筛掉之后剩下四个靠谱候选人的支持率会重新洗牌而不是所有票全部涌向一个人。而在低熵位置也就是模型本来就非常确定该写什么的地方因为这些字压根不在最低20%概率的筛选范围内根本不会被拿来训练模型原有的自信被完好保留。研究者用一种叫做杰卡德距离杰卡德距离一种衡量两段文本内容相似程度的指标数值越大代表两段内容差异越大也就是多样性越高。的指标验证了这一点训练前后的模型在生成较长回答时内容多样性几乎没有差别说明这套压制策略并没有让模型变得千篇一律。如果没有区分头部词和尾部词会怎样论文里做的10%消融实验给出了答案只压制概率最低的10%字词时这些字几乎全是那种极端冷门的词压得太狠反而让整个分布过度收窄熵大幅下降进步反而受限。这也从反面证明了这套分层压制的必要性。高熵位置还藏着另一层惊喜。研究者发现模型在这些犹豫不决的分叉点上特别容易蹦出等等不过或许再检查一下这类反思性词汇。这些词往往是模型自我纠错、重新审视思路的信号。经过这套训练之后模型生成这类反思词的频率明显上升回答长度也随之变长而回答长度和最终答案准确率之间呈现出清晰的正相关。研究者专门做了个屏蔽实验把这些容易触发反思词的分叉位置从训练里剔除结果回答长度的增长和准确率的提升都消失了训练到300步左右直接崩掉。这说明这套方法真正撬动的恰恰就是模型在关键分叉点上多想一步、多检查一遍的能力。数据说话效果到底有多猛拿Qwen3-1.7B这个17亿参数的模型做基准测试没训练之前在AIME24这个数学竞赛题上32次采样的平均正确率只有13.44%32次里至少对一次的概率是40%。用了这套自适应训练之后平均正确率跳到48.85%相对提升263.5%至少对一次的概率直接翻倍到80%。放到AIME25和更难的HMMT25竞赛题上提升幅度分别是264.4%和307.2%。换到40亿参数的Qwen3-4B模型上依然管用AIME24平均正确率从23.33%涨到62.08%。就算是本身已经很强的Qwen3.5-9B模型AIME24的分数也能从76.35%再往上拉到87.81%。而且这套方法不挑食跑到代码生成任务MBPP和综合问答任务GPQA-Diamond上测试同样能带来提升说明它学到的不是某个特定题型的窍门而是一种更通用的能力。跟其他不需要外部监督的方法比起来这套方法同样占优。有一种叫测试时强化学习测试时强化学习一种在推理阶段直接对模型进行训练的方法英文缩写TTRL靠模型自己投票选出可能正确的答案来构造训练信号。的方法虽然也不需要外部监督但容易把模型的判断锁死在某个局部最优解上导致至少对一次的概率反而下降。这篇论文提出的方法没有这个问题因为它并不强迫模型收敛到某个自己猜的答案上而是专注在字词层面做更细粒度的调整。写在后面读到教师批改噪声率超过50%这个数字的时候我第一反应是这套蒸馏方法是不是该被判死刑了。但往下读完才发现事情比想象中更有意思错误批改居然不影响学习效果这不是说明噪声不重要而是说明真正的学习信号原本就没依赖那些批改内容教师的存在感被严重高估了。最让我意外的是那个正负号实验。固定给负分能让模型稳步进步固定给正分却直接让模型崩溃到输出乱码。这种不对称性挺值得琢磨压制错误的冲动比鼓励某个具体方向要安全得多因为压制之后概率往哪儿走是模型自己根据剩下的合理选项决定的而强行鼓励某个具体方向一旦这个方向本身就是随机噪声模型就会被硬拽着往错误的地方走。这跟教育里常听到的一个说法有点像批评一个具体的坏习惯往往比空泛地表扬某种模糊的好行为更容易起效。论文里提到熵高的位置容易冒出等等或许这类反思词这个细节让我想起人在思考真正困难的问题时嘴里也确实更容易嘟囔等等好像不对而不是在做简单加法时会犹豫。这种语言习惯上的相似性也许不只是巧合。这套方法目前只在90亿参数以下的模型上验证过更大规模、更复杂架构下是否依然管用论文自己也承认还不清楚。一个已经被训练得极度自信、输出分布极度尖锐的模型还有没有足够的低概率尾部词可供压制这也是个悬而未决的问题。如果一个学生的进步根源不在于老师说了什么而在于他自己反复琢磨哪里没把握、然后主动收敛那些没把握的想法那我们平时对好的教学的想象是不是也该重新审视一下QAQ1在线策略蒸馏中教师模型的批改为什么会出现大量错误A因为教师是在批改学生自己生成的、教师从没见过的写法这种内容对教师来说本身就是陌生的教师容易凭自己的习惯给出误判教师规模越大这种偏差反而越明显最大的2350亿参数教师批改噪声率高达50.6%。Q2OPSA方法具体是怎么工作的AOPSA只关注学生自己生成内容里概率最低的20%的字给这些字打负分进行压制并且根据这些字所在位置的不确定程度熵动态调整压制力度熵越高压得越狠整个过程完全不需要外部教师、标准答案或验证器。Q3OPSA会不会让模型变得死板、丧失多样性A不会在高熵的分叉位置压制某个低概率词后概率会在其他有竞争力的候选词之间重新分配而不是全部涌向单一答案实验用杰卡德距离验证了训练前后模型的输出多样性基本没有下降。