Kaelem

老师知道的太多,反而害了学生

·4 min read
AI论文解读强化学习蒸馏

老师知道太多害了学生——自蒸馏中特权信息泄露导致知识熵暴跌

SDPO 是一种很有效的自蒸馏方法——让同一个模型同时扮演"知道答案的老师"和"只能看题目的学生"。但你猜怎么着?在化学领域训练中,SDPO 的 policy entropy 一路暴跌到 0.322,几乎失去了所有探索能力。同一模型在 GPQA 化学测试上的准确率从训练中期的 40.45% 一路下滑到 28.62%。

这不是训练不稳,也不是超参没调好。香港城市大学和清华的研究者给出了更精确的数据:物理 0.385、生物 0.602、化学 0.322、材料科学 0.150。材料科学那个 0.150——意味着模型每一步都只对极少数 token 有"确定性偏好",连犹豫的空间都没了。

根本原因不是蒸馏本身的错——而是老师知道的太多


反向KL重心——该听时听不该听时自己来

反向 KL 重心:一个"半推半就"的蒸馏目标

Yang 等人严格证明了:因为老师知道答案,即使给定题目和已生成的前缀,下一个 token 和正确答案之间仍存在正的信息量。这意味着老师的某些预测不是基于"推理能力",而是"已经知道答案"。

DemoPSD 的解法很优雅:不是完全不听老师的,而是在老师和学生分布分歧最大的那些 token 上,让学生保持自己的判断——"该听的时候听,不该听的时候自己来"。


训练熵——SDPO暴跌vs DemoPSD稳定

实验:四个领域,一组统一的提升模式

在物理、生物、化学、材料四个科学领域,DemoPSD 相对 SDPO 一致提升。训练熵方面,DemoPSD 比 SDPO 高 33%-98%。跨域泛化上,SDPO 出现明显退化而 DemoPSD 保持稳定。


让监督适应学习者——四项领域一致的增益

Big Picture:让监督适应学习者

这篇论文的深层洞察是:知识蒸馏的设计哲学应该从"让学生服从老师"转向"让监督适应学习者"。 一个好的老师不是把答案直接告诉学生,而是知道什么时候该闭嘴。DemoPSD 实现了一个"选择性闭嘴"的机制——当学生和老师分歧足够大时,信自己的。


本文基于 DemoPSD (Yang et al., 2026) 撰写。