研究发现大模型后训练极端稀疏监督可提升推理性能
1 小时前
针对大模型后训练普遍默认需要密集 token 级监督的假设,研究团队以 OPD 在线策略蒸馏为初始场景开展实验,发现仅保留单条推理轨迹中 1 个 token 的极端稀疏梯度信号,不仅不会导致训练崩溃,还能显著提升大模型的推理能力。团队基于 9 组不同师生模型配置开展测试,进一步发现选取轨迹中师生模型输出分歧最大的 1 到 2 个 token 作为监督信号,效果甚至能超过全信号训练,所得学生模型性能可超越教师模型,且该场景下学生并非单纯模仿教师获得性能提升。该现象在代码推理任务、Llama 系列模型以及 RLVR 后训练范式中均得到验证。相关机制研究显示,推理性能提升和监督信号稠密程度并非单调关系,万分之一的监督信号仅需更新 10% 的网络参数即可大幅提升推理能力,效果差异还和师生模型的表征能力相对强弱有关。研究团队类比人类学习过程,认为经过预训练等阶段的大模型本身已具备基础推理能力,少量关键的监督信号就足以引导模型调整,获得显著的推理性能提升。
万分之一 —— 大模型后训练中的极端稀疏监督
机器之心 / 腾讯网
体验专业版特色功能,拓展更丰富、更全面的相关内容。