清华团队再探 On-Policy Distillation:数据撑死,算法饿死
2 小时前
清华大学等多机构研究者开展 On-Policy Distillation(在线策略蒸馏,OPD)相关研究,将训练集缩减至 1 道题后发现,模型训练几百步仍能持续提升,单题训练可恢复全量数据约 70% 以上收益,在数学、coding 等多任务及不同模型上均有类似效果,且对训练题性质不敏感。研究指出 OPD 是「数据撑死,算法饿死」:数据侧,一道题经反复 rollout 可产生大量状态,1 道题能摸到全量状态空间的 71.5%,16 道不同语义簇的题即可达到与全量数据相当的效果,说明题目数量并非有效监督量的合适尺度,状态覆盖更关键。算法侧,模型吸收监督的速度随训练推进逐渐变慢,且训练集大小对吸收率影响极小,即使固定状态,模型仍需多次更新消化监督。在多教师 OPD(MOPD)设置下,每个领域 16 道语义不同的题即可打平全量 MOPD 效果。极端实验显示,无明确任务内容的输入也能产生有效监督,关键在于能否让模型进入 Teacher 可提供有效监督的状态。此外,对比 RLVR,OPD 训练涨幅更高,但二者天花板受限于不同因素。该研究为 OPD 数据筛选提供新视角,应关注题目能否带模型到未访问状态、Teacher 是否有可教内容及学生吸收速度,这一状态视角也可能适用于其他 on-policy 训练范式。
清华团队再探 On-Policy Distillation:数据撑死,算法饿死
机器之心 / 腾讯网
体验专业版特色功能,拓展更丰富、更全面的相关内容。