大模型 Scaling 撞上成本墙:三星提出 TrOPD 新方法,把前沿智能塞进数亿终端
7 小时前
三星大模型团队联合牛津大学、北京大学提出基于信任域的 On-Policy Distillation 方法 TrOPD,以解决端侧小模型继承大模型能力时,现有 OPD 方法因师生模型能力差距大导致监督信号失真、训练不稳定的问题。研究发现 OPD 训练成败关键在于教师能否对学生生成的每个 token 给出可靠监督,而非散度公式选择。TrOPD 通过识别教师可信监督区域,在信任域内用常规在策略学习,离群区域换用更温和监督,并引入离策略引导主动将学生生成拉向信任区域。实验显示,TrOPD 在数学、代码、指令遵循、STEM 等基准上全面超越现有 OPD 改进方法,且提升不仅限于训练领域,师生模型能力差距越大,其优势越显著,为前沿 AI 以低成本部署到数亿终端提供了新路径。
2026-08-12
三星在半导体研发中引入 Claude 模型 耗时一月的设计验证缩短至两天2026-07-15
面壁智能端侧大模型将搭载三星手机上市体验专业版特色功能,拓展更丰富、更全面的相关内容。