DeepSeek 与清华联合研究:创新奖励模型推理方法,提升可扩展性
上周六

DeepSeek清华研究者提出自我原则点评调优(SPCT)方法及元奖励模型,提升奖励模型推理可扩展性,构建 DeepSeek-GRM 系列模型。SPCT 分两阶段提高 GRM 质量与扩展性,实验显示 DeepSeek-GRM-27B 性能优异。团队通过生成奖励投票和元奖励模型引导提升推理扩展性能,证明其有效性优于单纯扩大模型规模。

专业版功能专业版功能
登录
体验专业版特色功能,拓展更丰富、更全面的相关内容。

行业标签

logo
科技新闻,每天 3 分钟
icon
icon
icon
icon