3B 模型成功率 94.5%,Token 级奖励打开长链路智能体训练新思路
9 小时前
多轮智能体任务仅设终点奖励,存在时间信用分配难题,即无法明确轨迹中哪一步需被强化。当前主流方案用模型给无技能轨迹 token 打分,但教师置信度可能仅偏好语言表达而非任务关键动作。中科大与阿里团队提出 ADRS 方法,将训练期特权技能转化为 token 级信用并接入强化学习路径。该方法通过三步训练,以三层信用构造解决教师分数跨步不可比、置信度未必有用、独立蒸馏损失绕开组相对优势等问题,不改变底层 RL 算法且推理时无需技能。在 ALFWorld、WebShop 和搜索式 QA 环境测试中,ADRS 显著提升模型成功率,能精准强化关键决策 token,数据效率高,长交互链路优势更明显,同时明确了方法边界。
B 模型成功率 94.5% Token 级奖励打开长链路智能体训练新思路
maomu.com
3B 模型成功率 94.5% Token 级奖励打开长链路智能体训练新思路
maomu.com / 智源社区
体验专业版特色功能,拓展更丰富、更全面的相关内容。