苹果新研究:纯中文推理训练,和用英文几乎没有差距
上周六
Apple 联合 Hasso Plattner 研究所发表论文,通过超 200 组 GRPO 强化学习推理训练实验发现,高资源语言用母语推理训练与英语训练的性能差距普遍在 2 个百分点以内,其中中文仅差 1.1 个百分点,打破了「推理必须用英语」的共识,意味着中文等非英语高资源语言的推理模型有条件从训练阶段就走独立路线。实验还显示跨语言迁移广泛有效,低资源语言训练有时能带来更强泛化,多语言混合训练性价比高,但部分模型-语言组合会触发特定任务的极端性能塌方,需逐语言、逐任务、逐模型排查风险。
体验专业版特色功能,拓展更丰富、更全面的相关内容。