为了理解而生成:他们用合成数据教会模型「视频通话」
1 小时前
针对现有音视频交互多为音视频问答、缺乏无需文本 / ASR 转写的原生音视频对话能力的问题,相关研究提出 OmniVChat 原生音视频对话框架,通过多智能体数据引擎 OmniVChat-Studio 合成带参考回复与评分标准的单轮、多轮原生音视频对话数据,构建覆盖 5 大能力类别的 2800 条评测基准 OmniVChat-Bench,将分层评分标准转化为强化学习奖励设计 OmniVChat-RL,基于合成数据训练模型。实验证明,仅用合成对话做强化学习,模型在完全未参与训练的真人真实交互数据集上的表现也得到显著提升,验证了经严格设计的合成数据可有效训练面向现实场景的原生音视频对话模型。
为了理解而生成:他们用合成数据教会模型「视频通话」
机器之心 / 腾讯网
体验专业版特色功能,拓展更丰富、更全面的相关内容。