多会话语音记忆基准 VoxMem,专治音频大模型记不住「谁说的、怎么说」
2 小时前
针对长期语音对话场景下现有评测存在的仅考察文字内容、无法分离历史长度对记忆效果的影响两大痛点,墨尔本大学与新南威尔士大学联合团队推出多会话语音记忆基准 VoxMem。该基准以「声学证据 × 记忆操作」二维分类法覆盖 15 种考察组合,所有题目在 8K 到 64K 不同历史长度下保持不变,共包含 3196 个评测实例、34743 个语音会话,合计约 177 小时音频。对 15 个音频大模型的评测显示,32K 上下文长度下所有模型整体准确率均未超过 40%,模型对语音语义的记忆表现远优于说话人身份、副语言线索、环境声三类音频原生信息,追踪语气、背景声变化的准确率极低,且随着历史长度增加,各类信息的记忆准确率均有下降,当前音频大模型的语音记忆瓶颈主要集中在信息的识别、定位与关联绑定环节,而非推理操作层面。
体验专业版特色功能,拓展更丰富、更全面的相关内容。