复旦发布以人为中心的复杂场景音视频追踪基准
1 小时前
复旦大学 CVL 实验室提出面向复杂人类中心场景的音视频追踪基准 AVTrack,论文已被 ICML 2026 接收,相关项目主页、论文、代码与数据集已公开。AVTrack 聚焦复杂动态场景下音视频对应与长期身份关联的基础问题,包含 871 段平均时长 54.0 秒的视频,提供 3120 条带跨帧身份的像素级实例轨迹,涵盖剧集、vlog 等六类来源,设为纯测试基准,并划分出视觉遮挡、音视频不一致等 8 类挑战场景,其复杂程度远高于现有同类数据集。研究团队对代表性 VIS、AVIS 方法及 Gemini 2.5 Pro 进行测试,发现现有方法在复杂场景中表现不佳,通用大模型的音视理解能力也难以直接转化为稳定的像素级说话人跟踪能力。团队提出的模块化模型 AVTracker 通过局部到整体的三阶段设计,在 HOTA 指标上取得最优表现,但音视频不一致、视觉遮挡等场景仍是所有方法的难点,后续将针对这些困难场景及相关机制展开研究。AVTrack 旨在剖析模型在复杂音视融合场景下的性能与短板,助力探索模型对动态场景中说话者的持续理解能力。
体验专业版特色功能,拓展更丰富、更全面的相关内容。