看懂不等于做对:VA-Bench 测出大模型空间智能的执行断层
1 小时前
针对多模态大模型空间智能存在的「看懂却做不对」的执行断层问题,相关研究提出 VA-Bench 评测基准,构建覆盖 14 类机器人操作任务的 280 个基础场景,设置观察-推理-行动-修正的完整交互闭环,要求模型自主判断信息缺口、主动调整视角、输出精确动作参数。测试显示头部多模态模型目标识别与定位、操作语义理解表现接近满分,但完整任务成功率仅约五成,能力短板集中在精细空间执行、错误在线修正、双臂协同三个环节。对照实验表明主动感知补全信息的能力比单纯提供多视角画面更关键,此外模型在空间布局迁移、长时序组合任务中的表现也出现明显下滑,VA-Bench 清晰测出了当前多模态大模型从空间理解到可靠物理行动之间的具体能力边界。
看懂不等于做对:VA-Bench 测出大模型空间智能的执行断层
机器之心 / 腾讯网
体验专业版特色功能,拓展更丰富、更全面的相关内容。