答对了,理由却错了:港科大提出 LexAgentHallu,追踪智能体的「隐性幻觉」
2 小时前
香港科技大学研究团队提出法律智能体幻觉评测基准 LexAgentHallu,将评测对象从最终答案扩展到智能体完整执行轨迹,构建覆盖法律内容与智能体执行过程两大维度的分层错误分类体系,收录 3414 个实例覆盖 17 个法律类别与 6 类任务。评测 18 种闭源和开源智能体配置发现,表现最优的配置仍有 89% 的执行轨迹至少出现一次幻觉,答案正确的样本中平均仍有 68% 的轨迹存在法律内容幻觉,错误并非随机分布,上游的法源层级、程序期限等错误易引发后续连锁偏移。该基准可将幻觉拆解为可定位的故障类型,为法律智能体从生成前明确边界、执行中验证依据、输出前检查一致性等环节搭建可靠性防线提供支撑,也指出法律智能体的可信度不能仅由最终答案证明,需对全推理链路进行核验以阻断错误传播。
2026-09-14
深大、港科大提出 ECA,让 Agent 行动前先验证证据体验专业版特色功能,拓展更丰富、更全面的相关内容。