Fable 5.1 超越人类却贵了 2.5 倍,NeoCognition 给 Agent 进公司算了笔账
1 小时前
NeoCognition 推出 ApprenticeBench 评测,将 Agent 放入模拟建筑公司,让其像新员工一样学习并处理应付账款工作。评测显示,Fable 5.1 和 GPT-6 Astra 通过率分别达 72%、68%,超过人类测试者的 51%,但 Fable 5.1 处理单张账单成本约为人类的 2.5 倍。该评测还发现,不同模型在真实工作场景中差距被放大,开源与闭源模型表现差异明显。此外,评测提出「CUA 税」概念,发现顶尖模型的这一成本已近乎消失。通过对照实验明确了模型从入职学习中获得的能力提升。还发现 Agent 存在越做越慢、做无用功等问题。未来 Agent 若能更省、更稳、易配合,有望大幅提升团队生产力。王宇翔教授已全职加入 NeoCognition 担任机器学习总监。
体验专业版特色功能,拓展更丰富、更全面的相关内容。