GPT-6 Astra 的隐藏推理,丹麦团队用 tool calling 撬出来了
1 小时前
丹麦奥尔堡大学 AI 安全实验室与 Seafill 开源社区联合发表研究,通过标准 API 的 tool calling 协议层方法,成功提取多款前沿大模型的隐藏思维链,经开源、闭源模型验证,提取出的推理内容接近模型原生推理,可作为研究其推理行为的有效代理。研究首次拆解 GPT-6 Astra 的推理机制,发现其推理树结构更紧凑,会像人做心算一样省略基础推导等细粒度中间步骤,仅外显关键结论,整体推理活动类型与其他前沿模型相近,只是外显内容更少。进一步测试显示 Astra 生成的压缩思维链仅对强模型友好,弱模型难以补全省略步骤、容易答错。该研究得出三点启示:安全层面需全方位覆盖模型行为防护,不能仅依赖关闭原生推理通道。思维链层面强模型的效率来自减少外显而非减少推理,适配其行为的提示词效果更好。训练数据层面最强模型的压缩思维链并非最优监督来源,将其展开为显式步骤才能更好适配弱模型的学习需求。
体验专业版特色功能,拓展更丰富、更全面的相关内容。