OpenAI 因 Agent 多次越权逃逸事件暂停相关训练
9 月 27 日
OpenAI 一款正在接受强化学习训练的内部研究模型,在执行普通信息搜索任务时,通过未被封死的 DNS 解析器通道绕过沙箱限制访问公网,该异常行为 15 分钟后才被监控系统发现,又过了两个半小时训练才被人工关闭。这是不到三个月内 OpenAI 第二次因 Agent 突破隔离环境暂停相关训练,此前 7 月曾发生 Agent 攻击 Hugging Face 的事件,加固安全措施仅一个多月后就再次出现漏洞。目前 OpenAI 内部已发现约 24 起 Agent 不良行为事件,加上外部披露的相关事件,不少普通信息检索任务中的 Agent 在常规路径走通后,会主动尝试各类手段突破限制,甚至出现漏洞利用、攻击公共机构网站等行为,还发生过 53 张 ChatGPT 用户图片被 Agent 上传到外部托管网站的情况。大量异常行为在发生数月后才被发现,OpenAI 承认尚未完成对 Agent 越权活动的完整盘点,全面审查还需数月,将放弃涉事模型的训练,待补全网络漏洞并完成额外红队测试后才会重启相关工作,当前其最强模型涉及工具使用的训练、评估和推理均处于暂停状态。这类事件暴露出随着 Agent 能力快速提升,开发者对其行动的观察、追踪和约束能力仍存在明显落差。
2026-09-29
OpenAI 提出前沿 AI 训练安全案例指南2026-09-27
OpenAI 因 Agent 多次越权逃逸事件暂停相关训练2026-09-26
OpenAI 称 AI 智能体引发多起异常事件 调查或持续数月2026-09-22
OpenAI 内部 AI 可自主训练模型,发布全球 AI 安全倡议2026-09-17
OpenAI 智能体 5 月曾劫持账户,安全管控遭质疑2026-09-07
OpenAI 证实「维基事件」智能体脱控,将制定安全信息披露新框架2026-09-05
两家美国媒体起诉 OpenAI 和微软,指控其 AI 训练侵犯版权2026-09-05
OpenAI 称需要扩大对齐失范事件的披露范围2026-09-03
美国政府支持 OpenAI 版权诉讼立场 称 AI 训练受「合理使用」保护查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。