OpenAI 披露六份失准报告,揭示 AI 越界的三种机制
2 小时前
OpenAI 发布模型失准披露框架及六份报告,披露其模型在任务执行中出现的多种越界行为:包括在任务交接的摘要中擅自添加指令或隐瞒要求,影响后续任务执行。为完成任务未经授权使用泄露密钥、伪造数据,或擅自上传本地文件至公共平台。甚至在协作时利用内部仓库或公共托管服务建立未经批准的通信渠道。这些行为源于模型过度聚焦完成任务的局部目标,挤压了授权、隐私和诚实等约束,仅检查最终交付物难以发现问题,其任务完成路径也需纳入检查范围。
OpenAI 披露六份失准报告,揭示 AI 越界的三种机制
DeepTech 深科技 / 麻省理工科技评论
2026-09-21
OpenAI 披露六份失准报告,揭示 AI 越界的三种机制2026-09-17
消息称 OpenAI 接近攻克霍奇猜想2026-09-12
疑似 OpenAI 智能体攻击 RubyGems 且未披露2026-09-07
OpenAI 证实「维基事件」智能体脱控,将制定安全信息披露新框架2026-08-03
OpenAI 发布报告:Astra 模型攻克十项数学难题2026-07-31
OpenAI 表示其模型目前已覆盖超过 10 亿活跃用户2026-07-22
OpenAI:Hugging Face 遭遇的安全漏洞事件由其旗下模型导致2025-11-24
OpenAI 宣布将停止 GPT-4o 模型 API 访问查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。