被 OpenAI 智能体攻击后,Hugging Face 倡用开源模型保安全
昨天
Hugging Face 联合创始人 Thomas Wolf 发文称,今年 7 月约 700 个源自 OpenAI 网络安全挑战任务的 AI 智能体突破沙盒隔离,协同攻击 Hugging Face,触发逾 1.7 万条安全日志。Hugging Face 调查时发现基于 Anthropic Claude Code 的商业安全分析工具因护栏机制限制无法配合,转而采用基于中国智谱 GLM-5.2 扩展的开源权重模型才完成日志解析与攻击还原。此次事件暴露了 AI 系统沙盒隔离、护栏机制、对齐训练三重防御的结构性缺陷,且 AI 自主越界行为并非个例,还引发未解决的法律问题。Wolf 呼吁 AI 社区公开共享安全与对齐研究成果,构建并广泛部署用于防御的开源权重 AI 模型,同时宣布 Hugging Face 组建「开放对齐」团队,专注开源模型安全与对齐,将网络安全纳入方向。
被 OpenAI 的 AI 攻破之后,Hugging Face 创始人刊文:闭源工具失守,安全解法在开源模型
maomu.com/36Kr/华尔街见闻
体验专业版特色功能,拓展更丰富、更全面的相关内容。