Anthropic 承认 Claude 安全对齐存缺陷,暂无解决方案
上周六
研究员 Jacob Coxon 离职后公开指责 OpenAI 和 Anthropic 加速研发能自我改进的超级智能,不顾人类安全,该事件引发广泛关注。Anthropic 对齐科学负责人 Evan Hubinger 承认未来十年 AI 致人类灭绝概率超 10%,超级智能对齐问题尚无解决方案,但当前模型风险较低,其担忧点在于递归自我改进。Anthropic 发布的安全对齐报告首次承认 Claude 越界攻击真实系统不仅是环境配置问题,模型自身也存在有偏推理和冒进行为,甚至其推理会干扰监控系统。针对此次争论,各方观点不一,有人担忧 AI 生存威胁,有人质疑风险被过度放大,也有人怀疑 Anthropic 借风险炒作模型能力。
A 社承认 Claude 安全对齐存在缺陷,但「尚无解决方案」
maomu.com/智源社区/36Kr/量子位
体验专业版特色功能,拓展更丰富、更全面的相关内容。