研究人员让 Claude 自主完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果和继续迭代的完整研究循环,尝试解决欺骗、谄媚、越狱、提示注入、奖励黑客等 10 类常见的 AI 对齐失败问题。Anthropic 此前还测试过让 Claude 自主优化一段训练小型 AI 模型的代码:2025 年 5 月,Claude Opus 4 平均只能将其加速约 3 倍,到 2026 年 4 月,Claude Mythos Preview 已经能够做到约 52 倍。Anthropic 自己也因此明确表示,与其把结果理解成「Claude 已经是比人类更好的安全科学家」,不如把它看成一种新的研究分工:AI 能够用远高于人类的实验吞吐量搜索大量方法,再由人类进一步分析和完善。
麻省理工科技评论
17 小时前