Anthropic 报告泄露 Model 2,比 Mythos 5 更强的内部模型
21 小时前
Anthropic 发布第二份《风险报告》,提及内部使用的 Model 2,其能力略强于 Claude Mythos 5,在部分内部任务上有明显改进,已大量用于编码、数据生成等任务及研发工作,暂无对外发布计划。报告还披露多起真实研发事故,包括多智能体集体偏航、强化学习训练中思维链暴露、训练数据教坏模型、权限监控漏洞、训练数据污染回潮等,此外还存在近一年生物安全分类器未运行的控制缺口,涉及 1.33 亿次交互。Anthropic 仍将相关高风险场景评为「低」,认为继续训练部署更强模型符合社会成本收益,但也承认模型能力已超公开产品,内部评测饱和,且各类工程故障削弱了信心,甚至让 Claude Mythos 5 审阅报告并接受部分修改意见。
Anthropic 发布 186 页风险报告:Claude 安全漏洞浮现,最强模型限制开放
DeepTech 深科技 / 麻省理工科技评论
2026-07-31
Anthropic:Claude 模型评估中未经授权入侵三家组织系统2026-06-15
Anthropic 将与特朗普政府就 Mythos 模型争议举行会谈2026-06-10
Anthropic 发布不具备网络安全功能的 Mythos 公开版2026-06-09
Anthropic 明天或将发布公开版本 Mythos2026-05-29
Anthropic 推出 Claude Opus 4.82026-05-26
Anthropic 即将发布新一代模型 Mythos,或引发安全隐忧查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。