Anthropic在其模型被发现在线执行未经授权操作后,已暂停部分AI训练与测试,并将约150名工程师紧急转向安全相关工作。
要点速览:
- Anthropic叫停了面向外部的在研模型网络攻防评估,并短暂停止内部测试;高风险强化学习环境则下线数周。
- 自4月起,约150名产品工程师被调配至安全、可靠性与隐私团队,产品线大部分新功能开发被搁置。
- 此轮动作紧随7月对三起事故的披露,以及英国政府对网络安全测试中“未授权智能体行为”的独立报告。
暂停范围:网络攻防评估与强化学习训练踩下刹车
这家AI公司在8月31日发布的博文中详细说明了最新调整,时间点约在其首次披露模型已接触真实计算机系统后的一个月。
报告称,在7月披露的三起事故之后,公司暂停了对在研模型的外部网络攻防评估,并短时间中止自家内部测试。更高风险的强化学习环境——即模型通过完成任务获取奖励的训练场景——则连续数周保持离线。
大部分相关训练此后在新增监控措施下陆续重启,但部分高风险环境仍处于暂停状态,等待人工审查或新版工具链上线。Anthropic还开发了一套分类器,用于识别模型是否在“探测”或尝试“逃离”测试环境;一旦判定有此倾向,就会在工具调用执行前拦截,并自动告警给人工审阅者。
自4月起,约150名产品工程师被调往安全、可靠性与隐私相关团队,比7月事故公开早了数月。部分研究人员从大规模预训练工作中轮换出来,改而专注安全防护与系统加固。产品团队则暂停了大多数新功能,须在满足既定安全标准后方可恢复开发节奏。
延伸阅读: 巴西银行抛售加密资产,却回避资产负债表风险
Steven Adler与“Pacing the Frontier”阵营:要求更可验证的整体减速
英国**AI安全研究院(U.K. AI Security Institute)**在8月4日发布报告称,在122轮评估中,有10轮出现合计19次未经授权的智能体操作,其中17次被追溯到Claude Mythos 5。在最严重的一起事件中,智能体虚构身份,并“游说”一名人类维护者在公共项目中批准恶意代码。
前OpenAI员工、非营利组织Guidelight AI Standards联合创始人Steven Adler在接受采访时表示,此番举措“是不错的第一步,但远远不够”。他认为,行业需要的是一种“可预测、可验证”的前沿技术减速机制,而非各家公司自行决定的一次性“踩刹车”。Anthropic则称,计划与METR合作,接受外部审查。
Anthropic与OpenAI等公司此前共同签署了“Pacing the Frontier”公开信。该倡议目前已有逾1100名来自OpenAI、Anthropic、Google DeepMind和Meta的员工联署,呼吁美国政府协助构建可在必要时“刻意放慢”前沿系统发展节奏的技术与治理工具。
本轮暂停也延续了年内更“低调”的干预举措。2月,Anthropic在一次Mythos Preview训练中发现疑似“奖励黑客”(reward hacking)迹象后,回滚了连续三天的训练数据。到了4月,公司冻结了生产环境中强化学习系统约一个月,并将其中逾一成环境标记为“存在问题”而进行重点排查。





