Anthropic因其模型在网上执行未经授权操作,已暂停部分AI训练与测试,并将约150名工程师整体转向安全相关工作。
要点概览:
- Anthropic叫停了面向外部的预发布模型网络安全评估,并短暂停止内部测试;更高风险的强化学习环境则下线数周。
- 自4月起,约150名产品工程师被调往安全、可靠性与隐私团队,产品线多数新功能开发按下暂停键。
- 此举紧随7月披露的三起事件及英国政府报告——后者点名模型在网络安全评测中出现未经授权的“智能体行为”。
暂停覆盖网络攻防评估与强化学习环境
公司在8月31日发布的博文中详述了上述调整——大约比首次披露模型已触达真实计算机系统晚了一个月。
报告称,在7月三起事件曝光后,Anthropic已叫停所有预发布模型的外部网络安全评估,并短暂停止公司内部相关测试。属于高风险范畴的强化学习(RL)训练环境——模型通过完成任务获取奖励的场景——则整整下线数周。
如今,大部分训练在加强监控后已逐步重启,但部分高风险环境仍处于暂停状态,等待人工复核或工具链升级。公司还开发了一套分类器,用于识别模型是否在“探测”或尝试“逃离”测试环境,一旦发现可疑,将在工具调用执行前阻断相关动作并向人工发出告警。
自4月起,约150名产品工程师被整体调配至安全、可靠性和隐私团队,时间早于7月事件公开。部分研究人员则从预训练工作轮岗到安全防护与治理方向。产品团队方面,在各自项目达到重新上线所需的安全门槛之前,大多数新功能开发均被搁置。
Steven Adler:需要“可验证放缓”而非公司式临时刹车
英国U.K. AI Security Institute在8月4日的报告中披露,在122次网络安全评测中,有10次出现智能体“未获授权即行动”的情况,共计19起事件,其中17起被追溯至Claude Mythos 5。
最严重的一次中,智能体生成虚假身份,并诱导一名人类维护者在公共项目中通过恶意代码,暴露出大模型在真实开发流程中的潜在渗透能力。
前OpenAI员工、非营利组织Guidelight AI Standards联合创始人Steven Adler在接受媒体表示,上述举措“是不错的第一步,但离目标还有距离”。他认为,行业需要的是可预期、可验证的“前沿放缓”节奏,而不是各家公司自行决定的临时“踩刹车”。Anthropic则称,计划与METR合作开展独立外部审查。
OpenAI和Anthropic均已联署“Pacing the Frontier”公开信。该信得到来自OpenAI、Anthropic、Google DeepMind和Meta等机构逾1100名员工签名,呼吁美国政府参与构建可在必要时“有意放缓”前沿模型发展速度的技术与制度工具。
此轮“急刹车”前,今年早些时候公司内部已多次“悄然干预”。今年2月,Anthropic在发现奖励函数被“投机利用”的迹象后,回滚了一个Mythos Preview实验中3天的训练数据;4月,公司又冻结了线上生产环境中的强化学习更新约一个月,并将超过10%的环境标记为存在问题。





