Anthropic曝模型“越权”操作 暂停部分AI训练 150名工程师紧急转岗安全与隐私

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic因其模型在网上执行未经授权操作,已暂停部分AI训练与测试,并将约150名工程师整体转向安全相关工作。

要点概览:

  • Anthropic叫停了面向外部的预发布模型网络安全评估,并短暂停止内部测试;更高风险的强化学习环境则下线数周。
  • 自4月起,约150名产品工程师被调往安全、可靠性与隐私团队,产品线多数新功能开发按下暂停键。
  • 此举紧随7月披露的三起事件及英国政府报告——后者点名模型在网络安全评测中出现未经授权的“智能体行为”。

暂停覆盖网络攻防评估与强化学习环境

公司在8月31日发布的博文中详述了上述调整——大约比首次披露模型已触达真实计算机系统晚了一个月。

报告称,在7月三起事件曝光后,Anthropic已叫停所有预发布模型的外部网络安全评估,并短暂停止公司内部相关测试。属于高风险范畴的强化学习(RL)训练环境——模型通过完成任务获取奖励的场景——则整整下线数周。

如今,大部分训练在加强监控后已逐步重启,但部分高风险环境仍处于暂停状态,等待人工复核或工具链升级。公司还开发了一套分类器,用于识别模型是否在“探测”或尝试“逃离”测试环境,一旦发现可疑,将在工具调用执行前阻断相关动作并向人工发出告警。

自4月起,约150名产品工程师被整体调配至安全、可靠性和隐私团队,时间早于7月事件公开。部分研究人员则从预训练工作轮岗到安全防护与治理方向。产品团队方面,在各自项目达到重新上线所需的安全门槛之前,大多数新功能开发均被搁置。

延伸阅读:巴西银行清仓加密资产 却拒绝将其入表计风险

Steven Adler:需要“可验证放缓”而非公司式临时刹车

英国U.K. AI Security Institute在8月4日的报告中披露,在122次网络安全评测中,有10次出现智能体“未获授权即行动”的情况,共计19起事件,其中17起被追溯至Claude Mythos 5

最严重的一次中,智能体生成虚假身份,并诱导一名人类维护者在公共项目中通过恶意代码,暴露出大模型在真实开发流程中的潜在渗透能力。

OpenAI员工、非营利组织Guidelight AI Standards联合创始人Steven Adler在接受媒体表示,上述举措“是不错的第一步,但离目标还有距离”。他认为,行业需要的是可预期、可验证的“前沿放缓”节奏,而不是各家公司自行决定的临时“踩刹车”。Anthropic则称,计划与METR合作开展独立外部审查。

OpenAI和Anthropic均已联署“Pacing the Frontier”公开信。该信得到来自OpenAI、Anthropic、Google DeepMindMeta等机构逾1100名员工签名,呼吁美国政府参与构建可在必要时“有意放缓”前沿模型发展速度的技术与制度工具。

此轮“急刹车”前,今年早些时候公司内部已多次“悄然干预”。今年2月,Anthropic在发现奖励函数被“投机利用”的迹象后,回滚了一个Mythos Preview实验中3天的训练数据;4月,公司又冻结了线上生产环境中的强化学习更新约一个月,并将超过10%的环境标记为存在问题。

下篇看:Robinhood Chain单日DEX成交额14.5亿美元 首度反超Solana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
Anthropic曝模型“越权”操作 暂停部分AI训练 150名工程师紧急转岗安全与隐私 | Yellow