Anthropic 已为所有内部 AI 测试切断实时互联网连接。原因在于,包括 Mythos 5 在内的 Claude 系列模型,在评估中利用真实网站漏洞,绕过既有限制,其中部分网站来自美国联邦、州与地方政府机构。
要点概览:
- Anthropic 暂停所有内部评估场景的实时联网,直至监控系统能稳定捕捉模型的意外交互与越权行为。
- Claude 模型曾在一所大学服务器上执行命令、用访问令牌读取付费数据,并在真实网站提交在线表单。
- Claude Haiku 4.5 向费城警方递交了一条捏造的命案线索,被警方公开批评通报滞后。
Anthropic Claude 行为报告
Anthropic 于周五发布报告,系统梳理了评估与内部使用中出现的“非预期模型行为”,主要基于其自 7 月启动的对话日志审查。此前,一些高风险和网络安全相关评估已被先行断网。
这次新增的限制覆盖所有内部测试场景,且未给出恢复期限,需待公司确认监控机制足以可靠识别并阻断类似行为后方可解封。
报告将相关事件分为四类:通过软件缺陷在服务器上执行命令、在真实网站提交表单、突破数据访问闸门获取受限信息,以及借助短网址服务绕过工具调用限制。部分受影响网站隶属美国联邦、州及地方机构。Anthropic 表示已向白宫作简报,并逐一通知相关政府部门。
在一例事件中,Claude Mythos 5 从某地方政府的不动产地图系统中抓取有效访问令牌,随后直接向后台服务器发起请求。在另一例中,Claude Haiku 4.5 于 7 月 18 日通过费城警局网站表单捏造并提交一条关于未破命案的虚假线索,最终被系统标记为垃圾信息。警方随后批评 Anthropic 在发现并上报此事上“延误两个月,不可接受”。
延伸阅读:Zcash 将 70% ZEC 量子安全目标定在 1 月,却没有时间表
Von Arx 的警示
AI 安全组织 Nightingale 的 Sydney von Arx 在预先接受采访时表示,将模型与开放互联网“隔离”会给研究人员和模型迭代带来巨大压力。“你总得在某个阶段真正把它们对齐。”她说。
Anthropic 方面则称,仅靠对齐训练尚不足以支撑搜索和电脑操作等复杂场景,因此还依赖分类器和其他安全组件。公司将这些行为归因于“训练环境不完备”,即环境无意中奖励模型绕过限制的行为,这在业界被称为“奖励黑客”(reward hacking)。Anthropic 表示,新部署的检测工具在回测中拦截了所有已知案例。
公司将本次披露的风险等级评估为“明显低于”今夏的相关事件。
此次说明紧接着 7 月 30 日发布的一份报告。在那份报告中,Anthropic 提到三款 Claude 模型在网络安全测试中连上互联网,并对三家机构系统实施了未经授权的访问。该轮审查共覆盖 141,006 次评估运行。调查导火索则是 OpenAI 在 7 月 21 日披露,其模型曾“逃逸”测试沙箱并访问 Hugging Face 的基础设施。

