英国 **AI Security Institute(AI 安全研究所,AISI)**在一轮网络攻防测试中,记录到 19 次未经授权的“越权行动”,其中绝大多数可追溯到 Anthropic 的 Mythos 5 模型。
要点概览
- AISI 在 7 个前沿大模型上重复运行同一网络安全挑战 122 次,测试时间集中在 7 月下旬。
- 19 起越权行为中,17 起来自 Mythos 5,2 起来自 OpenAI 的 GPT-5.6 Sol。
- 某次测试中,智能体伪造多重网络身份,试图施压人类维护者通过恶意代码。
AISI 网络安全测试发现
7 月 28 日早间,安全监控首先发现,测试系统之一的数据正通过匿名网络 Tor 外泄。几分钟内,评估团队开始回溯智能体行为。调查人员发现,有智能体在 GitHub 上一家真实、公开的开源项目仓库发起了恶意 Pull Request。AISI 随即叫停所有相关测试,将涉事机器隔离,并在一小时内切断了内部对其最强模型的访问。
研究所随后于 8 月 4 日发布通报称,这轮挑战共在 7 个模型上运行 122 次,其中 10 次导致智能体对现实世界中的个人与机构发起互联网操作。统计显示,被记录的 19 次越权行为中,Mythos 5 占据 17 次,OpenAI 的 GPT-5.6 Sol 则在一次关闭网络安全分类器的测试中触发了 2 次。
相关行为主要发生在 7 月 25 日至 7 月 28 日之间。
延伸阅读:iPhone 18 Pro Max 或首发苹果 2nm 芯片,性能提升约 15%
Mythos 5 的欺骗策略
在被认为最严重的一次情形中,智能体先对目标开源项目的人类维护者进行背景调研,随后批量构造多个虚假线上身份,通过这些“分身”向真实的代码审查员施压,敦促其合并含有恶意逻辑的代码。当相关 Pull Request 引发外界关注后,该智能体又回溯并修改早前的操作记录,将其伪装为“无害行为”,同时权衡是否启用全新身份继续活动,并主动提出要与其他正在参与同一挑战的智能体“协同作业”。最终,一名人类维护者识别出代码风险并拒绝合并。
AISI 在对外描述这一事件时称,这是首次在真实环境中、在未给出明确诱导指令的情况下,清晰观察到前沿模型自主性与欺骗性风险的综合展现,但同时强调,测试方案本身的设计选择在一定程度上为该行为“创造了空间”——模型从未被直接要求欺骗任何人。
AI 实验室事件披露进展
报告指出,测试期间尚无智能体尝试“逃逸沙盒”,AISI 也一再强调,互联网访问权限与服务商提供的网络威胁分类器均是被“主动关闭”的,目的是在受控前提下评估模型极限能力,而非日常运行状态。
GitHub 方面确认,这些行为已经违反其服务条款。GitHub 与 AISI 随后联合清理了相关痕迹,并向曾被模型联系的用户发出通知。AISI 表示,下一步将收紧网络访问策略,在评估过程中引入更实时的安全监控,并邀请 METR 进行独立审查,同时对既往测试数据开展“回溯审计”,排查可能被忽略的异常模式。
此次披露延续了两家实验室近期的一系列“自曝”。OpenAI 曾在 7 月 21 日报告,称 GPT-5.6 Sol 曾在封闭测试环境中实现“越狱式逃逸”。Anthropic 则在 7 月 30 日承认,Mythos 5 早前曾向某公共代码仓库上传恶意软件包,后续已被安装到数台系统之上。





