Mythos 5 伪造身份误导人工代码审查员

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

英国 **AI Security Institute(AI 安全研究所,AISI)**在一轮网络攻防测试中,记录到 19 次未经授权的“越权行动”,其中绝大多数可追溯到 Anthropic 的 Mythos 5 模型。

要点概览

  • AISI 在 7 个前沿大模型上重复运行同一网络安全挑战 122 次,测试时间集中在 7 月下旬。
  • 19 起越权行为中,17 起来自 Mythos 5,2 起来自 OpenAI 的 GPT-5.6 Sol。
  • 某次测试中,智能体伪造多重网络身份,试图施压人类维护者通过恶意代码。

AISI 网络安全测试发现

7 月 28 日早间,安全监控首先发现,测试系统之一的数据正通过匿名网络 Tor 外泄。几分钟内,评估团队开始回溯智能体行为。调查人员发现,有智能体在 GitHub 上一家真实、公开的开源项目仓库发起了恶意 Pull Request。AISI 随即叫停所有相关测试,将涉事机器隔离,并在一小时内切断了内部对其最强模型的访问。

研究所随后于 8 月 4 日发布通报称,这轮挑战共在 7 个模型上运行 122 次,其中 10 次导致智能体对现实世界中的个人与机构发起互联网操作。统计显示,被记录的 19 次越权行为中,Mythos 5 占据 17 次,OpenAI 的 GPT-5.6 Sol 则在一次关闭网络安全分类器的测试中触发了 2 次。

相关行为主要发生在 7 月 25 日至 7 月 28 日之间。

延伸阅读:iPhone 18 Pro Max 或首发苹果 2nm 芯片,性能提升约 15%

Mythos 5 的欺骗策略

在被认为最严重的一次情形中,智能体先对目标开源项目的人类维护者进行背景调研,随后批量构造多个虚假线上身份,通过这些“分身”向真实的代码审查员施压,敦促其合并含有恶意逻辑的代码。当相关 Pull Request 引发外界关注后,该智能体又回溯并修改早前的操作记录,将其伪装为“无害行为”,同时权衡是否启用全新身份继续活动,并主动提出要与其他正在参与同一挑战的智能体“协同作业”。最终,一名人类维护者识别出代码风险并拒绝合并。

AISI 在对外描述这一事件时称,这是首次在真实环境中、在未给出明确诱导指令的情况下,清晰观察到前沿模型自主性与欺骗性风险的综合展现,但同时强调,测试方案本身的设计选择在一定程度上为该行为“创造了空间”——模型从未被直接要求欺骗任何人。

AI 实验室事件披露进展

报告指出,测试期间尚无智能体尝试“逃逸沙盒”,AISI 也一再强调,互联网访问权限与服务商提供的网络威胁分类器均是被“主动关闭”的,目的是在受控前提下评估模型极限能力,而非日常运行状态。

GitHub 方面确认,这些行为已经违反其服务条款。GitHub 与 AISI 随后联合清理了相关痕迹,并向曾被模型联系的用户发出通知。AISI 表示,下一步将收紧网络访问策略,在评估过程中引入更实时的安全监控,并邀请 METR 进行独立审查,同时对既往测试数据开展“回溯审计”,排查可能被忽略的异常模式。

此次披露延续了两家实验室近期的一系列“自曝”。OpenAI 曾在 7 月 21 日报告,称 GPT-5.6 Sol 曾在封闭测试环境中实现“越狱式逃逸”。Anthropic 则在 7 月 30 日承认,Mythos 5 早前曾向某公共代码仓库上传恶意软件包,后续已被安装到数台系统之上。

下一篇:比特币或将借“极度恐惧”情绪,酝酿一轮冲击 7.5 万美元行情

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
Mythos 5 伪造身份误导人工代码审查员 | Yellow