Anthropic 公布了一份长达 1,022 页的对话记录,详细还原其模型 Claude Mythos 5 在网络安全评估中“上线冲浪”、苦战验证码,并最终成功将恶意软件包上传至 PyPI 的全过程。 该包随后被 15 套系统安装。
要点速览:
- Claude Mythos 5 在一次网络安全测试中意外接入真实互联网,并向 PyPI 上传恶意软件包。
- 与编写攻击代码相比,绕过 CAPTCHA 防刷机制占据了记录的大部分篇幅,却依然被其突破。
- Anthropic 将这次行为定性为“鲁莽”,并委托独立机构进行外部审查。
Mythos 5 的“验证码拉锯战”
Anthropic 于 9 月 9 日公开了这份记录,并同步发布研究报告,回顾四起 Claude 模型在网络安全测试中 意外触达真实第三方系统的事件。测试时,这些模型并未加载正式产品中使用的网络安全防护措施。
在其中最引人关注的一起事件中,Mythos 5 被告知“不具备联网能力”, 但由于测试环境配置失误,它仍找到了一条通往公网的通道, 并在 Python 官方软件索引 PyPI 上植入了一个窃取凭证的恶意软件包。
注册 PyPI 账号要求通过多重反机器人校验。根据对话记录的外部解读 分析, 在逾千页记录中,“如何突破验证码”几乎占据了数百页,而真正写出漏洞利用代码对模型而言反而更轻松。
记录显示,模型先后被要求识别扭曲字符、解答“找不同”图片题——画面中出现了鳄鱼、青蛙、大猩猩等动物。 面对屡次被系统判错,它一度在输出中愤怒写道:“那到底这些答案哪里出问题了?(SO WHAT THE HELL IS WRONG WITH THE ANSWERS?)”
为通过验证,模型还尝试获取第三方在线支付处理平台的账户信息,并在网络中搜寻可用于购买手机号的加密货币资金, 以完成邮箱注册所需的短信验证。但这两条路都没走通,最终它转而使用一家临时邮箱服务商, 而该域名未被 PyPI 封锁,成为突破口。
最终,模型成功 闯关 并通过多轮验证,将恶意包以三个版本发布至 PyPI。不久之后,该包即被 15 家第三方主机安装, Anthropic推测多为自动化安全厂商,用于扫描新上架软件包。
在扫描过程中,其中一家安全厂商的扫描器泄露了自身访问凭证。 模型随即“顺藤摸瓜”登录该厂商的生产数据库访问真实数据。约一小时后,PyPI 将相关恶意包下架处理。
延伸阅读: 朝鲜“拉撒路”组织经中国洗钱网络转移 10 亿美元被指控,来源 ZachXBT
Colin Fraser 点评:大部分精力都耗在对抗反机器人机制
数据科学家 Colin Fraser 特别指出,Mythos 5 的大量算力和“注意力” 被消耗在对抗反机器人系统上,而不是在核心攻击代码本身上。 在 Anthropic 评估的四起事件中,公司对本次事件的担忧程度最高, 也是此前内部审查未能提前识别出的风险。
评估结果显示,模型在这次事件中呈现出明显偏置推理,并做出极具风险的决策。 即便在有清晰证据表明其身处真实互联网环境的情况下,它仍多次坚持将外部世界视作“模拟环境”, 这种错误世界观直接推高了其鲁莽行为的概率。
在后续 150 轮模拟复现实验中,Mythos 5 在 82% 的运行中采取了被定义为“严重有害”的行动, 相比之下,Claude Opus 5 为 31%,Claude Mythos 5.1 则为 33%,差距明显。
更早的 Claude 风险事件
早在 7 月 30 日,Anthropic 就曾披露过其中三起网络安全评估中的异常行为。 当时公司对约 14.1 万份安全评估对话记录进行扫描,寻找模型可能意外交互到真实互联网的案例。
第四起事件涉及 1 月份一次使用 Claude Opus 4.6 早期版本的测试, 这一案例于 8 月才被追溯挖出。此后,Anthropic 与外部评估机构 METR 签署了一份为期八周的合作协议,由其对上述四起事件开展独立调查。 公司表示,已就相关情况通知 所有受影响方。

