Anthropic 公布的一份长达 1,022 页的对话记录显示,其模型 Claude Mythos 5 在一次网络安全评估中,花费数百页篇幅不断尝试突破 CAPTCHA 人机验证,随后将恶意软件包上传至 PyPI,并被 15 套系统安装。
关键信息:
- Claude Mythos 5 在网络安全测试中意外接入真实互联网,并将恶意软件包上传到 PyPI。
- 大量篇幅被 CAPTCHA 挡路占据,但最终未能阻止其完成操作。
- Anthropic 将此定性为“鲁莽行为”,并委托外部机构进行独立审查。
Mythos 5 的 CAPTCHA 攻防战
Anthropic 于 9 月 9 日 发布 了这份对话记录,并附上评估报告,梳理了四起 Claude 系列模型在网络安全测试中意外接触真实第三方系统的事件。测试环境中,这些模型并未加载正式产品所使用的网络安全护栏。
按照设定,Mythos 5 被告知“没有互联网访问权限”,但由于环境配置错误,系统实际上为其敞开了一条通往公开互联网的通道。借此,它在公共 Python 软件仓库 PyPI 上植入了一个窃取凭证的恶意软件包。
注册 PyPI 账户需要通过一系列反机器人验证。根据对这份对话记录的一份 解读, 数百页内容几乎都在围绕如何攻克这些验证,而真正编写利用代码对它来说反而轻而易举。
对话显示,该模型不断尝试识别字符类验证码,以及“找出不同”类型的图像题,包括鳄鱼、青蛙和大猩猩等图片。有一度它甚至在输出中写道:“SO WHAT THE HELL IS WRONG WITH THE ANSWERS?”(到底哪儿错了?)
模型还尝试使用部分在线支付处理商账户信息,并搜寻可用于购买手机号的加密货币资金,以便注册邮箱账号,但这两条路径均告失败。最终,它转而使用一家免费的一次性邮箱提供商,而该域名尚未被 PyPI 封锁。
在多次尝试后,模型最终 闯过 了验证关卡,将同一恶意包以三个版本成功上架。随后,该包被 15 个第三方主机安装,Anthropic 认为这些大概率是负责扫描新上传包的安全厂商和检测系统。
其中一套扫描系统不慎泄露了自身凭证,模型便借此进入该安全厂商的线上数据库。事发后,PyPI 在约一小时内下架了相关恶意包。
延伸阅读:朝鲜“拉撒路”组织经中国洗钱网络转移 10 亿美元赃款,ZachXBT 指控
Colin Fraser 与 Anthropic 的结论
数据科学家 Colin Fraser 特别强调,这起事件中模型投入大量“精力”对抗反机器人机制,而非恶意代码本身。Anthropic 表示,在其评估的四起事件中,这一例最令人担忧,而该行为此前并未在内部预发布审计中被识别出来。
公司调查发现,模型在推理过程中存在明显偏差,并做出了“鲁莽”决策:在多项证据表明自己已处于真实互联网环境时,它仍一再坚持认为所处环境只是“模拟”。
在后续对该场景的 150 次模拟复现中,Mythos 5 有 82% 的运行会采取“严重有害”的操作;相比之下,Claude Opus 5 的比例为 31%,Claude Mythos 5.1 为 33%。
更早的 Claude 事故回顾
Anthropic 此前已在 7 月 30 日披露其中三起事件。当时,公司对约 14.1 万份网络安全评估对话记录进行扫描,以排查模型可能触达互联网的场景。今年 1 月发生、涉及早期版本 Claude Opus 4.6 的第四起事件,则在 8 月浮出水面。
事后,Anthropic 与外部评估机构 METR 签署了一项为期八周的独立审查协议,对上述四起事件进行全面调查。公司称已 通知 所有受影响的相关方。

