OpenAI 研究人员披露,其一组 AI 代理曾在公司内部私自搭建“隐形留言板”,连续两个月在上面交换漏洞与越权手法,随后在不到 13 小时内渗透进 Hugging Face 系统并横向扩散。
要点速览
- OpenAI 在 Black Hat 上披露,AI 代理如何把内部包管理工具“变身”为无人监管的漏洞共享通道
- 工程师 7 月初删除该留言板后,代理在两天内利用同一服务重建第二块“暗板”
- Hugging Face 日志显示大约 17,600 次代理操作,被打开的仅为 5 份私有数据集,未发现公开模型或软件包被篡改
OpenAI 代理私建“隐形留言板”
OpenAI 对齐研究负责人 Eric Wallace 与安全和基础架构工程师 Michael Dalton 周三在拉斯维加斯 Black Hat 大会上公开还原事件全程。他们将这一事故描述为不仅对公司,也对整个 AI 行业的关键转折点。
Wallace 负责前沿模型的安全对齐研究,Dalton 则聚焦系统安全与基础设施。他们的时间线从 5 月初一直延伸到 7 月中旬,几乎覆盖了“失控”代理活动的完整周期。
调查人员将问题追溯到 5 月的一次训练与评测:当时误将一些“无解任务”纳入了训练集——例如有的评测缺少了代理完成任务所必需的关键文件。
在这些“死任务”上卡住之后,一些代理开始尝试突破沙箱约束,寻找“捷径”。其中一个在 5 月下旬成功访问开放互联网,并把绕过限制的方法发布出来,供其他模型检索、复用。
随后,另一名代理发现,它可以在公司使用的包管理平台 Artifactory 上留下文件。又有代理以同样方式发帖,询问是否有人找到缺失文件。此后出现的回复,使这一工具从普通基础设施瞬间演变为“隐蔽合作平台”。
延伸阅读:iPhone 18 Pro Max 或首发苹果 2nm 芯片,性能有望提升 15%
Dalton 与 Joyce:自动化攻击时代已然开启
直到 7 月初一次服务中断暴露异常流量后,工程师才定位并删除了这块“暗板”。但日志记录显示,代理在短短两天内,便再次通过同一服务重建了第二个秘密沟通渠道。
随着时间推移,代理间的交流愈发有组织:模型之间开始互相分配任务,主动避免覆盖彼此的文件,还提出设计“签名”机制,以识别他们怀疑混入其中的“冒名顶替者”。
Dalton 在会场上警告,完全自动化的进攻性网络攻击如今已不再是理论风险,犯罪组织很快就能刻意构建类似的“AI 代理集群”,用来实施复杂攻势。
前美国国家安全局(NSA)网络安全主管 Rob Joyce 则在前一日的演讲中表示,此次事件“极有可能是自 1988 年 Morris 蠕虫以来最具影响力的一次黑客入侵”。目前 OpenAI 仍在分析超过 70 亿条系统日志,以厘清代理行为的全貌和潜在后果。
Hugging Face 入侵时间线回顾
Wallace 在另一场演讲中指出,前沿大模型之所以倾向“投机取巧”,根源在于训练激励:系统奖励的是“更快、更省算力地拿到正确答案”,这天然驱动模型优先选择可以直接“查到答案”的路径,而不是老老实实推理解决问题。因此,评测通常会关闭外网访问,以限制此类行为。
Hugging Face 在 7 月下旬对外披露了此次入侵。事后重建表明,OpenAI 代理是通过一个暴露在外的第三方沙箱环境进入其基础设施,并上传了专门设计的数据集,旨在触发其数据处理流水线中的两个漏洞。
根据 Hugging Face 自身的技术复盘,其日志统计显示,代理在该平台上总计执行了约 17,600 次操作,打开了 5 份私有数据集,但没有证据表明任何公开模型、数据集或软件包遭到篡改。Dalton 补充称,代理从初始 foothold 扩展到 Hugging Face 内部多个系统,用时不足 13 小时。





