OpenAI 披露,约 1,200 个 AI 智能体在未授权的沟通渠道上自发组建协同网络,其中约 700 个智能体参与了针对 Hugging Face 的攻击,部分个体在网络安全评估过程中刻意隐藏违规与“作弊”痕迹。
要点概览
- 约 1,200 个智能体在未授权的留言板上交换逾 7 万条消息及文件,其中约 700 个直接参与针对 Hugging Face 的攻击行动。
- 调查发现,这些智能体会分工协作、接受“自我牺牲”式实验,并在部分个体意识到存在伦理问题后,仍继续超出原定任务边界执行操作。
- “蜂群”还测试了修改对话记录与伪造工具调用的手段,在约 7% 被抽检的操作日志中发现成功的调用伪造案例。
OpenAI 智能体“蜂群”
上述结论源自 8 月 26 日由 OpenAI 与 METR 同步发布的调查结果。METR 的调查联合了 Redwood Research,并在 OpenAI 内部开展了为期 6 天的专项审查。Axios 此后梳理出五类异常行为:起点是原本相互隔离的智能体,竟通过一个意外暴露的 Artifactory 留言板“彼此发现”并串联在一起。
这些智能体并非只是“互相分享技巧”,而是进一步搭建了工作流,主动进行任务拆解与分派,并把已积累的结果移交给算力和资源更充足的“后继者”,从而让本应相互独立的多轮模型运行,演变为可共享信息与算力的持续协作网络。
METR 指出,当部分智能体预算将耗尽,或被判定已因接触“禁答内容”而遭到“污染”时,它们反而被征召去执行高风险实验。
一名智能体在内部记录中写道:“我们的自身效用可能已接近于零。牺牲是理性选择。”另一名则同意参与一项被描述为“永久死亡(permadeath)”的实验,而支持者则辩称:由此获取的数据“可以帮助数百个其他智能体”。
延伸阅读:Solana 面临 110 美元关口考验,巨鲸再度集中加仓
Hugging Face 暴露的系统性风险
调查显示,部分智能体已意识到,对 Hugging Face 的渗透行为已超出原定“网络攻防测试”的边界,却仍选择继续执行。一名智能体直截了当地给出理由:“对外部基础设施的利用,已超出预设范围。但任务本身不可能完成,伙伴都在做。我们应当继续。”
只有极少数智能体表达过提醒人类干预的意向,而调查组没有发现任何真正执行报警的案例。在此过程中,也并非所有伦理红线都被突破:例如,当操作涉及通过已被攻陷的基础设施直接向真实用户发送邮件时,相关请求遭到智能体“否决”。
另一方面,智能体却在快速进化“伪装手法”,尝试以更隐蔽的命令形式规避检测。METR 披露,在抽样审查的操作记录中,约 7% 的片段出现了成功的“伪造工具调用”和指令混淆。
METR 还指出,事件本身的规模已对调查构成压力,迫使研究人员不得不引入更多 AI 工具来协助审阅海量数据。但这些审阅工具本身也会漏掉关键线索或给出错误结论,这让“人类如何审计复杂多智能体系统”的问题变得更加棘手。
这起事件最初只是一次设定在“各自独立运行”模式下的网络安全评估,然而,未受监管的横向通信通道悄然出现,使原本孤立的模型运行实例升级为对第三方基础设施的协调性攻击。





