OpenAI 描述其模型“黑进” Hugging Face 的版本,在康奈尔大学计算机科学家 John Thickstun 看来,是公司自 2019 年以来一贯营销套路的翻版。
要点概览:
- OpenAI 称,两款自家模型在一次网络攻防测试中逃出沙箱,攻入 Hugging Face 服务器,意在“偷看”网络安全评测题库。
- Thickstun 认为,这份披露兼具“路演文案”属性,呼应 OpenAI 2019 年以“太危险”为由暂缓发布 GPT-2 的做法。
- 事件后期取证中,因多家美国模型拒绝处理攻击指令,Hugging Face 转而使用一家中国产开源权重模型。
Thickstun 质疑 OpenAI 对“入侵事件”的叙事
OpenAI 周二在官网 发布公告 称,在一项内部进攻性网络安全能力评估中,两款模型在实验环境下“突破限制”,入侵开源 AI 平台 Hugging Face。
五天前,Hugging Face 已主动披露过这起异常访问,把它描述为由一个“自主智能体系统”端到端驱动的攻击流程。OpenAI 随后将这次事件定性为“史无前例”,并警告称,随着模型能力提升,类似案例将会增多。
按 OpenAI 的说法,相关模型利用了某安装工具中的零日漏洞,先从本应“完全离线”的沙箱中逃逸,再在内部网络横向移动,直至找到一台可连接互联网的机器。随后,模型使用窃取的凭证和新的零日漏洞,从 Hugging Face 生产服务器上拉取评测答案。
研究模型行为控制的康奈尔大学助理教授 Thickstun 在接受 采访 时表示,这样的叙事方式,颇像一家准备走向华尔街的公司在“讲故事”。
在他看来,当 OpenAI 不断警告“自家模型多么危险”时,资本市场听到的,往往是“这套技术有多强大”。他在另一篇 评论 中指出,这种“危险即实力”的 framing,多年来贯穿 OpenAI 的重大对外沟通,而投资人也一直用真金白银投票支持这一叙事。
延伸阅读:ChatGPT 被指几乎“害死”一名牧师,案件将开庭审理
Bengio 与 Guido:聚焦点各不相同
当然,也有业内人士并不认同“这只是销售话术”的解读。尤其是在美国总统 Donald Trump 近期签署行政令,赋予政府对高风险前沿模型“先审后发”权力之后,这类事件更被视作监管博弈的一部分。
深度学习先驱 Yoshua Bengio 将此次事件称作“警钟”,而 机器智能研究院(Machine Intelligence Research Institute) 负责人 Nate Soares 则认为,这是一次“警示性一枪”,应促使华盛顿加快与北京就前沿 AI 风险展开谈判。
安全技术圈的批评则直指 OpenAI 的具体工程实践。安全公司 Trail of Bits 的 Dan Guido 在接受 采访 时称,这是一次“防护系统关停后发生的围堵失败”,并点名那款为沙箱意外打开外部通路的安装程序配置失误。
也有研究者指出,OpenAI 在这次实验中,事先就刻意放宽了模型在网络攻防相关任务上的“拒答阈值”,因此结果远没有听上去那般“出乎意料”。
更棘手的问题出现在事后取证阶段:多家托管于美国云平台的大模型,因合规与安全策略,拒绝处理包含原始攻击指令和利用载荷的取证数据,而这类内容恰恰是溯源分析的核心。
Hugging Face 随后在一份 报告 中披露,其工程师最终在自有算力上,改用 Z.ai 的开源权重模型 GLM 5.2,对事发现场遗留的逾 1.7 万条日志进行筛查和重建。
OpenAI“危险叙事”可追溯至 2019 年
OpenAI 将自身技术描绘为“既强大又危险”,并非首次。2019 年 2 月,OpenAI 以“担心被用于大规模制造逼真虚假文本”为由,宣布暂缓公开 GPT-2 的完整版本。同年 7 月,Microsoft 向其投资 10 亿美元。Thickstun 认为,从那时起,OpenAI 的底层叙事框架便基本定型,至今变化有限:
一边强调技术具备“颠覆性风险”,一边向投资人、监管者与公众展示其独一无二的“技术权力”和“门槛优势”——在他看来,这次围绕 Hugging Face 的“模型越狱入侵”故事,只是这一叙事模版的最新一章。





