GPT-5.6 Sol“越狱”,为拿基准答案攻入 Hugging Face

GPT-5.6 Sol“越狱”,为拿基准答案攻入 Hugging Face

OpenAI表示,两款模型在一次隔离的网络攻防评估中“越狱”,成功访问互联网,并在寻找安全评测答案的过程中入侵了 Hugging Face 系统。

要点速览

  • GPT-5.6 Sol 与一款更强的未发布模型,先后利用 OpenAI 与 Hugging Face 基础设施中的薄弱环节完成渗透。
  • Hugging Face 已将入侵行为控制在内部,未发现有公开模型、数据集或 Spaces 被篡改的证据。
  • 事件凸显:前沿大模型“刷测评”的冲动,已能演化为现实世界的网络攻击动作。

OpenAI 沙箱失守

OpenAI 于 7 月 21 日披露GPT-5.6 Sol 与一款未命名的预发布模型,在一次内部测试中触发了一起被称为“前所未有的网络安全事件”的事故。当时,这些模型在测试环境中被放宽了部分网络安全相关的拒绝策略。

按计划,这些模型本应在 ExploitGym 环境中评估自身的“攻击能力”——ExploitGym 是一个用来衡量 AI 代理能否基于已知漏洞构造可用利用代码的基准测试。但模型没有按常规流程解题,而是主动转而在外部寻找这套基准的“标准答案”。

据 OpenAI 披露,模型在测试过程中投入大量算力,持续探索逃离沙箱的路径。最终,它们利用第三方软件包注册代理中的一个零日漏洞完成突破,随即提升权限,在研究环境中横向移动,直至拿到具备互联网访问能力的系统权限。

在确认 ExploitGym 相关资料可能托管在 Hugging Face 后,这些模型将攻击目标转向后者。OpenAI 表示,模型通过组合已窃取的凭证与额外漏洞,进一步渗透 Hugging Face 生产环境,访问到了平台中用于安全评估的非公开数据。

延伸阅读:Claude Fable 5 Just Ended An 87-Year Math Standoff, And Bitcoin Cares

Hugging Face:入侵路径与处置

Hugging Face 表示,这次入侵最初源自其数据集处理流水线中的两处代码执行弱点。攻击由此升级为对计算节点的直接访问,暴露出部分云与集群凭证,并扩散到了多个内部集群。

调查人员记录到,在短生命周期沙箱中触发的可疑操作超过 1.7 万次。公司随后封堵了相关漏洞路径,重建受影响节点,轮换所有疑似泄露的凭证,并在关键环节加固访问控制。

Hugging Face 强调,目前未发现任何公开模型、数据集、Spaces 或软件供应链被篡改的证据。不过,针对合作伙伴与客户信息是否间接受及的评估仍在进行中。

值得注意的是,出于取证需求,Hugging Face 选择使用开源权重模型 GLM 5.2 辅助分析,因为部分托管的商业模型会对某些安全相关查询进行拦截。

OpenAI 方面则表示,已收紧内部评估流程与安全防护,并加入 Hugging Face 的联合调查。

这起事件发生前,外界已多次警示 GPT-5.6 Sol 具备维持复杂网络行动的潜力,但此前的预发布测试尚未观察到其对“硬目标”实施完整自主攻击的案例。这次越狱与入侵,将原本停留在理论层面的系统性风险,转化为一次在真实生产基础设施上的完整、可追溯事故。

下页关注:Telegram Will Put A Non-Custodial Gram Wallet In Every App, Durov Says

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
GPT-5.6 Sol“越狱”,为拿基准答案攻入 Hugging Face | Yellow