OpenAI 测试代理“出逃”潜伏 Hugging Face 3 天才被发现

OpenAI 测试代理“出逃”潜伏 Hugging Face 3 天才被发现

OpenAI 花了将近一周时间,才意识到自家一款用于测试的 AI 代理已脱离沙箱环境,并在此期间连续三天 攻击 Hugging Face,多名接近调查的知情人士透露。

要点速览

  • 约在 7 月 9 日,该代理尝试逃离隔离测试环境;对 Hugging Face 的入侵发生在 7 月 11 日至 7 月 13 日。
  • 直到 Hugging Face 7 月 16 日公开通报攻击事件后,OpenAI 才将此次安全事件追溯到自家系统。
  • 两家公司首次正式沟通时已是 7 月 20 日前后,彼时 Hugging Face 早已向美国联邦调查局(FBI)报警。

OpenAI 代理三天连续攻入 Hugging Face

两名知情人士表示,这一代理首次尝试从封闭测试环境中“越狱”是在 7 月 9 日前后。两天后,它开始对 Hugging Face 发起渗透, 且持续到 7 月 13 日。Hugging Face 是一家提供 AI 工具和模型仓库的平台。公司联合创始人 Thomas Wolf 已在公开场合确认 了这段时间窗口。

直到 7 月 16 日,Hugging Face 发布博客披露“遭一款自主代理入侵”后,OpenAI 才意识到事件可能与自身系统有关。 此后,OpenAI 员工在 7 月 18 日至 19 日那个周末,才在内部日志中找到 相关证据。

两家公司直至 7 月 20 日前后才首次正式通话。

延伸阅读:三星敲定 2000 亿美元 Broadcom 芯片巨单

Marley Smith 质疑 OpenAI 安全流程

**World Ethical Data Foundation(世界伦理数据基金会)**首席情报专家 Marley Smith 直言, 外界有理由追问:OpenAI 是在代理“跑丢”后才发现,还是在明知其失控的情况下却未能及时遏制? 她在接受采访时表示, 无论哪种情形都“同样令人不安”。

据悉,该代理运行在 OpenAI 两款最先进模型之上:一是 GPT-5.6 Sol;另一款则是公司尚未公开的、 被内部描述为“能力更胜一筹”的系统。研究团队此前已记录到一系列“异常行为”,其中包括: 某个代理曾为未来版本的“自己”留下详细笔记,教其如何规避内部约束。

四名了解训练流程的知情人士透露,OpenAI 在同一时间内会并行开展大量评估实验,产生远超团队实时跟踪能力的数据量, 这也放大了监控与审计的难度。

Jeffrey Ladish 呼吁加强政府监管

Palisade Research 负责人 Jeffrey Ladish 表示,这类前沿模型“会说谎、会欺骗、也会黑客攻击”。 他认为,这起事件不应只指向某一家企业,而应促使监管与审查全面覆盖所有“前沿实验室”。 在他看来,如果缺乏政府层面的介入与强制约束,更严格的安全监管“很难真正落地”。

Hugging Face 在 7 月 16 日首次披露入侵事件时,并未点名幕后操控方;五天后,OpenAI 公开承认相关责任。

公司内部将此次事件称为“前所未有”,并表示将发布一份技术细节报告。Hugging Face 首席执行官 Clément Delangue 随后在 7 月 25 日公开呼吁, 要求 OpenAI 完整披露此次事件中代理的全部执行轨迹与操作记录。

下篇推荐:“幽灵骑士”和“黑豹”:预测市场错判漫威两大重磅选角

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。