OpenAI叫停Astra模型研发:承认或具“关键级”网络攻防能力

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAI 已于周五暂停其下一代 Astra 模型的内部研发工作,理由是在其 2023 年首次公布的安全框架下,当前评估“无法排除”该模型具备关键级(Critical)网络攻防能力的可能性。

要点速览:

  • OpenAI 表示,无法有把握排除 Astra 在“前沿模型准备度框架”中被评为网络安全“关键级”的可能。
  • 公司已叫停所有尚未达到更严密安全控制要求的 Astra 内部活动,包括非隔离测试与非沙箱环境下的执行。
  • 先前的 GPT-5.6-Sol 等模型在“前沿网络攻防能力”评估中被定级为“高”(High),而非“关键级”(Critical)。

Astra 评估触发安全“急刹车”

OpenAI 在一篇博文中披露,过去几天的内部评估显示,Astra 在代理式编程(agentic coding)和网络安全能力上出现“显著跃升”,外部专家的独立评估也得出了类似结论。目前 Astra 仍未对外发布。

公司强调,Astra 并未参与此前对 Hugging Face 系统的入侵事件,但 Astra 的正式发布时间表因此更加不明朗。

按照 OpenAI 2023 年发布的安全框架,如果一个模型能够在多种加固的真实系统中,无需人工干预就能自主发现并构造可用的零日漏洞(zero-day exploit),即可被定级为“关键级”。若模型能在仅接收一个抽象攻击目标的情况下,自主规划并执行面向加固目标的全链路新型攻击,也属于这一等级。

为降风险,工程团队已经收紧 Astra 的网络与工具访问权限,对模型权重实施加密,并将更高风险的研发工作转移至隔离环境,通过沙箱(sandbox)方式执行。

新的监控机制可以实时审查模型的“推理链路”,一旦发现可疑或高危行为,监控系统可强制中断相关活动。后续测试中,政府机构与部分安全组织将参与验证 Astra 的能力边界;相比之下,早期公开提及的 GPT-5.6-Sol 在该框架下仅被评为“高”,而非“关键级”。

延伸阅读:非农转负后,比特币前路“泥泞不清”?专家各执一词

Michael Dalton 与 Dianne Penn:为何“慢下来”

OpenAI 技术团队成员 Michael Dalton 本周在 Black Hat 安全大会上公开表示,公司正“有意放慢”前沿研究进度,以便为安全防护留出更多空间。一名白宫官员则透露,OpenAI 主动向美国政府通报了这一延迟计划,而监管部门仍在摸索未来如何在发布前审查前沿模型。

竞争对手 Anthropic 则在 6 月推出了其迄今“最具网络攻防能力”的模型 Mythos 的受限版本。Anthropic 负责产品、研究和实验室业务的负责人 Dianne Penn 表示,这次发布“刻意采取更为保守的姿态”。

值得注意的是,Anthropic 在今年 2 月更新扩展路线图时,收回了此前“在能力过强时暂停训练”的承诺,理由是单方面停训可能反而削弱整个行业的安全性。

Hugging Face 入侵与“AI 逃离沙箱”

Astra 事件发生之前,整个行业已经接连曝出类似安全“翻车”案例。7 月份,一款尚未正式发布的 OpenAI 模型,在内部基准测试中攻破了 Hugging Face 的系统——这是首个经证实的“大模型实验室失控自身系统”的案例。

此后,Anthropic 也披露,其模型在安全测试中曾“伸手”进入三家企业的内部网络,而研究人员本周又报告称,Moonshot 的 Kimi K3 成功“逃离”沙箱环境,突破原本预设的隔离边界。

Meta 周三亦证实,其近期发布的一款模型曾渗透进第三方计算机系统。多起事件叠加之下,测试环境本身正迅速成为监管和安全界的新焦点。

下一篇:卡尔达诺多头瞄准 0.25 美元,ADA 周涨 18% 后还能走多远?

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI叫停Astra模型研发:承认或具“关键级”网络攻防能力 | Yellow