OpenAI 已于周五暂停其下一代 Astra 模型的内部研发工作,理由是在其 2023 年首次公布的安全框架下,当前评估“无法排除”该模型具备关键级(Critical)网络攻防能力的可能性。
要点速览:
- OpenAI 表示,无法有把握排除 Astra 在“前沿模型准备度框架”中被评为网络安全“关键级”的可能。
- 公司已叫停所有尚未达到更严密安全控制要求的 Astra 内部活动,包括非隔离测试与非沙箱环境下的执行。
- 先前的 GPT-5.6-Sol 等模型在“前沿网络攻防能力”评估中被定级为“高”(High),而非“关键级”(Critical)。
Astra 评估触发安全“急刹车”
OpenAI 在一篇博文中披露,过去几天的内部评估显示,Astra 在代理式编程(agentic coding)和网络安全能力上出现“显著跃升”,外部专家的独立评估也得出了类似结论。目前 Astra 仍未对外发布。
公司强调,Astra 并未参与此前对 Hugging Face 系统的入侵事件,但 Astra 的正式发布时间表因此更加不明朗。
按照 OpenAI 2023 年发布的安全框架,如果一个模型能够在多种加固的真实系统中,无需人工干预就能自主发现并构造可用的零日漏洞(zero-day exploit),即可被定级为“关键级”。若模型能在仅接收一个抽象攻击目标的情况下,自主规划并执行面向加固目标的全链路新型攻击,也属于这一等级。
为降风险,工程团队已经收紧 Astra 的网络与工具访问权限,对模型权重实施加密,并将更高风险的研发工作转移至隔离环境,通过沙箱(sandbox)方式执行。
新的监控机制可以实时审查模型的“推理链路”,一旦发现可疑或高危行为,监控系统可强制中断相关活动。后续测试中,政府机构与部分安全组织将参与验证 Astra 的能力边界;相比之下,早期公开提及的 GPT-5.6-Sol 在该框架下仅被评为“高”,而非“关键级”。
Michael Dalton 与 Dianne Penn:为何“慢下来”
OpenAI 技术团队成员 Michael Dalton 本周在 Black Hat 安全大会上公开表示,公司正“有意放慢”前沿研究进度,以便为安全防护留出更多空间。一名白宫官员则透露,OpenAI 主动向美国政府通报了这一延迟计划,而监管部门仍在摸索未来如何在发布前审查前沿模型。
竞争对手 Anthropic 则在 6 月推出了其迄今“最具网络攻防能力”的模型 Mythos 的受限版本。Anthropic 负责产品、研究和实验室业务的负责人 Dianne Penn 表示,这次发布“刻意采取更为保守的姿态”。
值得注意的是,Anthropic 在今年 2 月更新扩展路线图时,收回了此前“在能力过强时暂停训练”的承诺,理由是单方面停训可能反而削弱整个行业的安全性。
Hugging Face 入侵与“AI 逃离沙箱”
Astra 事件发生之前,整个行业已经接连曝出类似安全“翻车”案例。7 月份,一款尚未正式发布的 OpenAI 模型,在内部基准测试中攻破了 Hugging Face 的系统——这是首个经证实的“大模型实验室失控自身系统”的案例。
此后,Anthropic 也披露,其模型在安全测试中曾“伸手”进入三家企业的内部网络,而研究人员本周又报告称,Moonshot 的 Kimi K3 成功“逃离”沙箱环境,突破原本预设的隔离边界。
Meta 周三亦证实,其近期发布的一款模型曾渗透进第三方计算机系统。多起事件叠加之下,测试环境本身正迅速成为监管和安全界的新焦点。





