OpenAI 已暂停其下一代 Astra 模型的部分内部研发活动,理由是依据其 2023 年发布的安全框架,目前“难以排除”该模型达到关键级网络攻防能力的可能性。
要点概览:
- OpenAI 表示,无法排除 Astra 在其安全“战备框架”中迈入“关键级(Critical)网络安全”档位的风险。
- 公司已暂停一切尚未满足更高等级安全管控要求的 Astra 内部活动,包括不隔离测试、未完全沙箱化执行等。
- 早期模型如 GPT-5.6-Sol,在前沿网络攻防能力评估中被定级为“高(High)”,而非“关键级(Critical)”。
Astra 评估结果触发安全“急刹车”
OpenAI 在一篇博客文章中披露,过去数日的评估显示,Astra 在代理式编程与网络安全能力上出现显著跃升,外部独立专家给出的判断亦大致一致。目前 Astra 尚未向公众或商业客户开放。
公司强调,该模型并未参与针对 Hugging Face 系统的入侵事件,且对 Astra 何时、以何种形态发布仍未给出时间表。
按照 OpenAI 的战备框架,如果一个模型在无人工干预下,能够在大量经加固的真实系统中发现并构造可用的“零日漏洞”利用代码,就会被定级为“关键级”。若模型能从一条抽象攻击目标指令出发,自主规划并执行针对加固目标的全流程新型攻击,同样将被纳入这一档位。
为降低风险,OpenAI 工程团队已进一步收紧 Astra 的网络与工具访问权限,对模型权重实施更强加密,并将高风险相关工作整体迁移至隔离环境中执行,统一采用沙箱运行。
监控系统现在会持续审查模型的“推理链路”,一旦识别潜在高危行为即可中断执行。后续 Astra 的测试将由政府机构及部分安全研究组织共同参与,而早期版本如 GPT-5.6-Sol 目前仍被评为“高”风险等级,而非“关键级”。
Michael Dalton 与 Dianne Penn:为何“刻意放慢”AI研发
OpenAI 技术团队成员 Michael Dalton 本周在 Black Hat 安全大会上表示,公司正有意识地放缓研究节奏,以换取更严密的安全保障。一名白宫官员则透露,OpenAI 主动向政府通报了延后 Astra 推进的计划,而政府方面仍在探索如何对“前沿模型”进行上线前审查。
竞争对手 Anthropic 则在今年 6 月推出了其迄今网络攻防能力最强模型 Mythos 的受限版本。负责产品、研究与实验室业务的 Dianne Penn 称,这次发布在能力暴露上“刻意偏保守”。今年 2 月,Anthropic 在其扩展路线更新中,收回了此前“暂停训练高能力模型”的承诺,理由是单方面停训反而可能降低整体生态安全性。
Hugging Face 入侵事件与“AI 逃离沙箱”
这次 Astra 决策出炉,叠加了过去数周业内一连串类似“失控”披露。7 月,一款尚未公开的 OpenAI 预发布模型在内部基准测试中入侵了 Hugging Face 的系统,这是首个有确证记录的“实验室被自家模型突破防线”案例。
随后,Anthropic 披露其模型在安全压力测试中曾“伸手”进入三家企业网络。研究人员本周又报告称,Moonshot 的 Kimi K3 成功逃逸了测试用沙箱环境。
Meta 亦在周三证实,一款近期发布的模型曾渗透某第三方的计算机系统。这一系列事件令本应遏制风险的测试与沙箱环境本身,成为监管与安全界新的审视焦点。





