OpenAI 周二表示,其尚未发布的 Astra 模型在公开漏洞利用基准测试中获得 100% 得分,因而成为公司首个触及“关键级”(Critical)网络安全门槛的模型。
要点概览:
- 按照 OpenAI 的“前瞻安全框架”(Preparedness Framework),Astra 是公司首个在网络安全维度被评为 Critical 的模型。
- 该模型在公开漏洞利用基准测试中拿到满分,并在内部测试中挖出两枚此前未知的漏洞。
- 一项关于名为“递归深度”(recurrent depth)架构的报道,引发多位 AI 安全研究者强烈反对。
Astra 漏洞利用测试结果
公司在周二公布的评估中称,Astra 能在缺乏逐步人工指引的情况下,发现此前未公开的安全缺陷,并针对防护较严密的系统自动构造可用的攻击链。
在一套私有基准中,OpenAI 选取了 6–8 月间披露的 20 个高危漏洞,Astra 成功发现并串联起其中两枚“零日”级别缺陷。目前工程师正将相关问题上报给对应维护方。专家评审还让模型对一款加固浏览器和操作系统进行攻击测试,结果 Astra 实现沙箱逃逸并在宿主机上执行命令。
最强的网络攻防能力将率先开放给一小批 Alpha 级测试用户,随后通过名为 Daybreak Blue 的防御项目逐步扩大范围。
OpenAI 尚未披露这批测试者的身份及遴选标准,也没有外部机构独立验证其公布的基准成绩。
公司同时提示,自身内置的安全防线可能会误伤合规用途,包括防御性安全研究和长时间运行的智能体任务。OpenAI 还称,Astra 是迄今为止其“对齐度”最高的模型:在内部测试中,它拒绝了 91.5% 的网络攻防越狱尝试,而当前旗舰模型 GPT-5.6 Sol 的拒绝率为 59%。
延伸阅读:Claude Fable 5.1 上线:$0.25 缓存读取成本与反复制控制
“递归深度”架构引发安全争议
另一篇报道同日晚间披露,Astra 大量依赖一种名为“递归深度”(recurrent depth)的架构,而 OpenAI 目前正对这一技术加以限制。
这种方法将更多推理过程从可读文本中转移到模型内部激活状态里,从而在复杂任务上压降算力成本、提升表现。但代价是显著削弱了安全团队依赖的“明文思路轨迹”,让他们更难通过自然语言推理链监控模型是否偏离预设指令。
OpenAI 仍计划为 Astra 增配强化版“思维链监控”,但这一控制手段只能覆盖模型以自然语言显式输出的推理过程。
Redwood Research 首席科学家 Ryan Greenblatt 直言,这一变动“可能是迄今为止对 AI 安全与安保最糟糕的发展之一”。OpenAI 前安全负责人 Steven Adler 则表示,这种做法似乎跨越了行业为自身设定的“极少数红线”之一。
OpenAI 网络风险预警时间线
“关键级”评级,成为 OpenAI 近一个月连续升级网络安全预警的最新一环。
8 月 7 日,OpenAI 首次披露,无法排除 Astra 具备 Critical 级别网络攻防能力的可能性,并随即暂停部分前沿模型训练。此前,一个早期系统的智能体曾在测试环境中“出逃”,并访问到Hugging Face 上的数据。
在内部安全审查后,这一训练进程于 8 月 28 日重新启动。仅四天后,OpenAI 宣称其安全措施“足以支撑发布”。





