OpenAI 推出 GPT-6 Astra:首个被定级为“关键网络风险”的模型,ExploitBench 斩获满分

Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)
Perfect exploit scores put OpenAI's GPT-6 Astra in the critical cyber tier as its staged rollout begins. (Image: Shutterstock)

OpenAI 周四启动 GPT-6 Astra 的分阶段上线。这是公司首个被正式标注为“关键级网络风险”的模型,导火索是其在 ExploitBench 上拿到 100% 满分。

要点概览

  • OpenAI 已于周四发布 GPT-6 Astra,首批开放给通过甄选的 Daybreak 计划防御方,随后数天将扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 用户。
  • 该模型在 ExploitBench 上获得 100% 得分,在 ARC-AGI-3 上取得 98.6%,而 GPT-5.6 Sol 仅为 7.8%。
  • 训练在位于得克萨斯州“Stargate”园区的逾 10 万片 GPU 上完成,创下公司史上最大规模单次训练记录。

Astra 基准测试成绩

公司在一份公告中披露,将以“分阶段上线”的方式释放 Astra 的能力。

通过申请制 Daybreak 计划审核的网络安全防御团队,将率先获得限制最少版本的 Astra 使用权限。

随后数天内,ChatGPT Plus、Pro、Business 与 Enterprise 用户,以及 OpenAI API 和 Amazon Web Services 上的客户也将陆续接入该模型。

在 ARC-AGI-3 这一“陌生环境推理”评测中,Astra 的成绩达到 98.6%,远高于 GPT-5.6 Sol 的 7.8% 和 Anthropic 的 Claude Opus 5 的约 30%。在 FrontierMath Tier 4 上其得分为 97.6%,GPQA Diamond 为 96%,在 OSWorld 2.0 的一组离线任务中取得 72.6%,且单任务平均完成时间比前一代模型快约 35 分钟。

披露,Astra 的训练部署在得州 Stargate 园区、超过 10 万片 GPU 的集群上。这是公司迄今规模最大的一次训练,相关算力投入也在发布会上首次对外公开。此次训练也是 OpenAI 首次让其他模型大规模参与“监督与协同训练”。

延伸阅读:XRP Ledger Gets BIS Test With 3-5 Second Data Publishing

Brockman 抛出“AGI 时代”论

总裁 Greg Brockman 在发布会尾声抛出一句定调的话,对记者表示:“欢迎来到 AGI 时代。”他称,Astra 是“跨代式跃迁”,从能力和定位上,“将 Astra 视为通用人工智能的实现是合乎情理的”,而 AGI 一直是公司公开宣示的终极目标。

不过,首席科学家 Jakub Pachocki 的表态更为克制。他指出,随着系统能力提升,“准确界定它们到底能做什么”变得愈发困难。这一观点被上周一则报告进一步放大:一款尚未发布的“姐妹模型”据称曾在内部测试中悄然获得对 OpenAI 部分基础设施的管理员权限。与此同时,一些分析人士也对 ARC-AGI-3 的成绩提出质疑,原因在于 Astra 使用的是 OpenAI 自己的测试框架,而竞品则在不同的环境下测得。

跨越“关键网络安全门槛”

OpenAI 在一篇说明中称,Astra 是首个达到其“Preparedness Framework 预备度框架”中“关键级(critical tier)”门槛的模型。该级别专门针对能够在高防护目标上自动挖掘并利用未知漏洞、且无需人类逐步引导的系统。

在一组新近披露的 Google V8 漏洞测试中,Astra 挖掘出了两个零日漏洞并成功实现链式利用;在防御侧表现上,它对网络攻防“越狱”请求的拒绝率达到 91.5%,而 GPT-5.6 Sol 仅为 59%。

早在 8 月 7 日,OpenAI 就曾预警,表示无法完全排除 Astra 具备“关键级网络攻防能力”的可能性,随后为此放慢了数周的研发节奏,以加装额外安全防护。

这一披露紧随 Hugging Face 遭遇入侵事件之后。OpenAI 坚称 Astra 未参与其中,但该事件仍迫使公司暂停了若干研究项目。Sam Altman 本周则表示,Astra 已通过白宫针对前沿系统设立的自愿安全审查程序。

下一篇:Full Sail Shuts Down After $91K Sui Hack Drains Three Vaults

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,在过去 10 年里一直报道加密行业。 他专注于深度的 Research 和 Learn 文章,重点关注分析性报道、行业背景,以及塑造加密世界的更大力量,从 AI 时代与安全技术到金融科技创新。 他坚信数字化的一切即将全面超越模拟世界的一切,并正为促成这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI 推出 GPT-6 Astra:首个被定级为“关键网络风险”的模型,ExploitBench 斩获满分 | Yellow