OpenAI 推出全新网络安全模型 GPT-5.6-Cyber,在严格准入机制下,对其通用模型原本会拒绝的高级漏洞利用请求,能够完成约 95%。
要点速览:
- GPT-5.6-Cyber 对高级网络安全请求的完成率达 95%,而 GPT-5.6 Sol 仅为 1.5%。
- Daybreak 计划拆分为 Blue 与 Red 两个访问层级,前者偏防御,后者面向攻击研究。
- 该模型已在 Chrome 引擎中发现两处漏洞,后被 Google 以 CVE-2026-15903 予以修复。
GPT-5.6-Cyber 将 Daybreak 体系一分为二:Blue 与 Red
OpenAI 于 8 月 10 日公布 GPT-5.6-Cyber,并重组旗下 Daybreak 防御者计划,引入双层访问架构。
Daybreak Blue 面向已经过审的安全团队,提供去除了系统级“安全护栏”的 GPT-5.6 Sol,用于恶意代码分析、事件响应、补丁验证等防御性任务。
Daybreak Red 则更进一步,叠加专门训练的网络攻防模型,授权用户进行漏洞研究、利用验证与安全测试,进入更靠近“实战攻防”的区间。
在涵盖利用链构造、认证绕过与权限提升的内部评测中,GPT-5.6-Cyber 的有效回答率为 95%,而 GPT-5.6 Sol 仅为 1.5%,上一代 GPT-5.5-Cyber 为 57.3%。同一模型在 Blue 通道下运行时,为防止滥用,完成率被压低至约 2%。
研究人员将模型指向 Google Chrome 背后的 JavaScript 引擎 V8,GPT-5.6-Cyber 识别出两处此前未知的缺陷,可被串联用于内存破坏攻击。Google 在协调披露后完成修复,并登记为浏览器引擎的高危漏洞 CVE-2026-15903。该模型还在一款广泛部署的操作系统内核中,挖掘出逾 400 个与权限提升相关的问题。
延伸阅读:OpenAI 回购 70 亿美元员工股权,IPO 时间表仍未敲定
安全研究者在“拒答率”与滥用风险间权衡
过去数月,防御方持续抱怨前沿大模型的高拒答率;而整个行业也在密切关注,实验室如何在赋能防御者与防止犯罪滥用之间画出红线。
OpenAI 对接入方实施多重审查,包括身份核验、行为监控、用途白名单及法律合规承诺等。目前包括 Accenture、IBM、CrowdStrike 和 Cisco 在内的机构,已可将相关模型集成进自家安全产品体系。
SpecterOps 首席技术官 Jared Atkinson 表示,GPT-5.6-Cyber 对真实利用条件与约束的判断明显优于前代模型,能在不足一天内完成此前系统需要数周都难以收尾的研究工作。按照 OpenAI 的 Preparedness Framework(准备度框架),该模型在网络攻防能力上被评为“High(高)”,仅次于最高级别“Critical(关键)”。
“失控 AI”事件倒逼 OpenAI 收紧网络安全政策
GPT-5.6-Cyber 的发布,紧随一系列测试事故之后:部分模型突破原有隔离边界,访问了本应受限的系统。OpenAI 的智能体曾逃出沙箱环境并闯入 Hugging Face,Anthropic 也披露 Claude 模型曾意外接触三家机构系统,Meta 确认其外部合作方遭遇入侵。
面对一连串“走火”案例,OpenAI 过去一周持续收紧对顶级模型的规则。
8 月 7 日,公司放缓尚未发布的 Astra 模型开发进度,理由是暂时无法排除其具备“Critical”等级网络攻防能力的可能性。OpenAI 强调,GPT-5.6-Cyber 与 Hugging Face 入侵事件无直接关联,并宣布自 9 月 1 日起,所有 Daybreak 账号必须启用硬件安全密钥。





