三名遭 OpenAI 解雇的研究人员在 10 月 7 日致信公司董事会,敦促暂停一切让 AI 更难以监控的研发工作,而一份公司内部备忘录则被曝在实质立场上支持这份联名信的建议。
要点概览:
- 三名被解雇研究人员于 10 月 7 日致信 OpenAI 董事会,要求停止会削弱 AI 监控能力的研发。
- OpenAI 称解雇与安全争议无关,但一份内部备忘录却“强烈赞同”联名信中的多项建议。
- GPT-6 Astra 的系统卡片显示,该模型较 GPT-5.6 Sol 更难通过常规方式监控。
致 OpenAI 董事会联名信的核心内容
据周三公开的部分节选显示(原文由 Gizmodo 披露),曾在公司负责安全与对齐工作的 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 将这封信寄给了 OpenAI 董事会及其安全相关委员会。
联名信全文尚未公布。已披露内容显示,三人写道:“在整个行业层面,我们尚未掌握如何在无法充分监控的情况下,安全地开发和部署模型。”
他们呼吁,OpenAI 及其竞争对手不应继续推进任何会进一步削弱可监控性的技术路径。据报道,联名信还建议 OpenAI 引入第三方审计机构、构建开放透明的安全生态,并指出此次解雇事件正在“寒蝉效应般打击仍留在 OpenAI 的员工”。
延伸阅读:CrowdStrike 指一名 26 岁中国黑客利用 Claude Code 攻击韩银
OpenAI 内部备忘录与解雇事件
OpenAI 发言人表示,此次解雇“与他们提出安全担忧或对外发声无关”。发言人并向媒体分享了一段由公司一位研究负责人在周三发出的内部备忘录内容,称备忘录对上述联名信中的建议“表示强烈赞同”。
OpenAI 此前在 10 月 1 日通过对外 声明 称,内部调查认定三名员工在与一家外部 AI 模型评估组织的相关事务中,误用敏感信息并违反公司政策。
截至目前,OpenAI 尚未在公开渠道披露这三名研究人员的身份,也没有披露涉事外部机构的名称。
GPT-6 Astra 的监控难题
所谓“Chain of thought(思维链)”,指的是模型在给出最终答案前写出的逐步推理过程。安全团队通过审阅这些推理链,以识别系统是否存在潜在“越轨意图”。
OpenAI 于 9 月 3 日发布的 GPT-6 Astra 系统卡片中指出,相较 GPT-5.6 Sol,新一代 Astra 模型在思维链层面更难被监控,并在一定程度上更能“自我掌控”自己的推理过程。系统卡片警告称,在对抗性场景下,Astra 级别模型“可能规避我们的思维链(CoT)监控”。
这些结论主要来自一系列有意指示模型“规避监控”的测试。OpenAI 同时表示,目前尚无证据显示 Astra 会将真实推理过程“藏”在无关文本中。
公司在系统卡片中强调,保持思维链可监控性是其核心研究目标之一,并承诺在缺乏新的、可证明模型对齐性的技术手段之前,不会接受超出既定阈值的进一步监控能力下滑。
三名研究人员的研究背景
这三名研究人员在相关领域早有布局。2025 年 7 月,Korbak 与 Balesni 牵头发表了一篇论文(由 Wang 及来自 OpenAI、Google DeepMind 与 Anthropic 的研究人员共同署名),该论文在 arXiv 上被 收录,将思维链监控描述为 AI 安全的一扇“崭新而脆弱的窗口”。
OpenAI 在 Astra 系统卡片中亦引用了这篇论文。论文敦促模型开发者在系统设计中系统性评估:各类架构与训练决策,会如何影响外界对模型推理过程的可观察性和可审计性。

