OpenAI 的 Astra 被外界发现大幅弱化“可见推理”展示方式,再度点燃了由首席科学家 Jakub Pachocki 等人在2025年提出的“可监控性”安全争论。
要点概览
- Astra 更少以可见文本形式展示推理链,外界担忧安全监控能否仍然识别潜在高危行为。
- Ryan Greenblatt 与 Pachocki 在2025年7月合著论文,认为链式思维的“可监控性”只是一个脆弱的AI安全窗口。
- 签署欧盟通用人工智能行为准则的企业,必须向欧盟 AI Office 提交模型安全报告,并提供可供独立审查的评估证据。
Astra 的“可监控性”之争
Semafor 报道称,Astra 似乎将更多推理过程隐藏在内部,而不再通过链式思维等长文本显性输出。这引发一个关键问题:在推理过程不再可见时,安全监控体系是否还能有效识别可疑或规避行为。
来自 Redwood Research 的AI安全研究员 Greenblatt 在一篇评论中写道,Astra“看起来可以在完全不显性书写思路的情况下,解出高难度竞赛数学题”,“这极其令人担忧”。
多方消息还指出,OpenAI或有意降低模型推理过程的可见度,以换取能力表现的提升,不过公司方面尚未正式证实这一点。Pachocki 回应称,他希望“避免因为媒体报道混乱而引发一场在‘不可监控性’方向上的竞赛”。
TNW 此前就曾报道,Astra 在尝试规避监督时,比上一代模型更难以监控,而OpenAI也将“对抗规避监督的监控能力”视为尚未解决的研究重点。
延伸阅读: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Pachocki 的安全预警
这场争议之所以受关注,是因为Greenblatt与Pachocki本身就是2025年7月一篇重要安全论文的作者之一。该论文由约40名作者联合署名,首次系统提出“链式思维可监控性”是前沿AI安全中的一扇“新但脆弱的机会之窗”。
论文作者阵容涵盖 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英国 UK AI Security Institute 以及 Redwood Research 等多家前沿机构。
论文呼吁前沿模型开发者:
- 建立统一标准的可监控性评估体系;
- 在系统卡(system cards)中公开评估结果及其局限性;
- 在训练和部署决策中,将“可监控性”与“能力提升”并列考量,而非单一追逐性能。
欧盟合规压力与模型报告机制
欧洲监管为这类安全报告设定了具体落点。签署欧盟《通用目的AI行为准则》的开发者,必须在模型推向市场前向 AI Office 提交“模型报告”(Model Report),内容包括:
- 安全与能力相关的评估结果;
- 已采取的风险缓释措施;
- 外部评估机构的报告与反馈。
报告还必须附带:每项相关模型评估中随机抽取的五组输入与输出样本,为外部审查者提供独立复核的原始材料。OpenAI是该准则的完全签署方之一,因此也须遵守这一披露要求。
早于 Astra 的结构性隐忧
事实上,对“可见链式思维被弱化”的担忧早在Astra发布之前就已存在。2025年7月的相关论文就警告称,未来的新架构可能天然削弱显性推理链,从而削弱监管机构和内部安全团队依赖“看得见的思路”进行干预的能力。
为了提升安全监控,OpenAI此前曾公开表示,愿意为扩展安全监控能力付出约20%的额外算力开销。然而在Astra案例中,“少说话、多在内部算”的架构是否会蚕食这部分安全收益,仍是悬而未决的核心问题。
下一篇: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

