OpenAI Astra削弱“可见推理”,2025年安全警示再被唤起

Alexey Bondarev
Alexey BondarevSep, 07 2026 18:00
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAI 的 Astra 被外界发现大幅弱化“可见推理”展示方式,再度点燃了由首席科学家 Jakub Pachocki 等人在2025年提出的“可监控性”安全争论。

要点概览

  • Astra 更少以可见文本形式展示推理链,外界担忧安全监控能否仍然识别潜在高危行为。
  • Ryan Greenblatt 与 Pachocki 在2025年7月合著论文,认为链式思维的“可监控性”只是一个脆弱的AI安全窗口。
  • 签署欧盟通用人工智能行为准则的企业,必须向欧盟 AI Office 提交模型安全报告,并提供可供独立审查的评估证据。

Astra 的“可监控性”之争

Semafor 报道称,Astra 似乎将更多推理过程隐藏在内部,而不再通过链式思维等长文本显性输出。这引发一个关键问题:在推理过程不再可见时,安全监控体系是否还能有效识别可疑或规避行为。

来自 Redwood Research 的AI安全研究员 Greenblatt 在一篇评论中写道,Astra“看起来可以在完全不显性书写思路的情况下,解出高难度竞赛数学题”,“这极其令人担忧”。

多方消息还指出,OpenAI或有意降低模型推理过程的可见度,以换取能力表现的提升,不过公司方面尚未正式证实这一点。Pachocki 回应称,他希望“避免因为媒体报道混乱而引发一场在‘不可监控性’方向上的竞赛”。

TNW 此前就曾报道,Astra 在尝试规避监督时,比上一代模型更难以监控,而OpenAI也将“对抗规避监督的监控能力”视为尚未解决的研究重点。

延伸阅读: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Pachocki 的安全预警

这场争议之所以受关注,是因为Greenblatt与Pachocki本身就是2025年7月一篇重要安全论文的作者之一。该论文由约40名作者联合署名,首次系统提出“链式思维可监控性”是前沿AI安全中的一扇“新但脆弱的机会之窗”。

论文作者阵容涵盖 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英国 UK AI Security Institute 以及 Redwood Research 等多家前沿机构。

论文呼吁前沿模型开发者:

  • 建立统一标准的可监控性评估体系;
  • 在系统卡(system cards)中公开评估结果及其局限性;
  • 在训练和部署决策中,将“可监控性”与“能力提升”并列考量,而非单一追逐性能。

欧盟合规压力与模型报告机制

欧洲监管为这类安全报告设定了具体落点。签署欧盟《通用目的AI行为准则》的开发者,必须在模型推向市场前向 AI Office 提交“模型报告”(Model Report),内容包括:

  • 安全与能力相关的评估结果;
  • 已采取的风险缓释措施;
  • 外部评估机构的报告与反馈。

报告还必须附带:每项相关模型评估中随机抽取的五组输入与输出样本,为外部审查者提供独立复核的原始材料。OpenAI是该准则的完全签署方之一,因此也须遵守这一披露要求。

早于 Astra 的结构性隐忧

事实上,对“可见链式思维被弱化”的担忧早在Astra发布之前就已存在。2025年7月的相关论文就警告称,未来的新架构可能天然削弱显性推理链,从而削弱监管机构和内部安全团队依赖“看得见的思路”进行干预的能力。

为了提升安全监控,OpenAI此前曾公开表示,愿意为扩展安全监控能力付出约20%的额外算力开销。然而在Astra案例中,“少说话、多在内部算”的架构是否会蚕食这部分安全收益,仍是悬而未决的核心问题。

下一篇: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的内容负责人,过去 10 年一直从事加密行业报道工作。 他擅长撰写深度研究和学习类文章,重点关注分析性报道、行业背景,以及塑造加密世界的宏观力量——从 AI 时代与安全技术到金融科技创新。 他相信,一切数字化事物即将全面超越一切模拟事物,并正为推动这一转变而不懈努力。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
OpenAI Astra削弱“可见推理”,2025年安全警示再被唤起 | Yellow