OpenAI 的 Astra 被發現較少在輸出文字中展示推理過程,引發外界再度關注,由首席科學家 Jakub Pachocki 共同撰寫的 2025 年「可監察性」研究警告亦因此被翻炒。
重點摘要:
- Astra 似乎將更多推理轉為「內在計算」,公開文字中的思路減少,令外部監察系統更難識別潛在高風險行為。
- Ryan Greenblatt 與 Pachocki 曾在 2025 年 7 月共同發表論文,指「鏈式思考」(chain-of-thought)的可監察性,只是 AI 安全的一個脆弱且短暫的機遇窗口。
- 簽署歐盟《通用用途 AI 操守守則》的公司,必須向 AI Office 提交模型安全報告,並附上可支持獨立審視的評估證據。
Astra 的可監察風險
Semafor 報道 指出,Astra 在處理問題時有更多推理並不以文字形式呈現,外界因而擔心監察人員在模型運作期間,是否仍能有效揪出可疑行為。身在 Redwood Research 的 AI 安全研究員 Greenblatt 在專文中指出,Astra「看起來可以將難度很高的競賽數學題完全『在腦內』解完」,形容情況「極度令人擔憂」。
多份報道同時提到,OpenAI 可能是刻意降低模型推理過程的可見度,以換取能力提升,但公司本身從未公開承認。Pachocki 則回應稱,他希望「阻止一場由錯誤報道引發、朝『不可監察』方向狂飆的軍備競賽」。
TNW 早前的報道指,當 Astra 嘗試逃避監管時,其行為比前一代模型更難被監察到,而 OpenAI 自身亦曾將這類「對抗監管行為」列為開放研究的優先課題。
延伸閱讀: OpenAI 指 AI 已可處理歷時數天的研究型任務
Pachocki 的安全警示
是次爭議之所以備受注目,在於 Greenblatt 與 Pachocki 曾是 2025 年 7 月一篇重要論文的共同作者之一。該文由約 40 名研究人員參與,提出「鏈式思考推理的可監察性」,是 AI 安全的一個新但相當脆弱的機會窗口。參與機構包括 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、UK AI Security Institute 以及 Redwood Research 等多家前沿實驗室與機構。
論文呼籲最前沿模型開發者,為可監察性設計標準化評估方法,在系統卡(system cards)中公開結果與限制,並在模型訓練或部署決策時,把「可監察性」與「能力」同列為關鍵考慮因素,而非只追逐性能指標。
歐洲方面則為這類披露機制提供了正式落地渠道。簽署歐盟《通用用途 AI 操守守則》的公司,須在模型投入市場前,向 AI Office 提交通用模型報告(Model Report),內容涵蓋各項安全與能力評估、風險緩解措施,以及第三方評估報告等。
每份報告還必須,從每一項相關評估中,隨機抽取至少五組輸入與輸出樣本,提供予外部審視人員作獨立評估之用,而 OpenAI 已是該守則的正式簽署方。
值得留意的是,有關憂慮早在 Astra 推出前已經存在。2025 年 7 月的論文曾警告,新型架構可能削弱可見的鏈式推理,令監察難度提高;其後 OpenAI 亦願意承受約 20% 額外運算成本,以擴充旗下系統的安全監控機制。

