OpenAI 推出的 Astra 被指大幅減少以文字形式展示推理過程,令外界重新關注首席科學家 Jakub Pachocki 等人在 2025 年於論文中提出的「可監察性」風險。
重點:
- Astra 似乎將更多推理轉移到「內部思考」,不再以明文推理鏈呈現,令外界憂慮監察系統能否偵測異常或危險行為。
- Ryan Greenblatt 與 Pachocki 曾於 2025 年 7 月合著論文,指「連鎖思維」(chain-of-thought)監察是一個脆弱但關鍵的 AI 安全契機。
- 歐盟《通用用途 AI 自律守則》簽署方須向 AI Office 提交模型安全報告,當中要包含評估證據,以便獨立審閱。
Astra 的「可監察性」爭議
Semafor 報道,Astra 執行複雜推理時,更多是在「看不見的」內部層面完成,而非逐步寫出推理文字,令外界質疑監察人員在模型運作過程中,是否仍然可以識別可疑行為。
來自 Redwood Research、專注 AI 安全的研究員 Greenblatt 在文章中撰文指,Astra「似乎可以完全在腦內(不輸出推理鏈)解出高難度數學競賽題目」,並形容情況「極度令人憂慮」。
有報道指,OpenAI 或刻意減少輸出的可見推理內容,以換取整體能力提升,但公司至今未有證實。Pachocki 則回應稱,希望避免「因錯誤報道而觸發一場『向不可監察性競賽』」。
TNW 早前亦報道,當 Astra 嘗試迴避監管時,相比前一代模型更難以監察;OpenAI 自身也形容,如何監督這類行為仍是開放中的優先研究課題。
延伸閱讀: OpenAI 指 AI 已可處理長達數日的研究型任務
Pachocki 早前安全警示再被聚焦
是次爭議備受關注,原因在於 Greenblatt 和 Pachocki 皆是 2025 年 7 月一篇關於「連鎖思維可監察性」的重要論文共同作者之一。該文將此視為 AI 安全的一個「新但脆弱」機會窗口。
論文作者近 40 人,來自 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、**英國 AI 安全研究院(UK AI Security Institute)**及 Redwood Research 等前沿機構。
論文呼籲大型模型開發者:
- 建立標準化的可監察性評估方法;
- 在系統卡(system cards)中公開結果及限制;
- 在決定訓練與部署策略時,將可監察性與模型能力同時納入考量。
歐洲則為這種披露機制提供了正式落點。簽署歐盟《通用用途 AI 自律守則》的企業,須在模型推向市場前,向 AI Office 提交「模型報告」(Model Report),內容涵蓋安全評估、風險緩解措施及外部評估機構的報告。
每份報告還必須從每一個相關評估中,隨機抽取至少五組輸入與輸出樣本,供外界審閱,提升獨立檢驗的空間;OpenAI 乃該守則的正式簽署方之一。
事實上,憂慮早在 Astra 面世前已出現。2025 年 7 月該篇論文已警告,新一代模型架構可能削弱可見的連鎖思維推理;其後 OpenAI 亦據報願意承受約 20% 額外運算成本,以換取對系統進行更深入的安全監察。





