OpenAI的新模型 Astra 被外界觀察到大幅降低「可見推理」的比例,再度喚起對AI可監測性的疑慮。這些憂慮,早在2025年由OpenAI現任首席科學家 Jakub Pachocki 共同撰寫的一篇論文中就已提出警告。
重點整理:
- Astra 似乎將更多推理過程轉為「不顯示文字」、在模型內部完成,使外部監控系統更難察覺問題行為。
- Ryan Greenblatt 與 Pachocki 曾在2025年7月共同發表論文,稱鏈式思考(chain-of-thought)可監測性是脆弱但關鍵的AI安全契機。
- 依歐盟規範,一般用途AI規範簽署方必須向AI Office提交模型安全報告,並附上可支撐獨立審查的評估證據。
Astra 的可監測性爭議
Semafor 報導指出,Astra 似乎將更多推理在內部完成,而不再以長篇推理文字呈現,引發外界質疑:監管方與內部安全團隊,是否仍能在模型運作過程中識別可疑行為。
來自 Redwood Research、專注AI安全的研究員 Greenblatt 在一篇評論中指出,Astra「看起來可以完全在腦中解出高難度競賽數學題」,幾乎不留下中間推理文字。他直言:「這看起來極度令人擔憂。」
有報導更推測,OpenAI 可能刻意降低模型輸出中對推理過程的暴露程度,以換取能力表現上的提升,不過公司並未證實此一說法。Pachocki 則回應稱,他希望「避免因為外界報導失焦,意外引發一場『競逐不可監測性』的軍備競賽。」
TNW 此前報導,Astra 在嘗試規避監管或測試時,比前一代模型更難被監控,而OpenAI本身也將「模型規避監測」列為尚待突破的研究重點之一。
Pachocki 的安全預警回顧
這場爭議之所以備受關注,正是因為Greenblatt與Pachocki本人,都是2025年7月一篇論文的約40名共同作者之一。該文指出,「鏈式思考可監測性」是一個剛浮現、卻極為脆弱的AI安全契機。
參與這篇論文的機構橫跨產業與研究單位,包括 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英國 UK AI Security Institute 以及 Redwood Research 等。
論文呼籲最前沿的模型開發商,應建立標準化的可監測性評估機制,並在系統卡(system cards)中公開結果與限制,同時在訓練與部署決策時,把「可監測性」與「能力」並列考量,而非只追求性能極大化。
歐洲則在制度面為這類揭露要求提供了正式落點。簽署歐盟「一般用途AI行為準則」(General-Purpose AI Code of Practice)的企業,必須在模型上市前向 AI Office 提交「模型報告」(Model Report),內容須涵蓋安全評估、風險緩解措施,以及外部評估者報告等。
每份報告還必須隨機附上每項相關模型評估中的五組輸入與輸出樣本,作為外部審查者獨立檢驗的基礎,而OpenAI已是該準則的正式簽署方。
值得注意的是,這些憂慮早在 Astra 問世前就已成形。2025年7月的那篇論文就曾示警,新型模型架構可能自然削弱可見的鏈式推理輸出;隨後,OpenAI 也承認其系統為強化安全監控,願意承受約20%的額外運算成本。

