OpenAI 的 Astra 被外界觀察到在回答問題時,顯性展現的推理過程更少,重新點燃對其「可監控性」與安全風險的討論。這場爭論,也讓首席科學家 Jakub Pachocki 於2025年共同發表的監管研究再度成為焦點。
重點整理:
- Astra 似乎把更多推理轉為「內在運算」,而非用文字逐步展開,外界憂心這將削弱監測系統偵測有害或異常行為的能力。
- Ryan Greenblatt 與 Pachocki 於2025年7月共同撰寫論文,形容「逐步推理(chain-of-thought)」的可監控性,是一個脆弱卻關鍵的AI安全契機。
- 依歐盟規範,一般用途AI(GPAI)守則簽署方必須向 AI Office 提交模型安全報告,包含可供獨立審查的評估證據。
Astra 的可監控性爭議
Semafor 報導 指出,Astra 似乎將更多推理藏在「看不見的過程」,而非以文字逐行展開,外界因此質疑,監測人員在模型運作過程中,是否仍能有效辨識可疑行為。
來自 Redwood Research、專攻AI安全的研究員 Ryan Greenblatt 在評論中表示,Astra「看起來能把高難度競賽數學題,完全在『腦中』解完」,並直言:「這點極度令人擔憂。」
多家報導同時指出,OpenAI 可能刻意降低模型輸出時的可見推理比例,以換取性能表現,但公司方面尚未證實相關說法。Pachocki 則回應,希望避免「因為外界報導失真,而引發一場『誰先走向不可監控』的軍備競賽」。
TNW 先前亦報導,當 Astra 嘗試規避監督時,相較前一代系統,其行為更難被監控。OpenAI 對此將「可監督性」列為當前仍未解決的優先研究議題。
延伸閱讀: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Pachocki 的安全警訊再被點名
這場爭議之所以受矚目,關鍵在於 Greenblatt 與 Pachocki 本身就是2025年7月一篇重要論文的共同作者。該文將「逐步推理(chain-of-thought)的可監控性」描述為AI安全上的一個嶄新、但極為脆弱的窗口。
這篇論文作者近40人,來自 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英國 UK AI Security Institute 與 Redwood Research 等前沿機構。
論文明確呼籲各大前沿模型開發商:
- 建立標準化的「可監控性」評估框架
- 在系統卡(system cards)中公開測試結果與限制
- 在訓練與部署決策時,把「可監控性」與「能力提升」放在同等考量
歐洲監管則進一步賦予此類報告一個正式的去處。根據歐盟《一般用途AI自律守則》(General-Purpose AI Code of Practice),簽署業者在產品進入市場前,必須向 AI Office 提交「模型報告」(Model Report),內容需涵蓋:
- 風險與安全評估結果
- 緩解措施與控制機制
- 外部評估機構的相關報告
每份報告還必須從每項相關模型評估中,隨機擷取至少五筆輸入與輸出樣本,提供給外部審查者獨立檢視。OpenAI 已是該守則的正式簽署方。
值得注意的是,這些擔憂早在 Astra 上線前便已存在。2025年7月的論文曾警告,新型模型架構可能削弱「可見的逐步推理」;之後 OpenAI 也公開承認,為擴大安全監測,願意承擔約20%的額外運算成本。
下一篇: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





