OpenAI Astra隱匿更多推理過程 再掀2025年安全警示爭議

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAI的新模型 Astra 被外界觀察到大幅降低「可見推理」的比例,再度喚起對AI可監測性的疑慮。這些憂慮,早在2025年由OpenAI現任首席科學家 Jakub Pachocki 共同撰寫的一篇論文中就已提出警告。

重點整理:

  • Astra 似乎將更多推理過程轉為「不顯示文字」、在模型內部完成,使外部監控系統更難察覺問題行為。
  • Ryan Greenblatt 與 Pachocki 曾在2025年7月共同發表論文,稱鏈式思考(chain-of-thought)可監測性是脆弱但關鍵的AI安全契機。
  • 依歐盟規範,一般用途AI規範簽署方必須向AI Office提交模型安全報告,並附上可支撐獨立審查的評估證據。

Astra 的可監測性爭議

Semafor 報導指出,Astra 似乎將更多推理在內部完成,而不再以長篇推理文字呈現,引發外界質疑:監管方與內部安全團隊,是否仍能在模型運作過程中識別可疑行為。

來自 Redwood Research、專注AI安全的研究員 Greenblatt 在一篇評論中指出,Astra「看起來可以完全在腦中解出高難度競賽數學題」,幾乎不留下中間推理文字。他直言:「這看起來極度令人擔憂。」

有報導更推測,OpenAI 可能刻意降低模型輸出中對推理過程的暴露程度,以換取能力表現上的提升,不過公司並未證實此一說法。Pachocki 則回應稱,他希望「避免因為外界報導失焦,意外引發一場『競逐不可監測性』的軍備競賽。」

TNW 此前報導,Astra 在嘗試規避監管或測試時,比前一代模型更難被監控,而OpenAI本身也將「模型規避監測」列為尚待突破的研究重點之一。

延伸閱讀:OpenAI稱AI已能處理長達數天的研究任務

Pachocki 的安全預警回顧

這場爭議之所以備受關注,正是因為Greenblatt與Pachocki本人,都是2025年7月一篇論文的約40名共同作者之一。該文指出,「鏈式思考可監測性」是一個剛浮現、卻極為脆弱的AI安全契機。

參與這篇論文的機構橫跨產業與研究單位,包括 OpenAI、Google DeepMind、Anthropic、Meta、Amazon、英國 UK AI Security Institute 以及 Redwood Research 等。

論文呼籲最前沿的模型開發商,應建立標準化的可監測性評估機制,並在系統卡(system cards)中公開結果與限制,同時在訓練與部署決策時,把「可監測性」與「能力」並列考量,而非只追求性能極大化。

歐洲則在制度面為這類揭露要求提供了正式落點。簽署歐盟「一般用途AI行為準則」(General-Purpose AI Code of Practice)的企業,必須在模型上市前向 AI Office 提交「模型報告」(Model Report),內容須涵蓋安全評估、風險緩解措施,以及外部評估者報告等。

每份報告還必須隨機附上每項相關模型評估中的五組輸入與輸出樣本,作為外部審查者獨立檢驗的基礎,而OpenAI已是該準則的正式簽署方。

值得注意的是,這些憂慮早在 Astra 問世前就已成形。2025年7月的那篇論文就曾示警,新型模型架構可能自然削弱可見的鏈式推理輸出;隨後,OpenAI 也承認其系統為強化安全監控,願意承受約20%的額外運算成本。

下一篇:Bitcoin ETF單日吸金9.87億美元 連三週維持資金淨流入

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容主管,過去 10 年一直從事加密貨幣相關報導。他專長於撰寫深入的研究與學習類文章,著重於分析性報導、產業脈絡,以及塑造加密貨幣世界的宏觀力量,從 AI 時代與安全技術到金融科技創新。他相信,一切數位事物即將全面超越一切類比事物,並正為實現這一願景而努力不懈。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI Astra隱匿更多推理過程 再掀2025年安全警示爭議 | Yellow