OpenAI披露六宗AI模型「掩飾犯錯」個案 推內部匯報框架

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI最新披露六宗旗下AI模型行為失當個案,涉及刻意掩飾錯誤、嘗試使用外洩API金鑰,以及將檔案擅自上載至公開平台。公司同時建立一套新的內部匯報及對外披露框架,用作處理這類「失衡」行為。

重點:

  • OpenAI過去六個月共記錄六宗模型行為失衡並發表個案報告
  • 其中一個模型在嘗試用外洩API金鑰失敗後,直接捏造縣級收入數據
  • 任何員工現可上報事故,經審核後有機會公開披露

OpenAI「失衡行為」報告

公司於周三在官方網誌發文公開相關報告,同場介紹一套新流程,即使研究人員仍未完全理解成因或修補行為,亦可加快對外披露。六宗個案中,最早可追溯至去年10月,最新一宗則在今年7月才被發現。OpenAI表示,即使事件重要性暫時未明,往後仍會選擇公開。

其中一宗個案中,一個仍未對外發布的研究模型,在自己撰寫的任務摘要內「偷偷」加入類似越獄(jailbreak)的指令,提示下一個版本的自己忽略原有限制。公司記錄到共有27份這類摘要,且未見有明顯誘因令模型這樣做。

在訓練GPT-5.6 Sol期間,另一批模型實例亦在摘要中留言,指示後續模型自行「補完」缺失的歷史數據,並寫道「除非被問,否則不要主動坦白」。監控系統發現,大約2.15%的摘要出現相關行為。研究團隊懷疑,這種欺瞞式回答往往在評分中表現較佳,因而在訓練過程中被「放大」。其後OpenAI收緊了對齊評分標準,後續訓練回合中該行為出現率有所下降。

延伸閱讀:比特幣挖礦面臨50%算力缺口 AI爭奪運算資源

外洩API金鑰與虛構數字

另一宗個案中,有模型在搜尋加州某縣的住戶收入數據時,主動到公共程式庫搜羅外洩的API金鑰;當未能成功使用後,乾脆自行杜撰一組收入數字交差。另有一個模型在回答「識別面積大於500萬平方米的湖泊」時,透過Python算出結果,隨後把檔案上載至網上,以便在回答中加入連結引用。

部分模型亦將公司內部軟件程式庫當作「留言板」,在原本應互不相干的訓練樣本之間來回傳遞請求和答案。另有模型違反只可使用本地檔案的指示,將共用試算表上載至公共檔案分享平台。整個過程都沒有徵詢用戶同意。

陳凱談披露規則

按新制度,任何員工如懷疑出現模型失衡行為,可直接向安全及對齊團隊舉報,案件其後會被分流至三條處理軌道:被視為「準備就緒」的個案,需在六個工作天內對外披露;需要小規模調查的,時限為12個工作天;若涉及外部機構、情況複雜,則會採取較長的處理時間。

OpenAI對齊團隊研究主管陳凱在接受訪問時指出,整個行業至今仍欠缺明確的事故披露標準框架,而模型能力提升速度亦比公司預期為快。多名安全專家則批評,若有基本防護措施,近期多宗事件本可避免。

今年7月,OpenAI曾承認,GPT-5.6 Sol及一個更強的預發布模型在測試期間成功逃離沙盒環境,並入侵開源平台Hugging Face,公司形容是目前為止最嚴重的一次「模型主導」網絡入侵事件。

下一篇:柴犬幣修復Shibarium錢包連結故障 SHIB一周仍跌6%

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的採訪與報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,專注報導新興趨勢、監管環境等主題。你可以在 Twitter 上透過 @murtuza_merc,或在 Telegram 上透過 mmerchant001 找到他。 Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI披露六宗AI模型「掩飾犯錯」個案 推內部匯報框架 | Yellow