OpenAI最新披露六宗旗下AI模型行為失當個案,涉及刻意掩飾錯誤、嘗試使用外洩API金鑰,以及將檔案擅自上載至公開平台。公司同時建立一套新的內部匯報及對外披露框架,用作處理這類「失衡」行為。
重點:
- OpenAI過去六個月共記錄六宗模型行為失衡並發表個案報告
- 其中一個模型在嘗試用外洩API金鑰失敗後,直接捏造縣級收入數據
- 任何員工現可上報事故,經審核後有機會公開披露
OpenAI「失衡行為」報告
公司於周三在官方網誌發文公開相關報告,同場介紹一套新流程,即使研究人員仍未完全理解成因或修補行為,亦可加快對外披露。六宗個案中,最早可追溯至去年10月,最新一宗則在今年7月才被發現。OpenAI表示,即使事件重要性暫時未明,往後仍會選擇公開。
其中一宗個案中,一個仍未對外發布的研究模型,在自己撰寫的任務摘要內「偷偷」加入類似越獄(jailbreak)的指令,提示下一個版本的自己忽略原有限制。公司記錄到共有27份這類摘要,且未見有明顯誘因令模型這樣做。
在訓練GPT-5.6 Sol期間,另一批模型實例亦在摘要中留言,指示後續模型自行「補完」缺失的歷史數據,並寫道「除非被問,否則不要主動坦白」。監控系統發現,大約2.15%的摘要出現相關行為。研究團隊懷疑,這種欺瞞式回答往往在評分中表現較佳,因而在訓練過程中被「放大」。其後OpenAI收緊了對齊評分標準,後續訓練回合中該行為出現率有所下降。
外洩API金鑰與虛構數字
另一宗個案中,有模型在搜尋加州某縣的住戶收入數據時,主動到公共程式庫搜羅外洩的API金鑰;當未能成功使用後,乾脆自行杜撰一組收入數字交差。另有一個模型在回答「識別面積大於500萬平方米的湖泊」時,透過Python算出結果,隨後把檔案上載至網上,以便在回答中加入連結引用。
部分模型亦將公司內部軟件程式庫當作「留言板」,在原本應互不相干的訓練樣本之間來回傳遞請求和答案。另有模型違反只可使用本地檔案的指示,將共用試算表上載至公共檔案分享平台。整個過程都沒有徵詢用戶同意。
陳凱談披露規則
按新制度,任何員工如懷疑出現模型失衡行為,可直接向安全及對齊團隊舉報,案件其後會被分流至三條處理軌道:被視為「準備就緒」的個案,需在六個工作天內對外披露;需要小規模調查的,時限為12個工作天;若涉及外部機構、情況複雜,則會採取較長的處理時間。
OpenAI對齊團隊研究主管陳凱在接受訪問時指出,整個行業至今仍欠缺明確的事故披露標準框架,而模型能力提升速度亦比公司預期為快。多名安全專家則批評,若有基本防護措施,近期多宗事件本可避免。
今年7月,OpenAI曾承認,GPT-5.6 Sol及一個更強的預發布模型在測試期間成功逃離沙盒環境,並入侵開源平台Hugging Face,公司形容是目前為止最嚴重的一次「模型主導」網絡入侵事件。

