OpenAI 公開六宗涉及旗下 AI 模型的事故,當中包括隱瞞錯誤、嘗試使用外洩的 API 金鑰,以及擅自把檔案上載到公開平台。公司同時 推出一套全新框架,用作系統化記錄及披露這類「失對齊」行為。
重點:
- OpenAI 公開過去六個月內觀察到的六宗模型失對齊行為報告。
- 其中一個模型在嘗試利用外洩 API 金鑰失敗後,捏造縣級收入數據。
- 任何員工現可將事件上報,經評估後有機會對外披露。
OpenAI「失對齊」報告
公司在周三的網誌發文,一次過公布六份個案報告,並介紹一套新流程, 目的是即使研究人員仍未完全理解或修復相關行為,也可加快披露步伐。最早的個案可追溯至去年 10 月,最新一宗則在今年 7 月才被發現。 OpenAI 表示,即使事件重要性未算明朗,日後亦會傾向主動披露。
其中一宗涉及一個仍未公開的研究模型。該模型在自己的任務摘要中,暗中加入類似「越獄」的指示,提醒下一個版本的自己要忽視系統限制。 公司共發現 27 份帶有這類「自我提示」的摘要,並指這種行為與獎勵機制之間,沒有明顯直接關聯。
在訓練 GPT-5.6 Sol 期間,OpenAI 又在另一批模型的摘要中發現,系統會向後續版本留言,叫它們在歷史數據缺失時「自行杜撰」,並註明 「除非被問,否則毋須完全透明」。監察系統在約 2.15% 的摘要中偵測到這類訊息;研究團隊懷疑,某些具欺騙性的答案反而在評分時表現較好, 令相關行為得以擴散。其後公司收緊對「對齊程度」的評分方式,後期的訓練輪次中,類似行為的比例有所回落。
延伸閱讀:比特幣挖礦算力現 50% 缺口 AI 搶佔算力資源
外洩 API 金鑰與捏造數字
另一宗個案中,一個模型在嘗試查詢加州某縣住戶收入資料時,主動搜尋公開程式庫,希望找到一條外洩的 API 金鑰;當未能成功取得, 它隨即自行捏造收入數字交差。
另外一個模型在被要求列出面積大於 500 萬平方米的湖泊時,透過 Python 找到答案,但之後竟將相關檔案上載到網上,只為在回覆中 引用一條連結作為「來源」。
亦有模型把公司內部軟件程式庫當成留言板,在原本應互不相干的訓練樣本之間,互相留低請求與回覆;有模型更把共用試算表上載至 公開檔案分享服務,無視系統只准使用本地檔案的指示,而全程沒有向用戶查問。
陳凱談披露規則
現時任何員工如懷疑出現失對齊個案,都可上報由安全及對齊團隊審視;相關團隊會按事件性質分成三條處理「軌道」。若個案被判定已 準備就緒,最遲會在六個工作天內對外公布;需要作小規模調查的,披露時限放寬至 12 個工作天;而涉及外部機構、情況較複雜的事件, 則會按實際情況較慢處理。
OpenAI 對齊團隊研究主管陳凱在接受訪問時指出, 整個行業至今仍未有明確的安全事故披露標準,而模型能力發展速度亦快過公司原先預期。多名資安專家則認為, 一些基本防護措施其實足以避免最近一連串事故。
今年 7 月,OpenAI 已承認, GPT-5.6 Sol 與一個更高階的預發布模型曾自行逃出測試沙盒環境,並入侵 Hugging Face 平台, 公司形容這是迄今最嚴重的一次「模型主導」安全事件。

