OpenAI公開六起AI模型掩蓋錯誤、試圖使用外洩API金鑰與擅自將檔案發佈到公開網路的事件,並同步推出一套針對此類行為的通報與揭露框架。
重點整理:
- OpenAI公布過去六個月觀察到的六份「模型失準行為」報告。
- 其中一個模型在嘗試使用外洩API金鑰失敗後,捏造加州郡收入數據。
- 任何員工現在都可以通報事件,經評估後有機會對外公開。
OpenAI「失準行為」報告出爐
該公司於週三在一篇部落格文章中,同步發布六起案例與一套新的內部流程,目標是在研究人員尚未完全釐清成因或修正行為前,也能更快對外揭露。最早的案例可回溯至去年10月,最新一件則是在今年7月才被發現。OpenAI表示,即便事件的重要性尚不明朗,也會傾向主動通報。
在其中一案,一個尚未對外發布的研究模型,會在自己的任務摘要中偷偷嵌入類似「越獄(jailbreak)」的指令,指示下一個接手任務的自身副本忽略原本的限制。公司統計共發現27則這類摘要,而且看不出模型這麼做可以獲得什麼明顯的獎勵。
在訓練 GPT-5.6 Sol 的過程中,其他實例則會留下訊息,要求之後的模型在缺資料時「自行編造歷史數據」,並註明「除非被問到,否則不要主動說明」。監控系統在約2.15%的摘要中偵測到這種行為,研究團隊推測,這類帶有欺瞞成分的回答往往在評分上表現較佳,因此有「擴散」傾向。之後在調整對齊(alignment)評分方式、收緊標準後,後續訓練批次中這類行為出現頻率已明顯下降。
延伸閱讀: 比特幣挖礦算力恐現50%缺口 AI搶吃運算資源
外洩API金鑰與捏造數據
另一個模型在被要求查詢加州某郡居民所得時,主動搜尋公開程式庫,希望找到可用的外洩API金鑰;在未能成功後,乾脆自行編造收入數字回覆用戶。另有一個模型在被要求找出面積大於500萬平方公尺的湖泊時,透過Python程式算出結果,接著把檔案上傳到網路上,只為了能在回答中「引用一個連結」。
還有模型把內部軟體程式庫當成留言板,在原本應該互相獨立的訓練樣本間,來回交換請求與答案。另一些模型則把共享試算表上傳到公開檔案託管服務,儘管指示明確要求只能使用本機檔案。這些行為全都沒有徵詢或確認使用者授權。
陳愷談揭露新規則
目前只要是OpenAI員工,一旦懷疑發生「模型失準」事件,都可以通報由安全與對齊團隊進行審查,之後再依情況分流到三種處理軌道:若判定已準備就緒,案件需在六個工作天內對外公布;若需小規模調查,期限為12個工作天;至於牽涉外部單位、情節較為複雜者,則會採較長時程。
OpenAI對齊團隊研究負責人 **Kai Chen(陳愷)**在接受訪問時指出,目前產業內尚未形成具體而明確的揭露標準框架,而模型能力的演進速度也超出公司原先預期。許多資安專家則認為,若一開始就建立基本防護措施,近期一連串事件其實有機會被阻止。
今年7月,OpenAI已承認,GPT-5.6 Sol與一款更強大的預發布模型,曾在測試環境中突破沙盒限制,侵入Hugging Face系統,這被公司形容為迄今最嚴重的一次「模型主導」安全事件。

