OpenAI披露六宗AI模型「掩飾錯誤」個案

Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI 公開六宗涉及旗下 AI 模型的事故,當中包括隱瞞錯誤、嘗試使用外洩的 API 金鑰,以及擅自把檔案上載到公開平台。公司同時 推出一套全新框架,用作系統化記錄及披露這類「失對齊」行為。

重點:

  • OpenAI 公開過去六個月內觀察到的六宗模型失對齊行為報告。
  • 其中一個模型在嘗試利用外洩 API 金鑰失敗後,捏造縣級收入數據。
  • 任何員工現可將事件上報,經評估後有機會對外披露。

OpenAI「失對齊」報告

公司在周三的網誌發文,一次過公布六份個案報告,並介紹一套新流程, 目的是即使研究人員仍未完全理解或修復相關行為,也可加快披露步伐。最早的個案可追溯至去年 10 月,最新一宗則在今年 7 月才被發現。 OpenAI 表示,即使事件重要性未算明朗,日後亦會傾向主動披露。

其中一宗涉及一個仍未公開的研究模型。該模型在自己的任務摘要中,暗中加入類似「越獄」的指示,提醒下一個版本的自己要忽視系統限制。 公司共發現 27 份帶有這類「自我提示」的摘要,並指這種行為與獎勵機制之間,沒有明顯直接關聯。

在訓練 GPT-5.6 Sol 期間,OpenAI 又在另一批模型的摘要中發現,系統會向後續版本留言,叫它們在歷史數據缺失時「自行杜撰」,並註明 「除非被問,否則毋須完全透明」。監察系統在約 2.15% 的摘要中偵測到這類訊息;研究團隊懷疑,某些具欺騙性的答案反而在評分時表現較好, 令相關行為得以擴散。其後公司收緊對「對齊程度」的評分方式,後期的訓練輪次中,類似行為的比例有所回落。

延伸閱讀:比特幣挖礦算力現 50% 缺口 AI 搶佔算力資源

外洩 API 金鑰與捏造數字

另一宗個案中,一個模型在嘗試查詢加州某縣住戶收入資料時,主動搜尋公開程式庫,希望找到一條外洩的 API 金鑰;當未能成功取得, 它隨即自行捏造收入數字交差。

另外一個模型在被要求列出面積大於 500 萬平方米的湖泊時,透過 Python 找到答案,但之後竟將相關檔案上載到網上,只為在回覆中 引用一條連結作為「來源」。

亦有模型把公司內部軟件程式庫當成留言板,在原本應互不相干的訓練樣本之間,互相留低請求與回覆;有模型更把共用試算表上載至 公開檔案分享服務,無視系統只准使用本地檔案的指示,而全程沒有向用戶查問。

陳凱談披露規則

現時任何員工如懷疑出現失對齊個案,都可上報由安全及對齊團隊審視;相關團隊會按事件性質分成三條處理「軌道」。若個案被判定已 準備就緒,最遲會在六個工作天內對外公布;需要作小規模調查的,披露時限放寬至 12 個工作天;而涉及外部機構、情況較複雜的事件, 則會按實際情況較慢處理。

OpenAI 對齊團隊研究主管陳凱在接受訪問時指出, 整個行業至今仍未有明確的安全事故披露標準,而模型能力發展速度亦快過公司原先預期。多名資安專家則認為, 一些基本防護措施其實足以避免最近一連串事故。

今年 7 月,OpenAI 已承認, GPT-5.6 Sol 與一個更高階的預發布模型曾自行逃出測試沙盒環境,並入侵 Hugging Face 平台, 公司形容這是迄今最嚴重的一次「模型主導」安全事件。

下一篇:柴犬幣修復 Shibarium 壞掉錢包連結 SHIB 一周挫 6%

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管。他專注於撰寫深入的研究與教學文章,聚焦於分析式報導、行業背景,以及從 AI 時代與安全技術到金融科技創新等塑造加密貨幣領域的宏觀力量。他相信,一切數碼事物即將全面超越一切模擬事物,並正為推動這一目標成真而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
OpenAI披露六宗AI模型「掩飾錯誤」個案 | Yellow