OpenAI揭露六起AI「掩蓋錯誤」案例 推出新通報架構

Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)
Three researchers were fired by OpenAI over alleged mishandling of sensitive information (Image: Shutterstock)

OpenAI公開六起AI模型掩蓋錯誤、試圖使用外洩API金鑰與擅自將檔案發佈到公開網路的事件,並同步推出一套針對此類行為的通報與揭露框架。

重點整理:

  • OpenAI公布過去六個月觀察到的六份「模型失準行為」報告。
  • 其中一個模型在嘗試使用外洩API金鑰失敗後,捏造加州郡收入數據。
  • 任何員工現在都可以通報事件,經評估後有機會對外公開。

OpenAI「失準行為」報告出爐

該公司於週三在一篇部落格文章中,同步發布六起案例與一套新的內部流程,目標是在研究人員尚未完全釐清成因或修正行為前,也能更快對外揭露。最早的案例可回溯至去年10月,最新一件則是在今年7月才被發現。OpenAI表示,即便事件的重要性尚不明朗,也會傾向主動通報。

在其中一案,一個尚未對外發布的研究模型,會在自己的任務摘要中偷偷嵌入類似「越獄(jailbreak)」的指令,指示下一個接手任務的自身副本忽略原本的限制。公司統計共發現27則這類摘要,而且看不出模型這麼做可以獲得什麼明顯的獎勵。

在訓練 GPT-5.6 Sol 的過程中,其他實例則會留下訊息,要求之後的模型在缺資料時「自行編造歷史數據」,並註明「除非被問到,否則不要主動說明」。監控系統在約2.15%的摘要中偵測到這種行為,研究團隊推測,這類帶有欺瞞成分的回答往往在評分上表現較佳,因此有「擴散」傾向。之後在調整對齊(alignment)評分方式、收緊標準後,後續訓練批次中這類行為出現頻率已明顯下降。

延伸閱讀: 比特幣挖礦算力恐現50%缺口 AI搶吃運算資源

外洩API金鑰與捏造數據

另一個模型在被要求查詢加州某郡居民所得時,主動搜尋公開程式庫,希望找到可用的外洩API金鑰;在未能成功後,乾脆自行編造收入數字回覆用戶。另有一個模型在被要求找出面積大於500萬平方公尺的湖泊時,透過Python程式算出結果,接著把檔案上傳到網路上,只為了能在回答中「引用一個連結」。

還有模型把內部軟體程式庫當成留言板,在原本應該互相獨立的訓練樣本間,來回交換請求與答案。另一些模型則把共享試算表上傳到公開檔案託管服務,儘管指示明確要求只能使用本機檔案。這些行為全都沒有徵詢或確認使用者授權。

陳愷談揭露新規則

目前只要是OpenAI員工,一旦懷疑發生「模型失準」事件,都可以通報由安全與對齊團隊進行審查,之後再依情況分流到三種處理軌道:若判定已準備就緒,案件需在六個工作天內對外公布;若需小規模調查,期限為12個工作天;至於牽涉外部單位、情節較為複雜者,則會採較長時程。

OpenAI對齊團隊研究負責人 **Kai Chen(陳愷)**在接受訪問時指出,目前產業內尚未形成具體而明確的揭露標準框架,而模型能力的演進速度也超出公司原先預期。許多資安專家則認為,若一開始就建立基本防護措施,近期一連串事件其實有機會被阻止。

今年7月,OpenAI已承認,GPT-5.6 Sol與一款更強大的預發布模型,曾在測試環境中突破沙盒限制,侵入Hugging Face系統,這被公司形容為迄今最嚴重的一次「模型主導」安全事件。

下一步閱讀: 柴犬幣修復Shibarium錢包連結故障 但SHIB一週跌6%

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容主管。他專長於撰寫深入的研究與學習型文章,著重於分析報導、產業脈絡,以及從 AI 時代與安全技術到金融科技創新等塑造加密貨幣領域的宏觀力量。他相信數位世界即將全面超越類比世界,並正為實現這一願景而努力不懈。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI揭露六起AI「掩蓋錯誤」案例 推出新通報架構 | Yellow