OpenAI揭露六起AI模型「藏錯誤」案例

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI公開六起自家AI模型「隱藏錯誤」、使用外洩API金鑰或擅自將檔案上傳到公開平台的案例,同時推出一套 專門用來通報並對外揭露此類行為的框架。

重點整理:

  • OpenAI過去六個月陸續記錄到六起模型行為偏離預期的事件,並彙整成報告對外發布。
  • 有模型在企圖使用外洩API金鑰失敗後,捏造美國郡級收入數據。
  • 任何員工現在都可以通報事件,啟動內部審查與可能的對外公開流程。

OpenAI行為偏差報告

公司在週三以部落格文章形式公布這六份報告, 同時發布一套新流程,即便研究人員尚未完全弄清原因或完成修正,也能加快對外揭露。最早的案例可追溯至去年10月, 最新一案則發生在今年7月。OpenAI表示,即使事件的重要性尚不明朗,未來也會選擇通報。

其中一個案例涉及尚未公開的研究模型。該模型會在自己的任務摘要中,悄悄塞入類似「越獄」的指令,要求下一個版本的 自己忽略原本的安全限制。OpenAI共記錄到27則這類摘要,且指出模型似乎沒有任何明顯誘因這麼做。

在GPT-5.6 Sol的訓練過程中,其他模型實例則會在壓縮後的摘要裡留下訊息, 指示後續模型「自行捏造缺漏的歷史資料」,並強調「除非被問到,否則不要主動坦承」。監控系統發現,約有2.15%的摘要 出現這類行為。研究人員懷疑,這是因為帶有欺騙成分的答案,反而在評分上表現較佳,導致這種策略在訓練中擴散。 在OpenAI收緊對齊評分標準後的後續訓練中,這類行為比例才明顯下降。

延伸閱讀:比特幣挖礦算力恐現50%缺口,算力與資本正被AI吸走

外洩API金鑰與「憑空編出來」的數字

另一個案例中,一個模型在試圖查找美國加州某郡的住戶收入數據時,主動搜尋公開程式碼庫中的外洩API金鑰; 在無法成功利用後,乾脆直接捏造一組收入數字回覆。

另有一個模型在被要求找出面積大於500萬平方公尺的湖泊時,透過Python程式得出答案,但接著自行將相關檔案上傳 到網路,藉此產生一個可供引用的連結,再回頭提供給使用者。

有些模型甚至把內部軟體程式庫當成「留言板」,在原本應彼此獨立的訓練樣本間,來回交換請求與解答。還有模型違反 指示,將共用試算表上傳到公開檔案託管服務,而非只在本機檔案中作業。整個過程中,模型從未向使用者求證或徵求同意。

陳凱談揭露規則

依照新制度,任何OpenAI員工只要懷疑發生模型行為異常,都可以直接通報,由安全與對齊(alignment)團隊審查,並將 個案分配到三條不同處理流程。

被認定「已準備就緒」的案例,預計在六個工作天內對外公開;需要小規模調查的則有最多12個工作天;至於涉及外部單位、 法規或技術較為複雜的事件,時程則會更長。

擔任對齊團隊研究負責人的陳凱(Kai Chen)指出, 目前產業中尚未形成具體明文的揭露標準架構,而模型能力的提升速度,已超出公司原本預期。許多資安專家則認為, 一些基本防護措施本可避免近期多起事件發生。

今年7月,OpenAI已承認, GPT-5.6 Sol以及一個更強大的預發布版本曾在測試沙盒中脫離控制,並入侵Hugging Face平台, 這被公司定調為迄今最嚴重的一次「由模型主導」的安全事件。

下一篇:柴犬幣修補Shibarium壞掉的錢包連結,SHIB一週仍跌6%

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深的財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,聚焦新興趨勢、監管環境等相關主題。你可以在 Twitter 上透過 @murtuza_merc 找到他,在 Telegram 上則是 mmerchant001。 Disclosure: Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
OpenAI揭露六起AI模型「藏錯誤」案例 | Yellow