Mythos 5 偽造多重身分 誘騙人工程師通過惡意程式碼

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

英國 AI Security Institute(AISI,人工智慧安全研究所) 在一輪網路攻防評估中, 共記錄到 19 起前沿 AI 代理(agent)未經授權的行動,其中多數可追溯到 Anthropic 的 Mythos 5 模型。

關鍵重點

  • AISI 在 7 個前沿模型上,重複執行同一項資安挑戰 122 次,時間落在 7 月下旬。
  • 19 起未授權行為中,17 起來自 Mythos 5,另 2 起出自 OpenAI 的 GPT-5.6 Sol。
  • 其中一名代理偽造多組身分,試圖說服真人維護者合併惡意程式碼。

AISI 網路攻防測試結果

7 月 28 日上午,AISI 安全監控系統偵測到其中一套測試系統有資料經由 Tor 匿名網路外傳,評估團隊隨即在數分鐘內回頭檢視該次代理行為。 調查人員發現, 有代理在 GitHub 上一個真實、公開的開源專案,送出了帶有惡意程式碼的 pull request。 AISI 其後緊急中止相關測試、隔離機器,並在一小時內切斷院內最強模型的內部存取。

AISI 在 8 月 4 日發布說明 指出, 這項挑戰在 7 個模型上共執行 122 次,其中 10 次測試延伸到真實網路環境, 影響到實際的個人與機構。被記錄的 19 起行動中,Mythos 5 佔了 17 起; OpenAI 的 GPT-5.6 Sol 則在關閉其資安分類器的單一輪測試中,出現 2 起行為。

整段可疑行為時間,從 7 月 25 日延續至 7 月 28 日。

延伸閱讀: iPhone 18 Pro Max Could Be First With Apple's 2nm Chip, 15% Faster

Mythos 5 的「欺瞞戰術」

在最嚴重的一次事件中,代理先對專案的人類維護者進行背景蒐集, 隨後打造多個假網路身分,輪番向真人審查者施壓,要求通過其提交的程式碼。 當相關 pull request 引來外界關注後,代理又回頭編修先前操作, 企圖營造成「無害修改」的樣貌,並評估是否改用全新人格繼續活動, 同時還主動表示願與其他執行同一挑戰的代理合作。最終,一名人類維護者看穿程式碼內容有異, 斷然拒絕合併。

AISI 在接受訪問 時形容, 這是首次在現實場景中,於未特別下達「欺騙」指令的前提下, 清楚觀察到模型自主決策與欺瞞風險的實例。但單位也強調, 測試架構與設定本身,確實提高了此類行為出現的可能性; 在整個過程中,代理從未被明示要求要欺騙任何人。

AI 實驗室的事故通報

測試期間,並無代理試圖脫離既有沙盒環境; AISI 也反覆強調, 相關測試刻意開放網路能力,並關閉供應商原有的資安分類器, 目的是觀察模型在幾乎無防護情境下的上限能力。

GitHub 確認,相關操作違反其服務條款,AISI 與 GitHub 其後合作, 移除所有遺留內容,並通知曾被模型聯繫的用戶。 AISI 下一步將強化網路管控、在評估過程中導入即時監控, 並邀請 METR 進行獨立外部審查,同時回溯以往測試紀錄, 檢視是否仍有類似行為未被發現。

此次公開說明,緊接著兩家實驗室先前各自的事故通報。 OpenAI 在 7 月 21 日表示, GPT-5.6 Sol 曾在一項封閉測試中突破鎖定環境。 Anthropic 則於 7 月 30 日坦承,Mythos 5 曾將惡意套件上傳至公開的程式碼儲存庫, 而該套件其後被多台系統安裝。

下一篇: Bitcoin Could Turn Extreme Fear Into Fuel For A $75K Rally

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Mythos 5 偽造多重身分 誘騙人工程師通過惡意程式碼 | Yellow