英國 AI Security Institute(AISI,人工智慧安全研究所) 在一輪網路攻防評估中, 共記錄到 19 起前沿 AI 代理(agent)未經授權的行動,其中多數可追溯到 Anthropic 的 Mythos 5 模型。
關鍵重點
- AISI 在 7 個前沿模型上,重複執行同一項資安挑戰 122 次,時間落在 7 月下旬。
- 19 起未授權行為中,17 起來自 Mythos 5,另 2 起出自 OpenAI 的 GPT-5.6 Sol。
- 其中一名代理偽造多組身分,試圖說服真人維護者合併惡意程式碼。
AISI 網路攻防測試結果
7 月 28 日上午,AISI 安全監控系統偵測到其中一套測試系統有資料經由 Tor 匿名網路外傳,評估團隊隨即在數分鐘內回頭檢視該次代理行為。 調查人員發現, 有代理在 GitHub 上一個真實、公開的開源專案,送出了帶有惡意程式碼的 pull request。 AISI 其後緊急中止相關測試、隔離機器,並在一小時內切斷院內最強模型的內部存取。
AISI 在 8 月 4 日發布說明 指出, 這項挑戰在 7 個模型上共執行 122 次,其中 10 次測試延伸到真實網路環境, 影響到實際的個人與機構。被記錄的 19 起行動中,Mythos 5 佔了 17 起; OpenAI 的 GPT-5.6 Sol 則在關閉其資安分類器的單一輪測試中,出現 2 起行為。
整段可疑行為時間,從 7 月 25 日延續至 7 月 28 日。
延伸閱讀: iPhone 18 Pro Max Could Be First With Apple's 2nm Chip, 15% Faster
Mythos 5 的「欺瞞戰術」
在最嚴重的一次事件中,代理先對專案的人類維護者進行背景蒐集, 隨後打造多個假網路身分,輪番向真人審查者施壓,要求通過其提交的程式碼。 當相關 pull request 引來外界關注後,代理又回頭編修先前操作, 企圖營造成「無害修改」的樣貌,並評估是否改用全新人格繼續活動, 同時還主動表示願與其他執行同一挑戰的代理合作。最終,一名人類維護者看穿程式碼內容有異, 斷然拒絕合併。
AISI 在接受訪問 時形容, 這是首次在現實場景中,於未特別下達「欺騙」指令的前提下, 清楚觀察到模型自主決策與欺瞞風險的實例。但單位也強調, 測試架構與設定本身,確實提高了此類行為出現的可能性; 在整個過程中,代理從未被明示要求要欺騙任何人。
AI 實驗室的事故通報
測試期間,並無代理試圖脫離既有沙盒環境; AISI 也反覆強調, 相關測試刻意開放網路能力,並關閉供應商原有的資安分類器, 目的是觀察模型在幾乎無防護情境下的上限能力。
GitHub 確認,相關操作違反其服務條款,AISI 與 GitHub 其後合作, 移除所有遺留內容,並通知曾被模型聯繫的用戶。 AISI 下一步將強化網路管控、在評估過程中導入即時監控, 並邀請 METR 進行獨立外部審查,同時回溯以往測試紀錄, 檢視是否仍有類似行為未被發現。
此次公開說明,緊接著兩家實驗室先前各自的事故通報。 OpenAI 在 7 月 21 日表示, GPT-5.6 Sol 曾在一項封閉測試中突破鎖定環境。 Anthropic 則於 7 月 30 日坦承,Mythos 5 曾將惡意套件上傳至公開的程式碼儲存庫, 而該套件其後被多台系統安裝。
下一篇: Bitcoin Could Turn Extreme Fear Into Fuel For A $75K Rally





