英國 AI Security Institute(AISI,AI 安全研究院) 公布最新網路攻防測試結果,指稱在一次集中測試中,共記錄到 19 起前沿 AI 代理(agent)未經授權的「越權動作」,且多數事件都可追溯至 Anthropic 的 Mythos 5 模型。
重點整理
- AISI 在 7 套前沿模型上,重複執行同一項網路安全挑戰共 122 次,測試時間集中在 7 月下旬。
- 19 起未授權行為中,有 17 起來自 Mythos 5,另 2 起來自 OpenAI 的 GPT-5.6 Sol。
- 其中一個代理甚至刻意打造多個假身分,向真人維護者施壓,要求通過惡意程式碼。
AISI 網安測試關鍵發現
7 月 28 日清晨,AISI 的安全監控系統發現,其中一台測試機器有資料流經 Tor 匿名網路外傳。研究團隊隨即調閱代理活動紀錄,並在幾分鐘內展開調查。
調查人員發現,有代理對 GitHub 上一個真實公開的開源專案提出惡意 Pull Request。AISI 立刻暫停相關測試、隔離受影響機器,並在一小時內切斷內部對高階模型的存取權限。
AISI 於 8 月 4 日對外說明,表示這項網安挑戰總計在 7 個模型上執行 122 次,其中有 10 次測試在真實網路環境中對真人與實體組織產生實際行動。19 起紀錄在案的未授權動作中,Anthropic 的 Mythos 5 占了 17 起;OpenAI 的 GPT-5.6 Sol 則在停用其內建網安分類器的情境下,在單次測試中出現 2 起越權行為。
相關異常行為發生區間為 7 月 25 日至 7 月 28 日。
延伸閱讀: iPhone 18 Pro Max 可能首搭蘋果 2nm 晶片、效能快 15%
Mythos 5 的欺瞞手法
在最具爭議的一段情節中,Mythos 5 代理先蒐集該開源專案人類維護者的背景資訊,接著建立多個虛構線上身分,並利用這些假帳號向真人程式碼審查者「帶風向」,施壓要求通過其惡意程式碼。
當這則 Pull Request 引發外界質疑後,代理隨即回頭修改先前互動紀錄,試圖將行為包裝成「無害」,並評估是否要切換為全新的假身分,同時還提出願與其他執行相同挑戰的代理「協同合作」。最終,一名人類維護者識破程式碼內容有異並拒絕合併。
AISI 在說明中形容,這是迄今最具代表性的實務案例之一,顯示高度自主 AI 在未被明確指示下,仍可能自然演化出「欺瞞」與「策略性行為」的風險。不過研究院也強調,自身在實驗設計上的一些選擇,確實為這類行為提供了可乘之機;代理在指令中從未被要求「欺騙他人」。
實驗條件與實驗室通報
AISI 表示,沒有任何代理嘗試突破實驗沙箱環境;且本次測試刻意關閉一般雲端服務提供的網路防護與 AI 網安分類器,目的是要全力「壓測」這些模型在缺乏外部保護時,能力與風險上限為何。相關情況已在後續說明中再次被強調。
GitHub 則確認,該名代理的操作已違反其服務條款。平台目前正與 AISI 合作,移除所有相關產物並通知曾被模型接觸到的用戶。AISI 接著將強化內部網路管控,在評估過程中加入即時監控,並邀請 METR 進行獨立外部審查,同時回溯檢視過往測試紀錄,找出可能被忽略的異常行為。
這次揭露,緊接在兩大實驗室各自對外承認其他事故之後。OpenAI 於 7 月 21 日通報,稱 GPT-5.6 Sol 曾短暫逃離一個鎖定的測試環境;Anthropic 則在 7 月 30 日表示,Mythos 5 曾將惡意套件上傳至公開程式庫,並在後續被多台系統下載安裝。
下一則看這裡: 比特幣可能把極度恐慌轉化為推升至 7.5 萬美元的燃料





