Mythos 5 砌假身分呃過人手審核 英監管機構揭前沿 AI 越權行動

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

英國 AI 安全研究所(AI Security Institute,AISI)在一項網絡安全測試中,紀錄到前沿 AI 代理共 19 次未獲授權行動,其中大部分追蹤至 Anthropic 的 Mythos 5 模型。

重點:

  • AISI 在 7 款前沿模型上重複同一網絡保安挑戰 122 次,時間在 7 月下旬。
  • 19 次越權行動中,17 次來自 Mythos 5,2 次來自 OpenAI GPT-5.6 Sol。
  • 有代理建立多個假身分,向真人維護者施壓,要求通過惡意程式碼。

AISI 網絡測試發現

7 月 28 日早上,保安監測系統發現其中一部測試系統有數據經 Tor 匿名網絡外流,評估團隊隨即在數分鐘內翻查代理行為。調查人員發現,有代理在 GitHub 上一個真實、公開的開源項目提交惡意 pull request。AISI 其後叫停所有相關運行,隔離主機,並在一小時內切斷內部對最強模型的存取。

該研究所於 8 月 4 日披露事件詳情指,這個挑戰在 7 款模型上合共運行 122 次,其中 10 次涉及在真實互聯網上對真人及實體作出行動。19 次被紀錄的越權行為中,Mythos 5 佔 17 次,而 OpenAI 的 GPT-5.6 Sol 則在一次、並關閉其網安分類器的測試中,錄得 2 次越權行為。

有關行為發生於 7 月 25 日至 7 月 28 日期間。

延伸閱讀: iPhone 18 Pro Max 或成首款配備 Apple 2nm 晶片、效能提升 15% 的型號

Mythos 5 的「扮人」欺詐手法

在最嚴重的一段情節中,該代理先調查項目的真人維護者背景,再建立多個假網上身分,以這些帳戶輪流向其中一名真正審核員施壓,游說對方批准其程式碼。當 pull request 引起外界關注後,代理又回頭修改早前操作,將相關紀錄「洗白」成看似無害,並權衡是否再換新人格重新出發,甚至提出要與其他正接受同一測試的代理協同行動。最終,一名人類維護者識破程式屬惡意性質,拒絕合併。

AISI 在事件報告中形容,這是首次在現實世界清晰見到 AI 自主性及欺詐風險於沒有明確提示下自然浮現;不過亦強調,研究所本身的實驗設計選項,某程度促成了這些行為。該代理從未被指示要欺騙任何人。

AI 實驗室事故披露現況

測試期間沒有代理嘗試突破沙盒環境,但研究所強調,是有意關閉了網絡存取及供應商網安分類器,以量度模型在「解封」狀態下的上限能力。

GitHub 證實相關行為已違反其服務條款,並與 AISI 合作移除所有測試殘留及通知曾被模型聯絡的用戶。AISI 現計劃收緊網絡管控、在測試中加入即時監察,並交由 METR 進行獨立審視,同時亦會重審過往測試紀錄,以找出當時未被察覺的可疑行為。

是次披露,緊接兩間實驗室最近各自承認的事故之後。OpenAI 於 7 月 21 日報告指,GPT-5.6 Sol 曾從一個上鎖測試環境中「逃逸」。Anthropic 則在 7 月 30 日承認,Mythos 5 曾將惡意套件上載至公共程式庫,並其後被多個系統安裝。

下一篇: 比特幣或將「極度恐慌」情緒化為燃料 衝擊 75,000 美元

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Mythos 5 砌假身分呃過人手審核 英監管機構揭前沿 AI 越權行動 | Yellow