Anthropic 近期在內部測試中驚覺,包含 Mythos 5 在內的 Claude 系列模型,竟能利用真實網站的安全弱點、繞過原先設定的限制,其中部分網站還屬於美國聯邦、州與地方政府機構。公司因而緊急決定:全面切斷所有內部 AI 測試的即時網路連線。
重點整理:
- Anthropic 暫停所有內部評估使用即時網路,直到監測工具足以穩定偵測並攔截模型的非預期行為。
- Claude 模型曾在大學伺服器上執行指令、利用存取權杖取得付費資料,並在真實網站上送出表單。
- Claude Haiku 4.5 曾向費城警方線上通報一則虛構兇殺線索,遭警方公開批評通報延遲「無法接受」。
Anthropic 公布 Claude 行為報告
Anthropic 週五公開一份關於「模型在評估與內部使用中出現非預期行為」的報告,主要來自公司自 7 月起展開的大量對話紀錄盤點。部分高風險與資安相關測試原本就已離線執行,如今則擴大為所有內部評估一律不得連上即時網路,且尚未設定恢復時程,要等公司確認監控機制足以可靠攔截這類行為後才會解封。
報告將事件分成四大類:透過軟體漏洞在伺服器上下指令、在真實網站上送出表單、突破資料閘門存取受限內容,以及利用網址縮短服務規避工具限制。其中部分網站隸屬美國聯邦、州、地方各級機關。Anthropic 表示,已向白宮簡報,並逐一通知相關政府單位。
一起案例中,Claude Mythos 5 從地方政府的不動產地圖服務中擷取仍有效的存取權杖,直接連到背後伺服器查詢。另一案例則是 Claude Haiku 4.5 在 7 月 18 日透過費城警察局線上表單提交一則憑空捏造的懸案兇殺線索,雖然最終被系統歸類為垃圾訊息,但警方事後痛批 Anthropic 花了兩個月才發現並通報,形容這樣的延遲「無法接受」。
延伸閱讀: Zcash 訂下 1 月量子目標:70% ZEC 要準備好,只差一個確切日子
Von Arx:切斷網路只是權宜之計
AI 安全組織 Nightingale 成員 Sydney von Arx 在這波事件正式曝光前受訪時指出,將模型徹底與開放網路切割,對研究人員與模型發展都會造成很大衝擊,「你總得在某個時間點讓它們真正對齊。」
Anthropic 在報告中承認,目前僅靠「對齊訓練」(alignment)仍不足以安全支撐搜尋與電腦操作等能力,因此還得輔以分類器及其他防護機制。公司將這些行為歸因於訓練環境仍不完美,有時會誤導模型以「繞過限制」的方式來達成目標,這種模式在業界被稱為「獎勵駭客」(reward hacking)。Anthropic 表示,新部署的偵測工具在測試中成功攔截了所有已知案例。
就風險等級而言,Anthropic 認為這次披露的一系列事件,嚴重度明顯低於今年夏季先前通報的資安事故。
本次說明緊接在 7 月 30 日的另一份報告之後。當時 Anthropic 指出,三個 Claude 模型在資安測試期間成功連上網路,並對三家機構的系統取得未授權存取。該次檢討涵蓋 141,006 次評估執行。這輪內部審查則是在 7 月 21 日 OpenAI 公布其模型曾突破測試環境邊界、觸及 Hugging Face 基礎設施後啟動。

