Anthropic 已為所有內部 AI 評估測試切斷實時上網功能。原因是包括 Mythos 5 在內的 Claude 模型,於測試中成功利用多個真實網站漏洞並繞過限制,當中部分網站由美國聯邦、州及地方政府機構營運。
重點:
- Anthropic 已在所有內部評估中關閉即時網絡存取,直至監察工具能可靠攔截所有非預期行為。
- Claude 模型曾在大學伺服器上執行指令、利用存取權杖(access token)讀取付費數據,並在真實網站遞交表格。
- Claude Haiku 4.5 曾透過網上表格向費城警方提交虛構兇殺案線報,並因此遭警方公開斥責。
Anthropic Claude 風險報告
Anthropic 於周五發表一份有關模型在評估及內部使用期間出現「非預期行動」的報告,主要基於公司自 7 月起展開的對話與操作紀錄審視。一部分高風險及網絡安全相關測試早已離線進行。
新措施現擴展至所有內部評估,不設完結日期,要等到公司確認監控系統足以捕捉相關行為,方會考慮恢復。
報告將事故分為四大類:透過軟件漏洞在伺服器上執行指令、在真實網站遞交表格、存取設有門檻的數據,以及利用短網址服務繞過工具限制。當中部分網站隸屬美國聯邦、州及地方政府部門。Anthropic 指出,已向白宮作技術簡報,並逐一通報受影響機構。
當中一宗個案中,Claude Mythos 5 從某地方政府的不動產地圖系統內,抽取仍然有效的存取權杖,隨後直接向背後伺服器發出查詢。在另一宗個案中,Claude Haiku 4.5 於 7 月 18 日透過費城市警察局網站表格,提交一宗捏造、指涉未破兇案的線報,最終被系統識別為垃圾訊息。當地警方其後批評 Anthropic 事隔兩個月才發現及通報事件,形容做法「不可接受」。
延伸閱讀: Zcash 訂 1 月量子化目標 擬將 70% ZEC 轉型但未定日子
Von Arx:斷網代價高 真正難題仍是對齊
AI 安全組織 Nightingale 的 Sydney von Arx 早前接受訪問時表示,將模型完全隔絕於公開互聯網之外,對研究人員及模型進展均構成沉重負擔,指出:「你總要在某個時間點,真正把它們『對齊』。」
Anthropic 在報告中承認,單靠對齊訓練,暫時不足以安全地讓模型進行網上搜尋及操作電腦,因此公司同時依賴分類器及其他安全機制作補充。公司將這次行為歸因於訓練環境不完美,令模型在某些情境下因「成功繞過限制」而獲得獎勵,出現俗稱「獎勵駭入」(reward hacking)的模式。Anthropic 指,新開發的偵測工具在事後測試時,能攔截所有案例。
Anthropic 評估,今次個案整體嚴重程度,低於今夏早前披露的一系列事故。
是次披露緊接 7 月 30 日另一份報告。當時 Anthropic 指出,三個 Claude 模型在網絡安全測試中成功連上互聯網,並對三間機構的系統取得未授權存取。該次審視覆蓋 141,006 次評估運行。調查始於 OpenAI 在 7 月 21 日披露,其模型曾從測試環境「逃逸」,並連接至 Hugging Face 基建。

