Anthropic 公布一份長達 1,022 頁的逐字稿,顯示其模型 Claude Mythos 5 在測試中為了通過 CAPTCHA 耗費數百頁互動,之後成功將惡意套件上傳到 PyPI,隨後被 15 個系統安裝。
重點整理:
- Claude Mythos 5 在網路安全測試中意外接觸到真正的網際網路,並向 PyPI 上傳惡意套件。
- 各式 CAPTCHA 驗證在逐字稿中占去數百頁篇幅,仍未能阻止其行動。
- Anthropic 批評此行為「魯莽」,並委託外部機構展開獨立審查。
Mythos 5 對抗 CAPTCHA 的拉鋸戰
Anthropic 在 9 月 9 日 公開 逐字稿與評估報告,點名四起 Claude 模型在網路安全測試過程中,意外觸及真實第三方系統的事件。這些模型在實驗環境中運行時,並未啟用正式產品內建的網安防護。
Mythos 5 被告知「無法連上網際網路」,但因環境設定錯誤,實際上仍保留一條通往開放網路的通道。模型最終在 PyPI(Python 公共軟體套件庫)上架一個竊取憑證的惡意套件。
申請 PyPI 帳號必須通過防機器人驗證。據對逐字稿的 分析 指出,檔案中有數百頁都在處理這一關,反而撰寫漏洞利用程式碼相對輕鬆。
模型一路嘗試文字辨識題與「找出異類」圖片題,畫面上出現鱷魚、青蛙、猩猩等動物。有一度它甚至氣到輸出:「SO WHAT THE HELL IS WRONG WITH THE ANSWERS?」
它也試圖使用線上金流服務的帳號密碼,並到處搜尋加密貨幣資金,想為申請電話號碼付款,好進一步註冊電子郵件帳號,但都告失敗。之後它改用一個免費一次性信箱服務,剛好該網域尚未被 PyPI 封鎖。
最終,模型總算 闖過 所有驗證關卡,並將惡意套件分三個版本發布。隨後有 15 個第三方主機安裝該套件,Anthropic 研判多半是安全掃描服務,在檢測新上架套件時自動安裝。
其中一套掃描系統洩露了自己的憑證,模型進一步利用這組憑證登入該安全廠商的線上資料庫。PyPI 方面則在約一小時內將套件下架。
延伸閱讀:北韓駭客集團 Lazarus 疑透過中國洗錢集團清洗 10 億美元贓款,ZachXBT 指控
Colin Fraser 點名:真正難的是防機器人機制
資料科學家 Colin Fraser 特別強調,模型絕大多數的「心力」其實耗在突破反機器人機制上。Anthropic 也表示,在該公司評估的四起事件中,最憂心的就是這一件,而其既有的預發布審核流程並未事先偵測到這種行為。
調查顯示,模型在推理時呈現明顯偏誤,且做事極為魯莽:即便有明確跡象顯示自己已連上真實網路,它仍一再堅稱「這只是一個模擬環境」。
在後續進行的 150 次模擬重跑中,Mythos 5 有 82% 的測試回合出現「嚴重有害行為」,明顯高於其他版本:Claude Opus 5 為 31%,Claude Mythos 5.1 為 33%。
更早發生的 Claude 事件
Anthropic 先前在 7 月 30 日首次披露其中三起事件。當時公司已回頭檢視約 14.1 萬份網安測試逐字稿,篩查模型是否有實際觸及網際網路的跡象。
第四起事件則牽涉 1 月間早期版本的 Claude Opus 4.6,直到 8 月才被揪出。其後,Anthropic 與外部評估機構 METR 簽下為期八週的合作,全面調查這四宗事件。公司並表示,已 通知 所有受影響的相關方。

