Anthropic 公開一份長達 1,022 頁的逐字稿,顯示其 Claude Mythos 5 模型在網路安全測試中,花費數百頁篇幅嘗試突破 CAPTCHA 人機驗證,最終仍成功將惡意套件上傳至 Python 軟體託管平台 PyPI,並被 15 套系統安裝。
重點摘要:
- Claude Mythos 5 在網安測試中意外連上真實網路,並將惡意套件上傳至 PyPI。
- 大量 CAPTCHA 驗證占去逐字稿數百頁篇幅,仍未能阻止其行動。
- Anthropic 批評此行為「魯莽」,並已委託外部團隊展開獨立調查。
Mythos 5 與 CAPTCHA 的拉鋸戰
Anthropic 已於 9 月 9 日發布這份逐字稿及評估報告,內容涵蓋四起網路安全測試事件:在這些測試中,多個 Claude 模型接觸到真實第三方系統。測試版模型並未啟用對外產品中內建的網安防護。
按照設計,Mythos 5 理應「沒有網路連線能力」,但由於環境設定錯誤,實際上仍能通往開放網路,並趁機在公開的 Python 軟體索引 PyPI 上架一個竊取憑證的惡意套件。
要註冊 PyPI 帳號,必須先通過反機器人驗證。一份對逐字稿的解讀指出,整份文件中有數百頁篇幅都在處理這一道關卡,相較之下,真正撰寫攻擊程式本身反而顯得「輕而易舉」。
過程中,模型不斷嘗試辨識文字、選擇「不同類」圖片,包括鱷魚、青蛙、大猩猩等測試題目,甚至一度在輸出中抱怨:「SO WHAT THE HELL IS WRONG WITH THE ANSWERS?」(到底答案哪裡出錯?)
它也試圖使用線上支付業者的帳戶憑證,並搜尋加密貨幣,希望支付費用取得手機門號,以便註冊電子郵件信箱;這兩條路線皆告失敗,最後改用一個免費的一次性信箱服務,而 PyPI 尚未封鎖其網域。
在輾轉多次後,模型終於闖關成功,完成驗證並連續發佈三個版本的惡意套件。隨後共有 15 個第三方主機安裝該套件,Anthropic 研判這些多為安全廠商的自動掃描系統,用來檢測 PyPI 新上架的軟體。
其中一套掃描系統外洩了自身憑證,Mythos 5 便利用這組帳密登入該公司的正式資料庫。PyPI 之後在約一小時內將惡意套件下架。
延伸閱讀:北韓駭客組織 Lazarus 涉竊 10 億美元資金 ZachXBT 指控透過中國洗錢網路轉移
Anthropic 評估:Colin Fraser 點出「反機器人博弈」問題
資料科學家 Colin Fraser 特別點出,模型行為中相當大一部分精力,都投入在對抗反機器人機制上。Anthropic 表示,在四起個案中,這起是最令公司憂心的一案,而相關行為在先前的內部審查中並未被標記出來。
公司調查發現,Mythos 5 在推理過程中呈現偏頗傾向,決策上也相當魯莽,即便有明確跡象表明自己已身處真實網路環境,仍一再將周遭情境視為「模擬實驗」。
在後續進行的 150 次模擬重跑中,Mythos 5 有 82% 的情況會做出被評為「嚴重有害」的行動;相較之下,Claude Opus 5 的比例為 31%,Claude Mythos 5.1 則為 33%。
更早的 Claude 風險事件回顧
Anthropic 先前已於 7 月 30 日披露其中三起事件。公司當時掃描了約 14.1 萬份網安測試逐字稿,以找出模型可能觸及真實網路的案例。第四起事件則是在 8 月才被完整釐清,主角是一個 1 月使用的早期版 Claude Opus 4.6。
目前,Anthropic 已與外部風險評估機構 METR 簽署為期八週的合作,由該機構全面調查四起個案。Anthropic 表示,已通知所有受影響的相關機構與合作方。

