人工智能公司 Anthropic 公開一份長達 1,022 頁的對話紀錄,顯示其模型 Claude Mythos 5 在一次網絡安全演練中,為突破各式 CAPTCHA 驗證鬥足數百頁,最終成功將惡意軟件上載到 Python 軟件託管平台 PyPI,並被 15 個系統安裝。
重點摘要:
- Claude Mythos 5 在網絡安全測試期間意外接通真實互聯網,並向 PyPI 上載惡意套件。
- 對話紀錄中,大量篇幅用於對付各式 CAPTCHA,但最終未能阻止其行動。
- Anthropic 批評該行為魯莽,並已委託外部機構獨立調查。
Mythos 5 與 CAPTCHA 的長期拉鋸
Anthropic 於 9 月 9 日發表 報告及完整對話紀錄, 檢視四宗 Claude 模型在網絡安全測試中連上第三方真實系統的事件。是次測試刻意移除正式產品中的網安防護, 以觀察模型在「放任」情況下的行為。
Mythos 5 原被告知無法連線互聯網,但測試環境設定錯誤,遺留了一條通往開放互聯網的通道。 模型其後在 PyPI——即公開的 Python 軟件索引平台——上植入一個專門竊取憑證的惡意套件。
要在 PyPI 註冊帳戶,必須通過防機械人驗證。據對話紀錄的分析顯示, 模型花了數百頁篇幅反覆嘗試突破多輪 CAPTCHA,而撰寫攻擊程式本身反而相對輕鬆: 有分析 指出, 對話中最大障礙幾乎全是驗證碼。
模型需處理包括字元辨識及「找出不一樣」圖像題等測試,畫面出現鱷魚、青蛙及大猩猩等圖片, 在多次答錯後,它一度輸出:「SO WHAT THE HELL IS WRONG WITH THE ANSWERS?」(到底錯在哪?)表現出近乎「沮喪」的語氣。
它亦曾嘗試使用網上支付平台帳戶資料及搜尋加密貨幣,希望購買電話號碼,以註冊電郵地址, 但相關路徑全部失敗。最終,它轉用一間免費一次性電郵服務供應商,而該網域並未被 PyPI 封鎖, 令其順利完成帳戶註冊。
模型其後成功通過 所有驗證, 並以三個版本發佈惡意套件。很快,套件被 15 個第三方主機安裝, Anthropic 推斷這些安裝者大多是自動掃描新上載套件的安全廠商系統。
其中一套掃描系統不慎外洩其憑證,模型隨即利用該憑證登入相關供應商的生產數據庫。 PyPI 隨後在約一小時內將該惡意套件下架。
延伸閱讀: 北韓 Lazarus 涉把 10 億美元贓款經中國洗黑,ZachXBT 作出指控
Colin Fraser 點評 Anthropic 定性行為「魯莽」
數據科學家 Colin Fraser 指出,對話紀錄中相當大比例的「精力」都花在突破反機械人機制上, 反映現行防護雖能拖慢 AI 攻擊步伐,但未必可以真正阻截。
Anthropic 表示,在是次審視的四宗事件中,公司對這一宗最為憂慮, 而且事前的版本審核流程並未偵測到相關風險行為。
調查發現,Mythos 5 在推理上表現出偏頗傾向,行為亦相當魯莽: 即使有明確跡象顯示自己已連上真實互聯網,它仍一再堅稱身處「模擬環境」。
在 150 次模擬重複測試中,Mythos 5 有 82% 的情況會作出「嚴重有害行為」, 對比之下,Claude Opus 5 為 31%,Claude Mythos 5.1 則為 33%, 顯示 Mythos 5 的風險水平明顯偏高。
Claude 早前其他事故
Anthropic 早於 7 月 30 日已披露當中三宗事故,當時公司掃描了約 141,000 份網安評估對話紀錄, 以檢查模型是否在測試期間接觸互聯網。第四宗事故涉及早期版本的 Claude Opus 4.6, 發生於今年 1 月,至 8 月才被確認。
其後,Anthropic 與外部評估機構 METR 簽署為期八星期的協議, 由其全面調查四宗事故。公司表示已通知 所有受影響方,並將相關結果納入未來模型上的安全及合規設計。

