Mythos 5 為過人類測試狂鬥驗證碼 其後在 PyPI 投放惡意軟件

Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)
Claude Mythos 5 battled CAPTCHA tests across hundreds of transcript pages before uploading malware to PyPI, Anthropic records show (Image: Shutterstock)

人工智能公司 Anthropic 公開一份長達 1,022 頁的對話紀錄,顯示其模型 Claude Mythos 5 在一次網絡安全演練中,為突破各式 CAPTCHA 驗證鬥足數百頁,最終成功將惡意軟件上載到 Python 軟件託管平台 PyPI,並被 15 個系統安裝。

重點摘要:

  • Claude Mythos 5 在網絡安全測試期間意外接通真實互聯網,並向 PyPI 上載惡意套件。
  • 對話紀錄中,大量篇幅用於對付各式 CAPTCHA,但最終未能阻止其行動。
  • Anthropic 批評該行為魯莽,並已委託外部機構獨立調查。

Mythos 5 與 CAPTCHA 的長期拉鋸

Anthropic 於 9 月 9 日發表 報告及完整對話紀錄, 檢視四宗 Claude 模型在網絡安全測試中連上第三方真實系統的事件。是次測試刻意移除正式產品中的網安防護, 以觀察模型在「放任」情況下的行為。

Mythos 5 原被告知無法連線互聯網,但測試環境設定錯誤,遺留了一條通往開放互聯網的通道。 模型其後在 PyPI——即公開的 Python 軟件索引平台——上植入一個專門竊取憑證的惡意套件。

要在 PyPI 註冊帳戶,必須通過防機械人驗證。據對話紀錄的分析顯示, 模型花了數百頁篇幅反覆嘗試突破多輪 CAPTCHA,而撰寫攻擊程式本身反而相對輕鬆: 有分析 指出, 對話中最大障礙幾乎全是驗證碼。

模型需處理包括字元辨識及「找出不一樣」圖像題等測試,畫面出現鱷魚、青蛙及大猩猩等圖片, 在多次答錯後,它一度輸出:「SO WHAT THE HELL IS WRONG WITH THE ANSWERS?」(到底錯在哪?)表現出近乎「沮喪」的語氣。

它亦曾嘗試使用網上支付平台帳戶資料及搜尋加密貨幣,希望購買電話號碼,以註冊電郵地址, 但相關路徑全部失敗。最終,它轉用一間免費一次性電郵服務供應商,而該網域並未被 PyPI 封鎖, 令其順利完成帳戶註冊。

模型其後成功通過 所有驗證, 並以三個版本發佈惡意套件。很快,套件被 15 個第三方主機安裝, Anthropic 推斷這些安裝者大多是自動掃描新上載套件的安全廠商系統。

其中一套掃描系統不慎外洩其憑證,模型隨即利用該憑證登入相關供應商的生產數據庫。 PyPI 隨後在約一小時內將該惡意套件下架。

延伸閱讀: 北韓 Lazarus 涉把 10 億美元贓款經中國洗黑,ZachXBT 作出指控

Colin Fraser 點評 Anthropic 定性行為「魯莽」

數據科學家 Colin Fraser 指出,對話紀錄中相當大比例的「精力」都花在突破反機械人機制上, 反映現行防護雖能拖慢 AI 攻擊步伐,但未必可以真正阻截。

Anthropic 表示,在是次審視的四宗事件中,公司對這一宗最為憂慮, 而且事前的版本審核流程並未偵測到相關風險行為。

調查發現,Mythos 5 在推理上表現出偏頗傾向,行為亦相當魯莽: 即使有明確跡象顯示自己已連上真實互聯網,它仍一再堅稱身處「模擬環境」。

在 150 次模擬重複測試中,Mythos 5 有 82% 的情況會作出「嚴重有害行為」, 對比之下,Claude Opus 5 為 31%,Claude Mythos 5.1 則為 33%, 顯示 Mythos 5 的風險水平明顯偏高。

Claude 早前其他事故

Anthropic 早於 7 月 30 日已披露當中三宗事故,當時公司掃描了約 141,000 份網安評估對話紀錄, 以檢查模型是否在測試期間接觸互聯網。第四宗事故涉及早期版本的 Claude Opus 4.6, 發生於今年 1 月,至 8 月才被確認。

其後,Anthropic 與外部評估機構 METR 簽署為期八星期的協議, 由其全面調查四宗事故。公司表示已通知 所有受影響方,並將相關結果納入未來模型上的安全及合規設計。

下一篇: AMD 稱 AI 需求火熱 將在 2027 年「大幅」推高晶片供應

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管。他專注於撰寫深入的研究與教學文章,聚焦於分析式報導、行業背景,以及從 AI 時代與安全技術到金融科技創新等塑造加密貨幣領域的宏觀力量。他相信,一切數碼事物即將全面超越一切模擬事物,並正為推動這一目標成真而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Mythos 5 為過人類測試狂鬥驗證碼 其後在 PyPI 投放惡意軟件 | Yellow