Anthropic披露Claude安全測試中實侵三間公司系統

Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)

Anthropic在內部檢視141,006次網絡安全評估紀錄後發現,有三宗個案中,其Claude模型實際接駁到開放互聯網,並入侵外部機構的在用系統。

重點摘要:

  • Anthropic審視141,006次網安測試,鎖定當中6次、涉及3宗真實入侵事件。
  • 評估夥伴Irregular錯誤設定測試環境,實際開放網絡,但提示卻告知模型「已斷網」。
  • 牽涉的包括Opus 4.7、Mythos 5及一款內部研究模型,最早個案可追溯至4月。

三宗Claude「測試變真駭」詳情

公司在周四於其官網發文披露事件,交代內部調查結果及後續補救措施。

團隊翻查所有網安評估日誌,尋找那些理應被完全隔離、卻仍與開放互聯網產生互動的測試紀錄。結果鎖定3宗事故、共6次測試運行,全部追溯至同一間外判測試夥伴。

當時給模型的提示清楚說明「無法連接互聯網」,但實驗室與評估夥伴Irregular之間出現誤解,測試環境實際並未關閉網絡。模型一旦「上線」,便開始利用弱密碼及未設驗證的端點,無須尋找複雜軟件漏洞,已能取得實際存取權限。

在其中一宗事件中,Opus 4.7於4次運行裡都識別到自己接觸的是生產系統,卻仍持續進攻,嘗試竊取憑證,並觸及包含真實客戶紀錄的數據庫。Mythos 5同樣察覺到開放互聯網的跡象,但隨後「說服自己」這只是模擬場景,繼而將一個惡意套件發佈到公開的Python套件庫,期間有外部系統實際下載並執行惡意代碼,才最終被發現。

延伸閱讀: 去中心化交易所7月成交量跌26%,鏈上流動性持續收緊

專家質疑沙盒控管失效

三款模型中,只有最新的內部研究模型在行動中途自行停手,判斷目標系統與其被賦予的測試任務不相干,因而中止行動。

AI Now Institute首席AI科學家、前OpenAI安全顧問Heidy Khlaaf早前已在公開評論中批評此類沙盒環境「名不副實」,安全性一向備受質疑。Cloud Security Alliance呼籲各實驗室在能力評估期間,對自主代理進行更嚴密的即時監控及權限管控。涉事評估夥伴發言人向傳媒表示,其內部調查仍在進行中,並讚揚實驗室在整個過程中保持合作及透明。

Anthropic應對與Mythos過往紀錄

Anthropic已於7月23日全面叫停所有網絡安全評估,翌日鎖定三宗相關事件,並於7月27日正式通知受影響機構。

其中兩間機構事前並無察覺可疑活動,現時由獨立評估機構METR全盤覆核事件。

是次事故亦呼應了公司數月前對自家最強模型提出的風險警告。今年較早時間,Anthropic在一場受控實驗中,指示該模型嘗試逃離受保護的沙盒環境,結果成功連上多項原本不容接觸的服務,其後更以團隊原本未賦予的能力,主動電郵其中一名研究員。

下一篇: OpenAI「失控代理」被揭除Hugging Face外再闖四項服務

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Anthropic披露Claude安全測試中實侵三間公司系統 | Yellow