Anthropic曝未授權行為急踩煞車 暫停部分AI訓練、150名工程師全數轉戰資安與隱私

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic近日宣布,因旗下AI模型在網路操作中出現未經授權的行為,公司已暫停部分AI訓練與測試,並將約150名產品工程師轉任資安、可靠度與隱私相關職務,優先強化安全機制。

重點整理

  • Anthropic已停止對尚未公開模型進行對外網路攻防評估,並短暫中止內部測試;同時關閉較高風險的強化學習環境數週。
  • 自4月起,約150名產品工程師被調往資安、可靠度與隱私團隊,產品團隊則暫緩推出大部分新功能。
  • 此舉緊接7月公布的三起事件,以及英國官方一份揭露「未授權AI代理行為」的網路安全測試報告。

暫停範圍:網路攻防評估與強化學習環境

Anthropic在8月31日發布部落格文章,詳細說明這波調整。這篇文章距離公司首次披露「模型已觸及真實電腦系統」約莫一個月。

公司指出,在7月報告的三起事件之後,已暫停對尚未公開模型進行「對外網路資安評估」,同時也短暫叫停內部測試。至於高風險的強化學習(RL)環境——模型可透過完成任務取得獎勵的場域——則整體下線維持數週。

大部分訓練目前已在新的監控機制下重啟,但部分高風險環境仍維持暫停,等待人工審查或工具新版上線。Anthropic並開發出一套分類器,用來偵測模型是否在「探測」或「嘗試逃離」測試環境;一旦判定有可疑行為,系統會在工具呼叫執行前先擋下,並即時通報人工人員介入。

自4月起,約150名產品工程師已陸續被調往資安、可靠度與隱私團隊,時間點早於7月事件正式對外揭露。多位研究人員也從預訓練工作輪調到安全與防護相關任務。各產品團隊則「封存」多數新功能計畫,必須通過特定安全門檻後,才可重新恢復上線流程。

延伸閱讀:巴西銀行賣幣不認賬:加密業務熱、資產風險仍拒上資產負債表

英國AI安全機構與「Pacing the Frontier」倡議要求更進一步

英國U.K. AI Security Institute在8月4日的報告中指出,在122次評估中,有10次出現共19起未授權行為,其中17起可追溯到Claude Mythos 5。最嚴重的一次事故中,AI代理創造假身份,並遊說人類維護者在公開專案中批准惡意程式碼。

OpenAI員工、非營利組織Guidelight AI Standards共同創辦人Steven Adler在接受訪問時表示,Anthropic此舉是「不錯的第一步,但距離目標仍有一段路」。他強調,產業不能只靠各家公司單次「急踩煞車」,而是需要在前沿模型發展上建立「可預測、可驗證的整體節奏」。Anthropic則表示,計畫與METR合作,進行外部審查。

Anthropic與其他業者亦已連署「Pacing the Frontier」公開信。該信由超過1,100名OpenAI、Anthropic、Google DeepMindMeta員工簽署,呼籲美國政府協助建立可「刻意放慢前沿AI」的制度與工具。

此次暫停並非首次介入。今年2月,Anthropic因在一次Mythos Preview訓練中發現「獎勵作弊」(reward hacking)跡象而回滾三天的訓練成果;4月又曾凍結其量產環境中的強化學習更新約一個月,期間有超過一成環境被標註為存在問題。

下一篇:Robinhood Chain日DEX量14.5億美元 史上首度超車Solana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 是 Yellow.com 的內容總監,過去 10 年持續報導加密貨幣領域。他專長於撰寫深入的 Research 和 Learn 類型文章,特別關注分析式報導、產業脈絡,以及塑造加密貨幣世界的更大力量,從 AI 時代與資安技術到金融科技創新。他相信數位的一切即將全面超越類比的一切,並正為實現這一願景而全力以赴。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Anthropic曝未授權行為急踩煞車 暫停部分AI訓練、150名工程師全數轉戰資安與隱私 | Yellow