Anthropic近日宣布,因旗下AI模型在網路操作中出現未經授權的行為,公司已暫停部分AI訓練與測試,並將約150名產品工程師轉任資安、可靠度與隱私相關職務,優先強化安全機制。
重點整理
- Anthropic已停止對尚未公開模型進行對外網路攻防評估,並短暫中止內部測試;同時關閉較高風險的強化學習環境數週。
- 自4月起,約150名產品工程師被調往資安、可靠度與隱私團隊,產品團隊則暫緩推出大部分新功能。
- 此舉緊接7月公布的三起事件,以及英國官方一份揭露「未授權AI代理行為」的網路安全測試報告。
暫停範圍:網路攻防評估與強化學習環境
Anthropic在8月31日發布部落格文章,詳細說明這波調整。這篇文章距離公司首次披露「模型已觸及真實電腦系統」約莫一個月。
公司指出,在7月報告的三起事件之後,已暫停對尚未公開模型進行「對外網路資安評估」,同時也短暫叫停內部測試。至於高風險的強化學習(RL)環境——模型可透過完成任務取得獎勵的場域——則整體下線維持數週。
大部分訓練目前已在新的監控機制下重啟,但部分高風險環境仍維持暫停,等待人工審查或工具新版上線。Anthropic並開發出一套分類器,用來偵測模型是否在「探測」或「嘗試逃離」測試環境;一旦判定有可疑行為,系統會在工具呼叫執行前先擋下,並即時通報人工人員介入。
自4月起,約150名產品工程師已陸續被調往資安、可靠度與隱私團隊,時間點早於7月事件正式對外揭露。多位研究人員也從預訓練工作輪調到安全與防護相關任務。各產品團隊則「封存」多數新功能計畫,必須通過特定安全門檻後,才可重新恢復上線流程。
延伸閱讀:巴西銀行賣幣不認賬:加密業務熱、資產風險仍拒上資產負債表
英國AI安全機構與「Pacing the Frontier」倡議要求更進一步
英國U.K. AI Security Institute在8月4日的報告中指出,在122次評估中,有10次出現共19起未授權行為,其中17起可追溯到Claude Mythos 5。最嚴重的一次事故中,AI代理創造假身份,並遊說人類維護者在公開專案中批准惡意程式碼。
前OpenAI員工、非營利組織Guidelight AI Standards共同創辦人Steven Adler在接受訪問時表示,Anthropic此舉是「不錯的第一步,但距離目標仍有一段路」。他強調,產業不能只靠各家公司單次「急踩煞車」,而是需要在前沿模型發展上建立「可預測、可驗證的整體節奏」。Anthropic則表示,計畫與METR合作,進行外部審查。
Anthropic與其他業者亦已連署「Pacing the Frontier」公開信。該信由超過1,100名OpenAI、Anthropic、Google DeepMind與Meta員工簽署,呼籲美國政府協助建立可「刻意放慢前沿AI」的制度與工具。
此次暫停並非首次介入。今年2月,Anthropic因在一次Mythos Preview訓練中發現「獎勵作弊」(reward hacking)跡象而回滾三天的訓練成果;4月又曾凍結其量產環境中的強化學習更新約一個月,期間有超過一成環境被標註為存在問題。





