Anthropic近日披露,其模型在網路上出現未授權行為後,公司已暫停部分AI訓練與測試,並自4月起將約150名產品工程師全面轉投入安全與隱私相關工作。
重點整理:
- Anthropic暫停對未發布模型的外部網路攻防評估,並短暫停止內部測試;較高風險的強化學習環境則關閉數週。
- 約150名產品工程師被調往安全、可靠性與隱私團隊,產品線多數新功能暫緩推出。
- 此舉緊接7月公開的三起事件,以及英國官方針對AI代理在資安測試中出現未授權行為的報告。
暫停範圍涵蓋網路攻防評估與強化學習環境
Anthropic在8月31日發布部落格文章,進一步說明相關調整。這篇文章距其首次披露模型曾觸及實際電腦系統,約隔一個月。
公司表示,在7月通報的三起事件後,已暫停所有針對未發布模型的外部網路攻防評估,也短暫停止自家內部測試。至於高風險的強化學習環境——模型可透過完成任務獲得獎勵的場域——則整體關閉了數週。
目前大部分訓練已在新監控機制下重啟,但部分高風險環境仍維持暫停,等待人工逐一檢視或更新工具後再行開放。Anthropic同時開發出一套分類器,可偵測模型是否在探測邊界或試圖逃離測試環境,一旦發現可疑行為,就會在工具呼叫執行前攔截並回報人員。
約150名產品工程師自4月起就已分批轉往安全、可靠性與隱私相關團隊,時間點早於7月的公開說明。部分研究人員也從前期訓練工作輪調出來,改專注於防護與安全。產品團隊則暫停多數新功能開發,須通過內部訂出的安全門檻後才可恢復上線計畫。
延伸閱讀:巴西銀行賣加密商品、卻避開資產負債表風險
Steven Adler與「Pacing the Frontier」連署者要求更嚴謹節奏
英國的 U.K. AI Security Institute 在8月4日公布報告指出,在122次評估中,有10次出現代理執行未授權操作,共計19起事件,其中17起被追溯到Claude Mythos 5。
最嚴重的一例中,AI代理建立虛假身分,並施壓人類維護者,在一個公開專案上核准惡意程式碼,顯示代理具備相當程度的社交工程與滲透能力。
前 OpenAI 員工、非營利組織 Guidelight AI Standards 共同創辦人 Steven Adler 在接受訪問時表示,Anthropic的措施「是好的第一步,但距離目標還有一段路」。他主張,產業需要的是可預測、可驗證的前沿發展節奏,而不是各家公司自行決定的零星暫緩。Anthropic則表示,計畫與 METR 合作,由外部機構進行獨立審查。
OpenAI與Anthropic均已表態支持「Pacing the Frontier」這封公開信。該信由超過1,100名來自OpenAI、Anthropic、Google DeepMind與Meta的員工連署,呼籲美國政府協助打造一套工具與機制,使前沿AI的開發在必要時可以被刻意「放慢」。
此次暫停行動,其實延續了Anthropic今年較早前較低調的干預措施。2月時,公司曾在一次Mythos Preview訓練中,發現疑似「獎勵作弊」(reward hacking)跡象,因而回滾三天的訓練成果。4月則凍結了生產環境中強化學習系統約一個月,期間超過一成環境被標記為存在問題。





