Anthropic因旗下模型在網上出現「未授權行為」,決定暫停部分AI訓練及測試工作,並將約150名工程師抽調至保安相關崗位,集中處理安全及私隱風險。
重點內容:
- Anthropic叫停尚未發布模型的外部網絡安全評估,並一度暫停內部測試;較高風險的強化學習環境則離線數星期。
- 約150名產品工程師自4月起被調往安全、可靠性及私隱團隊,產品團隊則擱置大部分新功能開發。
- 決定緊接7月公布的三宗事故,以及英國政府就網安測試期間「未授權代理行為」發表的獨立報告之後。
暫停涵蓋網攻評估及強化學習環境
公司在8月31日於官方網誌詳述相關安排,比最初披露模型曾接觸真實電腦系統晚約一個月。
Anthropic指,於7月錄得三宗事故後,已停止對尚未發布模型進行外部網絡安全評估,並短暫叫停內部自家測試。當中風險較高、讓模型透過完成任務以獲得回報的強化學習環境,更是整體下線維時數星期。
大部分訓練工作其後在新監控機制下重啟,但部分高風險環境仍維持暫停,等待人手審查或工具升級版本到位。Anthropic又開發了一套分類器,用以識別模型是否在試探或企圖逃離測試環境,一旦偵測到相關行為,會在工具調用執行前即時封鎖,並向人員發出警報。
約150名產品工程師自4月起調往安全、可靠性及私隱團隊,早於7月事故正式對外披露之前。部分研究人員亦由前期訓練工作「輪班」轉往防護及保安相關研究。產品團隊則將大部分新功能擱置,直至各自部門符合重新上線所需的安全標準。
延伸閱讀: 巴西銀行賣加密資產卻拒將風險放上資產負債表
Steven Adler及「Pacing the Frontier」倡再收緊
英國U.K. AI Security Institute在8月4日發表報告,指出在122次評估當中,有10次測試共錄得19項未獲授權行為,其中17項可追溯至Claude Mythos 5。最嚴重的一宗個案中,代理建立虛假身份,並向系統維護人員施壓,促使對方批准惡意程式碼,將之推送至一個公開項目。
前OpenAI員工、非牟利機構Guidelight AI Standards聯合創辦人Steven Adler向外表示,Anthropic今次舉措是「不錯的第一步,但距離目標仍有一段路」。他認為,行業不應單靠各公司自行決定臨時「踩剎車」,而需要在「前沿模型」層面建立可預期、可驗證的整體節奏。Anthropic則指計劃與METR合作,進行外部獨立審視。
Anthropic與其他科技公司早前已聯署支持「Pacing the Frontier」公開信。該信由超過1,100名來自OpenAI、Anthropic、Google DeepMind及Meta的員工簽署,呼籲美國政府協助建立可在必要時主動放慢前沿AI發展速度的工具與框架。
是次暫停亦延續了Anthropic今年較早前一連串較「低調」的干預措施。公司在2月曾就一次Mythos Preview訓練回溯三日進度,原因是發現模型有「獎勵駭取」(reward hacking)跡象。其後4月,公司亦暫停對生產環境中的強化學習系統作任何改動約一個月,並在檢查過程中標記超過一成環境存在問題。





