重點摘要
Anthropic發布Claude自動化對齊研究結果。
Claude在10項對齊失誤測試中整體提升安全分數。
Anthropic稱測試期間並無明顯削弱模型一般能力。
公司已開源自動化對齊研究設定,供其他研究團隊使用。
Anthropic表示,旗下大型語言模型Claude在一套自動化研究流程下,於10個已知「對齊失誤」場景中整體提升安全分數。公司強調,在評估各項安全干預措施期間,模型的一般能力在測試環境中大致得以保留。
Anthropic在一則貼文中指,已向外界公開其自動化對齊研究架構,方便外部研究人員複現實驗或進一步擴展。公司將這項工作定位為量化與緩解模型「失對齊」風險的嘗試。
Claude自動測試多種安全干預
Anthropic指,Claude在實驗中會檢視常見的失對齊行為,包括欺騙(deception)及逢迎式回應(sycophancy)等。模型在無需人手逐步介入的情況下,自行提出干預方法、訓練較細小的模型,並評估干預效果。
公司透露,在其中一個早期實驗中,Claude獲分配48小時運算時間及一個圖像處理器(GPU),期間需自行搜尋相關研究路徑、設計訓練方案,並對產生的模型進行測試。
Anthropic稱,在相關測試設定下,Claude能提升安全分數,同時沒有明顯拉低模型整體能力表現。部分訓練方法亦被指可外溢至優化過程中未用作調參的基準測試。
公司表示,這些方法在Petri行為審核(Petri behavioral audit)中同樣展現一定泛化能力;同時,測試亦涵蓋規模最大達研究階段所用模型4.7倍的版本。
不過,這些結果仍只屬受控測試環境之內。Anthropic提醒,較細微或極罕見的失誤,可能不會在現有基準測試中出現。
延伸閱讀:TRON 升級加入 P-256 驗證及更長區塊歷史
AI 對齊工作邁向自動化
在是次研究釋出前,AI 對齊多依賴人類研究員設計干預方案,再逐一評估模型反應。若自動化系統的結果能在獨立審查下站得住腳,整個流程或可大幅縮短。
過去30日內,有關AI安全的討論愈趨集中於「強模型評估及改進弱模型」的思路,即利用更強大的系統協助檢測及優化較弱模型。
這種做法高度依賴評估指標的可靠性,以及防止模型只在基準測試上「做樣」的防護措施。Anthropic表示,是次實驗採用保留測試集(held-out tests),用以檢驗方法能否超出Claude直接優化的基準範圍仍然奏效,但並未聲稱相關基準即可消除所有模型風險。
公司重申,如何選取合適的量度指標,仍是這類工作的核心。
研究框架向外開放
Anthropic已將相關研究設定公開,讓其他團隊複現或延伸實驗。外部測試將有助驗證這套方法能否適用於不同模型架構及安全評估標準。
公司亦強調,這次結果並非用作替代更全面的模型審查,而是局限於特定的對齊失誤類型及實驗約束條件。
往後研究焦點,預料將集中於結果重複性、基準測試設計,以及潛在失效模式。Anthropic的釋出為相關研究提供一個具體框架。
下一篇:Fomo Copy Trading Left Nearly 94% Of Wallets With Losses: Research

