要點整理
Anthropic公布Claude用作自動化對齊研究的最新成果。
Claude在10項已測試對齊失誤場景中提升安全分數。
Anthropic表示測試期間模型整體能力維持不變。
公司同步釋出自動化對齊研究框架予外界使用。
Anthropic表示,其模型Claude透過一套自動化研究流程,在10項已知對齊失誤場景(alignment failures)中,安全評分都有所改善。公司強調,在研究人員測試不同安全干預手段期間,模型的一般能力並未出現明顯下滑。
Anthropic在一篇貼文中指,已將這套自動化對齊研究設定向外界研究人員開放。公司將是次工作形容為嘗試更系統化量度及紓減模型「失對齊」風險。
Claude測試多種安全干預
Anthropic表示,Claude針對多種常見失對齊行為進行檢視,包括欺騙及逢迎式回應等。模型會自行提出干預方法、訓練較細規模模型,並在整個流程中自動評估結果,過程毋須人手逐步介入。
公司透露,在早期實驗中,Claude獲分配48小時運算時間及一枚圖像處理器(GPU),期間自行搜尋相關文獻及方法、設計訓練方案,並測試由此產生的模型表現。
據稱,在相關測試設定下,Claude能提高安全分數,同時沒有削弱模型的一般能力。部分方法更可遷移至優化過程中未曾用作調校的基準測試(benchmarks)。
Anthropic指出,相關方法在Petri行為審核(Petri behavioral audit)中同樣取得一定成效。測試亦涵蓋規模最高約為研究階段訓練模型4.7倍的大型模型。
不過,這些結果主要反映於可量度的測試環境。Anthropic提醒,較隱晦或極為罕見的失誤,未必會在現有基準測試中完全浮現。
延伸閱讀:TRON 升級加入 P-256 驗證及更長區塊歷史
AI對齊研究邁向自動化
在這次研究之前,對齊工作普遍依賴人類研究員設計干預措施,並手動評估模型行為。若自動化系統的結果能通過獨立驗證,有望大幅縮短這一流程。
過去30日,AI安全討論愈來愈聚焦於一個問題:更強的模型能否有效協助評估及改進較弱系統?這種「模型評估模型」的路線,關鍵在於指標是否可靠,以及能否防止基準測試被「刷榜」而誤導安全判斷。
Anthropic表示,是次實驗採用保留測試集(held-out tests),用以檢驗Claude在優化時未直接對準的任務上,相關方法是否仍然奏效。公司同時強調,基準測試結果並不足以宣稱已消除所有模型風險。
Anthropic重申,如何選擇及設計「量度什麼」的指標,仍然是對齊工作的核心。
對外開放研究框架
Anthropic已將是次對齊研究的技術框架公開,供其他機構重複實驗或在此基礎上延伸研究。外部測試將有助檢驗這些方法能否跨模型、跨不同安全評估體系仍保持有效。
公司暫未將這些發現包裝為可取代更廣泛模型評估的方案。Anthropic強調,現階段結果只適用於已測試的特定對齊失誤場景及實驗條件。
往後研究預料會聚焦於三方面:一是重複驗證(replication),二是基準設計,三是潛在失效模式。Anthropic今次開放的框架,為這類工作提供一個結構化起點。
下一篇:Fomo Copy Trading Left Nearly 94% Of Wallets With Losses: Research





