重點整理
Anthropic 公布 Claude 執行自動化對齊研究的結果。
Claude 在 10 項對齊失誤測試中顯著拉高安全分數。
Anthropic 表示整體模型能力在測試中維持不變。
公司同步開放自動化對齊研究架構供外部使用。
Anthropic 表示,旗下大型語言模型 Claude 透過一套自動化研究流程,在 10 項已知的對齊失誤測試中明顯提升安全分數。公司強調,在實驗期間,研究人員針對安全介入措施進行評估的同時,並未犧牲模型一般性能力表現。
Anthropic 在一篇 貼文 中指出,已將這套自動化對齊研究設定對外開放,方便其他研究團隊採用。公司將此工作定位為針對模型「失對齊」的量化量測與風險緩解嘗試。
Claude 測試多種安全介入方案
Anthropic 指出,Claude 針對常見失對齊型態進行分析,包括欺騙行為與逢迎式回應(sycophancy)等。實驗中,模型自行提出介入方案、訓練較小規模模型,並在各階段自行評估結果,全程不依賴研究人員逐步手動干預。
公司透露,在一項早期實驗中,Claude 獲配置 48 小時運算時間與一顆 GPU。期間模型用於查找相關研究路徑、設計訓練方法並測試所得模型表現。
根據 Anthropic,Claude 在既定情境下成功提升安全分數,同時未觀察到一般能力退步;部分訓練方法更可遷移至優化階段未使用的外部基準測試。
公司並表示,這些方法可泛化至 Petri 行為稽核(Petri behavioral audit),且測試納入的模型規模最高達研究階段模型的 4.7 倍。
不過,上述結果仍侷限於可量測的測試環境。Anthropic 強調,較細微或極為罕見的失誤情境,可能無法在現有基準中充分呈現。
延伸閱讀:TRON 升級加入 P-256 驗證與更長區塊歷史
AI 對齊邁向自動化
在這次研究釋出前,AI 對齊工作多半仰賴人工研究者設計介入策略並親自評估模型。若自動化系統的結果能通過獨立審視與壓力測試,將可大幅縮短這類研究週期。
過去 30 天內,AI 安全社群討論焦點愈來愈集中在「能否以更強模型協助評估與改進較弱系統」。這種做法高度依賴可靠的量測指標,以及避免被基準測試「刷榜」的防護機制。
Anthropic 表示,其實驗使用留出(held-out)測試,以檢驗方法能否超出 Claude 自行優化的基準數據而仍具泛化力。公司同時強調,基準表現不應被視為完全排除模型風險的證據。
公司一再指出,挑選合適的量測指標仍是整體工作的核心。
研究框架開放外部團隊使用
Anthropic 已將本次研究的自動化設定與流程開放,使其他研究單位可以複現實驗或在此基礎上延伸。後續由外部測試來驗證,這些方法是否能跨不同模型架構與安全評估場景維持效果。
公司並未將本次結果包裝為整體模型評估的替代方案,而是清楚界定:目前結論僅適用於特定對齊失誤案例及實驗條件範圍內。
往後研究人員預料將聚焦於:結果可否重現、如何設計更嚴謹的基準測試,以及尚未暴露的潛在失敗模式。Anthropic 釋出的架構,為這類後續研究提供一套可延展的實驗框架。
下一篇閱讀:Fomo Copy Trading Left Nearly 94% Of Wallets With Losses: Research

