重點整理
Anthropic 釋出 Claude 進行自動化對齊研究的成果。 Claude 在 10 項對齊失誤測試中提升安全評分。 Anthropic 稱模型的一般能力在測試中維持不變。 公司公開自動化對齊研究架構,供外界使用與驗證。
Anthropic 表示,旗下模型 Claude 透過自動化研究流程,在 10 項已知對齊失誤測試中明顯拉升安全分數。公司強調,在研究人員測試各種安全干預手段的同時,模型整體能力並未出現明顯下滑。
根據 Anthropic 在 貼文 中說明,這套自動化對齊研究架構已對外開放,方便外部研究者重現或延伸實驗。Anthropic 將此定位為量化並減輕模型「失對齊」(misalignment)風險的一項嘗試。
Claude 測試多種安全干預手法
Anthropic 指出,Claude 針對多種常見失對齊行為進行研究,包括欺瞞(deception)與逢迎式回答(sycophancy)等。模型在無需逐步人工介入的情況下,自主提出改善方法、訓練較小型模型,並對結果進行評估。
在一項早期實驗中,Anthropic 僅提供 Claude 一顆 GPU 與 48 小時運算時間。Claude 在限制條件下搜尋文獻與方法、設計訓練方案,並實際訓練與測試新模型。
依據公司說明,Claude 在既定測試場景中,成功在不稀釋一般能力的前提下提升安全評分;部分對齊方法甚至能遷移到並未參與優化過程的基準測試上。
這些方法亦被測試於 Petri 行為審計(Petri behavioral audit),結果顯示具一定泛化能力。Anthropic 補充,相關方法也被套用到尺寸最高約為研究過程所用模型 4.7 倍的大型模型上,仍有改善效果。
不過,這些結果僅反映在可量測、受控的測試環境中。Anthropic 也提醒,較隱晦或極為罕見的失敗樣態,可能無法在現有基準測試中完全呈現。
延伸閱讀:TRON 升級導入 P-256 驗證與更長區塊歷史
AI 對齊邁向自動化
在此次研究之前,AI 對齊工作多仰賴人類研究者設計干預手段並手動評估模型表現。若自動化系統的結果能在獨立驗證下站得住腳,理論上可大幅縮短對齊迭代週期。
過去 30 天內,AI 安全社群討論度升溫的一大焦點,是「更強模型是否能用來評估並改進較弱系統」。此一路線高度依賴可靠的量測指標,以及防範「只是在基準測試上投機取巧」的防護機制。
Anthropic 表示,本次實驗刻意使用「保留測試集」(held-out tests),檢驗 Claude 在優化過程中未直接對齊的基準上,方法是否仍具效果。但公司並未宣稱,這些基準測試足以排除所有模型風險。
公司強調,如何選擇、設計正確的衡量指標,仍是整個對齊工作的核心。
開放架構供外部研究者驗證
Anthropic 此次公開的研究架構,旨在讓其他團隊可重現、交叉驗證,或進一步延伸實驗設計。外部測試將是檢驗這些方法能否適用於不同模型與安全評估框架的關鍵。
Anthropic 也強調,這些結果並非用來取代更廣泛的模型審查與風險評估,僅代表在特定對齊失誤集合與實驗條件下的表現。
後續研究焦點,預料將集中在結果可重現性、基準設計合理性,以及潛在失敗模式的挖掘。Anthropic 此次釋出的架構,則為這些研究提供了具體的技術框架與起點。





