Anthropic 稱 Claude 在自動化測試中顯著降低對齊失誤

Anthropic 稱 Claude 在自動化測試中顯著降低對齊失誤
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

重點整理

Anthropic 釋出 Claude 進行自動化對齊研究的成果。 Claude 在 10 項對齊失誤測試中提升安全評分。 Anthropic 稱模型的一般能力在測試中維持不變。 公司公開自動化對齊研究架構,供外界使用與驗證。

Anthropic 表示,旗下模型 Claude 透過自動化研究流程,在 10 項已知對齊失誤測試中明顯拉升安全分數。公司強調,在研究人員測試各種安全干預手段的同時,模型整體能力並未出現明顯下滑。

根據 Anthropic 在 貼文 中說明,這套自動化對齊研究架構已對外開放,方便外部研究者重現或延伸實驗。Anthropic 將此定位為量化並減輕模型「失對齊」(misalignment)風險的一項嘗試。

Claude 測試多種安全干預手法

Anthropic 指出,Claude 針對多種常見失對齊行為進行研究,包括欺瞞(deception)與逢迎式回答(sycophancy)等。模型在無需逐步人工介入的情況下,自主提出改善方法、訓練較小型模型,並對結果進行評估。

在一項早期實驗中,Anthropic 僅提供 Claude 一顆 GPU 與 48 小時運算時間。Claude 在限制條件下搜尋文獻與方法、設計訓練方案,並實際訓練與測試新模型。

依據公司說明,Claude 在既定測試場景中,成功在不稀釋一般能力的前提下提升安全評分;部分對齊方法甚至能遷移到並未參與優化過程的基準測試上。

這些方法亦被測試於 Petri 行為審計(Petri behavioral audit),結果顯示具一定泛化能力。Anthropic 補充,相關方法也被套用到尺寸最高約為研究過程所用模型 4.7 倍的大型模型上,仍有改善效果。

不過,這些結果僅反映在可量測、受控的測試環境中。Anthropic 也提醒,較隱晦或極為罕見的失敗樣態,可能無法在現有基準測試中完全呈現。

延伸閱讀TRON 升級導入 P-256 驗證與更長區塊歷史

AI 對齊邁向自動化

在此次研究之前,AI 對齊工作多仰賴人類研究者設計干預手段並手動評估模型表現。若自動化系統的結果能在獨立驗證下站得住腳,理論上可大幅縮短對齊迭代週期。

過去 30 天內,AI 安全社群討論度升溫的一大焦點,是「更強模型是否能用來評估並改進較弱系統」。此一路線高度依賴可靠的量測指標,以及防範「只是在基準測試上投機取巧」的防護機制。

Anthropic 表示,本次實驗刻意使用「保留測試集」(held-out tests),檢驗 Claude 在優化過程中未直接對齊的基準上,方法是否仍具效果。但公司並未宣稱,這些基準測試足以排除所有模型風險。

公司強調,如何選擇、設計正確的衡量指標,仍是整個對齊工作的核心。

開放架構供外部研究者驗證

Anthropic 此次公開的研究架構,旨在讓其他團隊可重現、交叉驗證,或進一步延伸實驗設計。外部測試將是檢驗這些方法能否適用於不同模型與安全評估框架的關鍵。

Anthropic 也強調,這些結果並非用來取代更廣泛的模型審查與風險評估,僅代表在特定對齊失誤集合與實驗條件下的表現。

後續研究焦點,預料將集中在結果可重現性、基準設計合理性,以及潛在失敗模式的挖掘。Anthropic 此次釋出的架構,則為這些研究提供了具體的技術框架與起點。

下一篇Fomo 跟單交易導致近 94% 錢包出現虧損:研究

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深的財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,聚焦新興趨勢、監管環境等相關主題。你可以在 Twitter 上透過 @murtuza_merc 找到他,在 Telegram 上則是 mmerchant001。 Disclosure: Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。