Anthropic指Claude在自動化測試中大幅減少對齊失誤

Anthropic指Claude在自動化測試中大幅減少對齊失誤
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

要點整理

Anthropic公布Claude用作自動化對齊研究的最新成果。
Claude在10項已測試對齊失誤場景中提升安全分數。
Anthropic表示測試期間模型整體能力維持不變。
公司同步釋出自動化對齊研究框架予外界使用。

Anthropic表示,其模型Claude透過一套自動化研究流程,在10項已知對齊失誤場景(alignment failures)中,安全評分都有所改善。公司強調,在研究人員測試不同安全干預手段期間,模型的一般能力並未出現明顯下滑。

Anthropic在一篇貼文中指,已將這套自動化對齊研究設定向外界研究人員開放。公司將是次工作形容為嘗試更系統化量度及紓減模型「失對齊」風險。

Claude測試多種安全干預

Anthropic表示,Claude針對多種常見失對齊行為進行檢視,包括欺騙及逢迎式回應等。模型會自行提出干預方法、訓練較細規模模型,並在整個流程中自動評估結果,過程毋須人手逐步介入。

公司透露,在早期實驗中,Claude獲分配48小時運算時間及一枚圖像處理器(GPU),期間自行搜尋相關文獻及方法、設計訓練方案,並測試由此產生的模型表現。

據稱,在相關測試設定下,Claude能提高安全分數,同時沒有削弱模型的一般能力。部分方法更可遷移至優化過程中未曾用作調校的基準測試(benchmarks)。

Anthropic指出,相關方法在Petri行為審核(Petri behavioral audit)中同樣取得一定成效。測試亦涵蓋規模最高約為研究階段訓練模型4.7倍的大型模型。

不過,這些結果主要反映於可量度的測試環境。Anthropic提醒,較隱晦或極為罕見的失誤,未必會在現有基準測試中完全浮現。

延伸閱讀TRON 升級加入 P-256 驗證及更長區塊歷史

AI對齊研究邁向自動化

在這次研究之前,對齊工作普遍依賴人類研究員設計干預措施,並手動評估模型行為。若自動化系統的結果能通過獨立驗證,有望大幅縮短這一流程。

過去30日,AI安全討論愈來愈聚焦於一個問題:更強的模型能否有效協助評估及改進較弱系統?這種「模型評估模型」的路線,關鍵在於指標是否可靠,以及能否防止基準測試被「刷榜」而誤導安全判斷。

Anthropic表示,是次實驗採用保留測試集(held-out tests),用以檢驗Claude在優化時未直接對準的任務上,相關方法是否仍然奏效。公司同時強調,基準測試結果並不足以宣稱已消除所有模型風險。

Anthropic重申,如何選擇及設計「量度什麼」的指標,仍然是對齊工作的核心。

對外開放研究框架

Anthropic已將是次對齊研究的技術框架公開,供其他機構重複實驗或在此基礎上延伸研究。外部測試將有助檢驗這些方法能否跨模型、跨不同安全評估體系仍保持有效。

公司暫未將這些發現包裝為可取代更廣泛模型評估的方案。Anthropic強調,現階段結果只適用於已測試的特定對齊失誤場景及實驗條件。

往後研究預料會聚焦於三方面:一是重複驗證(replication),二是基準設計,三是潛在失效模式。Anthropic今次開放的框架,為這類工作提供一個結構化起點。

下一篇Fomo Copy Trading Left Nearly 94% Of Wallets With Losses: Research

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的採訪與報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,專注報導新興趨勢、監管環境等主題。你可以在 Twitter 上透過 @murtuza_merc,或在 Telegram 上透過 mmerchant001 找到他。 Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。