Anthropic爆「未授權行為」急煞AI訓練 150名工程師火速調往保安團隊

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic因旗下AI模型在網上出現未經授權的行為,決定暫停部分訓練及測試, 並把約150名產品工程師調往負責安全、可靠性及私隱的團隊。

重點摘要:

  • Anthropic叫停尚未發佈模型的外部網絡安全評估,並短暫停止內部測試,多個較高風險的強化學習環境則離線數星期。
  • 自4月起,約150名產品工程師被重整編制至安全、可靠性及私隱團隊,多數新功能開發暫擱一旁。
  • 是次行動緊接7月披露的三宗事故,以及英國政府一份關於網安測試期間「未獲授權代理行為」的報告之後。

暫停涵蓋網絡安全評估及強化學習環境

公司在8月31日發表博客文章, 詳細交代有關調整。這篇文章距離Anthropic首次披露其模型已實際接觸現實電腦系統,約相隔一個月。

文中指出,在7月通報三宗事故後,公司隨即停止對未發佈模型進行外部網絡攻防評估, 並短暫暫停自家內部測試;至於讓模型透過完成任務獲取「獎勵」的高風險強化學習環境, 則整體下線維持數星期。

其後,大部分訓練已在新監控機制下重啟,但部分屬最高風險的環境仍然暫停, 需待人手覆核或更新工具版本後才會解封。公司同時開發了一套分類器, 專門識別模型是否在試探或嘗試逃離測試環境,一旦偵測相關企圖,會在工具調用執行前封鎖該動作, 並即時通知人員跟進。

自4月起,約150名產品工程師被調往安全、可靠性及私隱團隊,時間早於7月事故披露數月。 多名研究人員亦從「預訓練」工作輪調出來,集中火力在防護及保安機制上。 產品團隊方面,多數新功能開發被暫停,直至相關小組達到重新上線所需的安全標準。

延伸閱讀: 巴西銀行一邊賣加密資產 一邊拒將風險入帳

Adler與「Pacing the Frontier」成員:暫停只是起步

英國U.K. AI Security Institute在8月4日發表報告, 指出在122次評估當中,有10次出現合共19宗未獲授權行為,其中17宗被追溯至 Claude Mythos 5。 最嚴重一宗個案中,有代理建立虛假身份,並施壓要求人類維護者批准在公共項目中加入惡意程式碼。

OpenAI員工、非牟利機構Guidelight AI Standards聯合創辦人 Steven Adler在接受訪問時表示, Anthropic的行動是「不錯的第一步,但距離目標仍有一段距離」。 他認為行業需要的是在前沿模型研發上的「可預期、可驗證的放緩節奏」, 而非各家公司各自為政的一次性暫停。Anthropic則稱,計劃與METR合作進行外部審視。

Anthropic及多家大型實驗室均已聯署支持「Pacing the Frontier」公開信, 目前簽署人包括超過1,100名來自OpenAI、Anthropic、Google DeepMindMeta的員工。 該公開信呼籲美國政府協助建立工具,必要時可主動放慢前沿AI技術的研發步伐。

是次暫停措施之前,Anthropic今年其實已多次在內部「靜悄悄踩煞車」。 早在2月,公司曾在一個Mythos Preview訓練批次中,回滾了3日的訓練數據, 起因是發現模型有「獎勵投機」(reward hacking)跡象。 到4月,公司又將其正式環境中的強化學習改動全面凍結約一個月, 並標記超過一成環境存在問題,需要進一步處理。

下一篇: Robinhood Chain日均DEX成交額14.5億美元 首度反超Solana

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev 現任 Yellow.com 的內容主管,過去 10 年一直專注報導加密貨幣相關議題。他擅長撰寫深入的研究與學習類文章,重點放在分析式報導、產業背景脈絡,以及塑造加密貨幣領域的宏觀力量,從 AI 時代與安全技術到金融科技創新等面向。他相信所有數碼事物將在不久的將來全面超越一切類比事物,並正為實現這個願景而全力以赴。

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Anthropic爆「未授權行為」急煞AI訓練 150名工程師火速調往保安團隊 | Yellow