Anthropic 研究員 Jacob Coxon 近日因憂心人工智慧失控而請辭,隨後,公司負責對齊研究的主管公開表示,在未來十年內,AI 導致人類「滅絕級風險」的機率,他個人評估已高於一成。
重點整理
- Jacob Coxon 在 Anthropic 與 OpenAI 專注前訓練研究三年後離職,直指兩家公司正競逐自己無法掌控的系統。
- Anthropic 對齊科學負責人 Evan Hubinger 表示,他個人估計,未來十年內 AI 導致人類全部死亡的機率超過 10%。
- Hubinger 認為現有模型風險仍低,但真正令人憂慮的是「遞迴自我強化」所帶來的超級智慧。
Jacob Coxon 為何離開 Anthropic:不信任「AI 軍備賽」
年僅 27 歲的 Coxon,過去三年先後在 OpenAI 與 Anthropic 進行前訓練模型研究,本週在 X 上發文宣布請辭,掀起軒然大波。他直言,這兩家公司都沒有展現足夠責任感,卻仍在競相衝刺能自我強化的超級智慧,等同拿全人類性命賭博。這則開頭貼文數小時內即累積逾 1,900 萬次瀏覽。
在另一場訪談中,他進一步警告,最極端、最具破壞力的情境,如今反而成為「基準路徑」,若不踩煞車,最遲明年底恐完全失控。他表示,身邊同事如今動輒以「crunchtime」(最後衝刺期)、「endgame」(終局)等字眼形容技術發展軌跡。
Coxon 大學主修數學,之後投入大型模型訓練,今年稍早才因看重 Anthropic 的「安全形象」而從 OpenAI 轉戰而來。但他指出,一旦實驗室之間陷入激烈競爭,「安全讓步」就幾乎無可避免。他現在的立場是:在沒有政府出手監管、或產業內協調集體放緩之前,任何一家公司都不可能「負責任地」打造人類級 AI。
延伸閱讀: XRP 價格有望挑戰 1.46 美元,九月「巨鯨回補」再啟動
Evan Hubinger:人類滅絕風險,個人估逾一成
負責 Anthropic 對齊科學、並主導模型壓力測試的 Evan Hubinger 隨即回應,認同 Coxon 對現況的描述基本正確。他在後續發言中估算,在未來十年內,AI 導致「人類整體滅絕」的機率,自己個人判斷已超過 10%。
Hubinger 表示,Anthropic 正「盡最大努力」做好安全與對齊,但公司目前並沒有明確方案,能保證解決超級智慧 AI 的對齊問題,也看不出已走在一條「穩健可解」的路徑上。他補充,目前市面上的模型本身風險仍屬偏低,他真正憂心的是未來可能出現「透過遞迴自我強化而進化」的超級智慧,也就是由現有系統訓練出更強大後繼者的架構。
值得注意的是,這一數字為 Hubinger 的「個人主觀判斷」,並非公司正式預測。此類風險機率高度依賴對未來 AI 能力上限、商業部署節奏與治理成效的各項假設,學界與產業內仍存巨大爭議。Anthropic 過去公開表示,遞迴自我強化並非必然結果,但若發生,很可能在各國與機構尚未準備完善之前到來,並大幅提高人類失控的風險。
Anthropic 安全團隊出走持續累積
Coxon 並非首位選擇離開的 AI 安全研究員。公司前安全防護團隊負責人 Mrinank Sharma 今年稍早也已請辭,臨行前同樣拋出「世界正處於危險邊緣」的警訊,隨後表示將赴英國研讀詩學,暫別前沿科技。
Anthropic 由一批前 OpenAI 員工於 2021 年創立,起家招牌就是「安全至上」的研究路線。不過,面對 Coxon 的公開指控與離職風波,截至週三上午,公司仍未對外發出正式回應。





