Anthropic 研究員 Jacob Coxon 近期請辭,表明擔心人工智能最終失控; 其後公司負責對齊研究的主管則罕有地表示,他個人估算本年代內人類被 AI 滅絕的機率超過一成。
重點摘要:
- Jacob Coxon 在 OpenAI 及 Anthropic 從事三年預訓練研究後離職,指兩間公司同樣在瘋狂衝刺開發自己都難以控制的系統。
- Anthropic 對齊科學主管 Evan Hubinger 表示,他個人認為未來十年內 AI 導致人類全部死亡的機率超過 10%。
- Hubinger 指出,現階段模型本身風險仍低,他主要憂慮來自可遞迴自我提升的超級智能。
Coxon 炮轟 AI 軍備賽後離開 Anthropic
年僅 27 歲的 Coxon,先後在 OpenAI 和 Anthropic 投入三年時間研究大型模型的預訓練。 他於本周三清晨在 X 上發文宣布辭職, 直指兩間公司都未有負責任行事,卻一味競賽式衝向可自我提升的超級智能,等同拿全人類性命來豪賭。 相關貼文在數小時內瀏覽量已突破 1,900 萬。
他其後在訪問中再度示警, 指最激進的發展路徑現已成為主流預設情景,情況最快或在明年年底前完全失控。 他透露,身邊同事現時經常以「crunchtime」(最後死線)及「endgame」(終局)來形容行業走勢。
Coxon 本科修讀數學,其後轉投模型訓練工作,今年初由 OpenAI 跳槽至 Anthropic, 正是看中後者標榜「安全優先」的形象。 他說,一旦實驗室之間互相競爭,安全上的取捨就會變得不可避免。 他現時的觀點是:沒有政府強力介入或整個產業協調式放緩,任何公司都不可能在真正負責任的情況下,單憑自身就打造出具人類水平的 AI。
延伸閱讀:XRP 價格瞄準 1.46 美元,大戶 9 月再度積累
Evan Hubinger:人類滅絕風險逾一成
Anthropic 對齊科學負責人、同時主導模型壓力測試的 Evan Hubinger 隨後公開回應, 指 Coxon 對現況的描述「是對的」。 他在受訪時估算, 未來十年內人工智能把人類「全部殺死」的機率,個人認為超過 10%。
Hubinger 表示,公司已盡力而為,但現階段並沒有一套可行方案去解決超級智能的對齊問題, 亦看不到正走在一條必然通向解決方案的路徑上。 他後來補充,現時世代的模型本身風險屬低水平, 真正值得憂慮的是,若未來出現透過「遞迴自我改進」而誕生的超級智能——即 AI 自行訓練下一代更強 AI——風險將會急劇放大。
需要留意的是,以上估算屬 Hubinger 個人判斷,並非 Anthropic 的官方預測。 這類數字本身,亦建立在對未來 AI 能力及部署方式一系列高度爭議的假設之上。 Anthropic 過去公開表示,遞迴自我提升並非必然會出現, 但一旦來臨,很可能快過各國制度與監管的準備速度,大幅推高人類喪失控制權的機會。
Anthropic 安全團隊人手流失加劇
Coxon 並非首位離開 Anthropic 的安全研究人員。 今年較早前曾主管公司防護(safeguards)團隊的 Mrinank Sharma 亦已請辭, 臨走時同樣警告世界正處於危險邊緣,並表示將遠赴英國修讀詩歌。
成立於 2021 年、由前 OpenAI 員工創立的 Anthropic,一直以「安全研究優先」塑造品牌形象。 不過,截至周三早上,針對 Coxon 的公開指控與辭職聲明,Anthropic 仍未發表任何正式回應。





