前 Google DeepMind 安全研究員 Bilal Chughtai 近日發出強烈警告,指人工智能若演化為超級智能而未能妥善「對齊」人類目標,最壞情況下或有能力「殺死所有人類」。另一名前實驗室研究員則估計,嚴重傷害有機會在未來五年內出現。
重點摘要
- Chughtai 已於7月離開 DeepMind,並認為超級智能有可能在數年內出現。
- 他指出安全與對齊研究遠遠追不上能力增長,主張協調式「減速」,而非全面叫停AI研發。
- 前DeepMind研究員 Josh Engels 預期未來五年內存在「巨大傷害」風險,Anthropic 及 OpenAI 多名人士亦支持放慢開發步伐。
Chughtai:超級智能或跑贏安全研究
Chughtai 曾任 DeepMind 研究工程師,主要專注於通用人工智能(AGI)的安全及對齊問題。他於今年7月離職,並在本周公開撰文提出警告。
他指,全球多間頂尖AI實驗室,在未來幾年內很可能訓練出超級智能系統,其能力在各個範疇全面超越人類,但卻難以確保其行為真正服從並符合人類長遠利益。
Chughtai 直言,核心風險在於「對齊」問題。他寫道:「我真誠地相信,AI是有能力殺死我們所有人的,而我們可能正逐漸失去避免這個結局的時間。」
以目前技術而言,他認為,用來訓練及約束先進系統、令其穩定追求人類既定目標的方法仍「極為初階」,遠遠落後於前沿模型在能力上的突破速度。他並不主張全面禁止或停止AI發展,而是希望業界:
- 放緩「軍備競賽式」的商業競爭節奏;
- 在行業層面協調開發路線;
- 對前沿系統的訓練方法、測試程序及風險評估提高透明度。
延伸閱讀: CLARITY Act Faces 60-Vote Senate Test As Opposition Grows
Anthropic 的安全壓力與離職潮
Chughtai 的表態,緊接 Jacob Coxon 本月初辭去職務之後。Coxon 過去三年先後於 Anthropic 及 OpenAI 工作,其後離職。Anthropic 對齊科學負責人 Evan Hubinger 其後表示,他認為在未來十年,AI導致人類滅絕的機率「高於10%」,該說法一度引起市場關注及爭議。
DeepMind 前安全團隊成員 Josh Engels 則在9月12日透露,他已加入專注評估AI風險的非牟利機構 METR,並拒絕了 Anthropic 及 OpenAI 的工作邀請。Engels 解釋,自己因為看到未來五年內存在「極度可怕」的巨大AI傷害風險,才決定轉向獨立評估機構。
Anthropic 行政總裁 Dario Amodei 一直呼籲業界應放慢能力提升速度,OpenAI 行政總裁 Sam Altman 亦公開支持類似立場。隨著領先實驗室之間的爭論升温,這種「放慢腳步」的共識變得愈來愈重要,因為示警聲音已不僅來自離職的安全研究員,同時亦來自仍在掌舵前沿AI公司的高層。
自2022年初以來,AI發展節奏急速加快。Chughtai 回顧自己剛開始投入該領域時,當時的系統能力遠不及現今前沿模型。短短幾年,討論焦點已從較抽象的「長期安全理論」,迅速轉向具體的實務憂慮,例如:
- 自主行為與失控風險;
- 模型是否真正與人類價值「對齊」;
- 安全與對齊研究能否追上模型能力的幾何級數增長。
下一篇: Bitget's API Now Reaches Gold, Forex, Indices And Crude Oil

