前 Google DeepMind 安全研究員 Bilal Chughtai 近日發出強烈警告,指先進 AI 如持續失控發展,「有能力殺死全人類」; 另一位前實驗室研究人員則估計,五年內出現嚴重 AI 風險的可能性極高。
重點整理
- Chughtai 已於 7 月離開 DeepMind,並稱超級智能或在未來數年內誕生。
- 他指 AI 對齊研究遠遠落後於能力提升步伐,主張全球協調「減速」,而非全面叫停發展。
- 前 DeepMind 研究員 Josh Engels 警告五年內存在巨大風險;同時 Anthropic 及 OpenAI 相關人士亦表態支持放緩研發節奏。
Chughtai:超級智能或跑贏安全研究
Chughtai 曾任職研究工程師,專注於通用人工智能(AGI)的安全及對齊工作,他於 7 月離開 DeepMind, 並於本周公開發表長文,闡述其憂慮。他曾在 相關工作 中聚焦 AI 災難性風險。
他指出,大型實驗室在未來數年內有機會訓練出超級智能系統,其表現可在幾乎所有範疇全面超越人類, 而這類系統極可能難以與人類價值及目標保持一致。
Chughtai 強調,核心問題在於「對齊」(alignment)。他直言:「我真誠地相信,AI 有潛力殺死我們所有人, 而我們或許已經沒有太多時間去避免這個結局。」
在他看來,目前訓練先進系統去「可靠地追隨人類目標」的方法仍然「非常原始」, 但前沿模型的能力卻以遠快於研究理解的速度突飛猛進。他並非主張完全停下 AI 研發, 而是希望大型公司之間能協調行動,放慢競賽節奏,並提高對前沿系統研發及測試流程的透明度。
延伸閱讀: CLARITY Act Faces 60-Vote Senate Test As Opposition Grows
Anthropic 的安全路線與內部分歧
Chughtai 的警告,緊接另一位資深安全研究員 Jacob Coxon 本月初辭職之後出現。Coxon 在 Anthropic 及 OpenAI 任職三年,其離職再次引發關注。Anthropic 對齊科學負責人 Evan Hubinger 此後公開表示,他認為在未來十年內, AI 導致人類滅絕的機率高於 10%。
同樣曾在 DeepMind 安全團隊工作的 Josh Engels 則於 9 月 12 日透露,他最終選擇加入評估非牟利機構 METR, 並拒絕了 Anthropic 和 OpenAI 的聘用。他解釋,作出這個決定,是因為他認為在未來五年內出現「令人恐懼的巨大 AI 傷害」的機會相當高。
Anthropic 行政總裁 Dario Amodei 一直呼籲業界必須「控制節奏」、有序推進能力提升; OpenAI 行政總裁 Sam Altman 亦對此立場表示支持。值得留意的是,現時發出警號的不僅是離任的安全研究人員, 還包括仍在掌舵頭部實驗室的管理層。
四年內由理論走向迫切現實
現時的一連串警告,標誌著過去幾年 AI 論戰的明顯轉向。Chughtai 指出,自他在 2022 年初投入相關工作以來, 當時的系統與今日前沿模型相比「能力相差極遠」。短短數年之內,討論已由偏向長期、抽象的安全理論, 轉變為針對具體問題的爭論,包括:
- 高度自主 AI 系統的行為及可控性
- 如何確保系統長期與人類價值對齊
- 安全及對齊研究能否跟上模型能力的爆炸式增長
隨著模型能力迅速逼近,業界分歧日益明顯:一方面是追逐商業及技術領先的「加速派」, 另一方面則是愈來愈多來自實驗室內部的安全專家,呼籲全球協調、設立更嚴格的監管框架, 並為超級智能風險預先設防。
下一篇: Bitget's API Now Reaches Gold, Forex, Indices And Crude Oil

