Anthropic 研究员 Jacob Coxon 因担忧人工智能失控于本周递交辞呈。对此,该公司对齐(alignment)负责人公开表示,在本十年内,AI 导致人类灭绝的概率“超过 10%”。
要点梳理:
- Jacob Coxon 在 OpenAI 与 Anthropic 从事三年预训练研究后选择辞职,称两家公司都在竞逐其自身无法控制的系统。
- Anthropic 对齐科学负责人 Evan Hubinger 认为,未来十年内 AI 导致人类全体灭绝的个人概率判断已“高于 10%”。
- Hubinger 表示现阶段模型风险较低,他的核心担忧集中在“递归自我改进”触发的超级智能。
“AI 军备竞赛”下,Jacob Coxon 选择离开 Anthropic
27 岁的 Coxon 过去三年一直在 OpenAI 和 Anthropic 专注预训练研究。本周三,他在 X 上发布长帖宣布辞职,称两家公司都没有尽到应有责任,却在“押注人类性命”的前提下,竞相冲刺自我改进型超级智能。首条贴文在数小时内浏览量即突破 1900 万次。
在另一场采访中,他进一步警告,目前最激进的情景路径“正在兑现”,局面可能在明年年底前彻底失控。他表示,身边同事如今频繁使用“冲刺期(crunchtime)”“终局(endgame)”等词描述行业走向。
Coxon 本科主修数学,之后转入模型训练领域。今年早些时候,他从 OpenAI 跳槽 Anthropic,原因正是后者在业内以“安全优先”著称。不过在他看来,一旦顶级实验室为竞赛所驱,安全让步就“不可避免”。他现在的立场是:在缺乏政府干预或全行业协调放缓的前提下,任何公司都不可能“负责任”地打造出具有人类水平的通用 AI。
延伸阅读:XRP 价格在 9 月鲸鱼再度加仓后剑指 1.46 美元
Evan Hubinger:人类灭绝概率“高于一成”
负责 Anthropic 对齐科学、主导模型压力测试的 Evan Hubinger 随后公开回应,称 Coxon 对当前形势的描述“基本准确”。他在一篇文章中估算,未来十年内 AI 导致人类全部灭绝的概率,在他个人判断中“已高于 10%”。
Hubinger 表示,公司“正在尽最大努力”,但目前没有针对超级智能对齐问题的成熟方案,也看不到一条清晰的解决路径。他同时强调,当下这一代模型本身的风险相对较低,他真正担心的是“递归自我改进”:即模型通过训练和升级后继系统,从而演化出远超人类、且不受人类制约的超级智能。
Hubinger 的评估属于个人判断而非公司官方预测,而这类数字高度依赖对未来能力演进与部署方式的一系列争议性假设。Anthropic 此前公开表示,“递归自我改进”并非必然发生,但一旦来临,可能远早于各国制度准备就绪的时间窗口,并显著放大人类失控风险。
安全团队出走潮加剧
Coxon 并非首位从 Anthropic 安全线离职的核心成员。此前,负责公司 safeguards 团队的 Mrinank Sharma 也已离职,他在临走前直言“世界正处于险境”,并表示将赴英国攻读诗歌相关课程。
Anthropic 成立于 2021 年,由一批前 OpenAI 员工创办,一直试图将自身塑造成“以安全研究为核心”的实验室品牌。截至本周三早间,公司尚未就 Coxon 的离职发布公开回应。





