Anthropic 是当前全球最受关注的 AI 公司之一,总部位于美国旧金山,2021 年由一批从 OpenAI 出走的成员创立,主力产品是聊天机器人 Claude——可以把它理解为 ChatGPT 的直接竞品。这家以「AI 安全」为立身招牌的公司,在 2026 年 9 月 9 日接连传出两条震动行业的消息:一名资深安全研究员公开辞职,指责公司「拿生命赌博」;随后该公司的安全团队负责人公开承认,他们真的相信 AI 可能杀死所有人类,个人估计概率超过 10%,并且公司「还没有计划」阻止这件事。
两名主角和一场公开辞职
先交代两个主角。Jacob Coxon 是 Anthropic 的资深安全研究员,此前曾在 OpenAI 负责训练 AI 系统,2026 年 9 月 9 日他在社交平台 X 上宣布离职,理由是公司对安全的处理「过于松懈」。Evan Hubinger 是 Anthropic 安全团队的负责人,他在这场风波中公开回应,认可了 Coxon 的判断。
Coxon 辞职时说了一句重话:Anthropic 和 OpenAI 两家公司「正在竞速冲向自我改进的超级智能,拿我们的生命赌博」。他还指出,连亲手建造这些 AI 的人都真心相信,AI 可能在 2030 年之前杀死所有人类。Hubinger 的回应更直接——「我们真的认真相信 AI 可能杀死所有人类」,他把个人估算的概率定在未来十年内超过十分之一。
两个必须翻译的术语
这场争论里有两个词,不解释清楚就听不懂。第一个是「超级智能」:指智力全面超过人类、能在几乎所有领域比人做得更好的 AI。「自我改进」则指 AI 能够自己改写、升级自己的程序——理论上它可以反复迭代,越变越强。
第二个是「AI 对齐」:一门研究「怎么确保 AI 想做的事,正是人类想让 AI 做的事」的技术方向。简单说,就是给 AI 装一个可靠的「方向盘」。Hubinger 承认,Anthropic 目前没有明确的计划确保高级 AI 与人类价值对齐,也「没有走上正轨」去制定这样的计划。
研究人员真正担心的是什么
这场争论的关键不是「AI 会不会变强」,而是「变强的路上会不会失控」。研究人员担心的失控路径叫递归自我改进:AI 改进自己 → 改进后的 AI 更擅长改进自己 → 再改进,如此循环加速,快到人类来不及踩刹车。今天这个循环还没有真正启动,但行业已经在为它铺路——如今大量 AI 代码本身,就已经是 AI 帮忙写的了。
为什么这次警告的分量不同
把这件事放进更大的背景里,信号更值得注意。Anthropic 本身就是「安全出走」的产物:2021 年,一批 OpenAI 成员因为不满该公司对安全问题的处理而离职、自立门户,Claude 由此诞生。如今轮到 Anthropic 的人因为同样的理由离开,并且点名批评新老两家公司。
另一个背景是钱。Anthropic 与 OpenAI 都在筹备首次公开募股(IPO,即公司股票第一次公开上市交易),融资与估值压力之下,谁先把更强的模型推向市场,谁就能拿到更多资本——Coxon 说这正是两家公司「明知风险仍不肯减速」的原因。近几个月,行业里还接连出现多起 AI 智能体(能自主执行任务的 AI 程序)失控事件,以及来自高层的安全警告。
这篇文章值得带走的一个结论是:这不是科幻讨论,而是两家头部 AI 公司内部人员——包括负责安全的团队负责人——亲口说出的判断。当「AI 可能杀死所有人类」的概率被公司内部估算为超过 10%,而公司承认没有对策时,行业真正需要回答的问题就变成了:在竞速与避险之间,谁来踩刹车,怎么踩。