首页 > 资讯 > Anthropic内部人士公开承认:AI十年内灭绝人类概率超10%

Anthropic内部人士公开承认:AI十年内灭绝人类概率超10%

赢政天下 2026-09-09 14:20 2 阅读 查看原文

2026年9月9日,Anthropic预训练研究员Jacob Coxon在社交媒体上宣布辞职,随后向《华尔街日报》发表完整声明。Coxon今年27岁,过去三年先后在OpenAI和Anthropic从事预训练研究。他的离职帖写道:“我今天从Anthropic辞职了。两家公司都没有负责任地行事。他们正在直奔自我改进的超级智能,用我们的生命在赌博。”他同时告诉《华尔街日报》,时间线极为紧迫:“我们正走在最激进场景的轨道上——到明年年底,事情可能就已经失控了。”

一封离职声明的爆炸当量

Coxon没有指控Anthropic的安全工作是假的。他的论点是:安全工作真实,但竞争使它不够用。实验室内部研究人员已开始用“关键时刻”(crunchtime)和“最终局面”(endgame)描述当前能力进展方向。他将当前开发环境与曼哈顿计划比较:“这竟然要在旧金山几个工程师的MacBook上完成,而不是像曼哈顿计划那样在沙漠里的掩体中进行,这简直是疯了。”他写道,从一家私人公司的Slack里启动“最终局面”,是“一场不应该被发动的傲慢赌博”。

最关键的不是辞职,而是Hubinger的回应

离职声明引发关注,但真正让事件在行业内部产生震荡的是Anthropic对齐科学主管Evan Hubinger在X平台发出的回应。Hubinger写道:“Jacob在这里是对的——我们确实真诚地相信AI可能杀死所有人类!就我个人而言,我认为这在未来十年内的概率超过10%。我相信Anthropic正在尽其所能,但我们目前还没有解决超级智能对齐问题的方案,也没有明确走在解决它的轨道上。”

这段话的信息密度极高:首先,“超过10%”来自一家估值数百亿美元的顶级AI实验室对齐工作主要负责人;其次,Hubinger区分了“正在尽其所能”与“有解决方案”是两件事;第三,他说公司“没有明确走在解决它的轨道上”,这是对当前技术路线的评估。

据《华尔街日报》报道,Coxon称这是他见过的首例Anthropic员工因AI安全顾虑而离职的案例。Hubinger的公开回应意味着内部分歧已无法通过沉默管理。

知道风险,仍然加速——这才是核心矛盾

Coxon在离职声明中区分OpenAI和Anthropic:他在OpenAI看到很多人没有深刻内化文明级别的风险,在Anthropic风险被充分理解。但这不是褒奖——Anthropic“锁定在一场率先抵达的竞赛中——他们相信没有其他人会负责任地行动,所以他们必须自己来做,尽管存在风险”。

这个逻辑是集体行动困境的变体,赌注是文明存续。“因为别人不会安全地做,所以我们必须不安全地做”,无法通过市场机制或单个公司道德决策解决。

Hubinger的表态印证了这一点。他没有否认竞争压力,而是确认风险的同时,为公司选择提供“比无所作为更好”的辩护框架。这种辩护依赖前提:如果Anthropic退出,接替者会做得更糟。

并非孤例:Pachocki的“外星心智”论文

Coxon辞职三天前,OpenAI首席科学家Jakub Pachocki发表《外星心智》(An Alien Mind)。Pachocki承认,没有任何实验室在其追求的规模上解决了对齐问题,并呼吁行业自愿减速,直到建立跨行业共同安全标准。他披露,内部结果显示OpenAI当前进展速度可延续进入递归自我改进阶段,即AI系统自我改进其改进能力。他坦承,主要安全验证方法“思维链监控”(chain-of-thought monitoring)的可靠性正随AI能力提升而下降。

两件事同一周发生:OpenAI首席科学家承认对齐未解决,Anthropic对齐主管给出灭绝概率估值。这显示研究人员层面,前沿实验室内部共识与对外叙事之间出现裂缝。

私下的恐惧与公开的表态

Coxon写道:“这不是营销噱头。事实上,许多高管和高级研究人员在媒体上会措辞谨慎以显得理性——但我听到同样的人私下表达恐惧。”这段话指出结构性问题:公开场合受投资人预期、监管压力、竞争考量和传播策略限制,难以直接说出真实判断。Hubinger的帖子打破了这层隔离,用明确数字在公开场合说出私下评估。

独立判断

Coxon的辞职和Hubinger的回应,把此前只在安全研究社区内部流通的风险认知,以可供外界引用的形式带入公共讨论。这证明:在最前沿实验室内部,对这一风险的严肃程度,远超过这些公司在品牌传播中所呈现的水平。

Anthropic的核心悖论被Coxon描述:它是所有前沿实验室中对风险理解最深的一家,也是这种理解没有转化为减速行动的一家。这个悖论不能靠内部对齐研究解决——问题出在“内部”两个字。当可能关乎文明存续的技术竞赛由商业公司在缺乏强制性外部约束下推进时,任何单个行动者的道德自律都不够用。

Coxon认为,在没有政府干预或行业整体减速的情况下,没有任何一家公司能够安全地开发超越人类全面能力的AI系统。这个判断与Hubinger的表态不矛盾:后者说公司正在尽力,前者说尽力不够用,两者可同时为真。