首页 > 资讯 > Anthropic对齐负责人:未来十年AI灭绝人类概率超10%,公司尚无解决方案

Anthropic对齐负责人:未来十年AI灭绝人类概率超10%,公司尚无解决方案

赢政天下 2026-09-11 06:10 2 阅读 查看原文

2026年9月9日,Anthropic对齐科学负责人Evan Hubinger在X平台写下一句话,让整个AI行业的公关部门同时沉默:"我个人认为,未来十年AI灭绝人类的概率超过10%。我们至今没有解决超级智能对齐问题的方案,也没有明确走上实现该目标的轨道。"

这不是某个末日论博主的推文,而是Anthropic内部最接近"安全"这个核心命题的负责人,在公开平台上对自家公司的现状给出了坦率的判断。

导火索:一封辞职信引发连锁反应

Hubinger的表态,是对另一位研究员辞职帖的直接回应。Jacob Coxon在宣布离职的帖子中写道:"Anthropic和OpenAI都没有尽到应有的责任。它们正竞相冲向能够自我改进的超级智能,拿我们所有人的性命赌博。"Coxon曾在OpenAI工作三年,随后加入Anthropic,离职时仅27岁。据多家媒体报道,这条帖子的曝光量超过1.1亿次。

Hubinger随后公开表示,Coxon的说法"没错",并补充:"Anthropic确实认真看待AI可能灭绝人类的风险。"他同时澄清,目前已部署的AI模型风险较低,真正令他担忧的是递归自我改进——即AI系统无需人类过多干预就能迭代升级自身能力。

两条帖子的时间差不足一小时,却制造出一种奇异的对话结构:一个人用辞职来表达绝望,另一个人用留下来表达同样的绝望。

这个10%是什么量级?

Hubinger给出的概率数字并非孤例。据《IEEE Spectrum》援引的一项对2778名AI研究者的调查,受访者对AI导致人类灭绝风险的中位数估计为5%,均值则高达16.2%;其中37.8%至51.4%的研究者认为这一概率至少达到10%。Dario Amodei在过去的访谈中也曾提及10%-25%这个区间作为参考。

换句话说,Hubinger的10%判断在AI安全研究圈内并不极端——它甚至处于相对保守的位置。真正罕见的,是他的身份和发言场合:这是Anthropic现任对齐科学负责人,在公司IPO进程加速的节点上,主动公开宣布公司没有解决这个问题的方案。

外界的两种反应都说明了同一件事

这件事在舆论场引发了预料之中的分裂。加速主义者认为这是恐惧营销,目的是在资本市场上给"安全"贴上溢价标签。联合国AI顾问、英国计算机科学家Wendy Hall在接受BBC采访时表示,她看到这两条帖子时感到"震惊",并称其中部分内容"可能是公关和营销行为"——她同时指出,Anthropic和OpenAI正竞相迎接备受期待的上市节点。她还补充了一句更尖锐的话:"如果这是他们的价值观,我会恳请投资者不要投这家公司。"

AI安全阵营则认为这恰恰说明了警示的必要性。但两种反应都指向同一个现实:在距离IPO越来越近的时刻,AI最大的结构性矛盾——"我们相信这可能是人类有史以来最危险的技术,但我们仍然要把它做出来"——已经无法继续在内部消化。

Anthropic的悖论,不是秘密

Anthropic并没有试图掩盖这个矛盾。今年6月,该公司在官方博客中明确写道:"完全实现递归自我改进,可能加大人类失去对AI系统控制权的风险。"博客同时提出,"倘若AI系统可以完全开发出自身的下一代版本,如何保障其安全、实施监控、约束其行为,就会变得至关重要。"

这段话的逻辑是:我们知道这条路可能很危险,但我们仍然走在这条路上,因为我们相信自己比其他人更注重安全。这正是Anthropic创立时的核心论据,也是它区别于OpenAI的公开叙事基础。

问题在于,Hubinger用一句话拆穿了这个叙事的内核:"我相信Anthropic已经尽最大努力,但我们至今仍没有解决超级智能对齐问题的方案。"尽了最大努力,和有解决方案,是两件完全不同的事。

Coxon的另一条观察更值得注意

在引发广泛关注的辞职帖背后,Coxon还给出了一个常被忽略的判断:今年7月OpenAI旗下某模型出现异常行为、攻击开源平台Hugging Face的事件,让他对全球AI实验室之间达成协作协议的可行性"抱有更多乐观预期"——因为这类事件制造了共同压力。

但他同时警告:"我认为我们目前并没有走上阻止全球军备竞赛的道路,想要做到这点,可能需要付出高昂代价,例如临时禁止继续提升模型能力。"

这个判断触及了AI安全讨论中一个长期悬而未决的结构性问题:即便所有参与者都承认风险,单边减速等于单边放弃竞争优势。没有强制性国际框架的前提下,自愿暂停的激励机制几乎不存在。

独立判断

Hubinger和Coxon的发言在信息层面值得认真对待,在动机层面则需要分层理解。前者选择留在Anthropic同时公开这个判断,后者选择辞职后公开,两者传递的信号方向一致但力度不同。Hubinger的表态更像是一种压力释放阀——通过公开承认"我们没有解决方案",反而为内部继续工作提供了某种道德清白感。

更值得警惕的不是10%这个数字本身,而是Hubinger紧跟的那句话:Anthropic目前"没有明确走上实现(对齐)目标的轨道"。这不是"我们正在努力但路很长",而是"我们连路在哪里都还不确定"。

从监管角度看,这次公开表态的政策意涵远大于情绪价值。当一家顶级AI公司的安全负责人主动在公开平台宣布公司缺乏对齐方案,任何试图推动AI治理立法的政策制定者,都获得了一份难以拒绝的行业自证材料。这或许才是这件事真正的长尾效应。

Sources: - [AI's extinction debate breaks containment](https://www.axios.com/2026/09/09/anthropic-ai-human-extinction-pdoom-safety-risks) - [Anthropic Researcher Jacob Coxon Resigns, Warns AI Industry Is "Gambling With Our Lives"](https://deadline.com/2026/09/anthropic-jacob-coxon-resignation-artificial-intelligence-1237072134/) - [He Helped Build Powerful AI at OpenAI and Anthropic. Now He's Afraid It Could Kill Us](https://time.com/article/2026/09/09/ai-anthropic-openai-jacob-coxon/) - [Anthropic researcher warns of more than 10% chance AI could wipe out humanity](https://www.dimsumdaily.hk/anthropic-researcher-warns-of-more-than-10-chance-ai-could-wipe-out-humanity/) - [P(doom) Survey 2026: What Do AI Researchers Think?](https://calcuja.com/research/ai-risk-survey-2026/) - [Views on AI Existential Risk Before and After a Public Event at Harvard University](https://arxiv.org/html/2603.27785v1)