首页 > 资讯 > Anthropic研究员辞职警告:自我改进AI恐毁灭人类

Anthropic研究员辞职警告:自我改进AI恐毁灭人类

赢政天下 2026-09-10 02:25 4 阅读 查看原文
Anthropic研究员辞职警告:自我改进AI恐毁灭人类

2026年9月10日,科技媒体Ars Technica刊文报道了一则震动AI圈的消息:人工智能公司Anthropic的一名研究员宣布辞职。临别之际,他向世界留下一句冷峻的警告——“我们真的、由衷地相信,AI可能杀死所有人类。”这句话迅速在网络上扩散,令人们重新开始讨论自我改进AI带来的生存级风险。

据Ars Technica报道,这名研究员长期从事AI对齐与安全评估工作。对齐研究的核心目标,正是避免AI系统在追求目标时采取违背人类价值的路径。可讽刺的是,切身体会到这一挑战难度的人,最终选择离开。这一决定,给AI界“安全可控”的叙事投下了一层阴影。

自我改进AI究竟可怕在哪里?

所谓“自我改进AI”,指的是能够像人类工程师一样审视、修改甚至重写自身代码,不断迭代能力的AI系统。目前的大语言模型并没有完全自主的自我改进能力——它们通常在训练完成后被冻结,只能通过外部反馈或额外工具进行有限修正。但是,如果某个系统具备了通用智能,并能在内部形成“设计—测试—部署”的闭环,它就可能进入指数级进化轨道。该研究员在报道中暗示,这种进化速度可能远远超过人类更新安全护栏的速度。

“我们真的、由衷地相信,AI可能杀死所有人类!”

这句看似极端的表述,其实是许多AI安全研究者长期以来的“思想实验”。但区别在于,以前它多停留在论文里,如今却出现在一位业内人士的离职现场。

Anthropic:安全理想与竞争现实的夹缝

Anthropic由数位OpenAI前核心成员于2021年创办,长期以“AI安全”为旗帜。其Claude系列模型在对话体验中展现出的“保守”也让它在各大厂商中独树一帜。然而,成立至今,Anthropic同样陷入商业竞赛的漩涡:一方面要避免释放危险能力,另一方面又要与OpenAI和Google争夺前沿阵地。公司已多次融资并扩大算力部署,内部安全团队则持续承受“既要性能、又要守规矩”的双重压力。

研究员离职事件不是孤立个案。此前已经有多名AI安全骨干离开头部实验室,他们中有人选择加入开源阵营,也有人直接退出业界,转入政策或公众教育领域。每一次类似事件,都会让外界重新审视:当最了解AI的人选择“逃离”时,行业高速列车的刹车闸到底在哪里?

当然,也应当避免把个体的辞职直接等同于技术末日的预兆。人工智能风险至今缺乏严格的实证工具证明“灭绝”一定发生。相关推演依赖大量假设与边界条件,远不是定论。然而,这次事件提供了一个难得的提醒:关于AI的讨论不能只沉迷于参数、算力、融资,也应该正视它的不确定性。

编者按:“杀死所有人类”的说法具有极大冲击力,但我们不应止步于情绪层面的震撼。自我改进AI是否必然导致灾难,目前尚无确凿答案;更值得关注的是,在定义模糊、监管滞后、评估体系尚未成熟的今天,我们是否已经具备安全驾驭这类技术的能力。这位研究员的辞职,应该被理解成又一次“真实的顾虑”,而非一句博眼球的台词。

本文编译自Ars Technica。