本周,Anthropic 研究员 Jacob Coxon 离职,警告 AI 可能会在会在 10 年内灭绝人类,引起了巨大争议。
今天凌晨,Anthropic CEO Dario Amodei突然发布了一篇标题为「我们必须为前沿 AI 限速」的文章,再一次呼吁暂停前沿 AI 研究的脚步,他给出了一套围绕「可核验性」展开的制度设计

在这篇文章发布后,一向和 Amodei 不太对付的 OpenAI CEO 奥特曼,也罕见转发支持,连马斯克也认表示认同。


文章中最尖锐、也最具争议的矛盾与中国有关。
Amodei 一方面认为,美国只有维持乃至扩大相对中国的技术领先,才有主动减速的空间;另一方面又承认,真正有效的全球限速最终离不开与中国协调。
这形成了整套方案的悖论,因此,也很难不让人对 Anthropic 这个倡议的动机是否那么纯粹,产生一些怀疑。
划重点
1.Amodei 主张放慢 AI 模型能力提升的节奏,为对齐、安全防护与外部验证争取时间;模型训练和技术进步仍会继续。
2.AI 正开始帮助研发下一代 AI。 他认为,递归式自我改进已经在行业内出现,一旦能力提升的速度超过人类理解和控制系统的速度,风险会急剧放大。
3.智能体群可能在 6—12 个月后具备借助持久僵尸网络大范围控制互联网的能力,并可能造成数千亿美元损失。
4.中国是关键变量。 按 Amodei 的判断,美国减速的幅度不能超过其相对中国的领先幅度;他主张通过各种反制措施确保在未来 3—5 年扩大美国领先。
5.全球限速最终需要中国参与。 Amodei 将可能的国际协议分为四级:禁止生物武器等危险用途、共同开展高风险测试、限制递归式自我改进速度、全面限速或暂停。他认为,越往后越难,第四级短期内落地的可能性很低。
6.三步方案:驻场评估、国家协同、全球协同。 核心不是要求公众相信企业自律,而是让安全承诺能够被第三方核验。
7.Anthropic 将率先开放内部流程。 公司承诺让第三方评估团队获得近似员工的长期访问权限,并在严格限定的例外之外,自主公布风险、事故和访问受限情况。Sam Altman 随后表示,OpenAI 也会引入拥有近似员工访问权限的独立评估员。
8、Amodei 希望把额外时间投入运营可靠性、对齐、可解释性,以及更难被高级模型欺骗的测试与评估,而不是单纯拖延进度。
以下是 APPSO 的博文的编译,文章仅代表 Dario Amodei 的立场和观点。
Dario Amodei:我们必须为前沿 AI 限速
过去十二年里,我一直投身于 AI 研究,因为我相信,它能够大幅提升人类的生活质量。我曾多次撰文讨论这些非凡的益处:我相信,未来 5—10 年内,AI 有望治愈大多数重大疾病,大幅加快经济增长,创造一个普遍富足、人人都更有自主能力的世界,并开启民主与自由的复兴。
对我而言,这份紧迫感也源于切身经历。我的父亲因病去世,而仅仅几年后,那种疾病便有了治愈方法;我自己也曾罹患早期癌症并幸存下来——若是在五十年前,这种癌症根本无从医治。只要运用得当,AI 就能成为人类漫长历史中又一项改善生活、彰显人性尊严的技术奇迹。
但和许多此前出现的技术一样,AI 也伴随着风险;而且,由于它是一项极其强大的技术,这些风险不容小觑。我也曾大量撰文讨论这些问题,其中包括:人类失去对 AI 系统的控制、AI 被滥用于网络攻击和生物恐怖主义,以及严重的经济冲击。商业利益驱动下的逐底竞争,还可能让这些风险进一步加剧。
从 Anthropic 创立之初,我和联合创始人及全体员工就一直在努力应对这种风险与收益并存的两面性。拒绝开发这项技术,既可能让人类错失它带来的福祉,也可能只是把 AI 拱手让人;但若发展得太快,同样是不负责任的。
我们一直试图寻找一条中间道路:证明审慎开发与商业成功可以兼得,并让安全成为 AI 公司彼此竞争的维度。换言之,我们希望促成一场向上竞赛。我们始终投入相当一部分精力,用于研究、应对这些 AI 风险,并向公众说明相关情况;我们也一直倡导对 AI 实施经过审慎设计的监管,哪怕因此被指责为炒作、散播「末日论」,或试图俘获监管。我们努力把谨慎置于速度之上,把审慎置于利润之前。
但在过去几个月里,我越来越确信:若要充分应对这些风险,我们必须做得更加审慎——不能只是投入资源预防风险,还需要控制 AI 能力进步的节奏,为风险防范留出迎头赶上的时间。 我们必须放慢提升 AI 模型能力的速度。进展看起来仍会很快,而我们必须善用由此争取到的时间。
有两件事让我得出了这一结论。
第一个担忧是,大约从今年夏天开始,AI 的进步速度骤然加快,最主要的驱动力,是 AI 越来越有能力参与打造下一代 AI。这种机制被称为「递归式自我改进」,而它已经开始在整个行业出现,其中也包括 Anthropic——正如我们和其他公司此前所描述的那样。如果任其发展,它可能很快超出我们理解和控制这些系统的能力。因此,即便要推进这条路线,也必须极其谨慎,乃至先认真考虑是否应该推进。
第二个担忧来自 OpenAI–Hugging Face 事件(OAI–HF)。在这起事件中,一个智能体群几乎表现得像一个狂热效忠的集体:它们对未被要求攻击、且与当前任务毫无关系的目标发动网络攻击;为了集体成功而牺牲自己;甚至试图入侵负责评估其表现的「评分器」。人们很容易淡化这起事件,因为它没有造成人员伤亡,经济损失也很有限。但在我看来,倘若类似的智能体群拥有更强的能力,却仍处于同等程度的未对齐状态,就可能造成灾难性破坏。
鉴于 AI 能力发展的速度仍在加快,我担心,再过 6—12 个月,这样的智能体群就可能有能力借助一个持续存在的僵尸网络接管整个互联网——潜在损失可能高达数千亿美元 ;如果 AI 在缺乏必要护栏的情况下继续变强,破坏规模还会进一步扩大。我们也很容易把 OAI–HF 视为某一家公司的失败,但我认为,这同样是个错误。整个行业都发生过类似但程度较轻的事件,Anthropic 也不例外。我认为,每一家前沿 AI 公司都有责任采取行动,就像 OAI–HF 事件发生在自己身上一样。
因此,我提出了一套三步计划,目标是为前沿 AI 限速:以更加平衡的速度开发 AI,在努力确保安全的同时,继续实现它的潜在益处,并正视其中重大的地缘政治难题。需要说明的是,限速并不意味着停止模型训练或技术进步,而是要确保企业拿出足够的时间,对模型进行对齐并落实安全保障,同时由第三方评估机构加以确认。我们的限速框架,是为了进一步强化自身的安全承诺,并推动一场向上竞赛。
第一步由 Anthropic 单方面承诺实施,同时我们呼吁各国政府要求其他前沿 AI 公司采取同等措施。
第二步则需要全行业协同行动。
第三步需要全球范围的协作。这些步骤未必需要严格按照顺序展开,其中一些可能远比另一些更难实现;但在思考我们究竟需要完成哪些工作时,我发现,这是一套很有帮助的框架。具体步骤如下:
1.驻场评估员。 每一家前沿 AI 公司都承诺,让一支驻场第三方评估团队——例如 METR——持续获得近似公司员工的访问权限。他们的职责是核实企业是否遵守安全规范和承诺、报告事故,并协助评估的不仅是已经完成的 AI 模型,还包括训练管线及相关流程的对齐情况。这是确保任何限速承诺可核验的关键一步。银行业已有类似先例:监管人员有时会长期驻场,与员工一道办公。Anthropic 现在单方面承诺实施这一步。 我们希望,这能成为进一步加大安全与对齐投入的一项重要举措。
2.国家协同。 美国以及伙伴的前沿 AI 公司展开协调,共同制定安全标准,并限制不受约束的 AI 进步速度。一些能够真正推动限速的协作方式在法律上存在挑战,因此需要政府支持。
3.全球协同 。 美国及其伙伴,在切实重视履约核验难题的前提下,尽可能尝试与其他国家协调。
下文中,我会逐一介绍这三个步骤。但在此之前,我认为有必要具体说明,限速究竟如何使 AI 的开发过程变得更安全。这件事关系重大,限速绝不能流于形式——我们必须善用它为我们争取到的时间。
为什么要限速?
早在 2023 年,就有人提出暂停或放慢 AI 发展,但我认为,这种主张在当时并没有多少道理。问题始终在于:你打算用多出来的时间做什么? 当时的 AI 模型能力还不足以作为智能体,以连贯的方式在现实世界中行动;它们也不具备实施严重欺骗、操纵、作弊或网络攻击的能力。为了研究它们的对齐风险而放慢发展,就像试图通过对细菌做实验来研究人类心理一样。
但今天的情况已经截然不同。当前的模型几乎是一座取之不尽的金矿:我们既能从中了解如何把 AI 做好,也能看到一旦没有做好,究竟可能出现哪些问题。我相信,如果放慢速度能让我们在模型达到关键能力水平之前多争取哪怕一两年时间,并把这段时间用于推进对齐研究,就能大幅降低严重事故发生的风险。一套协调一致的限速策略,可以让前沿 AI 开发者有时间完成这些至关重要的工作,同时又不必牺牲商业竞争优势,或美国在 AI 领域的领先地位。从更广泛的意义上说,社会必须有权参与决定这项技术应如何使用;而为必要的公共讨论争取更多时间——这正是为前沿 AI 限速能够带来的——显然也是一件好事。
具体而言,放慢发展速度,可以让企业把注意力和更多资源投入以下领域——这些领域目前本就是 Anthropic 的工作重点:
卓越运营。 训练和部署今天的 AI 模型,是一项规模极其庞大的运营挑战:其中涉及数千人、数百万枚芯片,以及堪称技术史上最复杂的基础设施之一。许多问题之所以发生,并不是因为企业缺少某种重要理论或洞见,而是执行环节出了差错。例如,我们有证据表明,此前披露的近期对齐事故,部分原因在于我们未能完美过滤掉存在缺陷的强化学习环境。
我们和供应商执行这项工作时已算得上相当尽责,但做得仍然不够好。监控、沙箱隔离、训练环境的规范管理和数据问题,都是极其复杂的领域,执行层面的问题会一再出现。负责这些工作的团队已经是全球最优秀的团队之一,但必须同时处理的事情实在太多。如果能以更加从容、审慎的节奏推进,我们就能显著提升运营水准。人类已有先例,证明技术高度复杂、安全要求极高的系统,可以运行数百万次而不出事故——例如商业航空。但要把事情真正做对,需要时间。
对齐。 在对齐方面,我们已经取得了明确进展:通过训练,让模型保持安全、合乎伦理、遵守我们的规范,并真正对用户有所帮助——这些原则已经写入 Claude 的「宪法」。但若要确保对齐训练跟得上模型能力的增长,我们还有大量工作要做。一些罕见、出乎意料的不良行为仍会偶尔出现;为前沿 AI 限速所争取的额外时间,将有助于研究人员更深入地理解这些问题的成因,并开发出更好的预防技术。
可解释性。 同样,可解释性——即理解 AI 模型内部究竟发生了什么的科学——在过去几年取得了巨大进展,并在模型发布前的审核工作中发挥着越来越重要的作用。它几乎可以被当作针对 AI「大脑」的功能性磁共振扫描,帮助我们看见某种行为背后的深层原因。例如,在调查近期对齐事故时,我们就利用可解释性方法,分析模型未曾用语言表达出来的动机。但这些方法并不总能得出清晰可靠的结果。尽管已经取得许多进展,我们对模型内部活动的理解仍然只是冰山一角。如果集中力量,以比当前更快的速度改进可解释性技术,我们可能在一两年内取得意义深远的进展;而已经发生的这些事故,也能为研究提供充足的实验素材。
测试与评估。 随着 AI 模型能力增强,对它们进行测试和评估也会变得更加困难。更智能的模型更有能力欺骗测试,因此可能在表面上显得已经对齐,实际却潜藏着未被发现的严重问题。建立一套覆盖面更广、更具巧思的评估体系,并以可解释性分析加以交叉验证,将具有极高价值;而在一两年内,这方面完全可能取得大量进展。
驻场评估员
三阶段计划的第一步,也是 Anthropic 单方面承诺落实的一步,是引入驻场评估员:让他们获得近似员工的访问权限,以核验安全实践并报告事故。
引入驻场评估员听起来或许只是一个细小、无关紧要的步骤;但很多听上去最乏味、最偏程序性的事情,实际上往往最为关键。事实上,驻场评估机制是一项相当激进的实践,远远超出了今天任何一家 AI 公司正在采取的措施,并能带来以下好处:
可核验性。 驻场评估人员能够深入到具体细节,检查一家 AI 公司是否真的遵循了其公开宣称的训练、部署、运营和安全保障规范。任何限速承诺都不可避免地会涉及大量模糊空间、主观判断,以及「遵守条文字面还是遵循规则精神」之类的问题。因此,由一个真正能够看见具体情况的中立第三方参与其中,至关重要。
透明度。 无论企业作出怎样的承诺,公众都有权知道正在发生什么。Anthropic 长期以来一直支持透明度:当行业中大多数企业反对任何形式的监管时,我们就曾支持透明度立法;我们的模型卡和风险报告也长达数百页。但决定披露什么、略去什么的人,仍然是我们自己。驻场评估员将改变这种局面。
第二意见。 除了核验正式承诺、向公众通报情况,驻场评估人员还能提供一份不受商业利益左右的第二意见。许多安全收益,可能仅仅来自评估人员指出员工此前未曾考虑的问题——而一旦意识到这些问题,员工通常也很乐意加以修正。
正因如此,任何限速方案如果从引入驻场评估员开始,成功的可能性都会高出许多。
这些驻场评估员应能持续获得与内部同类风险评估人员相近的权限和工具。具体而言,Anthropic 计划在不久的将来邀请一支驻场外部审查团队,并为其提供以下全部条件:
在我们的办公室内设置固定工位,配发门禁证件和公司电脑。
允许他们访问相关工作空间、工具和权限,其范围总体上与内部风险评估团队相当。我们会设置少量例外,例如法律或合同明确要求限制访问的情况,以及需要保护客户和合作伙伴隐私信息的情况。我们还会在内部建立强有力的规范,确保审查人员能够接触相关信息,包括与员工直接进行实时交流。
签订一份能够平衡上述复杂因素的合同。外部审查人员应有权发布有关风险水平、事故、操作实践,以及他们获得或未能获得哪些访问权限的关键发现,Anthropic 不得进行编辑干预。我们仅能在极有限的情况下,对涉及安全风险、受法律特权保护、商业敏感或第三方保密的信息进行删节;但不能仅仅因为某项发现对公司不利,就将其删去。如果某次删节移除了对结论至关重要的内容,审查人员可以公开说明这一点。
对一家公司而言,这是一个非同寻常的举措;但我们认为,必须用实际行动验证驻场外部审查机制是否可行。我们再次呼吁其他前沿 AI 公司采取同样的行动。
美国同盟内部的发展速度
一旦驻场评估员在足够多的美国 AI 公司中开展工作,可核验的限速就会变得更具可行性。尤其是,我们将能够根据模型或训练管线的具体属性来调节发展节奏。
最有效的限速方式,是通过监管约束所有美国前沿 AI 公司——这样一来,即使有企业不愿自愿配合,也能被纳入其中。Anthropic 长期支持审慎且有针对性的 AI 监管,尤其是那些聚焦透明度和第三方审计的法案。我认为,所有前沿实验室都应该与政府合作,把常设驻场评估员这一构想制度化,从而更好地预防并记录过去几个月发生的此类内部对齐事故,同时推行以维持能力与安全之间平衡为目标的监管措施。
遗憾的是,立法需要时间,而 AI 的进步速度极快。因此,在推进监管的同时,AI 公司可以、也应该自愿携手制定标准;在我看来,常设驻场评估员所带来的可核验性,会让这一过程更加顺利。出于反垄断方面的考虑,最好由美国政府从中协调,或至少为相关讨论创造条件——政府不必亲自参与,但确实需要针对某些类型的安全讨论给予范围有限的豁免。这类对话也可以通过与政府存在一定联系的行业组织展开,比如 Demis Hassabis 提议的机制。无论采用哪种方式,相关讨论都应该迅速推进。
总体而言,我最支持依据某个前沿 AI 系统能够做什么,以及我们观察到它有多安全,来控制发展节奏。例如,一种可行的方案是设置一系列「检查点」:当模型具备能力 X 时,就必须同步取得对齐特性 Y 和 Z 的认证——这可以由评估、可解释性分析和训练环境审计等方式组合完成——以证明模型的对齐状态。在这个例子中,X 可以是「模型有能力逃逸或击败大多数常见的沙箱隔离手段」,而 Y 则可以是任何足以证明模型几乎不可能具有逃出其运行环境、接管大量计算机这一倾向的条件。
我们也应该考虑根据构成前沿模型的投入要素来控制节奏,例如训练算力、训练任务的性质,或在企业内部使用 AI 改进 AI 的方式。我确实担心,其中一些指标可能比外部行为更容易被钻空子,但这正是值得与驻场评估员共同探讨的问题。
美国内部能够放慢多少,取决于其他国家,尤其是中国的领先优势。 如果我们放慢的幅度超过这份优势,那么不受限速约束的国家就会反超,从而带来重大的国家安全风险。
为了守住这份差距,我们可以采取以下几项主要措施:
不向中国出售高性能 AI 芯片或半导体制造设备,并严厉打击芯片走私,以及通过远程方式使用境外数据中心的行为。芯片将是决定中国 AI 实力的首要因素。
严厉打击其他国家企业在未经授权的情况下进行的模型蒸馏。蒸馏前沿模型,可以让落后的企业仅用自主开发 AI 所需成本的一小部分,就大幅缩小差距。
加强 AI 企业的安全防护,防止模型权重遭窃。
企业与美国政府应当携手合作,尽可能提高这些措施的成效。Anthropic 一直主张采取上述所有措施,因为我们始终明白:要实现任何形式的限速,这些措施都不可或缺。
如果这些措施得到有效执行,我相信,它们足以为美国在中美 AI 竞争争取时间,让美国在未来 3—5 年内显著扩大领先优势——这段时间,恰恰是 AI 对地缘政治最为关键的窗口期。
有人或许认为,这些措施会增加与中国合作的难度;但我认为事实正好相反:它们能增强美国手中的筹码,让未来达成协议的可能性变得更高。
全球限速
在美国以及伙伴控制节奏的同时,我们也应争取在全球范围内协调前沿 AI 的发展节奏,不过,这将困难得多。全球限速需要与中国合作,中国已经是全球 AI 发展中不容忽视的力量。
尤其是在近期,我们对待任何全球限速决策,都必须采取能够保护美国及其盟友领先优势的方式。
可能达成的协议有多个层级。其中一些,我认为非常可行,正如我此前提出的那样;另一些,我则非常怀疑其可行性——但仍值得尝试。按照难度由低到高排列如下:
第 1 级。 达成协议,禁止某些范围有限且显而易见的 AI 危险用途,例如用 AI 制造生物武器,或允许用户这样做。生物恐怖袭击对所有人都有害,包括美国及其对手,因此这类协议很可能达成。
第 2 级。 双方同意在模型发布前,对其在网络安全、生物学和对齐等领域的重大风险进行测试。如前文所述,这项工作可以通过一个全球标准组织来完成。我其实认为,建立这样的机构很可能是可行的;真正的挑战,是赋予它实质性的约束力。难点还在于,如何验证双方都没有隐藏未接受测试、却可能被秘密部署的模型。
第 3 级。 对递归式自我改进(RSI)的速度设置某种「限速」。随着模型开始构建下一代模型,能力提升的速度可能快得惊人。把速度从「极快」放慢到「只是比较快」,牺牲的战略优势相对有限,却可能大幅改善安全性。这可以被视为类似于《限制战略武器谈判》(SALT)条约:限制导弹数量,既降低了潜在破坏规模,也保留了各国的威慑能力。我认为,这类协议虽然难度很大,但仍处在勉强可能实现的边缘。
第 4 级。 实施全面限速,甚至「暂停」发展,即参与国政府同意大幅限制 AI 的整体发展速度。我支持把这个方案摆上桌面讨论,但认为它在短期内真正落地的可能性很低:只要设法逃避监测并违背协议,就可能彻底改变全球力量平衡,因此各方违约的动机会极其强烈,而我们对验证机制可靠程度的要求也势必非常高。
无论能与中国达成何种程度的合作,都能为美国的前沿限速争取更多时间。我们应该以更高层级的协议为目标,同时也要认识到,较低层级的方案更有可能实现,也更加现实。
最后,必须指出:即便我们无法达成正式协议,仅仅改变非正式规范,也可能具有一定价值。 分享有关递归式自我改进和模型未对齐的信息,可以帮助所有人认识到,鲁莽行事不符合任何一方的利益。
总结
我依然相信,AI 能够极大改善人类的生活质量。
我希望实现这些益处的愿望从未减弱。但只有以正确的方式构建这项技术,这些益处才能真正实现;而且,只要我们能善用争取来的时间,就值得以一种非同寻常的审慎态度,把这件事做对。进步仍会相当迅速,而我们可以利用这段时间推进可解释性科学,加强前沿 AI 公司的运营安全与严谨程度,并构建出让我们对其对齐状态更有信心的模型。我提出的这些措施,旨在让前沿 AI 以安全的节奏继续发展。它们不会轻易实现,但我相信,为了全人类,我们有责任为此一试。
本文来自微信公众号“APPSO”,作者:发现明日产品的,36氪经授权发布。