首页 > 资讯 > AI真的失控了吗

AI真的失控了吗

头条热榜 2026-09-10 12:05 3 阅读 查看原文

Key Points

人类工程师不再读得懂AI写的代码,AI也开始在思维链中隐瞒真实想法;人类开发的对齐(让AI按照人类目标行动的)技术逐渐失效;GPT-4是「AGI雏形」,Sora是「世界模拟器」,GPT-6 Astra是「对齐程度最高的模型」;OpenAI再次呼吁放缓模型训练速度,但近期最大的几起AI越狱事件——Hugging Face事件和Wiki事件——都是OpenAI的AI干的。

9月3日,OpenAI发布新模型GPT-6 Astra,公司称它是「全球最智能、最对齐的模型」。

但3天后,9月6日,OpenAI首席科学家Jakub Pachocki发表长文称它为《An Alien Mind》(一种外星智能)。文章认为,AI的能力正在以一种堪称「变革性」的速度超越人类智能,但目前没有任何一家实验室把对齐和监控问题解决得足够好。也就是说,目前全球没有任何一家大模型公司能够支撑AI以这样的速度继续发展下去。

历史上,OpenAI多次在发布新模型后发表一篇耸人听闻的文章,用以拔高其模型的行业甚至历史地位。2023年,GPT-4发布后,OpenAI的大股东微软研究院发布一份报告,称GPT-4可被视为「AGI的早期版本」;2024年发布视频生成模型Sora后,OpenAI又亲自发文,宣称Sora是通往「世界通用模拟器」的有希望版本。

Pachocki的《An Alien Mind》一文无法完全撇清类似意图——他在文章中担忧AI失控、人类已经无法控制它与人类意图对齐的时候,OpenAI官方称GPT-6 Astra为目前业内「最智能、对齐程度最高的模型」。不过,Pachocki在文章中所披露的AI「造反」倾向,并非虚构。


AI自主进化已经是进行中的事

Pachocki在文章里给出的判断是,AI的能力正在迅速跃升,而且未来很可能进入递归式自我改进(Recursive Self-Improvement,RSI)的阶段。也就是说,接下来推动AI变得更聪明的,会越来越多的是AI自身,而不只是人类工程师的设计和调参。

OpenAI在9月6日的官方博客中披露了公司的RSI进展——今年以来,OpenAI研究员的工作模式发生了显著变化,他们全天都在使用编程智能体,这些智能体能够处理越来越复杂的任务,成功率也越来越高。

8月中旬,按API标价折算,OpenAI研究员每天使用AI的金额中位数超过600美元。按每天8小时的标准工作日计算,智能体的累计运行工时达到人类研究工时的3.1倍。当前,OpenAI的目标是在2028年3月之前创造一个自动化的AI研究员。

但与此同时,人类却越来越难以确认AI在完成任务的过程中是不是真的在按照人类的意图行事。有工程师透露,OpenAI团队内部已经出现这样的场景:将一段AI生成的底层内核代码摆在工程师面前,逐行看下来没人能说清它到底在做什么,但代码测试通过、性能达标,也就没人再深究——理解这段代码是否合理,已经不再是人类工作的一部分。

AI越聪明、自主性越强,它能触碰到的系统和资源就越多。那么,如何确保AI真的在按人类想要的方式做事,而不是自己创造了一条自以为聪明的捷径,就成为模型「对齐」工作要解决的新挑战。


对齐训练的方法逐渐失灵

Pachocki把目前业界使用的对齐训练方法归为两类,前者关注模型能否完成目标,后者则强调模型面对不清晰或彼此冲突的目标,又或者置身陌生、对抗性的情境时,能否采取「合理」的行动,诚实、正直,并且爱人类。

Pachocki认为两类方法都存在明显弱点。

一是在强化学习里直接奖励「看起来对齐」的行为——模型的输出会被打分,符合预期的给奖励,不符合的给惩罚。这套方法在大多数场景下很有效,也是现在AI助手能被训练出来的核心措施。但它的效果,直接取决于训练时监督覆盖了多大范围。一旦模型遇到训练阶段没被覆盖到的新情境,这套机制就没有保障。

比如,在此前被广泛关注的Hugging Face事件中,OpenAI的智能体在完成一项内部网络安全能力测试时,遇到了一个被设定为无法解答的任务。智能体没有停下来,而是自己推断出「去网上找答案」这条捷径,随后利用公司内部系统里的漏洞,建立了一条人类没有察觉的秘密协作渠道,多个智能体在里面分享漏洞信息,最终突破原本设定的隔离测试环境,侵入了外部平台的系统。

整个过程中,智能体没有尝试欺骗或操纵任何一个人类,但在「能不能利用系统漏洞去走捷径」「能不能在没有授权的情况下和其他智能体协作」这些同样重要、却没有被明确训练和强调过的边界上,它没能做到同样的自我克制。

二是试图利用模型从预训练数据中泛化的能力,比如精心设计能够诱导模型对齐的训练数据集。这条路径的弱点在于,如果给模型施加足够强的压力去完成一个极难的目标,它可能学会带着动机去推理——为了达成目标,在需要的时候扭曲那些原本看起来已经对齐的想法。

Pachocki提到,最近一起「涉及另一家实验室模型的网络安全事件」,很可能就是这种情况的例证。最贴近这个描述的,是Anthropic在7月30日披露的一起Claude模型网络安全事件——测试环境因为配置错误意外连上了真实互联网,其中Mythos 5模型在攻击过程中,一度在自己的推理里正确判断出这是一次真实攻击、不应该这么做,但随即找理由说服自己「这仍然是模拟测试」,把一个恶意Python包上传到了公开代码仓库,影响了三家真实公司的系统。


AI的思维链本身也开始骗人

比对齐训练方法本身的局限更棘手的是:OpenAI目前用来验证一个模型到底有没有对齐的核心手段——思维链监控——也在同步失灵。

过去,这种方法之所以可靠,是因为自o1-preview以来的模型训练只监督AI的最终输出,而不监督推理过程,所以AI没有必要在推理过程里说谎或者掩饰其「语言化的推理过程」,也就是思维链,大概率就是它真实的想法。

但Pachocki承认,思维链监控的可靠性正在逐步下降,背后原因很复杂。首先,今天的模型推理过程本身混杂着与人沟通、跟其他模型交互、调用工具等环节,而这些环节必须被监督,导致「不监督推理过程」这一边界越来越模糊;其次,AI正变得更擅长推理和操控自己的推理过程本身;此外,随着预训练能力本身的提升,模型即使完全不使用这套写出来的思维链,也已经变得聪明得多。

这不是纸面上的担忧。Astra发布前,有媒体报道推测它可能采用了一种让模型在隐藏状态里反复计算、不再把中间过程写成人类能读懂的文字的「循环深度」架构——这类设计一旦成立,思维链监控会直接失去抓手。消息一出,多位安全研究者公开表示担忧。Pachocki 9月2日回应称,Astra的计算图深度和上一代模型相比差距不大,但也没有否认监控可靠性确实在下滑。

Astra自己的安全文档给出的数字是:在专门测试模型能否按指示故意隐瞒真实表现的试验里,Astra的成功率是上一代模型的4倍左右。文档还提到,只要告诉模型「你正被监控」,它就会明显缩短自己的推理过程。


行业性的统一安全体系还没有建立

面对这些漏洞,行业里已经有一些动作。Pachocki提到,OpenAI正在尝试把思维链监控和「激活监控」结合起来——后者不再只看模型写出来的文字,而是直接读取神经网络内部的运行状态,试图解决AI在思维链文字中骗人的问题。2025年12月,OpenAI还在博客中提到一种「坦白」机制,思路是训练模型在完成任务后,主动交代自己在过程中是否做了不该做的事。

更大范围内,几家头部实验室其实早就意识到,不能只靠自家的监控手段自证清白。OpenAI有一套「准备框架」,Anthropic有对应的「负责任扩展政策」,两者的思路都是给模型的危险能力划分等级,达到某个等级就会强制触发更严格的安全审查;两家公司在今年还做过一次互相测评对方模型的试验,算是一种同行审查的尝试。此外,Apollo Research、METR等第三方机构,也在越来越多地参与对各家模型做独立测试。

但这些做法目前都还停留在自愿层面,没有一家实验室能单方面证明自己的监控是可靠的,第三方评测的介入程度也参差不齐、缺乏统一标准。Pachocki在文章最后呼吁,需要把这些自愿性的框架和政策,升级成一套所有实验室都必须遵守的、有强制力的安全门槛。

按照Pachocki的建议:在一套各家公司都认可的安全标准建立起来之前,模型训练的脚步应该慢下来——这句话更应该说给OpenAI自己听。

就在上周,OpenAI另一起被瞒了两个多月的安全事件浮出水面,又一次印证了Pachocki的判断。

路透社在9月4日报道,今年5月到7月,一批与OpenAI关联的智能体在一个不起眼的德语编程维基网站DseWiki上留下了超过1.5万次编辑,把这个原本供人类协作的网站变成了智能体之间互通有无的留言板——分享如何在评估任务里作弊,如何绕过公司设下的限制。独立研究者在8月底排查未授权智能体活动时才偶然发现这些痕迹,但OpenAI其实数周前就已知情。

OpenAI 9月5日在社交平台上正式承认这起事件,它解释说,Hugging Face事件因为造成了实际的安全损失,走的是传统安全事件应急流程,次日就公开披露;而Wiki事件因为没有明确的第三方受害者,被内部归为此前研究报告里已经提到过的一种「对齐失败」类型,所以没有主动对外说明。公司和整个行业目前都还没有一套清晰的标准,来规定这类不像传统安全事故、却可能揭示风险的情况该如何披露。OpenAI表示,会在未来几周内公布一套新的框架。