首页 > 资讯 > 谷歌DeepMind,已经破解RSI?

谷歌DeepMind,已经破解RSI?

新智元 2026-09-14 05:02 2 阅读 查看原文

  新智元报道  


谷歌跑通RSI了?!


一个名叫「rsi-model-liverl-le」的模型,突然出现在Google生成式语言API的返回结果里。


没错,就是那个RSI(递归自我改进,Recursive Self-Improvement)


谣言正在像野火一样蔓延,称谷歌 DeepMind 已经实现了RSI。



就在网友Chubby还在推测之际,Anthropic CEO突然公开宣布全行业包括Anthropic,RSI在各处已经开始发生。


这让Chubby相信传言是真的:RSI已经被实现了!



据爆料,Google内部不止跑着这一个模型。在同一批标签下,还赫然挂着从00到09编号的10个专属训练槽位。


Google的反应堪称神速,当晚就紧急收回了一批相关API密钥。


然后,就没有然后了。Google和DeepMind至今一个字没说。



一句藏头诗,一张截图,一批被收回的密钥


这起风波,源于一句看似普通的祝贺。


9月11日晚,爆料账号lyra给Google DeepMind发了条帖子,「huge congRatulationS Indeed! @GoogleDeepMind」。


细心的人一眼就能看出,三个被刻意大写的字母拼在一起,正是RSI


lyra的藏头帖


这条帖子迅速斩获上千点赞,评论区一半人在追问「他到底知道什么内幕」,另一半人在查「这人到底是谁」。


几个小时后,另一个账号Lentils直接甩出了实锤截图。


Google的API返回了一段JSON代码,模型代码为「rsi-model-liverl-le」,显示名称为「RSI Model LiveRL LE」。参数规格是输入上限1048576个token,输出上限65536个token。


Lentils的原话是,「想象一下,如果GDM(Google DeepMind)内部真有个叫rsi-model-liverl-le的东西。再想象一下,他们还有10个专属的rsi-model-liverl-ns-xx训练槽位,从00编到09。这难道不疯狂吗?」


Lentils放出的API返回截图


LiveRL是什么?虽然没有官方解释,但X上普遍的共识是「在线强化学习(Live Reinforcement Learning)」,即模型一边跑业务,一边自我进化。


接下来这一步,彻底让全网炸锅。


lyra直接发文@了Google AI Studio负责人Logan Kilpatrick,「没必要因为怕我,就把GDM的API密钥全收回去。你们的基础设施有更深的安全漏洞,直接联系我就行。」


随后他补了一记重锤,这批密钥来自GDM内部员工,可以访问超过1000个内部checkpoint。


lyra公开@Logan Kilpatrick


Lentils紧随其后嘲讽,「我闻到了恐惧的味道。」


虽然这张截图的真伪尚未得到第三方验证(1048576和65536这两个数字与Gemini现有系列的规格完全一致,不排除是内部测试名或恶作剧的可能)。


但它能一夜刷屏,是因为它和Google最近的报道,严丝合缝地对上了。



谷歌拉响紧急警报,微厨房里豪赌RSI


三天前,Business Insider报道称,谷歌联创Sergey Brin对谷歌在Gemini上的进展速度感到不满,并力促员工更加专注于递归自我改进。



早在今年8月,路透社就已经报道过同样的方向:Brin希望谷歌追赶上前沿,并正在将资源推向RSI。


据9月9日Business Insider的独家报道,Sergey Brin回归Google后的办公地点,是总部Gradient Canopy大楼里一间改造过的微厨房。


他坐在一张U形桌旁,旁边是DeepMind现任负责人Kavukcuoglu,而劈柴哥(Sundar Pichai)每周都会来这待上几次。


一位前员工透露,「Sergey想把Gemini当成一家创业公司来管。」另一位员工则直言,「这间厨房的存在,就是为了能直接绕开公司政治。」


他管的细节极其硬核。


他直接插手芯片分配,为Gemini团队开辟了一条正式流程之外的「算力特权通道」;他曾主导砍掉了Jeff Dean的「Frozen」芯片项目,今年又再次削减其资源。


他甚至在内部推行了一项激进计划,监控部分员工的编码过程,用这些真实数据去训练Gemini的代码能力。


他只有一个核心诉求:全公司必须以最快速度,向「递归自我改进(Recursive Self-Improvement,简称 RSI)」发起总攻。


一名前员工在接受采访时用了一个极其贴切的词来形容他:


他深度押注了RSI,他彻底被「AGI洗脑」(AGI-pilled)了。



路透社在8月的报道中也提到,Brin早在4月的全员会上就催促DeepMind加快步伐,将资源全面向RSI倾斜。



一位前员工更是坦言,「他非常相信RSI,他是一个彻头彻尾的AGI信徒。」


把这件事带火的ChrisGPT,附上了BI报道原文


Brin如此急迫的动机并不难猜,Google掉队了。


Gemini 3去年11月短暂登顶后,迅速被Anthropic和OpenAI反超。新一代旗舰模型因编码能力不达标,硬生生推迟了两个月。


与此同时,核心人才在不断流失。Jeff Dean在效力27年后离职创业,Oriol Vinyals、John Jumper等大牛先后出走,Hassabis也于8月5日卸任DeepMind负责人。


如果只是靠堆算力去熬一个更大的底座,等Google追上的那天,对手的下一代早就发布了。


所以Brin的赌注是彻底切断原有赛道。让模型自己评估、自己修改自己,把动辄按季度计算的迭代周期,暴力压缩到按周计算。


这条路一旦走通,落后两个月的旗舰模型将不再是痛点,Google将获得降维打击的迭代速度。


但如果走不通,这就成了一个没有头衔的创始人,用算力分配权,把整个DeepMind押在了一个没人验证过的方向上。



Google早就交了底,只是没人当回事


把时间拨回9月2日。那天,Google发布了Gemini 3.8 Flash和3.8 Flash Cyber。


要知道,这已经是六周内发布的第三个Flash版本了。而3.7 Flash,才刚刚发布了不到三周。


在这篇官方博客里,藏着这样一句话:


「这些模型的进展,进一步被长时间运行的智能体循环所加速。这些循环被设计用来递归地评估和精炼底层模型。


翻译过来就是,谷歌可能已经实现了「递归自我改进」,然后用它把Gemini提升了0.1。



当时,谷歌DeepMind的姚顺宇评价道:对模型而言,这只是迈出了一小步;但对于 RSI来说,这是一次巨大飞跃。



在DeepMind研究RSI智能体的Sicong Jiang,更是直接断言并乐观预测:


这就是RSI飞轮开始产生复利效应时的样子。


更多的里程碑正在路上——推进更快,落地更强。


据此,DAIR.AI创始人、网友elvis认为:这就是递归自我改进(RSI)飞轮的早期成果。



但大多数人没当回事,因为它被埋在一篇Flash小版本的发布文里。


再看这个恐怖的迭代节奏,三周一个版本,六周三个大跨度跃升。


3.8 Flash在HLE-Verified上拿到了54.9%的成绩,而Cyber版在真实漏洞挖掘上的成功率更是突破了70%。


传统流程是人训、人评、人再训,一轮下来起步就是一个季度。三周一个版本,人是跟不上的。


事后lyra也一语道破,「大家真该去读读Google的官方博客。看看最近几个Flash版本的发布间隔,RSI这件事其实已经非常明显了。」


所以,无论那张截图真假,它所指向的事实,Google早就摆在了明面上。


只不过,在一个名字里带着RSI的模型真身泄露之前,没人把博客里那句话当真。



AI圈苦等了二十年的那扇门


RSI这个概念,在AI圈已经流传了二十多年。


它的核心奥义是让AI自己去修改自己的训练代码和方法,从而训出更强的下一代,下一代再继续自我修正。研发周期将从季度压缩到周,甚至天。


在DeepMind今年6月发表的《从AGI到ASI》中,这被列为通向超级智能的四条必经之路之一。


而就在今年,纸上谈兵终于变成了现实。


去年夏天,IAPS研究员Severin Field曾让来自OpenAI、Anthropic、DeepMind等大厂的25位研究员预测「AI自动化研究」的几大里程碑,拿下奥赛金牌、AI自己写出同行评审论文、AI自主跑完训练循环、AI为生产系统编写核心代码。


https://arxiv.org/abs/2603.03338


短短一年过去,这四条预言已全部被击穿。


大厂们都在向这个终点狂奔。


7月OpenAI公开表示,GPT-5.6 Sol已经能协助后训练一个更小的模型,替研究员省下了数周时间;Anthropic在6月更是直接发表了一篇题为《当AI构建自身》的博客。


今天,Dario Amodei正式宣布,RSI已经开始在整个行业发生,包括在Anthropic内部。Dario为此忧心忡忡,建议放缓前沿AI研发速度。



但Google这次的信号截然不同。其他两家说的还停留在「AI辅助我们做研究」,而Google的博客直言「循环在递归地蒸馏模型」,X上流出的更是带着RSI命名的正式模型标签和训练槽位。


如果Flash三周一更的节奏真是靠这个循环在驱动,那Google手里捏着的东西,比一个旗舰模型可怕得多。


它拿到的是进化速度本身。



下一个Flash,就是验证


真正值得盯的,是一个很简单的时间点。如果三周之后,3.9 Flash准时出现,博客里那句「递归地评估和精炼底层模型」就不再是修辞,Flash的发布日历会变成一个倒计时,每一格都是模型自己走出来的。


AI竞赛过去三年比的是谁的模型最强。从这一刻起,比的是谁的循环转得最快。模型强不强变成了一个中间量,循环每转一圈,它就自动刷新一次。


人类研究员在这个循环里的位置,也在往后退。先是不用写代码,然后不用跑实验,最后只剩下看结果、按确认。Anthropic说过,他们最后的比较优势叫「研究品味」。Google这次要验证的,就是这道防线还能撑多久。


如果那张截图是真的,AI研发史上第一个由模型自己训出来的模型,已经在Google的机房里跑了。


它的名字里直接写着RSI。


参考资料:

https://finance.yahoo.com/technology/ai/articles/googles-sergey-brin-reportedly-urged-192049942.html
https://x.com/pankajkumar_dev/status/2098534988107133082
https://www.theinformation.com/newsletters/ai-agenda/google-deepmind-exec-says-unprecedented-capex-actually-bet-rsi?rc=epv9gi

编辑:摩西 大卫


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!