Andrej Karpathy 的 AutoResearch 展示了一极简的 RSI(递归自我改进)循环:AI 修改代码、运行实验、评估结果、保留有效改进,然后继续下一轮。这套机制之所以有效,是因为软件沙盒是一个“已经写好的世界”:规则固定、状态有限、目标明确。AI 要做的,是在一个已知世界里寻找更好的答案。
但现实世界从来没有被完整写下来。
机器人不知道房间里可能出现什么;先进制造系统也不能假设数字孪生永远准确;科学实验也可能产生现有理论无法解释的结果。在这些场景中,失败不一定意味着 AI 做出了错误选择,也可能意味着:它用来寻找答案的那个世界,本身就缺了一部分现实。
这正是 Physical RSI 想解决的问题。它不只要改进执行任务的 Actor,也必须同步扩展 Actor 赖以行动的 World Model。二者共同进化,每一方的进步都会暴露另一方的下一道边界。
我们需要的不是一个只会生成逼真视频的 World Model,而是一个能够理解现实、构建模拟、提出假设,并在真实反馈中持续校正自身的Agentic World Model。这样的 World Model 通过抽象抓住现实中的对象、关系和因果规律,再借助语言与代码,把一次偶然事件转化为可复现、可验证、可迁移的环境。
例如,一只机器狗被电缆缠住。系统首先要判断:是世界模型无法解释电缆、张力与运动之间的关系?还是已经理解了问题,却不知道如何脱困?前者是 environment gap,需要扩展世界模型;后者是 skill gap,需要提升 Actor。新的理解和策略最终还要回到现实中验证。
于是,“意外”不再只是错误,而成为智能进化的入口:
遭遇 → 意外 → 诊断 → 抽象 → 模拟 → 求解 → 验证 → 内化
同样的循环可以发生在具身智能、先进制造、科学发现,以及任何需要与不完全已知的现实持续交互的领域。
RSI 的上半场,是让 AI 成为更好的问题解决者。
它的下半场,是让 AI 不断扩展自己能够理解和解决的世界。
真正的智能不是在一个固定世界里不断优化,而是让每一次未知都成为下一轮进化的起点。
Mirror 持续变化的世界,
Build 让世界模型与智能共同进化的 OS。
MirroS,向未知而生。