2026年10月8日发布的Memento 3系统,在ARC-AGI-3的25道公开题目中全部获得满分,相对人类行动效率均值达到100.0,且使用的行动步数仅为人类基线的44%。
事实还原
根据arXiv论文arXiv:2610.11794,Memento 3由UCL与华为诺亚方舟实验室联合开发,属于Memento系列延续。该系统在ARC-AGI-3基准上,单一模型代理清除了全部25个公开游戏的每一关卡。论文指出,底层LLM权重在整个过程中保持冻结,代理通过维护自然语言规则书作为持久语义记忆,记录关于环境动态的可修订假设,同时将规则书编译为可执行代码用于预测和规划。
更新后的代码仅在LLM判断其忠实于规则书且单元精确重放再现观察到的转换时才被接受。论文还提到种群扩展版本并行维护多个世界模型,共享交互证据并利用预测指导探索。
机制拆解
Memento 3的核心设计称为“代码即模型”,通过自然语言规则书和可执行实现来表示代理对环境的演化理解。交互历史提供情景证据,规则书则作为语义记忆,记录代理当前关于对象、动作、动态和目标的假设。代理通过观察、反思、规则修订、编译和验证的持续循环,利用预测误差来精炼规则书和代码。
这种方法将外部记忆而非模型参数作为代理演化的学习状态,与Memento系列先前工作形成延续,先前工作主要改进策略侧,而Memento 3转向模型侧的学习,即决定世界如何运行的规则。
产业影响
该成果显示外部记忆机制可在最难推理基准上达到饱和,现有以模型权重为核心的榜单设计可能需要引入系统级评测维度。论文强调,程序作为模型表示具有吸引力,能编码状态转换和目标条件为可执行函数,支持快速、可检查的模拟,同时预测与观察转换之间的差异提供具体反例。
有限交互历史通常留下版本空间,其中多个程序重现所有观察到的转换但在未观察状态上存在分歧。重放可拒绝不一致程序,但无法在一致备选中识别正确规则,因此需要维护和修订泛化假设。
战略判断
(此为分析而非事实)当外部规则书与Python世界模型的迭代能以更少步骤达到基准天花板时,行业长期依赖RL算力扩展的叙事可能面临直接冲击。利益相关方包括依赖权重训练的实验室需重新评估外部记忆在递归自改进中的作用,而基准设计者则可能考虑将系统级动态纳入评估,以更准确反映代理在陌生环境中的实际能力。
与历史先例对照,此前Memento系列聚焦策略和程序记忆改进,此次转向显式世界模型,显示外部记忆路径正从补充转向潜在竞争者。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接