首页 > 资讯 > 考拉悠然无界再登WorldArena 2.0全球前列,两项核心指标全球第一

考拉悠然无界再登WorldArena 2.0全球前列,两项核心指标全球第一

雷锋网 2026-09-20 11:05 8 阅读 查看原文

9月16日,WorldArena 2.0全球终榜揭晓,考拉悠然旗下悠然无界世界模型在Track 1视频质量赛道获得全球第二,并在Background Consistency与JEPA Similarity两项核心指标中位列第一。


在雷峰网看来,这进一步验证了其在长时场景一致性、状态演化与物理规律建模方面的能力。基于结构化4D世界建模、动态场景记忆等技术,悠然无界正进一步与Geek Mind具身大脑结合,将世界模型能力从榜单评测延伸至工业巡检等真实场景,推动具身智能从“能推演”走向“能执行、能复制”。

 

9月16日,WorldArena 2.0全球终榜正式揭晓。考拉悠然旗下悠然无界世界模型在Track 1(视频质量赛道)中综合得分位列全球第二。本次评测汇集了来自阿里巴巴、中国科学院等顶尖科技企业、科研机构及具身智能独角兽公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。

 

 

在多项核心指标上,悠然无界世界模型同样展现出领先性能。其中,Background Consistency(背景一致性)位列第一。长视频生成最常见的失效是场景漂移——推演到几十帧后,背景的纹理、光照或物体摆放在无声中发生改变;这一指标居首,意味着模型能在整段生成过程中稳定维持全局环境与场景布置。更具含金量的是 JEPA Similarity 位列第一:该指标不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项第一叠加指向同一个结论——模型不只是画得像,而是学到了物理世界随时间演化的规律。

 

 

视频质量赛道比的不是"生成的画面像不像",而是模型在长时推演中能否保持场景几何、纹理外观、物体与交互状态的物理一致性——也就是世界模型最核心的能力:理解物理世界如何随时间演化。考拉悠然的技术路线,是以"世界模型+智能体+场景复制"回应这一转折:底层是悠然无界世界模型,上层是Geek Mind极客心智具身大脑,中间由跨空间、跨任务、跨本体的"三跨"能力打通。

 

世界模型的胜负手是架构,不是算力


语言模型像"读过万卷书"的学者,靠统计规律预测下一个词;世界模型要做的,是在脑子里先"预演一遍"——给定当前场景与一个动作序列,推演出接下来会发生什么。前者比拼语料与算力规模,后者比拼对物理约束的建模能力。

考拉悠然团队把问题拆成两个具体挑战:长时推演中的误差累积,以及面对未见环境时的分布漂移,并做了两层针对性的架构设计。不仅看生成画面的清晰度,同时从视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性、可控性等6大维度、15项指标进行综合评估。

一是结构化4D世界建模:协同建模首帧3D场景几何与运动轨迹,把静态空间结构与动态动作过程建立关联,为后续每一帧生成提供持续的几何与运动约束。通俗讲,就是给生成过程装上"定位与惯性导航",抑制物体位置漂移、轨迹发散与误差随时间累积。

二是动态场景记忆:持续保持并更新场景的纹理、外观、布局等关键环境特征。长时生成中,模型容易逐渐"忘记"场景自身的样子,向训练分布回缩;动态记忆相当于不断刷新对当前环境的认知,从而提升长程一致性与域外泛化能力。

训练策略上采用由粗到精两阶段:第一阶段用大规模、多样化数据学习通用场景表征与运动规律,建立基础生成与泛化能力;第二阶段筛选高质量数据精细化微调,强化几何一致性、时序连贯性与运动准确性,完成从广泛学习到精确推演的跃迁。

在Track-1(视频质量赛道)上,悠然无界世界模型在场景、运动与交互层面展现出高度一致的未来推演能力,有效缓解了复杂长程生成中的状态漂移、误差累积与物理失真。具体来看,它能够应对多类高难度具身任务:

分布外泛化任务:面向未见过的场景,模型能够基于初始场景状态与给定动作序列进行未来推演,在长时生成过程中保持场景几何结构、纹理外观及机器人与物体交互的物理一致性。

长程任务:面向长时间、多阶段的连续操作,沿给定动作序列持续推演未来状态,抑制误差累积与状态漂移,保持场景、物体及交互状态的长期一致性。

复杂综合任务:在分布外场景、双臂协同与长程操作的综合挑战下,实现稳定、连续且物理一致的未来推演。


基于悠然无界世界模型构建的GeekMind,已率先实现行业落地


WorldArena回答的是“模型能力能不能被统一验证”,真实场景进一步回答的是“这些能力能不能真正用起来”。在工业巡检中,长期面临人力成本高、危险区域作业受限、人工记录难以标准化等问题。制造企业需要的不是单点检测工具,而是具备自主感知与决策能力的巡检体系。考拉悠然将悠然无界世界模型构建的通用具身智能体 Geek Mind 集成于四足机器人平台,面向大型央企制造车间提供巡检解决方案,核心能力体现为三个层面:

快速部署:方案不依赖产线改造,通过预训练模型与场景自适应机制,实现巡检路线的快速配置与任务切换,缩短从进场到运行的实施周期。

深度推理:基于世界模型驱动的感知—推理闭环,系统不仅采集温度、振动、仪表等状态数据,还能对异常现象进行因果分析,输出可追溯的判定依据,降低误报与漏报

空间无界:四足平台具备跨楼层、跨地形机动能力,覆盖人工难以抵达的高空、狭小与危险区域,扩展巡检的空间边界。具身智能在工业场景的价值,不在于替代某一岗位,而在于构建一套可复制、可规模化的无人巡检范式。央企制造车间,正在成为这一范式最早验证的场域。



空间智能技术的竞赛才刚开始


空间智能领域三个条件正在同一时间窗口成熟:算力成本下行让边端部署具备可行性,具身硬件供给趋于充足,行业客户从看演示转向算产出。考拉悠然目前握在手里的,是一个架构原创、经国际榜单验证的世界模型底座,一套把技术复用到多本体的"三跨"机制,以及一个把技术变成低门槛产品的平台。真正的考验在于,跨本体泛化的上限能否在更多极端场景中保持稳定——这将决定世界模型从"能推演"走向"能干活、能复制"的速度。