JEPA 路线先下一城:视启未来 Track 1 第一,晨昏线 Track 2 第二。
作者丨张岂萍 幸丽娟
编辑丨幸丽娟
世界模型的竞争,正在从“生成未来”,走向“能不能被机器人真正用起来”。
视频可以生成得越来越逼真,但进入机器人系统后,世界模型还要回答更具体的问题:它能否预测动作执行后的状态变化,能否支持策略训练,最终能否在真实机器人上完成任务。
WorldArena 把世界模型拉进了同一个“考场”。这套评测体系由清华大学团队联合多所海内外高校推出,是世界模型领域最权威的评测榜单之一。
WorldArena 1.0 已经将世界模型评测从单纯的视频生成,初步延伸到数据生成、策略评估和动作规划等具身任务。但整体仍主要集中在视觉输入、离线任务和仿真环境。
真实机器人执行、在线强化学习闭环、视触觉多模态感知,以及真实部署中的噪声、延迟和误差累积,还缺少系统性的评测。
针对这些缺口,WorldArena 2.0 进一步升级了评测体系。模态从纯视觉扩展到视触觉,功能从离线任务扩展到在线强化学习,平台从仿真环境延伸到真实机器人。
IROS 作为机器人领域最具影响力的国际顶级会议之一,WorldArena 2.0 Challenge 在这场盛会上搭起了真机闭环的竞技场,三条赛道分别指向视频质量、在线强化学习环境和真实机器人操作。
几大世界模型流派争鸣这么久,不同技术路线下的模型,也终于在这个竞技场上真刀真枪地一较高下。
明确走 JEPA 路线的视启未来拿下 Track 1 冠军,空间智能路线的同济大学 BWM-Turbo 模型则以 0.84 分之差位列第二;另有同属 JEPA 路线的晨昏线科技,在 Track 2 总分第二。
此外,一个值得注意的细节是:三条赛道的前两名,学院派与产业派都各占一席。世界模型赛道的竞争,已经迎来学术与工程能力的正面对撞。
围绕赛事定位、多机构协作、赛道设置与榜单结果,AI 科技评论还采访到了 WorldArena 2.0 Challenge 主办方清华团队。他们的回答,也进一步说明了这套评测在走向在线交互和真机执行时,如何设计、如何协作,又有哪些边界。
01
WorldArena 2.0,新一轮“大考”难在哪
WorldArena 2.0 把世界模型评测进一步推进到了在线交互和真实机器人。
WorldArena 1.0 主要检查两类能力:一类是世界模型生成的未来视频质量,15 项指标覆盖视觉质量(Visual Quality)、运动质量(Motion Quality)、内容一致性(Content Consistency)、物理遵循性(Physics Adherence)、3D 准确性(3D Accuracy)和可控性(Controllability);另一类看这些预测对机器人有没有实际用处,包括数据生成、策略评估和动作规划。
对 14 个代表性模型的评测显示,视频质量和具身任务表现并不总能对应。画面生成得更加清晰、流畅,并不意味着模型在数据生成、策略评估和动作规划中一定表现更好。
WorldArena 1.0 的覆盖范围也相对有限:模态上只处理视觉信息,功能上以数据生成、策略评估和动作规划等离线任务为主,平台上也主要停留在仿真环境。触觉反馈、在线交互以及真实机器人中的执行表现,没有进入这套评测。
WorldArena 2.0 的升级,则沿着模态(Modality)、功能(Functionality)和平台(Platform)三个方向展开。
模态上,从纯视觉扩展到视触觉。考察模型能否同时处理画面和接触信息。
功能上,从离线评测扩展到在线强化学习。考察世界模型能否作为交互环境支持策略训练。
平台上,从主要依赖仿真环境扩展到包含真实机器人评测。RoboTwin 2.0 和 LIBERO 等仿真环境之外,WorldArena 2.0 进一步加入真实机器人测试,把模型在物理环境中的执行表现也纳入评估。
基于 WorldArena 2.0 的这套评测方向,Challenge 设置了三条赛道:Track 1 评测视频质量,Track 2 评测世界模型作为强化学习环境的能力,Track 3 评测真实机器人操作。
Track 1 延续并升级了原有的视频质量评测,Track 2 和 Track 3 则是 2.0 新增的赛道。
Track 1 设置了70 个正式任务。其中50 个是白色桌面的ID(In-Distribution,分布内)clean场景,另外20 个是彩色或带有纹理桌面的 OOD(Out-of-Distribution,分布外)场景。所有参赛模型都在同一组数据集上接受测试。
这一赛道考察长程和分布外场景下的视频生成表现。OOD 场景通过改变桌面的颜色和纹理,引入与 ID 场景不同的视觉条件,用来观察模型面对分布变化时,能否继续保持物体身份、空间拓扑和动作因果一致。
最终成绩由 15 项指标共同决定,覆盖画面质量、运动质量、内容一致性、交互准确性、3D 几何和指令执行等方面。JEPA 表征相似度(JEPA Similarity)也被纳入其中,通过 V-JEPA 提取视频特征,比较生成视频与真实参考视频的特征分布是否接近。
Track 2 进一步进入连续交互。世界模型需要作为强化学习环境,策略在其中反复执行动作、获得新的状态和奖励,再继续更新。训练完成后,策略还要回到 RoboTwin 2.0 中测试任务成功率,检验世界模型是否真正支持在线策略训练。
这要求世界模型在多轮交互中保持稳定和动作可控,还要正确反映不同动作带来的状态变化,生成可靠画面为模型提供有效的奖励信号。一次预测偏差也可能被带入下一轮交互,并在连续交互中不断累积。
Track 3 则把评测直接放到真实机器人操作中。官方同时设置纯视觉和视触觉两类任务:既包括擦桌、倒水、清理桌面、叠衣服等视觉驱动操作,也包括夹薯片、削黄瓜、插两孔插头等需要接触信息的任务。
到了真机,接触力变化、传感噪声、通信延迟都会直接影响任务结果。重点考察模型和策略在真实环境中的泛化鲁棒性和动作偏离后的自恢复能力。
从 Track 1 到 Track 3,评测逐步从“能不能预测”,推进到“能不能支撑学习”,最后再到“能不能在真实机器人上完成任务”。
9 月 16 日,WorldArena 2.0 Challenge 全球终榜揭晓。三条赛道独立排名、独立评奖,按官网公布的奖项金额计算,总奖金为 7000 美元。
▎Track 1:WorldIncept,不只赢在视频“好看”
Track 1 终榜共有 81 个模型获得最终成绩。视启未来(Visincept)的 WorldIncept 以 72.33 分排名第一;同济大学计算机科学与技术学院空间智能团队的 BWM-Turbo 以 71.49 分位列第二,两者相差 0.84 分。
从分项来看,WorldIncept 的优势不只集中在画面质量。终榜结果显示,WorldIncept 在物理遵循性(Physics Adherence)和 3D 准确性(3D Accuracy)两项维度排名第一;语义对齐(Semantic Alignment)得分 90.11,同样位列单项第一。
物理遵循性关注生成过程是否符合真实世界的运动和交互规律;3D 准确性进一步考察深度、透视和空间几何关系;语义对齐则看生成结果有没有真正按照任务要求发生变化。
这些领先指标,也与 WorldIncept 背后的团队积累有一定对应关系。
WorldIncept 背后的视启未来由 IDEA 研究院孵化,已推出 DINO-X 系列视觉模型、DINO-XGrasp 万物抓取模型,并与百度智能云合作推出 EgoTwin 数据引擎。它依托十万小时级 Ego 数据和遥操作数据进行机器人动力学建模,并融合团队在通用物体理解、空间智能和人体/人手动作理解上的积累。
相比之下,同济大学空间智能团队更关注长时生成的稳定性。BWM-Turbo 在 DiT 架构基础上加入首帧引导、动态记忆和动作控制等设计,重点处理长时生成中的场景稳定、动作响应和时序一致性问题。
此次终榜中,BWM-Turbo 在背景一致性(Background Consistency)和 JEPA 表征相似度(JEPA Similarity)两项指标位列第一,也体现出这套方案在场景稳定和表征一致性上的优势。
两套方案的技术取向不同,但 Track 1 的竞争重点已经很清楚:视频生成只是基础,空间结构、动作变化和长时推演中的物理一致性能否稳定保持,开始成为拉开差距的关键。
▎Track 2:MW2,世界模型开始真正进入策略训练
Track 2 是 WorldArena 2.0 新增的在线强化学习赛道,评测世界模型能不能真正作为机器人训练策略的环境。策略先产生动作,世界模型预测动作之后的未来状态,再根据这些预测进行奖励计算和策略更新,最后看训练后的策略能不能把任务做成。
赛道基于 RoboTwin 环境,使用 Adjust Bottle(调整瓶子)这项任务进行。该任务要求机器人重新调整瓶子的姿态和位置,考验精细位姿控制和抓取稳定性。
终榜中,北京中关村学院的 MW2 以 72.93 分排名第一,晨昏线科技的 TTWM 以 72.40 分位列第二,两者相差仅 0.53 分,也是 47 个参评模型中仅有的两个超过 72 分的方案。
MW2 背后的北京中关村学院,近年来持续布局具身智能和物理智能。
紧随其后的 TTWM,则在世界模型训练上采用了更具体的优化方案。它是晨昏线目标因果世界模型 GCWM 的参赛版本,重点建模“动作会怎样改变未来状态”。模型以当前状态、任务目标和机器人动作为条件,预测动作执行后的物理交互和状态变化。
在 Track 2 的连续 rollout 中,团队还围绕目标区域、空间几何和跨时间一致性进行了针对性优化,并通过帧级噪声、冷启动随机化等设计,降低多轮预测中的误差累积。
这些设计也进一步体现在下游策略表现上。Baseline VLA π0.5 的成功率为 55.46%;以 GCWM 作为强化学习环境进行策略优化后,VLA 模型的成功率提升至 72.40%。
Track 2 把竞争重点进一步推向策略学习,世界模型是否真正能够提升下游策略表现,成为这一赛道的核心。
Track 3 是 WorldArena 2.0 新增的真实机器人评测赛道,覆盖 AgileX 双臂机器人和 Franka Panda 单臂机器人。
其中,Track 3.1 评测视触觉操作,在 AgileX 上完成夹薯片、削黄瓜和插两孔插头 3 项任务;Track 3.2 评测纯视觉操作,AgileX 设置擦桌、倒水、清理桌面、按指令清理桌面、叠衣服和叠纸盒 6 项任务,Franka 也覆盖擦桌、倒水和清理桌面。
各任务以真机执行成功率评价;综合总榜结合任务难度,并按视觉与视触觉方向的权重汇总计分。机器人需要在规定步数内完成操作,且过程中不能触发安全干预。
综合总榜中,小米机器人 MiRobot 团队提交的 ViTacX 以 76.64 分排名第一,上海科技大学 OmniFlow 团队以 67.37 分位列第二。
ViTacX 的主要优势来自纯视觉子榜。它在 Track 3.2 以 85.00 分排名第一,在擦桌、倒水、叠衣服和折纸箱 4 项取得单项最高分,其中前三项均为 100 分。
从团队技术背景看,小米机器人长期关注具身基础模型、VLA 和真实机器人执行,研究覆盖视觉感知、动作生成到真机连续执行等环节。这些方向,也正好对应 Track 3.2 所考察的视觉驱动操作和真实机器人执行能力。
到了 Track 3.1 视触觉子榜,ViTacX 以 66.67 分排名第三。
相比之下,OmniFlow 在纯视觉和视触觉两个子榜中都保持在第二位。其背后的上海科技大学长期开展机器人操作和触觉相关研究,自动化与机器人中心的具身操作研究覆盖触觉感知、遥操作、模仿学习、强化学习和多接触运动。
从两个子榜来看,ViTacX 的总榜优势主要来自视觉驱动的真机操作,在视触觉任务上的表现则相对靠后。
从已经公开的方案和榜单表现看,WorldArena 2.0 把不同世界模型技术路线放到了同一套评测体系中比较,不同方案各自擅长什么,也开始变得更加清楚。
Track 1 的前两名,指向的是两种不同的技术路线。WorldIncept 背后的视启未来旗帜鲜明走 JEPA 隐空间路线,BWM-Turbo 则走空间智能路线。两条路线的模型同台竞技,WorldIncept 在物理遵循性和 3D 准确性上领先,BWM-Turbo 则在背景一致性和 JEPA 表征相似度上位列第一。
Track 2 直接检验世界模型能不能稳定充当策略训练环境。冠军 MW2 来自北京中关村学院,该团队关注机器人对物理规律的理解,并把这种理解与动作学习、执行结合起来。第二名晨昏线科技的 TTWM 更加侧重动作因果预测,关注目标区域、空间几何约束、物体跨时间一致性,以及连续 rollout 中的误差累积。
Track 3 中,小米机器人 MiRobot 团队的 ViTacX 拿下综合第一,但它在纯视觉任务中的优势,并没有完全延续到视触觉操作。这说明,真实机器人操作不仅要看清环境,还要处理接触信息。多模态信息能否稳定进入动作规划和控制闭环,才是更难的部分。
三条赛道榜首团队各有所长,在不同能力层面展现独特优势。由于参赛具有选择性,是否有模型能够同时在视频生成、策略训练和真实机器人操作上达到领先水平,还有待验证,也值得期待。
04
对话主办方:世界模型的“考场”是怎么搭起来的
从多机构对赛事结果的统一判定,再到评测设置如何减少单一指标带来的偏差,WorldArena 2.0 的评测背后还有不少技术和组织问题。主办方清华团队在采访中,也对这些问题进行了解答。
以下为对话实录,AI 科技评论进行了不改变原意的删改。
▎AI科技评论:WorldArena 如今已成为世界模型的核心评测基准之一。你们怎么看这种认可?以及你们认为这种认可主要来自哪里?
主办方:这种认可主要来自学术界和产业界的共同需求:需要一套评测方法,判断世界模型预测出的未来,能不能真正帮助机器人执行动作。
对具身智能来说,要看模型能否准确响应动作指令,预测的运动是否符合物理规律,以及它能不能支持策略学习和真实执行。这些能力很难仅靠观看视频判断,需要专门的测试。
WorldArena 1.0 把这些问题转化成了可以按统一标准执行的测试流程,2.0 又加入了在线强化学习和真实机器人交互,进一步考察仿真到真实(Sim2Real)的迁移和闭环反馈。
对我们来说,一个基准有没有长期价值,要看它能否帮助研究者与从业者找到模型的本质问题、解释优点与不足,并据此改进方法。
▎AI科技评论:WorldArena 涉及清华、北大、CMU、斯坦福、普林斯顿、港大、NUS、中科院自动化所等多个机构,作为主办方的清华团队,具体扮演什么角色?
主办方:清华团队主要负责评测框架的研究设计与开发,以及赛事评测和开源社区维护。这个基准覆盖了视频生成到真机操作,需要投入大量软硬件、算力、人力资源,单靠一个团队很难完成,必须由多家机构共同协作。
具体工作包括搭建评测流程、规范处理提交代码、对接跨地域的远程推理服务、维护分布式评测集群,以及校验和汇总结果。真机赛道还需要和与机器人平台的合作方完成硬件接口适配、测试时段预约和现场操作安排。
▎AI科技评论:多机构协调上是否会遇到什么问题?能不能举一两个具体例子?
主办方:比较突出的困难有两个:一是不同计算环境下如何保证评测结果能够复现;二是不同现场的机器人设备和人员怎样协调。
比如,同样的评测代码,在 NVIDIA 和 AMD 等不同架构的显卡上运行,如果底层算子实现和环境依赖没有细致对齐,结果可能出现细微波动。因此需要做多硬件环境适配、统一底层配置,再集中复核,避免把平台差异误判为模型能力差异。
真机评测还涉及不同地区的场地、设备状态和人员安排,需要针对不同本体设计任务和数据采集流程。远程模型服务还要以毫秒级的时序配合现场执行,接口协议、物理初始条件和执行日志都要交代清楚。
▎AI科技评论:评测维度非常多,哪些可自动评测,哪些依赖专家主观打分?如何保证跨机构、跨赛道评分一致性?
主办方:三个赛道的自动化程度不同,取决于测试是否涉及在线交互和现场设备操作。
Track 1 主要评测生成能力,指标主要由自动化流程计算,同时保留对异常输出和可疑提交的人工审核。
Track 2 考察强化学习策略在世界模型环境中的迭代表现,评测流程的自动化程度也比较高。人工工作主要是排查服务调用的连通性,协调各队伍的交互计算时段。
Track 3 涉及真机操作,需要现场人员参与设备复位、抓取观察、异常处理和任务成败判定,并与参赛队伍保持实时连线,由双方实时沟通确认测试结果,据此统计成功率。
一致性主要通过同一赛道内采用统一规则来保证。各队伍的输入格式、API 规范、计算预算、评估指标版本和失败判定标准都保持一致。
不同赛道考察的能力不同,分数不能直接比较,我们重点保证的是每个赛道内部评测条件和判定标准的一致。
▎AI科技评论:榜单是否分挑战赛榜单和日常榜单?日常榜单更新机制是什么?多久更新一次?
主办方:挑战赛榜单和日常研究榜单的用途不同,公开范围和更新安排也有所区别。
挑战赛榜单用于确定比赛成绩和奖项,有明确的提交截止时间、榜单封榜规则和获奖审查流程。为保证比赛公平,部分测试数据不完全公开。日常研究榜单长期向学术界开放,代码和评测协议完全开源,研究者可在本地复用,为后续算法改进提供持续性能参照。
▎AI科技评论:WorldArena 2.0 比 1.0 增设 Track 2(MB-RL)和 Track 3(真机 WAM)。这个想法怎么提出的?为什么偏偏增设这两个赛道?背后考虑有哪些?
主办方:增设这两个赛道,是为了进一步检验模型在交互和真实执行中的作用。
1.0 主要聚焦具身数据引擎和策略离线评估,仍以开环的、仿真环境内的静态测试为主。模型在本地微调后接受测试,缺少实时反馈,也不能在交互过程中自我修正。
2.0 希望进一步考察两方面的能力。一是闭环交互能力。策略能否把世界模型作为交互环境,在模型生成的动态空间中持续学习和试错。二是具身泛化能力。在模型环境中学到的技能,经过 Sim2Real 迁移后,能否用于实体机械臂的操作。
背后的考虑在于:视频生成得连贯,不代表模型能提供可靠的物理反馈;在仿真中稳定运行,也不代表到了真机上仍能正常执行。因此,有必要把在线交互和真机部署单独设为赛道。
▎AI科技评论:之前商宇老师在接受我们的采访时,曾坦言榜单“sim-to-real gap”的局限。Track 3 真机赛道是不是直接回应了这个问题?能在多大程度上解决?
主办方:真机评测将实际传感、接触条件和设备执行过程纳入测试,为仿真研究提供补充。摩擦力变化、光照干扰、电机控制延迟和刚体接触等因素会影响真机任务结果。不过 Track 3 目前覆盖的任务、环境和机器人本体仍有限制,后续会持续拓展、改进。
▎AI科技评论:后续还会迭代到 WorldArena 3.0 吗?会考虑加入什么维度的测试?
主办方:推进 2.0 的过程中,已看到几个值得继续研究的方向:更高频、更长时间的闭环交互,执行失误后的自主纠错,不同构型机器人之间的泛化迁移,以及精细装配中的触觉与多模态感知融合。
▎AI科技评论:参赛是选择性的,是否会出现某个赛道强者扎堆、某个赛道冷清,从而削弱榜单整体代表性?
主办方:这和技术要求、研发成本、软硬件条件、迭代时间等有关。每个赛道都各有特色,体现了不同模型在不同层面的能力。
▎AI科技评论:三个赛道前两名都有产业派和学院派。在世界模型创新中的核心优势和短板分别是什么?
主办方:从本届参赛团队看,高校和企业优势互补。高校团队更愿意尝试前沿架构和新的目标函数,探索比较灵活;企业团队在高质量数据储备、大规模算力调度和系统部署上积累较多,工程运行也更稳定。这是我们对本届赛事的观察,不宜直接概括所有团队。
比赛也让双方需要补足的环节更具体了。算法创新还需在实际工程流程中稳定运行;有数据和算力优势,也需要准确的物理建模和清晰的问题定义,才能转化为成绩。把研究与工程能力结合起来,有助于缩短技术从方法提出到实际应用的过程。
▎AI科技评论:世界模型现在整体有四条技术路线,本届获奖团队基本覆盖了 JEPA、空间智能/结构化 4D、像素生成路线,但走 JEPA 路线的团队赢面似乎更大:视启未来拿下 Track 1 第一,晨昏线在 Track 2 位列第二。你们作为主办方,怎么解读这次结果?
主办方:实际系统中的技术路线并不是完全分开的。像素级自回归生成、基于潜空间的表征学习,例如 JEPA 思想,以及空间拓扑建模、显式物理引擎,可以在同一个系统中结合使用,不少领先团队采用的就是多模块架构。
此外,各队伍在模型参数量、预训练数据清洗、动作抽象接口和控制循环频率上差异也很大。这次结果为具身表征学习提供了值得继续研究的线索。
▎AI科技评论:见证这么多次榜单更迭和赛事演进,你们认为世界模型现在发展程度如何?最大的瓶颈在哪?
主办方:从本届赛事的测试结果看,在受控的特定任务中,领先的世界模型已经初步具备了对动作因果关系的响应能力,能够为下游策略学习提供一定帮助。
但在更长时间的复杂交互,以及接触密集的真实机器人操作中,世界模型仍然存在瓶颈。模型还不能足够准确、持续地刻画动作施加后引起的状态瞬变。连续预测中的微小错误会逐步累积和放大;到了真机上,还要处理毫秒级动作延迟,以及刚体接触带来的非线性力反馈。
▎AI科技评论:商宇老师在我们上次的采访提到“需要避免 WorldArena 成为模型新的路径依赖”(大家为了在 WorldArena 上拿高分,都去迎合它的指标和任务)。两届挑战赛以及日常榜单更新实践中,是否真的观察到这种依赖?具体有哪些表现?
主办方:针对公开规则进行优化,是基准运行中很难完全避免的现象。我们关注的是,分数提高究竟反映了模型通用物理能力的改善,还是仅仅对某个指标、某类任务拟合得更好了。
为减少后者影响,我们主要做了三方面工作:持续跟踪评分与实际物理任务成败的相关系数,校准高分但不能反映实际物理能力的指标;持续增加场景和任务,扩大 OOD 测试分布,纳入更多复杂接触任务;保留独立封闭盲测集,关键测试环节严格保密。
▎AI科技评论:如果给 WorldArena 下一阶段定一个目标,你们希望它重点解决什么问题、扮演怎样的角色?
主办方:下一阶段,希望更清楚地评估模型在真实世界的适用范围:研究者拿到一个世界模型后,能知道它在哪些物理场景下可靠,在什么条件、哪些状况下容易失效。
更长期的目标是,让 WorldArena 帮助大家改进方法,使世界模型能力更好地泛化到真实场景中。
为了方便大家抱团交流、互通会议消息,我们专门建了 IROS 2026 参会交流群!进群你会解锁这些「福利」?
-
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
-
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
-
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
-
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Luyoyo_2026,备注:IROS + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网
雷峰网