首页 > 资讯 > 2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

量子位 2026-09-13 15:38 2 阅读 查看原文
允中 发自 凹非寺
量子位 | 公众号 QbitAI

过去一年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real加速从仿真走向真机,全身控制能力也在快速突破。

机器人会做的事情也越来越多:能走、能跑、能抓、能导航,甚至可以完成越来越复杂的长程任务。

但如果把这些能力放到真实世界里,一个更基础的问题正在浮现:

机器人“会做”一件事,和机器人能够在开放环境中长期、稳定、泛化地把事情做成,其实是两回事。

一个机器人能跨过固定高度的障碍,不意味着换一种障碍还能完成;能在一个房间里导航,不意味着换一个场景、换一种机器人本体仍然有效;正常状态下能稳定行走,也不意味着受到撞击、跌倒甚至关节损伤之后还能继续工作。

这也是为什么,随着具身智能从Demo走向真实世界,行业的评价标准正在发生变化。

如果说上一阶段关注的是机器人到底“会多少技能”,那么下一阶段更重要的问题是:这些能力能不能持续规模化扩展。

这里所说的Scaling,不只是模型参数量,也不只是机器人数据量,而是模型能否经历更多环境、覆盖更多任务、迁移到更多机器人本体,并在真正进入物理世界之后,继续适应那些训练阶段没有见过的状态。

过去一个多月,亮源新创连续发布了三项技术:LightParkour、LightNav-0和Light REACT

  • LightParkour从简短的人类动作片段出发,通过物理仿真与课程学习扩展复杂接触技能;
  • LightNav-0基于Real2Sim2Real数据引擎,将2,000+个互联网来源的真实场景转化为可反复使用的仿真环境,生成4,000+小时视觉、语言和动作经验,并用于通用导航后训练;
  • Light REACT则面向外力扰动、跌倒和硬件损伤条件下的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。
图片
亮源新创连续发布三项技术:LightParkour、LightNav-0和Light REACT

看起来,这是跑酷、导航和全身控制三个不同方向。

但把三项技术放在一起,会发现亮源新创实际上一直在回答同一个问题:如何让Physical AI从单点能力,逐步形成可以规模化训练、规模化对齐和规模化部署的基础模型体系。

三项技术方向不同,但都在围绕亮源新创“三段范式”所指向的核心问题展开:如何让Physical AI的能力持续规模化扩展,并最终形成从训练、对齐到真实部署的学习闭环

具身智能真正要解决的,是能力如何持续规模化扩展

过去的机器人研发,大量建立在任务分解之上。导航解决导航,运动控制解决运动控制,机械臂操作解决机械臂操作。任务和环境越明确,工程系统往往越容易针对性优化。

这套方法并没有问题。工业机器人能够在高度结构化的环境中稳定工作,本身已经证明了它的价值。

但通用机器人面对的是另一种问题。现实世界不是一个固定Benchmark,环境会变,任务会变,机器人本体会变,甚至机器人自己的身体状态也会变。

如果每增加一个任务就重新训练一个模型,每换一个机器人就重新适配一次,每出现一种异常状态就重新设计一套控制规则,那么系统能力虽然在增加,开发和部署成本也会同步增长。

最终,能力没有真正实现规模化扩展,工程复杂度反而先增长起来。这也是基础模型给机器人行业带来的真正启发。

大语言模型的重要意义,并不只是把某一个NLP任务做得更好,而是通过统一模型、统一表示和规模化训练,让越来越多能力进入同一个模型体系。

如果Physical AI也要沿着类似方向发展,那么需要解决的核心问题,同样不是不断增加孤立技能,而是建立一套可以持续扩展能力边界的学习机制

亮源新创将这套机制概括为三个阶段:规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)和规模化部署(Scalable Deployment)

规模化预训练通过大规模数据训练建立基础能力;规模化对齐通过强化学习等方式进一步提升模型能力;规模化部署则推动基础模型进入真实世界,并持续产生高质量真实世界数据,形成驱动模型持续优化的数据飞轮。

三个阶段并非彼此割裂,而是共同构成一个持续迭代的学习闭环。亮源新创过去一个多月连续发布的三项技术,则从不同方向展现了他们围绕这套技术路径展开的研发进展。

LightParkour:先解决一个动作如何变成一类能力

先从LightParkour开始。跑酷是全身运动学习中涉及复杂接触的典型任务之一。普通行走主要依赖双腿和地面形成支撑,但当机器人需要攀爬、撑越或跨越较高障碍物时,环境本身会成为身体支撑的一部分。

手应该在哪里接触,什么时候承重,身体重心如何移动,障碍物高度变化之后动作如何跟着变化,这些都会直接决定任务能否完成。

传统动作模仿在这里会遇到一个明显问题:动作视频记录了“人怎么动”,却没有完整记录“这个动作为什么在这个环境里成立”。

如果直接通过动作重定向(Motion Retargeting)将人类动作映射到机器人本体上,可能出现手掌悬空、身体穿过障碍物,甚至整个轨迹超出机器人动力学能力的问题。

另一种办法是针对每一种障碍重新采集动作。但这样一来,数据成本会随着技能、地形和接触方式线性增长。

LightParkour选择的方式是:只给机器人一个起点,然后让技能自己生长

具体来说,LightParkour首先从真实人类动作中恢复一段简短的动作种子,再把动作和对应的障碍物一起放入物理仿真。仿真负责重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人成功完成当前动作之后,系统继续提高障碍物难度,并把成功轨迹作为下一轮训练的参考。

于是,从一段针对45厘米障碍物的初始动作出发,可以逐步生成覆盖至75厘米障碍的参考轨迹,对应90厘米高的Lightbot 0约83%的身高。

整个扩展过程中,只有最初的动作和障碍物需要人工对齐,之后的能力增长主要由物理仿真和课程学习完成。

这件事真正重要的地方,不是机器人跨得更高了,而是一个动作样本开始变成一个技能分布。

过去需要针对不同障碍重新采集示范,现在模型开始利用物理世界本身的规律,自动生成新的有效经验。

图片
LightParkour完整训练流程

这已经出现了基础模型实现Scaling的一个关键特征:能力不再和人工数据一一绑定

会很多动作还不够,要把它们放进同一个模型

技能扩展之后,第二个问题随之出现。

如果行走是一个模型,攀爬是一个模型,快速撑越又是一个模型,那么技能数量增加之后,机器人仍然需要一个上层系统决定什么时候调用哪个模型。

LightParkour进一步使用多专家蒸馏,把行走和三项复杂接触技能整合到一个统一策略中。

更关键的是,技能切换本身也不再依赖人工规则。系统进一步对不同技能之间的切换进行训练,让机器人自主学习什么时候保持行走、什么时候进入全身动作,以及什么时候重新回到普通运动。

部署时,不需要外部提供技能标签,也没有人工编写的状态机负责切换。

最终,LightParkour在Lightbot 0上运行的是一个统一的循环深度视觉策略。模型只使用胸前深度相机、本体感知和速度指令,以50 Hz在机载计算平台上运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。

这让LightParkour的意义从“人形机器人会跑酷”,进一步变成:机器人能不能把多个孤立技能压缩成一个统一模型,并根据当前环境自主决定什么时候使用什么能力。

LightParkour展示了亮源新创在感知驱动的全身运动、多技能统一策略和真机迁移方向上的阶段性进展。

但仅仅解决身体如何运动,还远远不够。机器人真正进入开放世界之前,还必须知道自己在哪里、目标在哪里,以及接下来应该往哪里走。

LightNav-0:让具身模型经历足够大的世界

导航是机器人进入真实世界之后绕不开的一项基础能力。

但通用导航与传统导航之间存在一个非常大的区别。传统系统可以提前建图,可以依赖定位,可以针对摄像头和机器人本体进行标定。

但一个真正面向基础模型的导航系统,需要面对不同环境、不同任务、不同视角甚至不同机器人本体。

换句话说,它不能只“记住怎么走”,而要形成可以迁移的空间智能。

这首先是一个数据问题。语言模型拥有互联网级文本数据,但机器人没有天然存在的“机器人互联网”。如果所有导航经验都依靠真机遥操作采集,那么每增加一个环境、一个机器人本体,都意味着新的数据成本。

LightNav-0的做法,是把互联网中的真实世界,转化成机器人可以反复经历的训练世界

通过Real2Sim2Real数据引擎,亮源新创将2,000+个互联网来源的真实场景转换为可复用仿真环境,形成4,000+小时视觉、语言和动作后训练经验。

同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,从而避免模型只适应某一种固定机器人视角。

这里有一个值得关注的实验结果。LightNav-0发现,在当前实验范围内,扩大环境覆盖度,比单纯增加相同环境里的轨迹数量更能稳定提升泛化能力。

img
在真实场景的仿真环境中生成导航经验

这意味着,Physical AI的数据Scaling可能和大语言模型有所不同。机器人不仅需要更多数据,更需要在更多样化的环境中积累经验。

导航不是识别目标,而是理解空间之后产生动作

数据规模解决的是“见过多少世界”,但导航还有第二个问题:如何把视觉和语言理解真正变成行动。

例如,机器人接到“走到沙发右边”的指令,理解“沙发”并不困难。真正困难的是,它还需要判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来应该生成怎样的运动轨迹。

LightNav-0因此引入Point CoT。模型首先在图像空间预测目标点和可通行点,再生成后续动作token。推理过程因此从“视觉+语言直接生成动作”,变成“视觉语言理解→空间推理→动作生成”。在公开的8项消融评测中,引入Point CoT后,平均任务成功率提高8.4个百分点,SPL提高5.7个百分点

随后,LightNav-0通过RVQ动作编码器,将连续机器人轨迹压缩为3个动作token,使视觉、语言、空间位置和机器人动作能够进入统一的模型训练框架。

这实际上在做一件基础模型非常熟悉的事情:建立统一表示。只不过语言模型统一的是不同语言任务,而Physical AI需要进一步把视觉、语言、空间和动作统一起来。

真正检验基础模型的,不是训练集表现,而是零样本迁移

最终,LightNav-0没有把验证停留在一个机器人或者一个Benchmark里。

在10个仿真设置中,LightNav-0覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型进一步零样本迁移到人形、四足、轮式和飞行机器人等不同本体。

官方同时发布了模型、代码和技术报告。这一验证重点考察模型在环境、任务和机器人本体变化条件下的零样本泛化能力。

LightParkour从一个动作示例出发,将其扩展为能够适应不同环境条件的技能分布,LightNav-0则把这种泛化进一步推到环境、任务和机器人本体。

但机器人进入真实世界以后,还有最后一个很难通过Benchmark提前解决的问题。世界会变化,机器人自己也会变化。

Light REACT:环境会变,机器人自己的身体也会变

机器人正常运行时,大多数控制系统都可以工作得很好。

真正困难的是异常状态。人可能撞到机器人,机器人可能跌倒,执行器可能出现故障,关节可能锁死,环境也可能限制它原本的运动方式。

这类异常在单次实验中可能并不高频,但随着部署规模扩大,其绝对发生次数也会增加,对系统韧性、故障恢复能力和运维效率提出更高要求。

如果异常频繁导致任务中断,并且需要依赖人工恢复,部署规模扩大后,运维压力也会相应增加。

因此,规模化部署不只是增加部署数量,还需要提高机器人在真实环境中的持续运行和异常恢复能力

Light REACT就是从这个问题出发。它的全称是REsilient humAnoid ConTrol(韧性人形机器人控制),目标不是让机器人永远保持一种标准步态,而是在身体条件发生变化之后,尽可能利用剩余的全身能力继续移动。

正常走可以,跛行可以,单腿跳可以;如果双腿已经无法维持直立运动,就让手臂参与支撑,切换到爬行。目标始终是同一个:在当前身体条件允许的范围内,继续完成运动。

关键不是拿到故障标签,而是从历史状态判断身体发生了什么变化

事实上,如何让机器人在面对新任务、新环境和新状态时减少显式人工适配,正在成为近期机器人基础模型研究中值得关注的方向。

今年8月,Skild AI发布S1。模型观看一次新任务的视频示范后,不修改模型权重,也不针对该任务重新进行后训练,就可以尝试直接执行。

在其公开的未见长程任务实验中,同样使用10万小时预训练数据时,视频上下文版本成功率达到66%,语言提示基线则为9%。Skild AI将传统机器人面对新任务时仍需要“收集数据—微调模型”的方式,类比为机器人仍处在“BERT时代”。

Generalist AI随后发布的GEN-1.5同样展示了一次示范下的任务适应能力。模型通过3—12秒的单次示范,在不进行梯度更新的情况下,在10类短程任务中取得59%的平均成功率;使用每项任务约5分钟数据进行10步梯度更新后,平均成功率进一步提升至83%。Generalist AI将这种能力归因于大规模物理经验预训练之后形成的单次示范学习和少样本适应能力。

另一条线上,RoboTTT把机器人可以利用的历史信息进一步扩展到8K个时间步。同一模型使用8K上下文训练,相比1K版本闭环表现提升62%,论文由此将上下文长度(Context Length)提出为机器人基础模型一个新的Scaling维度。

这些工作的架构、数据和任务并不相同,也没有必要把它们归为同一条技术路线。

但它们都在触及一个共同问题:当机器人面对变化时,能否更多依靠模型已有能力和上下文完成适应,而不是每次都重新依赖人工采集数据、微调模型或编写规则。

Light REACT把这个问题进一步推进到了机器人自身的身体状态。S1和GEN-1.5使用的上下文,核心信息来自外部提供的任务示范,模型需要理解的是“这一次要做什么”;Light REACT使用的上下文,则来自机器人近期自身的交互历史,它试图判断的是“我现在的身体处于什么状态,接下来还能怎么动”。

严格来说,它们处理的并不是同一种上下文学习。S1和GEN-1.5更接近从上下文中获得新的任务条件;Light REACT则是在训练所覆盖的损伤分布内,通过时序交互信息推断当前身体与动力学条件。它们共享的是利用上下文减少显式人工适配的思路,而不是同一种能力。

如果提前知道哪个关节损坏,那么可以针对每种故障设计一套控制器。

但真实部署的问题在于,机器人不一定提前知道自己哪里出了问题。Light REACT因此将全身上下文学习(Whole-Body In-Context Learning)作为核心机制。

训练阶段,系统针对不同损伤状态建立多个教师策略,覆盖执行器失效、关节锁定和膝部折叠约束三类损伤。随后,通过多教师蒸馏,将不同教师策略的能力整合到一个可部署的学生策略中。

但到了部署阶段,一个关键的信息被拿掉了:模型不会获得故障标签。它只能看到自己的本体感知、动作指令以及过去一段时间内身体如何响应。这意味着机器人必须通过自己的交互历史判断身体状态发生了什么变化。

亮源新创比较了多层感知机(MLP)、循环神经网络(RNN)和Transformer三种策略结构。结果显示,使用64帧因果上下文窗口的Transformer,能够更充分地覆盖教师策略的行为能力。

会多少技能是一回事,知道什么时候用又是另一回事

多教师蒸馏之后,Light REACT还遇到了一个很典型的大模型问题。

模型已经会走、会跛行、会跳、会爬,但不一定知道什么时候应该调用哪一种能力。例如,机器人明明还能站立,却可能直接趴下开始爬行。从任务奖励看,这也许能够完成移动,但从真实部署看并不合理。

所以Light REACT又加入偏好强化学习(Preference RL),对不同能力的调用方式进行进一步对齐。

模型最终形成一个清晰的行为偏好:身体条件允许时优先保持直立运动,只有当直立运动无法继续时,再切换到爬行等替代方式。

经过这一阶段,公开实验中的直立行为比例从约42%提高到约76%,爬行行为从约45%下降至约16%。

这一步很像大模型对齐(Alignment)真正解决的问题。预训练决定模型“会什么”,对齐决定模型“什么时候应该怎么做”。

到了Physical AI,这种对齐进一步从语言偏好扩展到了空间、动作和身体状态。

三项技术连起来,亮源真正要做的是Physical AI基础模型

现在再回头看LightParkour、LightNav-0和Light REACT,三项工作之间的关系就清楚了。

LightParkour解决的是技能如何实现Scaling。一段人类动作不再对应一条固定机器人轨迹,而是通过强化学习和课程学习扩展为能够适应不同环境条件的技能分布,再通过多专家蒸馏进入一个统一策略。

LightNav-0解决的是经验和泛化如何实现Scaling。2,000+个真实场景被转化成4,000+小时视觉、语言和动作经验,模型进一步通过具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL)获得跨场景、跨任务、跨本体的零样本导航能力。

Light REACT解决的是部署阶段的韧性问题。机器人不再假设自身始终处于训练时的正常状态,而是根据历史交互推断当前动力学条件,在扰动和硬件损伤后调整行为,为降低任务中断和人工介入提供技术基础。

三个方向采用的具体方法并不相同,但有一些共同倾向:扩大训练数据与状态分布,引入强化学习产生新的经验,并尽量减少部署阶段对人工规则和预定义标签的依赖;其中LightParkour和Light REACT还通过蒸馏将多项能力整合进统一策略。

三段范式,开始从技术判断变成研发体系

作为对Physical AI技术路径的系统性思考,“三段范式”正在随着具体技术成果的推进逐步落到研发实践中。

规模化预训练解决的是基础能力如何建立。机器人不可能只依赖昂贵的真机遥操作数据,还需要进一步利用互联网视频、多模态数据以及更大规模的物理世界信息,通过规模化数据训练建立基础能力,为后续的能力对齐和真实部署提供基础。

规模化对齐解决的是如何在预训练基础上,通过强化学习等方式进一步提升模型能力。LightParkour从全身智能出发,将有限的人类动作示例扩展为可泛化的复杂全身运动能力;LightNav-0则通过具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL),进一步提升模型在不同场景、任务和机器人本体上的导航泛化能力。

两项技术分别从全身运动通用导航两个方向,探索如何将基础模型能力进一步转化为物理世界中的行动能力。

规模化部署解决的是模型进入真实机器人和真实环境后,如何持续、可靠地运行。Light REACT从控制层验证了其中一个关键问题:面对外力扰动、硬件状态变化以及训练阶段未穷举的情况,机器人能否利用近期交互历史推断当前身体与环境状态,并据此调整全身行为,为降低真实部署中的任务中断和人工介入提供技术基础。

而三段范式真正形成闭环的关键,在于真实世界数据能够持续回流到模型训练体系。模型通过规模化预训练建立基础能力,在规模化对齐阶段进一步提升面向物理世界的能力,随后进入真实环境部署。

部署过程中产生的成功、失败、异常状态、环境变化以及机器人交互数据,又可以成为后续预训练和对齐的数据来源,推动模型持续迭代。

随着部署范围扩大,模型能够接触到更多样化的环境、任务和交互状态;真实世界经验的持续积累,可以进一步拓展训练数据所覆盖的状态分布,为下一轮模型训练和能力提升提供新的数据基础。

随着模型能力提升,其能力又有机会进一步扩展到更多机器人本体、更多任务和更多真实环境。

由此,预训练、对齐和部署不再是彼此割裂的阶段,而是逐步形成一个由真实世界数据持续驱动的Physical AI学习闭环。

具身智能的大模型竞争,最终比的是谁能形成自己的闭环

过去两年,行业已经证明机器人可以获得越来越多能力。

接下来更难的问题,是这些能力能不能被统一起来,并随着数据、训练和真实部署不断增长。

这也是为什么,只看一个机器人能不能跑酷、能不能导航,或者跌倒以后能不能爬起来,已经很难完整判断一家Physical AI公司的技术能力。真正需要观察的是这些能力背后的学习系统。

它能不能把一个样本扩展成一类技能,能不能把多个专家压缩成一个统一模型,能不能跨环境和跨本体泛化,能不能从自己的行为结果中继续学习,能不能在身体状态发生变化之后仍然完成任务,以及最终能不能把真实部署产生的经验重新送回训练体系。

从LightParkour到LightNav-0,再到Light REACT,亮源新创过去一个多月公开的三项技术成果,实际上沿着这条路线逐层展开。一个从全身运动开始,一个把能力扩展到通用空间智能,一个继续向真实世界中的韧性部署推进。

它们还不是Physical AI的终点,但已经让亮源新创的技术路线变得更加完整:不是围绕一个机器人产品不断增加功能,而是围绕具身智能基础模型建立从数据、训练、对齐到真实部署的完整能力栈。这也是三段范式真正想解决的问题。

大模型的上一轮竞争证明,智能可以随着数据、算力和训练规模持续增长。

而Physical AI的下一轮竞争,需要回答一个更难的问题:当模型真正拥有身体、进入现实世界之后,这套Scaling还能不能继续成立。

亮源新创正在做的,就是把这个闭环跑起来。

*本文系量子位获授权刊载,观点仅为原作者所有。