首页 > 资讯 > 机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协.

机器人基础模型的「协作时代」来了!芝诺机器人发布全球首个协.

机器之心 2026-09-08 06:00 2 阅读 查看原文
编辑|冷猫

如何让具身智能持续进化,是整个行业始终关注的核心命题。


最直接的方案,是提升单体能力。更灵巧的双手、更强的泛化能力、更可靠的执行表现 —— 这也是行业长期以来竞争最激烈的方向。


但现实世界中的任务,从来不是专门为一个人,或者一台机器人设计的。一个更聪明的机器人并不能解决所有问题。


于是,另一条思路慢慢变得重要:为复杂任务添加一些机器人呢?


协作模式天然适合那些物理任务本身需要多个作用点、多个工作空间或者并行操作的场景。


在工厂里,多台通用机器人平时各自工作,充分发挥单体智能;遇到复杂任务时,又能迅速组合能力。系统所需的物理能力,可以随着机器人数量近似线性扩展,而不必每次都重新设计一整套自动化方案。


但如果机器人离开了流水线,脱离了中央调度器的控制,进入更加通用的场景里,它们会各干各的,站在原地大眼瞪小眼?还是更糟 —— 两台机器人都觉得这个杯子该自己拿,最后在桌前「打起来」?


如何让它们真的像两个靠谱同事一样,能在没有人类指挥或是统一策略的情况下,把一件复杂任务自然地拆开、接力、配合完成,实现 1+1>2 的效果


这意味着多机器人系统既要实现众人拾柴火焰高的效果,又要杜绝三个和尚没水喝的问题。


当机器人进入规模化应用时,群体协作一定是其中一种关键的能力,甚至可以说是必须项。


芝诺机器人发布了 Zeno-1,一个 3B 参数的基础模型,是第一个专为去中心化多机器人协作设计的物理智能基础模型,能在本地以 30 Hz 的频率进行闭环视觉 — 运动推理。


简单来说,机器人从现在开始真的可以自主协作完成任务了!



让我们仔细观察这两个机器人协作的细节。



首先是挂裤子的动作。充分表现了两个机器人协作的动作精准性,准确夹取裤子穿过晾衣架,交接晾衣架全程很自然,稳定,没有一点多余的抖动。



给枕头装真空袋,两个机器人的协作水平让人惊掉下巴。这是一个相当长程的复杂任务,也是非常典型的家庭应用场景。机器人稳健地完成了自主动作决策,将具有弹性的枕头装入透明的真空袋,扶好袋子的同时捏紧密封,最后对准位置吸真空。中间任何一环的偏差都无法顺利实现。


更有意思的是,Demo 里的每台机器人运行的其实都是同一个策略模型的副 各自通过自己观察到的信息做判断。谁去抓、谁来配合、什么时候等待、什么时候接手,这些协作行为,是从同一个模型分布自己「涌现」出来的。



  • 技术报告:https://zenobot.ai/research/zeno-1-collaborative-intelligence


这和传统多机器人系统依赖中央控制器统一分工、同步时钟的思路,已经是两条完全不同的路线。


技术拆解:Zeno-1 的四阶段训练


Zeno-1 的核心问题可以用一句话概括:怎么让一个模型在不被告诉队友想什么的情况下,自己学会跟队友配合?



这个问题之所以难,原因有三。


第一,维度爆炸。两台机器人各自有自己的观测空间和动作空间,联合状态空间会随着机器人数量上升而快速膨胀,各个智能体之间的交叉注意计算量更是指数级增长。传统多智能体强化学习的做法是在一个中心化的模拟器里同时训练所有 agent,但这种方式在物理机器人上几乎不可行,因为必需的多机器人同步协作数据和特权数据极难获取。


第二,时间累积误差。两台机器人协作不像下棋那样回合制交替进行,而是连续的、实时的。0.1 秒的时序偏差在当下可能无关紧要,但 5 秒后就可能导致整个任务失败。误差会随时间累积,而且不可逆。


第三,搭档不确定性。真实场景中,你的搭档可能会犹豫、可能会打滑、可能因为观测噪声做出你意料之外的动作。任何假设「搭档会完美执行预设轨迹」的方法都注定脆弱。模型必须对搭档行为的变化保持鲁棒性。


四阶段递进训练


第一阶段:学习世界(大规模视频预训练)。 


第一阶段的目标是让模型建立对物理世界的广泛先验知识。


Zeno-1 在大规模视频数据上进行预训练,学习物理世界的基本规律:物体怎么在力的作用下移动?接触发生时会产生什么?柔性物体在被抓取时如何形变?液体倾倒时如何流动?


这一步完全不涉及机器人控制,模型像一个「旁观者」一样观察大量真实世界的物理交互视频,从中提取运动、接触、形变、因果等通用物理先验。这些先验知识为后续阶段提供了基础:模型不需要从零学习「物体会掉落」或「用力过大会把东西推翻」,这些常识在预训练阶段就已经被编码进去了。


第二阶段:学习自身(单体具身训练)。 


视频预训练获得的物理直觉是通用的,还不能直接驱动具体的机器人执行动作。第二阶段将这些通用先验落地到特定的机器人本体上。


在这一阶段,单台机器人在真实环境中进行训练,将预训练得到的视觉 - 物理先验转化为具体的感知 - 决策 - 执行能力。模型学会从自身的视觉观测和本体状态中提取任务相关特征,并将其映射为连贯的全身动作序列。


经过这一阶段,Zeno-1 作为单体已经具备了灵巧操作、工具使用和移动交互等基础能力。


「先成为一个称职的个体,然后才有资格谈协作。」


第三阶段:学习协作(闭环伙伴交互,Closed-loop partner interaction,CPI)。 这是 Zeno-1 最核心的创新。



传统路径是收集大量多机器人协作的演示数据,然后用监督学习去模仿。但这条路几乎走不通:你很难让两个真实机器人在真实环境中大规模生成高质量的协作数据,成本和效率都不允许。


CPI 的思路完全不同。它让两台独立运行的机器人互为训练伙伴。每台机器人根据自己的观测独立行动,而它的动作会改变共享的物理环境,进而影响另一台机器人的下一步决策。


值得一提的是,CPI 训练中,搭档本身就是一个正在学习的自主体,它的行为天然带有各种不完美:有时快、有时慢、有时失误。模型在训练过程中已经见过了大量搭档行为偏差的案例,对延迟也就具备了鲁棒性。


当我们有意扰动协作机器人的动作时序时,Zeno-1 的部署鲁棒性表现得尤为明显。即使面对会让基于同步演示训练的策略迅速失效的延迟,Zeno-1 仍能保持协调协作。


通过 CPI 训练,Zeno-1 学会了一系列具体的协作适应行为:减速、等待、让步、维持接触、重新校准时序,然后在交互重新变得兼容时恢复正常节奏。这些行为完全从闭环交互中自发涌现。


第四阶段:协作失败的针对性纠正


具体做法是:在真实部署中观察机器人的协作过程,识别协作出问题的关键时刻,然后由操作员围绕这些关键时刻提供纠正性演示,这些演示被补充回训练数据中。


关键机制在于最后一步,模型并非均匀地学习所有经验,它会在协作最容易出错的地方投入更多学习资源。


在协作适应过程中提高闭环伙伴交互的比例,其协作性能显著优于添加等量同步多机器人演示数据的效果。


具体而言,训练过程如下:


  • 步骤 1: 两台机器人被放置在同一个物理环境中,各自加载经过前两阶段训练的策略。

  • 步骤 2: 两台机器人根据各自的观测独立采取行动。机器人 A 的动作会改变共享物理环境,这个环境变化会进入机器人 B 的下一帧观测,影响 B 的决策,反之亦然。

  • 步骤 3: 随着交互的进行,两台机器人的时序节奏、运动轨迹和接触力需要持续适应彼此。协作能力从这个闭环中自然涌现。

  • 步骤 4: 系统会识别协作崩溃的时刻。当配合出现失误,这些失败片段会被标记出来,模型在这些关键时刻上进行额外的训练。



两台机器人在持续交互中「共同进化」,机器人通过真正的协作来学习协作,而不是通过观看人类演示来「模仿」协作。


两个关键子系统:持久交互记忆与预测式内省


从演示视频里我们发现,机器人能够顺利完成相当长程的任务。也就是说,在 CPI 之上,Zeno-1 还有两个让长时间协作成为可能的子系统。


Zeno-1 机器人长程任务演示


持久交互记忆(Persistent Interaction Memory)。 


多机器人协作任务通常跨越数分钟甚至十分钟以上。在这个时间尺度上,纯粹的反应式策略会丢失大量关键上下文。


Zeno-1 通过一个可学习的记忆模块来解决这个问题。这个模块在每个时间步更新,维护一个压缩的交互历史表征。它编码了三类信息:


  • 任务进展:当前任务处于哪个阶段,哪些子目标已经完成。

  • 搭档行为模式:搭档近期的动作趋势,是否在减速、加速、改变策略。

  • 共享物理状态演变:物体构型如何变化,接触点如何迁移。


据消融实验,持久记忆对于超过 3 分钟的协作任务至关重要。移除该模块后,模型在长时序任务上的表现显著退化。


没有持久交互记忆的机器人就是纯粹的「金鱼」记忆,每一步都从零开始判断局势,无法沉淀已经积累的交互经验。


预测式内省(Predictive Introspection)。 


这个机制让 Zeno-1 在执行动作之前先「在脑子里过一遍」。具体分两个层面:


在搭档交互层面,一个动作在局部看可能是最优的,但如果它导致搭档被置于不利位置,从团队整体来看就是次优的。


Zeno-1 会评估每个候选动作对搭档后续行为的可能影响。根据技术报告中在保留测试集上的评估数据:


  • Zeno-1 在协作决策点上有 87% 的概率选择了让搭档后续行为更优的动作。

  • 作为对照,移除搭档行为预测模块后(只考虑动作的即时效果),这一比例降至 61%


「为搭档着想」不只是锦上添花,而是协作质量的关键决定因素。


在物理接触层面,Zeno-1 内置了一个行动条件世界模型(Action-Conditioned Latent World Model),可以预测执行某个动作后共享物理状态会如何演变。


它的核心功能是在动作执行前识别可能的失败:抓取失误、滑动、抓握不稳和物体扰动。


研究团队在 200 次真实机器人实验中的测试,这个世界模型在 0.5 秒预警窗口内对接触失败的预测 AUC 达到 0.94,而仅基于当前观测预测的 AUC 为 0.81。


Zeno-1 能在接触前 0.5 秒预判即将发生的故障。


简单来说,它能预防协作失误。Zeno-1 可以在行动之前同时考虑「这个动作对搭档好不好」和「这个动作在物理上会不会失败」。



1+1>2,多机器人协作的起点


机器人的协作,似乎可以统一控制,但芝诺为什么要坚持去中心化?原因有两个:


  • 扩展性。 中心化控制器的联合动作空间随机器人数量指数膨胀。假设每台机器人的动作空间维度为 d,N 台机器人的联合空间为 d^N。Zeno-1 的去中心化架构下,增加一台机器人只需要加载同一个策略副本,无需重新设计控制器或重新划分联合动作空间,计算量线性增长。

  • 鲁棒性。 中心化系统存在单点故障。中央控制器如果出现延迟或故障,所有机器人同时失效。去中心化系统中,每台机器人独立决策,单个节点的故障不会传播到整个团队。


这个特性非常实用。你不需要一次性部署一个完整的机器人团队,而是可以按需逐台增加产能。


现实世界里,大量工作天然需要配合才能完成。腾讯云开发者社区的一篇行业分析指出,2026 下半年具身智能正进入「柔性工站重构」阶段:单台机器人再能干,碰到需要多工位协同的产线依然束手无策。


机器人之间靠什么协调?答案是:物理世界本身。


在 Zeno-1 的技术路径中,「共享的物理世界本身就是协调接口」。每台机器人通过观察环境以及其他机器人的行为,判断任务进度、理解协作状态,并据此调整自己的下一步动作。协调不再完全依赖显式通信和统一调度,而是在真实世界的持续交互中自然产生。


学术界也已经开始沿着类似方向推进。今年 6 月,斯坦福的 Chelsea Finn、Jeannette Bohg 的课题组提出一篇名为 CHORUS 的方法,提出了基于单一 VLA policy 的去中心化多机器人协作。


产业界也开始把 collaboration 视为下一阶段的重要能力。Figure 的 Helix 02 和 Google DeepMind 的 Gemini Robotics 2 都已经明确展示或强调 multi-robot collaboration,说明协作正在逐渐进入机器人基础模型的核心能力定义。


一个越来越清晰的趋势由此浮现:机器人基础模型正在从单体能力进一步走向协作智能。


 Zeno-1 至少验证了一件事:协作物理智能可以在单一去中心化策略中实现。


一台机器人能够完成的任务终究有限。当机器人真正学会观察彼此、理解彼此,并像同事一样共同工作,1+1 才开始真正大于 2,整个机器人行业的能力上限也将随之打开。



看得远一点,一个大量机器人参与的文明世界正在向我们招手。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com