首页 > 资讯 > 知道 ' 杯子是什么 ',和稳定抓起一个杯子,是两种能力:博登智能押注具身智能的 ' 数据基础设施 '

知道 ' 杯子是什么 ',和稳定抓起一个杯子,是两种能力:博登智能押注具身智能的 ' 数据基础设施 '

36氪文章 2026-10-09 18:09 4 阅读 查看原文

过去两年,具身智能的技术进展很快。从VLA、世界模型到强化学习,模型对环境的理解、任务规划和动作生成能力都在持续提升。但随着机器人真正走出实验室,进入家庭、工厂、仓储和商业服务等复杂环境,一个更基础的问题开始浮出水面:模型从哪里获得足够多、足够真实,并且能够持续迭代的物理世界经验?

这与大语言模型面对的数据问题并不相同。互联网已经积累了海量文本、图像和视频,但机器人最终需要处理的是物理世界。知道“杯子是什么”,和真正控制机械臂稳定抓起一个不同材质、重量和位置的杯子,是两种完全不同的能力。后者涉及视觉、空间、动作、力、机器人状态和环境反馈等多维信息,而且大量知识只存在于真实交互过程中。

在近日于美国匹兹堡举行的IROS 2026上,这一问题正在成为机器人产业新的关注点。博登智能此次带到IROS的,也并非单一数据解决方案,而是一套围绕真实世界数据展开的能力体系:Human-Centric Data、Cross-Embodiment Data、流式4D手部重建算法ChronoHand,以及面向真实机器人交互的开源数据集。

这些成果背后指向同一个判断:当机器人开始从“能完成任务”走向“在真实环境中稳定且持续完成任务”,真实世界数据就不再只是模型训练的原料,而开始成为决定模型迭代效率的一层基础设施。

模型越接近真实世界,数据问题越难绕开

具身智能并不简单缺少“更多数据”,它更缺少能够对应模型能力缺口的数据。

这是机器人数据与传统互联网数据一个很大的区别。在相对封闭的训练环境中,任务、物体和空间可以预先定义,但机器人进入现实环境之后,同一个任务可能面对完全不同的物体位置、材质、光照、空间结构甚至人的行为。模型在训练集上的成功,并不意味着它能够在现实环境中稳定复现。

因此,具身智能的数据需求正在从静态走向动态。过去的数据生产往往是先确定需求,再完成采集、处理和交付;现在越来越多的数据需求,需要由模型在真实环境中的表现反向定义——机器人在哪里失败、为什么失败、缺少哪类经验,再决定下一轮应该生产什么数据。

博登智能此次在IROS重点展示的Human-Centric Data与Cross-Embodiment Data,实际上对应了两类真实世界经验的获取方式。

Human-Centric Data的核心,是将人类已经拥有的大量操作经验转化为机器可学习的数据。通过第一视角设备、腕式设备、数据手套、UMI等采集方式,可以记录人在抓取、整理、装配等真实任务中的动作与环境交互。相比完全依靠机器人从零试错,人类每天都在真实世界中产生大量高价值操作经验,如何将这些经验结构化,是当前具身智能数据生产的重要方向。

Cross-Embodiment Data则解决机器人自身的经验问题。不同机器人在运动学结构、执行能力和传感配置上存在差异,如果数据长期局限于单一本体和有限场景,模型的泛化能力同样会受到限制。跨本体、跨任务和跨场景的数据,本质上是在扩大模型能够观察和学习的物理世界边界。

但采集到视频和轨迹,并不意味着数据已经能够直接用于模型训练。Human-Centric Data尤其如此:人可以很容易理解第一视角视频中双手正在做什么,但模型真正需要的是更精确的手部姿态、动作轨迹、关节运动,以及手与物体之间连续变化的空间关系。

这也是博登智能创始人兼CEO赵捷博士在IROS官方讲台向行业重点分享ChronoHand的原因。ChronoHand针对第一视角场景下遮挡、快速运动和双手交互等问题,通过双分支解耦、时序建模与闭环几何求解,实现连续4D手部重建。在ARCTIC基准测试中,其9项指标中7项取得最优结果,并实现FPS60(NVIDIA 4090D)实时推理。

如果把它放回整个数据链路来看,ChronoHand的意义就不仅是一项算法成绩。真实世界数据要成为模型可以利用的经验,中间需要经历从采集、同步、理解到结构化的一系列技术过程。数据基础设施本身,正在变成一个越来越技术密集的系统。

比数据规模更重要的,是数据能否形成生产闭环

解决数据有效性之后,另一个问题是如何把真实世界数据变成稳定产能。

Physical AI的数据很难像互联网数据一样通过抓取获得。真实数据生产需要场地、机器人、采集设备和操作人员,也需要任务设计、数据标准以及后续的多模态同步、结构化处理和质量控制。因此,当模型训练进入百万小时甚至更大的数据规模,仅靠项目制的数据采集方式很难长期支撑。

博登智能正在尝试把这件事变成一套标准化的数据生产系统。目前,公司已经在宁波、湖州、马鞍山建设三大具身机器人创新中心,拥有超过3万平方米真实世界场景空间,部署500余台机器人,覆盖30多个机器人品牌和型号,并形成每年50万小时以上Cross-Embodiment Data和百万小时级Human-Centric Data的数据生产能力。

这些数字解决的是“规模”问题,但真正决定数据基础设施价值的,是规模背后的生产效率。

从模型需求和任务定义开始,数据进入真实场景采集,随后完成多模态同步、结构化处理、质量验证和模型交付;当模型重新进入真实任务后,新的失败样本和能力缺口又会反向进入数据生产体系,触发定向补采和下一轮训练。

这意味着,具身智能的数据生产不再是一条“采集—处理—交付”之后就结束的流水线,而逐渐形成了需求定义—数据生产—模型训练—现实验证—模型反馈—定向补采的循环。

这个变化可能比单纯扩大数据量更加重要。

机器人真正进入现实世界之后,长尾问题理论上很难穷尽。一个固定数据集无论规模多大,都不可能预先覆盖未来部署中遇到的全部情况。相比提前生产一个无限大的数据集,更现实的路径是建立一套能够快速响应模型能力缺口的数据系统:模型发现问题,数据系统快速组织新的真实世界经验,训练完成后再回到现实环境验证。

因此,未来衡量具身智能数据基础设施的效率,可能不仅是“能够生产多少小时数据”,还包括另一个指标:从模型暴露问题,到对应数据重新进入训练,需要多长时间。

数据生产效率最终影响的,是模型的迭代效率。

这也是博登智能“Train at Scale, Validate in Reality”背后的逻辑——规模化训练和现实验证并不是两个彼此独立的环节,真正有价值的是让数据在两者之间持续流动,并最终转化为模型能力。

数据基础设施的新变量,是连接更大的真实世界

如果机器人最终要在全球不同环境中工作,真实世界数据还面临另一个天然问题:物理世界具有明显的地域差异。

家庭空间、工业流程、商品形态、操作习惯乃至任务标准,在不同国家和地区都可能不同。模型越追求泛化,越不能只依赖单一地区、单一机器人或单一任务产生的数据。这意味着,Physical AI的数据基础设施最终不仅要解决“生产多少”,还要解决能够连接多大的真实世界。

目前,博登智能已经形成覆盖中国、北美、欧洲、中东和东南亚的业务布局。此外,公司近期完成具身智能数据集出境备案,进一步建立起面向全球研发体系的合规数据交付能力。这使真实世界数据的生产体系开始从单一区域向全球研发网络延伸。

另一条路径是开源。今年6月,博登智能联合均普创新中心、上海交通大学MINT实验室发布RW-RL-Dataset,开放超过1000小时真实机器人交互数据;随后推出的RW-RL-HIL-Dataset,则进一步将机器人执行过程中人类介入、纠正和恢复任务的数据纳入开放研究体系。

这里值得注意的并不是又多了一个机器人数据集,而是数据内容本身发生了变化。传统数据集更多记录“机器人如何正确完成任务”,但真实世界中的失败同样具有很高的信息密度。机器人为什么失败、人类如何介入、怎样从失败状态重新回到正确轨迹,这些过程实际上构成了模型理解现实世界的重要经验。

从这个角度再看博登智能此次IROS呈现的几项成果,它们之间的关系会更加清晰:Human-Centric Data解决人类经验如何被规模化获取,Cross-Embodiment Data扩大机器人真实交互的覆盖范围,ChronoHand解决复杂人类操作如何被理解和结构化,创新中心承担规模化数据生产,而开源数据集、全球场景布局和跨境交付,则让这些真实世界经验能够进入更广泛的机器人研发体系。

这也解释了为什么数据基础设施正在成为机器人产业的新变量。

过去几年,行业主要在解决模型“会不会”的问题。随着机器人走向规模化应用,问题逐渐转向:同一个模型能否跨越不同本体、任务、环境和地域,依然稳定地“做对”。要解决后一个问题,仅靠继续增加模型参数并不够。机器人还需要持续获得新的物理世界经验,并通过现实反馈不断修正自身能力。

IROS上的这些变化或许只是一个开始。随着机器人真正从实验室进入更广泛的现实环境,模型与真实世界之间需要一层新的连接:它既要持续生产数据,也要理解数据、组织数据,并根据模型反馈不断产生新的数据。

对于博登智能而言,正在建设的正是这一层——让真实世界持续成为模型学习和进化的数据来源。