田晏林 发自 凹非寺
量子位 | 公众号 QbitAI
咋回事儿呢?机器人本体批量落地,行业要补的课反而更多了?
别意外。本体数量上来了,具身智能乍看离规模化越来越近,但理解周围世界、学习新任务、持续进化的能力,还没法跟着机器人一起批量复制。
和只在数字世界处理信息的通用智能体相比,具身智能要让AI真正进入物理世界。
一台机器人学会一个动作不算最难,难的是继续学会第二个、第三个任务;一项已经验证的能力,能不能快速复制到更多机器人身上;换一座工厂、一个工位,甚至换一种本体,还能不能继续跑。
说到底,行业关注的重点,正从如何造出机器人,转向如何持续生产和迭代机器人的能力。
9月16日,在2026智能经济论坛上,百度集团执行副总裁、百度智能云事业群总裁沈抖分享了一个判断:
智能体的能力边界在快速打开,已经能够处理更长程的任务,也开始进入规模化部署。
如果类比AI时代的发展,今天的AI有可能只是灯泡发明后的第一个月而已,因为灯亮了,所有人都看到了变化,但是电力带来社会经济分工的调整还没有出现。
当智能体进入产业系统,企业里的知识、数据、流程、工具和具体要求,要被组织到真实场景里,最终交付结果、创造价值,并持续进化。
这个思路放到具身智能这个领域里,要求只会更高。
机器人每一次执行,都会产生新的数据、误差和现场反馈。
这些经验要能回流到模型和系统里继续迭代,再沉淀成下一次可以复用的能力,机器人才能真正「越用越会」。
于是,当机器人本体开始批量下线后,一个更关键的问题被推到台前:
怎样才能让每台机器人不断学会新技能,并把一项已经验证的能力稳定复制到更多机器人和场景里?
本体量产是起点,能力量产是下一步
本体已经走上产线,接下来,能力也得找到自己的「产线」。
所谓「能力量产」,指的是把已经验证过的具身应用技能,通过模型、数据和本体的持续闭环,以稳定且可控的成本复制到更多真实场景中。
展台上完成一次叠衣服、上下料,和在工厂里连续做一万次,是两回事。
前者看一次成功,后者看任务成功率、人工接管率、单位任务成本、稳定运行时长,以及一项技能复制到更多机器和场景需要多久。
而一项机器人能力,也从来不只取决于模型。
「本体」解决身体如何规模化制造,「模型」决定能力上限,「数据和AI Infra」影响学习新技能的速度,「真实场景」则检验它能否从一次成功变成稳定成功。
真机执行后产生的新数据,再回到下一轮训练和验证。
但一个现实问题是,具身企业进入高频迭代后,原本分散的算力、模型、数采、仿真和部署链路很容易互相拖慢。
数据拿回来要处理,模型训练完要仿真,仿真过了还要真机验证,真机暴露新问题又得重新回流。
看起来只改了一次模型,背后可能同时牵动算力、训练框架、仿真环境、数据管线和部署方式。
这也正是全栈基础设施开始受到更多重视的原因。
它要做的,是把数据、训练、评测、推理和反馈等关键节点接成一条可重复运行的链路,让同样的时间和预算里,企业能够多跑几轮试验。
「能力量产」要想真正转起来,还要打通三个环节:
模型迭代效率、数据持续生产,以及跨本体和跨场景能力应用部署。
机器人的能力,到底怎么被生产出来?
第⼀环:让不同模型路线都能快速迭代
当前,VLA(视觉语言动作模型)、世界模型、全身运动控制等路线仍在并行演进,模型如何分工、世界模型如何接入、训练范式如何调整,都还没有完全收敛。
在百度智能云主任架构师应茹看来,技术路线越不确定时,AI Infra越要保持通用和灵活。
因为每改一次模型结构、训练方式甚至仿真引擎,都要重新适配算力、训练框架和部署环境,研发时间就会大量耗在工程配置上。
她认为,企业真正需要的,也不只是某一次训练快了多少,而是同样预算、同样时间里,能不能多跑几轮训练、仿真和真机验证。
有人一周能跑3轮,有人3周才能跑一轮。时间拉长,试错次数本身就是竞争力。
百度智能云旗下的AI算力基础设施产品「百度百舸」,切入的就是这部分共性工程。
它把数据准备、开发训练、仿真评测和推理部署接入同一套workflow(工作流),统一处理算力适配、训练框架、资源调度、仿真环境和模型部署。
以当前常见的5B到20B单体VLA、WAM(世界动作模型)为例,如果一味堆叠高配硬件,但显存、带宽和计算资源未必都能得到充分利用。
SONIC模型训练配方开源后,百舸将其集成到云上,可一键扩展至128卡训练规模;针对WAM模型的推理瓶颈,经过工程优化,相关测试中的推理延迟降至优化前的四分之一。
这些优化最终都是为了缩短具身模型的迭代周期。
本次论坛上,无界动力创始人兼CEO张玉峰直言,Physical AI的难点是「操作智能」。
为此,无界动力自研了快慢结合的MWA™具身大脑,并让性能、技能和泛化并行推进,在工业、商业两条场景线持续磨能力。
每进入一个新场景,就带回一批新数据。这也是它与百度智能云合作的切入点。
数据显示,依托百度百舸AI计算平台,百度智能云为MWA™具身大脑提供从数据处理、模型训练、仿真评测到真机推理部署的全栈支持,训练有效时长超过99.5%。
模型研发和场景数据只有同时转起来,能力才能持续生长。
第⼆环:把真实操作转化为可训练的数据
互联网已经给LLM留下了海量文字,但机器人想学会拧一颗螺丝、装一个零件,网上几乎找不到完整教材。
具身数据往往同时包含视觉、动作、空间关系、力觉、本体状态和时序关系,而且和具体本体、任务、现场高度绑定。
数据采回来,后面还有清洗、切片、标注、质检、管理、训练、评测。
当前具身智能的数据难题不只在于数量,更在于数据能否持续生产并高效周转。
在东莞,由东莞市及万江街道方面投入建设、百度智能云承建运营的具身智能训练场已投入运转。
百度也在这里落地了大湾区首个实体化具身智能采标实验室,提供数据工具链、百舸算力底座和训推平台,为机器人做真机采集、标注、仿真和模型迭代。
作为技术赋能和场景链接服务方,百度智能云充分发挥自身在具身智能基础设施方面的优势,链接具身产业链上下游共创合作方,共同为东莞制造业智能化升级提供场景赋能。
该训练场规划了13个真实产业场景,覆盖家具制造、3C电子、五金模具、物流仓储,配置50台套异构本体,并持续部署Ego、UMI等100余台无本体设备。
这些产业场景紧扣东莞产业优势和特色,把本地制造业刚需直接转化为机器人训练任务。
数据生产分成三条路:真机遥操作保证真实性,无本体采集降低成本并扩大规模,仿真和算法生成补充多样性。
东莞具身智能训练场也将采集的数据统一纳入具身智能数据采标管一体化平台管理。
不仅如此,训练场还承担「中试」功能。
机器人可以先试训,再中试,最后进厂,相当于把大量试错从正在生产的客户产线上提前搬出来。
由此,这里不再只是单点数据车间,而是一个具身智能行业的综合性工业实训载体。目前,该平台已经服务35家具身智能企业。
数据的规模只是表层,能否把真实现场持续变成机器人可学习、可验证、可回流的经验,才决定能力生产线转得有多快。
第三环:能力还得稳定落进机器人身体里
模型训练完成,只是能力形成的一半。
机器人面对真实用户时,得听懂、理解、及时响应、正确执行,还要长时间稳定运行。
模型部署、语音交互、端云协同、安全和本体适配,都会直接影响最后的产品体验。
消费级具身智能机器人品牌上纬启元,是一个典型例子。
它面向个人和家庭场景推出Q1、T1两款机器人。
围绕Q1、T1,百度百舸提供统一的模型训练、微调、推理和测试环境,并集中管理AI任务、数据流转与弹性算力调度,使模型研发能够在同一套环境中持续迭代。
“百度百舸AI计算平台在我们Q1、T1型机器人的研发过程中,提供了统一的模型训练、微调、推理和测试环境,实现了AI任务的集中管理和算力资源的弹性调度。”上纬启元首席科学家董豪表示。
上纬启元首席科学家董豪
而且他发现,在数据高效流转、模型训推加速等方面,显著提升了模型开发效率,缩短了实验闭环与算法迭代周期。
不过,具身智能要在现实世界中规模化落地,硬件系统同样重要。
对这类产品来说,用户最关心的,是叫它的时候能不能听见,听见之后能不能理解,理解之后能不能及时做出正确反馈。
据董豪介绍,百度智能云全栈AI能力也提供了系统化的支持。
在产品交互层,百度智能云的语音交互能力补上了机器人与用户直接沟通的关键环节。
一台面向真实用户的机器人,背后已经是多个系统共同工作。
「模型」负责理解和决策,「语音交互」负责承接用户意图和反馈,「端云协同」影响响应效率,「安全能力」决定系统能否长期稳定运行。
而且,这套底层支撑还要适应不同形态的机器人。工业机器人看重节拍、稳定和精度,个人机器人面对开放环境、高频交互和更复杂的用户需求。
只有跨本体、跨场景的适配能力建立起来,一项已经验证过的技能,才有机会真正复制出去。
50多家公司背后,基础设施需求正在出现共性
无论做工业、商业还是家庭机器人,企业最终都会反复碰到同一组底层问题,模型怎么更快迭代,数据怎么持续回流,本体怎么稳定部署,能力又怎么进入真实场景完成验证和复制。
再看百度智能云其他的合作伙伴:千寻智能、智元机器⼈、银河通⽤、宇树科技、星动纪元、跨维智能、星尘智能等企业,虽然产品形态、技术路线和目标场景各不相同,却也在集中暴露出相似的基础设施诉求。
比如千寻智能,和百度智能云的合作直接落在训练效率上。
据了解,千寻智能接入百舸后,有效训练时长达到98.8%,核心指向就是减少底层资源和工程问题对模型研发节奏的打断,让更多时间真正花在模型迭代上。
智元机器人则放在更广的全栈AI云框架下看。
它与百度智能云的合作重点不只是一块算力,而是随着机器人研发和产品推进,持续调用模型训练、数据处理、部署等底层能力。
当然,这些案例不能代表整个行业,却足以说明,具身智能企业走到研发提效和规模落地阶段后,底层基础设施需求正在浮现出越来越强的共性。
模型侧需要提高训练、推理部署效率;
数据侧需要贯通采集、标注、管理;
本体侧要解决交互、端云协同、安全与适配等问题;
进入场景后继续完成规模复制。
尽管具身智能的技术路线还在百花齐放,但基础设施需求已逐步收敛。
行业分工因此变得更清晰。
模型路线、产品定义、场景经验,依然是具身企业自己的核心竞争力。
算力调度、训练加速、数据处理、仿真评测、推理部署这些每家公司都会重复遇到的工程问题,则越来越适合沉到公共基础设施层。
百度智能云目前的布局,沿着这条链路展开。
- 模型侧,百舸提供训练、推理和算力调度。
- 数据侧,提供采集、标注、管理、评测的一整套链路。
- 本体侧,补上语音交互、安全和端云协同能力。
- 场景侧,通过训练场和中试平台继续完成验证和复制。
全栈AI云的价值由此变得更具体。
它把能力生产过程中反复出现的共性环节,做成一套可以被不同企业复用的底座,让具身企业把更多资源放回模型、产品和场景本身。
目前,百度智能云已经为产业链上超过50家重点具身企业,提供了全栈AI云技术支撑。
国际数据公司(IDC)发布的《中国具身智能云市场份额报告,2025》也提到,百度智能云以29.55%的市场份额,同样位居第⼀。
国际权威市场调研机构英富曼(Omdia)也给出了相同排名。双报告第一。
这些数字背后,更值得关注的是一个产业变化:
当越来越多不同路线、不同本体、不同场景的公司,开始调用相似的底层能力时,具身智能的竞争已经开始延伸到能力生成效率。
在具身智能技术路线尚未定型的阶段,企业未必需要提前押注唯一答案,但必须保证自己还能继续试。
模型可以换,训练范式可以换,本体可以换,场景也会继续变化。这就要求企业需快速搭建一套基础设施:既能承接模型迭代,持续沉淀数据,又可实现跨本体迁移部署。
未来的竞争,不只是谁先做出一项能力,也是谁能更快完成验证、复制和迭代。