首页 > 资讯 > 具身机器人能搞定超市盘点吗?全球七万门店正在给出答案

具身机器人能搞定超市盘点吗?全球七万门店正在给出答案

量子位 2026-09-09 12:52 2 阅读 查看原文

允中 发自 凹非寺

量子位 | 公众号 QbitAI

一家正在营业的超市里,一台轮式机器人正沿着货架缓慢移动。

它要躲开顾客和购物车,核对电子价签和商品价格,还得调整摄像头角度,看清被前排商品挡住的库存。到了补货环节,机械臂要伸进只有三四十厘米高的货架层,把软塌塌的膨化食品袋抓起来,再整齐放回排面。

每一个动作,以及识别精度、运行安全和设备成本,都直接影响零售商的经营结果。

ROI回报,是具身智能走进真实门店绕不开的一步。

现在,两家公司——汉朔科技X-Era Lab(拓元智慧)——正在共同把这些能力带进真实门店。

汉朔科技是零售数字化的老玩家。公开资料显示,汉朔科技服务全球超过550家零售客户,产品覆盖80多个国家,铺进了将近7万家门店。

这些门店的货架上布满电子价签,每张价签都实时连接着商品,价格和货位信息,相当于提前为机器人铺好了一套可读取的物理坐标系。

后者是一家深圳公司,专注自研世界动作模型,打造具身智能软硬一体方案,面向零售、人居、制造等场景落地智能机器人。

它基于4D时空表征的原生世界动作模型VWA,让机器人能够理解遮挡、光照变化和商品状态,预测环境变化并完成动作。

一家出场景,一家出大脑,两家企业共同面对的命题是:

当顶尖AI模型接入覆盖全球门店的真实场景网络,具身智能能否摆脱一次性演示Demo,转化为可在货架间持续稳定运行的生产级系统?

具身智能如何在全球零售门店货架跑通商业闭环?

汉朔科技内部近几年一直在押注Physical AI。

Physical AI指的是一整套让AI能够读到物理世界、也能改变物理世界的基础设施。机器人,则是其中最新、也最难的一环。

作为泛零售数字化领域的头部企业,汉朔科技服务了全球超过550家零售客户,签约了接近四成的全球零售百强客户,其产品覆盖了全球80多个国家,将近7万家真实门店。

基于这样庞大的业务底盘和对零售场景的深度理解,汉朔将零售门店里的具身智能需求收敛成三件事:

  • 巡检
  • 盘点
  • 补货

目前,汉朔的巡检机器人已经进入国内和海外商场开始POC测试

△汉朔巡检机器人

在当下具身智能的讨论中,主流落地场景主要集中在两极。

一极是工厂(高度结构化,传统自动化已解决大半),另一极是家庭(完全非结构化,泛化能力要求极高,距离商业化还有很长的路要走)。

恰好介于二者之间的零售门店,其实是一块被严重低估的具身智能“试金石”。

零售行业最核心的痛点在于盘点频率存在天然瓶颈

大型零售门店的全店盘点,只能安排在闭店时段,也就是夜间或周末凌晨开展。因为营业期间顾客、商品持续变动,盘点数据会严重失真。

这种高度依赖人力的模式,导致多数零售商一年仅能完成一到两次全店盘点。

行业数据显示,账实不符是零售业普遍难题;倘若盘点频次能够提升,库存实时性与货损管控水平都将得到显著改善。

若巡检机器人可以按区域排班,在门店营业时段稳定完成巡检与盘点工作,把盘点频次提升至周度甚至每日级别,这将为整个供应链管理带来质的飞跃。

用电子价签构建“物理世界坐标系”

作为全球零售数字化领域的头部企业、全球第二大电子价签供应商,汉朔已在近7万家门店搭建起电子价签网络,建成深入货架、打通SKU与物理货位的数字化底座。

在此基础上,汉朔进一步搭建门店数字孪生系统,把商品、货架、设备、库存和门店运营状态映射至统一的数字空间。

这意味着当AI与机器人进入门店时,无需单纯依靠视觉从零感知环境,可以调用持续更新的商品与空间先验信息。

这套由“真实门店网络+数字孪生+智能终端”组成的基础设施,构成了汉朔布局具身智能乃至Physical AI领域难以复制的场景壁垒。

而电子价签本身就是附着在每一个货架点位、可实时更新的结构化商品元数据载体。

货架点位应该陈列哪个SKU、对应售价,都能与ERP系统实时同步。

基于这一底层能力,机器人将获得三大差异化优势:

第一,端侧算力压力显著下降。

价签预先告知货位预期商品,模型仅需做闭集确认,端侧小模型即可胜任,减少云端算力开销与延迟。

第二,原生货架语义坐标。

无需机器人用SLAM重建地图并人工标注;海量价签节点,可直接提供门店空间与商品分布信息。

第三,本地计算满足合规要求。

在欧洲等合规监管格外严格的区域,依托价签先验信息+端侧小模型实现本地数据处理,将合规约束转化为技术优势。

为真实货架而生的原生世界动作模型

要为这套庞大的物理门店网络搭载智能“大脑”,汉朔选择与深耕零售场景的AI团队X-Era Lab(拓元智慧)达成合作。

X-Era Lab(拓元智慧)聚焦具身智能与世界动作模型研发,目标打造下一代智能机器人基础设施;团队由中山大学人机物智能融合(HCP)实验室与鹏城国家实验室联合孵化。

核心创始团队包含王广润博士、王可泽博士、蒲韬博士等顶尖青年科研人才,成员兼具牛津大学、香港理工大学、UCLA以及华为等机构的科研与产业落地经验。

团队原创并落地原生世界动作模型(VWA),在基于4D时空表征的模型架构内统一完成环境世界理解与机器人动作生成。

仅使用10亿参数,VWA就在十余项权威评测中取得领先,性能超越多款数十亿参数的主流模型,该技术路线也获得Google DeepMind、NVIDIA等团队的认可。

科研层面,团队累计发表顶会、顶刊论文500余篇,总引用量超10万次,九次斩获国际顶会最佳论文奖,三位核心成员入选全球前0.05%顶尖科学家榜单。

产业化层面,X-Era Lab组建了来自腾讯、华为的全栈工程团队,搭建日均服务500万次调用的世界模型MaaS平台;同时搭建真实交互视频数据管线,每日可生产约2万小时毫米级4D训练数据。

团队把百亿参数模型的能力压缩至10亿–30亿参数区间,能够在32 TOPS算力的硬件上完成端侧部署;还与星宸科技联合研发面向世界模型的专用芯片,将模型推理时延压缩至毫秒级别。

除此之外,团队开源了全球首个具身智能操作系统PhyAgentOS,以此持续推动具身智能机器人走向规模化落地。

正如X-Era Lab CTO陈添水博士所言,零售赛道很难靠概念讲故事,场景细节高度细碎,仅盘点一项任务就可以拆解成多个评价等级,技术能力很容易被实际业务证伪。

汉朔机器人产品线总经理童亮认为,零售卖场是典型的半结构化场景:货架布局、基础作业规则相对固定,但同时存在商品变动、顾客走动等人流干扰这类动态变量。这类真实场景数据恰好适合训练具身机器人,能够规避实验室仿真数据泛化能力弱、开放环境变量过载的短板。机器人在真实门店执行理货、盘点任务的过程中采集数据,并且同步接受业务指标校验,能够有效降低落地试错成本。因此真正愿意沉下心深耕这个方向的团队,并不多。

△AI生成场景图

场景底座+世界模型,驱动零售具身智能持续迭代

具身智能走向产业落地,胜负手或许并不只在于模型本身的能力。尤其是当前模型能力正快速走向商品化,仅依靠参数规模很难长期形成代际差距。

真正稀缺的资产,是来自物理世界的现场知识,如门店内实时发生的变化、每个货架点位应陈列的商品、通道宽度与层高,以及哪些商品容易出现遮挡、形变或被顾客临时挪动。

这类信息是汉朔科技十四年深耕全球零售场景逐步积累而来,无法仅凭算力与模型训练凭空生成。

汉朔所沉淀的正是零售领域Physical AI落地所稀缺的底层基础——真实门店场景、商品与货架数据,以及持续搭建的门店数字孪生能力。

依托电子价签、IoT网络与智能终端,门店里的商品、货架、设备和运营状态能够持续映射至数字空间,为AI理解物理环境提供可读取、可动态更新的场景底座。

但拥有场景底座并不代表机器人就能自主完成作业,汉朔还提供了一套可供机器解析的物理坐标系,它让模型能够识别点位现状、预期标准以及现场变化,为任务理解与执行提供先验信息。

在此基础上,汉朔与X-Era Lab需要共同解决的核心问题,是让模型在这套坐标系下理解空间、预判环境变化并输出可行动作。

X-Era Lab原生世界动作模型VWA借助4D时空表征,打通环境理解、行为预测与机器人控制,使价签、货架、商品以及人员动态不再是孤立数据,而是模型可以理解并据此执行任务的世界状态。

更关键的是,这套方案并非简单将通用大模型直接部署到商超环境,而是让模型在真实业务任务中持续校准。

每一次巡检、盘点,甚至识别、操作中出现的失误,都可以转化为模型迭代的反馈信号。

依托汉朔覆盖全球的门店场景网络、商品货架数据与数字孪生底座,双方能够持续沉淀真实业务里的识别、盘点、操作反馈,形成可验证、可复用的模型与场景能力,并在真实门店环境中持续迭代优化。

让智能走进真实物理场景,依托真实场景持续迭代智能。

只有将高性能AI模型接入承载海量真实场景与商业数据的网络,具身智能才有望脱离一次性演示Demo,演进为一套可持续运行、持续迭代,且具备商业可行性的生产系统。