当业界集体等待具身智能的“ChatGPT时刻”,卡住进度的往往不是算法,而是数据。灵灵智能(LINGLING INTELLIGENCE)试图用“无本体+真机”双轨采集与一套数据治理管线,把真实世界的人类行为转化为机器人可以直接用于训练的数据资产。这家公司日前启动数千万元级天使轮融资,用于放大已经跑通的数据供给飞轮。
具身智能的瓶颈,不在算法而在“数据荒”
过去两年,人形机器人与具身大模型的每一次亮相几乎都由算法突破推动,但越来越多从业者意识到,真正的天花板在上游——可供训练的高质量物理交互数据。据国金证券2026年7月发布的研报,截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,而训练一个通用具身模型至少需要千万小时级的多模态数据,供给不足实际需求的5%。中国信通院人工智能研究所等机构在《具身智能训练场研究报告(2026年)》中给出类似判断:具身基础模型要迎来“ChatGPT时刻”,至少需要千万小时级真实数据,而当前全球可用的高质量真实数据仅为数十万至百万小时级,供需之间存在量级差距。
数据稀缺的背后,是采集成本与数据质量的双重困境。据《2026全球具身智能技术创新与应用白皮书》披露,真实数据的采集成本一度高达每小时1200美元;在国内,传统真机遥操作的单条有效数据成本也普遍达到数十元。与此同时,工厂化的采集场景高度同质,居家、餐饮等长尾场景难以被标准化复刻,而众包与视频蒸馏数据又常常因为质量不可控,难以直接进入训练管线。灵灵智能团队把这套判断浓缩为一句话:谁能用更低的成本、更稳定的质量把人类行为转化为机器人可训练的数据,谁就握住了这条赛道的供给端定价权。
双轨三模式:把真实世界的行为转成可训练数据
针对这一缺口,灵灵智能给出的解法是“双轨三模式”。第一条轨道是无本体数据采集,让真人佩戴采集设备完成任务,数据规模可以随人数弹性扩张,成本远低于真机方案。这条轨道下又分两种模式:一种是与商业场景、当地院校合作建设的集中式基地,由受训示范员规模化采集,质量稳定,适合大批量标准数据集的交付;另一种是居家灵活用工的分布式网络,自然人在平台接包、在自家客厅与厨房完成采集,把千万个家庭变成数据的末梢节点。灵灵智能认为,后一种模式的价值在于覆盖工厂难以复刻的长尾场景——不同户型、家具与生活习惯带来的多样性,恰是模型泛化最需要的部分。
第二条轨道是真机遥操数据采集,由北京大学先进制造与机器人学院庞智博教授团队参与,让真实机器人本体执行任务示范,同步记录动作、力觉与环境等多模态信息。这类数据质量最高、可直接部署,主要面向本体厂商在特定场景下的精准需求。两条轨道组合起来,构成“低成本大规模+高质量精准”的完整供给。据团队介绍,其无本体采集硬件采用手持采集手柄搭配头胸视角相机与手部动作捕捉,所有传感器共用全局时钟做硬件级对齐,从源头保证多模态数据的同步性。
采集只是起点。灵灵智能自建了数据治理平台,覆盖数据预处理、空间重建、智能标注与质量评估四个环节:先做去噪、同步与帧对齐,剔除脏数据;再以自研的VIO位姿算法完成三维场景重建,据称可将这一环节的人工效率提升十倍以上;标注环节建立任务、原子动作与场景标签体系,采用AI辅助加人工复核;质检环节则从完整性、同步性、覆盖度等维度评估,低分数据自动打回,团队称一次通过率超过85%。经过这套管线,原始数据被加工成可直接进入主流训练框架的标准化数据集,并配套相应的合规报告。
更具长期想象空间的是“数据飞轮”。模型在执行任务时产生的失败案例会被自动回流,平台据此挖掘长尾场景,定向补充采集并更新数据集;同时,团队在庞智博教授带领下自研仿真环境,试图以Real2Sim2Real的方式对真实数据扩量,再经真机回验后进入管线。在灵灵智能的设想中,真实数据与仿真数据双向互喂,数据越用越便宜、越用越聪明,每一轮闭环可推动任务成功率提升5%至10%。
不造本体、不训模型,做具身智能的数据基础设施
在商业模式上,灵灵智能选择了一条相对中立的路线:不造机器人本体,不与下游客户竞争;不训练VLA基础模型,做模型公司的数据伙伴而非算法对手;也不绑定任何单一本体厂商。它的目标客户是需要训练数据的具身大脑公司与机器人本体厂商,交付形式包括标准化数据集、面向特定场景的定制采集服务,以及任务分包与数据管理平台。团队把自身定位为具身智能数据版图上的公共基础设施——无论哪条技术路线最终胜出,都需要从数据供给侧采购。
场景侧,灵灵智能已覆盖商业服务、餐饮服务、零售导购、居家家务、照护陪伴与工业协作等品类,累计覆盖100多个真实场景,并在全国多省取得商业服务与工业场景的采集授权,通过与当地院校共建实训基地形成可复制的产能网络。值得注意的是,团队并不认为产能本身构成壁垒。在他们看来,全国已有60多个数采基地停留在“场地—采集—简单标注—卖数据集”的同质化竞争里,大量原始数据无法进入训练管线,真正的分水岭在于精炼能力,以及能否把良率、可入库率做成对客户公开的硬指标。
支撑这套打法的,是“互联网大厂+连续创业+顶尖学术”的组合团队。创始人兼CEO霍燕锋曾就职于腾讯、创业黑马等互联网企业,具备互联网产品与商业化经验,现就读于北大光华EMBA;联合创始人、首席科学家庞智博是北京大学先进制造与机器人学院长聘教授,曾任ABB集团瑞典研究院资深主任科学家,研究方向覆盖多模态具身智能模型与机器人触觉感知;联合创始人、COO陈佳拥有十余年连续创业经历,负责公司日常运营与基地网络建设。
据了解,灵灵智能本轮为数千万元级天使轮融资,资金将按12至18个月的里程碑分两期到账,主要投向众包网络的设备铺量与节点运营、仿真环境与采集管线的研发,以及家用、商用、工业三类场景网络的拓展。公司下一阶段的目标,是对标数据采集赛道的头部节奏推进Pre-A轮。
在具身智能从技术演示走向规模落地的过程中,数据供给很可能长期是最稀缺、也最容易被低估的一环。灵灵智能押注的,正是这门“卖水”生意的确定性。