AMD 收购 World Labs 的消息一出,立刻在 AI 圈引发震动。
9 月 28 日,AMD 宣布以全股票方式、约 82 亿美元的对价收购 World Labs。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。
交易公布前几周,World Labs 刚刚发布新一代空间世界模型 Atlas。与此前的视频生成模型不同,Atlas 从零开始训练,把文本、图像、视频、相机位姿和 3D 深度放进统一的空间上下文,重点解决新视角预测,并延伸到三维重建和时空模拟。
在中国,有一家公司比 Atlas 早两年走上这条路。
影身智能成立于 2024 年,创始人兼 CEO 闵伟是清华大学工学博士,曾任阿里巴巴本地生活机器人团队负责人。
该公司从成立之初就选择原生 4D 路线,从多视角采集和动态重建做起,进一步训练 4D 世界模型,再把模型部署进机器人和真实工厂。今年 4 月,影身智能已实现用 4 到 6 台消费级摄像头、单块消费级 GPU 实时生成 4D 数据;9 月,在中国国际服贸会上展示了 6 台摄像头支撑的 4D 直播方案。Atlas 发布时,影身智能已经在福建晋江的制鞋工厂里跑起了机器人,拿到了 2 亿元超级订单,排产机器人达数千台。
在闵伟看来,AMD 看到的不只是一家技术公司,更是一个重建生态的机会。
「AMD 作为芯片公司,要撼动英伟达的地位,必须拥抱下一代基座模型。大语言模型时代的生态已经相对成熟,继续沿着旧路径追赶,窗口越来越窄。4D 世界模型提供了一条新的技术路线、新的基座和新的数据,可能带来一套新的算力生态。」
他把这笔交易看作 4D 世界模型从前期探索进入规模化商业落地的转折点。
空间智能需要新的底座
过去几年,AI 在语言、图像和视频领域取得惊人进展,但当它需要真正进入现实世界,驱动机器人操作柔性材料、理解复杂的物理交互时,局限就会暴露出来。
模型可以识别画面中的物体,却未必知道物体为什么这样运动;它可以预测下一帧像素,却无法保证这种变化符合真实的物理规律。
问题与数据表征有关。
现实物理世界是四维的,由三维空间加上时间构成,而大语言模型处理的是文字,视频模型处理的是一帧帧二维像素,两者都是对物理世界的降维投影。一旦进行了投影,空间结构、遮挡关系、物体接触过程、柔性形变等信息,就不可避免地被压缩乃至丢失。
闵伟以风为例解释这种差异。「在二维像素中,风很难直接呈现,因为它没有明显颜色,但在 4D 时空里,风可以被理解为一组具有位置、体积和运动状态的物质。」
4D 高斯数据通过大量带有位置、尺度、方向、透明度和外观特征的高斯基元,描述物体在空间中的分布,以及这些状态如何随时间变化。这些高斯基元可以理解为带方向、可拉伸的椭球形「小光斑」,具备空间分布属性,也能够直接参与场景渲染。
相比只能还原空间结构的静态 3D 模型,4D 数据进一步记录物体的运动轨迹、遮挡关系、接触过程和形变状态,为机器人的定位、路径规划和动作调整提供更丰富的依据。
目前,行业大致形成了四类技术思路:
一是基于大语言模型向上延伸,在语义空间理解物理世界,但语言本身是高度抽象的符号,幻觉问题和时空连续性问题难以根治。
二是基于视频生成模型,维度有所提升,但仍无法从根本上解决二维像素的局限。
三是在隐空间做推理,试图去除冗余特征实现更好的因果建模,但隐空间特征难以监督,不确定是否真正与物理世界对齐。
第四条路线,就是李飞飞的 Atlas 和影身智能在做的原生 4D 世界模型,让隐空间的特征尽量与真实的四维时空对齐,再在此基础上做理解、生成与预测。
影身智能选择这条路线,是从第一性原理出发的直觉。「物理世界就是 4D 的,要做世界模型,一定要建模四维时空。」闵伟说。
2024 年,行业主流还在 VLA、真机数据和视频模型上使力,全国建设大量数据采集中心,公司们疯狂堆真机数据,相信 Scaling Law 会在具身智能领域再次奏效。4D 路线需要更复杂的采集设备、更高的计算成本,也因此长期面临外部质疑。「当时外部看不懂,整个行业觉得 VLA 是主流,代表未来。」
如今,行业的判断正在转向。Atlas 的发布是一次高调的背书,字节跳动也被报道正在开发面向实时空间视频生成的 AI 模型。4D 逐渐从少数团队的技术选择,变成一条受到持续关注的产业路线。
影身智能如何构建 4D 世界模型?
影身智能的技术路线包含 4D 数据加工、世界模型训练,以及让模型进入真实业务并回收执行结果三个环节,由此形成数据飞轮。
多视角视频仍然是数据入口。视频经过空间对齐、动态重建和信息补全后,先转换为随时间变化的 4D 状态,再用于模型训练。视频负责记录现实场景,4D 数据负责承载其中的空间和时间关系。
这套系统的产品形态是「影身 360」。它通过环绕布置的家用级 RGB 摄像头和消费级 GPU,从稀疏视角实时生成 4D 数据。行业早期获取 4D 数据通常需要约 80 台摄像头,处理几分钟素材就要消耗大量算力。影身智能先把输入减少到十几台摄像头,随后进一步降至 4 至 6 台,并尝试用单块消费级 GPU 实时完成生成。
闵伟把这个过程称为「数据冶炼」。
普通数据采集主要增加原始视频数量。数据冶炼则需要提升单条数据的物理信息密度。除了动作轨迹,4D 数据还要恢复物体的位置、几何结构、遮挡关系、接触过程和形变状态。
目前,影身智能的 4D 数据集已达万小时量级,且仍在持续增长。
这些数据进入世界模型后,模型学习的内容不再局限于下一帧画面,还包括空间状态如何延续、遮挡后的物体是否仍然存在、碰撞如何发生,以及动作介入后环境将如何变化。未来,触觉、力觉等传感器信息也可以接入同一套时空表征。
这套表征还能帮助模型减少对无关信息的依赖,以抓取任务为例,背景、灯光、桌面纹理和物体文字,很多时候都不决定动作结果,4D 空间把物体的位置和运动关系表达得更清楚,有机会用更少数据获得更稳定的泛化能力。
在完整流程中,稀疏多视角视频首先进入数据引擎,生成 4D 状态;4D 数据再进入基础模型,形成统一的时空表征;经过任务适配后,模型可以生成机器人动作、新视角画面、未来状态和 3D 点云。机器人执行结果随后回流数据体系,继续用于训练和优化。
两条业务线验证价值
4D 世界模型是影身智能的技术底座,物理具身和数字文娱则是两条主要业务线。
其中,制鞋是物理具身方向的首个落地产业;4D 直播和 4D 游戏,则是数字文娱方向当前重点开拓的应用。
两条业务线使用同一套多视角采集、4D 重建和时空生成能力,但承担的任务不同:工业机器人负责验证模型能否理解并改变真实物体,数字内容则负责扩大应用场景和数据入口。
制鞋:先在柔性制造中验证物理具身
影身智能选择制鞋作为早期落地场景,和任务本身的复杂度有关。
瓶装水、固定工件等场景位置稳定、动作规则清晰,传统编程或基础 VLA 模型已经能够处理部分问题。但鞋面、鞋底和布料等柔性物体,会发生形变,产品款式、尺码和材料也持续变化,要求加工模式更加灵活,传统仿真很难完整还原柔性物体的状态、实现柔性生产。
以穿鞋带为例。鞋孔可能被鞋面或机械臂暂时遮挡,在二维画面中,目标可能短暂消失。连续的 4D 状态可以保留它在空间中的位置,让机器人判断目标只是被遮挡,并根据鞋体姿态调整轨迹。
布料抓取也类似,真正决定动作的往往是褶皱和形变,表面纹理很难单独提供完整依据,而 4D 世界模型恰好在柔性物体形变规律的判断上具备二维视频模型所不具备的优势。基于此,影身智能选择制鞋产业作为 4D 世界模型落地应用的首个行业。
数字文娱:扩大 4D 数据入口
在物理具身之外,影身智能以 4D 世界模型为基座,将数字文娱作为另一个业务板块,涵盖 4D 直播、4D 游戏等场景。
在今年 9 月举办的中国国际服务贸易交易会上,影身智能就曾展示其基于 6 台摄像头实现的 4D 直播方案,摄像头采集现场画面后,模型自动补全未覆盖区域,观众得以从全新视角观看动态场景。
直播、演唱会、互动影游和社交媒体,都可以复用多视角采集、空间重建和实时生成能力。对影身智能而言,这些价值不只在于内容呈现,主播、工作室和创作者也可以成为 4D 数据生产者,内容工具降低采集门槛,真实场景提供更多动作、人物和空间状态。
工业机器人负责验证模型能否理解并改变物理世界,数字内容则扩大数据来源。两类业务共享同一套底层能力,最终汇入同一个数据闭环。
下一代基座,正在加速成型
2024 年,原生 4D 世界模型还是一条需要解释的路线。两年后,AMD 收购 World Labs,把空间智能推到了芯片、模型和产业资本共同关注的焦点。
而在这场竞赛里,影身智能已经有了两年的先发积累。
影身智能要证明的,也不只是模型能否生成一个新视角,它需要让 4D 数据持续进入模型,让模型持续进入机器人和真实业务,再让真实业务反过来产生更多数据。只有这条链路能够稳定运转,4D 才可能成为真正的基础设施。
闵伟的判断是,「原生 4D 模型将成为与大语言模型、视频生成模型并列的下一代基座」,接下来就看这条路线能否在更多工厂、更多机器人和更多真实世界里跑通。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com