9月10日消息,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。该模型面向空间智能与具身智能,将物理、几何和外观三类三维世界状态纳入统一框架,并支持相机物理信息理解、自由视点空间仿真、三维世界生成与重建以及闭环探索等任务。
据了解,Puffin-World将相机绝对朝向和重力场信息作为物理状态,以深度信息表示场景三维结构,并以RGB图像表示外观状态。模型通过Omni-Camera相机表示,将重力锚定的绝对相机信息与相对几何结合,在连续旋转和长轨迹移动过程中保持物理方向及空间结构一致。同时,模型可在生成RGB画面的同时预测深度信息,用于后续三维重建。
具体来看,Puffin-World可在一个模型中完成四类任务:从单张图像预测相机横滚角、俯仰角和垂直视场角;根据指定相机方向和视场角生成对应画面;从文字、单张或少量参考图像出发,沿指定轨迹生成多个视角并重建三维世界;以及根据当前相机姿态预测修正动作和执行后的观察结果,形成“状态感知—动作预测—结果生成—再次校准”的闭环。
数据方面,团队同步开放Puffin-16M数据集,包括1500万组视觉—语言—相机三元组,以及100万条覆盖俯仰、横滚、偏航、复合运动和360度环视等情况的旋转轨迹。此外,团队还为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图像。
评测方面,Puffin-World在四项Benchmark中取得SOTA成绩。其中,在Stanford2D3D测试中,横滚角、俯仰角和垂直视场角中位误差分别为0.29度、0.53度和1.62度;在Puffin-Cam-Bench上,上方向、纬度和重力方向中位误差分别为0.84度、1.26度和0.79度,FID为75.93。
在Puffin-Traj-Bench上,模型取得18.00的PSNR、0.613的SSIM和0.288的LPIPS;在RealEstate10K三维世界生成测试中,PSNR、SSIM和LPIPS分别为17.22、0.595和0.318。
目前,Puffin-World已同步开放代码、模型及相关数据集,可用于机器人仿真、合成数据生产、三维内容生成及具身智能训练等场景。(葛嘉淼)