首页 > 开源 > 飞捷科思全面开源Fysiverse-3D:以统一空间推理构建可执行3D世界

飞捷科思全面开源Fysiverse-3D:以统一空间推理构建可执行3D世界

OSChina资讯 2026-09-24 16:04 11 阅读 查看原文

近日,飞捷科思全面开源Fysiverse-3D。作为飞捷科思Fysiverse物理世界模型体系中面向三维世界构建的系列工作,Fysiverse-3D覆盖从一句话到一个可执行世界的完整链路:首先,可验证空间文生图方案SpatialGuard对自然语言中的空间意图进行显式规划,生成空间关系准确、可验证的视觉观测,为下游重建提供可靠输入;随后,统一空间推理模型Fysiverse-3D-Vision从图像中“看懂”场景,恢复保留独立对象、空间关系与功能信息的对象级三维表示;仿真就绪框架Fysiverse-3D-SimReady将重建结果转化为在物理引擎中放得对、站得稳、跑得起来的可执行世界。三者共享同一条空间显式化主线——让空间信息在每一环都以可读、可验证、可操作的形式存在,共同构成“一句话→一张图→一个可执行世界”的完整路径。

https://oscimg.oschina.net//AiCreationDetail/up-32b066ade24411efad3da85079519c6b.png

SpatialGuard:为世界重建提供可靠、正确的视觉观测来源

图像来源的空间可靠性,直接决定了重建世界的质量上限。SpatialGuard解耦与显式化作为核心思想,通过Layout Harness建立“规划-渲染-验证-修复”闭环流程,把文本中的空间意图转化为可检查、可修复的三维布局状态,确保交给Fysiverse-3D-Vision的每一张图像在空间关系上都严格正确,从而为 Fysiverse-3D的世界重建提供可靠的视觉观测来源,使得Fysiverse-3D相比以往关注语义忠实性的早期模型进一步实现稳定的组合关系、有效的多物体协调和可解释的中间状态

https://oscimg.oschina.net//AiCreationDetail/up-a51d26743ceaa0eea6bee98b31bc238d.png

SpatialGuard 系统架构图

Layout Harness 作为整个系统的“空间工作内存”,可在多物体、关系密集的复杂空间提示词下实现从“生成后筛选”到“生成中调控”的范式转变:先将提示词解析为物体列表与可检查的空间约束谓词,并初始化三维场景布局;再将布局渲染为深度图、法线图、语义掩码等控制图像,引导扩散模型生成;由视觉语言模型对生成结果做结构化评估,产出明确的验证报告,指出每项约束通过或失败;最后根据失败报告调用原子工具精确修改布局参数,进入下一轮迭代。空间约束在整个生成周期中始终保持为机器可读、可操作的状态。

https://oscimg.oschina.net//AiCreationDetail/up-213e01f6a28f9a45900d6d2d8732157c.png

SpatialGuard与不同方法在复杂空间提示词下的生成结果对比

SpatialGuard目前已被自然语言处理领域顶级会议EMNLP以长文的形式录用:

https://arxiv.org/pdf/2609.01582

Fysiverse-3D-Vision:为视觉生成提供对象级三维重建

单个物体外观逼真,并不意味着组合后的场景布局合理。Fysiverse-3D-Vision (F3V)将三维生成从孤立资产生成拓展到场景级空间组织,使对象级资产与全局布局协同建模。其目标不仅是恢复一幅具有真实感的三维画面,更是构建保留独立对象、空间关系和功能信息的场景表示,为后续物理仿真与具身交互提供基础。

https://oscimg.oschina.net//AiCreationDetail/up-c496908e39a15d0d9c2c3fe389c728ca.png

 

从单图观测到对象级三维场景,并扩展物理参数、材料、可供性与部件信息

Fysiverse-3D-Vision的核心设计,是将"生成什么样的物体"与"把物体放在哪里"分开处理:在资产生成路径方面,系统对目标区域进行裁剪、补全与正视化处理,再调用与任务适配的图像到三维模型,恢复物体的外观与几何;在空间布局路径方面,系统根据原始场景图像和目标掩码,独立预测平移、旋转与尺度,将生成的资产放回统一场景空间。由于布局不再绑定某一种资产生成器,系统能够灵活结合不同生成方法为资产补充纹理、物理属性或部件结构,并通过统一的空间变换接口组织这些对象,兼顾资产扩展性与场景一致性。

https://oscimg.oschina.net//AiCreationDetail/up-966de2d947f87ec19c472341884e6169.png

统一的视觉、语言与几何基础模型

https://oscimg.oschina.net//AiCreationDetail/up-e4673c4081bd7d90c83f455418d69015.png

 

几何与视觉指标定量对比结果

通过“建立共享表征 → 注入布局能力 → 优化空间合理性”的渐进式优化,Fysiverse-3D-Vision探索出一条由统一空间推理连接单图观测与可执行资产的技术路径,推动三维内容从“能够展示”进一步走向“能够编辑与交互”,使得不同类型的资产能够在同一场景中被合理组织和使用。对于场景编辑而言,独立对象与显式布局使资产能够分别调整和组织;对于物理仿真而言,布局与属性信息可为后续环境构建提供结构化输入;对于具身智能而言Fysiverse-3D-Vision将为连接视觉观测、对象操作和交互环境提供基础。

https://oscimg.oschina.net//AiCreationDetail/up-f7b567f30761bb2031a5f503ca5362a5.png

定性多种方法对比结果

代码仓库:

https://github.com/Fysics-AI/Fysiverse-3D-Vision

Hugging Face:

https://huggingface.co/Fysics-AI/Fysiverse-3D-Vision

Fysiverse-3D-SimReady:为仿真提供场景级“接地精修”

机器人训练、数字孪生与具身智能仿真,需要的从来不只是"看起来像"的三维资产。在物体几何恢复与空间布局由Fysiverse-3D-Vision承担后,Fysiverse-3D-SimReady(F3SR)在其输出基础上进一步完成场景级接地与仿真执行,为具身智能仿真提供场景级“接地精修”(grounded refinement):输出一个既能从原始视角渲染、又能由物理引擎直接推进的仿真就绪场景。通过以“重力一致初始化 → 输入视角对齐 → 场景图引导的接触修正 → 智能体目标条件仿真”为核心的四步闭环,使得每一处几何或物理修正都能追溯到图像中的对应观测区域。

 

https://oscimg.oschina.net//AiCreationDetail/up-4bdf8eb490eef5355a33f42a92163a8a.png

Fysiverse-3D-SimReady 总览

Fysiverse-3D-SimReady 在“外观优先”与“仿真就绪”之间进行了精确平衡,兼顾视觉一致性与物理稳定性。在单图场景重建的定量对比中,Fysiverse-3D-SimReady取得最高的 PSNR、最低的释放动能与被动漂移,并在该评测子集上消除了可测量的物体间穿透;相对 SAM3D释放动能降低超过四个数量级、五秒被动漂移降低超过两个数量级;SAM3D 的 mIoU 略高(0.74 对 0.71)。

 

https://oscimg.oschina.net//AiCreationDetail/up-0c00b94c5cf44f4abf331eb9ec4922f6.png
https://oscimg.oschina.net//AiCreationDetail/up-ae2b6923198aa1dec0cf2ed9bf9ee943.png

从原始视角渲染的碰撞、倾倒与落定

传统仿真环境依赖多视角扫描、人工建模、手工摆放与逐项碰撞调试,成本高、周期长,难以覆盖大规模、多样化的真实场景。Fysiverse-3D-SimReady把这一过程压缩为"单张图像 + 少量提示",让更普遍的二维观测成为三维仿真环境的起点。对具身智能而言,训练数据与仿真环境的规模、多样性性与真实性直接影响策略泛化——更低成本的 Real-to-Sim 管线能够帮助研究者更快构建场景、复现问题、生成任务并开展系统化评测。

项目主页:

https://fysics-ai.github.io/Fysiverse-3D-project-page/

开源代码:

https://github.com/Fysics-AI/Fysiverse-3D-SimReady

Fysiverse-3D 并不将单图场景生成视为一次性的"生成完成",而是将其设计为视觉、几何与物理约束共同驱动的逐级闭环:从识别物体、恢复几何,到组织空间,再到让场景在重力与碰撞下可运行、可验证并持续演进。研究者与开发者可基于开源代码复现流程,并在物体重建、布局恢复、接触修正、碰撞近似、物理稳定与机器人任务接口等环节进行扩展。

https://oscimg.oschina.net//AiCreationDetail/up-8d261b08196b5ce5bdf74f476ee08c87.png

智能体仿真规划

作为专注于物理AI核心技术研发的科技创新企业,飞捷科思希望通过逐步开放其自主研发的生态技术体系中的重要模块,推动物理感知、重建、仿真和决策之间形成更完整的技术链条,为机器人、数字孪生、自动驾驶和智能制造等各类应用场景提供开放、可信的物理智能基础设施。面向未来,飞捷科思将继续坚持关键技术自主创新,持续完善以自研Fysics可微分物理引擎、Fysiverse物理世界模型、OmniFysics全模态物理AI基础模型等为核心的物理AI基础支撑底座,深度聚焦具身智能与物理AI产业化落地,推动具身智能与机器人在真实物理世界中的感知、推理与执行能力跃升,为产业上下游合作伙伴持续贡献物理AI核心技术与中国方案。