现在的全模态AI已经能够同时处理图像、视频、声音和文本,并完成越来越复杂的推理任务。在现有评测体系中,评测基准主要关注模型“最终做对了什么”,模型通常只需要给出最终答案即可被记为一次成功推理。但此类评价方式很难回答一个更关键的问题:模型究竟有没有准确感知到支撑推理的关键信息?
近日,飞捷科思(Fysics AI)与复旦大学认知与智能技术实验室(CITLab,原智能感知与无人系统实验室)联合推出了全球首个面向全模态世界感知和物理状态推理的评测基准FysicsReason,并构建了一套以World State Variables(WSV,世界状态变量)为核心的评测框架。通过将复杂推理拆解为“世界状态感知”和“后续推理”两个阶段,FysicsReason能够分别评估模型看到了什么、听到了什么、提取了什么关键信息,以及最终如何基于这些信息完成推理。
从“验证最终答案”走向“验证推理过程”
真实世界中的复杂问题通常需要经历多个步骤:人首先要理解问题需要什么信息,再从图像、视频、声音等观测中提取相关内容,随后结合逻辑关系或物理规律完成计算和判断。
FysicsReason 将这一过程中关键的中间信息定义为世界状态变量(WSV),包括问题中的目标概念、目标物体的空间位置、关键事件发生的时间区间、物体材料,以及密度、温度等物理参数。模型在回答最终问题之前,需要先预测对应的世界状态变量,评测系统因此可以直接检查这些关键中间环节,并进一步分析模型的错误来源。
世界状态感知:连接视听信息与多层推理的关键桥梁
FysicsReason 的四大核心亮点
01引入世界状态变量,让推理过程“看得见”
传统多模态基准往往围绕最终答案进行评分。FysicsReason在最终结果之外增加了中间世界状态评价。
对于同一个问题,模型需要同时给出世界状态预测结果和最终推理结果。例如,在空间推理问题中,需要先确定目标物体的边界框;在视频事件推理中,需要先定位关键事件发生的时间段;在物理问题中,则可能需要先判断材料或估计具体的物理参数。模型可能已经找到了正确证据,但后续逻辑计算出现问题;也可能最终答案正确,中间定位结果却并不准确。FysicsReason提供了更细粒度的模型诊断能力,通过这种设计可以更清楚地区分不同类型的模型失误。
02五类推理任务,覆盖定位、感知与物理计算
围绕不同类型的世界状态变量,FysicsReason设计了五类任务,形成了从基础信息感知、时空定位,到物理属性理解和数值计算的完整能力链:
符号逻辑推理要求模型先识别问题真正需要求解的目标量,再结合视觉信息完成数学与符号逻辑推理;
空间定位推理要求模型根据声音和问题描述找到图像中的对应目标,并输出其空间位置后完成回答;
时间定位推理要求模型从连续视频中定位特定视听事件发生的时间区间,并据此进行推理;
物理感知推理要求模型结合图像和声音分析物体材料及脆性、硬度等物理属性,判断其可能产生的物理行为;
真实世界物理计算推理进一步从视频中的物理过程提取密度、温度等参数,并结合问题条件和物理规律完成定量计算,部分任务还要求解释观察到的物理现象。
FysicsReason涉及的五类世界状态推理任务
03高质量全模态数据构建与严格筛选机制
FysicsReason最终包含2,328条高质量问答样本,其中包括1,691组图像—音频样本和637段音视频样本。整个基准覆盖3类核心能力、5类世界状态变量和10项细粒度能力,并进一步涵盖13类数学问题、51个推理子领域、67类视听事件、14类物理现象、56类物理属性和24类材料。数据同时支持文本问题和语音问题,可用于评测模型在不同输入形式下的全模态理解与推理能力。
在数据构建过程中,原始样本会被统一重构为“世界状态感知—推理”形式,并补充中间变量标注、参考计算过程和相关辅助信息。随后通过自动筛选与人工审核进行多阶段质量控制,重点检查多模态信息与问题的一致性、世界状态变量与推理任务的相关性、答案正确性以及物理计算合理性。
FysicsReason能力体系与数据构建流程
04同时评价“世界状态”和“最终答案”
FysicsReason采用世界状态得分与最终推理得分共同构成综合评价结果,其核心指标为:
针对不同类型的世界状态,FysicsReason采用相应的评价方式:空间位置使用边界框IoU,时间位置使用时间区间IoU,材料和物理属性通过匹配得分与F1进行计算,连续物理参数则采用基于标注区间和相对误差的连续评分方式。
这一评分体系可以同时反映模型的感知能力与推理能力。较高的综合得分意味着模型需要在中间证据提取和最终问题求解两个环节都保持较好的表现。
最终答对,并不代表每一步都准确
FysicsReason对多种主流开源和闭源全模态模型进行了系统评测。结果表明,当前模型在最终问题回答与中间世界状态感知之间仍存在明显差距,最优模型的综合得分仅为51.8%。从不同能力维度来看,模型在目标识别和部分物理信息提取方面表现相对较好,但在空间定位、尤其是精细时间定位上仍明显不足。这说明现有全模态模型已经具备一定的语义理解与物理感知能力,但在长视频和复杂视听场景中,准确定位支撑推理的关键时空证据仍是主要瓶颈。
两类典型问题:证据错误与推理错误
FysicsReason的细粒度评价进一步揭示了两类具有代表性的失败模式:
第一类是最终答案正确,但中间世界状态预测并不准确。例如,在时间定位任务中,部分模型能够正确回答问题,却无法精准定位关键事件在视频中的发生时间,说明模型可能理解了视频的大致内容,但未能准确捕获与问题最相关的局部证据。
第二类是世界状态预测正确,但后续推理结果出现错误。例如,模型可能准确判断材料、温度或其他物理属性,但在公式使用、变量组合或数值计算过程中出错。这表明感知能力与推理能力具有不同的误差来源,而FysicsReason通过分别评价两者,能够进一步定位模型出现问题的具体环节,为后续优化提供更明确的方向。
感知—推理解耦的典型失败模式
项目主页:
https://github.com/Fysics-AI/FysicsReason
项目数据集:
https://huggingface.co/datasets/Fysics-AI/FysicsReason
为下一代全模态推理建立一套“可验证考卷”
随着全模态模型进入更复杂的现实世界任务,仅依靠最终答案已难以完整反映模型能力。FysicsReason通过世界状态变量显式拆分感知与推理过程,并围绕目标、空间、时间、材料和物理参数建立统一的可验证评测体系,使评测能够进一步定位模型在现实世界信息获取和后续推理中的具体错误。这种从最终答案走向中间世界状态验证的方式,为全模态模型能力分析、物理推理评测和强化学习训练提供了更细粒度的基础,并推动模型从“会回答问题”走向“能够稳定感知并推理真实世界”。
作为专注于物理AI核心技术研发的科技创新企业,飞捷科思希望通过逐步开放其自主研发生态技术体系中的重要模块,推动物理感知、重建、仿真和决策之间形成更完整的技术链条,为机器人、数字孪生、自动驾驶和智能制造等各领域提供开放、可信的物理智能基础设施。面向未来,飞捷科思将继续坚持关键技术自主创新,持续完善以自研Fysics可微分物理引擎、Fysiverse物理世界模型、OmniFysics全模态物理AI基础模型等为核心的物理 AI 基础支撑底座,深度聚焦具身智能与物理 AI产业化落地,推动具身智能与机器人在真实物理世界中的感知、推理与执行能力跃升,为产业上下游合作伙伴持续贡献物理AI核心技术与中国方案。