首页 > 资讯 > 闭源模型天花板要被开源模型捅破了?深度机智PhysBrain1.5,打通“理...

闭源模型天花板要被开源模型捅破了?深度机智PhysBrain1.5,打通“理...

甲子光年 2026-09-10 06:03 2 阅读 查看原文

深度机智自研架构,把“让模型理解世界并理解如何行动”这件事真正做扎实。


GPT-6的发布,把大语言模型的能力边界又一次推向了新的高度。


推理、编程与多模态理解的接连突破,让行业看到通用智能的演进仍在提速。不过,当模型能力在数字世界里被反复验证之后,一个更本质的问题随之浮现:一个足够理解世界的模型,究竟能不能在真实世界中行动?


Robocurve做过一组机械臂测试:在20次积木放碗任务中,GPT-6 Astra成功19 次,而Claude Fable 5.1在同一任务里只完成8次。


测试中,模型读取摄像头画面与机器人状态,给出末端的位置、姿态和夹爪指令,再根据新的视觉反馈持续调整动作。大语言模型对世界的理解,能够被转化为真实的物理行动。



大模型下一轮的价值扩张,正在越过屏幕。


但测试的另一面同样值得留意:在把蓝色圆形拼图块放进对应凹槽这类精细插入任务中,GPT-6 Astra的成功率降到了10%。大模型积累的通用理解能力,可以成为机器人适应任务的基础,但从“理解”到“执行”的鸿沟依然清晰:空间智能、具身理解与精细动作生成,仍是模型要在物理世界中行动就必须跨越的门槛。


而这,正是当前行业竞争的焦点。谁能补齐这些能力,谁就有机会把模型的能力边界延伸进工厂、实验室和日常生活。


深度机智正是在这个位置上交出了新答卷。它正式发布了物理基座模型 PhysBrain 1.5:在28项具身空间智能与规划基准上,其8B版本取得72.5的综合得分,在参与评测的开源模型中综合排名第一,整体表现已媲美GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)等头部闭源系统。



这一次,一家成立才一年多的中国公司,正用一套自研架构,把空间理解、动作生成、未来状态预测等多维能力收进同一个基座模型,把“让模型理解世界、并理解如何行动”这件事真正做扎实。




1.把“理解、动作、预测”收敛进一个闭环


在讨论模型之前,需要先厘清物理智能到底在解决什么。深度机智将其概括为Physical Loop一个“观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步”的物理智能循环。


真正的物理智能,不是单点能力,而是这个闭环能够连续、稳定地运转,并据反馈自我修正。但在今天,构成这一循环的能力大多分散在语义理解、空间感知、物体识别、动态生成等彼此割裂的专用模型中,缺少统一的世界表征行动目标与反馈机制Physical Loop也难以运转。


深度机智的判断是:要做出能“在世界中行动并自我修正”的底座,必须先回到这个闭环本身,把能力重新组织起来。PhysBrain 1.5,是围绕这一闭环重建模型本身。



该模型以Qwen3-VL-8B-Instruct为基座,扩展出专用的动作token与视觉状态token,把语言回答、结构化空间输出、末端执行器轨迹,以及未来的RGB、深度与机器人占用预测,全部表达为离散token,在单一自回归主干、单一next-token预测目标下联合训练,不引入任何任务专属头。这意味着,理解、动作生成与未来状态预测不再由多个模型拼接,而是在同一个物理循环中共同训练、彼此对齐构成了能力扎实、边界清晰的一体化物理智能底座。


在这套统一架构之下,PhysBrain 1.5的能力可沿Physical Loop拆成三个相互咬合的环节。其一是具身理解:模型通过基础VLM接口、辅以具身监督,覆盖五类能力——基础视觉空间感知3D与多视角空间理解具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理。换言之,它不只是“看懂”画面,而是带着空间结构与物理常识去理解场景。



其二是动作预测:给定任务指令、当前视觉观测,以及可选的近期动作历史,模型直接输出下一拍末端执行器的动作块,表达为一段ActionPiece token序列;单臂、左腕、右腕共用同一套词表与码本,意味着一份通用模型权重即可驱动不同形态的机器人。这正是“理解”能够落地为“行动”的关键一跃。



其三是未来状态预测:在给定当前观测与任务指令后,模型预测约一秒后的世界状态,并以RGB图像、度量深度图与机器人占用掩码三种模态联合给出。这种“先想象结果、再采取行动”的能力,让模型在闭环中拥有了前瞻与纠错的依据动作尚未执行,它已能预判环境将如何变化。



这种“一个token接口贯通物理循环”的架构选择,比单纯堆高某项分数更能说明问题:它指向的,是一个可“感知—决策—行动—反馈”连续运转、并能据反馈自我修正的物理智能基座模型。




2.人类完整经验,是物理智能循环的来源


闭环要能运转,第一步是“有经验可学”。模型在Physical Loop中观察、决策、行动、反馈,其能力上限,终究由它所消化的物理经验的质量与完整性决定。而人类经验天然地嵌入这一循环中。人在真实世界中持续感知环境、理解情境、形成意图、采取行动,并根据环境反馈修正自己的判断与行为。人类的智能,正是在无数次Physical Loop中生长出来的。在深度机智的路线里,人类经验是物理智能循环的第一性来源。


为此,深度机智构建了Ego360全景数采体系,尽可能完整地保留人类行动过程中的环境、身体、手部交互与注视这意味着模型学到的是一段连续、完整的“人经验”,而非被割裂的局部这正是“完整经验”之于物理智能循环的关键价值。只有保留了行动前后的因果链条,模型才能真正理解“为什么这么做”和“做完之后发生了什么”,而非仅仅记住“怎么做”。



当模型理解了因果关系,空间关系、操作方法与纠错经验就能在不同任务间迁移复用。人类经验的长期价值,正是在于它能沉淀出可复用的能力。当前,这套体系正以每月万小时级的速度持续新增,不断为物理智能注入丰富的训练资源。


让数据真正转化为模型能力,还需要打通从“看到”到“做到”的关键一环。PhysBrain 1.5引入的ActionPiece机制,正是解决这一问题的核心组件。它让模型能够同时学习“该怎样行动”和“行动之后可能发生什么”,即同时建模动作生成与状态预测。在团队内部实验中,PhysBrain 1.5的动作预测能力实现了从24%到54%的翻倍提升。




3. 72.5分拿下开源第一,媲美顶尖闭源


PhysBrain 1.5本轮评测覆盖基础视空感知、空间与多视角理解、具身认知推理、空间指向与可供性、视觉轨迹推理五类能力,共28项基准。


结果上,PhysBrain 1.5-8B以72.5的综合均分拿下开源模型榜首,并在28项中的14项取得开源最佳10项位列开源模型第二;相较最强开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分,较RynnBrain 1.1(63.1)高出9.4分。更受关注的是其整体水位:72.5与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到1分以内。在具身智能的核心能力上,深度机智正与全球最前沿的闭源系统站在同一水位线上竞争。



深度机智同时开放了PhysBrain 1.5 2B与8B两个参数规模的权重上线Hugging Face,为社区验证与下游部署提供入口https://huggingface.co/collections/DeepCybo/physbrain-15)




4.Human-as-Humanoid:

人类经验驱动真机行动,闭环落到执行


如果说Ego360解决了“人类经验从哪来”,PhysBrian1.5实现了“人类经验如何转化为模型能力”,Human-as-Humanoid则回答了“人类经验如何转化为真机行动”。其研究证明,同步采集的第一、第三视角人类视频,可直接转化为适配PrimeU的动作训练数据;原始示范吞吐量达到遥操作的4.8—7.2倍,部分任务无需目标任务机器人示范,即实现从人类数据到真机执行的零样本迁移。



这一步的意义,在于把“模型能力”真正接到了“真机执行”上:人类经验不再只是训练素材,而是能直接驱动机器人完成真实操作的动作来源。从人类经验、到模型建模、再到真机落地,深度机智由此跑通了从模型能力到真机执行的全栈链路


它也反向验证了Ego360与PhysBrain 1.5所代表的“人类学习”路线,不只是一套训练数据或一次基准高分,而是能在真实世界里闭环运转的完整系统。这正是“全栈布局”之于深度机智最具体的价值:大脑与身体、数据与本体,被组织在同一条主线上。




5.提前一年的路线定力,与正在重排的牌桌


全球范围内,物理基础模型的投入正在加速:Google DeepMind的Gemini Robotics、Physical Intelligence的π系列、Figure等,分别在具身推理、人类工作视频数据、少样本适应等方向上持续加码。一个明显的趋势是,国外头部企业正在殊途同归物理经验数据、空间与交互能力、基础模型训练,正成为全球持续投入的共同焦点。


如果把视线拉回一年前,深度机智早以将这些焦点写入了长期发展路线图中。2025年10月10日,深度机智发布《源于人,超越人》技术路线图,明确把“人类学习”作为物理通用智能的核心研发路径围绕“以人类数据为起点”,“以动作为中心建模”,“身体为AI设计”的三大战略开展物理智能全栈布局。


在这套全栈布局中,Ego360持续积累的人类经验数据,PhysBrain基座模型以此不断探索能力边界,Prime系列本体则承担真实交互中的验证与反馈。人类数据基建、模型能力研发与本体闭环验证三环协同推进,在物理智能的每一阶段都进行系统性的技术积累与持续突破,持续收窄从“人类经验”到“机器能力”的转化路径。


深度机智用一个相对早期的起点,跑通了“数据—模型—本体”的全栈链路,并在今天交出了模型层面的可量化成绩。当行业对物理AI的认同迅速升温,真正稀缺的仍是长期一致的技术判断与跨环节的执行能力;深度机智过去一年围绕人类经验数据、物理智能建模与机器人验证所做的积累,正在转化为一种先发即难追的身位。


物理智能的终局,不是一个会回答的模型,而是一个能在真实世界里感知、行动并不断自我修正的闭环。PhysBrain 1.5未必是这条路的终局,但它清晰地标志着:在中国物理AI基础模型的竞争中,一家成立仅一年多的公司,已经凭借人类学习路线与全栈布局,走到了全球竞争的第一梯队。对行业而言,这是一个值得持续跟踪的潜力股

(封面图来源:深度机智)



END.