首页 > 资讯 > GPT拆掉了「具身大脑」,Embodied PhyStack会是具身智能的下一站吗?

GPT拆掉了「具身大脑」,Embodied PhyStack会是具身智能的下一站吗?

36氪文章 2026-09-29 21:31 4 阅读 查看原文

过去两年,具身智能尤为性感的故事之一,就是“大脑”。

在海外,从Physical Intelligence的π系列,到Figure的Helix,再到Google DeepMind的Gemini Robotics,全球极受关注的一批具身大脑模型,都在尝试把视觉、语言和动作放进同一个学习框架。

国内创业公司也沿着这一方向涌入,根据IT桔子数据,2026年上半年,国内具身智能赛道融资322笔、总额935亿元,较2025年同期增长5倍,其中超过一半的资金涌向VLA模型、世界模型和数据基础设施,“大脑-小脑-本体”成为主流技术路径。

但这条路走了两年,行业发现,“大脑”依然是那块极为难啃的骨头。然而,2026年9月3日,GPT-6 Astra发布,给具身智能的发展带来新的变量。

OpenAI对它的官方定位依然是通用模型,没有直接提及机器人。但当研究员将GPT-6 Astra接入人形机器人后,瞬间引爆了具身智能产业。在9月12日GitHub上的评测报告《GPT-6 Astra as an Embodied Policy》中,GPT-6 Astra以碾压性的比分超越,“空降”RoboDojo榜一。

《GPT-6 Astra as an Embodied Policy》中GPT-6 Astra在十项机器人测试中断层第一

通用大模型,真要杀回具身智能“主桌”了?

1.通用大模型,杀回“主桌”

想要真正理解这次GPT-6 Astra对整个具身智能产业冲击的力度,首先得理解两个基础问题:具身智能究竟想解决什么?以及,为什么这事很难?

具身智能的终极目标始终是无人化作业,也就是让机器人实现“自治”。而让机器人动起来,只是这条路线的起点。

过去十几年里,整个机器人产业进展最快的是“身体”和“控制”。机械臂解决了确定性环境下的重复作业,轮式底盘把作业半径从工位扩展到了整个车间……本体形态的丰富,让机器人能到达的场景变多了;而控制能力的提升,则让机器人在这些场景里真正把活干稳。两者叠加,机器人的自治边界才被一步步拓宽。

但轮式底盘和机械臂的自治边界是有上限的——它们依赖相对结构化的环境。在诸多本体形态中,双足人形机器人更有机会逼近更完整、更广泛的自治边界。因为人类环境本身就是按双足形态建造的,门把手、楼梯、工具、工位,都是为人设计的。行业意识到这一点后,人形机器人在本体上又持续迭代了很多年。

控制层也在同步演进。到了具身智能时代,强化学习和仿真训练推动了人形机器人的运动控制。走路、跑步、上下楼梯、摔倒后起身已经逐渐变成行业基础能力。灵巧手、电机、减速器和力传感器仍在进步,本体的可用性也在持续提升。

身体和控制这两层,正在逐步成熟。但真正难的地方,也随之暴露出来:认知和决策,即,如何让机器人在开放环境里自主判断该做什么、怎么做,或者说,让机器人“长脑子”。

国内清华系创企动易科技的双足人形机器人PHYBOT C2,可以看作一个典型的案例。

在2025年底,动易科技团队在全球范围内先一步实现了双足人形机器人与人自主对打羽毛球的能力;今年4月的广交会上,这台身高1.35米的双足人形机器人手持球拍与现场观众智能对打,正手、反手、挑球都能接住,全程不需要工程师介入。

(动易科技双足人形机器人与人自主对打羽毛球)

让双足人形机器人自主与人对打羽毛球,难点在于时间窗口极窄,球从对手球拍离开到抵达己方击球点通常不到一秒,机器人要在这段时间里完成观察、判断、跨步、引拍、击球的全链路,任何一环的延迟都会导致失败。而PHYBOT C2的成功证明了一件事:在几十毫秒量级的闭环里,具身智能已经可以凭端到端的感知决策模型,脱离遥控和预设,完成自主状态下的高动态实时交互。

但也要看到,打羽毛球相对是目标单一、规则封闭的任务,机器人不需要思考打完球之后该干什么。PHYBOT C2先撕开了人形机器人实时决策的口子,但具身智能的长程任务和多任务规划能力仍未突破;后者需要的,是能对物理世界建模的理解力,以及能读懂人类意图和逻辑顺序的理解力。

换句话说,想让机器人“长脑子”真的很难。

在大语言模型(LLM)爆发的早期,研究员们不是没想过把大语言模型平行移植到具身智能机器人身上,可惜效果实在欠佳。在专门考察长程家庭任务中规划级自治能力的Long Act基准测试中,GPT-5在HoloMind框架下的目标完成度为59%,完整任务成功率仅16%;Qwen3-VL-32B分别为51.2%、15%。而同组人类被试的成功率是93%。

LLM走不通,VLA、世界模型等路线逐渐成了产业的“香饽饽”。随之而来的,是大规模数据采集,更大的VLA模型、更大的世界模型,以及更强的模型形态。

值得注意的是,VLA出现的时间并不比LLM晚。2023年,谷歌RT-2将机器人动作编码成了文本Token,让模型像生成文字一样生成动作,奠定了VLA路线的基础。此后,在行业巨额融资冲击下,“具身大脑”成了最热话题。甚至有行业人士戏言“没有基座模型,都不好意思做机器人了”。

然而,钱砸进去之后,问题并没有消失。在今年7月的RoboDojo评测中,30个主流机器人Policy平均成功率仅为12.8%,官方评价为“大多还在山脚适应高反”。VLA的“相机-基座耦合”问题仍未得到解决,相机视角稍有变化,任务成功率便会急剧下跌。长程任务和多任务规划能力则更是困难。

在此之前,业内普遍的解法是——采数据,采更多的数据,用Scaling Law逼出具身智能产业的“智能涌现”时刻。

直到大模型开始展现新的可能。

2026年9月3日,OpenAI正式发布GPT-6 Astra,官方号称其“面向复杂推理、软件工程、计算机使用、科学研究与专业文档”,上下文窗口105万Tokens,最大输出12.8万Tokens,整篇发布报告里没有一个字提到具身智能。

在RoboDojo官方评测中,GPT-6 Astra一举在42项机器人任务、2100次测试中拿到22.48%的平均成功率和28.97分,排名高于彼时全部40个公开机器人策略,也高于原公开榜首DM0.5的19.34%和24.90分。

2.具身智能,变天了

一个此前被默认为“终局”的架构判断,开始松动。

过去几年,行业最常见的划分是“大脑—小脑—本体”:上层负责认知和决策,中间负责运动控制,身体负责执行。随着VLA和世界模型兴起,行业投入大量资源,试图让“大脑”包办一切:让它既能理解世界,又能拆解任务,还能直接指挥身体。

但GPT-6 Astra展示了一个新可能,通用大模型本身,就可以承担过去“大脑”中最难的那部分——深度思考。

动易科技团队认为,机器人公司不再需要自己造一个集中式的全能“大脑”。深度思考可以交给通用大模型,机器人公司需要补上的是浅层思考和实时决策这一层。未来的具身智能技术栈,也就可能从三层走向四层,自上而下分别是通用大模型、物理智能体PhyAgents、运动控制系统PhyCore与本体PHYBOT,动易科技将其命名为:Embodied PhyStack(具身智能技术栈)。

动易科技Embodied PhyStack示意图

第一层,通用大模型:视觉输入,做长程任务与多任务规划,通过深度思考,理解人类意图,拆分长程任务与多任务的任务序列,判断逻辑顺序,进而调用物理智能体PhyAgents的能力解决任务;同时,它作为云端大模型响应偏慢的问题,也交给PhyAgents来补全。

第二层,物理智能体:视觉输入,进行实时决策,以端到端VLA能力为核心,通过浅层思考,PhyAgents把大模型分配的子任务翻译成机器人能实时执行的指令。

第三层,运控模型:本体感知,实时控制,相当于人的“小脑”。PhyCore根据PhyAgents的任务指令,平衡身体、驱动机器人本体完成执行。

第四层,机器人本体:由PHYBOT身体负责执行,并基于现实环境和本体状态变化,定向反馈给上述三层,予以纠偏和重新规划并执行:步态与移动的平衡性控制问题,修正回流给PhyCore;针对环境变化反馈给PhyAgents,做出毫秒级的实时决策;整体执行节奏和能力边界的触达情况则回到第一层——身体在触碰边界时给出的信号,让通用大模型据此做一次重新规划。

Embodied PhyStack技术栈的意义,不只是多了一层。它把“具身大脑”从一家公司必须包揽的全部,拆成了通用大模型与机器人公司之间的分工协作:通用大模型负责它最擅长的深度思考与推理规划,机器人公司负责它最擅长的实时决策、物理闭环与稳定执行。对具身智能产业来说,这是一条更现实、也更经济的路线判断——不必再造一个“什么都自己干”的超级大脑,而是让专业的人干专业的事。

而提出这条路径的动易科技,用三组实验来验证。

3.动易科技的三组实验

第一组实验,用通用大模型作为大脑,与动易科技的PhyCore运控系统配合,驱动机器人执行长程任务。

这组实验中,通用大模型作为深度思考层,把端到端的VLA直接推到长程任务上,不针对特定任务重新微调模型,就拿到了足够高的完成度。在零件收纳的任务中,“通用大模型+PhyCore”的组合已经能够跑通完整的任务链路,无论在仿真环境还是真机验证,机器人都能够理解人类意图,结合现实环境状态,执行并完成长程任务和多任务。

比如,在安装电池的仿真环境中,机器人将失误行为直接反馈给通用大模型,利用大模型对人类意图的理解,进行思考,主动寻找安装位置,完成训练任务。

仿真环境中,机器人利用通用大模型完成安装电池训练

在真机任务的执行里,机器人会基于对语义和环境的深层次理解能力,对失误行为做出反馈,由通用大模型进行重新思考与规划,完成任务。在下方实验中,PHYBOT在抓取银色工件时出现两次失误,基于通用大模型对深层意图与环境的理解判断,在第三次成功完成任务。

上方为通用大模型推理过程,下方为真机完成工件抓取过程,已200倍速

第一组实验验证了大模型在长程任务上的可行性,但也暴露了一个问题:通用大模型做深度思考够用,做毫秒级实时决策太慢。在执行工件抓取的任务中,机器人用时约3个小时,这不利于机器人在更复杂的操作里,做出实时性的平衡控制。

这也带出了第二组实验。

该组实验要解决的,是用物理智能体PhyAgents毫秒级的实时决策能力,补齐通用大模型效率上的短板,更好地完成长程任务与多任务。

这组实验还原了酒店环境中的清洁用品收纳场景,考察机器人对物理世界理解与多任务的实时规划。具体流程分为两部分:

1.通用大模型收到任务需求后,基于意图和环境判断,做深度思考,拆分成多个子任务,给出任务序列,并调用PhyAgents端侧VLA的能力分配执行;

2.机器人收到子任务序列指令后,在PhyAgents的实时决策配合下逐一完成。这主要依赖于PhyAgnets通过端到端的VLA实时决策能力,评估环境与本体状态,浅层分析任务完成度,驱动PhyCore的运控指令,让机器人本体予以执行,直到任务全部完成。

Embodied PhyStack技术栈的真机实验效果,推理过程5倍速,真机操作原速

本组实验成果比第一组更为突出。通过通用大模型与物理智能体、运控模型、机器人本体的互相协同,机器人已经具备了深度思考与实时决策的能力,能够准确、及时地完成长程操作。效率上的对比更直观:同样是抓取任务,第二组抓取3个工件只用了不到2分钟。按单个工件平均耗时计算,对比第一组实验,第二组效率提升超过100倍。

第三组验证,指向新场景的训练效率。

前两组验证的是“通用大模型能不能做决策规划”,以及“如何配合通用大模型实现机器人的深度思考与实施决策”。第三组则把通用大模型的能力放到了机器人训练环节。工程师只输入任务需求,包括约束条件、训练目标,以及从仿真迁移到真机时需要注意的事项,通用大模型便可以进一步生成训练智能体,调用GPU训练机器人运动控制的神经网络,并在仿真环境中自动验证与迭代,最终将达标的训练结果部署到真机。

上方为通用大模型训练的智能体,下方为真机效果

这个实验带来的变化主要体现在训练效率上。按照动易科技团队的测试,此前训练一个智能体通常需要接近一周;接入通用大模型后,同类流程最快可以压缩到3小时左右。过去大量依赖算法工程师“手搓”,手工调试、反复验证的工作,开始逐步由通用大模型参与自动生成和迭代。通过联动通用大模型,机器人新场景训练的工作效率提升数十倍。

这三组实验通向同一个判断——通用大模型与具身智能的协作,正在把具身智能从单点能力突破推向系统级自治能力闭环。人类意图的理解、长程任务与多任务规划、逻辑顺序的把握,这些过去被认为必须由具身智能公司自己攻克的难题,开始通过分工协作来加速解决。对于产业来说,这意味着具身智能的落地节奏,可能比预想中更快。

从OpenAI的官方报告中我们也可以看到,GPT-6 Astra的视觉理解力既来自前期网络视频数据的积累,也来自多模态模型的基础能力,混合具身数据之后,两条线在物理世界任务上完成了汇合。互联网规模的预训练,先一步在机器人决策环节直接兑现成可测量的成功率。

而这,恰恰踩中了整个具身智能产业的痛点。

此前的具身大模型始终面对一个结构性难题:机器人拥有的数据规模,很难和互联网大模型处在同一个数量级。机器人动作数据却必须通过真机、遥操作、仿真或者人工示教获得,成本高出几个数量级,而且不同本体的数据分布并不完全兼容。更关键的是,机器人数据中极为丰富的信息往往集中在“怎么动”,而长程任务需要的世界知识和逻辑能力,却恰恰是互联网数据更擅长提供的东西。

这也解释了,动易科技Embodied PhyStack为什么要把通用大模型放在第一层:认知短板不必由具身智能公司自己去补齐,物理闭环、实时决策与稳定执行才是他们更该集中资源的地方。

4.我们正在见证一场价值迁移

通用大模型与具身智能的分工边界一旦打通,具身智能的整个产业格局也会随之变化。

首先是技术层面。如果这个趋势继续向前,未来的具身智能技术栈可能不会收敛成一个包办一切的“大脑”,而是重新将通用认知能力、物理智能、运动控制、本体操作等分别拆开,成为一套效率更高的协同系统。Embodied PhyStack正是这一判断下的具体路线:通用大模型负责深度思考,PhyAgents负责实时决策,PhyCore负责运控,PHYBOT负责执行与反馈。

业内遵循此类方案的玩家其实不少。比如谷歌DeepMind的Gemini Robotics-ER,从设计之初就只做推理不做动作,其处理视觉与空间理解、任务规划和成功检测,作为机器人的高层推理模型,通过原生调用Google Search、VLA或任意第三方函数来完成任务。Gemini Robotics 1.5所引入的“先思考再行动”机制,能够把长程任务的失败率从44.5%压到22%。

国内创企动易科技则用Embodied PhyStack,做了另外一件事,不是将通用大模型简单粗暴的嫁接到机器人本体上,而是把深度思考与实时决策拆开,通过四层协同完成工作目标。结果是在长程任务与多任务的规划上,执行效率比单层方案提升超过百倍。

第二个变化将是资源配置的转移。随着上层通用认知能力越来越容易获得,具身智能企业可以把更多资源放在物理智能、控制、本体和真实场景上,这些恰恰是互联网Scaling极难解决的问题。

过去,具身智能创业公司可能必须同时投入本体、数采、基础模型、VLA和控制。未来,所有企业都需要重新回答这三个问题:哪些能力可以直接站在通用模型之上?哪些能力必须依靠真实物理世界训练?哪些能力最终只能通过工程和场景积累解决?

如果通用大模型继续提高物理世界理解和推理能力,上述技术层面的“分层架构”可能成为具身智能产业一条更经济的路线,通用模型公司继续投入巨额算力和互联网规模数据,把认知能力向上推;具身智能企业则把有限的研发资源集中到通用模型难以从互联网获得的部分——如何让模型进入实时物理闭环,以及运动控制、本体和真实场景。

一旦世界知识、视觉理解和长程推理可以直接从通用模型API获得,具身智能真正稀缺的资产毫无疑问地将会重新聚焦物理世界,回归产品、回归场景。谁能把这些资源更快地压到真实任务、好的产品上,谁就更有机会建立起下一代具身智能公司的壁垒。

而第三个变化,可能也是最令人意想不到的变化,是Token产业生态的变化。

今天通用大模型最大的Token消费终端主要是人和数字Agent。机器人进入规模部署后,一台持续工作的机器人会不断产生视觉、语音、环境状态和任务历史,同时持续向上层模型请求判断。它每执行一次长程任务,就要把大量视觉帧、状态数据和历史轨迹灌进上层模型的上下文窗口,端侧只负责执行基础运动控制、导航与简单识别。长期来看,具身智能可能成为基础模型公司尤为重要的多模态推理消耗场景之一。

但Token消耗本身不是终点。真正值得关注的,是这些消耗背后,机器人在物理世界里到底完成了什么。

客观来说,GPT-6 Astra在RoboDojo的平均成功率只有22.48%,距离可靠自治还很远。其在精细操作、动态控制和双臂协同上同样存在短板,也说明物理智能拥有独立于语言智能的Scaling问题。截止至本文发稿前,已经有不少于3个新策略在RoboDojo上超越GPT-6 Astra,“空降”榜单前列。

具身智能离攻克“全自治”还有很远

然而,一个没有经过任何具身智能针对性调整训练的GPT-6 Astra尚能拿到如此惊人的好成绩,人们难以想象GPT-7、GPT-8将会是什么样的颠覆性成果,也同样难以想象国内大模型沿着自己的节奏继续迭代后,会给具身智能产业带来多大的变量。

随着通用模型“跨界”能力的提升,Embodied PhyStack这类分层架构也把一个更尖锐的问题摆在产业面前:如果世界认知、复杂推理和任务规划可以越来越多地由通用模型完成,具身智能企业真正的护城河是什么?

或者说,当通用大模型承担了第一层,具身智能公司究竟还应该自己造什么?

从Embodied PhyStack的四层分工看,答案可能是:物理交互数据、实时决策能力、全身控制、本体可靠性、系统可靠性、真实场景的工程闭环。这些正是通用大模型难以从互联网直接获得、必须由具身智能公司在物理世界里一层层补上的能力。

这也意味着,接下来真正值得投入的,不是再追一个更大的名词,而是那些看起来更笨、更慢、更不性感的事:训端侧模型、调实时控制、磨稳定本体、跑真实场景。资源应当向这些地方倾斜,资本也需要在这里沉淀下来。谁先把这些务实的事做成,谁才有资格谈下一代具身智能。

大模型负责思考,机器人公司负责身体——Embodied PhyStack这条分工路径,可能让整个具身智能产业,少走十年弯路。