首页 > 资讯 > 开源模型夯爆了!ZDTaichu5.O-9B,10B以内空间具身智能卷出通用类第一

开源模型夯爆了!ZDTaichu5.O-9B,10B以内空间具身智能卷出通用类第一

机器之心 2026-09-18 06:00 3 阅读 查看原文
图片
编辑|陈陈


紫东太初开源的这个通用多模态大模型 ZDTaichu5.0-9B,简直夯爆了!


虽然参数只有 9B,却在空间具身智能这条赛道上跑到了前列。


9 项国际权威空间理解基准中拿下 8 项同参数通用组别第一,在空间感知、跨视角三维推理、具身任务规划等指标上优于 Qwen3.5-9B、STEP3-VL-10B 等模型,即使加入 Gemini 3 Pro、Grok 4 等闭源模型,仍在 5 项基准上取得最高分。




不仅如此,该模型在图文理解、OCR、视觉数学、代码 以及 Agent 等通用多模态能力评测中,同样保持第一梯队


通用能力榜单


在 11 项 Agent、代码、指令遵循和数学推理测试中,也表现出比 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等同量级开源模型的优越性。尤其在 TAU2-Bench 和 IFEval 上,其成绩还略高于 Gemini 3 Pro。


AGENT 和文本榜单


Blog:

https://taichu-ai.github.io/ZDTaichu5.0-9B

Huggingface:

https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

Modelscope:

https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

Github:

https://github.com/Taichu-AI/ZDTaichu5.0-9B/


伴随模型开源的,紫东太初还公布了 ZDTaichu5.0-9B 背后的技术路线:自适应循环推理,该技术与大家猜测的前沿闭源模型 GPT‑6 Astra 使用的 Loop Transformer 技术采取类似的路线,展现出团队极高的技术前瞻性。



另外,紫东太初同步开放了一整套经过验证的数据生产管线详细方案,覆盖预训练、监督微调、高质量退火和 GRPO 强化学习等环节。


通用多模态模型进物理世界,卡在哪里?


这背后对应的是一个正在发生的变化:


过去几年,通用多模态大模型在数字世界的能力提升速度有目共睹,图文理解、复杂视觉问答、跨模态推理,这些任务的评测分数逐渐逼近饱和。


但物理世界是另一回事。


一个机器人面对操作台上的工件,需要同时完成:看清楚目标在哪(空间感知)、换了视角之后还能认出来并判断空间关系(跨视角三维推理)、给出一个不违反物理约束的操作方案(具身推理)。这些能力,在数字世界的多模态评测里几乎不会同时考到,但在物理现场,它们必须同时在线,缺任何一层,任务链条就会在某个节点断掉。


更麻烦的是,空间具身所需的三维关系标注、操作约束数据,和通用多模态的图文数据在分布上差异较大,两类数据混在一起训练,模型很容易在参数受限时顾此失彼。


再就是推理机制:空间推理任务内在地存在难度不均匀性,有的判断一步就能得出,有的(比如参照系变换、多物体相对关系推演)需要更深的迭代计算,但传统模型的算力分配是线性的,不管题目难不难,消耗的计算资源基本一致,这在参数有限的小模型上,是一个真实的瓶颈。


ZDTaichu5.0-9B 的解法是用一套完整的数据生产管线解决数据侧的问题,用自适应循环推理机制解决复杂推理以及算力分配的问题。


结果是,空间具身能力跃升,通用能力不降级。


具体结果如何?我们接着往下看。


10B 档位空间具身能力通用第一,通用多模态大模型迈向物理世界


ZDTaichu5.0-9B 的空间具身能力提升,首先体现在复杂空间理解任务上


给定一张图或一段视频,模型能不能精准定位目标物体的坐标?要求模型同时理解物体属性、空间排序、位置信息三个维度。


实测里,ZDTaichu5.0-9B 准确输出了归一化坐标并精准命中真值,而参与对比的同级开源模型全部定位错误,ZDTaichu5.0-9B 是唯一完成正确目标选择的模型。


寻找从左到右第二个银色盒子。


第二层:参照系转换。真实环境中的机器人,很少保持固定视角。机器人移动之后,摄像头位置变化,原本建立的空间关系也会发生变化。模型需要理解这种变化来自观察角度改变,而不是物体本身移动。


典型任务是要求模型先移动到某个参照物位置、转向面对另一个参照物,再判断第三个物体相对自身的方位。在示例中,ZDTaichu5.0-9B 给出了正确的方位判断。


三视角推理 —— 指令要求移动至绿框窗帘位置、面向蓝框沙发,判断红框柜子相对自身方位。


MindCube-tiny 这一榜单要求模型在脑中构建三维心智地图,完成复杂的物体关系推演。ZDTaichu5.0-9B 78.27 对 Qwen 的 57.6、STEP3 的 62.8,差距超过 15-20 个点。这个数字背后还有很重要的意义,因为 MindCube 本质上在测模型有没有真正建立三维空间表征,而不是在做简单的语义匹配。


ERQA 和 RoboSpatial 是具身交互理解的核心基准,测的除了物体在哪里,还有我能不能对它做操作以及该如何操作。放置任务要求模型判断可放区域:找到杯柄侧的空闲位置。ZDTaichu5.0-9B 输出坐标落在合理区域,Qwen 和 STEP3 输出坐标全部落在不符合要求区域。这个差距说明其他模型根本没有完成操作约束的空间推理,只是在做一个位置猜测。



把这几个维度连起来看,你会发现一条完整的能力链条:静态感知→动态定位→跨视角转换→三维推演→具身条件判断→交互决策。每一层都比上一层难一个数量级,而且缺任何一层,机器人在真实场景里都会在某个步骤失效。ZDTaichu5.0-9B 在这条链条上 8/9 拿到同参数通用组别第一,并且还不损失通用能力,表现出结构性领先。


另外,在真实物理环境中,机器人需要面对一连串相互依赖的任务流程。


这类长程任务要求模型需要持续记住目标对象、空间位置、已完成步骤以及当前任务进度,并根据新的环境反馈不断更新判断。


ZDTaichu5.0-9B 在美工刀收纳任务中,体现了这种持续状态理解能力。



那么,紫东太初究竟做对了什么,才能让一个 9B 模型在通用多模态能力上保持第一梯队,同时在空间具身任务中展现出同档位领先表现?


这背后,是模型推理机制与数据工程体系的共同作用。


自适应循环推理:把算力用在的问题上


先说推理机制,这是 ZDTaichu5.0-9B 和当前其他路线最核心的技术分岔点。


现在市面上处理复杂推理的主流方案有两种:一是思维链(CoT),让模型在输出层面多想几步;二是外部工具调用,遇到难问题调用外部计算模块。


但对于物理世界任务而言,这两种方式都有局限。


CoT 更适合数学、代码等符号推理任务,而机器人面对的是持续变化的三维环境,很多判断依赖视觉状态和空间关系,并不能简单拆解成线性的语言推理步骤。


工具调用虽然能够扩展模型能力,但会增加系统复杂度和执行延迟。在实时交互场景中,模型需要快速判断环境变化,并动态调整行动策略,而不是等待多轮外部调用。


这正是 ZDTaichu5.0-9B 自适应循环推理试图解决的问题。


该机制让模型自己判断这道题有没有把握:模型在完成一次标准前向计算后,会通过熵门控机制评估当前预测结果的不确定性,如果结果比较确定,直接输出,不额外消耗算力;但如果遇到空间变换、物体关系判别、操作条件校验这类高不确定性的判断节点,模型在内部循环执行层块计算,迭代优化隐层表征


整个过程发生在模型前向传播内部,不依赖外部工具调用,也不需要生成额外的思维链文本。这是它与当前行业主流的 CoT 延伸方案的核心区别:后者通过增加输出长度换取推理质量,前者在潜空间里直接处理。



这一技术路线,也与当前大模型推理架构探索的方向相呼应。以外界猜测 OpenAI GPT-6 Astra 探索的 Loop Transformer(循环 Transformer)为例,行业正在尝试将更复杂的推理过程放入模型潜空间内部,通过动态调节内部计算深度提升有效推理能力。虽然两者具体实现方式存在差异,但都指向一个趋势:让模型根据任务难度自主决定思考多少,以更高效的方式获得更深层次的推理能力。


当然,内部循环机制如果不加约束,存在越算越偏的风险。紫东太初在工程实现上配了三重稳定设计:


  • 一是阻尼更新:对每一轮的特征修正幅度做约束,防止表征逐渐偏离原始判断;

  • 二是双重停止判据:同时监测 KL 散度 + 隐状态残差; 

  • 三是轨迹读出与状态回滚:把多轮迭代过程中的中间状态都保留下来,最终从中挑选风险最低的一版作为输出。


从工程效果上看,这套机制在不明显拉高平均推理成本的前提下,大幅提升了复杂空间任务和长流程任务场景下的正确率,相当于把有限的算力预算,精准地花在真正需要的问题上,而不是平均分摊在每一个问题上。


另外,需要说明的是,这种内部循环解决的是长程任务链条中单步判断的质量问题,一个完整的复杂具身任务依然要依靠外部任务循环去接收环境的新观测、更新全局任务状态,内部循环与外部任务循环是两层协同的架构,共同支撑起真正的长程物理任务。


数据管线方案:开源了权重,更开源了「怎么做到的」


评测成绩解决的是这个模型行不行的问题,但对于真正要在产业里落地具身智能的机构来说,更根本的问题是:我能不能在这个基础上,用自己的数据接着往前走?


现阶段,绝大多数开源模型只发布权重,不公开数据处理管线。对于拥有工业现场数据、机器人操作数据、实验场景数据的企业和科研机构来说,这意味着拿到权重,能用,但没法改。


原因在于空间具身能力的训练数据需要三维场景数据、跨视角标注、具身交互轨迹、操作约束标签,每一类都需要专门的采集、处理和质量控制流程。这套工程成本需要高度专业性,也是大多数开源模型只开放权重、不开放工艺的原因。


ZDTaichu5.0-9B 开放的管线详细方案覆盖了训练的三个核心环节:


预训练阶段,紫东太初先将开源图文、网页文档、公开视频、多视角素材以及仿真数据等多源内容统一纳入数据池,再经过哈希与 URL 去重、清晰度和安全过滤、图文相关性筛选,以及图像重描述、视频抽帧等处理,最终组织成多模态训练样本。为模型建立通用知识、视觉理解和空间具身能力的基础。



监督微调阶段,样本池已不再是简单问答对,而是大规模任务轨迹数据,涵盖开源 SFT 指令、真实业务问答、空间具身案例与智能完整工具调用轨迹。团队执行指令质量打分、答案正确性校验、难度分层配比,并专门做图像、问题、对象关系、操作约束之间一致性的强制校验,同时采用多轮对话、多图拼接、视频序列打包构建样本,批量合成带步骤的思维链数据,经拒绝采样、格式校验、一致性校验层层过滤脏样本。


最终的训练数据,教会模型如何结合视觉证据完成任务拆解、工具调用、多轮具身交互。



高质量退火 + GRPO 可验证奖励强化学习,团队建立了能力域、难度、质量三维自动标签系统,标签体系与评测基准维度一一对应,定向筛选高难度、高信息量样本,过滤低质噪声样本。强化学习部分采用 GRPO 框架,设置答案正确性奖励、空间框选坐标命中奖励、输出格式合规奖励等多组可自动校验的信号,把空间点位输出、结构化规划变成可反馈的训练目标。



这套管线方案开放的意义在于,它把「如何把自己手上的工业数据、仿真数据、实验数据训练成一个能用的多模态模型」这件事,从少数团队的内部经验,变成了行业内可以直接复用的公开方法论。对于正在推进具身智能落地、但缺乏大模型训练经验的机器人公司、制造企业和科研机构而言,这比单纯多一个高分模型权重更有价值。


从跑分到落地:ZDTaichu5.0-9B 开始落地科研与制造现场


具身智能行业有一个公认的魔咒:演示好看,落地难产。


过去两年,国内外发布的具身智能演示视频不计其数 —— 机械臂精准抓取、人形机器人流畅行走、AGV 自主避障,但真正进入工业现场完成稳定商业交付的案例,屈指可数。


紫东太初已在科研自动化、智能制造等真实场景中对 ZDTaicu5.0-9B 进行了落地测试


在科研自动化方向,用户只需输入问题,ZDTaichu5.0-9B 就能跑通从提问到分析报告的完整流程:


用户只需输入问题,ZDTaichu5.0-9B 就能自主调用工具,完成解析解与数值解求解、结果校验,并可视化结果,跑通从提问到分析报告的完整流程。


在试管按序入架的湿实验中,模型需要持续追踪两支试管的身份和任务进度。即使试管在抓取和移动后位置发生变化,模型仍能判断当前状态,并继续规划下一步操作。



智能制造方向,ZDTaichu5.0-9B 已围绕备料配送、机台上下料等典型业务完成实体验证,覆盖密集货架、相似零件以及复杂操作约束等工业现场常见问题。



在跨工位备料配送任务中,面对一句自然语言工单,模型能够理解目标与目的地,完成目标识别、抓取位置判断和高层任务规划,再由机器人执行双臂协同搬运与放置,跑通从工单理解到实体操作的完整链路。



ZDTaichu5.0-9B 在完成科研自动化和智能制造场景的闭环验证后选择开源,也表明空间具身智能模型的竞争,正在从单纯比拼模型参数和 benchmark 分数,进入比拼真实场景验证、数据闭环和生态构建的阶段。


从模型能力到产业落地,空间具身智能需要一条完整链路


如果把 ZDTaichu5.0-9B 放进更大的产业坐标系来看,我们会发现几个有意思的点。


首先,10B 参数档位的选择有其产业逻辑。


真正的终端具身设备,如工业机器人、移动操作平台、实验室自动化设备,对推理延迟和硬件成本有严苛约束。70B 或更大的模型即使能力再强,也无法在边缘侧实现实时响应。10B 档位是当前算力约束下能力与部署的合理折中点:能跑在消费级 GPU 上,能在合理延迟内输出规划结果,能在私有化部署时控制成本。


在这个档位实现空间具身能力的突破,比在百亿参数上做到类似效果,产业化价值要高得多。


其次,通用能力不衰减是产业落地的必要条件。


工业场景下,机器人需要处理的任务远不只空间操作。工单是文字,操作手册是文档,异常报告是结构化表格,人机对话需要自然语言理解,这些都依赖模型的通用多模态能力。如果为了空间具身能力而把 OCR、文档理解、指令遵循拉垮,实际应用中模型就会在非空间环节频繁出错,系统可靠性就无从谈起。


ZDTaichu5.0-9B 给出的答案是:空间具身能力是对通用能力的增强,而不是替代。这个立场在产业化路径上是更务实的。


机台上下料,这里考验的是多项能力能否连续衔接:前一刻对空间关系的判断,会直接影响下一步动作选择;任何一个环节发生偏差,都可能让整条任务链中断。


第三,完整数据管线方案的开放,是加速产业生态的关键举措。


目前国内具身智能产业的一个真实痛点:各家机器人公司都在积累自己的操作数据,但缺乏将这些数据转化为模型能力的系统方法。ZDTaichu5.0-9B 开放的数据生产管线详细方案,等于提供了一套工业级验证过的方法论,企业可以在此基础上接入自有工业现场数据、机器人轨迹数据,继续迭代垂直场景的能力。这和只开放权重的做法有本质不同。


第四,科研自动化可能成为空间具身智能落地的重要入口。


相比开放环境中的机器人任务,实验室场景具有更明确的流程、更丰富的数据积累和更高的自动化需求。科研实验涉及仪器操作、样品处理、数据分析等多个环节,本身就是一个需要模型持续理解环境并执行任务的复杂场景。


滴管液体转移任务,模型需要同时绑定滴管、源烧杯、目标烧杯三者的空间关系,并根据滴管相对目标容器的悬停位置判断当前操作阶段。


ZDTaichu5.0-9B 在科研仿真计算、湿实验操作等方向的探索,展示了多模态大模型进入专业场景的一种可能路径。


如果未来模型能够进一步结合领域知识、实验设备和自动化平台,科研流程可能成为大模型进入物理世界的重要应用方向。


结语


过去,多模态模型主要解决数字世界的信息理解问题。


随着机器人、智能制造和科研自动化的发展,模型需要进一步理解现实环境中的空间关系、物体状态和行动逻辑。


ZDTaichu5.0-9B 的探索,代表了一条新的技术路径:在保持通用多模态能力的基础上,加强空间理解和具身任务能力,让模型从理解世界进一步走向改造世界。


随着 ZDTaichu5.0-9B 的开源,它同时验证了几件更根本的事:第一,空间具身能力和通用多模态能力并非零和博弈,在 10B 以下这个参数档位,二者可以兼得;第二,一个模型能不能真正落地,取决于能不能形成从数据工程到底层推理机制、再到实体场景验证的完整闭环,而不只是某一个环节的单点突破;第三,把数据生产管线详细方案本身作为开源资产对外开放,可能比单纯开放一个高分权重,更能实质性地降低整个行业的研发门槛。


当然,仿真评测环境和真实物理世界之间依然存在客观差距,这也是紫东太初团队明确提出后续要持续投入的方向,进一步优化仿真到现实的迁移能力,缩小两者之间的鸿沟。


但至少从这一次开源来看,国内大模型在物理具身智能这条路上,已经从能不能做的验证阶段,走到了「好不好用、能不能开放给行业复用」的落地阶段,这对机器人、科研自动化、智能制造这些正在等待大模型基座的产业而言,是一个值得关注的信号。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com