具身智能行业又爆大瓜。
梅卡曼德创始人邵天兰在朋友圈开炮:包括北京、上海一些名气很大估值很高的上春晚的公司,大量利用所谓"数采中心"和与地方政府、投资方、供应商的关联交易来制造虚假的、不可持续的收入,他指出这种做法是不合法,不道德,而且不聪明。

银河通用随后回应:公司产品已在工业、零售、药房等多个领域实现规模化落地,并完成长达 2 年的常态化运营验证。
表面上看,吵的是机器人公司的收入是不是真的,真机数据是不是真的,商业场景是不是真的。
但往深了看,背后还有一个更大的问题:大家都说自己拥有的那个“真实世界”,到底是不是真的?
巧的是,你问100个投资人,今年他们看的方向是什么,投资人都会告诉你,世界模型,它被寄希望于让机器理解、预测和模拟真实世界。
方向听起来很清楚,边界却没那么清楚。
当我们真正问一句,到底什么才算世界模型?100个投资人心中不一定有100个哈姆雷特,但答案已经开始分叉。
除了原本就在做具身大脑的那些人,还有视频生成、3D生成、数据公司、仿真平台,一些原本并不以“世界模型”为名的公司,都开始被纳入这场新叙事。
世界模型成为每一家相关或者不相关公司的标配,出现在PPT的页眉、发布会的标题、融资故事里的镀金边框。
更有意思的是,一个连行业边界都没有统一的赛道,却已经开始批量制造独角兽:在我们梳理的55家公司中,已经有12家进入独角兽行列,其中九家来自具身智能领域。
市场对这个词的热情也远比产品落地来得快。Google Trends数据显示,“world model”全球搜索热度同比暴涨1200%,2026年5月至7月快速冲高。

Google trends :世界模型全球搜索热度
「非标玩家UnDefined」近期梳理了国内59个世界模型,将他们划成七大门派:机器人派、智驾派、大厂派、视觉生成派、数据派、3D派、Native派。
不同门派,不同出身,不同底牌,也注定了不同的活法。
接下来,我们将从夯到拉锐评这些“世界模型”,主要看三件事:它到底有多像一个真正的世界模型,有没有真正进入真实世界,以及能不能从真实世界里持续获得反馈。
当然,我们并非专业机构!!所有评价都不够客观!如有雷同纯属巧合。
01 机器人派:争夺理解世界的大脑——我给到顶级
机器人派做世界模型,是真拥挤,也是真需求。
目前公开世界模型的机器人和具身智能公司至少有18家:商汤绝影(开悟Kairos)、大晓机器人(Kairos 3.1)、星海图(Fast-WAM)、智元机器人(τ0-WM、GE-Sim 2.0)、银河通用(DyWA、LDA-1B)、灵初智能(Psi-W0)、星源智(ω-EVA)、极佳视界(GigaWorld-Policy)、墨奇智能、章鱼动力、中科第五纪(BridgeV2W)、韦特嘉仓储机器人(具身大脑Ulti-Brain)、至简动力(VLA LaST₀)、智平方(全域全身VLA GOVLA)、飞捷科思、无界动力(W‑WALA)、自变量机器人(WALL‑WM)、破壳机器人(Embodied World Model)等。
机器人派是世界模型赛道里资本密度最高的一派。2026年上半年,国内仅具身智能赛道披露的融资额就超过460亿,其中七成砸向了前20家,银河通用、星海图、智平方、自变量的估值都已经突破200亿,成立不到一年的无界动力,连融四轮后估值也突破百亿,至简动力则半年就跻身独角兽。
资本赌的,是谁能先垄断真机数据入口。
传统机器人靠规则编程,端到端模型泛化能力很差。遇到陌生物体,就直接宕机;换一个场景,就要重新训练。这也是人类期待世界模型能够解决的——理解物理规律后,在"脑内"推演后果,选择最优动作。
机器人派切入世界模型最大的抓手,是他们派拥有真实应用场景和真机数据(敲重点:是能训练出能力的真数据,不是和前述所谓数采中心虚构的数据)。
机器人在真实环境里的每一次抓空、碰撞、跌倒和人类接管,都是世界模型最珍贵的训练数据。只要真机规模起来,“模型训练—真实验证—产品迭代”的飞轮就有机会转起来。
因此,机器人派很有可能是最先把世界模型带入物理世界的一派。
但问题也恰恰在这里:真机是资产,也是负债。没有足够多的真机,闭环就是空谈;可机器人一多,硬件、部署和维护成本又可能先把公司拖死。
还有一个更隐蔽的陷阱:专用模型不等于通用世界模型。自己公司的机器人每天产生的数据,确实能让模型越来越懂自己的机械臂、抓取方式和场景,但这可能只是把一个“小世界”做得越来越熟。真正的考题是能不能换一台机器人、换一个任务、换一个陌生环境依然有效。
所以,机器人派最终比的是谁能把真机数据变成可迁移的物理世界知识,从“只懂自己的机器人”走向“理解别人的机器人”,这才是真的在造理解世界的大脑;否则,世界模型只是给自己的机器人找了一个更高级的仿真器。
能把后者变成前者的,可能只有一两家;剩下的,只是在借世界模型的名义,给融资故事加戏。
02 智驾派:预测下一秒世界——我给人上人
目前至少有7家车企和智驾公司公开了相关探索,包括蔚来汽车(NIO WorldModel)、理想汽车(重建世界模型、生成世界模型)、小鹏汽车(X-World)、吉利汽车(World Action Model)、小米汽车(Joint World Model)、华为云(盘古多模态大模型的世界模型)、Momenta(R7 强化学习世界模型)等,另外,地平线与星河问途也公开表示自研智驾系统内含世界模型能力。
名单不长,但每家都自带量产车队和数据管道。
今天的“智驾”本质仍是辅助驾驶。世界模型要补上的是感知、预测和规划的统一。
车企最大的优势,是拥有持续运行的现实世界采样器,从采集真实道路数据、发现问题、筛选有效样本、重新训练,再通过仿真和评测验证模型迭代效果,最后把模型重新部署到车上,实现数据闭环。
智驾派数据采集条件高度标准化:相对固定的传感器、车辆控制接口;相对统一的路况;相对重复的任务,所以模型具有很强的规模复制性。
和其他派不同,在过去的十年中,智驾派已经跑过一轮数据闭环建设,所以他们可能成为最早跑通世界模型的垂直领域之一。
但车企的问题也很现实:造汽车和造基础模型,是两套能力。有钱、有车、有数据,不等于拥有万卡集群和预训练团队。因此,部分车企的世界模型,可能是"贴牌"或"联合研发"——名字属于车企,底层能力却来自供应商。
这也成了智驾派真正的暗战。华为、Momenta等供应商可以跨品牌、跨车型获取数据,尤其能覆盖极端天气、复杂路口和危险决策等高价值场景,更重要的是,他们有机会把不同车队的数据、算法和评测体系连接起来。他们的野心是从“卖智驾方案”进一步变成“汽车智能时代的基础能力提供者”。
同样,供应商也有困扰,能接触数据,不等于拥有数据闭环。数据能不能持续用于训练,最终还要看与车企的合作模式和合同条款。
车企争的是自己的数据规模和闭环,供应商争的是跨车队的数据规模和闭环,最终谁能真正把数据变成模型能力,谁才有资格定义下一代汽车的大脑。
03 大厂派:全都能做,但世界不是靠堆出来的——我给顶级
目前已公开相关产品或研究的大厂包括:阿里巴巴(Qwen-RobotWorld、Qwen-AgentWorld、Happy Oyster)、蚂蚁灵波(LingBot-World / LingBot-VA)、腾讯混元(HY-World 2.0)、字节 Seed(GR 系列、Seedance 2.0)、快手(可灵视频 3.0 Omni)、华为云(盘古世界模型),以及正在探路的美团(LongCat-Video)。
2026年,世界模型开始被越来越多大厂视为下一代AI基础设施。他们可以容忍自己的大模型不是最强,但绝不能容忍自己在新牌桌上缺位。
大厂派最大的优势是什么都有。有视频的做视频,有地图的做3D,有机器人的做具身,有Agent的做数字环境……阿里甚至同时押注机器人、Agent和虚拟世界三条路线。
这种“全都要”的底气,在战略模糊期是优势,但标准一旦确立,也可能变成负担。毕竟,世界模型究竟应该是视频、3D、物理模拟器,还是Agent的数字环境,现在还没有答案。
路线可以同时下注,但数据闭环却不能同时成立。内容平台有海量视频,却缺少动作反馈;地图公司有空间数据,却未必拥有持续的物理交互;机器人公司有真实动作数据,但规模又远小于互联网数据。
数据很多,不等于有世界模型最需要的数据。最后做出来的可能是一堆分别服务于视频、3D、机器人和Agent的“高级工具”。
世界模型的终局,也未必是模型最多的大厂赢,而是谁能把模型、场景、数据和反馈串成闭环,并从“全都下注”里跑出一条真正的数据飞轮。
04 视觉生成派:从生成画面走向模拟世界——今年年初我给npc,现在我给人上人
视觉生成派向上做世界模型,本质上是在给已有能力重新定价。
现有公开相关模型的公司包括:Sand.ai(Magi-1.1)、智象未来(原生全模态世界模型架构)、魔芯科技(KOKONI-World / MoWorld)、生数科技(Motus / MotuBrain)、阿里 Happy Oyster,以及广义统计下的快手可灵 3.0 Omni、字节Seedance 2.0。
这一派手里握着最便宜的互联网海量视频——这本身就是物理世界在时间维度上的切片。
Sand.ai 用自回归预测下一段视频,魔芯科技从 3D 空间切入,生数科技把 VLA、世界模型、视频生成整合进 Motus。从"生成下一帧"到"预测下一状态",技术栈本来就是连续的。
资本也认这个逻辑。生数科技B轮融资近20亿元,投后估值超20亿美元,正在冲刺港股 IPO;智象未来三个月连续完成三轮融资,累计超过21亿元;可灵AI独立融资近30 亿美元,投前估值150 亿美元。
资本买的已经不只是"生成画面"的生意,还有从内容生成走向物理模拟的想象。能生成杯子落地的视频,卖的是内容工具;能预测杯子落地后碎片溅起的轨迹,卖的是物理理解。
从"内容生成"到"物理模拟",估值逻辑差了一个数量级。问题是,重新定价的前提,是能力真的值这个价。
视觉生成派的核心优势是有数据、有模型、有工程,最大的短板却是有画面,没因果。
现有研究也表明,视觉生成模型距离真正的世界模型,仍卡在空间推理、持久状态、长程一致性和因果理解等问题上。这是范式问题——从"无意识模仿像素"到"有意识理解物理",中间隔的是"动作-反馈"的闭环。
所以,这一派最终要跨过去的,是从视觉上的连续性走向物理上的因果性,从“生成世界”走向“模拟世界”。
05 数据派:从还原世界走向生成世界——我现在给顶级,下半年我再改
目前已经公开自研模型的公司包括:大衍科技(4D世界重建合成数据平台)、卓印智能(Simulaix)、树为智能(具身智能物理因果数据引擎)、群核科技(SpatialGen)、五一视界 51WORLD(51World Model)和跨维智能(DexWorldModel)。
首先,在具身智能这个充满非共识的行业,数据短缺成为当下为数不多的共识。
所以卡着行业脖子的数据派,天然有优势。只不过在数据问题解决之后,他们还有价值吗?
2026年,世界模型显然是比数据标注、仿真服务更性感的资本故事。于是各家争相推出自己的世界模型,从按单收费走向按能力收费,成为这类公司的共识。
数据派最大的优势,是起手就有场景资产。群核科技背后是数千万真实家居设计数据;51World Model建立在城市级数字孪生之上;树为智能则直接把物理因果锚定在真实刚体碰撞和摩擦系数上。
所以,他们的模型在"空间一致性"和"物理可信度"上更有竞争力,而且他们的数据客户本身也是潜在模型客户。给机器人公司卖了两年训练数据,现在推销"具身世界模型",销售链路都不用重建。
但问题也来了:既是数据供应商,又是模型供应商,客户究竟该买你的模型,还是该防着你成为竞争对手?
归根到底,数据派真正的底牌还是在场景资产和仿真引擎,世界模型更像是在这些资产上套了一层"神经化包装"。因此,他们也可能是最先被证伪的一批——披着模型外衣的仿真公司。
真正的验金石,是离开自己最熟悉的业务场景后,模型还能不能对陌生环境稳定预测、推演结果。否则,它依然只是工具。
当然,如果真有谁能把场景资产+物理仿真+预训练能力跑出闭环,数据派反而可能诞生隐形冠军。毕竟,有"世界"的人,比只有"参数"的人离物理现实更近。
问题是,他们愿意为了成为大脑,彻底放弃卖铲子的舒服日子吗?更残酷的问题是,有些公司的现金流根本不允许他们放弃。当世界模型的故事讲完,他们或许会发现,自己既不是大脑,也回不到铲子商的位置了。
06 3D派:从重建世界到理解空间——数据派的另一个支门派
这一派坚信3D才是正确的世界表征。
目前公开相关模型的公司包括:腾讯混元(HY-World 2.0)、阿里高德(ABot‑Earth 0.5);昆仑万维(Matrix系列)、元昊动力(4D 世界模型基模)、极佳视界(GigaWorld‑1)、VAST(Tripo )、影身智能(S1)、魔芯科技(MoWorld 3D)、知天下科技(3DGS三维重建平台)、群核科技(SpatialGen)、具身升维(3D物体/环境生成重建方向)和其域创新(LCC空间重建与编辑体系)。
3D派很擅长回答"这一秒长什么样",世界模型要回答的却是"下一秒会怎样"。
于是就有了昆仑万维把Matrix-3D包进Matrix世界模型系列,VAST在3D生成底座上推世界模型,其域创新把LCC空间编辑体系升级成世界模型……
但加了播放键的3D模型,也不一定能预测物理后果;重建再精确,也许仍是高级扫描仪。
不过至少他们开始拥有一个可测量、可编辑、可调用、可交互的空间:腾讯混元HY-World 2.0 输出Mesh和3DGS,美术可以导进Unity继续改;阿里高德ABot-Earth 0.5重建城市时带有地理坐标;影身智能的S1直接用原生3D数据训练,机器人拿到的是空间坐标。
对于机器人、自动驾驶而言,这种把空间位置、深度和物体关系直接固定下来的3D表征尤其重要,因为模型不能只知道“前面有辆车”,还得知道车在哪里、自己在哪里,以及两者怎么运动。
更重要的是,如果现实场景真的被重建成3D世界,模型就可以在这个世界里继续生成物体和环境,再加入角色、动作和物理规则,那时,3D就真的能成为世界模型的空间底座。
但3D派的致命瓶颈也在这里:普遍缺失动力学推演与因果交互能力。
所以,能造出世界的外壳,不代表算得出世界的内核。碰撞、摩擦、动力学和长时序变化,目前很多方案还在靠传统物理引擎补位;而高精度3D生成和动态推演的算力成本,也足以让创业公司肉疼。
如果3D派不能顺利从“空间表示”走向“空间推演”,最终也还只是更逼真的场景渲染工具,而非理解世界的模型。
07 Native派:先验者的赌注——我先给个npc,回头再改
这一派从Day1起,核心使命就是通用世界模型。
目前公开的玩家包括:流形空间(WorldScape-Policy )、逆矩阵科技(悟界·Physis)、LiberAI、卜拉格科技和飞捷科思。
Native 派是 2026 年资本最敢下注的一派。流形空间一年连融五轮、累计近15亿元;逆矩阵科技成立四个月拿下超1.1亿美元;LiberAI半年四轮、累计超10亿元;卜拉格科技成立仅一个月、产品尚未公开,估值就冲到20亿美元。
哇塞哇塞,可以说比那些从别的门派转型而来的老登们融资更猛!令人羡慕!
资本猛猛下注的原因是,对通用世界模型的未来想象,以及模型跑通后对数据入口的反向收割能力。
Native派相信物理规律可以被神经网络内化,相信存在一个比专用模型更底层的统一框架,至于这个框架是空间表征、物理引擎还是隐状态模型,各家答案不同,但赌注都押在“通用”两个字上。
Native派最大的优势,是没有历史包袱。他们可以按照自己理解的“世界”来设计模型、数据和交互方式。
所以理论上,他们是最有机会做出真正跨场景、跨任务的通用世界模型。
但问题也最直接:没有产业入口,就没有现成的世界数据。逆矩阵提到要"从预测下一个词转向预测下一个物理状态",可物理规律是从一次次真实失败里磕出来的。
世界模型最需要的,就是持续的“观察—行动—结果”反馈。没有数据闭环,所谓Native很容易只剩下一套漂亮的架构和更漂亮的融资故事。
可数据和场景不是期货,最终必须交割。GPT背后有互联网海量文本,Native派拿什么去造一个“物理世界GPT”?
而且Native派几乎没有退路。
机器人做砸了还能卖机器人,数据做砸了还能卖数据,视频做砸了还能卖视频;Native派如果通用基座跑不通,手里可能什么都没有。
结尾
最开始,我以为这是一次蹭概念。
写到这,我觉得不是。
互联网泡沫时,名字带“.com”就能上市;SaaS热潮时,传统软件换个订阅制就能讲云故事;元宇宙最热的时候,VR展厅也能融到钱。历史总是押韵:概念先起飞,产品还在滑跑,所有人先挤上牌桌再说。
好像只是历史的重复。
但又有一点不一样。过去几轮,至少技术底座是确定的:互联网是TCP/IP,SaaS是云和订阅,大模型有Transformer。
世界模型却连定义都没有被共识:视频生成说它是下一帧预测器,3D说它是空间模拟器,机器人说它是物理推演器,Native派说它是通用基座。
所以,我们这次的排名的参考价值,大概要在一年后揭晓答案的时候才能显现。
本文来自微信公众号“非标玩家UnDefined”,作者:程可乐,36氪经授权发布。