(本文作者为 FoST未来叙事,钛媒体经授权发布)
文 | FoST未来叙事,作者 | 葱葱
82亿美元,芯片巨头AMD以全股票形式收购世界模型公司World Labs。
AMD在收购公告里写道:“World Labs 的模型经验,将帮助AMD更深入地理解工作负载如何演变,进而塑造未来的技术路线图。”
换句话说,AMD看中的,不只是World Labs今天的模型能力,更是世界模型这类前沿模型可能给芯片硬件研发带来的“前瞻性”。

董事长兼CEO苏姿丰(左)和World Labs联创李飞飞(右)
2026年以来,世界模型正替代大语言模型成为AI界的新晋“网红”。当大模型还停留在对话、文本和图像生成时,世界模型要做的是拓宽AI的能力边界,从“生成内容”推向“生成世界”。
这意味着,AI生成的将不再只是一个镜头、一段视频或一张图片,而是一个能够持续运行、允许用户进入、探索和互动的数字世界,这也许将是一次真正的内容重塑。比如,电影可能不再只是一段被观看的故事,而是成为一个用户能直接参与互动的小世界。
但高热度的另一面是,世界模型至今尚未成熟,甚至没有一个确切的定义。于是,一系列问题随之而来:
世界模型究竟是什么?为什么李飞飞和杨立昆走向了不同的技术路线?Google、英伟达和AMD等巨头们又在押注什么?
更重要的是,为什么AMD愿意为一家成立仅两年的世界模型公司,开出82亿美元的价格?
当AI不再只是生成一段视频,而是开始生成一个可以进入、探索和互动的“世界”,影视、游戏和其他内容产业会发生什么?
01 世界模型,到底是什么
说来有趣,世界模型这个词最早并不是来自计算机科学,而是由一位人文社科领域的研究者提出。
1943年,英国心理学家Kenneth Craik在其著作《The Nature of Explanation(解释的本质)》中写到:
人的大脑会在内部建立一个关于外部的“小规模世界模型”,并利用这个模型预测未来可能发生的事情、比较不同的行动方案。
2018年,Google Brain的David Ha与人工智能先驱Jürgen Schmidhuber共同发表论文《World Models》,正式在人工智能的论文中提出世界模型的概念。
他们还给出了一个简洁的框架:世界模型=观察世界(V)+预测世界(M)+在内部世界中学习行动(C)。
这也为后来的人们提供了一条重要线索:AI真正需要的,可能不只是生成内容,而是形成一个关于世界如何运转的内部模型。李飞飞所推动的空间智能路线,以及杨立昆长期倡导的JEPA路线,虽然技术路径不同,但最终都在回答类似的问题。
今年6月,李飞飞发表一篇长文试图进一步厘清世界模型的概念,她认为,世界模型是当今AI最重要,但也是最被过度使用的术语之一。基于这一观察,她按功能,将世界模型划分为渲染器、模拟器和规划器三类。ㅤ
渲染器输出观测,以供人眼观看的像素形式呈现,文生视频是代表产品;
规划器回答的是智能体下一步该做什么,还处于萌芽状态;
模拟器负责输出世界状态,是连接二者的桥梁,最重要也最容易被忽视。
李飞飞认为模拟器提供的是世界模型的结构骨架,它既能从中导出视觉外观供渲染器使用,也能从中导出行动后果供规划器使用。
和李飞飞有所不同,杨立昆认为生成视频不等同于理解世界,你根本不可能预测视频里发生的一切,合理的可能情况有无穷多种。
基于上述分析,杨立昆给出的解决方案是联合嵌入预测架构(JEPA)。

杨立昆对JEPA的解释是:为了能够做预测,你需要找到一种抽象。在杨立昆看来,世界模型不应该是模拟器,它们应该在抽象空间中工作。同时,杨立昆还认为,世界模型不应该是生成式模型,也不应该是视频生成系统。
无论是李飞飞给出的“世界模型”定义,还是杨立昆提出的JEPA架构,最终都指向了一个相似的问题——AI能否形成对现实世界的认识,并据此预测环境如何变化、行动会产生什么后果。
02 巨头去留间,各有选择
世界模型并不是一个新概念,但新一轮产业热度大约从2024年前后开始,并在2025年至2026年随着视频生成、机器人和Physical AI的快速发展进一步升温。ㅤ
2025年11月,Meta首席AI科学家杨立昆宣布离职,他在接受采访时表示,2024年前后,Meta逐渐将更多资源转向大语言模型和超级智能方向,FAIR等偏探索性的研究因此受到影响。ㅤ
事实上,在杨立昆离开之前,Meta已经削减了包括FAIR团队成员在内的部分AI岗位。此时,Meta正在大幅重组AI业务,并将更多资源集中到超级智能和大模型等方向。ㅤ
离开Meta后,杨立昆个人成立了新公司AMI Labs,延续他在Meta时期的JEPA方向的探索和研究。
杨立昆曾多次表示大语言模型不是通往人类级别、类人智能的正确技术路径。今年9月,在纽约的演讲中,杨立昆重申:“如果你关心人类水平的AI,就不要研究LLM。”他把这句话用红色字体放在结尾的PPT中。
不止杨立昆,包括李飞飞在内的研究者,都把世界模型视为通往更高级机器智能的重要技术路径。李飞飞曾在社交平台表示:大语言模型仍然是黑暗中的文字匠人:能言善辩,却缺乏经验;知识渊博,却脱离现实。
尽管如此,大语言模型仍是当下科技巨头,尤其是互联网巨头押注的重点对象。毕竟,目前来看,世界模型仍处于技术探索期,商业化路径也远未成熟。这便有了杨立昆离职Meta,创立AMI Labs的结果。
当然,这并不是说,Meta等巨头放弃了世界模型路线,只是一个资源取舍问题。
比起Meta,谷歌还在世界模型的方向倾注更多资源。2025年8月,Google DeepMind发布Genie 3,DeepMind表示:“Genie 3是我们突破性的世界模型,可以通过单个文本提示词创建交互式、可玩的环境。从照片般逼真的风景到奇幻的境界,可能性无穷无尽。”
碰巧的是,杨立昆从Meta离开创立公司不到一年,李飞飞带着他创办两年的World Labs加入芯片巨头AMD——这也展示出两类公司的不同选择,芯片巨头们往往更注重提前预判下一个时代。
对于AMD这样的芯片公司而言,它需要对先进模型保持足够敏锐,才能提前看到未来的算力需求。类似的逻辑,2016年,黄仁勋便亲自向OpenAI交付了第一台DGX-1 AI超级计算机。
现在,AMD收购了一家世界模型公司,英伟达则早在2025年1月发布了Cosmos世界基础模型平台。
03 当世界模型,开始“创造世界”
AMD宣布收购World Labs消息的同时,李飞飞发长文回顾了一路走来的历程。她在文章中写道:宇宙并非由文字构成,而是由真实存在的事物组成。从科学、娱乐到机器人,人工智能需要解决的诸多重要问题,都需要模型来推理物理世界的结构和行为。
随后她回顾了World Labs成立以来的一系列成绩,重点提到近期发布的Atlas。李飞飞称,Atlas解决的是空间智能领域一个长期存在的关键问题:如何仅凭少量2D图像,重建真实空间,并预测此前没有观察到的新视角。它能够用于机器人、娱乐场景生成、房地产、设计、建造等领域。
这正是人们研究世界模型的意义所在。当下的机器人泛化程度仍然有限,往往只能做一些固定的动作,在面对一些突发场景时经常失灵,这正是世界模型所努力解决的问题之一。
不止机器人,在游戏、影视等内容产业领域,世界模型也开始展现出新的应用可能。
World Labs联合创始人Ben Mildenhall曾表示,World Labs一直拥有不少来自创意行业的用户,他们使用相关模型维持2D图像、电影、3D和游戏之间的空间一致性。
谷歌Genie 3最大的变化之一,是从“生成一段视频”走向“生成一个可以实时进入的世界”:它可以根据文字提示生成动态环境,以24fps运行,维持数分钟的世界一致性。
如果说文生视频是在“生成一个镜头”,那么Genie 3开始尝试的是“生成一个可以进入、互动的世界”。这意味着,未来的内容生产对象,可能不再只是“一部电影”“一集电视剧”或者“一条短视频”,而可能变成一个可以持续运行、不断变化、允许用户进入的数字世界。
不久前,彭博社报道称,字节跳动正在基于Seedance开发实时空间视频生成模型。该项目涉及跨部门及算力资源协调,目标并不只是一段生成好的视频,而是一个能够根据用户声音和动作实时变化的虚拟环境,潜在应用包括直播、短剧和游戏,并计划服务Pico头显。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App