到目前为止,田柯宇的创业公司还没有公开名称,也没有正式产品。但投资人已经先给它定了价:近3000万美元融资,投后估值2亿美元。
五源资本、IDG都参与其中。团队大约10个人,计划在2027年前后发布完整模型。这笔钱放在今天的世界模型市场里不算离谱。

但放在田柯宇身上,多少有点特别。
两年前,他还是字节跳动的一名实习生。字节称他因“严重违规”被辞退,同期,他参与的论文拿下了NeurIPS 2024 最佳论文。
现在,他又拿着同一份技术履历进入了世界模型创业。
田柯宇X的主页背景图,来自电影《降临》。
漆黑的空间里,几个人穿着橙色防护服站在后面。艾米·亚当斯饰演的语言学家 Louise Banks 走到最前面,隔着面罩举起一块白板。上面只有一个词:HUMAN。

她没有武器,也没有长篇解释。面对完全陌生的生命,第一步是先告诉对方:我们是谁。
这张图挂在一个做世界模型的研究者主页上,多少有点贴题。
田柯宇现在要做的事情,正是让机器处理人类语言难以描述的视觉世界。他的团队正在尝试建立一套供AI使用的视觉符号系统,希望用它处理海量视频。
这笔钱买的是什么
五源资本今年组织的一次讨论,把世界模型归纳为“在动作条件下预测世界状态变化”。
这个定义还没有成为行业共识,但它说明了资本为什么开始关注这个方向:AI下一步要处理的,不只是文字和图片,还包括空间、时间和动作。
田柯宇的公司选择在这个时候进入,吃到的是一个很明显的时间窗口。
世界模型还没有形成稳定的产品形态,行业也还没有统一的评测标准。对投资人来说,这意味着风险很大,但也意味着技术路线、创始人和论文成绩仍然可以先拿来定价。
田柯宇最有价值的资产,是一篇论文。
2024年,他作为第一作者发表了《Visual Autoregressive Modeling》,提出让模型按照图像的不同尺度逐层生成,而不是像传统模型一样逐个像素或逐个视觉Token处理。论文称,这种方法能够提高图像生成的速度和效率。
这篇论文后来获得NeurIPS最佳论文奖。后来面对相关争议,NeurIPS回应称论文采用盲审,评奖依据是科学质量。
此次的创业方向,田柯宇基本延续了这条思路。
据报道,田柯宇的团队正在为AI建立一套新的视觉符号系统,包含约20万个符号,用来处理视频信息。他们计划向系统输入1亿小时的视频,并希望把视频生成成本降低至少一个数量级。
这和今年5月份五源资本组织的一场世界模型的社群讨论活动类似。在一篇名为《2026年了,我们还在用爱迪生试灯丝的方式评估World Model》中,其强调世界模型本质上是一场效率竞争:谁的压缩比更高,谁就能占据优势位置。
对于技术效率的共同追求,可能是五源资本押注人的关键。
毕竟目前,田柯宇的公司没有公开模型,没有产品,也没有明确的商业模式。他的计划是先把技术做出来,再在2027年左右发布完整模型。
天才少年的以火攻火
2024年10月,关于字节跳动实习生攻击模型训练的消息在社交媒体一时间成为AI圈里离经叛道的传奇。
当时最夸张的版本是:事件涉及8000多张GPU,给字节造成上千万美元损失。
字节跳动随后回应,称确有实习生因严重违纪被辞退,但受到影响的只是商业化技术团队的某个研究项目,不涉及字节的大模型,也没有影响线上业务;8000多张卡和上千万美元损失的说法严重夸大。
第一财经后来报道称,字节内部通报认为,这名实习生在2024年6月至7月因不满资源分配,通过编写、篡改代码等方式干扰研究项目的模型训练任务。字节因此与他解除实习协议,并向法院提出800万元损失、2万元合理支出及公开道歉等诉求。
之后字节否认了网上流传的损失金额和GPU数量。
最新的报道中披露,田柯宇也给出了自己的说法。他承认自己关闭过另一名实习生的程序,目的是释放计算资源给其他研究人员。他把这件事形容为“用火攻火”,并表示如果重新来一次,会采取更谨慎的做法。
报道还称,最终的结果是赔偿50万元,并没收全部工资。
“国家政策对具身智能给予了强力支持,市场上的资金也同样积极。”东方贝尔资本合伙人Vita Gu说。该机构参与了田柯宇公司的投资。
她还表示,在众多创业者中,田柯宇给她留下了特别深的印象,因为他能够把一个复杂的想法讲得很简单。
田柯宇开始创业之际,全球范围内的世界模型竞争正在加速。
9月,AMD宣布以约82亿美元的全股票交易收购李飞飞创办的World Labs。World Labs此前已经完成10亿美元融资,做的是能够生成、重建和模拟三维空间的模型。
Google DeepMind的Genie 3可以根据文字生成能够实时探索的虚拟环境,运行速度达到每秒24帧,并在几分钟内维持场景的一致性。
中国公司也开始把视频生成往实时交互上推。PixVerse今年发布R1、R2,主打连续生成和可交互的视觉世界。
这些产品看起来仍然像视频工具,但行业想要的东西已经不只是“画面更逼真”。
视频���型负责生成下一帧画面。更严格意义上的世界模型,还要理解动作和结果之间的关系:机器人向左移动之后会发生什么,摄像机换一个角度后原来的物体是否仍然存在,某个物体受到外力后会如何运动。
本文来自微信公众号“数智奔流”,作者:周易,36氪经授权发布。