过去两年,AI 视频最常见的使用方式是:输入一段提示词,等待几十秒甚至更久,再拿到一条完整的视频。这种方式更接近一种生产工具——用户提出需求,模型生成结果,用户再从结果里挑选、修改。视频本身是一次性产物,生成结束,交互也就结束了。
但今年,另一种视频正在出现。
视频不一定要等到生成完,才被用户看到。一个数字人可以在对话中被打断,再继续回应;一段正在输入的视频,可以被实时换人、换装、换背景,甚至改变风格。模型不再只是“生成一条视频”,而是在一个持续发生的现场里,不断根据用户的输入生成新的画面。
这意味着,AI 视频可能正在面对一个和过去不同的问题。它要争夺的或许不只是短剧、广告和影视制作这些内容生产需求,还包括直播、游戏、社交、陪伴,以及各种需要持续视觉反馈的交互场景。
大厂也开始从不同方向进入这个问题。
字节的动作比较典型。一边,Seedance 2.0、Seedance 2.5 继续把视频生成往更强的创作工具推进;另一边,Seed 团队又开始解决实时音视频交互的问题。8 月发布的 SeedRealtime 是一个原生音视频全双工模型,可以持续理解声音、画面和时间信息,并在对话中处理打断、环境变化和上下文。
它不是传统意义上的实时视频生成模型,但它指向了一个相似的变化:AI 不再只是等待用户输入,再生成一个结果,而是开始持续存在于一个现场里。
关于实时视频这场全新的竞争,我和生数科技流式视频生成和推理负责人张金涛有一次长聊。
生数科技是由清华朱军团队创立于 2023 年的模型公司。金涛是00后,此前他主要做模型推理加速。2024 年,他在跟随朱军老师读博的第一年,和团队做了 SageAttention,用低比特计算加速 Attention,在生数的视频模型中实现了端到端两倍以上的加速。这段经历后来恰好对应了实时视频的现实难题:模型不仅要生成得足够好,还必须生成得足够快,而且成本得让普通用户用得起。
2024 年 5 月,生数准备发布第一版模型并面向全球上线时,张金涛开始以实习的形式参与视频模型的推理优化。到 2026 年 3 月,他成为实时视频生成团队负责人。4 个月后,生数发布 Vidu S1,把视频生成推进到实时互动:用户上传一张图片,可以让一个数字角色实时回应、做动作,而且这套能力已经可以在消费级 GPU 上运行。两个月后,Vidu S2发布,进一步把实时能力从数字人扩展到视频编辑,可以实时改变人物、服装、背景和风格。
产品变化背后,其实是更大的问题:
如果视频也可以像语言一样实时生成,那么它最终会成为一种什么样的媒介?
与此同时,大厂正在进入。在这场全新的竞争里,最后最有价值的,到底是模型本身,还是掌握用户入口的平台?
以下是我们的对话。

01
这一轮实时视频,和元宇宙那一波有什么不同?
顾翎羽:为什么AI视频要从离线生成走向实时交互?
张金涛:并不是说我们要从离线生成走向实时交互,而是说实时交互它是个新的需求,我们是要满足这么一个新的需求。
离线生成主要是一个创作工具,市场极限不会特别大。这是需求决定的。假设每个人每天看一个小时视频,全球有 60 亿人,但一段内容可能会被很多人重复播放,所以最终的生成需求还要除以平均播放量。即使未来大量离线视频内容都由 AI 生成,它的市场极限还是会受到这个逻辑限制。
实时交互不一样。语言模型里,每个人都有自己的 session。技术从业者每天写代码、问技术问题,会消耗很多 token;普通用户也会和豆包、ChatGPT、Gemini、Claude 聊天。实时视频也是一样,它满足的是每个人独立的实时交互娱乐需求、交互性的视觉享受,它也是每个人一个独立的会话。人类的实时交互的视觉享受的需求是非常大的,几乎每个人每天大量的活动都是实时交互的,包括出去玩、和朋友交流、打游戏等。
所以我认为,实时交互的视频,或者说实时交互的多模态娱乐需求,它是一个新的、非常大的市场。
顾翎羽:这一轮实时视频,和元宇宙数字人那一波有什么不一样?
张金涛:首先是成本。传统的数字人采用 CG 加动作捕捉,你可能要设计好这个形象和这一套动作捕捉的标准,也就是说初期成本就比较高。
但是现在的模型,你上传一两张图片,点一下开始,等个四五秒,就可以开始实时地去聊了去用了,初期使用成本上是有明显差异。其次,传统元宇宙里面的数字人不能实时交互,只能按照模板设定的动作去执行。
现在实时交互模型,你跟它交互的内容就决定了它要生成的内容,是没有任何预设的模板的,你想让它干什么,都可以去实时地发生。
顾翎羽:真正让这一轮实时视频成立的关键是什么?
张金涛:模型本身的能力到了一个新的阶段。
以前很多事情做不到,不是大家没有想象过,而是模型没有办法在足够低的成本下完成。现在视频生成的质量已经上来了,同时模型的理解能力也在提高,再加上推理优化,让它开始有可能进入实时场景。
实时视频生成技术是最近半年才开始发展,配套的下游产品和产业还没有完全发展起来,但已经开始了。一年以后,我相信会有很多成熟应用,竞争也会更激烈。
顾翎羽:这个行业什么时候会真正爆发?
张金涛:在未来的两年左右,会达到一个比较接近 GPT-3.5 的爆发点。
顾翎羽:如果看得更远一点,实时视频的需求规模最终会到什么程度?
张金涛:3 到 5 年后,实时交互的视频,或者说实时交互的多模态娱乐需求,至少市场是跟语言模型类似,或者甚至比语言模型还要高。
顾翎羽:你觉得 3 到 5 年就可以?
张金涛:至少技术上是没有这样的瓶颈的。
02
实时视频的第一条指标,不是画质,而是“跟得上”
顾翎羽:实时视频最核心的技术指标是什么?
张金涛:首先是速度至少要跟得上播放速度。比如一个视频是 24 帧或者 30 帧每秒播放,你不能生成一帧需要几百毫秒、几秒钟,那它就没办法真正进入实时场景。所以我们首先要解决的是端到端的 latency 和 throughput,让模型至少能够持续地产生画面。
当然,速度达到实时以后,画质依然非常重要。但如果速度没有过这个门槛,画质再好也没有办法形成真正的实时体验。所以我会把它理解成一个比较硬的 threshold:先做到实时,再去讨论质量、稳定性、交互体验这些问题。
顾翎羽:如果只是不断提高生成速度,是不是就可以从离线视频走到实时视频?
张金涛:提高生成速度是必要的,但不等于实现了实时视频生成。像 TurboDiffusion 这样的加速技术,可以大幅缩短视频生成的时间。但如果沿用离线生成的方式,本质上还是先给定一个 prompt,再把一整段视频生成出来。它解决的是“这段视频多久能生成完”,不代表用户在中途改变 prompt,画面就能立刻响应。
实时视频更关心的是另一种速度:从用户输入一个新指令,到这个指令真正影响画面,需要多久。
比如视频正在向前推进,用户突然说“向左转”,系统需要及时(比如0.1s内就响应)接上这个动作,同时保持前后画面的连贯。如果还要重新生成一整段,再把结果播放出来,即使生成得很快,也很难形成实时交互的体验。
所以,这不只是推理加速的问题,算法的设计目标和对应的工程建设都需要改变。生成速度回答的是“视频做得有多快”,实时性回答的是“系统能多快回应你”,这两件事不能画等号。
顾翎羽:Vidu S2 在实时视频上具体做了什么变化?
张金涛:在S2中,我们更关注的是怎么让生成的视频真正能够被实时交互和实时编辑。
这次主要有两个方向。一个是S2 Avatar。除了简单的说话、表情和肢体动作,也能实时响应跳舞这类比较复杂的动作指令。在生成过程中还可以随时加入新的参考图片。比如互动到一半,你给模型一张物品的图片,它可以让���色把这个物品拿起来。也就是说,Avatar 不再只是一个预先设定好的数字人,而是可以在互动过程中持续接受新的信息和指令。另一个方向是S2 Editing。它的输入可以是一段正在发生的视频流,模型一边接收视频,一边实时修改,再持续输出新的画面。比如视频播放过程中,你可以随时切换风格、角色、服装或者背景,同时保留原来人物的动作和视频内容。
顾翎羽:游戏里的 NPC 是不是也可以用这种模型来做?
张金涛:我觉得是一个很自然的方向。传统游戏 NPC 的行为其实有很多预设,它在什么情况下说什么话、做什么动作,很多都是提前设计好的。如果模型能够实时理解玩家的行为,再生成相应的视觉反馈,那么 NPC 的自由度就会提高很多。
但这里面也有一个很现实的问题,就是成本。如果一个 NPC 的每一次反应都需要大量 GPU 资源,那商业上能不能成立是另外一回事。所以最后还是会回到我们刚才说的,模型不仅要足够好,还必须足够快、足够便宜。
03
实时视频不缺原始数据,缺的是好数据
顾翎羽:像具身行业,因为还是比较受到数据的限制,有些人觉得不会有突然的、爆炸性的 GPT 时刻。你觉得实时视频生成也是这样吗?
张金涛:我觉得不完全一样。具身智能现在比较明显的问题是,真实世界里能够直接拿来训练的数据本身就比较少,机器人做一个动作,需要真的去执行、去采集,这个成本比较高。
但视频其实不缺原始数据。中国每天都有非常多的视频产生,短视频、直播这些内容本身就是非常丰富的数据。所以我们的问题不是“没有视频”,而是这些视频里面有多少真正能够被模型利用的数据。
顾翎羽:所以这是中国模型的优势?
张金涛:对,我觉得这是一个比较明显的优势。这意味着原始数据的来源很多。但原始数据多只是第一步。真正决定模型效果的,还是你能不能把这些原始数据变成适合训练的数据。包括清洗、筛选、标注、理解,以及最后怎么构造训练任务,这些都会影响模型。
顾翎羽:什么是高质量的数据?
张金涛:我们现在生成视频,都用的是 Diffusion Model。我认为它的本质是一个渲染器,它不需要有任何的智能。所以你只需要把你想生成的内容,首先你得有你想生成的内容的数据,你得把这个数据里边的画面中的东西都标注出来。
一个好的数据,首先它的画面质量得很高,它的视频数据本身是你想让这个 Diffusion Model 想要生成出来的一个状态。
第二点呢,你能对这个视频做非常详细的标注,你能把这个视频发生了什么,用文本标注得非常详细。因为如果你不标注的话,你怎么能让渲染器去渲染出来你没有标注的部分,是很难的。
04
模型从被动响应走向主动判断,难点在哪里?
顾翎羽:如果未来实时视频越来越依赖 Agent,模型是不是也会越来越像一个实时决策系统?
张金涛:会有这个趋势。因为实时场景下,用户不会每一次都给模型一个非常完整的 prompt。很多时候用户只是说一句话,甚至只是做了一个动作,模型就需要根据上下文去判断他想干什么。
所以模型的工作其实会从“按照指令生成”变成“理解上下文,然后决定应该生成什么”。VLM Agent在这里面就比较重要,因为它能够帮助模型把用户的自然语言、视觉信息以及上下文结合起来。
但这也会让系统变得更复杂。
以前可能就是一个模型从输入到输出,现在可能会变成多个模块协同,包括视觉理解、Agent、生成模型、后处理以及安全控制。实时要求又意味着这些模块之间的 latency 都不能太高。
顾翎羽:模型变得更主动以后,会不会反而更难控制?
张金涛:这个确实是一个需要考虑的问题。模型越主动,它能够理解和完成的事情就越多,但同时你也会希望它在一些边界上是可控的。尤其是实时场景,模型没有太多时间让你人工干预,所以安全、内容控制、身份和年龄判断这些事情都需要尽量放进系统里面。
比如涉及明星脸、人物身份这些内容,就需要有比较严格的限制。实时视频不是说模型能生成什么就都生成什么,它最后还是要在一个真实的产品环境里运行,所以技术能力和安全能力其实是同时往前走的。
05
实时视频的算力,首先得让普通人用得起
顾翎羽:实时生成视频和大语言模型相比,算力消耗大概是什么样的?
张金涛:大语言模型它有小的也有大的。实时视频生成模型它也有大的有小的。模型之间很难直接对比。
只是说我们目前可能希望以一个更低的成本去实时部署它,所以现在我们需要的实时视频生成需要的算力没有那么大。对于一个模型来说,可能一台消费级的显卡的机器就可以。
顾翎羽:因为要控制用户的使用成本吗?
张金涛:因为我们希望每个人能够都能支付这个费用。
顾翎羽:但如果未来实时视频真的大规模普及,单靠现在的消费级 GPU,会不会成为限制?
张金涛:现阶段消费级显卡对我们的限制相对没那么大,目前的算力和硬件条件能够满足我们的需求。
长期来看,随着实时视频对 latency、throughput 的要求越来越高,模型和底层硬件之间肯定会有更深的协同,包括推理 Infra、算子优化以及软硬件适配等。不同模型公司的路径也会不一样,有的会更深入地参与底层硬件优化,有的会和芯片、Infra 公司合作。对我们来说,核心还是围绕模型实际需求,把整个推理链路的效率持续做上去。
顾翎羽:所以除了模型公司自己做芯片,未来也可能会出现专门为模型公司提供芯片 Infra 的公司?
张金涛:做定制化芯片,一定是个正确的路线。
06
如果平台掌握流量入口,模型公司怎么办?
顾翎羽:这个赛道做大了,不一定最受益的是模型公司,有可能是掌握流量入口的平台公司。你觉得这个对你们来说是威胁吗?
张金涛:很明显是个威胁。
顾翎羽:你们有什么觉得比较好的对策?
张金涛:第一点是我们就只做纯模型,也没什么不好。我们把这个流量入口给其他人,就相当于提供这种 API 服务。这也没什么不好。很多模型,像 DeepSeek,或者像 Kimi,它们也没有太多流量入口,但只要它们的模型还是相对比较领先的,它就靠这种 API 服务,也能把公司做得很好。只当一个 API 供应商也没什么不好。
第二点呢,我们也会去尝试去做我们自己的一些流量入口。
顾翎羽:大厂下场了,你们的窗口期有多久?
张金涛:如果我们现在把 S2 发了之后,什么都��做了,那可能半年以内,大家就都会赶上来。但我们肯定还是要持续去做。
顾翎羽:你会有很强的焦虑感吗?
张金涛:做模型的人都会有这种焦虑。大家都会担心自己是不是慢了一步,是不是认知已经落后了一些,或者某一个环节是不是没有做到当前最领先。这些过程都会让你担心自己是不是还在最前面。因为模型的竞争本来就很残酷,做模型的人不能停下来,必须一直向前。
本文来自微信公众号“腾讯科技”,作者:顾翎羽,编辑:苏扬,36氪经授权发布。