首页 > 资讯 > 实测全球上线的 vivago R1,我用它打造了一部赛博西游记短片

实测全球上线的 vivago R1,我用它打造了一部赛博西游记短片

爱范儿 2026-09-08 21:40 2 阅读 查看原文

上周,《后西游记》在湖南卫视黄金档时段上映。

这部剧最大的特点,是全程采用 AIGC 参与制作,并可根据观众反馈调整未播内容。首播后,《后西游记》拿下同时段省级卫视收视第一,制作成本约为真人剧的十分之一,芒果 TV 官方播放量已达 1.1 亿次。

关注度之外,AI 视频正在进入新的阶段。过去,AI 更多承担单个镜头、单张图片的生成工作,而如今,行业开始探索让 AI 参与完整内容生产流程。

APPSO 之前也报道过,2026 世界人工智能大会(WAIC)期间,智象未来(HiDream.ai)正式发布全球首个无限时长内容创作智能体 vivago R1。

现在,vivago R1 已经正式全球上线,国内版本名为「够搭」(以下统称 vivago R1)。它试图解决的是另一个问题:当 AI 已经能够生成画面之后,普通人距离制作一部完整作品,还有多远?

▲ vivago R1 体验地址:vivago.ai
够搭体验地址:goudaai.com

热知识,vivago R1 是首个可稳定生成 3 至 5 分钟视频的对话式创作 Agent。

不同于需要用户自行搭建工作流的画布式、节点式工具,vivago R1 采用对话式创作路线,用户只需自然语言描述创意,就能完成从故事、脚本、分镜,到角色、镜头和成片生成的全流程,大幅降低了创作门槛。

如果说《后西游记》展示了 AI 如何进入影视工业,vivago R1 展示的则是 AI 如何以 Agent 形式参与影视生产,并将完整的内容生产能力交给普通用户。APPSO 决定第一时间上手测试。

实测 R1 ,一个人就是一支 AI 剧组

既然《后西游记》成为近期 AI 视频领域最受关注的话题,我们直接围绕西游主题进行创作。

我们为够搭设计了一部名为《重启·西游》的赛博朋克短片。

2099 年,人类记忆被统一意识网络「天庭系统」重写,最后一段未被改写的原始数据「悟空」从废弃数据中心中苏醒,携带「真经」穿越赛博朋克新长安城,在被系统猎杀之前上传真经。

视觉风格是东方赛博朋克——敦煌壁画遇上银翼杀手。

把创意输入够搭后,Agent 自动匹配 Cinematic Story Director,先生成完整分镜脚本和关键画面,然后等我确认创作方向之后继续生成视频。

在这一过程中,R1 够搭的 Chat 与画布形成了一套围绕 Agent 协作设计的创作流程。

Chat 负责承接用户意图、调用素材并推动脚本、分镜和视频生成;画布则结构化呈现脚本、分镜、视频及关键资产,方便用户查看进展、比较结果。简单来说,Chat 用于与 Agent 协作,画布用于整理和呈现创作成果。

视觉一致性是够搭给我留下最深印象的部分。APPSO 要求的「冷蓝色赛博世界风格」和「暖金调真经力量」的色调对比贯穿全片,没有跨场景的风格跳变。

悟空的角色形象——赛博僧袍、额头金色电路纹路、琥珀色瞳孔——在多个镜头间保持了辨识度;全息赛博佛像角色也做得相当高级,把那种神圣与赛博元素融合的气质展现得淋漓尽致。

新长安城全景那种细节密度极高的画面,通常是 AI 视频最容易崩的类型,城市细节、人物关系以及整体视觉风格需要同时保持稳定,而 R1 完成的效果已经接近一支完整概念短片。

过去,AI 视频最容易展示的是某个惊艳镜头。但一个行业共识是:即使拿到了世界上最强的模型,普通人依然做不出想要的东西。因为模型能力与用户想要的结果之间,存在巨大的 Gap——这个 Gap 填充的是创作者脑中的审美、经验和判断,是海量被专业训练过的创作直觉。

如今,行业开始面对更复杂的问题:如何让多个镜头、一段故事乃至一整支视频保持连贯。vivago R1 的最大亮点,正是 AI 视频从生成片段走向完整作品的交付。

·当品牌广告,被 AI 装进一个对话框

完成长视频测试后,我们又尝试了商业广告场景。

我们准备了测试素材:一张人物照片、产品包装和 Logo;让够搭用这些素材做一条社媒广告——「每吃一口,人格切换一次」:没吃前低电量,第一口职场精英,第二口热血侠客,第三口松弛日常。

够搭匹配 Story Ad Director 后,先生成广告分镜,再根据确认后的方案完成视频制作。整个过程中,人物形象和产品包装保持了较好的连续性。

对于品牌、电商和内容创作者而言,AI 视频的价值体现在降低制作成本、缩短修改周期,并减少重复制作与人工调整的投入。当视频生成逐渐从一次性的创意尝试,走向稳定、可交付的生产流程,AI 视频也开始展现更清晰的商业价值。

·AI 开始理解互联网那些「人类暗号」

更刁钻的测试是网络热梗。

我们又输入了一段充满谐音梗的任务——「噜妹噜妹噜妹妹,猪 mer 猪 mer 猪 mermer…..,噜妹听到后走过来掐一下噜噜的脸,哄哄噜噜」。

这类内容看似简单,但实际上需要理解谐音梗、理解「掐脸」的情感含义、还要编排成有节奏的视频。不仅考察它的视频生成能力,还考察它的搜索和理解能力。

R1 先通过 Websearch 查了这个梗的来源,然后生成了包含原创角色和情绪转折的完整视频。

整个使用过程中,我们都没有告诉他噜噜的形象和声音,尽管如此,够搭做出来的还原度和情感表达已经相当不错,萌化了老夫的少女心。

·未来每个人,都可能拥有自己的数字资产库

除了直接生成内容,够搭还有一个更重要的能力:帮助用户沉淀自己的创作资产。

在够搭的 SkillHub 中,用户可以找到大量预设功能,将抽象的 AI 能力转化成具体创作场景。它的价值在于降低用户理解 AI 能力的成本,让更多人知道自己可以用 AI 完成什么,也让创作从「想到一个点子」更快进入执行阶段。

其中,OOTD Advisor 是一个比较有代表性的功能。

APPSO 准备了一个 AI 生成的人物照作为素材,把它发给够搭,然后让它结合上传的人物形象特点,帮忙搭个四五套衣服。要求是既适合通勤穿,又不显得普通有班味。

它最终帮我搭配了四种风格的 OOTD, 说实话,每一种风格都颇具特色,真的太方便了!以后想试衣服,直接把我的照片和在网上看好的衣服发给它,岂不是可以直接赛博试衣?

最最最令人兴奋的功能,还不止如此。我们精挑细选,好不容易搭配出喜欢的穿搭,做出想要的动漫形象,以及栩栩如生的场景,总不能每次都「抽卡」吧?

够搭针对这种割裂感的体验,推出了资产库积累功能。资产库和普通收藏的差异在于,普通收藏通常保存的是用户看到的内容,而资产库沉淀的是用户在产品内生成、筛选并认可的内容,并在后续创作中直接调用。

比如我可以把我最喜欢的 OOTD 添加到资产库,再把噜噜的形象,还有之前「赛博西游」中的「天机塔」场景都加到素材库,来一场跨次元的对话~

一次创作不再只是一次性输出,而会逐渐成为下一次创作的素材基础。

从留声机到 vivago R1,人类创造力迎来第三次释放

回看人类历史,真正改变创作方式的技术,往往都在解决同一个问题:如何让更多人的想法抵达最终作品。

1877 年,爱迪生发明留声机,让声音第一次被记录和复现,人类表达开始摆脱时间与空间的限制。进入 20 世纪,单反相机的问世,尤其是微单的普及,让摄影从少数人的专业技能变成普通人记录世界、表达自我的方式。

留声机让每个人都可以保存自己的声音,单反相机让每个人都可以记录眼前的世界。

而今天,AI 视频正在推动第三次创造力释放。

过去,一个人脑海中的故事想变成一部完整视频,需要经过一条复杂的专业链路。编剧负责构建故事,导演负责设计镜头,摄影负责捕捉画面,剪辑负责组织节奏,后期负责完成最终呈现。

创意和作品之间,始终隔着一层复杂的「翻译层」。

AI 视频的发展,正在改变这一关系。

早期 AI 视频模型,例如 Sora,让大众第一次看到机器生成视频的可能性。一句自然语言描述,就可以生成具有电影感的画面,让人类第一次感受到 AI 视频创作的魔力。

但从一个惊艳的镜头,到一部完整的视频作品,中间依然存在巨大距离。视频创作真正困难的地方,在于如何让多个镜头保持统一,让角色在不同场景中保持一致,让故事拥有连续的叙事逻辑。

这也是 R1 想解决的问题。如开头所述,当下行业正在形成两条路线:一种把模型、工具和参数交给用户,让创作者自行组合和调试,换取更高自由度;

另一种则像 R1 一样,是将专业创作者的经验、审美和判断逻辑融入 Agent 编排能力。用户只需简单对话,背后则由 Agent 理解并执行完整创作流程。

两种路径没有绝对对错。前者上限更高,适合专业创作者;后者门槛更低、交付更稳定。

这也指向一个更本质的判断:模型能力不等于产品能力。

在 AI 视频创作里,模型和工具链再复杂,若不能将创意稳定组织成完整作品,就只是「能力展示」,而非真正的生产力。

除了面向普通用户的对话式创作体验,R1 也开始向开发者和专业内容团队开放更高阶的使用方式。目前,够搭已经支持 CLI 命令行交互模式,让用户可以通过终端直接调用视频生成、素材渲染、任务调度以及参数配置等能力,感兴趣的朋友不妨尝试一下。

而从够搭出发,我们也可以进一步看到它背后的公司——成立于 2023 年的智象未来(HiDream.ai)。

作为一家专注多模态生成式人工智能的企业,智象未来自主研发了 HiDream-O1 系列大模型,并将多模态理解与生成能力应用于内容创作。

支撑这一目标的,是智象未来在模型架构上的长期探索。当前许多视频生成模型会先将图像压缩至隐空间,再基于压缩表达进行学习和生成。虽然这种方式能够降低计算成本,但也可能损失文字、表情和纹理等细节。

HiDream-O1 系列采用原生全模态 UiT(Unified Transformer)架构,减少 VAE 和独立文本编码器等环节,将图像像素、文本 Token、视频体素、音频、动作及空间关系等原始信号映射至统一 Token 空间,再通过同一套 UiT 完成理解、生成和推理。

在这一技术路线下,智象未来进一步拓展了世界模型的能力边界。截止到今年 7 月,智象未来原生全模态交互式世界模型 HiDream-O1-World 在 WBench 评测中取得领先表现。

无论是 HiDream-O1-Image,还是 HiDream-O1-World,智象未来作为创新型大模型企业,正逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型家族矩阵,构建统一世界模型基座的技术闭环。

而模型之外,智象未来也在持续推动产品化加速落地。

如果说 HiDream 系列大模型探索的是模型能力的上限,那么 vivago R1 则致力于把这些能力转化为人人都能使用的创作体验。

从留声机到单反相机,再到 vivago R1,人类创造力的每一次释放,都伴随着创作门槛的降低。

一边是在提升 AI 视频生产的能力边界,一边是在扩大参与创作的人群范围。当这两股力量同时推进,够搭真正改变的,将是未来每个人都拥有用 AI 讲述自己故事的机会。

作者:单玉喆、莫崇宇

爱范儿,让未来触手可及。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。