
程浅 发自 凹非寺
量子位 | 公众号 QbitAI
AI视频Agent已经告别大抽卡时代了?
创作者们不用十连抽开盲盒,不用当炼丹师,一次性就能整明白了?
历经两个月的内测,以“确定性交付”为核心卖点的AI视频创作智能体Vivago R1官宣上线。
△
Vivago R1负责人介绍产品
此前,vivago.ai积累全球用户超7000万,曾登顶Product Hunt日榜第一。
官方的slogan很明确:让AI视频告别抽卡模式,走向确定性交付。
话虽如此,它的实际表现到底怎么样呢?AI视频创作者真的可以一举告别抽卡吗?AI视频的格局会因此被改写吗?
我们第一时间来到发布现场进行了深度实测。
AI视频产品千千万,Vivago R1有什么特别的?
请各位先来看实测。
我先给Vivago R1输入了一个小说片段。
章北海看着悬浮在液体中的显示界面,看到深海加速液依次充满飞船上各个有人的舱室,这个过程持续了十多分钟……章北海感到父亲的灵魂从冥冥中降落到飞船上,与他融为一体,他按动了操作界面上那个最后的按钮,心中默念出那个他用尽一生的努力所追求的指令:“自然选择,前进四!”木星轨道上突然出现了一颗小太阳,它强烈的光芒使得行星上大气层中的磷光黯然失色……
Vivago R1很快get到了意思:

之后给了一系列风格、时长、尺寸等可操作的选项,跟着选就好……
还有大纲,也会先给你check一下:

然后开始出剧本和分镜。

能看出这里的剧本是将小说里文学化表达进行了拆解,细化成了“脚踝、膝部、腰际”、“A区、B区、C区”这种可视化表达。
然后开始生图,也就是所谓的图片资产。

不得不说,木卫一让人眼前一亮,但这个章北海的“选角”怎么说呢……
交给大家评价了!
之后,每个图片都会生成相应的视频片段,这些片段可以直接下载自行剪辑,当然,Vivago R1也会直接给到你一个合并版。
大家可以看看成片效果,一次直出无调整,音效同为视频生成。

各位感觉如何?
个人感觉,虽然存在一些bug(比如加速液的充盈感没有体现出来,飞船的显影太突然),但整体的质感还不错。

以及,我很困惑为什么其中章北海要眨眼,于是去翻了一下这里的创作思路。
Vivago R1表示这是为了突出“章北海在意识即将沉入黑暗的瞬间感受到父亲灵魂的降临”,于是在最后一次睁眼时神色坚毅了。
只能说生成这么抽象的场景也是难为你了。
通过上面的流程,或许可以比较清晰地理解产品负责人给它的定位:一个对话式的视频创作Agent。
在Vivago R1团队看来,这个定位涉及两个层面的区分。
第一层,是与传统视频生成工具的区分,此类工具交互逻辑较为简单:用户输入提示词,模型输出视频片段。
第二层,是与画布式或节点式的工作流平台的区分。此类平台通常将模型、参数和创作流程以可视化节点的形式暴露给用户,具有高自由度,高操作门槛。
相较之下,Vivago R1的定位更突出以对话作为创作的主入口,即用户用自然语言描述创作意图,Agent负责理解、拆解并执行从剧本到成片的完整链路。
R1的对话窗口还与可交互画布双向锚定,对话中产生的资产(角色设定、分镜脚本、生成片段等)会自动同步到画布的对应位置。

在视频时长方面,发布会并未使用“无限时长”的表述,但承诺当前可以稳定输出5分钟左右的完整连贯作品,且能够保持人物、场景等资产的一致性。
技术手段上,R1使用了多Agent架构。
由主Agent负责接收和理解用户的自然语言意图,将其拆解为结构化的创作任务;多个子Agent则分别负责脚本生成、分镜编排、角色设计、场景构建、音效匹配等具体执行环节。
两种路径:用户编排还是系统编排?
实际上,在2026年的AI视频赛道中,“Agent端到端成片”并不是一个十分罕见的品类。
所以问题就来了。
既然各家都在底层聚合了高度相似的视频模型(如可灵、Seedance、Veo等),那么产品之间的差异化壁垒在哪呢?
或许会逐渐落在产品交互逻辑与“由谁来做决策”的底层设计上。
这种设计正在逐渐分化为两条截然不同的路线:
第一条路线是“用户编排”,即倾向于把模型选择、参数微调与流程控制以无限画布和节点工作流的形式完整暴露给前端。
另一条路线是系统编排,比如Vivago R1,主张由系统承接中间层的所有工程与参数复杂度。
实际上,产品内在的复杂度有一个可以简化的临界值,到达临界值后,唯一能做的就是将固有的复杂性从一个地方转移到另外一个地方。
这是“复杂度守恒定律”,1984年由泰斯勒提出。
技术越成熟,操作越简单,内部越复杂。
因此,谁能承接好这部分复杂度,把用户的注意力释放给内容创意本身,谁就能打开更广泛的大众创作市场。
虽然系统编排听上去更高级些,但也更难做。
为了让系统替用户做决定,R1需要在背后建立一套评估机制,在一致性、意图理解和稳定性等方面之间动态权衡。
另一方面,模型路由可能是这款产品的关键支撑所在。
也就是让系统知道:什么任务、什么风格该用什么模型、什么时候用贵的或是便宜的……这需要对每个模型能力边界和任务匹配度有充分的理解和判断。
Vivago R1产品负责人将当下的视频生成能力划分为五个阶段,以此来定位自家产品的位置。

L1是基础的3s左右的可动镜头,L2是适配营销的多镜头单场景,L3是单角色跨场景叙事,L4是支持社交媒体持续内容产出的单IP人设连载,L5则是更远期的多角色、跨剧集AI短剧。
目前,Vivago R1将自身的能力重心定位在解决L4阶段,依托多Agent架构沉淀资产档案,保障角色、风格在跨周期创作中的长期一致性。
上手几天,实际感受如何?
总结一下实测感受吧。
首先比较明显的感觉是:整体输出的稳定性不错,一次输出的结果里多少已经有了可用内容。
这或许就是Agent编排路线相对于单次生成模式的一个实际优势。
但成本需要结合具体用途来看,据产品团队介绍,当前生成一条完整视频的成本约在百元左右。
这个价格对于品牌商业视频来说是合算的,毕竟传统制作流程中从脚本到成片的人力和时间成本远高于此。
但对个人创作者来说,或许略有昂贵。
官方的解释是,R1不追求单次生成的绝对低价,而是通过稳定输出来降本增效,而后续也会朝着降成本的方向继续努力。
其次,分镜策略比预想中精细。
这可能是AI视频生成领域长期存在的一个问题:同质化。
由于多数产品依赖模型直接输出,不同输入得到的镜头构图、运镜节奏、景别切换相似度会比较高,或者说,缺乏专业叙事层面的差异处理。
但从R1的生成结果来看,产品团队在剧本拆解和镜头规划环节做了比较明显的投入。
△Vivago R1生成片段:主人公经营书店(整理书架、送书)还不能说完全克服了同质化的问题,但至少在“理解内容该怎么拍”上有了明确策略。
此外,交互的灵活性或许会是后续迭代的重点方向。
当前在操作上已经可以在关键节点进行更改,选择。而据产品团队透露,后续版本将开放分镜脚本的自定义编辑功能,同时持续优化各环节的token消耗逻辑以降低使用成本。
One More Thing
值得一提的是,Vivago R1并不是一个孤立的产品。
它背后的公司智象未来(HiDream.ai)是一家基础模型公司,自研的图像生成模型HiDream O1已经开源。
R1是这套模型能力的应用层呈现。
沟通中了解到,团队中包含影视行业资深从业者和一线漫剧、短剧创作团队,产品的创作策略在一定程度上来源于真实的行业经验积累。
团队坦承产品尚处初期,当前的重心在于跑通“端到端”的连贯创作体验,能力上限仍有广阔的舒展空间。
但从Vivago R1的使用中,我们或许可以对创作范式进行一次重新审视。
毕竟随着基础模型能力的跃迁,AI创作工具的分水岭逐渐转向对创作者表达欲的服务能力上。
这不是一个简单的问题。
若将视频生成产品比作马良的神笔,那么,神笔是一个好的创作工具吗?
从效率的角度看,答案显然是肯定的,没有比这更强的生产力了。
但曾有学者指出:这个故事的真正主角可能是神笔,而不是马良。
在获得神笔之前,马良白天放牛、晚上用树枝在地上画画,绘画对他而言是一种无目的的、纯粹的精神活动。
而在获得神笔之后,他的创作开始开始服务于具体的实用目标,他最终画了什么,则由神笔的能力边界和外部需求决定。
Vivago R1的创造应该放在一个未来里被思考,在那个未来里,人们不关心神笔是如何成为神笔的,而只期待纯粹的表达。
因此Vivago R1的系统编排能力,能在多大程度上悄然契合用户心底那个既抽象又挑剔的、关于“好”的直觉标准,或许才是问题的关键所在。
参考链接:
[1] https://m.thepaper.cn/newsDetail_forward_31294632
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟
科技前沿进展每日见