Sora 关停之后,AI 视频的比赛,正在从「15 秒」变成「5 分钟」

摘要

做视频,你更愿意用一句话对话生成,还是自己搭节点、调参数?

 

2024 年 2 月,Sora 的演示视频在一夜之间刷屏,我身边做影视的朋友第一反应是「完了」,第二反应是「等等,它什么时候能用」。

答案是:等了很久,然后没了。2026 年 3 月 24 日,OpenAI 宣布关停 Sora,网页和 App 在 4 月 26 日停服,API 定在 9 月 24 日下线。一个点燃了整个赛道的产品,从封神到退场只用了 25 个月。

所以当我听到智象未来讲述5分钟生成时,第一感觉有点微妙:那个曾经被拿来当靶子的对手,已经不在赛场上了。

但换个角度想,这个对比恰恰说明了一件事,Sora 定义的「15 秒惊艳片段」时代,正在被翻篇。接下来大家比的是什么,vivago R1 给了一个答案,它未必是正确答案,但方向值得认真看。

「5 分钟」到底难在哪

vivago R1 是智象未来的「内容创作智能体」,7 月在 WAIC 2026 首次亮相,9 月 8 日面向全球开放,国内版本叫「够搭」。据介绍,vivago.ai 从 2024 年 5 月上线,全球用户突破 7000 万,两年做到这个规模是真实的增长。作为参照,可灵公开的数据是全球用户 6000 万、2026 年 1 月月活 1200 万。

它主打的能力是一次性稳定输出 5 分钟视频,并支持无限次多轮延长。作为对照,通稿说 15-30 秒的片段式生成「依然是行业主流」。

截至 2026 年初,主流工具的单次生成时长大致是,Veo 3 和 Sora 2 最长 60 秒,Runway Gen-4 约 30 秒,可灵的高级会员已经能到 3 分钟。「行业主流还在 15-30 秒」这个说法,放在今天已经偏保守了。

但做过视频的人都知道,长视频的难点从来不是「把时长拉长」,而是「让故事在几十个镜头之间持续成立」。 同一个角色换了三个场景以后脸还是不是那张脸,声音是不是同一把嗓子,剪辑节奏有没有断掉,这些在 15 秒的片段里根本不用考虑的问题,到了 5 分钟全部会暴露出来。

也正因为如此,直到今天,专业创作者的实际工作流仍然是把长片切成一个个 5 到 15 秒的镜头分别生成,再拿到剪映或 Premiere 里手动拼接。「更长」在很长一段时间里都不等于「更好用」,前后一致性下降、提示词偏离,是所有人都踩过的坑。

R1 的解法,是不在模型层硬扛,而是在系统层做调度,一个主 Agent 负责拆解创意,一组子 Agent 分别负责脚本、分镜、角色、场景和音效,中间靠智象自研的 HD-AgentOS 做全流程编排。用智象创始人兼 CEO 梅涛在 WAIC 上的话说,一个看似简单的「分镜生成」任务,需要理解镜头语言、叙事节奏和体裁差异,这不是直接调一次大模型 API 能做到的。

换句话说,R1 的真正卖点不是「5 分钟」,而是「5 分钟里的一致性是谁在管」。 模型负责单镜头的画面质量,Agent 负责跨镜头的连续性,这是一个分工,而不是一个模型参数。

R1 流程示意|图片来源:智象未来

Chat-First :把复杂藏起来,也是把控制权收回去

抛开数字,R1 最有意思的产品选择,是它明确站到了「对话优先」这一边。

目前 AI 视频工具大致有两条路线:一条是画布式、节点式的工作流,把模型、工具和参数全部交给用户自己连接,自由度高,门槛也高;另一条是 R1 这种,用自然语言描述需求,系统自动生成,再在对话里持续调整。

智象把它的方法论总结为「做后」和「做厚」:「做后」是把专业创作者的判断、审美和经验编码进 Agent 的编排能力,形成中后台;「做厚」是建一个 SkillHub,把抽象的 AI 能力翻译成产品广告、角色视频、故事短片这样的具体场景,让用户知道能做什么、从哪开始。用户只表达目标,Agent 负责拆解和执行,SkillHub 作为翻译层,自动匹配需要的 Skill 组合。

「R1 的对话式创作,不是把复杂消灭,而是把复杂藏在简单背后。」 这句话是对的,但它同时也暴露了这条路线的代价。

复杂被藏起来的同时,控制权也被藏起来了。 一个做广告片的创作者,客户说「把第三个镜头的产品往左挪一点,光再冷一点」,在节点式工具里这是拧两个旋钮的事;在纯对话里,你得赌 Agent 能不能准确理解「一点」是多少,以及改动会不会牵连其他镜头。行业里已经有人指出,各家都在竞相拉长时长、拉高分辨率,但很少有人真正解决「可控性」,而这恰恰是创作者最在意的核心命题。

对话是最好的入口,但不一定是最好的终点。 真正成熟的形态,大概率是「对话生成初稿、精细工具修改细节」的混合模式。R1 推出的资产库功能,把用户认可的角色、场景沉淀下来,在后续创作中复用,其实已经是往这个方向走了一步:当角色成为可复用的资产,「项目制」创作才真正成立,用户手里也才真正握住了一些确定的东西。

模型上限,系统下限:AI 视频进入「中国时间」之后

把 R1 放回行业里看,我觉得它出现的时机比它的参数更值得讨论。

Sora 的关停,被很多人解读为「AI 视频不行了」。但更准确的读法可能是:单靠一个惊艳模型、缺乏商业化路径的产品形态不行了。 OpenAI 把算力和团队转向了更赚钱的企业工具和代码业务,视频这条线被交给了市场上「千万个替代品」。

而替代品里跑得最快的,是一批中国公司。字节的 Seedance 2.0 在春节前后重新定义了物理真实感的天花板,可灵靠着快手电商生态和广告、短剧客户,做到了年收入 1.4 亿美元量级。这两家走的是「大厂 + 生态」的路,模型足够强,再往两边接分发和商业化。

智象走的是另一条。它是一家创业公司,创始人梅涛来自学术和大厂研究院体系,2025 年靠开源图像模型 HiDream-I1 在开发者社区建立过存在感。它没有抖音也没有快手,所以它选择在「系统层」建立差异:基础模型决定能力上限,智能体系统决定交付下限。 当模型能力的差距在缩小,谁能把能力稳定地组织成作品,谁就能拿到预算。

Sora 的 15 秒,回答的是「AI 能不能生成视频」。两年过去,这个问题已经有了肯定答案,问题本身也就失效了。R1 的 5 分钟,试图回答的是「AI 能不能交付一部作品」——这个问题目前谁都没答完,包括 R1 自己。但把问题问对,本身就是这个阶段最重要的进步。

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。