AI 生视频,正在偷偷从云端「搬回」家里

摘要

如果本地生视频只花电费,你会给自己做一部短剧吗?

周六下午,广州。一场以「本地 AIGC 创作落地」为名的研讨会,开场不过十几分钟,就把我拉进了一张账单里。

英特尔中国技术部 AI 方案技术总监 王巍巍,提起这两天在圈子里传得很火的一个帖子:一家做漫剧的创业公司晒出 7 月账单。收入不错,自然流分账 24 万,平台返了 9 万多,加起来三十几万。但算力成本花了 19 万 5,人工 5 万,再加上版权、水电、场地,最后算下来没亏,净赚 4 块钱。两个创始人,一人两块。

台下笑了一阵,笑声里带着点苦涩。这大概是当下 AI 短剧创作者最真实的写照:创意平权了,钱却都交给了云端的算力。

我去这场会,原本是想看看英特尔的 Arc Pro B70 显卡在 AIGC 上能做到什么。但坐了三个小时,我发现更有意思的,是坐在台下和茶歇时凑过来聊天的这群人。他们有的手搓了 31 集短剧,有的用一周做成一部十分钟的同人电影,有的带着「采购任务」而来,有的只是想偷偷做一部自己想看的剧。

 

「不想再当云端算力的搬运工」

英特尔中国技术部总经理高宇上台,第一句话就问大家还记不记得 B70 是什么时候发布的。台下有人答:4 月 23 日。他说这张卡发布才四个月,「我个人的体感,像过了一个世纪」。

这四个月里,几乎每周都有新模型面世,桌面智能体成了每个人工作流里不可或缺的工具,AI 短剧赛道「非常非常活跃」。他自己每天至少刷一小时视频,观察是现在刷到的 AI 视频,比三个月前精致程度大幅提升,「完全可用、完全可看」,不再只是无脑爽剧。

「今天是一个创意平权的时代。」 他说,过去有想法、有创意的人,受限于拍摄设备、制作设备、资金投入,实现不了导演梦;今天只要有 token,你就能当自己的人生导演。

但话锋一转,他把问题引向算力。去任何一家生视频网站,抽卡、排队、等 slot,耗时也耗钱。而且他判断算力平台「可能还要涨价」。内存在涨,SSD 在涨,显卡在涨,连英特尔自己的 CPU 也在涨。生视频和大语言模型不同,后者可以靠 PD 分离、专家并行提升并发,而视频生成本身是算力密集型,并发很难提高,「每一个人的时间成本和金钱成本都很高」。

这个判断在现场得到了很具体的印证。一位来自南京 AIGC 短剧公司的听众提到,他们正在做「转绘」,把国内已实拍的短剧,用 AI 换脸换背景重新生成,反向出口到 TikTok。一部 90 到 120 分钟的剧转出来,行业极限大概是 10 天;用字节的 Seedance 工作流可以压到两三天,「但是成本很高,巨高」。

另一位带着「采购任务」来的听众说得更直白。他们单位前段时间要买 RTX Pro 6000,涨价了;领导改成 RTX 5000,结果还在涨,「现在领导说要不先配两台 5000 跑着先」。他补了一句我觉得很关键的话:「成本低的前提,是你一次性要投入更多的成本才可以。」

王巍巍把本地创作的理由归纳为四点:数据隐私,尤其是那些前瞻性的创意和产品设计;内容定制化,本地可跑复杂工作流、训练自己的 LoRA;无需排队、无需审核,「在确定的生产条件下反复打磨创意」;以及长期使用成本。

本地价值回归不意味着放弃云端,「很多场合根据需要随时可以上云」。但那句「大家都不希望成为云端算力的搬运工」,显然更能击中台下的人。

 一群「手搓AI」的人

真正让我坐直身子的,是数字折叠的 Roy 上台之后。

他开场就说,去年这个时候他也在广州做过一次类似的分享,「那个时候其实是没有任何信心的」。他们一直坚持做本地生成,当时还得靠三维辅助才能让片子看起来统一。这一年里,进步巨大,但过程中「人是没有坚持的」很多人慢慢转向了即梦这样的在线平台。他们也曾犹豫纠结:但如果他们也转向在线,那些手里有卡的本地用户,卡就闲置了;社区里那些一直在调开源模型的人,也得不到什么回报。

他们坚持了下来,然后「等来了 MiniMax 的海螺 3,一个最伟大的开源模型,没有之一」。他说社区里很多用户私下叫它「S3 爸爸」,因为在它开源之前,他们用 LTX、用万象做出来的东西,「说话都不敢特别大声」,因为要么人物动态不好,要么一致性保持不了。

然后他放了一部片子。昆仑、探险队失联、殉葬坑、封印破了,一个完整的探险题材短剧。放完他说:「一年前,我们根本无法想象本地用一张显卡,再用一个开源的视频模型,就能手搓出来这种质量的片子。」

这部片子的作者就在现场,他打算自己手搓 31 集。Roy 说:「很感动啊,在所有人都在用即梦的时候,只有我们在坚持。」

接下来他讲的几个用户,我觉得比任何参数都更能说明「本地」意味着什么。

一个是在工厂上班的普通人。Roy 跟他说,你帮我做一个赛博朋克风格的片子,他用数字折叠的「无限画布」加上一张 B70,一晚上就做出来了,无论是角色三视图、面部特征、场景组装、视频生成,人要做的只是「把握方向盘」。选哪个角色、抽出来的剧情感觉如何,这些也不会很重要。「他也不是什么艺术家,也不是搞 AI 的。」

一群是义乌和深圳的电商。他们直接买一套软件、买一块显卡,放公司里跑,设计好脚本,一天生成几百条视频发到自媒体和国际站。

茶歇时,我旁边一位创作者聊起自己的经历,他不想给云端平台充很多钱,就直接玩二创,一个星期做了一部十分钟的蝙蝠侠同人,「电影感非常强」。他也顺口说了句现实的话,他用的这张卡,两个星期前还是 6600,现在 9000 了。

Roy 自己是学动漫设计出身的,后来做教学。他说 AIGC 来临之前,很多学生跟他说「老师我想做导演」,他会说「你别做梦了」,做导演要先学剧本、学节奏,做动漫还得学建模、学绑定。「现在的话呢,我感觉人人都可以做导演了。」

然后他说了一句让我记了很久的话:「有时候我总是觉得我思考的还是太慢了。当这个流程发布之后,很多人找我学习,我说不用学了,我们又升级了。」

 英特尔加速AIGC创业者

回到英特尔。这场会的产品主角是 Arc Pro B70:367 TOPS 的 INT8 稠密算力,32GB 显存,PCIe 5.0 ×16,显存带宽 608 GB/s,售价一万出头。王巍巍反复强调的一点是,它是一张专业级显卡,专业驱动、50 多家设计软件认证、ECC 显存、长时间高负荷稳定运行,「但我们只卖消费级显卡的钱」。

32GB 显存是整场会的关键词。高宇说这个尺寸「对端侧很甜」,正好能把海螺 3 这样的视频模型在本地跑起来,同时还能塞下一个 27B 的千问 模型。他们认为这是当下本地智能体的「黄金配置」。王巍巍给的数字是,Q4 量化后能跑到 50 多 token/s 的解码速率,24G 显存的消费卡也能跑,但想要支持最长 256K 上下文,就需要 32G。

视频生成的实测数据来自两边。英特尔用海螺 3 官方 20 步工作流生成一段 720P、5 秒的视频,大概 9 分钟;如果想要更高分辨率,可以回到 MiniMax 云端的 2K API,也可以在同一张 B70 上用超分工作流把 720P 拉到 2K,大约 7 分钟。

Roy 那边补充了对比,他们测下来 B70 跑海螺 3 文生视频的性能,大约是 RTX 5080 的 85%、4090D 的 70%、5090 的 45%;超分到 1080P 只要 3.9 分钟。他们选的超分模型是开源里效果好但很吃显存的 SeedVR2,「我用这张卡去超分的时候,它不会崩」。

这些数字都不算惊艳,但它们指向同一件事,本地生视频从「能跑」变成了「能干活」。

英特尔还展示了两个偏「视频智能体」的方案。一个是素材检索,千万级博主韩露手里有 2.5TB 视频,用一台四卡 B70 加多模态模型给本地视频打标签,之后用自然语言就能搜到「一个男人和一个 nice 信息」的片段。

另一个是高光提取:一台酷睿主机装两张 B70,一张跑 27B 语言模型撑智能体,一张专职生成,导入一段 10 分钟的产品介绍,输入需求,agent 全程接管,输出 30 秒高光视频,并自动生成片头片尾。这套方案已经给了英特尔自己的市场部,「他们觉得至少可以提效一倍以上」。

部署也被刻意做简单了。Windows 下装驱动、解压便携包、双击脚本,「和 N 卡的使用上没有任何区别」;Linux 下不用配 Python 虚拟环境,直接给 Docker 镜像。

至于未来,王巍巍说明年年初会有下一代产品,网上曝光的算力最高到 1000 多 TOPS,显存最大到 480GB。有人追问多卡显存并用的计划,他认为英特尔 GPU 的策略就是「更有性价比的算力」,一万块钱左右「基本上你找不到这么大的显存」,多卡并行「我们也会去看一看,也会推动生态社区多一些方案」。

AI 导演梦之后,是「生意怎么算」

会开到后半段,问题开始变得现实。

有人问:本地跑视频、跑短剧,距离商业化还有多久?Roy 的回答很坦率,最长支持 15 秒,至于商业化,「就看他们啥时候 2K 开源」。MiniMax 华南的负责人在自己的分享里说得也很实在,海螺 3「离我们心中的 sota 还有距离」,线上的 2K 版本会开源,时间还没定;但已经有一家海外公司基于他们的模型做后训练加美学优化,「现在已经冲到第一了」,他把这看作开源的魅力。

Roy 也补了一句,商用是分级别的。做高质量漫剧,肯定还是用 Seedance;但红果那种快消式短剧,观众不在意画质和动态,只在意剧情爽不爽,「取决于公司的商业架构」。「其实就是这个生意怎么算」,用在线算力还是本地算力,谁赚钱,生意就来了。

不过,现在模型生成视频已经很优质、很高效了,但剪辑环节仍然停留在基础的图片和文字调整。一个好故事的剪辑是需要审美和节奏的,这个方向的进度怎么样?Roy觉得现在故事够不够优秀,在设计分镜时就决定了。他们会做一个类似 3D 导演台的东西,先把简单的素材自动剪在一起。如果是素材很多想剪出效果,就先用 agent 打标再自动编辑。但他也承认,剪辑目前还没有自动化,「因为大家觉得剪辑花费不了什么 token,重心都放在生成上」。

当本地部署成本优势这么明显,为什么用的人还不多?Roy 说以前确实不多,MiniMax 开源之后越来越多了;没用的原因,第一限制还是技术,「他们了解更多的是 Seedance、即梦这种简单一点的」;第二是不会配设备,「它不是一个显卡就能搞定的事情,还有存储、内存,除非你是资深硬件玩家」。

所以现在选择本地的是三类人,觉得成本太高的;喜欢折腾设备的技术极客;以及接了大量漫剧短剧业务、想要一套自己可控的自动化流程的公司。

我想起开场那张账单。4 块钱的利润,对应的是 19 万 5 的云端算力。英特尔想做的事情很清楚,把这笔钱的一部分,换成一张放在你桌子底下的卡。它不一定比云端快,也不一定比云端好,但它是你的,你可以抽一整晚的卡,睡一觉醒来片子已经生成了,无非就是电费。

这大概就是那些坚持「手搓」的人,在过去一年里没有放弃的理由。至于导演梦能不能变成生意,2K 什么时候开源,剪辑什么时候不再是黑盒,一次性投入什么时候能收回。这些问题今天没有答案。但至少,它们已经从「能不能做」,变成了「怎么算账」。

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。