视频生成算力新选择:SmarCo GC3 如何绕过「存储墙」这道硬门槛

摘要

大模型生成视频,正在成为这个算力饥渴时代最典型的应用场景之一。一段由AI生成的1080P视频,背后往往是数十亿参数神经网络的反复迭代,是海量张量运算在时空维度上的密集交织,也是无数像素数据在芯片与存储之间的辗转奔袭。

大模型生成视频,正在成为这个算力饥渴时代最典型的应用场景之一。一段由 AI 生成的 1080P 视频,背后往往是数十亿参数神经网络的反复迭代,是海量张量运算在时空维度上的密集交织,也是无数像素数据在芯片与存储之间的辗转奔袭。

对于大多数创作者而言,按下"生成"按钮之后等待渲染完成的焦虑,以及不断攀升的 GPU 集群账单,几乎已经成为一种常态。这场无声的算力战争背后,一个结构性的困境正在浮出水面——传统芯片架构下,算力的大头消耗在了"搬运"而非"计算"上。

存储墙:视频生成绕不开的硬约束

视频生成场景的算力特征与静态图像处理截然不同。扩散模型、视频大模型等任务不仅涉及海量张量的矩阵乘法,还涉及时序建模、多帧依赖和长序列的上下文理解。在冯·诺依曼架构的 GPU 上,这些运算遵循"取指-译码-执行-写回"的控制流逻辑。参数和中间特征图在显存与计算核心之间来回搬运,算完再搬回去。

问题在于,这种"搬运-计算-搬运"的模式在面对视频生成这种动辄数十亿参数、长序列帧间关系的任务时,瓶颈被无限放大。4K 视频每秒近 2.5 亿个像素数据在芯片与显存间反复搬运,大部分能耗和延迟消耗在了搬运而非实际计算上——这正是业内常说的"存储墙"。而在视频生成中,由于生成连贯动作需要多次迭代,数据搬运的开销呈指数级叠加。

数据流架构:让计算跟着数据走

针对这一难题,中科通量推出的 SmarCo GC3 芯片,提供了一种截然不同的解题思路。这款被定义为"全球首款基于 RISC-V 数据流架构的视频智能 AIGC 芯片",采用了不同于传统控制流的调度模式——没有程序计数器,没有复杂的乱序执行逻辑,取而代之的是一种基于数据依赖的动态触发机制。

简单来说,当计算节点所需的输入数据齐备时,计算便自动触发;结果生成后,直接流向下一个需要它的节点。整个过程没有多余的搬进搬出,没有全局同步等待,也没有缓存未命中的随机抖动。

这恰好与视频生成的内在逻辑形成了结构性的契合。以扩散式视频生成为例,其核心是带有时间依赖的降噪步骤,每一帧的生成都依赖前一步的全局张量状态,同时涉及时序注意力——这本身就是一个数据依赖图。SmarCo GC3 将这张图直接映射到硬件上,中间特征图在片上计算节点间流转,直到最终生成完整帧才写出片外存储。

 硬参数撑起场景野心

从规格来看,SmarCo GC3 为视频生成场景做了相当针对性的配置。200 TOPS(INT8)的 AI 算力,足以支撑大规模扩散模型和视频生成模型的实时推理;128GB LPDDR5 统一内存池配合 ECC 纠错,既保障了长视频生成任务中帧缓存的稳定性,也为每一次随机噪声采样和去噪更新提供了容错能力;而 128 路 1080P 硬解码引擎的配置,则意味着在视频生成工作流中,素材解码、预处理、AI 生成和后处理可以无缝衔接,无需在多个专用芯片间倒腾数据。

值得关注的是 SmarCo GC3 在生态层面的选择。数据流架构解决了"高效计算"的问题,但如何被广泛采用是另一个挑战。中科通量选择将数据流架构与 RISC-V 开放生态绑定——借助 RISC-V 的向量扩展和可定制指令机制,将 Transformer 中的矩阵乘加等高频算子固化为专用执行单元。与此同时,全球范围内越来越多的 AI 框架和算法库将原生支持 RISC-V,视频生成开发者无需从零开始。这种"数据流提供效率上限,RISC-V 提供生态下限"的组合,切实降低了开发者迁移的门槛。

从妥协到自由生成

在传统 GPU 上跑视频生成,开发者总是在妥协——妥协于 batch size、分辨率、生成时长和实时性。因为控制流架构的存储墙和同步墙决定了,当数据洪流超过一定阈值,性能不是线性下降,而是断崖式崩溃。

SmarCo GC3 的数据流架构提供了一种不同于"堆更多 GPU"的解决路径。通过将计算与存储深度融合,让中间结果在计算节点间直接传递,而非反复存取片外内存,这颗芯片在理论上能够支撑多路视频生成并行执行,也让长时间的连续视频生成具备了更现实的硬件基础。

当然,数据流架构并非新鲜概念,学术界从上世纪 70 年代就开始了相关探索。SmarCo GC3 的落地是否能在实际生产环境中兑现纸面参数的优势,编译工具链能否跟上模型算法的快速迭代,RISC-V 生态在 AI 框架层面的兼容性究竟如何——这些都有待更多实测数据的验证。

但至少有一点值得行业关注:当摩尔定律放缓,制程红利消退,视频生成的性能提升不能再靠堆更多的 GPU、烧更多的电。中科通量给出的方向是让数据不再需要被搬运,让计算跟随数据自然流动。这条路能否走通,将在很大程度上决定视频 AIGC 从"能生成"到"自由生成"的跨越速度。

视频生成的时代大潮已然到来,而算力架构的革新,正是支撑这一切的底层地基。在这条数据之河上,SmarCo GC3 刚刚起航,前方还有更长的航程。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。