中科曙光 ParaCache 发布,打造「多快好省」的词元引擎

摘要

8 月 28 日,2026 中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案——基于存算协同理念的 ParaCache 高效管理方案。实测显示:基于该方案,模型单轮对话首词元时延(TTFT)最高降低 98.5%,高并发场景词元吞吐量最大提升 27 倍。

8 月 28 日,2026 中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案——基于存算协同理念的 ParaCache 高效管理方案。实测显示:基于该方案,模型单轮对话首词元时延(TTFT)最高降低 98.5%,高并发场景词元吞吐量最大提升 27 倍。

AI 推理的双重困境

随着大模型应用规模化落地,算力消耗的重心已从训练转向推理。然而推理环节正遭遇两大瓶颈。

一是推理越来越慢。在多轮对话中,大模型的每次回答,都需要重新计算所有历史内容,计算量平方级增长:处理 16K 长文本,单次推理需执行 2.56 亿次键值对计算。

二是「记忆」越来越贵。为避免重复计算问题,业界普遍采用 KV Cache(键值缓存)技术加速推理,把已算好的键值向量缓存在 GPU 显存中。但显存容量有限、价格高昂,随着模型变大、上下文变长,硬件成本也将急剧攀升。不仅如此,传统 KV Cache 只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群场景中,加速效果大打折扣。

一次计算、多次复用

ParaCache 通过构建四级架构,对 KV Cache 进行全层级的高效管理:热数据放显存、温数据放内存、冷数据放 SSD(固态硬盘)和分布式存储。这种「四级缓存池化」的管理解决方案可以实现两大关键突破:在硬件层,ParaCache 优化了跨芯片、跨节点的计算效率,打通各级存储资源;在运行层,则可以跨请求参与前端应用,消除重复计算,缓存可复用时间长达数周甚至数月。

ParaCache 让 KV Cache 从「用完即弃」的临时数据,变成可反复调用的数据资产。这可以直接让词元提升推理响应速度、降低成本,并为智能体的扩展提供支撑。

「多」「快」「好」「省」

ParaCache 为用户带来的价值很直观。

更快:缩短首词元时延,让「第一字」更快出现。120K 长文本下,单轮对话首词元时延最高降低 98.5%,仅 400 毫秒;多轮会话下该指标仍降低超 80%,至 4.9 秒。

更多:提升词元吞吐量,每一秒处理更多推理任务。高并发场景下,词元吞吐量最大可提升 27 倍,在硬件规模不变的前提下,可承接更多请求。这一收益在大集群的高并发场景下更为显著。

更省:削减词元内存占用,降低硬件开销。冷热数据分层管理的方式,大幅降低对内存硬件的依赖,实测显示,即便缓存容量下调,系统性能也几乎不变。企业用中低配硬件的成本,就能跑出高配硬件的上下文长度,集群总拥有成本(TCO)大幅优化。

更好用:无缝对接全球推理生态。该方案同时原生兼容全球推理生态的事实标准——LMCache,企业无需重构技术栈,即可平滑升级。

在 7 月落成的首个全国产十万卡 AI 超集群曙光 8000 上,ParaCache 成功支撑长上下文对话、高并发在线推理、智能体工作流与高通量推理四类应用场景,扛住了生产级考验。

从存数据到存智能

「ParaCache 并非改写 GPU 的性能上限,而是通过减少重复计算和数据搬运,让既有算力得到更充分的利用。」

中科曙光北京公司总裁助理、分布式存储产品部总经理石静指出,过去 GPU 是推理架构的绝对中心,而 ParaCache 的推出,让存储的定位也随之重写:从被动的 IO 响应,转向推理链条上的主动参与者。它将决定哪些记忆留在显存、哪些下沉到内存和 SSD、哪些进入分布式存储,何时预取、何时淘汰。

这正是 AI 驱动下数据基础设施的一次结构性变化。作为中科曙光「AI 数据工厂」理念的最新落地,ParaCache 将存储能力从数据读写延伸到优化词元产出,为词元经济时代的大规模应用提供了可行路径。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。