
9 月 11 日至 13 日,以"共织算力网 智启新未来"为主题的 2026 中国算力大会在河北廊坊举行。作为国内算力领域规格最高的国家级产业盛会,大会汇聚了全产业链数百家企业与上万名专业观众,全力助推我国算力产业高质量、集约化、普惠化发展。
9 月 11 日至 13 日,以"共织算力网 智启新未来"为主题的 2026 中国算力大会在河北廊坊举行。作为国内算力领域规格最高的国家级产业盛会,大会汇聚了全产业链数百家企业与上万名专业观众,全力助推我国算力产业高质量、集约化、普惠化发展。
翼华科技芯片架构师邹玥在本届算力大会上发表了题为《AI 算力网络的端网协同,重构 Token 成本曲线》的主题演讲,分享了以端网协同技术提升 GPU 利用率、降低 Token 成本的路径与实践。

大模型应用加速落地,"算力贵"已成为产业发展关键瓶颈。邹玥指出,行业评价 AI 网络往往先看端口速率和带宽,但算力中心真正的核心指标是"每百万 Token 成本"——即总投入除以真正能交付的有效 Token 数量。网络同时影响这两头,而最大的降本杠杆,来自减少 GPU 等待。
这一问题在 AI 场景中尤为突出:训练中 GPU 同步协作,一张卡慢了全队都得等;推理中"短期记忆"传输慢或波动大,运营方只能多备 GPU。传统以太网的局部拥塞、业务感知不足等短板,在 AI 工作负载下被进一步放大。"投入同样数量的 GPU,能不能稳定输出更多满足业务要求的 Token?这才是算力中心真正需要回答的问题。"邹玥说。
面对这一痛点,翼华科技提出了"端网协同"技术架构,核心思路是让应用端、网卡和网络设备不再各干各的,而是实时通讯、互相配合。端侧软件了解业务优先级,知道哪些数据更紧急;智能网卡让数据不经过 CPU 可直接在 GPU、内存和网络之间走"快车道";交换网络掌握全局路况,把拥塞、故障信息实时反馈给端侧。三者形成闭环,网络从被动"管道"变为动态"智能调度系统"。
翼华科技将这套架构命名为 ELink,由端侧运行层(ERT)、网卡执行层(ERNIC)与网络协同层(ERSW)三大组件构成,重点解决单集群大规模扩展和跨数据中心协同两大场景,在机间和跨域层面提升传输效率,撬动 GPU 利用率。"端口速率决定物理上限,端网协同决定这些带宽有多少能够稳定转化为有效吞吐。"邹玥强调,后者才是降本的关键。

翼华科技已形成覆盖智能网卡(SmartNIC)、超级网卡(SuperNIC)与面向分布式推理的 AI-DPU 的完整产品矩阵规划。其中,图南一代为国内首款 P4 可编程开源网卡,已实现大规模商用出货;图南二代面向下一代智算网络,强化了可编程能力,支持更大规模的集群扩展;AI-DPU 则创新性实现 KV Cache 硬件卸载、跨节点共享上下文内存池、向量数据库检索全链路卸载,补齐 GPU 与底层存储间缺失的高速缓存层级,大幅减少模型重复计算,降低集群推理综合成本,同时兼容 vLLM、SGLang 等主流推理框架,存量集群可快速平滑接入。
在实际应用中,端网协同方案已在大模型训练、MoE 推理、Prefill 与 Decode 分离、多租户与跨域调度等场景中逐步展现降本价值。邹玥在演讲最后表示"让系统产出更多满足用户体验要求的 Token,同时减少被等待、拥塞和故障浪费的算力。计算、网络和调度形成协同,才能持续降低每个 Token 的成本。"翼华科技也将继续坚持"双芯驱动、全栈服务"战略,以端网协同架构与图南系列产品助力算力中心降本,为我国智能计算基础设施高质量发展提供有力支撑。
来源:互联网



