大模型落地这一年,「炼」比「造」更值钱

摘要

每家公司都想当 Token 工厂,但真正赚到钱的,可能是那些把碎片化算力「炼」成标准化服务的人。

 

2026 年科技圈最不缺的词,大概就是「Token 工厂」。

从年初黄仁勋在 GTC 上喊出「未来的数据中心就是生产 Token 的工厂」,到阿里成立 TokenHub 事业群、三大运营商推出 Token 套餐,再到 WAIC 上几乎每个展台都挂着这四个字。这个概念在半年内完成了从技术术语到行业黑话的进化,速度堪比当年的「元宇宙」。

但和元宇宙不同的是,Token 工厂背后确实有一门真实且高速增长的生意。问题在于,当所有人都自称工厂的时候,「工厂」这个词本身就不再有区分度了。

真正值得关注的,不是谁在「造」Token,而是谁在「炼」算力。

所有人都在建「工厂」,但工厂和工厂不一样

理解 Token 工厂这门生意,需要先看清楚它内部的分层。

最轻的一层是「转售型」玩家。拿到一个 DeepSeek 或 Qwen 的 API 接口,包一层壳,加个计费系统,就能对外卖 Token。门槛极低,利润极薄。商汤大装置 CGO 杨松在 WAIC 上说得很直接,转发一个 DeepSeek 的 Token 接口,也可以把自己包装成一个 Token 工厂。

中间一层是「超市型」平台。典型如硅基流动,聚合上百种主流开源模型,开发者按需挑选、按量付费。它的价值在于选品丰富和推理加速,本质上是一个高效的模型分发渠道。硅基流动今年拿了超 20 亿元 B 轮融资,是这个赛道上跑得最快的独立玩家之一。

但还有一层,做的事情更重、壁垒也更深。它们不只是分发模型或转售 API,而是在底层把碎片化、异构化的算力资源「提纯」成标准化的 Token 产能。如果说前两种是在搬运 Token,这一种更像是在「炼」算力。

范式智能(前第四范式)最近交出的半年报,恰好提供了一个观察这层生意的切口。

从「卖项目」到「卖 Token」,一家 AI 老兵的转身

范式是一家很难用一句话定义的公司。

作为一家成立已超十年的企业级 AI 老兵,范式过往的商业形态在很大程度上代表了中国企业 AI 赛道的集体宿命:依托「先知平台」做深度的定制化项目交付,客单价虽高但极其依赖人力与现场工程,毛利率、规模效应被重交付严重拖累。

不止范式,几乎所有做 To B AI 的公司都在这个循环里打转。收入看起来不错,但利润始终上不去,因为每一单都像在重新做一个项目。

但大模型时代的到来,让范式开始打破这个死循环。

2026 年 8 月,范式发布中期业绩,数据相当醒目。上半年总收入 37.65 亿元,同比增长 43.4%,归母净利润 1.19 亿元,首次实现规模化盈利。但真正让人注意到结构性变化的是 API 业务的爆发。

2025 年全年,这块收入只有 0.8 亿元,占总收入的 1.1%。到 2026 年上半年,半年就做到 4.64 亿元,同比增长 860.8%,收入占比跳到 12.3%。客户的 Token 调用量同比增长约 620%。

据业绩会上的信息,管理层已经将 API 业务全年收入指引上调到同比增长 20 倍。

从「卖项目」到「卖 Token」,AI老兵正在经历一次商业模式的重构。

传统的先知平台业务依然是基本盘(上半年 18.3 亿元),但 API 这条新的增长曲线,第一次让这家公司有了「用量制」收入的特征。用量制意味着可复制、轻交付、有规模效应,这和项目制的逻辑完全不同。

麦格理在 9 月初首次覆盖范式时,给出了「跑赢大市」评级和 59 港元的目标价。核心论点只有一句话:市场仍然把它当成一家企业 AI 软件公司,低估了它向 AI 基础设施平台转型的价值。申万宏源和中金也分别维持了「买入」和「跑赢行业」评级。

机构的判断是否准确,需要时间验证。但至少有一点已经很清楚:范式的收入结构正在发生实质性的变化,而不只是讲一个概念。

「炼厂」的技术账

API 收入暴涨 860% 是结果,但更值得拆解的是这个结果背后的技术底座。

范式给自己的定位是「Token 工厂」,但从技术架构来看,它做的事情更接近一座「算力炼厂」。它要解决的核心瓶颈,不仅是「算力怎么不浪费」,更是如何让企业以最低的综合成本、最高的吞吐效率,源源不断地产出业务所需的标准化 Token。

两个关键技术模块撑起了这座炼厂。

第一个是 HAMi vGPU,一套异构算力统一调度平台。它解决的是 GPU 利用率的问题。行业平均水平是不到 30%,也就是说企业花大价钱买来的 GPU,大部分时间都在闲置。HAMi 通过虚拟化和细粒度调度,把利用率提升到 70% 到 90%。这不只是一个技术指标的改善,而是直接关系到 Token 生产的单位成本。同样一张卡,产出翻了两到三倍,成本结构就完全不一样了。

第二个是 ModelHub,一个模型与芯片的适配平台。大模型落地的一个隐性痛点是,不同的模型跑在不同的芯片上,性能差异巨大。英伟达、华为昇腾、寒武纪,每一种芯片都有自己的架构特性,同一个模型在不同芯片上的表现可能天差地别。ModelHub 做的事情就是把这些「模型×芯片」的排列组合逐一调优,目前已经沉淀了超过 20 万组适配组合。

这两项技术放在一起,可以理解为一条横跨模型、芯片和应用场景的 Token 自动化生产线。它做的事情是把企业内部混乱无序的技术资产,包括各品牌的 GPU、各版本的模型、各行业的应用需求,炼化为高吞吐、低延时、开箱即用的工业级 Token 供应能力。

20 万组适配,这个数字本身就是壁垒。它不是靠堆人力就能快速复制的,而是需要大量的工程实践和持续的调优积累。每新增一款芯片或一个模型版本,适配工作就要重新来一轮。这让范式在「模型到企业」这个中间层上,建立了一道不容易被绕过的护城河。

在这两个模块的基础上,范式目前的可调度算力已经达到 2.8 万 PFLOPS。从算力输入到 Token 输出,形成了一条覆盖调度、适配、生产、交付的全链路能力。

和硅基流动这类原生推理平台相比,范式的路径差异很明显。硅基流动是面向开发者生态的开放市场模式,强调模型丰富度和推理速度,不碰行业 know-how。范式则是从企业级客户的需求出发,用十年积累的行业应用经验和工程能力,把过去重人力、重资产的项目制交付,转化为标准化的 Token 输出模式。 一个是面向公域的「AI 模型超市」,一个是面向私域、把行业 know-how 封装进基础设施的「算力炼厂」。前者卖的是模型的可选择性,后者卖的是从算力到业务的全链路确定性。

不是所有管道工都能成为基础设施

回到开头的问题。2026 年的 AI 行业,模型能力本身已经不是最大的瓶颈了。DeepSeek、Qwen、GLM,开源模型的水平已经够用。真正卡住企业 AI 落地的,是中间那一层。怎么把模型能力高效、低成本、稳定地交付到业务场景里,这件事远比想象中复杂。

这也是为什么「Token 工厂」赛道看起来热闹,但能跑出来的公司可能没有想象中多。API 价格战已经在打了,腾讯混元部分模型的输入价格涨了四倍多,同时更多玩家在疯狂降价抢市场。端侧 AI 的普及也在分流云端推理的需求。这个赛道的竞争烈度,远超一年前的预期。

在这样的环境里,单纯做 Token 转售没有未来,做模型超市需要极致的成本控制能力,而做「算力炼厂」的公司,因为技术壁垒和客户黏性都更高,反而可能在洗牌中活得更好。

范式的半年报至少证明了一件事:一家做了十年项目制交付的 AI 公司,确实可以跑出用量制的增长曲线。至于这条曲线能延伸多远,API 收入能不能从 12% 的占比继续往上走,最终成为收入结构的主导力量,这些问题在下一份财报到来之前,仍然是开放的。

但有一个趋势已经很清楚了。大模型赛道的竞争重心正在从「谁的模型更强」转向「谁的 Token 更便宜、更快、更稳定」。在这场转移中,真正有价值的不是「造」Token 的能力,而是「炼」算力的能力。

这门看起来不那么性感的生意,也许才是 AI 基础设施的真正底色。

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。