当 AI Coding 和 Agent 不再只是尝鲜工具,Token 消耗开始成为企业真实付费曲线,AI 云服务的竞争重心也正在变化。
当 Token 消耗进入生产力阶段,PPIO 打造面向Agent的智能Token工厂
当 AI Coding 和 Agent 不再只是尝鲜工具,Token 消耗开始成为企业真实付费曲线,AI 云服务的竞争重心也正在变化。
7 月 17 日,2026 世界人工智能大会(WAIC)期间,PPIO 在上海举办媒体沟通会,正式发布全新的 Agentic Cloud 定位以及智能模型网关新品。围绕 Agent 时代的模型调用、任务执行和云端托管,PPIO 希望打造一座面向 Agent 的「智能 Token 工厂」。
在会后的媒体群访中,极客公园采访了 PPIO 联合创始人兼 CEO 姚欣。现场一个反复被问到的问题是:过去几个月里,Agent 和 AI Coding 带来的 Token 消耗增长,到底是真实需求,还是又一轮技术热度下的短期尝鲜?
姚欣给出的回答很直接:确实有尝鲜,但尝鲜之后留下来的,是企业付费形成的真实曲线。
Token 需求正在从尝鲜变成生产力
今年 2 月、3 月,PPIO 后台曾看到一条非常陡峭的 Token 增长曲线。姚欣在采访中回忆,那一阶段有大量尝鲜式应用涌入,大家都想试一试 Agent 能做什么。但一两个月后,C 端尝鲜热度逐渐回落,真正值得观察的反而是后面的变化。
「现在我们进入到了一个稳健的增长阶段,每个月可以看到大约 10% 到 20% 的持续增长。」姚欣表示,如果按照这个节奏推算,全年可能会有 3 到 4 倍的增幅。
这条曲线的特殊之处在于,PPIO 是 To B 平台,平台上的 Token 消耗主要来自企业付费调用,而不是免费补贴出来的 C 端流量。也就是说,它更接近一条企业愿意为 AI 生产力买单的曲线。
在现场交流中,姚欣提到,企业内部大量重复性劳动正在被 AI 改造。以 PPIO 自身为例,内部使用 OpenClaw 最积极的并不只是技术人员,财务、人事、行政、市场等非技术岗位也在高频使用。相比 Claude Code、Codex 等需要命令行和技术理解的 AI 编程工具,OpenClaw 这类智能体的门槛更低,只要有飞书或微信就能使用,因此更容易进入日常办公流程。
另一个变化发生在创业公司里。姚欣观察到,一些 OPC 公司正在形成新的启动方式:过去创业往往是先融资,再启动项目;现在则可能是先买一个 Token 包,做出 Demo,验证跑通之后再去融资。
他把这类公司称为 Agent Native 企业。它们不一定拥有庞大的团队,却可能拥有大量 Agent 员工。PPIO 接触到的一些 OPC 公司,单月 Token 使用量已经达到百亿级。对这些企业来说,Token 已经不再是「试试看」的预算,而是被纳入成本和产出的计算。
这也是 PPIO 在 WAIC 期间发布 Agentic Cloud 的背景。Agent 需求开始从热度走向真实消耗,云服务的关键问题也从「能不能调用模型」,变成「能不能让 Agent 更稳定、更便宜、更长时间地完成任务」。
智能模型网关,让每次调用变成一次调度
围绕这一变化,姚欣在发布会上提出了一个 Agent 时代的公式:Agent 生产力 = Token 智能密度 × Agent Loop 时长。
前者决定 Agent 每一步决策的质量,后者决定 Agent 能连续运行多久、完成多复杂的任务。智能模型网关对应的,正是提升 Token 智能密度。
在传统模型调用中,开发者往往依赖一个「全能型」大模型。但在真实任务里,不同环节对模型的要求并不相同:简单问答不一定需要最强模型,复杂推理也不适合交给轻量模型;法律合同审查、医疗初步诊断等高价值、高风险场景,则需要更高的结果稳定性。
PPIO 智能模型网关试图把这些调用变成动态调度。其核心能力包括混合模型 MoM 和模型调度:关键步骤可同时调用多个专家模型,通过交叉验证和融合生成最终答案;简单任务则由系统自动分流到更轻量的模型,并结合上下文压缩、缓存复用、预算护栏和失败回退机制控制成本。
在采访中,姚欣用了一个更口语化的比喻:PPIO 不是简单售卖 92 号、95 号、98 号汽油,而是希望把不同能力的模型组合起来,得到更高质量的智能结果。换句话说,PPIO 要做的不是 Token 中转站,而是通过算力、推理、调度和融合真正生产高质量 Token。
据公司披露,在 DRACO 深度研究基准测试中,PPIO 通过融合 Mimo-V2.5-Pro、Kimi-K2.7 和 GLM-5.2 进行混合模型推理,可以将性能提升至接近 Claude Fable5 的水平,而成本大幅下降。综合测算下,PPIO 智能模型网关可将智能水平提升 20%,将成本降低 50% 至 60%。
这一能力背后,是对模型增长曲线变化的回应。姚欣在现场提到,模型本身的智能提升速度正在放缓,开源与闭源模型的差距也在缩短。PPIO 不是模型训练公司,因此更关注推理侧和智能体调用侧:能不能通过混合模型、推理加速和工程编排,让最终任务结果再上一个台阶。
从 Agent Infra 到 Agentic Cloud
如果智能模型网关解决的是「每一步调用是否足够聪明」,Agent Harness 解决的则是「Agent 能否长时间稳定执行」。
Agent 不能只会思考,还要能调用工具、进入环境、验证结果、修正错误,并在复杂任务中持续循环。Harness 正是围绕这些环节形成的工程体系,涵盖上下文构建、工具编排、验证循环、成本控制和可观测性等能力。
在群访现场,也有媒体追问 Hermes 和 Harness 的区别。姚欣解释,Hermes 是一款开源智能体框架,和 OpenClaw 是同类产品;Harness 则是一类工程体系,指向智能体执行过程中的编排、工具调用、验证和纠错。PPIO 所说的 Harness,是其基于这一技术方向做的自研实现。
去年,PPIO 推出了兼容 E2B 接口的 Agent 沙箱,为 Agent Harness提供安全隔离的运行环境。据介绍,PPIO Agent 沙箱冷启动时延低于 200 ms,支持上万个沙箱同时创建,任务空闲时可自动暂停计费,综合使用成本较同类产品降低 90% 以上。上线一年后,PPIO Agent 沙箱业务规模已增长超 120 倍。
今年,PPIO 将这一能力继续向上封装,推出 PPClaw、PPHermes 等托管 Agent。开发者通过控制台最快 10 分钟即可完成云端部署,部署后的 Agent 支持 7×24 小时持续托管、定时任务调度、一键暂停计费和秒级唤醒。
姚欣在采访中把这次升级定义为从 Infra 到 Cloud 的升级。过去 PPIO 提供的是沙箱、模型 API 等基础能力;现在,PPIO 希望把模型、沙箱、工具调用、记忆、任务编排和托管服务融合起来,为企业提供一套面向 Agent 的完整运行环境。
这种升级也对应 PPIO 自身的全栈路线。姚欣认为,AI 云服务的竞争壁垒不只是能否买到更好的 GPU,而是能否从底层算力、异构计算、全球调度,到模型优化、混合模型,再到 Agent 和 Harness 应用层进行端到端优化。
截至 2026 年 6 月,PPIO 日均 Token 调用量已超过 1.2 万亿,较 2025 年同期增长超 8 倍。根据灼识咨询统计,按 2025 年及 2026 年第一季度平均每日 Token 消耗量计,PPIO 在中国独立 AI 云计算服务提供商中排名第一。
在全球化方面,PPIO 也在将 Agentic Cloud 能力延伸到海外。官方信息显示,PPIO 已覆盖全球 6 大洲,拥有 5000 多个分布式算力节点,并与 GitHub、Hugging Face、OpenRouter、vLLM、SGLang 等开发者社区建立合作或生态适配。姚欣透露,PPIO 平台偏 To B,目前约 70% 的消耗来自海外。
当 Agent 成为新的软件入口,Token 就不再只是模型服务的计费单位,而会成为企业生产力系统中的基础资源。对 PPIO 来说,Agentic Cloud 的意义也不只是发布一组新产品,而是在 Agent 真正进入付费使用和长期运行阶段之前,提前搭好生产、调度和托管 Token 的云底座。



