维度网讯,在WAIC 2026大会上,中国PPIO正式发布了Agentic Cloud定位与智能模型网关新品,提出打造面向Agent时代的“智能Token工厂”。随着全球AI智能体市场预计将从2024年的51亿美元增长至2030年的471亿美元,Agent任务对Token的需求量急剧攀升。

PPIO联合创始人兼CEO姚欣指出,Token的客户正在从人转向Agent,云服务商需要提供更低延迟、更高吞吐的“Token工厂”。根据灼识咨询数据,尽管推理成本每年以10倍以上速度下降,但单次Agent任务消耗的Token数量已从早期的数百增长至数万甚至数十万,综合成本压力不降反升。同时,单一模型无法覆盖Agent多样化需求,Agent对延迟和稳定性的要求远高于传统AI应用。
PPIO发布的核心产品智能模型网关,采用“混合模型”(Mixture of Models,MoM)机制。在关键Agent步骤中,网关会将问题分发给多个专家模型,通过交叉验证生成答案,避免因模型偏科导致的任务失败。网关还具备智能调度与成本优化能力,根据任务类型进行路由,并通过压缩冗余上下文、预算护栏等机制控制成本。根据DRACO深度研究基准测试,PPIO通过融合Mimo-V2.5-Pro、Kimi-K2.7和GLM-5.2进行混合推理,可将性能提升至接近Claude Fable 5的水平,智能水平提升20%,成本降低50%-60%。PPIO自研的推理加速引擎针对Agent场景深度优化,推理性能提升可达10倍,搭配Prompt Cache技术,Token成本最高可节省80%。PPIO已入选中国信通院首批“企业级Token服务性能攀登基线”,在通用场景下TPS≥55个/秒、TTFT≤0.9秒、调用成功率≥99.9%。

在Agent运行环境方面,PPIO推出了Agent沙箱,基于microVM技术实现毫秒级冷启动(<200ms),每个任务运行在独立虚拟机环境中,支持上万个沙箱同时创建,Auto Pause/Resume机制使成本较同类产品最高降低90%以上。自去年WAIC发布以来,这款中国首款兼容E2B接口的Agent沙箱业务规模增长超123倍。PPIO Agent Harness内置了Browser Use、Computer Use、Code Interpreter和MCP Server等能力,覆盖Agent从信息获取到执行操作的完整链路。平台预置了PPClaw、PPHermes等多款智能体模板,开发者最快10分钟即可完成云端部署,同时支持7×24小时持续托管与定时任务调度。

数据方面,2026年6月PPIO日均Tokens调用量超1.2万亿,在中国独立AI云计算服务商中排名第一,较2025年同期增长超8倍。公司营收从2023年3.584亿元增至2025年7.703亿元,全球注册开发者超67万名。PPIO平均GPU利用率在2025年持续高于75%,远超行业平均40%-50%。姚欣介绍,PPIO通过全球调度网络的“削峰填谷”能力,利用东西半球时差,将GPU利用率拉到70%-80%。目前PPIO已在欧洲、北美洲、南美洲、东南亚等区域部署分布式多集群,覆盖全球6大洲。

姚欣表示,智能上限不仅存在于模型内部,在模型之外的Agent工程、模型融合方向同样能大幅提升智能水平。PPIO致力于通过让Token更便宜、让Agent运行更稳定,为智能体经济的爆发提前布局底层基础设施。

基于Harness层,平台预置了PPClaw、PPHermes等开箱即用的智能体模板,开发者通过控制台一键操作即可云端部署,最快10分钟可上线运行。部署后支持7×24小时持续托管与定时任务调度,不使用时可一键暂停计费,恢复时秒级唤醒。平台还提供面向Agent的AI原生接口,支持MCP标准协议,Agent可通过自然语言调用GPU算力、沙箱环境等基础设施。平台兼容LangChain、CrewAI、AutoGen等主流Agent框架。

PPIO的分布式算力网络和高密度计算节点为智能Token工厂提供底层支撑。其通过跨地区时区差异和多样化客户群的交错需求,将全球闲置算力动态分配至需求高点,确保GPU资源有效利用。这种调度能力直接降低了单位Token的实际成本,成为PPIO“前店后厂”模式的底层保障。










