中国科大讯飞发布星火Token Factory
2026-07-23 16:32
收藏

维度网讯,科大讯飞于7月19日正式发布星火Token Factory,旨在帮助企业提升大模型应用效率与管理水平,构建面向未来的大模型基础设施底座。

企业AI规模化落地过程中面临一系列运营管理难题。模型种类不断增加,调用成本持续攀升,系统稳定性要求提高,而跨模型管理、成本控制、安全治理和运行监控等能力建设相对滞后。企业往往需要同时接入多个模型服务,支撑代码助手、智能客服、知识问答、内容生成、文档处理等不同业务场景。不同任务复杂度差异显著,但实际应用中常采用统一模型处理,导致资源利用效率不高,Token成本持续增长。多模型并行运行也对系统稳定性、安全治理和运营管理提出更高要求。企业AI建设正逐步从“模型能力建设”迈向“AI基础设施建设”阶段,关注重点不再仅是模型本身能力,而是如何让模型能力真正融入业务体系,实现稳定运行、统一治理和持续优化。

星火Token Factory定位为企业级AI模型智能路由平台,提供模型统一接入、智能路由调度、Token成本优化、安全合规治理等核心能力,形成覆盖“接入—治理—观测—运营”的完整闭环,为企业构建统一的大模型服务入口,实现大模型资源的可管、可控、可追溯。

智能路由功能基于Prompt长短、规则预置、自定义规则、对话轮次、session亲和等多维度特征综合判定任务复杂度,对请求进行L1至L3智能分级管理。平台综合考虑质量、成本、延迟、可用性、安全等级五个因子匹配适合的模型资源,让简单任务调用更具性价比的模型,复杂任务优先匹配高能力模型。整个决策平均延迟可控制在100毫秒以内。通过智能路由能力,平台能有效降低大尺寸模型调用压力,为企业释放更多成本优化空间。

在国产化私有部署场景下,星火Token Factory围绕昇腾硬件特性对主流开源大模型进行端到端工程优化。显存侧通过多种模型压缩与精度优化技术,在精度可控前提下降低显存占用。计算与通信侧融合核心计算算子,对多卡通信进行调度重排,实现计算与通信并行重叠。缓存与调度侧通过跨节点分布式KV Cache管理与多级存储调度,引入上下文感知的缓存路由与上下文复用重组策略。解码侧引入面向昇腾硬件的并行解码加速机制。实测数据显示,在相同硬件条件下,相较开源vLLM-Ascend框架,推理效率提升约5倍,首Token延迟降低30%–40%。

安全体系方面,星火Token Factory采用三权分立架构,管理不碰数据、操作不碰权限、审计不碰业务,三者相互独立、相互制约。平台对所有关键操作自动生成不可篡改的全链路审计记录,覆盖数据访问、权限变更、模型调用、数据导出六大类操作,满足等保要求。敏感信息防护覆盖个人隐私和经营数据,进行分级路由,确保敏感数据不出域。

星火Token Factory提供端到端全链路日志审计能力,实现请求从进入平台到最终返回结果的全过程记录。通过日志追踪、路由决策记录、Token消耗统计和成本归因分析,让企业掌握每次模型调用的运行状态和资源消耗情况。配合预算管理、ROI分析和可视化报表,为后续运营优化和资源规划提供数据支撑。星火Token Factory的发布进一步完善了科大讯飞在企业AI基础设施领域的能力布局,也标志着企业大模型应用正在从单点探索迈向规模化运营的新阶段。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com