HXS使英伟达H100推理能耗降17.2%-27.4%
2026-08-03 10:20
收藏

维度网讯,Trust Carbon Infrastructure公司日前公布,其正在申请专利的HXS计算效率层经独立签署的测量确认,在NVIDIA H100硬件上降低了能耗并提高了推理容量,且模型输出保持一致。GPU短缺、电力约束和冷却成本日益限制基础设施扩张,若这一组合被业界广泛复制,将立即引起企业界的关注与审视。

对运营大型推理集群的企业而言,经济性越来越取决于硬件利用率,而非单纯增加加速器数量,这推动基础设施优化的讨论从硬件更换转向软件挖潜。推理已成为组织在生产规模下部署生成式AI增长最快的运营支出之一;电价持续波动,数据中心电力分配受限,冷却基础设施往往在机架空间耗尽之前先触及实际极限。在此背景下,Trust Carbon表示HXS正属于这类从已部署系统中提取更多有效工作的软件技术。

公司发布的签署测量结果显示,HXS在单个NVIDIA H100 80GB GPU上使用vLLM 0.26.0运行,于五个广泛使用的开源AI模型——阿里巴巴的Qwen2.5-72B-Instruct、Meta的Llama 3.3 70B、DeepSeek的R1-Distill 70B、谷歌(Google)的Gemma 3 27B以及微软(Microsoft)的Phi-4——上持续降低能耗,同时保持输出完全一致。各模型每GPU能耗下降17.2%至27.4%,工作温度最多下降15摄氏度。

冷却与电耗几乎同等重要。较低的板温会作用于机架密度、热管理策略、硬件寿命和设施运营成本,这些指标虽不如原始性能指标受关注,但在规划多兆瓦AI部署时,运营商越来越倾向于将热余量与计算容量一同评估。

测试中,Microsoft Phi-4对应的一种配置改进幅度明显大于整体测试集:功耗由306瓦降至152瓦,降幅50.5%;吞吐量从每秒109.8个请求增至293.7个请求,同时维持相同的延迟目标,无延迟百分位恶化,输出保持一致,记录零错误。软件优化通常改善一项指标而牺牲另一项,吞吐量提升往往伴随延迟代价,功耗降低也可能反映利用率下降;在输出一致前提下同时优化多个操作特性,这正是基础设施工程师在做出采购决策前希望独立复现的结果类型。

Trust Carbon将于8月第一周在硅谷展示HXS,同时寻求独家许可合作伙伴或潜在收购。这种商业做法显示,公司或认为将技术嵌入成熟基础设施供应商比独立构建软件业务更有价值。大型GPU集群运营商、超大规模云提供商、AI基础设施初创公司和服务器制造商都可能评估这款无需购置新加速器即可提高利用率的软件。

对硬件迭代而言,这还有另一层含义:硬件供应商历来依赖逐代GPU换代来提供效率改进;能够延长现有硬件经济寿命的软件会使升级周期复杂化,尤其是在组织可在保持可接受服务水平的同时推迟昂贵基础设施更新的情况下。

不过警示同样明确:测量结果虽经签署,仍由供应商在受控测试条件下收集。企业买家通常需要不同生产环境中的独立验证,才能假设真实客户流量下的类似收益;工作负载组成、请求模式、批处理行为和软件配置都会实质影响推理效率。Trust Carbon也承认能耗降低因应用特性而异,并建议客户在使用已发布数据前用自有生产流量验证性能。

对基础设施买家而言,即使独立验证尚未完成,早期测量结果仍可为技术评估提供理由——适度的效率提升就可能显著改变大型GPU部署中的运营成本、机架利用率和扩展规划。若HXS能持续提升推理吞吐量,组织可能推迟硬件采购,但在改变采购或部署假设之前,生产验证必不可少。HXS还宣称可扩展至AI推理以外领域,当前只有推理测量结果经签署并公开披露,类似效率提升能否迁移到更广泛的服务器工作负载,在获得可比测试之前仍无定论。混合工作负载下的性能一致性、不同流量模式、多GPU环境、编排平台以及独立第三方基准测试,仍需更广泛证据才能支撑大规模部署决策。

云提供商、AI基础设施供应商、服务器制造商以及运营大型推理集群的企业,都可能评估这类无需立即资本扩张即可提升硬件利用率的软件。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com