中国天数智芯发布天垓300,性能超越Hopper
2026-07-20 11:31
收藏

维度网讯,2026年7月19日至20日,中国国产GPU厂商天数智芯在2026世界人工智能大会(WAIC 2026)期间正式发布新一代通用GPU旗舰产品天垓300。

作为天数智芯新一代自研架构的首款产品,天垓300围绕芯片架构、关键算子、系统扩展和软件生态进行全面升级,目标是对标并超越Hopper架构的主流方案(Hopper方案)的效能表现,为AI规模化应用提供算力支撑。

图片

天垓300基于SIMT通用计算架构,可支持标量、矢量和张量等多种计算类型,并针对Attention、MoE、AF分离、PD分离及大规模系统扩展等关键技术进行优化。在复杂业务负载下,产品兼顾计算效率、业务时延和总体拥有成本(TCO),满足人工智能规模化应用对通用性、性能和成本的综合要求。

天数智芯AI与加速计算负责人单天逸表示,人工智能正从理解与生成信息的“信息智能”迈向具备规划和执行能力的“行动智能”,并拓展至建模和预测未知的“探索智能”,三类智能对计算的不同要求构成了天垓300的设计主线。

针对信息智能,天垓300重点优化Attention与MoE。在Attention计算中,通过提升矩阵计算与向量计算的并行效率,减少数据读写等待,在不同精度下实现超过90%的Attention效率,优于Hopper方案。在64k上下文长度场景中,其Attention效能高Hopper方案10%。在MoE方面,通过算法与硬件协同优化,在DeepSeek V4 MoE场景中计算效率突破70%,综合训练效能和性价比优于Hopper方案;推理场景中,平均效能高Hopper方案10%。

针对行动智能,天垓300强化PD分离能力,对Prefill阶段和Decode阶段进行差异化优化。在Qwen、GLM、Kimi、DeepSeek等主流模型测试中,首字延迟较Hopper方案降低约20%。通过降低协议开销和优化链路路径,产品平均通信延迟降低约13%。在GLM 5.2等模型的Decode测试中,效能较Hopper方案提升10%。

针对探索智能,天垓300可支持标量、矢量和张量计算,覆盖FP4、FP8等多种精度及MMA、DPX、FMA等指令,适配矩阵求解、动态规划、稀疏计算和数字孪生等任务。在Cosmos3世界模型中,其推理效能相较Hopper方案高出10%。

支撑天垓300性能的底层架构创新包括:通过提高数据复用率减少重复访存的ixSMEX,将动态规划中原本需六条指令计算压缩至一条的ixDPX,以及降低存储冲突和显存开销的ixTrans。天数智芯自2018年起持续完善软件栈,已开发近百个加速库,形成覆盖通信、编译、驱动、量化和性能分析的工具体系。天垓300可支持全球主流大模型框架及关键加速组件。目前,该产品已具备规模化应用条件,并与中国国内云厂商、服务器厂商、互联生态及超节点系统开展深度适配,可支持从单机到规模化集群的规模化部署。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com