新思科技推出业界首个完整ESUN IP方案
维度网讯,Synopsys(新思科技)推出业界首个完整的ESUN(纵向扩展网络以太网)IP解决方案,覆盖第1层和第2层,旨在应对AI数据中心网络挑战。该方案为完全集成、预验证的堆栈,可开箱即用。
人工智能正将数据中心设计推向新领域。随着训练集群从数十个加速器扩展到数百个,再到数千个,网络已成为决定整体系统性能的关键因素。在这些系统中,加速器持续交换中间数据并进行同步,要求不仅快速移动数据,更需可预测地移动数据。即使微小延迟也可能产生连锁反应,导致计算资源闲置。传统以太网被设计为尽力而为的网络,假设偶尔的数据包丢失、重传和可变延迟可接受,这种模型对于AI系统失效。AI工作负载受限于尾延迟——系统中速度最慢的数据包,单个延迟数据包可能阻塞整个集群,数据包丢失引发的重传进一步增加延迟和可变性。这些低效问题随规模扩大加剧,带宽浪费和过度重传导致更高功耗、增加的基础设施成本以及降低的可扩展性,当集群增长到数十万个加速器时不可持续。
以太网包含拥塞管理机制如PFC(基于优先级的流量控制)和ECN(显式拥塞通知),但为通用网络设计,而非AI纵向扩展系统中紧密耦合、对延迟敏感的通信模式。在规模扩展时出现若干限制:协议开销方面,标准以太网依赖IP头部,每个数据包增加28-48字节,在频繁小消息的纵向扩展环境中直接降低有效吞吐量;无链路级错误恢复,除FEC(前向纠错)外无链路级恢复机制,残留错误需上层协议解决,引入显著延迟惩罚;粗粒度拥塞管理,PFC作为链路范围暂停机制运行,缺乏管理多个流量类别的粒度。这些挑战导致一些设计转向专有互连,但伴随生态系统碎片化、灵活性有限和更高长期风险的权衡。

业界并未替换以太网,而是对其演进。ESUN通过针对AI工作负载的定向增强来适配以太网,同时保留以太网的核心价值:操作熟悉度——网络团队可利用现有以太网专业知识、工具和管理实践;基础设施重用——纵向扩展和横向扩展流量共享相同以太网交换架构和物理基础设施;统一结构——以太网成为纵向扩展和横向扩展的共同连接介质。增强聚焦且目标明确:物理层保持标准以太网,链路层增加无丢失可靠性和细粒度拥塞控制,网络层精简以减少开销。

ESUN最直接的改进之一在数据包层面。传统以太网依赖IP头部,每个数据包增加28-48字节开销,ESUN将其替换为紧凑的4字节头部,在通信频繁且对延迟敏感的环境中显著提升数据包效率和吞吐量。基本能力如流量优先级、拥塞信令和负载均衡都得以保留,实现更加高效。

ESUN还引入两个关键机制使通信更加确定性。链路级重试(LLR)在数据链路层本地检测和恢复链路错误,而非依赖时间尺度高出几个数量级的高层传输协议,显著降低尾延迟,消除代价高昂的端到端重传。基于信用的流量控制(CBFC)用细粒度的、每虚拟信道的拥塞管理替换PFC的粗糙链路范围暂停行为,发送器仅在接收器确认有缓冲区容量时才发送,防止溢出,实现无丢失操作,同时避免PFC相关的队头阻塞。这些机制共同使ESUN能够提供无丢失、低延迟和带宽高效的通信,同时保留以太网的开放性和互操作性。

Synopsys推出业界首个完整ESUN IP解决方案,覆盖第1层和第2层,包括:1.6T多速率以太网MAC,支持多达四个独立的400G通道,可通过224G SerDes配置为1×1.6T、2×800G、4×400G和4×200G模式;1.6T PCS(物理编码子层)及RS-FEC,采用RS544 FEC实现稳健纠错,RS272 FEC用于低延迟操作;UE/ESUN链路层控制器,实现LLR和CBFC,用于无丢失可靠性和细粒度拥塞管理;经过硅验证的224G PHY(物理层),针对低功耗、低延迟和信号完整性优化;全面的验证IP和系统级验证支持。通过提供完整的IP解决方案,Synopsys消除了构建高性能网络系统通常伴随的大部分集成负担和风险。
所有组件作为单一系统共同设计和验证,通过预验证完整的L1/L2堆栈消除了从多个供应商采购和拼接IP带来的集成风险。同一IP可用于ESUN(纵向扩展)和Ultra Ethernet(超以太网,横向扩展),简化系统设计,允许团队在数据中心不同部分重用通用架构。该解决方案针对低功耗、高性能和面积效率优化,提供从100G到1.6T的多速率配置以及灵活的FEC模式。核心是Synopsys 224G PHY,在多个先进工艺节点上可用,自2022年10月以来已公开演示224G硅互操作性,在ECOC和OFC上进行了超过30次多厂商演示,在损耗高达45 dB的信道上实现了零后FEC错误。
ESUN得到超过175家公司以及业界领先的超大规模计算厂商和硅供应商的支持。Synopsys致力于通过业界首个完整ESUN IP解决方案推动这一转型。该ESUN IP解决方案是Synopsys更大HPC IP产品组合的一部分,旨在支持完整AI系统堆栈,包括通过ESUN和UALink(超加速器链接)进行纵向扩展连接、通过PCIe(高速外设互连)和CXL(计算快速链接)进行芯片间连接、通过以太网和Ultra Ethernet进行横向扩展网络连接、高带宽内存接口、多裸片和芯粒互连以及安全和基础IP。这些技术共同为构建下一代AI系统提供了基础,其中计算、内存和连接性共同扩展。





















