维度网讯,Liqid 正为美光(Micron)为美国能源部太平洋西北国家实验室(Pacific Northwest National Laboratory,PNNL)设计的 Abaco 系统提供池化内存层。该平台能够跨多台服务器提供超过 160 TB 的一致内存,面向数据集访问效率限制比处理器性能更明显的 AI 与科学工作负载。

当前计算能力的扩张速度已超过内存容量、带宽和局部性的跟进速度。大型图模型、科学模拟、分子工作负载和 AI 推理常常因处理器等待数据,或操作员围绕单台服务器内存限制拆分任务而停滞。Abaco 的设计思路是把内存视为共享的、可编程的资源,而非永久绑定到单台机器的固定组件。Liqid 称,其机架规模设计可将最多 160 TB DRAM 分配给单个主机,或把容量分布在最多 16 个节点上。美光是该项目的主要技术承包商,Liqid 则提供扩展硬件、交换结构、主机适配器和编排层。这次部署仍是国家实验室级别,并非主流数据中心已准备好围绕分解式内存重建的信号,但它把讨论从架构图推进到了实际运行的硬件。
Liqid 的 EX 5410C 平台支持 CXL 2.0,单机箱最多提供 40 TB DRAM,多个机箱可组成超过 160 TB 的容量池。Liqid Matrix 软件负责将容量分配给主机,并集成 Kubernetes、Slurm 和 Ansible 等工具。其核心主张是:昂贵的内存不应该因为在错误的服务器中闲置而被浪费。操作员可将大容量池分配给模拟、分析任务或推理工作负载,之后再把这部分容量转用于其他任务。理想情况下,这能提高利用率并推迟服务器采购。
但在实践中,经济性取决于工作负载行为。内存池化引入了结构组件、适配器、管理软件和新的运维依赖,本地 DRAM 依然更简单。对延迟高度敏感的应用,即使 CXL 结构提供高带宽,也可能无法容忍远程访问模式。买家需要基于自身任务的测量数据来决策,而不是只看聚合容量数字。故障域也会发生变化:跨多个节点共享的内存池提高了灵活性,但结构或管理故障可能同时影响更多系统。容量规划从服务器采购转向编排策略,相应的监控、访问控制和恢复流程也需要重建。









