NVIDIA DGX B300集群布线方案(基于RoCE)
本文重点阐述基于RoCE协议的NVIDIA DGX B300集群计算网与存储网布线设计的核心要点。
一、方案概述
上篇,我们深入探讨了NVIDIA DGX B300集群在InfiniBand协议下的高速布线方案,本篇,我们将继续聚焦NVIDIA DGX B300集群,为您详细解读,基于 RoCE协议下的布线架构参考。
本文重点阐述了基于RoCE协议的NVIDIA DGX B300集群计算网与存储网布线设计的核心要点,设计依据为DGX B300系统(标配ConnectX-8网卡)。其中,计算网与存储网是数据传输的核心载体,两者均采用光连接技术,依托Spectrum-X以太网交换机构建高带宽、低延迟的传输链路,为超大规模AI大模型训练提供稳定的数据吞吐保障。
DGX B300系统核心网络端口配置(计算网与存储网)如下:
• 计算网络:配置8个OSFP端口(单端口支持2×400G);
• 存储网络:配备2个单端口QSFP端口(单端口支持400G)。
见下图二
二、计算网布线设计
2.1、网络拓扑架构
计算网采用经轨道优化的双平面胖树(Fat-Tree)拓扑架构,分为Leaf层与Spine层两级交换机部署模式,以可扩展单元(SU)作为基础部署模块。需重点说明的是,在NVIDIA DGX B300 SuperPod的后端计算网络方案中,核心采用SN5600系列以太网交换机。该交换机最多支持64个800G端口,基于此构建的两层无收敛网络架构最多可支持2048个GPU。但当前标配的ConnectX-8网卡不支持800G以太网端口,因此为满足更大规模GPU协同需求,NVIDIA采用多平面设计,本方案即采用两个通信平面(每个800G网卡拆分为2个400G端口),两个端口各自构成独立的通信平面,后端计算网络可视为2个平行且独立的400G网络。
本方案中的8个SU包含512个节点(每SU 64个节点),配套部署128台Leaf层交换机与64台Spine层交换机,集群整体支持后续按SU单元进一步规模化扩展,以满足超大规模AI训练的算力扩容需求。
2.2、光链路连接设计
计算网采用全光链路部署,核心链路类型及连接方式如下:
• 400G(400G-SR4/VR4)短距链路(≤50m):采用MPO APC(Base-8)至MPO APC(Base-8)的多模MPO线缆连接,实现节点与Leaf交换机间的短距高速互联。
见下图三
2.3、计算网光链路数量估算(基于8 SU配置)
针对8个SU配置(合计512台DGX B300节点,4096颗GPU),计算网核心光链路如下表所示,共计约8192条MPO光缆(可根据实际规模灵活调整):
见下图四
三、存储网布线设计
3.1、网络架构基础
存储网采用与计算网物理隔离的独立架构,可有效避免数据传输相互干扰,确保存储与计算性能均达到最优。依托“leaf-Spine”两级拓扑架构部署,全程采用光连接技术实现高速互联。
3.2、光链路连接设计
存储网的核心光链路设计如下:
• 800G(2×400G-DR4)长距链路(≤500m):采用2×MPO APC(Base-8)至2×MPO APC(Base-8)的单模MPO线缆连接,实现Leaf与Spine交换机间的长距高速互联;
• 800G(2×400G-SR4/VR4)短距链路(≤50m):采用2×MPO APC(Base-8)至2×MPO APC(Base-8)的多模MPO线缆连接,实现Leaf与Spine交换机间的短距高速互联;
• 400G(400G-SR4/VR4)短距链路(≤50m):采用MPO APC(Base-8)至MPO APC(Base-8)的多模MPO线缆连接,实现节点与Leaf交换机间的短距高速互联。
见下图五
3.3、存储网光链路数量估算(基于8 SU配置)
存储网核心光链路及组件数量如下表所示,共计约2048条MPO光缆(可根据实际收敛比灵活调整):
见下图六
长芯盛(武汉)科技有限公司,总部位于武汉,在北京、上海、广州、深圳、成都、汉川、香港、台湾及美国、德国、日本、印尼等多地设有分子公司及办事处,产品和方案主要应用于数据中心、智慧建筑、超高清视频、虚拟现实、医疗系统、机器视觉等工业和终端消费领域。
综合布线品牌iCONEC,是长飞公司、长芯博创旗下唯一专业从事综合布线业务的子品牌,业务主要专注于智慧建筑和数据中心两大领域,在布线领域拥有众多自主知识产权,致力于为客户提供高效、可靠、全场景的综合布线产品与解决方案。
