为何新一代智算服务器配套的光纤使用量,达到传统数据中心服务器的200倍以上?
一、AI智算服务器本身的网络接口数量大幅增加
传统IDC机房里的普通服务器,大多用于网站、存储、业务后台,一台机器一般就2‑4个网口,用来对外联网、简单数据交互。
而AI算力卡(GPU加速卡)集群不一样,一台智算服务器内部会搭载多张高性能GPU。GPU之间需要高速互联做模型训练、推理,每张加速卡都要独立的高速光纤互联接口,单台机器的网口数量会暴涨十几到几十倍。
二、集群内部的互联网络密度爆发式增长
大模型训练不是单台服务器独立运行,往往几百上千台服务器组成一个算力集群。
服务器之间需要极低延迟的高速互联(IB无限带宽或者高速以太网),GPU之间实时交换海量参数、梯度数据;
传统机房更多是服务器对外连接,机器内部之间互相通信很少;智算中心是机器之间大量对内互联,集群内部布线规模远大于对外出口布线,这是光纤用量暴涨的核心原因。
简单理解:传统机房是大家各自上网;AI机房是上千台机器互相高速抱团运算,内部连接线极多。
三、带宽需求指数级上升,必须大量独立光纤
大模型训练每时每刻会传输海量权重、训练数据集,单根光纤带宽会很快打满,不能复用。
传统业务可以多台服务器共用一条光纤链路;AI算力场景下,GPU之间必须独占高速光纤链路,不能共享,避免延迟、拥堵,因此链路数量成倍叠加。最终整体光纤用量达到传统机房的200倍以上。
四、机房层高加高到7.5米的配套逻辑
层高从5米提升到7.5米,多出的空间主要用来架设密集的光纤桥架、大量布线,同时布置大功率散热风道。高密度的光纤线缆本身也会发热,加上服务器功耗极高,整体散热压力远大于传统机房,因此整体层高必须抬高。
总结:传统机房主要是对外上网;AI智算机房是大量GPU互相高速组网运算,内部互联链路数量爆炸,直接推高光纤用量。
发布于 上海
