海风若雨萧萧====转自豆包查询,非诱导性建议及推荐
2026-07-12 20:31
阅读人数 1
曙光 8000(登峰)十万卡全国产 AI 超集群完整解读
一、事件概况
7 月 10 日光合组织 2026 智能计算大会,中科曙光正式发布国内首个全国产十万卡 AI 超集群曙光 8000(登峰),已经完成部署投入运行,并接入国家超算互联网,标志国产算力正式从万卡时代迈入十万卡时代抖音百科。
建设节奏
2024 完成系统研制→2025 工程落地→2026‑02 上线 3 万卡→2026‑04 扩容至 6 万卡→2026‑06 完成 10 万卡全部部署;同时启动第二套十万卡集群研发。
二、核心硬件与技术架构(全链路国产化)
1、算力芯片
核心加速芯片采用海光信息 DCU 深算 4 代 + 海光高端 CPU,整套集群 10 万张加速卡全部选用国产芯片,不依赖英伟达 GPU;全面兼容 CUDA 生态,降低大模型迁移成本。
2、网络互联(核心技术壁垒)
自研 scaleFabric 类 IB 原生 RDMA 高速网络,解决十万规模层级下网络拥塞问题,十万卡之间低时延无损互联,打破传统分布式集群通信损耗过高的痛点;
英伟达 Rubin 受限于 PCB 工艺仅能做到单机柜 72 卡,跨机柜带宽大幅衰减;华为 Atlas950‑SuperPoD 最高 8192 卡,曙光 8000 实现 10 万卡统一组网,在超大集群规模实现领先。
3、存储系统
搭载自研 ParaStor 分布式存储,拿下 2026 全球 IO500 榜单生产型全节点、10 节点性能双榜第一,适配万亿参数大模型海量数据读写需求抖音百科。
4、散热系统
曙光数创自研浸没式相变液冷技术,单机柜支持兆瓦级功耗,全年自然冷却,PUE 低至 1.04;单位算力能耗相比传统风冷降低 37%,算力密度提升 9.2 倍。
5、架构最大特点:超智融合
摒弃超算、智算硬件分区割裂的传统方案,一套集群同时支持 FP64 高精度科学计算(气象、生物医药、工业仿真)和 FP8‑INT8 低精度 AI 训练推理,兼顾科研大模型和通用大模型训练;千亿参数大模型微调周期缩短 60%央广网。
三、应用价值
算力能力:集群满负荷运行可以承担国内 5‑10% 的 AI 大模型推理算力需求;
商业模式:接入国家超算互联网,由硬件销售转向算力租赁服务,中小企业大模型训练成本下降 75%;
产业意义:验证国产芯片、网络、存储、散热全栈软硬件可以稳定支撑十万卡超大规模集群,契合十五五全国一体化算力网国产化率≥80% 硬性采购标准;后续各省会复刻十万卡集群项目,带动千亿级国产硬件采购空间。
四、和华为 Atlas950‑SuperPoD、英伟达 Rubin 架构对比
曙光 8000(海光 DCU 路线)
组网上限:10 万张 DCU;优势是超大集群组网调度、超智融合;短板是单卡 FP8 算力弱于昇腾 950‑DT、Rubin‑Ultra;偏向国家级普惠算力、科研场景。
华为 Atlas950‑SuperPoD(昇腾路线)
单集群上限 8192 张昇腾 950‑DT 芯片,依靠灵衢 2.0 全光互联,单卡性能更强,主打互联网大模型训练;2026 年 Q4 批量交付。
英伟达 Rubin‑Ultra
受限于 Kyber 正交 PCB 背板工艺难产,NVL‑72×2 背靠背机柜方案取消,2027 年仅能做到单机柜 72 卡,跨机柜带宽衰减严重,2028 年 NVL‑144 才能落地,大规模集群建设进度明显落后国产方案。
一句话概括:华为主打 8000 卡级别高性能训练集群,曙光 8000 实现十万卡国家级算力底座,二者形成国产算力双路线。
发布于 安徽
