一、算力主导范式变迁:CPU时代DDR是附属,AI推理时代HBM成为核心瓶颈
1. CPU算力时代,DDR仅作辅助,靠缓存/架构掩盖延迟、日常负载带宽冗余,容量增速缓慢(十年仅3倍),带宽迭代慢,不决定核心性能,随终端数量温和增长,具备大宗商品周期波动特征;
2. 生成AI推理时代,核心KPI从GPU算力TOPS/FLOPS,转为单位成本/功耗下token吞吐、单用户token生成速度,进入token经济学范式,GPU算力不再是天花板,瓶颈转移到HBM容量(size)与带宽(BW)。
二、底层逻辑推导:Token吞吐=HBM容量×HBM带宽
- 总token吞吐=批处理并发数(batch size)×单用户token生成速度:
- batch size受HBM容量约束:并发请求KV缓存必须驻留HBM,并发提升同步拉高所需HBM容量;
- 单token生成速度受HBM带宽约束:解码过程反复读取权重、KV缓存,带宽直接决定生成速率;
- 硬件硬约束下,要维持世代吞吐翻倍增长,HBM容量与带宽乘积必须同步翻倍增长,从英伟达A100到Rubin Ultra迭代数据,也验证二者增长曲线高度拟合;
- 软件优化无法突破该底层物理约束,仅能做边际提升,不能替代HBM迭代需求。
三、纠偏HBM周期性争议:不再复刻传统DRAM周期逻辑
传统DRAM需求随消费电子、PC起落走供需过剩-降价循环;而AI推理的规模化部署、agent链式任务串行提速需求、商业回报驱动持续扩产部署,HBM需求由架构底层硬需求锁定指数增长,不是短期景气炒作,不会随常规库存周期快速回落;
GPU厂商要维持产品竞争力、兑现token经济学“买越多赚越多”的商业逻辑,必须持续倒逼HBM迭代扩容提带宽,供给侧主动迭代压力强,脱离大宗商品周期规律。
四、产业与市场结论
1. 半导体价值重心从GPU算力,向HBM存储及配套封装/供应链转移,HBM是AI算力集群扩容、降本提效的核心卡点;
2. 中长期供需紧平衡、技术迭代持续推进,高增长具备结构性、长期性,短期产能爬坡、良率、地缘会带来阶段性扰动,但不改指数增长主线;
3. 算力集群设计、芯片架构演进,都需要围绕HBM容量/带宽做协同优化,算力冗余配置需匹配存储瓶颈,单纯堆GPU算力收益边际快速衰减。
发布于 广东
