《Modern GPU Programming For MLSys》瞄准的问题很具体:在大模型的训练和推理链路里,端到端速度往往取决于少数几类 GPU kernel 的实现质量,包括注意力机制 kernel、LLM 的 prefill/decode kernel、低精度的 block-scaled GEMM、融合 MoE 层等。 http://t.cn/AXSQhCRj

机器之心Pro
26-06-27 15:25 微博认证:机器之心官方微博