每天学点经济学
26-06-22 12:30

【16张B200训模型踩了13个坑】双节点16张B200跑35B MoE模型RL训练,作者记了13个bug。PyTorch显存扩展和推理休眠互斥,改一个另一个炸;B200自动启用的FlashInfer融合算子在容器里IPC死锁,CPU飙满GPU闲着;EAGLE投机采样+混合Mamba结构接受率竟是0%,draft白跑全被拒,关掉更快。最离谱的OOM:entropy计算要临时分配20GB,框架早就实现分块计算只是默认没开,一行参数解决。调试CUDA异步错误像追凶,stack trace常指错方向,sglang给的修复建议有时就是bug本身。你遇到过自动推荐反而坑人的工具吗?#AI训练# #你被自动优化坑过吗#

发布于 江苏