1/ DeepSeek V4终于出来了,很多人说我们已经实现了用国产卡训练大模型自给自足闭环了,并不这样
2/ 华子刚也发了一片Dpsk发布的文章说提供全面支持,但具体怎么个支持法?1)最主要的是超节点支持的推理,这是最主要的,低时延,降低访存开销,2)其次是做续训练(continue pre-train),但这个难度就小得多了,可以粗暴理解为数据量比较大的微调
3/ 其实最关键的预训练,还是在Nvidia的卡上做的,这也是最难门槛最高的过程,现在还是离不开,Deepseek-V4-Pro是1.6万亿的MoE模型,这个对于华子的GPU难度还是大了一点,我看官方给的口径是现在只是有个功能、参考实现,但实际做还是有距离
4/ 去年V3发布的时候,官方技术报告里直接写了用了2048 张 NVIDIA H800 GPU 的集群进行训练,这次这块内容基本没提,原因嘛。。
5/ 现在Anthropic的Opus大概5万亿参数,还没放出来的最强版Mythos可能更大,没放出来和serving成本过高也有关系,于是乎先给A家的小圈子用了。xAI在同时训练2个10万亿的,OpenAI估计也差不多,反正大家的teacher model肯定是很大的
6/ 华子要稳定支持万亿参数MoE的预训练,估计至少还要一年,过去这一年和dpsk应该也有很深度的合作,但现阶段还是不太行。AI世界一年还是蛮长的,估计明年SOTA模型都是10个Trillion参数起跳
7/ 把推理做好也不错了,毕竟未来推理的市场并不比训练小,在N卡上把主要的训练任务做完把大家服务好也行。未来Agentic model的推理也蛮多挑战的,只是相比训练难度更小。
8/ 反正那是远远没到能开香槟的时候,NV和TPU们进化还是太猛了,题是一年比一年难做
发布于 北京
