DeepSeek-V4开源,
DeepSeek-V4-Pro(1.6T,激活49B)、DeepSeek-V4-Flash(284B,激活13B)。
其实还是,有一点点小失望的,就是这个V4还是一个纯文本的模型,并不是多模态模型。
不过说回来,DeepSeek也真是国内一股清流,一句“不诱于誉,不恐于诽,率道而行,端然正己。” 道破本心。
看完DeepSeek-V4的论文,整个模型上的技术,之前都有提到,
流形约束超连接 (mHC),是基于字节的HC的改进,将残差映射矩阵约束在双随机矩阵流形上,从而增强信号跨层传播的稳定性。
混合压缩稀疏注意力(CSA)和重度压缩注意力(HCA),
注意力机制在DeepSeek-V3.2-Exp中,有提出DeepSeek稀疏注意力 DSA,
核心是通过一个快速索引器和 一个细粒度的Token选择器,每个 query 不再关注全部历史 token,而是只选择最相关的 top-k 个 Key-Value 单元参与计算,在于“少看”
CSA则是对DSA进一步引入了压缩机制,先将每 m个Token的 KV Cache 压缩为一个注意力单元从而将序列长度从 n 降到 n/m,再在这些压缩后的 KV 单元上应用 DSA 的 top-k 选择机制。
这样一来,CSA 同时减少了序列长度和关注范围,在效率和信息保留之间取得了更好的平衡,可以看作是对 DSA 的增强版本。
HCA则走向了另一个方向,进一步提高压缩率,但不使用稀疏选择。将更多的 token(m',远大于 CSA 中的 m)压缩成一个 KV 单元,使得整体序列长度大幅降低。
由于压缩后的 KV 数量已经足够小,所以采用了正常的dense attention,相当于用信息分辨率的损失换取更低的计算成本和更强的全局覆盖能力。
理解三者关系:
- DSA = 稀疏(不压缩)
- CSA = 压缩 + 稀疏
- HCA = 极限压缩(不稀疏)
混合上还做了其他操作,比如:额外的 RMSNorm、部分旋转位置嵌入、attention sink等
还有就是优化器采用Muon优化器,对就是Kimi K2用的优化器。
其他的,MoE、MTP就是之前DeepSeek-V3的技术了。
模型在训练方面,
预训练阶段,语料到达32T Tokens,加大了长文档、科研论文及智能体代码的比重,逐步提升序列长度从4K至1M。
后训练阶段,分为两阶段。先针对子领域微调出多个带有不同思考模式(Non-think / High / Max)的专家模型,再通过 在线策略蒸馏 将能力整合进统一模型,避免了传统模型合并带来的性能衰减。
舍弃传统标量奖励模型,直接用模型自生成评估奖励(GRM)。
增加快速指令标记,引入专用 token(如 <|query|>、<|domain|>),无需额外小模型即可并行处理搜索查询、意图识别等辅助任务,大幅降低首字延迟。
榜单上,也是逼近御三家的模型,
刷到 LMArena,DeepSeek-V4也已经挤进开源前三。
榜单之外,DeepSeek牛逼之处就在于对资源的进一步压缩,
还有国产,这么小的注释,感觉吃了很多苦。。。
下一篇测试。
#How I AI##DeepSeek#
