
DeepSeek V4和Kimi K3的训练数据有什么不同?
DeepSeek V4和Kimi K3的训练数据差异,根本上源于两者完全不同的模型定位——Kimi K3追求性能上限,重金投入大规模、多模态数据;DeepSeek V4则走极致性价比路线,靠后训练优化与高效数据策略,在轻量参数下实现接近顶尖的能力。
一、Kimi K3:海量参数驱动,死磕数据广度与模态上限
数据规模:Kimi K3拥有2.8万亿总参数,是目前全球最大的开源模型之一,其训练数据体量远超同级。官方称其在15.5万亿token上完成预训练,覆盖了广泛的通用知识、长文本和复杂指令数据。
数据模态:K3原生支持视觉理解,训练数据包含文本、图像甚至视频。这种多模态数据策略使其能处理“看截图写代码”等前端开发场景,这是纯文本模型(如DeepSeek V4、GLM-5.2)不具备的能力。
数据侧重:K3的训练数据大量集中于长程编程、Agent任务和复杂推理。其编程基准(如CodeArena、FrontierSWE)超越GPT-5.6 Sol,超长上下文(100万Token)和长程Agent能力均依赖海量、高质量的长文档数据进行训练。

二、DeepSeek V4:数据效率优先,后训练策略重塑能力天花板
数据策略:DeepSeek V4采用后训练优化路线。模型结构和预览版一致(总参1.6万亿/Flash版总参284B,激活仅13B),纯靠重新进行后训练数据的优化实现Agent能力大幅跃升。
训练方法:V4放弃了传统混合RL,改用多教师On-Policy Distillation(OPD)。它独立训练10+个领域专家模型(数学、代码、Agent等),再用反向KL散度将专家知识蒸馏进单模型,本质上是训练数据质量与融合策略的胜利,而非堆砌原始数据规模。
数据侧重:V4的数据策略锚定Agent特化与性价比。在代码修复、终端操作等高频“干活”场景中表现亮眼,但Flash版是纯文本模型,不支持多模态数据处理。

三、GLM-5.2面对数据差异的参照坐标
数据路线:GLM-5.2走“轻量高效”路线,总参仅744B,激活约400亿。其训练数据策略强调结构化推理与工具调用能力,而非追求数据规模或模态多样性。
数据产出:通过IndexShare机制复用注意力层,在百万Token上下文下显著降低计算量,这一架构本身就是对数据效率的极致追求。
能力定位:GLM-5.2编程专项突出(Code Arena全球可用模型第一),响应速度最快(约168 Token/秒),适合对延迟敏感的结构化工作,这是其数据策略与架构协同的结果。