V4 Pro的API定价为何比海外旗舰低这么多?
DeepSeek V4 Pro的API定价仅为海外旗舰模型的几十分之一,根本原因在于其从架构设计到训练流程的全链路成本压缩策略,将“高性价比”作为核心竞争力。
一、架构创新:从源头降低推理成本
MoE混合专家架构:V4 Pro总参数1.6T,但每次推理只激活490亿参数(49B),仅需调用6个专家,大幅减少计算开销。
混合注意力机制:采用Compressed Sparse Attention(CSA)与Heavily Compressed Attention(HCA)组合,在100万token上下文下,单token推理FLOPs仅为V3.2的27%,KV Cache仅需10%——这是长上下文推理最大成本来源,直接压到十分之一。
混合精度存储:权重以FP4+FP8混合精度发布,1.6T模型实际存储仅约862B参数,降低部署门槛。
二、训练优化:用更少资源训出更强能力
Muon优化器替代AdamW:实现更快收敛速度和更稳定训练过程,在32T token规模上完成工业级验证。
两段式后训练范式:先分领域(代码、数学、推理、Agent等)独立培养专家模型,再通过在线策略蒸馏合并为统一模型,有效避免多任务RL阶段相互干扰。
三档推理模式按需切换:Non-Think、Think High、Think Max,用户根据任务复杂度选择,避免“一刀切”浪费算力。
三、商业策略:以低价抢占生态与Token使用量
永久低价定位:5月22日宣布将V4 Pro API价格从原定价永久降为1/4,输入3元/百万token、输出6元/百万token,缓存命中仅0.025元。
高于算力瓶颈的预期:预览版发布时官方就坦言“受限于高端算力,Pro服务吞吐有限”,并预告下半年昇腾950超节点批量上市后价格会进一步下调——说明当前低价既是主动选择,也受制于供给能力。
全球Token使用量第二:极致低价已帮DeepSeek成为全球第二大Token调用方,V4 Pro正式版发布后甚至可能登顶,销量足以摊薄固定成本。
