财经盘面记
19小时前来自 科技看点

DeepSeek为何能大幅降低Token消耗成本?

DeepSeek V4 Flash模型单日处理8万亿Token,3亿Token对于它来说只是小菜一碟——按照缓存命中后的价格,成本不到1块钱,但对于其他模型则可能高达数千美元。

一、3亿Token到底算不算“烧钱”?

绝对量级并不夸张:DeepSeek V4 Flash在OpenCode平台单日处理量达8万亿Token,3亿Token仅占其日处理量的0.00375%,对于高频开发者来说,这不过是几个Agent任务的正常用量

成本低到可以忽略:有开发者实测,使用DeepSeek V4 Flash消耗约1亿Token仅花费1.34元;另一用户报告8亿Token花费31元;按此推算,3亿Token成本约在4~12元之间,甚至更低

对比其他模型差距悬殊:同等3亿Token任务,如果使用Claude Opus需约2500美元,是DeepSeek成本的250倍以上;GPT-5.6 Luna即使降价80%后,单任务成本仍比DeepSeek V4 Flash高出约60%

二、DeepSeek定价凭什么这么“香”?

价格屠夫式定价:DeepSeek V4 Flash输出价格为每百万Token 2元(约0.28美元),输入价格更低,仅为GPT系列同类模型的几分之一甚至几百分之一

缓存命中近乎免费:缓存命中后输入价格从1元降至0.02元/百万Token,折扣高达98%;有用户实测缓存命中率达68%~99%,实际花费极低

峰谷定价再砍半:低谷时段成本再降一半,异步批量任务几乎零成本;企业级用户还可享受长期协议折扣

三、技术层面如何实现“极致性价比”?

混合专家模型(MoE)架构:总参数2840亿,但每次推理只激活130亿参数(仅4.6%),就像一家公司面对不同任务只调动最对口的专家团队,避免了全量计算的浪费

压缩稀疏注意力与FP4量化:在处理百万级长上下文时,计算量降至V3.2版本的10%,KV缓存仅需7%,大幅降低单Token所需算力

后训练优化提升效率:V4 Flash不改模型架构,通过重新做后训练在Agent能力上大幅提升,同时保持了极低的推理成本;开源社区和全球开发者的协作进一步压低了边际成本