为什么小米大模型降价了你还觉得贵-你测的是缓存未命中
我最近发现一个问题,DeepSeek V4出来的时候打25折,输入从12块降到3块,输出从24降到6块,最近小米MiMo大模型也跟着大幅降价,力度都挺大的吧?
但还是能看到很多人说还是贵啊,说打个你好就花了不少钱。我第一次看到这种说法的时候惊了,打句你好能花多少钱?然后我去看了他们是怎么测的,瞬间就明白了。
他们打开小龙虾、hermes或者其他agentg软件,发了一句"你好",然后看账单,可能花了几毛钱。哪里出问题了呢,在他们测试的场景,恰好是所有计价方式里最贵的那一种——缓存未命中。
AI大模型收钱分三块:缓存未命中、输出、缓存命中
你第一次发一段内容给AI,它得从头"读"一遍,完整算一次,这个过程叫缓存未命中,价格是3块钱每百万token。
但同一段内容你再发第二次、第三次的时候,系统发现你发的东西和之前一模一样,它就不重新算了,直接从缓存里调结果。这个过程叫缓存命中。
缓存命中的价格是多少?0.025元每百万token。
3块对比0.025。差了120倍。
所以那些说"打个你好就花了多少钱"的人,测试的是什么场景?第一次调API,发一句你好,AI回复,全程缓存未命中,这当然是你最贵的一次。
我某天DeepSeek跑了1.11亿个token
这1.11亿里面,有1亿零800万是缓存命中,按0.025元每百万token算。
只有239万是缓存未命中,按3块钱每百万token算。
加起来多少钱?13.23元,算下来每百万token只要0.119元。
小米这个,算下来是:
2.5*33852672+300*1360465+143535*600=578892180credits
按照小米mimo月卡最低档34块多的价格来算,这3500万token花费4.8元,每百万token0.137元,确实是大降价。
简单来说就是你让AI看一本书,这一开始会花不少钱,因为这对AI来说是新内容(每百万token三块钱),但之后再让AI根据这本书的内容和你交流,就是旧内容了(每百万token0.025元),现在你明白了吗?
打个你好测试花了多少钱没有意义。
