拿llamacpp,用4块A100 + cpu thread 混合推理kimi-K2的unsolth的版本(看@karminski-牙医 发的,我就去下了下,据说有15%的performance损耗),但是毕竟小啊,1.8bit量化,一共才占250个G左右,其实你们有大一点的cpu都行,但是没我这个快[期待] prompt eval time = 84108.50 ms / 8974 tokens ( 9.37 ms per token, 106.70 tokens per second)
eval time = 4964.97 ms / 126 tokens ( 39.40 ms per token, 25.38 tokens per second)
total time = 89073.47 ms / 9100 tokens, 这个prompts和outbound数据对于llamacpp已经不错了,毕竟它并发弱,也没人拿它并发,主要核心是单序列单实例(一个请求一个推理),不支持 vLLM 的 PagedAttention(分页 KV cache,多请求共享内存)。服务器模式 (llama-server) 可以处理多个 API 请求,但用队列(sequential),不是真正并行,所以TPS 低,但是阉割了的K2也是61层啊。我这个在上上代的机器上跑着玩的tps已经不错了[捂嘴哭],把它在roo code上分析的截图没截到,做的plan的mermind图非常漂亮 ,反正我又多了个玩具[奶牛猫]
发布于 日本
