Funnunculus
24-05-10 22:16 微博认证:动漫博主

14B Q5_K_M 量化的模型,在 M1 Ultra 中可以跑 30 tokens/s,在 M2 Ultra 中可以跑 36 tokens/s,使用的是最新版本的 llama.cpp。图里还有一个 3090 的 token 数,还是并行跑的,简直碾压苹果。开始好奇 M4 Ultra 的推理性能了…… ​

发布于 加拿大