14B Q5_K_M 量化的模型,在 M1 Ultra 中可以跑 30 tokens/s,在 M2 Ultra 中可以跑 36 tokens/s,使用的是最新版本的 llama.cpp。图里还有一个 3090 的 token 数,还是并行跑的,简直碾压苹果。开始好奇 M4 Ultra 的推理性能了……
发布于 加拿大
14B Q5_K_M 量化的模型,在 M1 Ultra 中可以跑 30 tokens/s,在 M2 Ultra 中可以跑 36 tokens/s,使用的是最新版本的 llama.cpp。图里还有一个 3090 的 token 数,还是并行跑的,简直碾压苹果。开始好奇 M4 Ultra 的推理性能了……