这两个模型的核心区别在于量化精度与资源消耗的权衡。Bonsai-27B-gguf 是追求极致轻量的 1-bit 版本,而 Ternary-Bonsai-27B-gguf 是追求更高性能的 Ternary (三元) 版本。
具体对比如下:
· 核心定位:Bonsai-27B-gguf 定位为手机级 (Phone-Class) 的1-bit模型;Ternary-Bonsai-27B-gguf 定位为品质导向 (Quality-Oriented) 的三元模型。
· 量化精度与格式:前者是 1-bit (Q1_0_g128),每参数 1.125 bit;后者是 Ternary (三元) (Q2_0_g128),每参数 1.71 bit。
· 模型大小:前者约 3.9 GB;后者约 7.2 GB。
· 性能保留:前者保留 FP16 约 90% 的智能;后者保留 FP16 约 95% 的智能。
· 平均基准:前者在15项测试中平均 76.11;后者在相同测试中平均 80.49。
· 推理速度 (M5 Pro):前者约 44 token/s;后者约 26 token/s。
总而言之,Bonsai-27B-gguf (1-bit) 占用空间更小、速度更快,适合手机或内存有限的设备;而 Ternary-Bonsai-27B-gguf 性能更接近原版模型,适合追求品质且硬件条件较好的笔记本或台式机。
两者都基于 Qwen3.6-27B,支持 262K 上下文和视觉功能。
发布于 河北
