本地开发能真干活的甜点档位,不是 7B,也不是 70B。
是 27B 这一档。
🔍 7B 跑得快但不够聪明——写稍微复杂点的 agent loop 就开始漏步骤、记不住上下文,调 prompt 调到怀疑人生。70B 倒是聪明,但单张 24G 卡 4bit 都塞不下,多卡跑推理 KV cache 通信又会吃掉一截吞吐。
27B 刚好卡在 4bit 量化能塞进 24G 显存的窗口,4090、A5000 都跑得动。长上下文场景下 KV cache 全在一张卡上不用跨卡同步,单 batch 延迟反而比 70B 多卡部署更稳。
💡 做推理优化的应该有感觉,单卡推理是真省心——没有 NCCL,没有 tensor parallel 切分,没有 batch 边界对齐这些破事。本地开发要的就是改完立刻能跑、能复现,27B 是目前少数能在消费卡上做到这件事的能力档位。
📌 当然 4bit 量化会掉点,但相比 7B 那种能力天花板,27B 量化后的水平还是高出一截。这两年 20-30B 这个区间越炒越热不是巧合——不是更大不香,是更大的本地体验真的会被 IO 和通信拖死。
发布于 日本
