blackorbird
26-07-15 19:24 微博认证:科技博主 头条文章作者

7 月 14 日 PrismML 正式发布 Bonsai27B,这是全球首款能在手机本地完整运行的 27B 级多模态大模型,依托极致低比特量化技术把原本几十 GB 的旗舰模型压缩到数 GB,彻底打破高端本地 AI 只能依赖电脑、云端的固有认知,普通手机、笔记本都能离线跑完整智能体能力。http://t.cn/AXKpredA

很多人对 27B 参数模型没有直观概念,我们先理清基础门槛,原生 Qwen3.627B 作为基座,采用标准 16-bit(FP16)精度存储时整体体积达到 54GB,就算行业通用的 4-bit 量化压缩版本也要 18GB,这样的体量别说手机,多数轻薄笔记本都很难完整加载运行,更不用说同时承载图像识别、多轮工具调用、长文本推理等复合任务,此前具备完整多步骤推理、智能体循环能力的 27B 级模型只能部署在高端台式 GPU 或者云端服务器,普通用户几乎没有本地使用的渠道。

Bonsai27B 针对这个痛点推出两套量化变体,全程端到端低比特处理,从 embedding(嵌入层)、attention(注意力层)、MLP(多层感知机)到 LMhead(输出词表层)没有任何高精度权重 “逃逸通道”,配套视觉模块采用 4-bit 轻量化量化,支持读取截图、本地文档、相机实拍画面,不再局限纯文本交互,两款模型原生搭载 262Ktoken 超长上下文窗口,同时支持 speculative-decoding(推测解码)无损加速生成速度,全部权重遵循 Apache2.0 开源协议开放商用。

第一款是 TernaryBonsai27B(三元量化版本),权重仅允许 {-1,0,+1} 三个数值,搭配 FP16 分组缩放实现单权重等效 1.71 有效比特,完整模型文件仅 5.9GB,定位优先保障推理精度,日常普通笔记本就能流畅加载,完整保留多步推理、结构化 toolcalls(工具调用)、智能体循环全功能,适合开发者、需要离线处理复杂文档、代码编写的用户。

第二款是 1-bitBonsai27B(二值量化版本),权重只保留 {-1,+1} 两种取值,同等分组缩放下单权重等效 1.125 有效比特,模型体积压缩至 3.9GB,刚好适配 iPhone17Pro 留给第三方应用的内存配额,成为行业首个落地手机终端的 27B 级大模型,这里要补充手机硬件的特殊限制,12GB 内存的 iPhone 实际能分配给 AI 模型的运行内存仅 6GB 左右,模型还要预留 KV 缓存、激活值存储空间,传统量化方案完全无法满足,3.9GB 的权重文件留存充足运行空间,离线运行多模态智能体不会出现内存溢出崩溃。

官方实测不同硬件的生成速度,NVIDIA GeForce RTX5090 显卡运行 1-bit 版本最高可达 163tok/s,三元版本峰值 134tok/s;苹果 M5Max 芯片运行 1-bit 版本峰值 87tok/s,三元版本 58tok/s,移动端 iPhone17ProMax 可完整运行多模态智能体演示,缓存预填充图像上下文后稳定完成识图、工具联动操作。

部署适配层面,Bonsai27B 原生支持两大主流硬件生态,苹果全系 Mac、iPhone、iPad 通过 MLX 框架原生加速,NVIDIA 显卡依靠 CUDA 搭配团队自研低比特内核适配混合注意力架构,不用额外适配工具即可直接加载权重,官方同步开放限时免费开发者预览 API,开发者无需本地硬件就能快速调试模型接口,完整压缩、评测、量化技术细节收录在配套白皮书内可供查阅。

项目研发团队 PrismML 脱胎于加州理工学院实验室,获得 KhoslaVentures、Cerberus、Google、三星持续资金支持,团队长期深耕无损神经网络压缩技术,此前多款 1-bit、三元量化模型已经验证轻量化商用可行性,本次 Bonsai27B 把这套技术上限拉高到 27B 参数级别,这套量化方法不绑定特定模型架构,团队已经启动更大规模参数、全新架构模型的研发工作。#ai创造营#

发布于 广东