面壁智能发布 1.3 B 的视觉模型MiniCPM-V 4.6
清华面壁智能继续搞端侧模型着. 这次出的 MiniCPM-V 4.6 (1.3B) 依旧做的是底层工程优化
其中 LLaVA-UHD v4 架构加持的早期压缩技术... 通俗点讲, 就是在图像刚进入网络的时候, 就提前把没用的画面信息给砍了, 省得留到后面占算力.
▪️ 算力消耗暴降: 视觉处理的算力直接省了一大半 (降了 55.8%), 而且肉眼看过去效果没变差.
▪️ 夸张的性价比: 跑分赢了 Qwen3.5-0.8B 算是常规操作, 但有意思的是... 等等, 我刚对着原图表核对了一下, 它居然只用了对手大约 2.5% 的 token 预算. 相当于干同样的活, 饭量小了几十倍.
▪️ 速度极快: 就算是一张 3K 分辨率的高清大图扔进 4090 里, 首次出词只要 75.7 毫秒.
他们公司对普通开发者和用户一向是极其极其友好。 iOS, 安卓甚至鸿蒙的部署代码都全部开源了, Ollama 和 vLLM 也直接兼容, 拿来就能跑.
🔗 HuggingFace:
http://t.cn/AXi4PcPX
🔗 GitHub:
http://t.cn/A6HigmHf
发布于 新加坡
