#小米公开MiMo推理优化技术#
从云端到端侧:
MiMo补全了大模型“端云协同”一块核心拼图
大模型诞生之初,就有两条路摆在所有人面前:一条是全堆在云端,靠远程调用,优点是参数够大,缺点是贵、慢还不隐私;另一条是跑在端侧,就在用户手机汽车里,优点是快、安全还便宜,缺点是端侧算力不够,做不了大模型。这分叉口一摆就是十多年,没人能把两条路拧成一股绳——直到小米掏出MiMo推理优化,才算补上了端云协同一块核心缺了十年的拼图。
回溯十年前,端侧AI就只是做个图像识别、语音唤醒这种小活,大一点的推理全得靠云端,哪怕你手机再快,算复杂题还是得等网络传数据。后来大家想做大模型端侧部署,可怎么压都压不下来:要么是把模型砍得只剩骨架,性能渣得没法用;要么是推理慢到卡半天,功耗高到手机发烫,没人能做到"性能不砍,成本压下来,还能跑在端侧"。小米做MiMo的时候,从一开始就奔着这个目标走:你参数再大,我推理的时候只激活需要的部分,你存上下文,我只存窗口里的内容,一下子就把显存占⽤砍到原来七分之一,刚好能塞进端侧的NPU和GPU里。
这次公开的推理优化,不止是给云端API降了价,更是给端侧大模型铺了路:原来手机NPA只能跑7B模型,现在用MiMo的优化,能跑30B甚至更大的模型,还能维持低功耗低延迟,用户用的时候,复杂推理不用传去云端,就在本地算,隐私有了,延迟没了,成本还降了。对整个行业来说,这一下就把"端云协同"从概念变成了现实:复杂计算放云端,实时推理放端侧,小米靠MiMo把这套走通了,整个IoT行业都能跟着受益——以后你的智能音箱不用联网也能做复杂推理,你的智能汽车座舱不用等云端响应也能秒懂指令,你的手机断网也能写代码解数学题,这才是真正的全场景AI。
更有意思的是,小米本来就是做终端出身,从手机到汽车到IoT,一整个终端生态攥在手里,所以才会往死里抠端侧推理的成本——这不是巨头做慈善,是小米的生态本身就需要这个。可这份需求做出来的成果,整个行业都能用:原来做IoT的厂家,想做AI不敢做,现在有了MiMo验证并公开的优化路径,为行业提供了经过大规模实践验证的工程范本,端侧推理的成本门槛得以显著降低,这将助力更多IoT设备以可负担的成本集成智能能力。
大模型走了这么多年,云端的戏已经唱够了,现在终于轮到端侧开花了。小米这次补的这块拼图,不止是自己生态的拼图,更是整个大模型行业的拼图:端云协同不是说说而已,是要靠一步一步啃工程细节啃出来的,MiMo啃下来了,整个行业的下一个十年,也就有了新的方向。#雷军[超话]#
发布于 江苏
