马弘运
26-09-08 16:00 微博认证:数码测评师 资深摄影师 青年作家 科技博主

#小米发布最新模型MiMoX#
小米这次最值得看的,其实不是“又发了两个新模型”,而是 MiMo开始从一个模型,变成真正能在电脑上替你干活的东西了。

MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 目前还是预览版,小米暂时没有公布一套足够完整的公开 Benchmark,所以现在直接说它“超过GPT、Claude、Gemini”都太早。但从 MiMo Desktop 展示出来的能力看,这代模型明显是冲着 Agent 去的:PDF、表格、图片、视频、录音甚至压缩包都能直接扔进去,它自己理解需求、拆任务、调工具,最后不是回你一段文字,而是交付文档、PPT、表格、网页、图片,甚至软件工程项目。还能实时预览、局部修改、版本回退。

如果一定要跟主流模型排位置,我目前不会把 MiMo-X 直接放到 GPT-5.6 Sol、Claude 5 这类最顶级模型前面,因为缺少独立测评。但小米上一代 MiMo-V2.5-Pro 已经证明,它在代码、Agent、长链路任务这几个方向不是陪跑。此前 MiMo Code + V2.5-Pro 在小米公布的 SWE-bench Pro、Terminal Bench 等测试里已经能和 Claude Code 正面打,第三方测试里 V2.5-Pro 也进入过全球第一梯队附近。

我反而觉得 MiMo-X真正有可能建立优势的地方,不是“谁更会聊天”,而是谁更适合干活。 Claude强在代码和复杂推理,GPT整体能力均衡,Gemini有多模态和Google生态,小米现在押的则是“模型+Agent+桌面客户端”。MiMo Desktop甚至已经做了自动模型路由、多Agent协同、浏览器自主操作和上下文缓存,复杂任务不用用户自己研究该选哪个模型、开什么工具。

相比以前的MiMo,我觉得这次最大的变化可以概括成一句话:

以前小米是在证明“我也能做出一个很强的大模型”,这次是在回答“这个模型到底能替普通人做什么”。

这比 Benchmark 再涨几分更重要。尤其小米手里还有手机、平板、电脑、汽车和IoT这一整套硬件生态。如果未来 MiMo-X 真能深入系统权限,把现在 Desktop 上这种“读资料→查网页→操作软件→生成成果”的链路搬进小米设备,那它最大的对手可能根本不是另一个聊天机器人,而是鼠标、键盘和一堆App本身。

我最想测的也不是让 MiMo-X 写诗或者做数学题,而是直接丢给它 20个PDF+3张Excel+一堆网页,让它自己干半小时,最后看看交上来的东西到底能不能用。

这才是这一代 Agent 模型真正的分水岭。#大模型##ai##小米#

发布于 重庆