槐角笔耕新
26-09-19 20:04

关注到:小米MIMO v2.6pro正在直播的rl里:
最新的DeepSwe成绩已经来到了70(三次平均)
超过了kimiK3和GLM5.3!仅次于闭源的Claude opus5、fable5,GPT5.6sol,GPT6astra,还有Gemini3.8flash!

这说明虽然小米已经将近半年没有发过新模型,但是之前在数据收集方面一直没有落下,rl的能力也同样在业界的前沿,还是可以做出来第一梯队的模型的!

而且这种考核指标不那么迫切的状态,可能反而更有利于团队发挥自身优势,做好前置的研究。至少从目前mimo团队的表现来看,没有那种特别kpi为导向的迫切感——当然也不是没有kpi的意思。

比起2.5系列来说,v2.6系列全系都给到了多模态,而且小米v2.5之前是少数支持图片、音频、视频的模型。不知道模型大小是多少。

之前小米在展示 ai cube的原型机的时候,放出来了一个120b的端侧模型给大家体验。如果这次的flash最后是120b的话,那也太恐怖了,如果不是的话,也说明小米的模型家族还在丰富。

目前v2.6flash已经停止训练了,总共训练了30步,花费854,044美元,3天11小时。v2.6pro还在继续,正在进行第25步,按照目前的速度来看,总共需要训5天左右,花费250万美元左右。

大模型就是烧钱哈,这还只是一次rl,目前为止就已经花了将近300万美元。
小点的公司真是玩不起,如果是预训练的话,时间会更长,成本会更高,太吓人了。

v2.6flash最终的基准测试停留在了
DeepSWE 65.68,
内部编码62.87,
AutomationBench 52.70

不过看起来30步不是成绩最好的版本,也许权衡后会把28步的发布?谁知道呢。
反正最后发出来的应该是更全面测试后,综合最优的。

发布于 内蒙古