1/ 刚在看DeepSeek V4的技术报告,发现用到了Kimi之前开源过的Muon优化器,简单说就是万亿大模型训练的稳定收敛非常依赖优化器。DS的报告在2.4这一节单开一趴讲了Muon这个优化器 ,杨植麟今年去英伟达GTC的分享里也讲了Muon
2/ 这一幕让我想起了去年Kimi K2发布时,Kimi公布的技术报告用了和DS相同的MLA架构,快一年过去了,这次在DS里看到了Kimi的身影,也是蛮好玩的,中国的AI公司友好借鉴,这个氛围比美国好多了
3/ 对面马斯克天天在X上骂Sam Altman是无耻的骗子,撒谎如呼吸般自然(这是原话..),打了好几次官司让OAI赔偿1340亿美元,同时痛斥A家和Dario虚伪双标,道貌岸然,未来赢不了,然后Sam Altman和和Dario两个人虽然没有直接对骂,但几次发言都暗讽,就差把友商是傻X直接说出来了,行业会议上当面拒绝握手
4/ 过去一周,Kimi K2.6和 DS V4两个万亿大模型都开源了,两家的战略分化也越来越清晰。
1)DS属于克制专注,把模型单点能力做扎实,把推理成本往死里打,但是产品说实话还是需要打磨
2)Kimi则明显把重兵放在了C端应用和Muti-Agent(智能体)生态上。这也是为什么很多人觉得DS API香,但Kimi商业化还能有一些进展的原因
5/ 多智能体非常有可能诞生下一个关键的scaling方向,也是K家押注的一个重要方向,主包表示赞同,软件层面看,把单个agent模型做好是scale up,multi agent本质是把智能scale out
6/ 我虽然很看好xAI,但是Grok现在的多智能体验确实平平,Grok 4.2 的亮点也是多智能体,但是和之前体验没有好特别多,交付能力还是有限,问xAI的人说是正在做真正的Agent产品了,不知道为啥进展这么慢
7/ 有用过K家的Agent Swarm的朋友可以交流下,感觉还是比较耐操的,可以交付非常heavy的工作(输出10万字报告或者大型PPT/Excel),有深度用户的话可以评论区交流一下。我现在就希望K家继续优化,Agent Swarm干活多,但是token消耗也多,重度用户多开几个就和claude code一样额度很快打满了
8/ 中国公司做产品果然还是更好一点,至少在多智能体这个体验上,我觉得中国公司完全不输海外,完全不是追随状态。也记录一下,现在DeepSeek+Kimi的估值加在一起还不到OpenAI的1%
发布于 北京
