招财小仲景
25-07-13 20:31 微博认证:投资内容创作者

⚡大模型的夏季更新浪潮开始了

【1】Grok 4能力符合预期,关注后续更新:

1)Grok 4基于20万卡的Colossus集群训练而得,后训练中的RL算力较Grok 3投入提升10x,甚至已经超过预训练算力消耗;基准测试表现优秀, 在HLE、GPQA、AIME25等评测集上分数高于o3、claude 4等前沿模型;API价格$3/15每百万tokens,和Sonnet 4价格相同;支持256k上下文长;

2)实测下来目前业内对Grok 4的评价不算特别高,优势包括逻辑能力/计算能力强、长文本召回能力强、部分人表示Grok 4 Heavy能够解决其他前沿模型解决不了的难题,适合在科研领域使用。Grok 4的劣势则包括代码能力不行、指令遵循能力不行、API速度慢、幻觉率高、倾向于过度思考、看不到推理轨迹、也关闭不了推理模式等;

3)Grok后续还有一系列的升级计划,包括8月的Coding模型、9月的多模态Agent、以及10月的视频生成模型,上述的一些能力短板有望在后续更新中补全,我们需保持动态地评估

【2】Kimi开源基模K2,Agent能力是亮点:

1)K2采用MoE架构,模型大小 1T, 激活参数量32B,上下文长度128K,擅长Coding与Agent任务,目前暂不支持多模态与思维模式。训练阶段,K2使用了自家的MuonClip优化器实现万亿参数模型的稳定高效训练,后训练使用了大规模Agentic合成数据做强化学习。推理部署需要至少16张H200/H20;

2)K2的模型架构和dpsk-V3相比,参数量更大(1T vs. 671B)、更加稀疏(384个专家 vs. 64个专家,激活数都为8个)、注意力头数量更少(64个 vs. 128个),这样的做法可以在减少显存开销的同时,增加推理的泛化能力;

3)K2受ACEBench启发开发了完整的工具调用培养流程,规模化模拟了大量的多轮工具使用的真实场景(包括MCP调用)。这种可扩展的流程能生成多样化优质数据,为大规模拒绝采样和强化学习奠定基础。RL环节采用self-judging机制,让模型担任自身批评者,为不可验证任务提供可扩展的、基于评分标准的反馈;

4)实际测试下来,K2的优势包括代码能力提升大、Agent能力提升大、创意写作能力不错;劣势包括Context不够用、推理速度慢、会出现指令遗忘、幻觉较高。总体来说K2是一款底子不错的基模,Kimi也是后续国产o3的有力竞争者

【3】大模型的夏季更新已经拉开帷幕

1)海外方面,OpenAI将于近期发布一款开源模型(原计划是下周发布,但因需要额外的时间做安全测试决定推迟),这将是OpenAI自2019年开源GPT-2后的首次开源。另外Sam也公开表示GPT-5也会在这个夏天发布。除此之外,谷歌Gemini 3也在X上被爆料即将开始内测,叠加刚刚钞能力招兵买马的Meta和上述还有一系列更新的Grok 4,海外前沿模型的竞争势必会非常精彩

2)国内方面,Kimi K2和上月发布的Researcher都证明了RL在国内的技术可行性,Doubao1.6的代码能力在开发者中认可度也在提升(民间已经出现了一些Claude Code+豆包的平替方案)。我们预期Q3还将迎来DS V4/R2、Qwen3.5、Douabo2.0等一大波国产模型的更新,我个人对此是充满信心和期待的

3)展望后续的模型能力迭代的方向,我们希望看到大模型具备更长持续时间的推理、能够调用更加丰富的工具、能够具备原生的记忆能力、突破现在主流的上下文窗口上限、以及在多智能体系统取得更多突破。我们不建议去预测某一款具体模型的能力,但上述能力维度可以作为我们判断新模型是否超预期的一把标尺,供大家参考

【4】建议关注:#鼎捷数智 (台湾订单提速,A股的美股应用)、#光云科技、 #金蝶国际、 #第四范式 等

HYJSJ DJN⚡⚡⚡

发布于 浙江