风云学会陈经
26-08-02 16:37 微博认证:亚洲视觉科技 研发总监 2024微博年度新知博主 长文原创作者 财经观察官

#印度韩国突然宣称有媲美DeepSeek大模型#
这并不奇怪,做出开源大模型难度降低了很多,也能有个别亮点。日本也做了

韩国这个是真的做出来了,有些自己的东西。

Motif-3-Beta是韩国AI基础设施公司 Moreh 的子公司Motif开发的。团队2025 年 2 月才成立,仅约 30 人,B 轮融资约1600 万美元。​韩国政府直接提供了约 700多块英伟达 B200 GPU,5 个月弄出来了一些东西。

Motif-3是稀疏混合专家模型(MoE),总参数314B,激活约 13B参数,384 个专家,8 活跃1 共享。上下文窗256K,专门用约 106GB 韩语语料 预训练,主打韩语 NLP。Motif 强调这是完全独立的韩国架构,没有基于任何外国开源模型做微调。这完全可能,从头训练是可以的,机构和技术借鉴。据说在开源模型中排全球第三,仅次于 Kimi K3 和 GLM-5.2,这个水平是可以的,但是还需要具体评测。之前已经做了Motif-2,发展轨迹清楚。中国开源以后,学习难度低了很多。

印度这家Sarvam AI 是班加罗尔的初创公司,公司成立仅两年多,团队 114 人,最近完成了印度初创企业史上最大 B 轮融资,高达2.34 亿美元,估值 15 亿美元。

Sarvam 声称构建 3 个模型的累计计算成本约 2000 万美元,比 DeepSeek 还低。​关键是2025 年 4 月,印度政府在 60家申请机构中选中 Sarvam 承接主权大模型项目,提供 4096 块英伟达 H100,使用期 6 个月,政府补贴部分算力费用,换取 Sarvam 股权。要求模型必须从零训练,完成后开源。印度政府也怕开发者忽悠钱。

三个大模型,Sarvam-30B,预训练用了约 16 万亿 token,32K 上下文,MoE 架构每次推理只激活约 10 亿参数。Sarvam-105B是128K 超长上下文,声称在多项推理基准上超过了 DeepSeek-R1。

开源后行家看配置文件,发现架构是DeepSeek 的山寨缩水版,借鉴了 DeepSeek 的 Multi-head Latent Attention 和 MoE 设计。应该是从零训练的,这技术不算难。

日本也有好几个企业做的大模型,但是没有很出名的,水平都一般。

韩国印度的模型基本都是个别性能训练得有些亮点,就拿出来说。但是实际使用幻觉严重,综合指标不行。

发布于 上海