前HR本人
26-08-03 21:03 微博认证:柏林工业大学珠三角校友俱乐部 理事

果然很印度啊,那个声称比DeepSeek更便宜的印度模型Sarvam AI其实很拉胯。
​首先,Sarvam AI并没有什么原创性,它是采用的DeepSeek开源出来的模型架构。比如说,Sarvam 105B采用的多头隐注意力(Multi-head Latent Attention)架构,就是DeepSeek 提出的,并发表了论文。它们就是直接“借鉴”了。

现在全球很多国家的所谓AI大模型“创新”,就是在中国大模型基础上修修改改,然后就忽悠了。这个领域就是中美,其他国家没有戏。

发布于 广东