多说几句早上那个字节大模型的战略选择不蒸馏路线的话题吧。
The Information把相关原因推测为担心再次出现TikTok那样的地缘危机,属于合情但不合理。
我这么说字节可能也不爱听,就是真要算起账来,跟排在前面的GLM、Kimi、DeepSeek比起来,Seed在美国市场的调用量根本不够看,天塌了也是高个子先碰到头好吗⋯⋯
Z Finance提了一个点,字节Seed内部不只是禁止蒸馏美国的模型,连中国的开源模型也不让蒸,设置了硬检测机制。
国内市场总没有蒸馏禁令吧,说明字节并不是担心TikTok事件重演,纯粹是对技术路线的分歧做了选择,判断蒸馏会干扰自己这边的训练突破,不想被一时的榜单捆住手脚。
很经典的张一鸣延迟满足理论。
再次推荐一下姚顺宇的那期播客,讲了很多关于蒸馏的业内研究,其中一个主要观点是,蒸馏的技术路线存在「知其然而不知其所以然」的代价,能做对题,但未必掌握了正确的解题思路,适合追赶,无法领先。
在我看来,蒸馏是一个中性的手段,或者说属于学习手段之一,而不是唯一,就像同样是背单词,有人用间隔重复法,有人用词缀记忆法,有人用语境阅读法,不必分对错,用结果说话。
再说了,字节能不走蒸馏的路子,如果真的可以长期坚持下来,摸索出独有的训练路径,对于国产模型的大形势也是有好处的,选择越多,就一定主动在我。
发布于 湖北
