犀小莉
25-01-31 20:48 微博认证:科技科幻博主

翻旧卷,恰好读到“圣人病病,是以不病”,在这个特殊时刻,灵感再次直击灵魂:老梅发动的巅峰科技战,选择从大语言模型切入,实在是自寻死路。他们,太不了解中文了。中文这种高维度度语言,太适合语言大模型场景了。

以病字为例,偏旁病字头表示了内涵意思,丙则标注了读音。光这一个字,就是发音和意思一体表达了两个维度的意思。

而在“病病”两字中,因为在句子中顺序位置的变化,又延伸出意动的功能,动词化使用了。这一点很重要,在数学表达上就是以更小的矩阵规模组合出更丰富的排列组合。

进一步展开,八个字表达的意思,用现代汉语表达相同的意思,大概是30个字左右。可观的是,就算这30个字的句子,仍然是当前世界主流语言中表达效率最高篇幅最小的文字了。

显然,如果以文言文的形式整理语料来投喂语言大模型,那么这个语言大模型必然是所需存算资源最小最精简的大模型。有趣的是,由于我国历史上的史官制度,大量的事件被记载下来,语料是充足的。加上秦始皇早早就统一了文字,相当于做了初步的数据结构化。越是古早的典籍,用字越精简,而且还被后人从各个角度注释,相当于又多次丰富了汉字本身在不同维度的表达力。

这个世界上,没有任何一个其他文明,拥有像汉字文言文这样的浓缩了高维度信息的语言。这样的文字,只在科幻片《降临》中见过类似的:七支桶文明的文字,以环形多分叉的结构融合了时间和空间信息的表达。

片中那些使用字母文字的西方人,把这种文字认定为是高级维度文明的特征。而中华文明系统中,先人自古以来就使用一种类似的文字系统。

中美语言大模型领域的对阵,除了数据、能源、芯片这些方面的持续角力,最终会祭出双方竞争最本质的东西,就是语言本身的维度。我们已经脱离了文言文的日常使用,但是祖宗留下的语言和语料资产还在。你想想开头那8个字,用白话文对应的是30个字,用字母语言来表达的话要多少个词?多少个字母?以及何处来体现这8个字的意境?

我们的古文和字母文字文明的古文完全不一样。我们的古文代表着精炼,浓缩了音意形境等等高维信息。而对面越是“古文”,越是粗鄙,连拼写都乱七八糟,放到表意的矩阵里就是一个规模巨大但是极其稀疏的矩阵,变不出什么花样。

这就让我们在大模型竞争中,于芯片技术、能源等级和数据规模之外,获得一种语言本身的降维打击优势。而这种优势太过高端,别说非汉语母语水平的人难以理解,就连以汉语为母语的人群中,也只有一小部分语言精英能掌握。

我们做一个前瞻,语言大模型,技术差距可弥补,能源水平可追赶,到头来还是在语言本身的优越性上决胜负。之乎者也,又省又快又多,到头了。到头了就面临另外一个问题,去现实大模型的战场PK,那是一个更宏大的战场…

发布于 浙江