悖论Nano
26-04-24 16:41

#DeepSeekV4发布#
鉴于之前就提到的语言大模型(LLM)进入趋同阶段。http://t.cn/A68PsZF6
现在各个大模型在简单问题上的能力大差不差
真正有区分度的,还是在复杂问题上的能力,比如大体量的软件工程,极其复杂的基础问题,需要广泛信息的深度思考。

简单地说,就是常说的「聪明」与「智慧」的区别。
类似精英中人与人之间的智力差别很小,有区分度的是每个人一辈子塑造的知识体系在应对危机时的整体水平差异。
再类比的话,就是计算机CPU水平都是顶尖的,但是装的系统、软件水平差异。

还是那个问题,LLM是语言大模型,依靠输入的世界知识概率性地影响训练结果
如果本身世界知识存在错误,就会污染万亿参数构成的知识网络
对于复杂问题,在解决的过程中很有可能受到相关的错误知识构成的知识网误导,导致输出结果出现概率性偏差,整体上就表现地笨一点。

虽然已经有许多判定对错的逻辑模块,但始终还不是逻辑大模型
一切信息要满足需求,最终都需要判定对错
所以LLM竞争赛道始终是逻辑能力

逻辑算法与上下文规模是一定程度上互补的,
因为根据我们这世界事物之间的普遍联系,对于复杂问题和输入的世界知识,想进一步提升判断对错的能力,除了更高效准确的逻辑算法以外
可以通过识别多层次多领域事物之间的同构,相互制约而纠正
世界知识污染,单次对话有问题,多次对话或者挂载RAG纠正就行

但是需要的上下文自然非线性爆炸增长
逻辑算法厉害,上下文规模可以小一点
上下文规模可以大,那么逻辑算法可以差一点

其实和解决复杂问题类似,哪怕再聪明的大模型,在解决复杂问题时也无法避免需要大规模的上下文长链思考、多次对话
一旦需要大规模的上下文,那么训练和推理的成本也非线性爆炸增长
所以上下文规模、成本是一体两面的
所以,在逻辑算法没有突破性进展的情况下,成本/上下文规模就是接下来所有模型竞争的赛道。

DS或许比其他大模型更早看清这一点。
DS一开始就不停地卷推理成本,如今DSv4使用国产芯片,打破算力成本的天花板,可预见未来工业克苏鲁爆产能后,成本会进一步下降,而算法方面也一直降低训练和推理成本,包括这次新的注意力机制,未来自然也不会忽略逻辑算法,都是在为提高上下文铺路,这是极有远见的正循环。因此有了如今普惠的1M上下文。
此外,我们国家的电力成本本身也非常有优势。

因此,可以预见的是,DS在解决复杂问题上的潜力还有可以挖掘的空间
而国外的模型在电力成本问题上有天花板,而且看样子在降低训练和推理成本上不尽人意。

至于开源问题,大概未来大家会意识到,输出大模型本质是在输出意识形态,对国家来说,和收API那点钱比,生死之地不可不察。

之前关于大模型的内容
[符号、语言、逻辑的区别](http://t.cn/A6QAvTch)
[语言模型依赖符号概率相关性只蕴含相对较弱的贝叶斯主义推理能力](http://t.cn/A6QlcCT9)(https://weibo.com/7809831819/OnZJY5IzU)
[语言不是思维的神经学证据](http://t.cn/A6QlVevv)
[语言是交流工具的语言学证据](http://t.cn/A68PsZFJ)
[辩证地理解语言大模型中的逻辑能力](http://t.cn/A68PsZF6)
[大模型参加高考文理偏科](http://t.cn/A68PsZFI)
[大模型未来会冲击新闻传媒业](http://t.cn/A68PsZFt)

发布于 四川