宝玉xp
26-08-18 22:11 微博认证:前微软Asp.Net最有价值专家 2025微博年度新知博主 科技博主

一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果:
> 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。

Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具,撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事

小模型+工具就能行的观点之所以流行,因为理论上确实说得通:模型不知道的冷门知识,可以上网查;不会算的题,可以调用代码。小模型加工具,似乎没有做不到的事。而小模型意味着更低的算力成本,对整个行业都很有吸引力。

他用自己学羽毛球打了个比方。教练教的每个动作他都能做出来,但要在实战中流畅串联,跟练了上万次形成肌肉记忆的人完全不是一个级别。语言模型也一样,内化了知识的大模型和靠工具临时检索的小模型,体验差距很明显。

具体来说有三点。第一是速度,直接给出答案远比调用工具搜一圈再回答快得多。第二是理解的深度,比如你问一个音乐节的口碑如何,大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果里排在前面的几条评论。第三是可靠性,每次都要重新查资料、重新推导,出错的概率更高,在复杂的长任务中错误还会层层累积。

回顾“苦涩的教训”(Bitter Lesson)里面的观点:历史反复证明,靠扩大规模获得的能力提升,总是胜过精巧的工程设计。工具让小模型能做更多事,但追求最高质量的用户,始终会需要更大的模型。

x.com/_jasonwei/status/2089429555371024577
---- 原推转译 ----

工具调用无法取代更大的语言模型

语言模型刚开始能够熟练使用工具时,我很认同一种说法:我们不需要继续扩大语言模型的规模,只需要一个足够强大的「认知核心」——比如拥有 10 亿参数——其余一切都可以通过工具调用来完成,例如浏览互联网或执行代码。我想,当时很多人都认同这个观点。确实,我们很难找出一项有意义的任务,是一个能够充分使用工具的 10 亿参数模型在理论上无法完成的。例如,大语言模型知道的任何冷门事实,原则上都可以从互联网上检索出来,再交给一个 10 亿参数的语言模型进行推理。

但现在,我认为这个观点完全错了,原因很简单:不依赖工具也能快速、自然地完成任务,这件事非常重要。

真正让我理解这一点的,是我今年学习羽毛球的亲身经历。打羽毛球时,我就很像一个「10 亿参数的认知核心」。教练教我的每一种击球动作,从身体能力上说我都做得出来,但我要在脑中记住每个动作要领,再把它们组合到一起,需要付出很大努力。练习时,我几乎可以完美地完成一次击球;可一旦进入连续的对打,我就很难做到,在比赛中更不可能稳定发挥。这显然不同于那些把一个动作练习过上万次、已经能凭本能轻松完成的人。

同样,语言模型无需调用工具、直接在内部掌握一个事实,是有实际意义的。第一,我们显然很在意速度。相比让模型长时间思考以确认答案,或者再去浏览网页,你当然更希望立刻得到回答。第二,有些东西就是更适合通过大量数据上的反向传播来学习。假如你问大家通常怎么看 Shambhala 音乐节,你会更希望大语言模型根据互联网上的全部数据给出一种综合意见,而不是复述网页搜索排在最前面的三条评论。第三,费很大力气寻找答案,可靠性不如一开始就知道答案。理论上未必一定如此,但至少目前在实践中很可能就是这样。如果每次都要重新查找事实,或者重新做一遍数学推导,出错的概率就会更高;在长周期任务中,这些错误还可能不断累积。

一旦你认同「不使用工具、直接依靠模型参数完成任务」具有价值,就必须承认:一个 10 亿参数的认知核心远远不够。10 亿参数的模型能够内化多少知识,存在信息容量上限,而我们肯定希望 AI 知道得更多。即使 1 万亿参数,可能也仍然不够。我们会希望 AI 尽可能了解我们的世界,希望它不断吸收新信息;同时,我们对 AI 能为自己做什么的期待也会持续提高。

简而言之,工具调用可以让小模型完成更多事情,但那些追求最高质量智能的人,始终会想要更大的模型。「苦涩的教训」(Bitter Lesson)再次应验了。

发布于 美国