【当我们谈论大模型的参数时,到底在谈论什么?】
写这篇文章的起因很有趣。听闻我的一位编辑同事在半夜醒来,在笔记本上潦草地写下了一句话:“什么是参数?”凌晨四点产生的想法通常不太靠谱,但这却是一个非常好的问题——它直击了大语言模型运作原理的核心。
#大语言模型# 的参数通常被比作控制模型行为的刻度盘和操纵杆。你可以试着想象一台行星般大小的弹球机,几十亿个挡板和缓冲器经过精确设置,将球从一端弹射到另一端。而只需要微调这些设置,球的运动轨迹就会发生变化。
#OpenAI# 于 2020 年发布的 #GPT-3# 拥有 1750 亿个参数。Google DeepMind 最新的大语言模型 Gemini 3 可能至少拥有一万亿个参数,有人甚至估计这个数字可能高达 7 万亿,但该公司并未透露具体数据。(鉴于目前激烈的竞争环境,AI 公司不再分享关于其模型构建方式的信息。)
尽管模型各异,但参数的基本定义,以及参数如何赋予大语言模型惊人能力的原理是通用的。如果你想知道大语言模型真正运转的机制,想了解那个多彩的弹球机比喻背后到底如何运作,让我们一起来深入探讨。
戳链接查看详情:http://t.cn/AXbliPwj
