程墨Morgan
25-02-09 19:17 微博认证:AI博主

AI大神Andrej Karpathy在2月6号往油管上发了一个长达3个半小时的视频《Deep Dive into LLMs like ChatGPT》,信息密度非常大,质量非常高,只可惜我没有完整的3个半小时,不然真想一口气看完,只能这几天断断续续看,今天看完之后,感觉大受震撼,我笔记都写了四五页。

虽然卡神讲的很多东西我以前也知道,但是卡神组织得更好,而且他也说了很多以前我不知道的LLM知识,强烈建议大家去看原视频,没有科学上网方式的,去B站也能找到搬运资源,搜索Deep Dive into LLMs like ChatGPT即可。

我这里分享一下我的学习心得。

卡神的一些神比喻,非常贴切:
- 预训练(Pre-training)就是下载和压缩互联网,只是这种压缩是有损压缩
- 训练的过程,就像是DJ在根据音色反馈旋转调音板上的Knob
- 推理的过程,就像是扔有偏差的硬币(biased coin),根据扔的结果决定下一个token是啥
- 预训练相当于读课本上的知识,SFT相当于看课本上的例题解答过程,RL相当于做课后那种只有最后答案但要自己写演算过程的题。

卡神对于AI幻觉的一些有趣介绍:
- 早期LLM的SFT训练样本都是自信回答的预期,LLM也就被训成对不知道的知识也自信地胡说八道了。
- 在SFT过程中用一些问题发现LLM的知识盲区,然后就增加训练数据,让LLM面对这些问题的时候回答I don't know,就可以有效缓解AI幻觉
- 鼓励LLM去使用外部工具(比如网络搜索),也能够缓解AI幻觉

卡神反反复复强调的一点,就是LLM本质就是一个token生成器,没有什么魔法,就是根据概率来产出下一个token,这也可以解释为什么需要SFT让LLM输出多一些token之后再产生结论,因为一个基于Transformer的LLM顶多几百层,了不起上千层,对于每个token的计算资源是非常有限的,如果让LLM在一两个token中得出结论,那这有限的计算资源肯定不如让LLM在产生几百给token之后的计算资源,更多的计算资源产生正确答案的概率肯定更大。

卡神专门有一段介绍DeepSeek R1,对R1赞誉有嘉,他也提到有的人担心R1是中国的AI就『怕被盗取隐私』,说这是开源模型,你就自己下载用也行,用美国服务提供商的R1 host也行。

因为卡神讲的太浓缩了,我肯定不能介绍完,大家有时间真应该去看一看原视频,绝对值得花这3个半小时。

#人工智能##LLM##AI#

发布于 美国