我在网上看了这么久,确实没看到真正懂AI底层机制的人。要么都是直接复制过来泛泛之谈,自己讲得一头雾水,别人听得一头雾水。要么就是长篇大论,玄乎其技。你也不知道它是真强啊,还是在用概念砸我们,玩信息过载就能掩盖业务能力弱的游戏。
我不否认有很多AI的大牛,人外有人,但是呢,真的牛那就在大厂里赚大钱,没功夫来网上闲扯。有一些也很愿意分享,但站位太高了,和公众传播的gap太大了,也不太会给普通人讲,索性就自嗨了。
今天给大家讲一个AI的概念,我都不用从头开始讲,随便找一个也能用大白话让你们清楚是什么。比如transformer里有一个“因果注意力”机制。这东西听上去很玄乎,但实际上简单的不能再简单了。
在模型训练过程中需要给料,就像给火车烧煤一样,一铲子一铲子往里加数据,你不能一块往里塞,处理不过来。这一铲子下去比如说10个token,但大模型不能10个token一起处理,只能一个一个处理。它要做的工作是把这10token的意思进行编码,生成一个权重,以后再听这句话的时候,就知道接下来该说什么。
比如说给料是“今天天气不错”,模型对它开始编码训练,问“今”你猜猜你身后是谁,今回答说“可能是气”,反向传播说不对,你再猜,最终猜到了(位置1的)“天”,这回说对了,猜的时候用的是权重,所以就把权重给记录了下来,这就训练好了。
因为我们给料的时候是一起给的,今能看见天(通过QKV特征加权求和),这时你训练它说你后边是谁,今马上说是天,因为它看到答案了,所以训练的效就没了。那么就需要一个机制给今后边的“天”盖住,这个机制就叫“因果注意力”,其实就是我们考试的防作弊机制,给答案加一个盖板,这个盖板叫因果掩码(Causal Mask)。
发布于 北京
