硅谷王川
23-03-02 00:59 微博认证:独立投资人

大语言模型如 chatgpt 的培训,有个概念叫做 "人工反馈增强学习" ( Reinforcement Learning from Human Feedback, 简称 RLHF ).

简而言之,就是每次模型生成文本,用人工反馈作为性能衡量标准,优化模型。这里面的第一个挑战是人工反馈比较昂贵; 第二是不同的人对同样的输出会有不同的反馈,让语言模型无所适从。

正确使用社交媒体,可以看成是对自己的 RLHF. 粉丝越多,获取反馈的成本就越低,这样培训自己的成本也越低,进步也越快。当然需要注意的是,迅速拉黑没有任何价值的,不友好的反馈和抬杠。

发布于 美国