今天谈谈电子鹦鹉项目。有个叫Minimind的LLM学习项目,今天看已经有35k个星星了[震惊]而我的Nano项目只有0.2k个星星[泪奔]
g♂thub.com/bd4sur/Nano
从项目的复杂度和完成度来看,我确信Nano是不逊于Minimind的,但是两者的关注点不同。Minimind更关注训练,强调PT+FT+RL的全流程覆盖,以及对新手相当友好的实操教程。而我更关注推理,强调可视化和端侧部署。两者都从零训练出了100M规模的语言模型,至于实际能力嘛,我只能说都还没有跨越量变到质变的门槛,几乎没有实用价值。
基于我对语言模型的“电子鹦鹉”实质的认识,我对训练意兴阑珊,并不试图千方百计攀登模型能力的高峰,而专注于将电子🦜装进千奇百怪的笼子里。正是因为认识到自己不具备训练实用模型的条件,我把重点放在推理,尤其是端侧推理上,在2024年年中兼容了Qwen3,向着电子🦜的产品化实用化迈出了一大步。
Nano项目最早是2023年12月从Karpathy大佬的nanoGPT项目复刻而来,初衷是给GPU服务器烤机。当时我对LLM并没有很大兴趣,后来机缘巧合下开始深入研究nanoGPT,发现很有趣,是个内涵小外延大的东西,于是开始尝试自己手搓LLM。在此之前,先整了一些活儿,比如用Transformer解决Q问题,排序问题等等。
我曾经也想将Nano打造成像Minimind这样的教学项目,但后来放弃了助人的想法,而专注于自我教育——教育自己理解LLM的复读机本质。我甚至希望把Nano打造成VLM(CLIP代码至今仍然在代码库里),后来也是兴趣寥寥而作罢。
一件商品的价值,归根结底取决于它对别人有什么用。一流产品做标准,超一流产品做生态。像Minimind这样的学习项目,极大降低了入门AI的门槛,催生了一大批以讲解Minimind为业的讲师,可以说是功德无量。在Minimind之前,也有很多所谓的“tiny-llama”项目,试图低成本复刻1B级模型,但是完成度不高,效果也不够好,因而默默无闻。这说明,LLM作为一种小内涵大外延的东西,入门是不难的,难的是怎么把它玩出花儿来,实现“从技术到收益的惊险一跃”。从这个角度看,我的电子鹦鹉有200个星星,我已经很满意了。至于后面如何培育这个电子🦜,就交给缘分吧。
