马力AI和商业思维
26-06-23 20:45 微博认证:知群 CEO 微博新知博主

Karpathy 拿一张显卡放了两天,让 AI 自己跑了700次实验,挑出20个真改进,把训练速度又压快了11%,而这份代码,本来就是他这种顶尖研究员反复打磨过、相当成熟的。

更值得说的不是那11%。是他把「让 AI 自己迭代」这件听起来很玄的事,拆成了三个普通人也能照抄的零件。

先说这个人。Andrej Karpathy,前 OpenAI 创始团队成员、前特斯拉 AI 总监,训练大模型这件事上,是影响力很高的那类机器学习研究者。他最近开源了一个小框架,叫 autoresearch,干的事情很直白:让一个 AI 自己去做机器学习实验。

我最近在把 AI 圈这些人的分享系统过一遍,他这个东西让我盯着看了半天。

它跑在他自己写的 nanochat 上,一套训练 GPT-2 级别小模型的代码,本来就被他打磨得很干净。真正干活的训练代码大概630行,外加一个用大白话写的提示词文件,告诉 AI 该往哪个方向折腾、有哪些规矩不能破。然后一张显卡、放两天,AI 自己跑了大约700次实验,从里头筛出约20个真有用的改进。叠在一起,把训练到 GPT-2 那个水准的时间从2.02小时压到了1.80小时。

听着不起眼,但你得记住前提:这是在一个全球顶尖研究员已经反复优化过、相当成熟的代码上,又抠出来11%。

里头有个细节挺扎心。AI 翻代码的时候,揪出 QK-Norm(注意力里的一个归一化环节)的实现少写了一个标量系数,结果注意力在各个头上摊得太散。这个 bug,Karpathy 自己反复调了那么多遍都没发现。

这就有意思了。一个 AI,把一个顶尖高手都没看见的盲区给翻出来了呢。

好,那它到底怎么做到的?说穿了,整套方法就三件套。我把它叫做自动科研的「三原语」——一个能改的东西、一个能比的分数、一个固定的时长。

第一件,一个能改的东西。

它只让 AI 动一个文件,就是那个 train.py。别的文件碰都不让碰。这一条特别关键。你要是把整个项目都敞开给 AI 改,它东改一笔西改一笔,过两天你自己都不知道它干了什么、哪儿改坏了。锁死在一个文件里,边界就清楚了,每一次改动都看得见、对得上。

第二件,一个能比的分数。

每跑完一轮,好不好不靠感觉,靠一个数说话。它用的是 val_bpb(验证集上的「每字节比特数」,数越小说明模型把文字压得越省)。为什么非得是一个数?因为 AI 自己要判断「这版比上版强还是弱」,得有个能直接比大小的硬标准。而且这个数还不能被刷分糊弄,换个词表、改个花样都骗它不了。一个干净、能比、骗不了的分数,是整个循环能自己转起来的命根子。

很多人做事卡住,其实就卡在这第二件上。一件事好不好你说不清、量不准,AI 帮你试一百遍也没用,因为它不知道哪遍算成功。你能把「好」翻译成一个数,这件事才有资格交给机器去磨。

第三件,一个固定的时长。

每次实验都只跑5分钟,不管你这台机器快慢。固定时长才公平:这版花5分钟拿到的成绩,跟那版花5分钟拿到的成绩,才能放一块儿比。要是这次跑3分钟那次跑8分钟,比出来的高低就没意义了。

三件凑齐,循环就转起来了:AI 读一遍说明,改那一个文件,跑那个固定时长,看那一个分数,好的留下、差的退回去,然后再来一遍。整夜不停,一小时十几轮。

为什么这事值得普通人也关心?

因为过去做研究,最熬人的从来不是没想法,是人本身就是那个瓶颈。一个研究员,脑子里想法一大把,可手是慢的。改一行、等显卡跑完、看个结果、再改下一行,一天到晚手搓也就八到十轮,大半时间还耗在干等机器上。Karpathy 的判断很直接:拖慢 AI 研究的,恰恰是人。所以他想做的,是让 AI 自己没完没了地往前推,最好一点都不用人插手。

这套思路真正聪明的地方,是它跟「训练大模型」其实没多大关系。你把那三件套抽出来看:一个能改的东西、一个能比的分数、一个固定的预算,这玩意儿普通人照样能套到自己手头的活儿上。

举个最实在的例子,改简历。

一个能改的东西,就是你那份简历文档;一个能比的分数,你可以让 AI 站在招聘官的角度给个停留意愿打分,0到10分;一个固定的预算,比如每轮就改这么多、花这么点额度。然后让它自己改一版、打个分、留下分高的、扔掉分低的,循环个几十遍,你回头挑最高分那版就行。文案、标题、产品介绍,全是一个路子。

而且这不挑模型。你用 DeepSeek、Kimi、通义、豆包,配一个简单的循环脚本,一样能仿这套结构出来。核心从来不在你用哪家 AI,在你有没有给它搭好这三件套。

我自己琢磨下来,三件里最难的不是第一件也不是第三件,是中间那个分数。能改的文档好找,固定的预算好定,可「怎么把好坏量成一个数」往往要你先把自己想清楚:你到底想要什么、什么样算更好。这一步逼着你把模糊的目标讲明白,反倒是整件事里最有价值的功课。AI 只是替你把后面那几十遍笨功夫扛了。

说回 Karpathy 本人。这套东西很巧,但他自己也把边界讲得很清楚:单显卡、单文件、单指标,本质上是个很小的沙盒,干的是把人类做实验那点机械的体力活自动化,离「AI 自己发现新科学」还差得远。别被「自动科研」这四个字唬住。

真正让我后背有点发凉的,反倒是 QK-Norm 那个 bug。连他这种级别的人,亲手调过无数遍,都漏掉的东西,AI 闷头跑两天给翻出来了。这一笔,既说明这种自循环是真有用,也说明人手搓出来的盲区,可能比我们以为的大得多。

所以最后留个问题给你:你手头有没有那么一件事,是要反复试错、改了又改、却一直凭感觉判断好坏的?如果有,它缺的可能就是那三件套里的某一件——多半是那个能比的分数。

#马力的AI知识分享#
#马力在记录AI领域500位大佬的分享#

发布于 北京