你有没有让 AI 一口气帮你跑过一串活儿——订票、查资料、再把结果整理成一份报告那种?前面几步看着都对,越往后越离谱,最后结果完全跑偏。
这种体验现在越来越常见。AI 早就不只是一问一答了,你给它一个任务,它能自己分步骤、自己调工具、自己往下做。可一旦让它连着跑十几步,翻车的概率就高得吓人。
有一篇论文专门去拆了这件事,标题叫《Where LLM Agents Fail and How They Can Learn From Failures》,18位作者的团队,把200条失败的 AI 运行记录一条一条标注出来(就是从头到尾盯着它每一步怎么走的),想看清楚它到底是怎么崩的。
结论挺反常识的。AI 跑多步任务时,真正要命的不是某一步做错了,是它做错之后,还一脸认真地基于这个错往下做。
我把这个现象叫「错误传染」。
意思是,一个根上的错误,会顺着后面每一步决策一路扩散下去,越滚越大,最后把整个任务带崩。错误不会自己愈合,只会滚雪球。
打个比方,这就像跟错了导航。第一个路口你拐错了,但导航全程都觉得自己在对的位置上,后面每一步都认认真真地基于这个错误的起点重新规划路线,开得越久离目的地越远。它不是某一步突然失灵,它是每一步都很努力,只是地基是歪的。
AI 也是这样。它不会在某一步突然变笨。它前面埋了个错,后面所有看似合理的操作,全建在这个错上。你盯着它后半段看,会觉得每一步都挺正常,可结果就是不对。因为问题早就发生在你没注意的那一步了。
那它都错在哪些地方?这篇论文把 AI 的失败分成了五类,我觉得对照着看挺有用,因为它解释了「越做越离谱」到底是哪个环节出的问题。
第一类是记忆。它没记住、或者记错了前面已经出现过的信息。比如你早就告诉过它一个条件,跑到后面它忘了,或者记串了。
第二类是反思。它对自己的进度判断错了,最典型的就是把没做完的事当成做完了,然后心安理得地进入下一步。
第三类是规划。一上来任务就拆错了,方向定歪,后面执行得再卖力也是白费。
第四类是行动。该调 A 工具它调了 B,或者工具用对了但输入的格式不对,操作直接失败。
第五类是系统。这类不怪 AI,是外部原因,比如工具临时不可用、接口报错、环境有限制,它也没办法。
这五类里,前两类特别值得说。论文发现,多数失败并不是在最后一步崩的,而是聚集在中间那段;而源头,往往是记忆和反思出了问题,再带崩后面的规划。
说白了,AI 翻车很少是「最后没收住」,更多是「中间记岔了、或者误判了进度」,然后它揣着这个错继续走,一步步把自己带进沟里。这跟我们想当然的不太一样。我们总以为它是越到后面越难、所以才错,其实坑早就在中段挖好了。
举个最常见的传染链你就懂了。第一步它记错了一个条件(记忆出问题),接着它对着这个错的条件去判断「我应该差不多做完了」(反思跟着出错),于是它在错误的前提上重新规划下一步该干嘛(规划被带歪),最后调用工具去执行(行动看着没毛病,可方向全错)。你看,五类失败里前一类塌了,后面的就像多米诺骨牌一样接连倒下。它每一步都「合逻辑」,只是逻辑的起点是坏的。
知道了这个,下面这件事就更关键了。
既然错误会传染,那救它的办法,就不是在它崩掉的地方打补丁。
这是很多人会本能犯的错。AI 跑出来的结果不对,我们一看,行,那你「再改改」「重新弄一下」。可它是在哪儿改?在那个已经歪掉的地基上改。你让它修后面的症状,它就在错误的延长线上修修补补,越改越乱,因为根上那个错你压根没碰。
这篇论文做了个实证,挺能说明问题。他们专门做了个工具去定位 AI 失败的根因,也就是那「第一个决定性的错误」,而不是后面一连串的连带反应。结果,靠这个找根因的本事去回灌纠错,AI 完成任务的成功率最高能相对提升26%。而他们这个找根因的准确率是24.3%,对比之下,原来的方法只有0.3%(差了几十倍,不是一个量级的事)。这个24.3%是严格口径,论文里叫「全程全对」(哪一步出错、错在哪个环节、是哪类错误,三样得同时答对才算数),不是随便指出个大概位置就行,所以别看绝对值不高,它已经把基线甩开几十倍了。
这两个数字摆一起,意思就很直白了:能不能找对那「第一步」错在哪,几乎决定了你能不能把任务救回来。改对了根,后面顺了;只盯着末端的乱象修,是救不回来的。
所以落到我们普通人怎么用 AI,我觉得有几条挺实在:
第一,发现 AI 走偏了,别急着让它「在原结果上改」。先往回找,找到它第一步是从哪儿开始歪的,回到那一步重开。在错误的地基上让它「再改改」,多半是白费工夫,还浪费你的额度和耐心。
第二,跑长任务别一把梭。一口气甩给它一串十几步的活儿,等它全跑完你再看结果,那时候错误早传染开了,根本理不清是哪步开始坏的。不如拆成几段,多设几个检查点,每跑一段你确认一下对不对,再让它往下走。这样就算错,也错在你眼皮底下,截得早。
第三,越是重要的多步任务,越要逐步确认,而不是图省事让它一条龙跑到底。AI 的「自信」是均匀的,它对的时候和错的时候,语气一样笃定,所以你别想着靠它自己的口气判断它有没有走偏,这事还得你自己来卡节点呢。
说白了,用 AI 干多步骤的活儿,核心心法就一句:错误不会自愈,只会滚雪球,所以要早截断。发现第一步不对,立刻停,回根因。
当然这事我也没法说得太满。这篇论文测的是 ALFWorld、GAIA、WebShop 这几个特定环境里的任务,样本就200条,规律在这些场景下成立,换到别的活儿上未必每条都严丝合缝(这点我心里也没底)。但「错误会传染、要回根因截断」这个大方向,我自己用下来是越来越认同的。
你平时让 AI 跑多步任务,一般是栽在哪一步上的?是它记岔了,还是把没干完的当干完了?评论里聊聊,我挺好奇大家踩的是不是同一个坑。
#马力的AI知识分享#
发布于 北京
