爱真趣酱早睡版
26-06-24 00:00

为什么Agent Loops正炙手可热(The Information)
如果你最近浏览过 X 或 Reddit 的 AI 板块,你可能会发现agent loops这个词出现的频率比以往更高。该术语指的是一种运行模型和 AI 智能体的新方法,旨在提高它们在长期运行或定义模糊的任务上的表现。近几个月来,这种方法越来越受到开发者的青睐。
其核心理念可以概括为:传统的做法是给 AI 模型一个提示词,等待它执行,然后根据执行效果给予反馈并提供新的提示词。而现在,人们可以让一个或多个 AI 智能体在“循环”中运行,尝试不同的方法来完成任务。它会让另一个智能体对其工作进行评分,直到实现目标或达到某种迫使其暂停的预设条件。
虽然与通过提示词进行人工指令操控相比,循环方法的成本更高,但它可以带来更好的结果。例如,Anthropic 的工程师在 4 月份的 AI 工程师大会上表示,他们曾让 Claude 开发一款可以制作复古风格电子游戏的应用程序,并分别测试了“极简提示词”和“智能体循环”两种方法:
• 极简提示词: 耗时 20 分钟,花费 9 美元。但生成的游戏根本无法运行,应用程序本身也非常简陋。
• 智能体循环: 耗时 6 小时,花费 200 美元。但构建的应用要好得多,拥有更多游戏设计师想要的功能,比如更改游戏调色板的能力或调试功能。
有趣的是,让智能体在循环中工作的想法已经存在了一段时间——至少从去年夏天开始,当时澳大利亚开发者杰弗里·亨特利(Geoffrey Huntley)在博客中介绍了他的方法,他称之为“拉尔夫·维格姆技术”(Ralph Wiggum technique)(这是向《辛普森一家》中的角色致敬,该角色以愚蠢但极其乐观和坚持不懈而闻名)。
开发者们告诉我,现在的循环比当时更有效。他们表示:
• 更有韧性: 总体而言,模型在处理长期运行的任务时,越来越不易放弃。
• 更聪明地处理边缘情况: 过去开发者必须在提示词中写得非常具体(例如详细说明遇到意外情况该怎么做),而现在的模型已经足够聪明,能够自己摸索出在这些边缘情况下应该怎么做。
工程师们也更擅长设置这些智能体循环。例如,在 Anthropic 的例子中,他们针对不同的任务使用了独立的智能体:一个“生成器”(generator)智能体用于创建应用,一个“评估器”(evaluator)智能体用于检查应用是否正常运行。
智能体和人类一样,不擅长检查自己的工作,因此让一个独立的智能体或模型(甚至可能由不同的 AI 供应商提供支持)来检查原始 AI 的工作至关重要。(我们之前已经报道过开发者是如何使用这种技巧的,比如让 OpenAI 的 Codex 检查 Claude Code 的工作,反之亦然。)
在 Anthropic 的例子中,生成器和评估器智能体还会就应该使用什么标准来判断任务是否完成进行辩论。智能体之间的这种拉锯战(即所谓的“对抗性”关系),类似于人类希望团队成员对自己的想法提出反对意见,而不是一味地当“应声虫”。

发布于 北京