怎样让AI科学加班, 产生更好的结果?
为什么现在大家都在讨论长程任务? 难道让 AI 不断"加班", 就一定能得到更好的结果吗?
Nope!
我平时会拆解很多 AI 评测框架, 给大家不断丰富测试内容, 让大家更全面地理解现在 AI 的真实能力. 今天我刚测过的这个框架就很适合回答这个问题: 怎样让 AI 科学加班?
这个框架是字节跳动 Seed 刚发布的 EdgeBench。需要把 AI Agent 放进真实可运行的环境里, 给它时间、工具和反馈, 看它能不能在长达十几小时的迭代中不断改进.
我这次只测了其中一道题, 用的是我本地跑的 35B-A3B模型(4bit量化版本).
测试内容很有意思, 是大名鼎鼎的 DCSS, 全称 Dungeon Crawl Stone Soup. 如果你玩过 Roguelike 游戏, 却没听说过 DCSS、CDDA、ToME4 这三幻神, 兄弟那我只能说快去补课.
且慢, 不用搜, 我快速给大家补一下. 这类游戏都是随机地牢冒险: 你进入地牢后探索地图, 捡装备, 打怪, 尽可能走得更深. EdgeBench 里面用的是命令行版本的 DCSS, 地图、怪物、玩家都用字符表示, 长这样:
当然 DCSS 也有图形界面版本, 是这样的:
重点来了嗷: 这个测试不是直接让大模型去玩游戏, 而是让大模型通过 Agent (CodeX Cli) 写一个全自动玩游戏的机器人 Bot(Lua 脚本), 让 Bot 自动探索、自动战斗、自动下楼, 尽可能取得更高分.
我让这个模型跑了约 70 分钟. 一开始自动评测得分是 15.2, 后来最高跑到了 33.4.
在框架内能清楚的看到"学习"过程: 初始阶段 Bot 逻辑很粗糙: 血量低、身边没贴脸敌人, 就原地休息; 有敌人就自动攻击.
最高分那一版则补齐了很多游戏里必须处理的细节: 被菜单卡住怎么办, 出现确认提示怎么办, 被网住或混乱怎么办, 什么时候才算安全可以休息, 什么时候要继续推进.
其中一个关键变化是休息策略. 最初版本更像是"附近没有敌人贴脸就休息", 高分版本会扫描周围怪物, 判断环境是否安全, 再决定要不要休息.
看上去很简单, 但这个策略直接把测试集中的一个case从21分拉到了126分! 直接能能决定 Bot 是原地等死, 还是能活着跑到更深层了.
这个进化就是 EdgeBench 设计得有意思的地方. 他会记录 Agent 在长时间任务中的完整过程: Agent 有没有利用环境反馈? 有没有根据失败改策略? 有没有持续探索? 有没有把多轮尝试转化成表现提升? 以及, 它有没有把最高分策略保留下来?
EdgeBench 官方测试更狠, 连续跑了 12 小时以上, 部分 extended runs 甚至超过了 72 小时. 这些任务覆盖科学计算、软件工程、组合优化、知识工作、形式化数学和游戏模拟, 一共 134 个任务, 其中 51 个已经公开了 (我就是从HuggingFace dataset下载运行的).
官方论文我也看了一下, 有个爆点: 当他们把 134 个任务、约 38,000 小时的 Agent 交互数据放在一起看, Agent 在环境中的学习表现会随交互时间呈现稳定的 log-sigmoid 曲线.
啥意思? 简单来说单个任务的性能提升曲线可能很随机, 一会儿暴涨、一会儿回退; 但当任务足够多、时间足够长, Agent 从环境中学习的过程就不是一团乱麻了, 而是可以被记录、拟合、比较, 甚至呈现出类似 scaling law 的规律.
所以长程任务可不是"让 AI 多跑一会儿碰碰运气". 真正的重点是给 Agent 一个 Harness 闭环: 先尝试, 再观察反馈, 再吸收经验, 最后改进产物. 这个循环跑起来, 才是 Agent 进入真实工作流之后最关键的能力.
我这个单次运行是没办法观察到 scaling law 的, 因为我只跑了一个任务, 一个模型, 70 分钟.
但它刚好展示了为什么 EdgeBench 这种类型的评测很重要: 如果只看最终结果, 是看不到模型中间曾经找到过好策略的; 如果只看最高分, 又看不到它可能还会回退. 只有把过程记录下来, 我们才能真正判断一个 Agent 是在学习, 还是只是在随机试错.
所以回到最开头的问题: 怎样让 AI 科学加班?
答: 给AI真实环境, 可验证的反馈, 足够长的探索窗口, 以及能保留成功经验的机制.
EdgeBench 正好测的就是这件事: AI Agent 怎样才能现实世界的反馈里越做越好.
#HOW I AI##EdgeBench##ScalingLaw##AIAgent##AgentLoop##自我迭代#
最后, 相关资源给大家整理到这里, 框架甚至我觉得都能照抄了:
Github: github.com/ByteDance-Seed/EdgeBench
测试数据集: huggingface.co/datasets/ByteDance-Seed/EdgeBench
论文: edge-bench.org/paper.pdf
