连买牛都搞不定,所以要让炒股真的不行吗?🥹
Cattle Trade,一个用买牛游戏测试 LLM 谈判纪律的多智能体基准
Cattle Trade 是一个多智能体经济博弈基准,用来评估 LLM 在 bluffing、bidding、bargaining 里的长期表现。它把 agent 放进 50-60 回合的交易场:竞价、隐藏报价、讨价还价、对手建模、资源分配都混在一起,比单轮谈判题更接近真实策略环境。
论文结果有刺:作者评估了 7 个低成本语言模型和 3 个确定性代码 agent,共 242 局游戏;两个启发式代码 agent 反而超过多数 LLM。LLM 常见问题不是语言能力,而是资源纪律差,比如过度出价、自己给自己竞价、发起破产式交易、对对手状态适应慢。
这类 benchmark 更像 agent 真考试:长期、不完全信息、多方竞争,模型必须在“想赢”和“不把自己玩破产”之间保持稳定。
🔗 链接:http://t.cn/AX6GtmiK
📄 论文:http://t.cn/AX6Gtmio
#HOW I AI# #ai生活指南# #AI工具#
发布于 广西
