做过 agent memory 的都知道一个尴尬事实:召回率刷到 95%+ 没啥用,agent 照样把过期信息当真。
新出的 STALE benchmark 把这事捅明白了:测的不是"能不能找到记忆",而是"知不知道这条记忆已经作废"。
🔍 它定义了一个挺刁的失败模式叫 Implicit Conflict——后来的观察隐式让旧记忆失效,但没有显式否定。
比如用户三个月前说"我在北京",上周提了句"搬来上海了挺累的"。问"周末推荐个附近的展",模型该用哪条?
📌 结果是前沿模型最高 55.2%,专门的 memory 框架也没好到哪去。共同症状是:
能从 query 里把旧 context 翻出来,但翻出来之后不会判断它还作不作数;
用户带着错误前提提问时,顺着前提就答了,不会反驳。
💡 这跟工程直觉对得上。业内卷 memory 这一年多,向量库、图谱、分层摘要折腾了一圈,几乎都堆在 read-side——检索更准、排序更好。
但 STALE 这篇指了个反方向:问题在 write-side。新观察进来的时候,得显式裁决它跟谁冲突、让谁过期、连带影响哪些下游状态。retrieval 再强,存进去的东西本身没人维护时效,下游就是在过期数据上做推理。
做 long-horizon agent 的可以拿这个 benchmark 跑一下自己的 memory pipeline,大概率会比想象中难看。 arXiv: 2605.06527
发布于 中国香港
