模型预测
26-05-14 18:59 微博认证:财经知识分享官 微博原创视频博主

Hermes 智能体的三层记忆结构。
AI 智能体在会话结束后会忘记所有内容,但 Hermes 不会。它拥有三层记忆,每一层的速度都不同。
第一部分:MEMORY.md(2200 个字符)和 USER.md(1375 个字符)文件会在会话开始时作为冻结快照注入到系统提示符中。
MEMORY.md 包含项目约定、工具特性和经验教训。
USER.md 包含您的个人资料:姓名、沟通风格和技能水平。
这些文件特意做得非常小。
当 MEMORY.md 的容量达到约 80% 时,代理会进行整合:合并相关条目,删除冗余,仅保留最核心的信息。
这是对内存施加的自然选择压力。
文件大小保持不变,但其内容会随着时间的推移变得更加清晰。

第二部分:FUL-TEVT 存储系统(SULIT + FTS5)每次对话都会存储在带有 FTS5 索引的 SQLite 数据库中。
代理可以按需搜索过去数周的会话。当代理调用 session_search 时:FTS5 可在约 10 毫秒内对超过 10,000 个文档进行匹配排名,LLM 会总结最佳匹配结果,并将简洁的结果返回到上下文中。
第一层始终存在,但容量很小。
第二层容量无限,但需要主动搜索。关键信息存储在内存中,其他所有内容均可搜索。
第三层:扩展内存提供程序,包含 8 个可插拔的提供程序,它们与第一层和第二层并行运行,永远不会取代它们。
三个值得了解的层级:Honcho(辩证用户建模,12 个身份层级)、Holographic(本地优先,HRR 向量,无外部调用)和 Supermemory(上下文隔离,防止同一事实被无限次地恢复)。
启用后,Hermes 会在每个回合自动同步:回合开始前预取,回合结束后同步,并在会话结束时提取。这是大多数人容易忽略的部分。
每个回合,层级都会通过一个五步循环进行组合:
1. 回合开始。第一层已处于提示状态,第三层进行预取和前缀添加。
2. 代理使用所有三层作为上下文进行响应。
3. 周期性触发提示(约每 300 秒一次)。代理会思考:“是否发生了任何值得持久化的信息?” 如果有,则写入;如果没有,则静默返回。
4. 内存写入磁盘上的 MEMORY.md 文件。由于前缀缓存保持有效,因此在本会话中不可见。
5. 会话关闭。第二层记录会话记录,第三层提取语义信息。下一个会话以新状态打开。
如今,代理的内存要么始终处于开启状态但存储较浅(将所有内容都塞入提示中),要么存储较深但被动(向量存储,但永远不会在正确的时间触发)。

Hermes 兼顾两者:用于存储关键事实的小型常驻文件、用于深度回忆的全文搜索、用于语义建模的外部提供程序,所有这些都由一个提示协调,该提示自主决定哪些信息值得保存。代理不仅存储记忆,还会在压力下对其进行管理。

发布于 广东