为何您的 AI 智能体并非存在推理问题,而是记忆问题:面向生产级智能体状态的实用指南
文章指出,当前 AI 代理的失败并非源于推理能力的局限,而是缺乏有效的记忆机制。基准测试往往评估无状态推理,而现实世界中的代理则需跨越多个回合及多种信息源运作。单纯在提示词中增加上下文既因 token 限制而成本高昂,又因注意力稀释而效果不佳。真正的代理状态由四层构成:用于当前会话的工作记忆、用于通用知识的语义记忆、用于技能的过程记忆,以及用于溯源的来源记忆。生产级架构包含四层记忆:用于即时交互的快速上下文缓冲区、用于快速检索语义和过程信息的检索索引、用于长期存储并具备生命周期管理的持久化层,以及用于清除陈旧数据的遗忘机制。代理记忆循环始于用户输入,随后查询检索索引以获取相关记忆。接着,通过组合工作记忆、检索到的记忆及其他相关信息来构建上下文。调用大语言模型(LLM)并传入该组合上下文,进而执行动作。最后,更新记忆并生成对用户响应。成功的关键在于对上下文的结构化组装,优先处理系统提示、当前目标及检索到的事实。滚动摘要用于压缩历史对话数据以管理上下文窗口大小。在记忆更新过程中,提取新事实并持久化存储,同时通过压缩和过期机制管理陈旧记忆。文章强调,稳健的记忆系统对于构建能够应对真实用户与会话的可靠 AI 代理至关重要。