Agent记忆系统概述,短期记忆长期记忆工作记忆全解析 Agent记忆系统概述短期记忆长期记忆工作记忆全解析你有没有这样的体验。跟ChatGPT聊了一会儿它记住了前面说的内容能接着聊。但是关掉窗口重新打开它就全忘了一切从头来。这就是大模型的记忆问题。大模型本身是没有记忆的。每次调用都是独立的它不知道你上一句话说了什么。所谓的记住是因为应用层把之前的对话也一起传给了它。这种做法在简单场景够用。但到了Agent场景就不够了。Agent需要处理复杂任务可能要跨多轮对话可能要记住用户的偏好可能要回顾之前的决策。光靠把历史对话全塞进Prompt既浪费Token又效果不好。这一篇我们讲Agent的记忆系统。有哪些记忆类型各自解决什么问题怎么设计一个合理的记忆体系。为什么Agent需要记忆先说没有记忆的Agent会出什么问题。上下文丢失。用户说了什么偏好过几轮对话就忘了。用户告诉Agent我是Python开发者过了十轮对话Agent推荐了一堆Java教程。重复劳动。用户上一次让Agent查过的信息下一次又得重新查一遍。Agent不记得自己已经查过了也不记得查到了什么。无法学习。用户纠正过Agent的错误下次它还犯同样的错。不能从交互中学习永远是第一次见面。任务断裂。复杂任务跨多次对话执行时Agent不记得任务进行到哪一步了无法继续。记忆系统要解决的就是这些问题。让Agent能记住该记的忘掉该忘的越用越懂用户。三种记忆类型借鉴人类认知科学的模型Agent的记忆通常分三种类型。短期记忆。就是当前的对话上下文。用户说了什么Agent回了什么最近几轮的交互。短期记忆存在内存里对话结束就清空。相当于人的工作台当前正在处理的信息都在这里。长期记忆。跨对话持久保存的信息。用户的偏好、历史决策、重要事实。长期记忆存在数据库里下次对话还能调出来。相当于人的笔记本记下来以后可以翻看。工作记忆。介于短期和长期之间。当前任务执行过程中的中间状态、临时变量、推理链条。任务结束后可能被清理也可能被总结后存入长期记忆。相当于人的草稿纸临时写写画画。这三种记忆配合使用构成了Agent的完整记忆体系。短期记忆怎么实现短期记忆最简单的实现方式就是把对话历史传给大模型。LangChain里的ConversationBufferMemory就是干这个的。它把所有对话都存在一个列表里每次调用大模型的时候把整个列表塞进Prompt。fromlangchain_openaiimportChatOpenAIfromlangchain.memoryimportConversationBufferMemoryfromlangchain.chainsimportConversationChain llmChatOpenAI(modelgpt-3.5-turbo,temperature0)memoryConversationBufferMemory()conversationConversationChain(llmllm,memorymemory)conversation.invoke(我叫张三是Python开发者)conversation.invoke(我最近在学AI Agent开发)conversation.invoke(我叫什么名字)# Agent能回答你叫张三因为它记住了前面的对话问题在于对话越来越长Token消耗越来越大。聊了50轮Prompt可能就几千个Token了。既慢又贵。所以短期记忆需要管理。不能无限增长。常见的策略有几种。滑动窗口。只保留最近N轮对话。比如只保留最近10轮更早的丢弃。简单有效但会丢失早期的重要信息。摘要压缩。定期把旧对话总结成一段摘要。用摘要替代原始对话大幅减少Token。保留了关键信息但摘要质量依赖大模型。Token限制。设一个Token上限超过就截断。跟滑动窗口类似但按Token而不是轮数来算。长期记忆怎么实现长期记忆的核心是把重要信息持久化存储需要的时候检索出来。存储方式通常用向量数据库。把每条记忆做成一个文本块向量化后存进去。需要的时候用语义检索找出来。fromlangchain_openaiimportOpenAIEmbeddingsfromlangchain_community.vectorstoresimportChromaclassLongTermMemory:def__init__(self,db_path./agent_memory):self.embeddingsOpenAIEmbeddings()self.storeChroma(persist_directorydb_path,embedding_functionself.embeddings,)defremember(self,content,metadataNone):记住一条信息self.store.add_texts(texts[content],metadatas[metadataor{}],)self.store.persist()defrecall(self,query,k3):回忆相关信息resultsself.store.similarity_search(query,kk)returnresults# 使用memoryLongTermMemory()# 记住用户信息memory.remember(用户叫张三是Python开发者有5年经验,metadata{type:user_profile,time:2026-01-01},)# 记住用户偏好memory.remember(用户偏好简洁的代码风格不喜欢过多注释,metadata{type:preference,time:2026-01-01},)# 回忆resultsmemory.recall(用户的编程偏好是什么)# 返回包含用户偏好简洁的代码风格的记忆长期记忆的关键不是存储是筛选。什么信息该记什么信息该忘。把每句话都存进长期记忆信息会越来越多检索质量会下降。大量无关的记忆会淹没真正重要的信息。好的做法是让大模型来判断。对话结束后让大模型回顾这段对话提取出值得记住的信息存入长期记忆。工作记忆怎么实现工作记忆是任务执行过程中的临时记忆。Agent执行复杂任务的时候中间会产生很多临时信息。搜索到了什么结果推理到了哪一步当前的计划是什么。这些信息不需要长期保存但在任务执行期间需要随时访问。工作记忆通常用一个结构化的状态对象来管理。classWorkingMemory:def__init__(self):self.taskself.plan[]self.current_step0self.intermediate_results[]self.context{}defset_task(self,task):self.tasktaskdefadd_result(self,result):self.intermediate_results.append(result)defget_summary(self):return{task:self.task,plan:self.plan,current_step:self.current_step,results_count:len(self.intermediate_results),last_result:self.intermediate_results[-1]ifself.intermediate_resultselseNone,}# 使用wmWorkingMemory()wm.set_task(调研AI Agent开发框架写一份对比报告)wm.plan[搜索主流框架,对比功能,对比性能,写报告]wm.add_result(找到LangChain、LlamaIndex、AutoGen、CrewAI四个主流框架)# ... 任务执行中任务完成后工作记忆可以清理掉。或者把关键结论提取出来存入长期记忆。记忆系统的设计原则设计Agent的记忆系统有几个原则要注意。按需记忆。不是所有信息都值得记。只记对未来有用的信息。用户的名字、偏好、重要决策、纠正过的错误这些该记。闲聊、无关紧要的细节不用记。定期整理。长期记忆会越来越多需要定期整理。合并重复的更新过时的删除不再相关的。就像人定期整理笔记一样。分层检索。检索记忆的时候先查短期记忆不够再查长期记忆。不要每次都翻全部记忆太慢也容易引入噪音。隐私保护。用户的敏感信息要谨慎处理。不是什么都能存的。提供忘记的功能让用户可以删除特定的记忆。LangChain里的记忆组件LangChain提供了多种现成的记忆组件可以直接用。ConversationBufferMemory。最基础的存所有对话。ConversationBufferWindowMemory。滑动窗口只存最近N轮。ConversationSummaryMemory。自动摘要把旧对话总结成摘要。ConversationSummaryBufferMemory。混合策略近期对话保留原文旧对话变成摘要。ConversationKGMemory。知识图谱记忆从对话中提取实体和关系存成图谱结构。VectorStoreRetrieverMemory。向量数据库记忆把对话存到向量库需要的时候语义检索。选用哪个看你的场景。简单对话用BufferWindow就行。需要长期记忆用VectorStoreRetriever。需要结构化信息用KGMemory。后面几篇我们会逐一深入这些记忆组件的用法。下一篇我们详细讲对话记忆管理。对比几种主流的对话记忆策略看它们各自适合什么场景。