MemSkill:LLM 智能体的 “可进化记忆” 框架
摘要:大多数大语言模型(LLM)智能体的记忆系统依赖于少量静态的、手工设计的操作来提取记忆。这些固定程序将人类关于"存储什么"和"如何修正记忆"的先验知识硬编码其中,使其在面对多样化的交互模式时显得僵化,且在处理长历史记录时效率低下。为此,我们提出了MemSkill,将这些操作重新定义为可学习、可演化的记忆技能——即用于从交互痕迹中提取、整合和剪枝信息的结构化、可复用例程。受智能体技能设计哲学的启发,MemSkill采用一个控制器来学习选择少量相关技能,并配合一个基于LLM的执行器来生成技能引导的记忆。除了学习技能选择外,MemSkill还引入了一个设计者模块,定期审查那些所选技能产生错误或不完备记忆的困难案例,并通过提出改进方案和新技能来演化技能集合。三者结合,MemSkill形成了一个闭环流程,同时优化技能选择策略和技能集合本身。
为什么要让记忆“活”起来?
想象一下,一个智能客服 Agent 正在处理一个长达一小时的客户投诉。它需要记住客户情绪的变化、问题的关键节点、尝试过的解决方案以及各种细节。传统的记忆系统通常依赖一套固定的、由人类工程师预先设计的操作(比如“记录关键信息”、“忽略寒暄”),就像给 Agent 配备了一套固定的工具箱。
这种方法的痛点很明显:
- 僵化死板:人类的先验知识很难覆盖所有场景。面对五花八门的对话风格和任务需求,这套“工具箱”很快就会捉襟见肘。
- 效率低下:随着交互历史越来越长,逐字逐句地处理和更新记忆变得异常低效,Agent 很容易在信息的海洋中迷失方向。
- 缺乏适应性:当任务领域或交互模式发生变化时,固定的记忆机制无法自我调整,性能就会大打折扣。
我们真正需要的是一个能够根据经验自我调整、不断学习如何“记笔记”的记忆系统。这正是 MemSkill 想要解决的问题。
MemSkill 是如何工作的?
MemSkill 的核心思想是,将传统的记忆操作(Memory Operations)提升为一套可学习、可组合、可演化的记忆技能(Memory Skills)。它不再是简单地告诉 Agent “该记什么”,而是让 Agent 学会“如何去记”。
这个过程可以类比为我们人类学习新技能。一开始我们可能只有一些基础动作(比如写作时的“主谓宾”结构),但通过不断练习和反思,我们会总结出更高级的技巧(如“总分总结构”、“运用比喻”),并学会在不同情境下灵活运用它们。
MemSkill 通过一个精巧的闭环系统来模拟这个过程,如下图所示:

传统方法与 MemSkill 对比
上图(a)展示了传统方法,它们在每个对话回合(turn-level)都交织着固定的操作和 LLM 调用,像一条串行的流水线。而 MemSkill(b)则完全不同,它会一次性处理一个对话片段(span-level),从一个动态的“技能库”中挑选出最合适的几个技能,然后指导 LLM 一次性生成高质量的记忆。
整个 MemSkill 框架由三个核心组件构成一个闭环,不断自我优化:

MemSkill 架构总览
- 控制器(Controller):负责“选技能”。它会分析当前的对话内容和已有的记忆,从技能库中挑选出最相关的 Top-K 个技能。这个过程是通过强化学习来训练的,任务最终完成得好不好,会反过来指导控制器做出更好的选择。
- 执行器(Executor):负责“用技能”。它是一个 LLM,接收控制器选出的技能和对话内容,然后像一个听从指令的助理,一次性生成或更新记忆。
- 设计师(Designer):负责“创造和优化技能”。这是 MemSkill 的点睛之笔。系统会定期收集那些让 Agent 犯错的“疑难杂症”(Hard Cases),然后设计师(也是一个 LLM)会分析这些失败案例,对现有的技能进行优化,甚至创造出全新的技能来解决问题。
通过这个“使用-评估-演化”的闭环,MemSkill 的记忆系统不仅学会了如何更好地使用现有技能,其技能库本身也在不断进化,变得越来越强大和适应特定任务。
核心贡献
简单总结一下,MemSkill 的主要贡献可以归纳为三点:
- • 提出“记忆技能”:将记忆操作抽象为可演化的技能,让 Agent 的记忆管理从固定的“工具”升级为动态的“能力”。
- • 设计闭环优化流程:巧妙地结合了用于技能选择的强化学习和用于技能演化的 LLM 指导,实现了记忆系统从“使用”到“创造”的自我进化。
- • 验证了有效性与泛化能力:在多个标准测试(包括对话、问答和具身交互)中取得了显著效果,证明了这套方法不仅性能好,而且还能跨任务、跨模型迁移。
深度拆解:MemSkill 的炼成之路
理解了 MemSkill 的核心思想后,我们来深入看看它的各个组件是如何协同工作的。整个过程就像一个不断学习和成长的团队。
1. 技能库(Skill Bank):记忆能力的军火库
技能库是 MemSkill 的核心资产,它存储了所有可供选择的记忆技能。每个技能都像一张详细的说明书,告诉执行器在特定情况下该做什么。
一个技能通常包含以下结构化信息:
- • 目的(Purpose):这个技能用来干什么?
- • 使用时机(When to use):什么情况下应该用它?
- • 应用方法(How to apply):具体怎么操作?
- • 约束(Constraints):有什么注意事项或限制?
系统启动时,技能库仅包含四个基础技能:INSERT(插入新信息)、UPDATE(更新旧信息)、DELETE(删除无用信息)和 SKIP(跳过)。随着训练的进行,设计师(Designer) 会不断往里添加更具体、更强大的新技能。
2. “使用-评估”循环:控制器与执行器的日常工作
对于每一段对话历史,MemSkill 会将其切分成多个片段(span),然后依次处理。
-
• 控制器如何选择技能?
控制器通过一个巧妙的嵌入式方法来保证对动态变化的技能库的适应性。它会将当前的对话片段和已有的相关记忆编码成一个“状态向量”,同时也将技能库里每个技能的描述编码成“技能向量”。然后,它通过计算状态向量与各个技能向量的相似度,来为每个技能打分,并选出得分最高的 K 个。这种方式让控制器可以处理任意数量的技能,而不需要在技能增加时改变自身结构。z执行器如何生成记忆? -
• 执行器如何生成记忆?
执行器是一个强大的 LLM。它接收三样东西:当前的对话片段、相关的旧记忆、以及控制器选出的 K 个技能。然后,它遵循这些技能的指导,一步到位地生成或修改记忆。这种“批量处理”的方式远比传统方法逐回合修改记忆要高效。这种技能条件下的生成(Skill-conditioned Generation)是 MemSkill 效率和效果的关键。它将多个操作组合在一起,形成了一个更连贯、更全面的记忆更新。
3. “演化”循环:设计师的创造性工作
如果说控制器和执行器是在“术”的层面提升效率,那么设计师(Designer)则是在“道”的层面推动进化。

MemSkill 架构总览
如上图右半部分所示,设计师的工作流程如下:
- 收集疑难杂症:在训练过程中,系统会把那些导致任务失败或效果很差的案例(Hard Cases)记录到一个“疑难杂症缓冲区”里。
- 分析失败根因:设计师会定期从缓冲区中挑选出最具代表性的失败案例进行聚类分析,找出导致失败的共性问题。例如,它可能会发现 Agent 总是记不住事件发生的时间顺序。
- 两阶段技能演化:
- • 优化旧技能:首先,设计师会尝试修改现有的技能,看能否解决问题。
- • 创造新技能:如果修改旧技能不足以解决问题,设计师就会创造一个全新的技能。比如,针对记不住时间顺序的问题,它可能创造一个名为
Capture Temporal Context(捕捉时间上下文)的新技能。
这张消融实验表清晰地展示了设计师的重要性。如果去掉设计师(w/o designer),模型的性能会大幅下降,这证明了技能演化是 MemSkill 成功的关键。同样,如果只允许设计师优化旧技能而不创造新技能(Refine-only),性能也无法达到最佳。

消融实验结果
4. 技能案例:从通用到专用
经过演化,技能库里会涌现出许多针对特定领域的专用技能。这体现了 MemSkill 强大的自适应能力。

在不同任务上演化出的技能案例
上图展示了在两个不同任务上学到的典型技能:
- • 在对话任务(LoCoMo)中,演化出的技能更关注“捕捉时间上下文”和“捕捉活动细节”。这很合理,因为在长对话中,理解事件的来龙去脉和人物的详细活动至关重要。
- • 在具身任务(ALFWorld)中,Agent 需要在虚拟环境中完成任务,演化出的技能则变成了“捕捉动作约束”和“追踪物体位置”。这同样非常直观,因为在虚拟世界里,知道“什么能做、什么不能做”以及“东西在哪”是完成任务的前提。
这些案例生动地说明,MemSkill 能够自动地从交互数据中提炼出对任务最有价值的记忆模式,并将它们固化为可复用的技能。
实验效果怎么样?
是骡子是马,拉出来遛遛。MemSkill 在多个基准测试中都表现出色。
主要结果
从下表中可以看到,无论是在对话型基准还是具身交互任务上,MemSkill(加粗行)在大部分关键指标上都显著优于其他所有基线方法,包括 MemoryOS、A-MEM 等强有力的竞争对手。这证明了其方法的普适性和有效性。

主要实验结果对比
特别值得一提的是,这些结果是在两种不同的基础大模型(LLaMA3.3 和 Qwen3-Next)上取得的。MemSkill 仅在 LLaMA 上进行了训练,然后直接将学到的技能库迁移到 Qwen 上,依然能取得最佳性能。这展示了其强大的跨模型泛化能力——学到的“如何记忆”的技能是通用的,不依赖于特定的 LLM。
迁移能力与分布外泛化
为了进一步测试其泛化能力,文章做了一个更有挑战性的实验:将在对话数据集(LoCoMo)上学到的技能,直接应用到文档问答数据集(HotpotQA)上。这两种任务的输入形式(对话 vs. 文档)和信息结构差异巨大。

在 HotpotQA 上的迁移表现
结果如上图所示,即便面对这种分布偏移(Distribution Shift),MemSkill 依然全面超越了为对话场景设计的 MemoryOS 和 A-MEM。尤其是在上下文更长(200 Docs)的设置下,MemSkill 的优势更加明显。
这张图还揭示了另一个有趣的现象:选择的技能数量 K 对性能有一定影响。通常来说,K 值越大(比如 K=7),性能越好,尤其是在处理更长、更复杂的上下文时。这表明,当信息变得嘈杂时,组合多个技能进行“会诊”能带来更好的记忆效果。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)