今天,Agent 已经不只是在对话框里给出一个答案。它们可以在代码库、浏览器和各类工具之间持续工作,把原本零散的操作串成一段更完整的任务流程。
但任务一旦跨了好几天、好几个工具,真正棘手的事就出现了:同样的问题再来一次,它能不能少走弯路?
很多系统已经有长期记忆,能存下聊天记录、工具调用、任务总结和复盘。可“存下”不等于“学会”。比如,Agent 可能记得自己装过一个插件,下次却还是重新翻目录、再试一遍。它也可能留下很多代码修改记录,却不知道哪些做法真的有效,又分别适用于什么条件。
问题不一定是记录不够多,而是这些记录还没有变成一套能在合适场景里拿出来用、并且能自己说明为什么可用的办法。任务越长,这个缺口越明显——反复试错会消耗时间,也让结果变得不稳定。
这正是记忆张量MemTensor 团队联合中国科学技术大学、香港理工大学、福州大学和西安交通大学的研究人员提出 **MSCE(Memory-Skill Co-Evolution)**的切入点。它不只把长期记忆当作可检索的历史文本,而是希望让系统从一次次交互里挑出可信的经验,再把它们整理成可复用的策略和技能。
换句话说,MSCE 要解决的不是“怎样多记一点”,而是“记住以后,怎样真的学会”。
论文题目:
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
论文链接:
https://arxiv.org/pdf/2607.16621
github链接:
https://github.com/MemTensor/MemOS
01
一段经历,
什么时候才值得留下
如果把聊天记录、工具返回和操作轨迹都塞进长期记忆,Agent 的确“记得更多”了。但它下一次做事时,还是得把这些材料重新读一遍、重新判断一遍。
这很像把一整本工作日志交给新人:东西不少,却没有告诉他,哪一页才是真正能照着做的经验。
更难的是分辨。
一条任务成功了,可能是方法对了,也可能只是碰巧遇到了合适的环境。
一条失败记录里,也可能藏着一个本来正确、只是没走完的步骤。
要是把原始轨迹直接固化成技能,试错、偶然性和只适合当时环境的细节,也会一起被带到下一次任务里。
所以 MSCE 不把“多存一点”当作答案。它先问三个更具体的问题:哪些经验值得留,哪些做法可以抽出来复用,以及一条策略满足什么条件,才够资格变成技能。
02
论文把记忆分成了三层
MSCE 的做法,是先别把所有信息混在一个记忆池里。研究团队把它们拆成 L1、L2 和 L3 三层,每一层只回答一个问题。
- L1 先记事实:刚才到底发生了什么?
它保留任务当时的状态、Agent 做了什么、环境给了什么反馈、这一步的局部反思,以及经过反馈校准后的轨迹价值。L1 不会急着下结论,它更像一份能回头查的原始记录。
- L2 再整理做法:遇到这类问题,通常该怎么处理?
当不同 episode 里反复出现相似、而且结果为正的轨迹时,MSCE 会把它们归纳为一条结构化策略。里面不只写操作步骤,还要写清触发条件、验证条件、不适用的边界,以及这条策略来自哪些轨迹和 episode。
例如,智能体在多个软件环境中反复发现“基础镜像缺少系统依赖,仅安装 Python 包无法解决问题”,这就不再只是一条操作经验,而可以上升为对环境依赖关系的认知。
- L3 则往前走一步,试着回答:这个环境有什么规律?
如果多条 L2 策略总在同一个领域出现,系统会继续整理这里的实体、结构、工具依赖和任务约束,并把相关策略留在一起。
例如,智能体在多个软件环境中反复发现“基础镜像缺少系统依赖,仅安装 Python 包无法解决问题”,这就不再只是一条操作经验,而可以上升为对环境依赖关系的认知。
可以这样理解L1 记下发生过什么 → L2 整理下次怎么做 → L3 归纳环境里的规律。把这三件事分开,后面的技能才有证据可查。
03
任务做完后,
怎样看待中间的每一步?
长任务常常只有一个最终结果:完成,或者没完成。
可一个任务做成了,不代表前面的每一步都对,做砸了,也不代表每一步都没有价值。只拿最后的成败给整条轨迹打分,很容易把真正有用的操作和无效试错混在一起。
MSCE 设计了一套**“反思加权的价值回填”**办法。
任务结束时,最终反馈先确定终点的价值,再往前看,系统会把每一步的局部反思和后续步骤的价值结合起来。某一步的反思越可靠,它越能继承最终反馈;判断不清时,就更多参考后面发生了什么。
对于文本反馈,MSCE 还会看目标完成度、执行过程质量和用户满意度,合成一个统一的终局信号。
这样,一条轨迹里的步骤不必再拿同样的分数:真正推动任务往前走的操作会被保留,反复无效的探索会被压低。
04
从一次经验,
到一项真正能用的技能
在 MSCE 里,完成一次任务不等于自动多出一项技能。
研究团队把技能看成从稳定 L2 策略里筛出来的可调用对象。一条策略得有明确证据支撑、带来过正向收益、适用范围足够稳定,还要通过验证,才会被提升为技能。
这也意味着,技能不能只写“该做什么”,还得写“什么时候别做”。系统会检查里面的工具、步骤和结论有没有证据,验证条件是否完整,以及它有没有偷偷加入证据里从没出现过的工具或能力。
最后形成的技能会带着触发器、执行过程、验证规则、适用边界、证据锚点、决策指导和可靠度。它也不是生成后就不再变化:候选、试用、激活、修正、归档,都是它可能经历的状态。连续成功的技能会被强化;反复失败或得到负面反馈的,适用范围会收缩,甚至不再默认被检索。
05
两组评测,结果怎么样?
研究团队把 MSCE 放到两类测试里看。
EvoAgentBench 覆盖信息检索、数学推理、软件工程、代码实现和知识工作五类 Agent 任务;LoCoMo 则专门考察长对话记忆。先看前一组。
和各领域最强的非 MSCE 基线相比,MSCE 在信息检索、数学推理、软件工程和知识工作上的 Pass@1 分别提高 4.61、4.00、15.39 和 5.17 个百分点。代码实现任务里,它以 61.54% 的 Pass@1 并列最佳,平均交互轮数从 3.9 降到 2.0。
再看 LoCoMo。MSCE 的总体评审得分是 61.23,总体 F1 是 49.89,比最强基线 SkillFlow-Evolve 分别高 2.01 和 1.18 分。
结果显示:除软件工程外,它在多数任务里同时改善了效果和效率;软件工程的成功率涨得明显,成本则小幅上升。
06
离开原任务,这套方法还管用吗?
一条技能如果只能在第一次学到它的任务里生效,价值有限。
研究团队又测了六组跨领域迁移:信息检索到数学推理、数学推理到代码实现、代码实现到软件工程,以及知识工作到信息检索等。
六组迁移都带来了正向的 Pass@1 增益,幅度在 2.56 到 5.13 个百分点之间,平均是 3.93 个百分点;其中四组的任务成本还降了。
至少从这组实验看,MSCE 留下的不是某一道题的标准答案,而是能换个场景继续用的操作结构、验证方式和环境认识。
同时,还观察了一个更长的过程:从 p0 到 p100,记忆和技能不断积累以后,信息检索、数学推理和软件工程的 Pass@1 都持续上升。单位成功任务的归一化成本先因探索而上升,之后再慢慢回落。
07
记忆不该只是档案
做 Agent 记忆,常见的思路是两件事:多记一点,或者检索得准一点。
MSCE 追问的是第三件事:记起来之后,怎样把经验变成下次还能用、出了问题也能改的能力?
在这套框架里,轨迹不只是日志,而是证据;策略不只是一次总结,而是带着触发器、边界和验证条件的程序;环境认知不只是模型的自由联想,而是和策略、轨迹相连的结构化信息。
技能也不是临时写出的一句提示词,它有来处、有可靠度,也会经历试用、修正和归档。
所以,这篇论文真正想处理的,不是给 Agent 多加一点存储空间,而是让它对自己做过的事有更好的记性,也有更谨慎的判断:什么该相信,什么能复用,什么还需要继续改。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~