当 Agent 的 SOP 也能被训练:skill.md 的自进化方法

📅 2026/7/24 7:33:46 👁️ 阅读次数 📝 编程学习
当 Agent 的 SOP 也能被训练:skill.md 的自进化方法

最近看到一篇很有意思的论文,讨论的是如何把 skills 作为对象去训练,以实现自进化的效果。论文把 skill.md 当成 frozen agent 的外部状态,靠 rollout、反思、文本编辑、验证集 gate 来持续优化。个人感觉整个过程有点像 Gradient Descent,只不过是在文本空间里做的,最后的产出是一份优化好的best_skill.md,思路很有趣。

01

从人工文档到可训练对象

过去做 Agent,大家手里多多少少都攒着一堆说明文档:CLAUDE.md、AGENTS.md、skill.md、system prompt、tool usage guide、各种 domain SOP,基本都靠人工经验写。写得好 Agent 就稳健一点,写得差就会在同一个地方反复犯错,然后继续手工调整打补丁。

SkillOpt 的关键变化在于,它把这类文档从"人工经验产物"变成了可以训练的对象。skill.md 在 Agent 系统里成为一个可优化、可验证、可迁移的工程 artifact。

论文里的 skill 是一份自然语言策略文档。在 direct chat 场景下它会插进 system 或 developer instruction;在 Codex、Claude Code 这类 harness 里更像一份持久的 procedural memory。SkillOpt 关心的说白了就是"Agent 应该怎么干活"。

这篇论文很容易被误读成"又一个 prompt optimization 方法",但我觉得重点不在这儿。

Prompt optimization 优化的是一段 prompt,SkillOpt 优化的是一份更稳定的 procedural artifact。这份 artifact 里沉淀的是 Agent 的执行经验,比如做表格任务时先检查 workbook 结构和公式,做文档问答时先定位视觉表格的行列字段,这些规则是人类专家反复踩坑后总结出来的 SOP。所以 SkillOpt 优化的是 Agent 的外部 policy layer。

论文也强调,SkillOpt 部署出来的就是一份紧凑的best_skill.md,大约 300 到 2000 tokens,目标模型和 harness 都保持不变。

02

SkillOpt 是怎么工作的

可以先看一个简化流程。

当前 skill 文档

冻结目标模型执行任务

产生 rollout 轨迹

记录成功、失败、工具调用、最终答案和评分

Optimizer Model 分析轨迹

提出 add / delete / replace 文本编辑

根据 edit budget 限制修改幅度

生成候选 skill

验证集分数是否提升

接受修改,更新 best_skill.md

拒绝修改,写入 rejected-edit buffer

整个过程有点像训练模型,但训练对象是文本。论文把它叫text-space optimizer for agent skills。目标模型冻结不动,另一个 optimizer model 看带分数的执行轨迹,提出受控的 skill 编辑。只有候选 skill 在 held-out validation set 上严格提升,修改才会被接受。

里面有几个设计值得拆开看。

修改是 bounded 的。Optimizer 不能随便重写整份 skill,只能通过 add、delete、replace 这类结构化编辑来改。

有一个 textual learning rate,论文叫 edit budget,控制每一步最多接受多少条编辑。这个挺重要——一次改太多,skill 很容易被改坏,把已经有效的规则覆盖掉。

每次修改都要在验证集上跑,分数没提升就拒绝。

被拒的修改也不会直接扔掉,会进入 rejected-edit buffer 当负反馈,提醒 optimizer 哪些修改"看起来合理但实际会伤"。

最后还有一个 epoch-wise 的 slow / meta update,负责总结跨 epoch 的长期规律,比如哪些编辑确实有用、哪些失败一直存在、哪些能力已经稳定了。这个 meta 信息只在训练阶段用,不会跟着最终 skill 一起部署。整个过程停下来是不是很像 Gradient Descent?

03

实验效果与迁移能力

论文在 6 个 benchmark、7 个 target model、3 种 harness 上做了实验。Benchmark 包括 SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld;执行方式包括 direct chat、Codex harness 和 Claude Code harness。

作者论文中提到,在论文设定的对齐评测协议下,SkillOpt 相比 no-skill、human-skill、one-shot LLM skill、Trace2Skill、TextGrad、GEPA、EvoSkill 等 baseline,取得 best 或 tied-best。

总体而言,GPT-5.5 direct chat 提升 23.5 个点,Codex agentic loop 提升 24.8 个点,Claude Code 提升 19.1 个点。

单项任务上,程序性越强的任务提升越明显。GPT-5.5 direct chat 下:

数据来自论文表格。SpreadsheetBench 和 OfficeQA 提升非常大,这其实跟实际经验也对得上:越是需要工具操作、状态管理、格式约束和多步验证的任务,越依赖稳定的 procedural skill。

不过我觉得 SkillOpt 最有应用价值的地方,是它训出来的 skill 可以迁移。论文里做了三类迁移实验:

  • 跨模型迁移。在 GPT-5.4 上训出的 SpreadsheetBench skill 迁到更小的 GPT 变体上,仍然有收益。
  • 跨 harness 迁移。在 Codex loop 中训出的 spreadsheet skill 迁到 Claude Code 后,带来 59.7 个点的提升。
  • 跨 benchmark 迁移。从 OlympiadBench 学到的数学 skill 迁到 Omni-MATH 上仍有正收益。

这至少支持了论文的判断:SkillOpt 学到的不只是单题答案,而是一部分可复用的 procedural knowledge。这点对工程落地很重要,因为企业内部经常有大量相似任务——不同部门的报表处理、不同格式的合同审阅、不同产品线的知识库问答。skill 能迁移就有机会先在一个相对标准化的环境里训出稳定 SOP,再迁到相近场景做小规模验证和调整。

04

限制

最直接的限制之一,是它依赖可评分环境。SkillOpt 需要 validation gate,也就是你得知道候选 skill 是不是真的变好了。在 SearchQA、SpreadsheetBench、OfficeQA 这类任务里,可以用 exact match、hard score 或 benchmark-specific scorer——论文也明确说实验用的是各 benchmark 的 native hard score 或 exact-match accuracy。

但开放任务里事情会复杂很多。写一篇文章、做一次市场研究、生成一个产品方案,"更好"是什么?这种场景不是不能做 SkillOpt,但 validation gate 会成为真正的难点,可能需要拼人工反馈、偏好模型、rubric、pairwise comparison,甚至多层 verifier。

训练成本也不低。部署时只要一份best_skill.md,但训练阶段要大量 rollout,optimizer model 也要反复分析轨迹和提出修改。论文也报告了不同任务的训练 token 开销差异。

它目前主要优化单个 domain skill。如果未来 Agent 面对的是开放世界任务,可能需要 skill library、skill routing、multi-skill composition。

05

工程影响与展望

下面更多是我基于论文结果做的工程化思考和推断。

很多 Agent 失败,并不是因为模型完全不知道答案,而是执行流程不稳定:会忘记检查工具结果,会在多步任务里重复访问已处理过的状态,会输出看起来合理但没经过验证的答案。这类问题很难靠换更大的模型解决,因为问题不在知识层,而在执行层。

企业 SOP 有了新的迭代路径。以前 SOP 是给员工看的操作手册,以后可能要兼顾 Agent——甚至先给 Agent 训好,再让人去 review。而且这不是一次性的,可以跟着真实任务的反馈持续迭代,不再依赖工程师手工打补丁。

skill 会成为可审计的团队资产。模型权重很难审计,但best_skill.md是一份文本——可以 review,可以版本管理,可以回滚,也可以在团队之间共享。过去那些沉在个别工程师脑子里的调试经验,有机会变成可传递的工程产物。

模型升级时的执行能力保留。底层模型升级是常态,每次换模型,之前积累的调优经验往往要重新验证一遍。如果执行经验沉淀在 skill 文档里,换模型时至少有一个明确起点,而不是从零摸索。迁移实验也已经表明这条路是走得通的。

受监管场景的合规价值。在金融、医疗、法律等受监管场景里,这种文本化 skill 至少提供了一个更容易审计和版本追溯的入口。但它不能替代完整的合规验证,仍需要任务级评测、人工审核和运行日志留痕。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费