生成式AI之父:自进化Agent系统全面复盘
今天分享LSTM 之父和生成式 AI 之父Jürgen Schmidhuber署名的最新论文:「自我进化Agent」全景综述。
自我改进(Self-Improvement)从哲学畅想变成了工程热点——Reflexion、Voyager、Darwin Gödel Machine、GEPA、SkillOpt……新工作几乎每周都在冒,但术语极度碎片化:self-correction、meta-prompting、self-play,说的其实是同一族机制。没想到,DeepSeek-V4和Kimi-K2论文里,还藏着一家国产模型公司
Figure 1:自我改进范式总览——基座模型改进(θ)与脚手架改进(Σ)两条主路径
这篇97页综述的价值在于:它用一个统一的形式化框架,把2023–2026年200多个工作收纳进同一张地图,还把概念根脉一路追溯到1790年代的最小二乘法。
Figure 4:自1790年代末至今的理论根源与理想模型时间线
核心定义:Agent = (θ, Σ),一个公式定江山
综述的第一块基石是给出现代agent的系统级抽象。在时刻 t:
A_t = (θ_t, Σ_t),其中 Σ_t = (p_t, m_t, T_t, g_t)
Figure 5:形式化框架下的FM-based Agent结构示意图
- θ:基座模型的神经参数(认知核心);
- Σ:操作脚手架(operational scaffold)——即最近业界热议的harness,论文特意说明用 scaffold 强调"可修改的结构";
- p:prompt/系统指令
- m:记忆机制及其检索更新策略
- T:工具集与调用接口
- g:控制逻辑(路由、调度、安全约束)
Figure 2:2023–2026代表性工作时间线,左道θ右道Σ,终点指向AGI路标
还有一个对工程界极有价值的定义——Skill = 自诱导更新算子 U 的可复用序列化实例。Skill的本体是"那次更新"本身,存在哪个基板只是存储位置。并且区分 object-level skill与 meta-level skill——后者才是自我改进的核心。
DeepSeek和Kimi之后,又一家中国企业出手了
分类框架:两条进化路径,一个信号视角
在 A=(θ,Σ) 之上,综述提出统一分类法,先按"改什么"分两条主路径,再按"信号从哪来"细分:
Table 1:与相关综述的组织维度对比
| 路径 | 更新对象 | 特点 | 类比 |
|---|---|---|---|
| 基座模型改进 | θ(参数空间) | 慢、贵、稳定全局、难回滚、可跨任务摊销 | System 1,长期巩固 |
| 脚手架改进 | Σ(执行空间) | 快、便宜、可逆、任务特定、无灾难性遗忘 | System 2,快速试错 |
与已有综述(Gao et al. 2026、Fang et al. 2025、Tao et al. 2024)相比,本篇的独特性在于:信号视角(signal lens)+ 更新基板(update substrate)双轴正交,并且把FM微调和agent脚手架放进同一个形式化里,而不是当作两个孤立话题。
Figure 3:覆盖FM更新、脚手架更新与评估基准的统一分类树
路径一:基座模型改进(θ)——让模型自己给自己产数据
按学习信号的形态,θ 改进分三类:
Figure 6:基座模型改进的三条参数更新回路
5.1 内在生成示范(S ≈ D):模型即数据工厂
模型从自身权重里"挤出"训练数据:指令-回答对、推理轨迹、执行日志。代表工作:Self-Instruct(种子扩增)、Evol-Instruct(复杂度进化)、LMSI(自洽性过滤)、Ladder(递归分解出课程)、TT-SI(测试时检测不确定性 → 针对盲区现场生成数据 → LoRA即时微调,极样本高效)。
⚠️ 核心风险:模型坍缩与知识气泡——反复吃自己产的数据会放大偏见、窄化解空间。缓解手段:保留真实数据打底、外部验证器/定理证明器把关、多样性感知的数据池扩展、人工审计。
5.2 内在评估反馈(S ≈ e):模型当自己的裁判
不再产"例子",而是产"判断",分三族:
- Rubric反馈:按显式准则打分排序——Constitutional AI、Meta-Rewarding(连裁判的判断本身都再评一遍)、Self-Evolved Reward Learning;
- 一致性反馈:多次采样取共识/熵/自我确信度——TTRL(测试时多数投票当奖励)、INTUITOR(self-certainty当内在奖励);
- 纠正性反馈:产出批评+修订稿——SELF、RISE、Reflect-Retry-Reward。
⚠️ 致命软肋:评估器与策略同源耦合,会奖励"表面合规"而非真实改进;一致性只是正确性的代理,模型系统性犯错时重复采样只会放大同一个错误。
5.3 外在探索经验(S ≈ τ):环境说了算
信号接地于行动后果,分两种环境:
- 真实任务环境:程序化验证器(单元测试,如Agent-RLVR)、学习型奖励模型(WebRL、UI-Genie)、自生成任务(Absolute Zero:自己出题自己答,执行验证定生死);
- 模拟代理环境(World Model):先学环境动力学再"脑内演练"——WebEvolver(协同进化的网页世界模型)、WMPO(像素级世界模型上做想象rollout)。
⚠️ FM时代特有的坑:语言版reward hacking(钻LLM裁判的措辞漏洞)、能力退化(窄奖励RL侵蚀预训练通用能力)、幻觉动力学(生成式模拟器编出貌似合理的错误转移,策略学会利用幻觉)。
路径二:脚手架改进(Σ)——不动权重,照样进化
这是对工程师最实用的部分,按组件拆成四层,干预深度递增。
6.1 Prompt:信号越来越"有营养"的四代范式
Figure 7:Prompt精炼作为自我改进循环及其四范式
- 标量反馈优化:只有分数没有方向,靠搜索——APE、OPRO、RLPrompt、InstructZero;
- 定性反馈精炼:文本批评驱动定向修改——Self-Refine、Reflexion、ACE(Generator–Reflector–Curator模块化上下文工程);
- 种群进化:prompt当基因做选择/交叉/变异——EvoPrompt、Promptbreeder(连"变异指令"也一起进化,自指!)、GEPA(反思引导进化,号称可超过RL);
- 文本梯度:把批评形式化为"方向性更新向量"——APO、TextGrad(文本版自动微分)、MetaTextGrad(优化"优化器自己的prompt")、SkillOpt。
一条清晰主线:信号从标量 → 批评 → 种群适应度 → 结构化方向指导,优化越来越不依赖启发式、越来越自动化。
Table 2:四种prompt优化范式的信号/目标/代表系统/优劣对比
6.2 Memory:从静态缓存到自治引擎
三个维度拆解:
- 记忆对象:显式(加工后的轨迹/精选原文/整合外部知识——可解释、可审计)vs 隐式(latent embedding/KV增强——紧凑快速但难调试);
- 记忆结构:扁平(便宜但有近因偏差)→ 层级(压缩长历史但结构脆弱)→ 图(关联检索支持多跳归因,维护复杂)→ 向量检索(语义召回默认项,但"相似≠有用");
- 记忆处理:信号驱动的CRUD(Create选择性蒸馏写入 / Read混合启发式+门控检索 / Update定期复习衰减+迭代蒸馏 / Delete多级剪枝+分层驱逐),外加 Select(写谁读谁)与 Maintain(保鲜与遗忘)两维治理。
代表系统:Mem0、A-MEM、Zep(时序知识图谱)、G-Memory(层级图混合)、MemoryOS(OS式分层驱逐)。
6.3 Tool:从"会用工具"到"工具治理元认知"
- 动态路由:检索与图路由(ToolNet、OrchDAG把工具依赖建成有向图)、策略学习路由(Tool-Star、AGENTFLOW、ToolGen把检索-选择-调用坍缩成单一生成过程)、主动交互式路由(MCP-Zero主动发现工具、Tool-Planner局部API级修复);
- 迭代精炼:生成-执行-修订闭环——Voyager奠基,STELLA加专职critic,SkillWeaver蒸馏可复用web工具,DRAFT专改工具文档(很多失败源于指令与工具语义的错位,而非代码bug);
- 自主创造:TOOLMAKER打通"从论文抽逻辑→装依赖→闭环调试→产出可调用接口"全生命周期;Alita/Code2MCP用MCP协议把代码库标准化为服务,防止工具爆炸冲垮路由策略。
6.4 Full Scaffolding:把整个代码库当作可修改基板
最深的干预层级:agent把自己的全部操作逻辑和源码当作可改写对象,形式化为Σ_{t+1} = I_{Σ_t}(Σ_t; S_t)——注意改进器 I 下标就是 Σ_t 自己,改进器与它改进的系统共同进化。实践中落地为"生成补丁 → 验证器门控(单测/回归/安全检查)→ 通过才提交"。
Figure 10:跨迭代的脚手架自我改进示意
代表系统:Darwin Gödel Machine(维护agent档案库、开放式长出后代树)、Huxley-Gödel Machine(用clade级元生产力CMP近似哥德尔机理想)、GödelAgent(monkey patching自修改)、Live-SWE-agent(首个运行时在线自我进化的SWE agent)、AlphaEvolve/ShinkaEvolve(程序进化)、STOP(Self-Taught Optimizer,递归调用自身改进)、Agent Symbolic Learning(把agent当"符号网络",用自然语言损失/梯度做符号化反向传播)。
Figure 11:自我改进agent的代表性应用领域
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~