26年7月来自人大、北大、清华、中山大学、港科大和新加坡国立的论文“Towards Long-Horizon Agents: A Survey, Foundation, Evolution, Harness, Optimization, Application, and Frontier”。
随着LLM能力的快速发展,人们对人工智能智体的期望正从解决简单的单回合任务转向在现实世界中执行长时程任务。这类系统称为长时程智体:它们能够进行长时程规划,与现实世界环境互动,从自身错误中恢复,并在执行过程中调整策略。这种能力正迅速成为实用智体智能的核心瓶颈。尽管取得了这些进展,但该领域仍然缺乏对长时程智体的统一定义和分类。诸如“自演化”或“自主”智体等相关概念经常被互换使用,但这些概念都未能清晰地阐明构建长时程智体的真正含义。这种认知上的缺失使得业界缺乏一种系统性的方法来评估长时程能力的进步。
本文通过将长时程智体视为外部驾驭(harness)和内部优化的协同演化,构建了一个统一的框架,并围绕六个相互关联的视角展开论述:基础、演化、驾驭(harness)、优化、应用和前沿。首先将长时程智体形式化为一种与工具耦合的决策过程,并将其与诸如长时间运行执行、自主性和自我演化等邻近概念区分开来。然后,追溯该领域从提示(prompt)级控制到运行时智体系统的演进历程,并从外部化驾驭和内部化优化这两个互补视角对现有工作进行分类。在此基础上,根据接口将长时程智体分为五种应用形式,并回顾相应的基准测试和资源。最后,讨论了关键挑战和前沿方向。
。。。继续。。。
优化,就是如何将这些能力逐步内化到模型参数中。按照训练流程组织本节内容。首先是架构基础,它首先决定了长时域训练和推理在计算上是否可行:无法表示和高效处理长轨迹的策略无法有效地进行长轨迹训练。然后,考察能力发展的六个阶段:数据和环境合成、预训练和中期训练、微调、强化学习、策略内蒸馏和自进化。图 11 概述整个流程,表 5 总结每个阶段的特征、机制和代表性工作。
架构基础及其六个训练阶段如下:
- 架构基础:使长轨迹的训练和解码更加高效。
- 数据和环境合成:构建可验证的长期经验,包括任务、环境和轨迹,供后续阶段用于训练和反馈。
- 训练前/中期:构建动作-观察和推理先验,使智能体的行为自然而然,而非被动接受。
- 微调:从精心设计的智能体轨迹中培养行为和工具使用规范。
- 强化学习:优化整个轨迹,并在稀疏、延迟奖励下解决长期信用分配问题。
- 策略内提炼:将策略巩固到自身的状态分布上,减少分布偏移并稳定先前学习的行为。
- 自我演化:将自我生成的经验、反馈和任务环境更新转化为持续的策略改进。
与监督式微调相比,智体强化学习(Agentic RL)进一步利用智体自身交互的反馈来优化策略。这使得LLM的优化目标从单轮响应扩展到长时程交互轨迹。如图12所示,其核心挑战涉及四个方面:采样信息丰富的多轮轨迹、从稀疏反馈中提取多粒度信用信号、将这些信号整合到稳定的策略更新中,以及组织训练交互模式,例如层级结构、工具使用、多智体协作和记忆。表6列出各部分的代表性工作。
自进化作为一种训练机制,用于内化智体自身产生的经验。前几个阶段主要依赖于预先准备好的数据、任务集、环境集合或轨迹。自进化增加一个反馈回路:当前策略会在其环境中产生新的尝试、失败和反馈,而训练过程会将选定的记录写回模型。这正是它与上述两个蒸馏阶段的区别所在:微调蒸馏和策略内蒸馏都使用在训练轮次中保持不变的监督源,而自我进化则将数据、任务甚至环境视为循环自身更新的对象。近年来,这已发展成为一个快速发展的研究领域,已有专门的论文详细阐述了智体如何自主地进化其模型、记忆、工具和工作流程,以实现终身适应 [147, 165]。如图 13 所示,这项工作分为三种形式:离线自进化、在线自进化和智体-环境协同进化。
长时程智体运行于各种各样的环境中,从代码库和网页文档到图形界面、多模态流以及开放式的研究工作流程。这些场景不仅在任务持续时间上有所不同,而且在智体观察、行动和接收来自外部世界的反馈的界面上也存在差异。这反过来又决定了执行过程中可用的信息、可以本地检测的错误以及智体必须添加哪些能力来弥补环境的不足。
图 14 将代表性应用分为五大类,各类应用的区别在于每个智体观察和行动的界面:
长时域智能体的五大代表性应用包括:
- 软件工程智体:在代码库和执行环境中进行操作,通常可以通过测试、编译器和运行时输出来检查编辑内容。
- 信息检索智体:与 Web 文档、搜索引擎和知识库交互,其挑战在于如何在没有直接执行预言机的情况下收集和综合证据。
- 计算机使用智体:通过屏幕截图、辅助功能树和底层操作来操作图形界面,推断和操纵部分可观察的界面状态。
- 多模态智体:对长时间的视觉、听觉和文本流进行推理,其中相关信息分布在不同的时间和模态中。
- 通用智体:将多个此类接口组合在一个工作流中,利用异构工具、权限和外部服务。
长时程智体的进展是通过共享的基准测试和开放资源基础来衡量和复现的。由于报告的分数反映了模型、框架和训练方案的共同贡献,因此长时程评估最好被理解为具有时程-觉察能力(对目标必须保持的时间长短敏感)和归因-觉察能力(能够区分框架引起的差异和模型引起的差异)[123, 286, 468]。用作基准测试的可验证的长时程环境也经常被重用作优化方法的训练环境,因此评估进展和内部化进展紧密相关。除了下表列出的域基准测试之外,越来越多的测试套件特意强调多小时的自主性。例如,从 MLE-bench [51] 中的机器学习工程到 PaperBench [560] 中对研究论文的端到端复现,这些都补充 METR [286, 429] 的前沿时间范围测量。
总而言之,这些资源表明,长时评估正围绕有状态、耗时数小时且经济效益显著的任务进行整合,并且报告的分数必须被解读为模型、框架和训练方案的共同属性,而不仅仅是模型本身的属性。
本文预期将定义未来几年研究方向的最具影响力的范式转变,以及每种转变所蕴含的未解难题。最重要的前沿领域存在于这一过渡空间:能力在框架和权重之间双向迁移。驾驭(harness)本身也从固定的脚手架转变为可学习、可移植的对象。在嘈杂、高成本的真实环境中,长时程行动力会打破两个支柱所依赖的理想化前提。核心诊断是,实际的长时程进展越来越取决于模型运行环境的属性,而不仅仅是模型本身。为了便于比较这些压力,将前沿领域归纳为四个更高层次的维度:演化、有效性、效率和可信度。表 8 概述此结构下的九个立场。对于每个具体的前沿领域,首先说明该领域所处的现状和阻碍因素(现状和挑战),然后说明对该领域未来发展方向的立场以及它所遗留的未解决问题(展望)。