导语:想让双足人形机器人学会一套流畅的霹雳舞动作,过去往往需要工程师针对这一技能进行数周甚至数月的控制器调试。来自波士顿动力与RAI研究所的研究团队在《Science Robotics》上发表了一项名为ZEST(Zero-shot Embodied Skill Transfer)的统一框架,试图改变这一局面:它可以让机器人从动作捕捉、手机视频甚至动画关键帧中直接学习运动技能,训练完成后零样本部署到真机,无需逐项微调。无论是Atlas的军队爬行和霹雳舞,还是G1的芭蕾和爬箱子,甚至四足Spot的后空翻,都源自同一套极简训练流程。本文将深入拆解ZEST的技术细节。
一、核心问题:人形机器人的“运动自由”为何如此难?
人形机器人的设计初衷很简单:人类环境是为人体形态构建的。因此,拥有类似形态的机器人理论上应该能复现人类能完成的日常动作。但这一目标的技术难度极高:高自由度、间歇性多接触交互、建模误差,都要求控制策略既能捕捉人类运动的丰富性,又能承受真实世界的物理不确定性。
过去十年间,两条主要技术路线各有短板。
路线一:基于模型的“离线规划+在线跟踪”。典型代表是波士顿动力的Atlas跑酷和舞蹈,通过MPC加全身控制器来追踪关键帧动画参考。这一路线在良好建模和状态估计条件下效果出众,但在高不确定性和复杂接触环境下难以部署,且对参考轨迹的物理一致性要求很高。
路线二:强化学习。从“白纸”开始训练策略,具备优秀的敏捷性和鲁棒性,但样本效率低、对奖励设计高度敏感,容易产生不自然或过于激进的动作。
数据驱动运动模仿则试图走中间路线——用运动数据作为先验来规范强化学习,从而减少奖励工程。DeepMimic、AMP、ASE等方法推动了这一方向的进展。但现有的模仿类方法仍然存在大量手工组件:接触标签、奖励塑形、状态估计器、观察历史、多阶段训练、特定行为重新调参等。这些“工程附件”让运动迁移难以规模化。
ZEST的核心主张是:把这些复杂性全部拿掉。
二、ZEST框架:一个极简到“不像真的”的统一方案
ZEST是一个单阶段、统一的运动模仿框架。其设计哲学可以概括为一句话:用数据源的多样性和训练的智能调度,替代人工工程的复杂度。
它实现了几个关键的技术舍弃:
不需要接触标签:演示数据只需要运动学信息,无需标注哪只脚何时接触地面。
不需要未来参考窗口:策略只接收“下一步目标状态”,而非完整的未来轨迹窗口。
不需要观察历史:仅使用上一时刻的动作作为最小时序上下文。
不需要状态估计器:策略不依赖全局位姿或基座线速度这类需要估计的量。
不需要大规模奖励塑形:奖励项保持通用,跨机器人、跨任务只使用一组超参数。
不需要多阶段训练:单阶段PPO完成训练,单张NVIDIA L4 GPU约10小时即可收敛。
这些舍弃看似简单,实则建立在一个更深层的训练设计之上:让困难片段获得更多训练资源,并在训练早期提供物理辅助,让策略平稳跨越最难的探索阶段。
三、三种数据源:动作捕捉、手机视频和动画关键帧
ZEST的一大特色是异构数据源的统一接入。
1. 高保真动作捕捉
使用Xsens和Vicon系统采集的自然人体运动,是最高精度的数据来源,仅需极少的后处理。它保留了人类的细微运动特征,比如步态中明显的脚跟-脚尖滚动、接近关节极限的膝盖伸展,以及优雅安静的步态过渡。这些特征靠纯奖励塑形很难诱导出来,但在高保真动作参考的引导下可以自然涌现。
2. 噪声单眼视频
ZEST的ViCap流程可以从普通手持手机拍摄的野外视频中重建三维人体运动。该流程组合了MegaSaM(用于稳健的相机运动和场景估计)和TRAM(用于人体姿态估计),显著减少了姿态抖动和脚步打滑等重建伪影。
这一流程的工程意义巨大:从录制视频到生成重定向参考动作只需要几分钟。理论上可以“早上录制新片段,白天训练,晚上上机运行”。这意味着机器人技能库的扩充速度可以被大幅压缩。
3. 非物理约束的动画关键帧
关键帧动画则用来创造人类无法实现、或本应属于非人形形态的动作。对于Atlas,这包括利用其机器人特有的自由度——比如连续旋转的后偏航关节——实现人体解剖学不可能完成的动作。对于Spot四足机器人,动画关键帧更是缺乏人体演示时的主要数据来源。
无论来源如何,所有以人为中心的数据(MoCap和ViCap)都通过一个时空优化问题重定向到目标机器人骨骼上。该优化过程同时解决尺度统一、时间重采样、根位置/朝向跟踪、关节对齐,并保证前向运动学和非穿透约束。
四、训练细节:ZEST的技术核心
ZEST将其任务形式化为目标条件的马尔可夫决策过程,训练中使用非对称演员-评论家架构和近端策略优化。
1. 观察空间:尽量最小化
演员只接收本体感觉信息和下一步目标状态。本体感觉部分仅包括:躯干IMU框架的绝对角速度、归一化重力矢量、关节位置/速度、以及上一时刻的动作。刻意排除全局基座位置和线速度等需要状态估计器的量。
参考观察也只编码下一步目标:基座高度、基座线性/角速度、重力方向、参考关节位置。不使用未来参考窗口,不需要接触标记。
评论家则额外接收特权信息:真实基座线速度、末端执行器位置/速度、接触力、课程相关信号等。这些信息只在模拟中可用,帮助价值函数更快收敛。
2. 动作空间:残差动作
策略输出残差动作,加到参考关节位置上,再作为位置目标送入关节级PD控制器。残差动作的优势在于:策略只需学习“偏离参考多少”,而不是从零开始综合完整的关节指令,从而显著降低探索负担并提升学习稳定性。
3. PD增益的选取:从解析电枢值出发
ZEST为每个关节建模独立的二阶系统,利用驱动器的标称电枢惯量,通过启发式方法调谐PD增益,实现具有期望自然频率的临界阻尼响应。相同的PD增益同时用于仿真和硬件,最大程度地减少仿真与现实的差距。
这里有一个值得关注的细节:ZEST为并联连杆执行器建立了一系列渐进简化的模型。从完整闭环动力学模型,到局部投影模型(假设支撑链无质量),再到动态骨架模型(对角线近似),最终到名义电枢模型(固定配置近似),在计算效率与动力学精度之间做了系统取舍。对于更动态的后空翻行为,团队还开发了更精细的执行器模型,纳入功率限制算法、电机磁饱和以及传动效率损耗等非线性效应,并利用真实世界数据优化了正负工作效率。
4. 奖励函数:刻意保持通用
总奖励由三部分构成:跟踪奖励、正则化奖励和生存奖励。跟踪奖励采用有界的指数核函数,衡量基座线速度、角速度、姿态、关节位置和关键身体位置等与参考的误差。正则化项惩罚快速动作变化、大关节加速度、关节位置和扭矩极限违规。生存奖励在每一步给予恒定正值,鼓励更长的时间。所有奖励项均不依赖具体任务或动作,也不使用参考接触标签。
5. 训练中的两个“智能调度器”
自适应参考状态初始化:将每个演示轨迹划分为固定时长的小段,每段维护一个基于近期跟踪表现的失败分数。重置时,倾向于从失败分数高的段落采样初始相位。这一机制让训练集中在最困难的运动段上,防止对简单片段的过度采样和对困难片段的欠采样。
自动课程辅助扳手:对于涉及大基座旋转的高动态技能,如倒立、侧手翻和后空翻,单纯依靠参考状态初始化往往难以起步。ZEST在基座处施加一个虚拟的空间扳手辅助,其强度与各段的失败分数自动联动。随着跟踪性能提升,辅助逐步退火至零。这相当于体操教练的“递减支持”机制。
五、硬件部署:从Atlas到Spot的零样本迁移
ZEST在三种不同形态的机器人上完成了硬件验证:波士顿动力电驱动Atlas人形(约1.8米,100千克)、Unitree G1人形(约1.2米,35千克)和波士顿动力Spot四足机器人。
Atlas:人体运动的最大程度复现
通过动作捕捉,Atlas学会了走路、慢跑、前滚翻、四足爬行、军队爬行、侧手翻、后空翻,甚至短暂的霹雳舞。这些动作的共同特点是超出脚部以外的多接触——手、膝盖、前臂、躯干和背部都可能与地面发生交互。这些行为对于传统基于模型的全身控制框架几乎是禁区。
通过手机视频,Atlas学会了足球踢球和三段舞蹈,涉及单脚支撑和连续跳跃,需要在持续平衡中精准控制脚步时机。尽管视频参考存在姿态抖动和脚步打滑等伪影,零样本迁移后仍然保持了表现力。
通过动画关键帧,Atlas完成了“倒立反转”这一利用机器人独特自由度的动作——连续旋转后偏航关节并保持手部支撑稳定。这是人类解剖学无法复现的。
Unitree G1:跨本体迁移的验证
在G1上,ZEST实现了从动作捕捉到乒乓球和侧手翻的迁移,以及从视频到芭蕾舞、跳上箱子、爬箱子、下箱子等场景交互技能的迁移。
箱体任务尤其展示了框架的鲁棒性。策略完全基于本体感觉,不接收箱体位置的感知输入,而是通过训练时对机器人与箱子相对位姿的轻量随机化来学习处理不确定性。测试中,成功率为5/5,并在随机初始偏移和偏航下全部成功。该策略还支持2千克的躯干负载,并能适应训练分布之外的箱体高度。
Spot:跨形态的杂技行为
对于四足Spot,动画关键帧使“连续后空翻”“桶滚”“倒立平衡”和“快乐狗”等杂技动作成为可能。在桶滚过程中,Spot的机载IMU甚至在空中饱和,但它仍然完成了动作。
这些结果共同证明:同一套策略结构和训练方案,不需要针对不同形态或不同技能进行重新设计。
六、基于模拟的消融:是什么让ZEST有效?
研究团队在15个Atlas参考动作上训练了单一多技能策略,并通过大规模消融实验检验了每个设计选择的价值。
关键结论:
课程和辅助扳手:可以移除,但样本效率降低。无课程的极简变体在20小时的训练后,性能才约等于完整方法10小时的水平。辅助扳手主要帮助高动态动作在训练早期避免灾难性终止。
自适应采样:移除后性能下降明显,因为困难片段被欠采样。热图分析表明,采样概率精确追踪了失败分布,并将更新集中在高失败区域。
参考窗口和观察历史:增加未来参考窗口或观察历史(5-20步)反而损害性能。输入维度增加带来冗余,使信用分配更复杂,并减慢了收敛。
演员-评论家观察设计:移除评论家的特权信息会降低价值估计质量,导致策略更新变弱。
残差动作 vs 绝对动作:绝对动作表现最差。早期训练中小的策略输出可能导致大的PD跟踪误差,引发关节扭矩爆炸。
与MPC基线的对比同样富有启发性。对于走路这类接触时序简单、轨迹良好的行为,MPC和RL表现相近。但对于侧手翻、慢跑等更具动态性的动作,RL的优势逐渐显现。对于倒立反转、舞蹈B、四足滚动等动作,MPC要么因接触标记错误失败,要么因点接触约束下手臂扭矩饱和失败。ZEST学习的策略不需要显式接触时间表,天然容忍任意身体部位的交互和接触时序的不确定性。
七、局限与未来方向
ZEST并非没有边界。研究团队坦率指出:
泛化边界尚未探明:目前未测试多技能策略对训练集之外全新运动的泛化能力,即“接近但不完全相同”的未见技能。
感知缺失:当前策略完全基于本体感觉,假设地面平坦且不打滑,对不平整或柔顺环境的感知留待未来研究。
仿真到现实的依赖:虽然提供了并联执行器建模和解析电枢PD增益选取的实用程序,但全自动系统辨识仍是一个未解难题。
长距离任务的挑战:对于乒乓球这类需要协调上半身挥拍与动态基座动作的超长时程任务,自适应采样策略对成功至关重要。
未来方向包括:通过紧凑运动嵌入或零/少样本适应实现未知运动的通用跟踪;用连续学习扩展运动库;训练教师模型跟踪大量参考语料,再将知识蒸馏给接受稀疏、人类可理解输入的学生模型,最终实现从语言命令到动作执行的闭环。
八、结语
ZEST证明了一件重要的事:在运动模仿领域,简单的统一框架可以替代大量逐个技能、逐个机器人的工程调试。它的强大并不来自复杂的网络结构或海量的奖励塑形,而来自对训练过程的精细调度——把资源集中在难点上,在早期提供物理辅助,让策略在足够的多样性中自然收敛。
这种“少即是多”的设计哲学,正在为人形机器人从“会动”走向“会做事”铺设一条更可扩展的道路。当上午录制的视频能在晚上转化为机器人身上的新技能时,人类运动与机器人能力之间的边界,开始变得前所未有的模糊。
论文信息
标题: Embodied skill transfer for locomotion control
作者:Jean-Pierre Sleiman, Li He, Alfonso Adu-Bredu, Robin Deits, Arun Kumar等
机构:RAI研究所、波士顿动力等
期刊:Science Robotics, 2026年8月12日,第11卷第117期
DOI:10.1126/scirobotics.aec7695