Transformer Transformer:运动条件下机器人协同设计的统一模型,速度更快、设计更优!

📅 2026/7/30 7:52:28 👁️ 阅读次数 📝 编程学习
Transformer Transformer:运动条件下机器人协同设计的统一模型,速度更快、设计更优!

Transformer Transformer:用于运动条件下机器人协同设计的统一模型

该研究由 Huy Ha、Karen Liu、Shuran Song 开展,有相关论文、视频和代码。研究涵盖研究动机、框架介绍、RoboTokens、架构设计、动力学自引导、实验结果、现实应用等方面。

并非所有机器人都生来平等

并非所有机器人都生来平等,而 Transformer Transformer 作为统一模型,能根据操作演示生成针对特定运动优化的完整机器人。例如为 ALOHA2 双手机器人平台设计的抛布机器人,与原始设计相比,将跟踪误差降低了 73%,最大关节速度降低了 30%。这一成果基于 RoboTokens 训练的扩散 Transformer,RoboTokens 是对机器人实体、状态和动作进行统一标记化的方法,相同架构涵盖不同实体空间和用例。其动力学模型通过动力学自引导过程引导实体扩散,三个设计空间的实验表明,该模型能对未见过的奖励和轨迹进行零样本优化,相比进化基线方法,提高了性能并缩短了运行时间。

技术总结视频

有一个 17 分钟的详细介绍视频,也可查看图文版本。

给定操作任务,哪种机器人最优?

机器人的实体形态决定其擅长的任务,即便有出色策略,糟糕的实体形态也会受限。具体问题是,给定目标末端执行器的运动和奖励函数,希望生成完整的机器人实体及控制器,这被称为运动条件下的机器人协同设计。

演示、生成、验证

框架将机器人协同设计重新定义为三步过程:演示期望的末端执行器运动,模型生成优化后的实体,同一模型验证该设计并控制机器人。同一个网络扮演生成器、评估器和跨实体控制器三个角色,通过对机器人进行统一标记化联合训练实现。论文分为统一的机器人表示(RoboTokens)、统一的架构(Transformer Transformer)和统一的训练目标(动力学自引导)三部分。

RoboTokens:统一的机器人表示

每个机器人变成类型化的标记序列,蓝色标记编码实体,橙色标记编码动力学。RoboTokens 是涵盖所有实体的共享词汇表,有完整性、灵活性、一致性、可扩展性、可优化性等关键设计目标。对 MuJoCo Menagerie 中的 11 个机器人进行标记化,每个机器人变成 28 - 101 个 RoboTokens 的序列,且 RoboTokens 比 MJCF 文本紧凑 27 - 110 倍。

Transformer Transformer:统一的架构

该模型是基于 RoboTokens 训练的扩散 Transformer,采用 DDIM4 噪声调度。通过改变掩码标记,同一个网络可扮演不同角色,相同权重在动力学上进行联合训练。其标题有双关含义,第一个“Transformer”指机器人,第二个指自注意力架构。它有感知实体的控制器和多样化机器人类别的生成器两个功能,前者能根据机器人调整控制策略,后者能从高斯噪声中扩散出完整机器人。

动力学自引导:零样本处理奖励

为解决为模型未见过的奖励函数生成高奖励机器人的问题,可将模型预测输入用户奖励函数得到预测奖励,并行多次运行模型选优。还可计算预测奖励梯度注入扩散过程,即动力学自引导。以随机生成的四足机器人为例,模型能根据不同奖励条件生成不同机器人,实现零样本处理奖励。对于运动的分布,扩散组合方法可实现为整个任务优化机器人,在 UMI 双手机器人洗碗数据集上测试,模型生成针对整个预留分布优化的机器人并验证设计。

设计更优,速度更快

与随机和 CMA - ES 两个基线方法比较,Transformer Transformer 在有更多推理种子时能生成更好设计,性能约一分钟后达平台期。在三个设计空间和多个奖励函数下,其零阶和动力学自引导变体生成奖励更高的设计,速度比 CMA - ES 快几个数量级,原因是对候选设计进行 GPU 并行化处理和非自回归扩散可并行评估整个过程。

现实应用:ALOHA 上的布抛掷任务

为测试系统,选择 ALOHA2 上的动态布料展开任务。原始 ALOHA 设计难以跟踪轨迹,模型针对“跟踪速度”奖励优化 ALOHA 设计后,制造出的优化设计有更长的连杆长度和倒置安装两个变化,且优化后的设计关节轨迹更平滑。

局限性与未来工作

存在几何形状和场景、控制器迁移、测试时扩展的平台期、数据生成成本等方面的局限性,扩展到复杂几何形状和场景上下文、提升控制器泛化能力、提高奖励预测准确性和探索替代推理方案、降低数据生成成本是未来研究方向。

参考文献

包括 Peebles, W., & Xie, S.、Zhao, T. Z., Kumar, V., Levine, S., & Finn, C. 等众多文献。完整参考文献列表可在论文中查看。