RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

📅 2026/7/24 14:24:17 👁️ 阅读次数 📝 编程学习
RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

26年6月来自阿里达摩院、香港具身智能实验室、港中文、阿里湖畔实验室和蚂蚁集团的论文“RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation”。

扩展机器人学习规​​模需要海量且多样化的轨迹数据,但目前数据采集受限于物理遥操作模式,因为每一次演示都需要操作员将时间投入到特定的硬件和工作空间中。提出一种“数字遥操作”范式,通过利用生成式世界模型替代真实机器人,实现数据采集与物理约束的解耦。在该框架下,操作员的手部姿态流驱动一个以机器人为中心的生成式世界模型,仅需单张参考图像即可合成高保真的自我视角(egocentric)视频。记录下的姿态流作为一种与具体具身形态无关的动作标签,可通过标准的重定向(retargeting)技术迁移至任意目标机器人,从而生成用于模仿学习的完整状态-动作轨迹,且无需依赖物理硬件。这一范式具体实现为 RynnWorld-Teleop 系统,该系统集成-觉察骨架条件控制、基于视频扩散 Transformer (DiT) 的渐进式人机动作映射训练,以及流式自回归蒸馏技术。该流程将生成过程压缩为单次推理,使得在单张 H100 GPU 上即可实现超过 40 FPS 的实时交互式生成。仅使用 RynnWorld-Teleop 生成数据训练出的策略,在多种灵巧双臂操作任务中均实现有效的零样本(zero-shot)仿真-到-现实(Sim2Real)迁移。此外,利用数字遥操作数据增强真实世界数据集能持续提升任务成功率,这表明 RynnWorld-Teleop 可作为下一代机器人智体的高保真、可扩展数据引擎。


机器人领域的最新进展——例如视觉-语言-动作(VLA)模型(Black et al., 2024; Brohan et al., 2022; Kim et al., 2024; Li et al., 2026b; Zhao et al., 2026b)和世界模型(Agarwal et al., 2025; Ali et al., 2025)——展现了实现通用自主性的巨大潜力,但数据匮乏问题依然严重制约着其发展(Zhao et al., 2026a; Lepert et al., 2025a; Zhao et al., 2023)。若能获取此类大规模机器人数据,将简化训练流程,并有望突破性能上限。尽管传统的遥操作系统(Li et al., 2025b; Ze et al., 2025; Zhao et al., 2025a)能提供高质量的专家数据,但它们往往局限于固定的实验室环境和特定的操作对象(Zhao et al., 2025b; Guo et al., 2026; Zhao et al., 2024)。手动重置环境所需的高昂成本,以及获取多样化现实世界物体的物流挑战,使得这些系统难以捕捉交互中的长尾分布情况。因此,在非结构化环境中实现稳健的泛化能力仍是一项尚未解决的难题,仅靠物理平台本身无法克服这一障碍。

本文提出一种将操作员时间与物理基础设施解耦的方法,即利用生成式机器人替代真实机器人。这种范式称为“数字遥操作”:操作员的实时手部姿态流被输入到一个生成式世界模型中;该模型以目标场景的单张参考图像为条件,合成出机器人若实际执行该动作时会产生的“自我中心视角”(egocentric)视频(图1所示)。

关键在于,由于生成的视频基于操作员关节级的手部姿态,记录下的动作本身便构成了一种与具体机器人形态无关的“真值”(ground-truth)动作标签;通过标准的重定向(retargeting)流程,这些标签可迁移至任何具体的机器人形态上。生成的视频提供了相应的视觉观测结果,由此产生的轨迹数据可直接用于下游的模仿学习,而无需实际操作物理机器人。如果数字遥操作技术得以实现,机器人数据采集将仅受限于操作者的想象力,而不再受限于物理基础设施的制约。

近期有两类研究触及这一目标,但未能完全弥合其中的差距。一类是“人到机器人”的视频转换方法(Lepert et al., 2025a; Li et al., 2025a; Lepert et al., 2025b; Song et al., 2025),它们试图通过渲染或转换,将人类演示画面中的主体替换为机器人形态,从而弥合视觉差异。尽管这些方法跨越了视觉鸿沟,但它们本质上是被动的、仅限于观测的:底层机器人动作并未实际生成,且庞大的 扩散Transformer(DiT)骨干网络也排除了闭环交互的可能性。另一类是基于动作条件的自我中心世界模型(Hao et al., 2026; Wang et al., 2026, 2025b; Xie et al., 2026; Tu et al., 2025),它们更进一步,能够根据人类控制信号合成未来帧,但仍以人类为中心。渲染出的手部图像依然是人手,未能弥合“具身形态”(embodiment)上的差异。一个真正的数字遥操作系统必须同时满足以下条件:(i) 以机器人为中心,使操作者能够遥控机器人;(ii) 基于动作(action-grounded),确保生成的每一帧画面都与可还原的关节级动作信号相关联;以及 (iii) 具备实时性,使操作者能保持在控制回路中,从而将复杂的技能序列串联起来。此前尚无框架能同时满足这三点要求。

为此,本文提出 RynnWorld-Teleop,这是首个在上述严格意义上实现数字遥操作的系统,如图 1 所示。RynnWorld-Teleop 是一个以机器人为中心、基于动作条件的世界模型,它能以支持实时控制的帧率,输出高质量、交互式的自我中心视角视频。


给定参考图像 I_ref 和手势序列 P={p_1, . . . , p_T},RynnWorld-Teleop 能够合成高保真的机器人视角(egocentric)视频 V = {v_1, . . . , v_T}。为了弥合人类意图与机器人执行之间的具身差异(embodiment gap),其框架整合以下要素:(i) 深度感知的动作表征与任务专用架构;(ii) 用于实现从人类到机器人知识迁移的两阶段渐进式训练范式;以及 (iii) 支持实时交互式生成的自回归蒸馏过程。

1 预备知识

RynnWorld-Teleop 基于 Wan-I2V 架构(Wang,2025a)构建,该架构采用 3D 变分自编码器(VAE)和基于 Transformer 的去噪器 F_Θ。其训练目标遵循条件流匹配(CFM)框架(Lipman,2022)。给定初始图像潜变量 z_0 = E(I_V),前向过程构建一条连接数据与噪声的概率路径:z_t =(1−t)z_0 + tε, ε∼N(0,I) ,其中 t ∈ [0, 1]。网络 v_Θ 经过训练,基于参考图像的潜表示 z_ref = E(I_ref) 和深度-觉察骨架控制潜表示 c 来预测速度场 L_CFM。在推理阶段,为了实现实时响应,系统利用经过蒸馏的因果学生模型(distilled causal student)求解由 v_Θ 定义的常微分方程(ODE)来生成视频。

2 深度-觉察动作表征

将动作表征为基于21个关节点手部追踪生成的骨架视频序列。为了解决标准二维投影中固有的深度歧义问题(这对精确建模手与物体的交互至关重要),采用一种深度调制渲染技术。具体而言,每个关节点和骨骼的深度编码颜色映射及直径,均根据其在相机空间中的深度进行动态缩放(如图2所示)。这种表征方式有效地整合了手部的关节结构信息与操作所需的空间线索。

为确保控制信号与视频生成流程兼容,利用预训练的VAE编码器将渲染出的姿态视频投影到潜空间。由此生成的控制潜向量 c 在空间和时间维度上均与目标视频的潜向量对齐,从而实现了动作与外观之间细粒度的关联映射。

3 基于动作条件的视频生成

基于视频扩散 Transformer (DiT) (Wang et al., 2025a) 构建世界模型,利用手部姿态序列作为物理动作的高维代理,以此作为生成过程的条件。

姿态到视频的条件控制。其模型遵循“图像-到-视频”的范式:给定参考图像的潜表示 z_ref 和控制潜表示 c,模型预测后续的运动。为了整合姿态信息,采用一种结合分布对齐的加性 Patch 嵌入(patch-embedding)方案,其中引入一个专用的控制补丁嵌入层 PatchEmbedc_C→D,与原有的视频补丁嵌入层 PatchEmbedz_C→D 并行运行。

这确保在整个训练过程中,相加的控制信号始终与预训练的视频流保持统计兼容性。为了保留生成先验,PatchEmbedc采用零初始化,而门控标量 α 则初始化为一个较小的值(例如 0.1),从而使网络能够在不破坏预训练权重稳定性的前提下,逐步融合姿态信号。

4 渐进式跨域训练

为了促进灵巧操作技能从人类先验向机器人载体的迁移,采用一种两阶段训练范式。为弥合这两个训练阶段之间的人机载体差异,将所有数据转换为成对的(2D骨架,RGB)序列,并在表1中展示各阶段的训练数据统计信息。

阶段1:以自我为中心的人类动作预训练。模型首先在大规模以自我为中心(egocentric)的人类视频数据集上进行训练。在此阶段,DiT学习手与物体交互的基本动力学特性,并建立从骨架构型到逼真视觉合成的映射关系。

利用EgoDex (Hoque et al., 2025) 和 VITRA (Li et al., 2025c) 进行预训练。具体而言,EgoDex数据被分割为81帧的片段。为了生成骨架引导信息,将3D SE(3)手部姿态转换到相机坐标系,并投影到2D空间以渲染包含双手及前臂的关节连线骨架视频。对于VITRA,提取25帧的片段,并利用其提供的动作标注(MediaPipe格式的21个关节)。利用相机内参及各片段首帧的相机位姿,将这些关节投影为2D骨架视频,以保持空间对应关系。

阶段2:机器人域适应。在成对的遥操作数据上对模型进行微调;在该数据中,人类手势通过逆运动学(IK)映射为机器人动作。这使得模型能够充当以机器人为中心的世界模型,即由类人意图直接驱动机器人执行动作的视频生成。

为了给RynnWorld-Teleop的训练提供必要的多样化物理交互数据,收集一个专注于复杂双臂协同操作的大规模真实世界数据集。该数据集包含四项不同任务,旨在挑战模型对物体动力学及长时程操作的理解能力。

为了有效捕捉以人为中心的运动先验,用动作捕捉(MoCap)系统记录操作者的手部动作,从而获取同步的2D骨架序列。为确保与预训练阶段的时间一致性,所有机器人轨迹均被分割为81帧的片段。这种基于骨架的统一表征,结合一致的时间对齐,促进了操作能力从人类演示到机器人载体的有效迁移。

总共收集 1,800 个高质量的演示片段。与针对特定任务的策略训练不同,这全部 1,800 个片段均被用于训练 RynnWorld-Teleop,从而使生成模型能够从广泛的物理场景中学习到全面的世界先验知识。具体任务及其相应的数据分布详见表 2。

5 自回归蒸馏

为了支持交互式闭环应用,将双向教师模型蒸馏为一个能够以帧为单位进行自回归视频生成的因果学生模型(Huang et al., 2025)。该过程包括针对流式推理重新配置模型,随后进行两阶段优化:因果流匹配(causal flow-matching)预热阶段和对抗性分布匹配阶段。

因果流式架构。学生模型采用因果时间掩码和固定大小的 KV 缓存(一种支持原地写入的预分配缓冲区),以实现低延迟推理。与教师模型不同,学生模型在时刻 t 的注意力仅限于 {1, . . . , t} 范围内的帧。为了在自回归生成过程中保持长期一致性,将参考图像 I_ref 的嵌入(embedding)保留为持久的汇聚token,并将所有后续生成的 KV 状态附加到缓存中。这种设计确保在整个生成过程中,初始参考图像的身份特征和空间上下文得以保持。

因果流匹配的预热。训练始于因果流匹配(Lipman et al., 2022)目标,旨在弥合双向处理与因果处理之间的差距。通过最小化均方误差 L_MSE,训练学生模型以帧因果的方式预测速度场 v_theta。

该阶段利用单步速度回归建立学生模型的流式生成和遵循控制指令的能力,为后续的采样加速提供稳定的初始化基础。

分布匹配蒸馏。为了仅用四步去噪即实现高保真合成,随后采用分布匹配蒸馏(DMD,Yin et al., 2024)。这一精细化过程利用学习的critic和冻结的教师模型提供基于分数的梯度引导,从而将学生模型的输出分布推向教师模型的分布。在此阶段,学生模型执行 4 步采样生成。关键在于,在连续的数据块(chunks)之间,通过持久化的 KV 缓存进行梯度反向传播。这种跨块的梯度流动促使模型最小化转换处的边界伪影,确保时间上的平滑连续性,并使最终模型能够在实时交互循环中达到与教师模型相当的视觉质量。


RynnWorld-Teleop (如图3 所示),是一个受动作驱动的以自我为中心(egocentric)的世界模型,能够将手部姿态流转化为高保真的实时机器人视频。然而,要实现数字遥操作的愿景,仅靠世界模型是不够的:它必须集成到一个闭环系统中,该系统能够捕捉操作员意图、驱动生成器,并产出可直接供下游策略使用的轨迹。

下面使 RynnWorld-Teleop 成为此类数据引擎的配套系统:1)将操作员原始动作转化为用于模仿学习的(视频、动作)成对轨迹的端到端流程;2)将该范式与传统的物理仿真进行了对比,其中阐述数字遥操作作为可扩展数据源的独特优势。

1 策略学习的数据生成流水线

为了实现可扩展的策略训练,其开发了一套系统化的流水线,利用 RynnWorld-Teleop 作为高保真数据引擎来生成合成的机器人轨迹。
动作重定向(Retargeting)。基于佩戴在操作者胸部、手腕和上臂上的 Vive 追踪器所获取的原始 6 自由度(6-DoF)位姿,首先通过一个经过校准的坐标变换链计算每只手臂末端执行器的目标位姿;该变换链利用平移缩放因子将操作员的工作空间映射到机器人的工作空间。随后,利用迭代阻尼最小二乘法(DLS)逆运动学求解器获取相应的关节配置;求解过程中引入基于上臂追踪器推导出的零空间(null-space)肩部先验约束,以确保手臂保持自然、类人的姿态。每次更新后都会强制执行关节限位约束。对于操作员的每一个动作,该过程都会生成一个同步的 54 维机器人动作向量(包含双臂各 7 自由度和双手各 20 自由度),该向量与驱动 RynnWorld-Teleop 的手部位姿流精确对齐。

基于骨架条件的合成。对于每一个源演示(source demonstration),提取初始 RGB 帧作为参考图像 I_ref。操作员的手部位姿流被渲染为以 16 FPS 采样的二维深度感知骨架序列 S_1:T。通过以 I_ref 和 S_1:T 为条件驱动 RynnWorld-Teleop,合成相应的机器人执行视频。值得注意的是,由于 I_ref 是目标场景的唯一视觉规范,用户既可以直接提供该图像,也可以对其进行合成编辑,从而构建出超出训练分布范围的操作场景。无论采用哪种方式,真实的机器人动作序列 a_1:T 均与生成的视频帧保持同步。每个动作 a_t 都是一个拼接向量,包含双臂(各 7 自由度)和双手(各 20 自由度)的绝对关节位置信息。这些动作由原始遥操作过程中的操作者位姿重定向而来,确保合成的视觉观测与机器人状态能够完美对齐,从而满足下游模仿学习的需求。通过分块重锚定(Chunked Re-anchoring)缓解漂移。若完全采用自回归方式生成长时程视频,往往会导致视觉漂移及累积性的物理不一致问题。为确保生成数据符合物理真实性,采用一种基于分块的生成策略,片段长度设定为 81 帧。对于首个片段,模型利用演示数据的真实起始帧进行初始化;而在后续的每个片段中,通过引入机器人相机在特定时间步捕获的实际自我中心视角(egocentric frame)作为新的参考帧(I_ref),从而对生成过程进行重锚定。这种周期性的校准机制确保了在复杂长时程任务的整个过程中,生成的环境(如物体位姿和光照条件)始终与真实动作序列保持一致。

2 RynnWorld-Teleop 作为数据引擎与传统仿真技术的对比

将 RynnWorld-Teleop 与传统物理仿真器进行对比,以突显其作为可扩展数据引擎的优势:

无需 3D 资产构建:传统仿真需要为每个物体显式创建 3D 网格(mesh)和 URDF 文件(Guo et al., 2026; Zhao et al., 2025b)。RynnWorld-Teleop 仅需单张参考图像 I_ref 即可隐式构建环境,彻底规避人工资产建模的瓶颈。

无视觉域差异:仿真渲染固然存在“现实鸿沟”(reality gap)(Zhao et al., 2026b)。RynnWorld-Teleop 直接在真实世界的像素分布空间内合成图像帧,无需进行域随机化(domain randomization),即可自然地呈现复杂的光照、反射及传感器噪声。

隐物理特性与人工系统辨识(SysID)的对比:传统仿真器依赖繁琐的系统辨识过程(如摩擦系数、质量参数的测定),且难以处理可变形体。RynnWorld-Teleop 通过在大规模人类视频数据上进行预训练,习得物理“常识”,能够在无需显式微分方程的情况下,生成符合物理规律的接触动力学效果。


1 训练细节

采用 Wan2.2-TI2V-5B (Wang et al., 2025a) 作为基础模型。为了使基础模型与目标环境的视觉特征(如光照、特定物体)相匹配,首先进行标准的文本/图像生成视频(TI2V)微调作为预热阶段。该阶段不涉及动作条件控制。在 64 块 NVIDIA H100 GPU 上以 2 X 10-5的学习率对完整模型进行 2,000 步训练,使模型能够适应人类与机器人数据集特有的视觉领域。

动作条件训练。引入深度-觉察骨架条件控制分支,并探索两种训练范式以适配模型:低秩自适应(LoRA)和全参数监督微调(SFT)。这两种范式均遵循两阶段渐进式训练策略:

• 阶段 1(以自我为中心的人类数据预训练):用预训练的 Wan-2.2-TI2V-5B 主干网络初始化模型,并在大规模人类数据集上学习基础的操作动力学。

– 基于 LoRA:优化 Patch Embedding 层和 LoRA 权重(秩为 64),学习率为 2 X 10-5
– 全参数 SFT:以 2 X 10-5的学习率进行全参数微调,并采用 200 步预热(warmup)及 EMA(衰减率为 0.999)以稳定交互先验的学习。

• 阶段 2(机器人域自适应):在 1,800 个成对的人类-机器人交互片段(episodes)上对阶段 1 的检查点(checkpoint)进行微调,以弥合具身差异。

– 基于 LoRA:继续训练 LoRA 权重和控制分支,学习率为 1 X 10-5
– 全参数 SFT:以 1 × 10⁻⁵ 的学习率微调模型的所有参数,并结合 EMA(衰减系数 0.999)及 200 步预热(warm-up)策略,以确保模型在复杂的双手动协同任务中的稳定性。

自回归蒸馏。最后,将双向教师模型转化为因果学生模型,以实现实时推理:

• 因果流匹配(Causal Flow-Matching)预热:学生模型以 1 × 10⁻⁵ 的学习率进行预热,以建立时间上的因果关系。
• 对抗蒸馏(DMD):针对少步交互式生成任务,采用 DMD 方法,其中生成器学习率为 2 × 10⁻⁶,判别器学习率为 5 × 10⁻⁷。

2 数字遥操作系统评估

实验设置。实验在搭载双臂及双“无极”(WUJI)灵巧手的 TIANJI M6 移动机器人上进行。视觉数据流由安装在机器人视角的 RealSense D435i 摄像机采集。

如图 4 所示,为了展示方法在多种操作挑战中的泛化能力,在四项需要不同程度双臂协作的任务上对该方法进行了评估:

(1) 双重抓取(Dual Picking):机器人利用左臂从盘中抓取苹果,右臂抓取香蕉,并依次将两个物体放置在桌面上。
(2) 方块推动(Block Pushing):一项连续推动任务,左臂先将一个大方块从左侧区域推至中心位置,随后右臂接力将其推至指定的右侧目标区域。
(3) 双臂提举(Bimanual Lifting):一项重载协作任务,要求双臂同步将一个西瓜造型的毛绒玩具从桌面提起,并准确放入托盘中。
(4) 盖盖子(Lid Placement):一项侧重精度的任务,要求机器人抓取盖子并将其准确对齐,盖在纸箱上。

这些任务综合考察了模型在双臂协同、时间序列规划及长程交互方面的能力。针对每项任务,通过对初始环境状态进行大幅度随机化处理来评估模型的泛化性能;这包括改变任务相关物体(如水果、容器)在工作空间坐标及轴向旋转方面的 6 自由度(6-DoF)位姿。主要的评估指标为成功率,定义为每项任务在 35 次连续真实世界试验中的成功完成比例。若机器人能在 120 秒内达到目标状态,则视为试验成功。

基于生成式数据扩展的策略学习。除了视觉保真度外,RynnWorld-Teleop 还充当了数字遥操作的生成式数据引擎:它通过将不受约束的人类手势转化为与真实动作(ground-truth actions)完美同步的逼真执行轨迹,从而扩展了机器人的训练数据集。

特征分布分析。为了进一步探究真实世界机器人轨迹与 RynnWorld-Teleop 生成轨迹在视觉和语义上的对齐情况,利用 t-SNE 进行特征分布分析。分别从真实世界演示数据集和 RynnWorld-Teleop 生成的数据集中随机抽取 1000 帧数据,并使用预训练的 I3D 模型(Carreira 和 Zisserman,2017)提取特征,以捕捉高层语义信息。

实时控制的延迟分析。为了验证 RynnWorld-Teleop(因果型)的实时性能,在单块 NVIDIA H100 GPU 上评估了其端到端推理延迟。其采用 4 步流匹配(flow matching)调度进行优化的因果型蒸馏学生模型,在 480 × 832 分辨率下实现了 40.0 fps 的高吞吐量。

3 动作条件世界模型评估

实验设置。为了全面评估 RynnWorld-Teleop 的生成能力,设立两个不同的评估基准:

• EgoDex-Test(以人为中心的领域):为了评估通用交互先验并进行消融研究,使用了 EgoDex 数据集(Hoque 等人,2025)。从官方 EgoDex 测试集中随机抽取 50 个视频序列,每个序列包含 81 帧(帧率为 16 FPS)。这些序列涵盖多种未见过的人与物体交互场景。使用这一具有代表性的子集,能够确保无偏地评估模型将大规模人类操作先验迁移到动作条件生成任务中的效果。

• Robotic-Test(机器人专用领域):为了评估模型在实际机器人载体和真实实验室环境中的表现,预留一个特定的 Robotic-Test 集。该数据集包含 20 个视频序列(每个序列 81 帧),均从自行采集的遥操作数据中随机选出,并确保这些数据未在第二阶段的机器人适应(Robotic Adaptation)训练中出现过。这些序列涵盖全部四类任务(双臂抓取、方块推动、双臂提举和盖子放置),旨在验证 RynnWorld-Teleop 能够在各种机器人操作场景中保持高视觉保真度和时间一致性。

硬件基础设施如图10所示: 评估采用标准的机器人配置:搭载 WUJI 灵巧手的双臂 TIANJI M6 系统。汇总包括自由度(DoF)、负载能力及指尖作用力在内的详细技术参数,以确保该操作基准测试的可复现性。

实体机器人基于TIANJI M6机械臂和WUJI灵巧手构建。策略的推理频率设定为50 Hz,指令发送时的延迟保持在18到30毫秒之间。底层接口以500 Hz的频率运行,确保了平滑的实时控制。控制策略与底层接口之间的通信通过LCM(Lightweight Communications and Marshalling)实现。

通过遥操作系统采集真实世界的演示数据。硬件配置包括一对TIANJI 7自由度机械臂和一对WUJI 20自由度灵巧手,总计拥有54个自由度。在机械臂控制方面,操作员佩戴五个HTC Vive追踪器(分别安装在胸部、双腕和双上臂)。系统以100-120 Hz的频率计算手腕相对于胸部的变换关系,并将其输入到一个在独立进程中运行的、基于Pinocchio库的逆运动学求解器中。求解出的关节指令经由Ruckig轨迹生成器进行平滑处理(考虑速度、加速度和加加速度约束),随后以200 Hz的频率发送给机械臂。

在灵巧手控制方面,如图11所示,操作员佩戴Manus数据手套。手套的原始信号被转换为MediaPipe的21点手部骨架格式,并通过专用重定向模块映射到WUJI灵巧手的20自由度关节空间,同时应用指数移动平均滤波器对运动进行平滑处理。


CosHand。CosHand (Sudhakar et al., 2024) 是一种基于扩散模型的手部图像生成模型,它根据参考图像和目标手部掩码(mask)来合成目标手部外观。其用其官方发布的模型检查点(checkpoint),并采用其基于图像条件的生成流程。对于每个视频,提取第 0 帧作为参考图像,并利用 SAM2 (Ravi et al., 2025) 从真实视频(ground truth video)中获取逐帧的二值手部分割掩码。在每个时间步 t > 0,以参考图像、参考手部掩码(第 0 帧)和目标手部掩码(第 t 帧)为条件,使用 DDIM 采样(50 步,无分类器引导尺度为 1.5)生成分辨率为 256 × 256 的目标帧。随后,将生成的帧调整大小至 480 × 832 以匹配真实视频的分辨率,从而为每个视频生成 81 帧(帧率为 16 fps)的视频。

Mask2IV。Mask2IV (Li et al., 2026a) 是一种两阶段潜空间视频扩散模型,它根据输入图像、文本提示(prompt)以及起始和结束手部掩码来生成视频。用该模型两个阶段的官方发布检查点。对于每个真实视频,提取 SAM2 (Ravi et al., 2025) 手部掩码,并将 81 帧的序列划分为 5 个互不重叠的片段(chunk),每个片段包含 16 帧。对于片段 i,其生成条件包括:索引为 16i 的真实帧(作为输入图像)、第 16i 帧(起始)和第 16(i + 1) 帧(结束)的手部掩码,以及基于任务名称生成的文本提示(例如“一只手正在倒东西”)。推理过程在 320 × 512 分辨率下进行,采用 50 步 DDIM 采样、η = 1.0、无分类器引导尺度 1.0 以及引导重缩放(guidance rescale)0.7。将这 5 个片段按顺序拼接形成 80 帧的输出视频,最后将其调整大小至 480 × 832 以进行评估。

InterDyn。InterDyn (Akkerman et al., 2025) 在 Stable Video Diffusion (SVD) 的基础上增加一个 ControlNet 分支,该分支接收手部交互掩码作为空间条件输入。通过帧重采样将每段真值(ground truth)视频从 16 fps 转换为 12 fps,并将其分割为两个互不重叠、各包含 28 帧的片段。相应的 SAM2 (Ravi et al., 2025) 手部掩码也经过同样的重采样处理,并转换为 InterDyn 输入流水线要求的 VP9 编码 WebM 格式。对于每个片段,InterDyn 将第一帧作为参考图像,将 28 帧的掩码序列作为 ControlNet 条件,在 50 步去噪过程中生成 14 帧输出(时间维度下采样因子为 2,帧率为 6 fps)。这两个片段共生成 28 帧预测图像(原始分辨率为 256 × 384),随后将其上采样至 480 × 832,以便与真值进行指标计算。