三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

具身模型消融实验总结分析

具身模型消融实验总结分析

需要先说清楚一件事:这些消融都是在各自基准和数据上做的,结论有适用范围,不能当成跨场景的铁律——这也是为什么不同论文在某些点上会"打架"。

一、TRI × 清华《Co-training Large Behavior Models》

消融规模:5 大类 co-training 数据 → 8 种子模态 × 3 种训练策略 + 1 个 baseline,共89 个策略、5.8 万次仿真、2835 次真机评估,用 Welch’s t-test / STEP test + Bonferroni 校正

核心消融结论

消融维度结论
标准 VL 数据最优模态之一;两阶段全协同训练最优(阶段1预训练+阶段2联合精调)
机器人轨迹语言标注有效,VLM 标注 > 脚本标注;两阶段仅阶段1最优
跨具身机器人数据(OXE)最优模态之一,对分布偏移/未见任务提升最大;两阶段仅阶段1最优
人类视频 VLM 标注有效,两阶段全协同最优
人类视频潜在动作仅在低目标机器人数据量下有用,大数据量下无收益甚至有害
离散动作 token(FAST / VQ-VAE)无统计显著收益,FAST 甚至降低未见任务泛化
CoT 显式约束短程操作任务中无提升甚至退化,“画蛇添足”
纯机器人数据训练侵蚀 VLM 骨干的通用 VLM 能力;有效协同训练能保留/恢复

💡 这篇是目前数据模态消融最系统的一篇,相当于 VLA co-training 的"避坑圣经"。


二、VLANeXt(ICML 2026)—— 500+ 实验提炼 12 条配方

消融规模:在统一框架下围绕 RT-2 基线,从基础组件 / 感知要素 / 动作建模范式三个维度做超过 500 组受控实验,LIBERO + LIBERO-plus 上逐步叠加设计选择

核心消融结论(按设计维度):

设计维度消融发现
Policy 模块独立 policy head(30.2%)≫ baseline(19.8%);大模型(Large Policy Module)达 64.4%,是最大单一增益
Action Chunkingchunk=4 最优(75.4%),chunk=8 略降(74.6%)
训练目标回归(85.4%)> Flow Matching(80.0%)≈ DDIM(80.0%)> VQ-VAE 分类(58.8%)> bin 分类(74.6%)
VLM 骨干容量Qwen3-VL-4B(95.8%)> Qwen3-VL-2B(90.0%)> LLaMA3.2+SigLip(80.0%)> PaliGemma(69.8%)
VLM-Policy 连接Soft Connection(可学习 query buffer)91.8%略优于 Loose / Tight
时间观测历史加入多帧历史反而降到 85.0%(当前帧 91.8%),多帧历史引入噪声
相机视角第三人称+手腕多视角 97.6% ≫ 单第三人称 91.8%
本体感受注入位置注入 VLM 端 98.0%(最优)> 注入 Policy 端 96.2% > 两端都注 97.6% > 不注入 97.6%
本体感受投影Linear Projector 98.0% ≈ Transformer Projector + MAE 97.0%
世界模型视角加 world modelling 辅助 98.0% → 94.4%(LIBERO-plus)
频域辅助损失加 frequency domain loss 后 LIBERO-plus 从 87.2% 提升到94.4%

⚠️ 注意:VLANeXt 发现"模型性能随骨干增强而提升",这与 LLaVA-VLA 的"参数规模≠性能"结论相反——VLANeXt 的解释是自己用了更大的 policy module,能消化更强 VLM 的表征


三、LLaVA-VLA + CEBench —— 8 条轻量化设计结论

消融规模:在 CEBench(CALVIN + RoboTwin + 真机移动操作)上系统消融,得出8 条关键结论

编号消融维度结论
F1参数规模性能与参数规模非严格正相关;0.5B 无预训练可媲美 7B
F2多视角融合多视角是 3D 感知核心;单图拼接(vertical stack)优于分开编码
F3本体感受编码Token 化 > MLP 投影,更好利用 VLM 的语言建模能力
F4动作分块分块增强规划能力,chunk=5 最优
F5跨具身预训练非必需,域内多任务后训练 + 单任务微调即够
F6扩散头 vs 离散扩散头非必需;离散 token + 分块可达媲美性能(CALVIN: 离散 94.8/84.5/71.3 vs 连续 93.5/84.4/73.5)
F7离散化粒度粗粒度优于细粒度;256 bins 在效率和泛化上优于 1024 bins
F8统一动作空间Direction Token + Value Token是移动操作系统最优解(真实移动操作 4/10 vs 2/10)

四、OpenVLA(Stanford/CMU/Berkeley/DM)

消融规模:CoRL 2024,真机 BridgeData V2 + LIBERO 仿真

消融维度结论
OpenX 预训练混合移除后 Bridge 任务从 76.3% 降到45.6%(↓30.7 点),是多机体多样化数据的主收益
双视觉编码器(SigLIP+DINOv2)去掉 DINOv2 降到 40.6%(↓5 点),空间细节有用但边际小于数据多样性
视觉编码器冻结 vs 微调冻结显著更差(早期 Bridge 实验 80.0% vs 46.7%),VLA 不能照搬 VLM 的"冻结视觉"经验
输入分辨率224px 与 384px 性能无明显增益,但 384px 训练慢 3 倍
LoRA 微调rank=32 的 LoRA 可达全参数微调约 4% 参数差距内的性能
4-bit 量化内存减 50%+,性能无损;8-bit 量化性能下降主要来自推理速度而非精度
训练节奏固定 lr=2e-5、无 warmup、约 27 epoch 直到 action token acc > 95%

📌 OpenVLA 最有工程价值的两条:OpenX 混合几乎不可省;VLA 必须微调视觉编码器。


五、Octo(Berkeley RAIL)

消融规模:25 个数据集组合 + 6 个新任务微调评估

消融维度结论
架构Transformer-first(ViT 类)83%在大规模多样数据上优于 ResNet+小 Transformer 70%;但在小数据集上 ResNet 反超 ViT
训练数据多样性RT-X 数据集混合 60% ≫ 单一 Bridge 43% ≫ Octo-Small baseline 83%,数据多样性至关重要
训练目标扩散头 83%≫ 连续动作 MSE 35% ≫ 离散化动作 18%
模型规模Octo-Base > Octo-Small,更大模型在场景感知和鲁棒性上更优
指令模态目标图像指令比语言指令成功率高 25%
微调效率约 100 条演示 + 单卡 < 5 小时,平均成功率 72%(从零训练仅 20%,VC-1 仅 15%)

六、SmolVLA(Hugging Face LeRobot)

消融规模:LIBERO 上全套消融

消融维度结论
注意力结构CA+SA 交替 85.5%> 仅 CA 79.0% > 仅 SA 74.5%
因果掩码因果掩码 74.5% > 双向注意力 67.5%;防止动作"偷看未来",长时序任务从 23% 涨到 40%
VLM 层截断用前 16 层 78.5%(仅比 32 层全量 80.3% 低 1.8 点),速度翻倍性价比极高;隔层采样优于小 VLM 但仍不如截前 N 层
训练目标Flow Matching 85.5%> L1 回归 75.25%
动作分块大小10-50 个动作的块大小在响应性和计算效率间取得平衡
异步推理异步 73.3% vs 同步 78.3%,单任务耗时 13.75s → 9.7s(提速 30%),60s 内完成循环数 9→19

七、LingBot-VLA 2.0(蚂蚁灵波)

消融规模:4 个 GM-100 真机任务,聚焦动作表示与训练策略

消融维度结论
动作目标相对关节动作 55.0% ≫ 绝对关节动作 33.7%;相对动作把目标分布标准差从约 0.80 降到 0.28
动作归一化MeanStd 归一化最优;保住大幅修正动作(|x|>1.5 长尾不裁剪)
损失函数L2 优于 L1(46.4% → 55.0%);relQpos 目标多在零附近,L2 更贴合高密度区;L1 仅在接触丰富/重尾的"挤番茄酱"任务上更好
分布对齐提出"分布对齐 gap"指标解释 relQpos 收益:条码扫描任务关节动作 gap 远小于末端,关节动作成绩碾压(58.7 vs 24.0)

💡 LingBot 的消融价值:把 VLA 里常被默认的"相对动作 + MeanStd + L2"组合给出了量化的、可复现的理由


八、跨论文结论冲突与共识

把上面七份消融放一起看,有些点是共识,有些是冲突

✅ 强共识

  • 数据多样性 > 架构微调(OpenVLA、Octo、TRI 三篇一致)
  • 扩散 / Flow Matching 训练目标优于 MSE / 离散分类(Octo、TRI、VLANeXt、SmolVLA、LLaVA-VLA 一致)
  • VLA 必须微调视觉编码器(OpenVLA 明确,VLANeXt 通过线性投影器隐含)
  • Action chunking 有益(VLANeXt chunk=4/8、LLaVA-VLA chunk=5、SmolVLA 10-50)
  • 本体感受信号要显式注入(VLANeXt 注入 VLM 端最优、LLaVA-VLA token 化优于 MLP、LingBot 相对关节动作最优)

⚖️ 冲突点(取决于实验设置)

冲突点立场 A立场 B
参数规模VLANeXt:更大 VLM 骨干更好(Qwen3-VL-4B 95.8%)LLaVA-VLA:0.5B 无预训练可媲美 7B
解释VLANeXt 用了更大的 policy module 消化表征LLaVA-VLA 认为轻量 head 限制了大模型收益
离散动作 tokenTRI:FAST/VQ-VAE 无显著收益LLaVA-VLA:配合 chunking 的粗粒度离散化可达媲美性能
时间观测历史VLANeXt:多帧历史反而引入噪声多数 VLA:观测历史有益(但 VLANeXt 用当前帧+强 chunking 补偿了)

⚠️ 单篇消融的局限性

  • SmolVLA:消融主要在自己加的小模块上,没有换同尺度其他 VLM 做 backbone 对照——所以"小模型媲美大模型"的结论有内部有效性限制
  • LingBot-VLA 2.0:消融聚焦动作表示 4 个选择,没有做数据规模 / 视觉骨干的消融
  • TRI Co-training:结论是 4000 小时数据规模下的,低数据场景下单目 / 离散 token 可能仍有用(论文自己也承认潜在动作在低数据量下有效)

给新手的"消融结论查阅地图"

如果你的疑问是“XX 设计选择该不该用”,按下面这个映射去查对应论文的消融表:

  • 数据怎么混合 →TRI Co-training
  • 整个 VLA 架构怎么搭 →VLANeXt 12 条配方
  • 小模型能不能打 →LLaVA-VLA 8 条结论
  • 7B 级 VLA 工程化 →OpenVLA 消融表
  • 通用机器人策略预训练 →Octo 表 II
  • 高效 VLA(消费级 GPU)→SmolVLA LIBERO 消融
  • 动作表示 / 归一化 / 损失 →LingBot-VLA 2.0 §6
← 返回列表