需要先说清楚一件事:这些消融都是在各自基准和数据上做的,结论有适用范围,不能当成跨场景的铁律——这也是为什么不同论文在某些点上会"打架"。
一、TRI × 清华《Co-training Large Behavior Models》
消融规模:5 大类 co-training 数据 → 8 种子模态 × 3 种训练策略 + 1 个 baseline,共89 个策略、5.8 万次仿真、2835 次真机评估,用 Welch’s t-test / STEP test + Bonferroni 校正
核心消融结论:
| 消融维度 | 结论 |
|---|---|
| 标准 VL 数据 | 最优模态之一;两阶段全协同训练最优(阶段1预训练+阶段2联合精调) |
| 机器人轨迹语言标注 | 有效,VLM 标注 > 脚本标注;两阶段仅阶段1最优 |
| 跨具身机器人数据(OXE) | 最优模态之一,对分布偏移/未见任务提升最大;两阶段仅阶段1最优 |
| 人类视频 VLM 标注 | 有效,两阶段全协同最优 |
| 人类视频潜在动作 | 仅在低目标机器人数据量下有用,大数据量下无收益甚至有害 |
| 离散动作 token(FAST / VQ-VAE) | 无统计显著收益,FAST 甚至降低未见任务泛化 |
| CoT 显式约束 | 短程操作任务中无提升甚至退化,“画蛇添足” |
| 纯机器人数据训练 | 侵蚀 VLM 骨干的通用 VLM 能力;有效协同训练能保留/恢复 |
💡 这篇是目前数据模态消融最系统的一篇,相当于 VLA co-training 的"避坑圣经"。
二、VLANeXt(ICML 2026)—— 500+ 实验提炼 12 条配方
消融规模:在统一框架下围绕 RT-2 基线,从基础组件 / 感知要素 / 动作建模范式三个维度做超过 500 组受控实验,LIBERO + LIBERO-plus 上逐步叠加设计选择
核心消融结论(按设计维度):
| 设计维度 | 消融发现 |
|---|---|
| Policy 模块 | 独立 policy head(30.2%)≫ baseline(19.8%);大模型(Large Policy Module)达 64.4%,是最大单一增益 |
| Action Chunking | chunk=4 最优(75.4%),chunk=8 略降(74.6%) |
| 训练目标 | 回归(85.4%)> Flow Matching(80.0%)≈ DDIM(80.0%)> VQ-VAE 分类(58.8%)> bin 分类(74.6%) |
| VLM 骨干容量 | Qwen3-VL-4B(95.8%)> Qwen3-VL-2B(90.0%)> LLaMA3.2+SigLip(80.0%)> PaliGemma(69.8%) |
| VLM-Policy 连接 | Soft Connection(可学习 query buffer)91.8%略优于 Loose / Tight |
| 时间观测历史 | 加入多帧历史反而降到 85.0%(当前帧 91.8%),多帧历史引入噪声 |
| 相机视角 | 第三人称+手腕多视角 97.6% ≫ 单第三人称 91.8% |
| 本体感受注入位置 | 注入 VLM 端 98.0%(最优)> 注入 Policy 端 96.2% > 两端都注 97.6% > 不注入 97.6% |
| 本体感受投影 | Linear Projector 98.0% ≈ Transformer Projector + MAE 97.0% |
| 世界模型视角 | 加 world modelling 辅助 98.0% → 94.4%(LIBERO-plus) |
| 频域辅助损失 | 加 frequency domain loss 后 LIBERO-plus 从 87.2% 提升到94.4% |
⚠️ 注意:VLANeXt 发现"模型性能随骨干增强而提升",这与 LLaVA-VLA 的"参数规模≠性能"结论相反——VLANeXt 的解释是自己用了更大的 policy module,能消化更强 VLM 的表征
三、LLaVA-VLA + CEBench —— 8 条轻量化设计结论
消融规模:在 CEBench(CALVIN + RoboTwin + 真机移动操作)上系统消融,得出8 条关键结论
| 编号 | 消融维度 | 结论 |
|---|---|---|
| F1 | 参数规模 | 性能与参数规模非严格正相关;0.5B 无预训练可媲美 7B |
| F2 | 多视角融合 | 多视角是 3D 感知核心;单图拼接(vertical stack)优于分开编码 |
| F3 | 本体感受编码 | Token 化 > MLP 投影,更好利用 VLM 的语言建模能力 |
| F4 | 动作分块 | 分块增强规划能力,chunk=5 最优 |
| F5 | 跨具身预训练 | 非必需,域内多任务后训练 + 单任务微调即够 |
| F6 | 扩散头 vs 离散 | 扩散头非必需;离散 token + 分块可达媲美性能(CALVIN: 离散 94.8/84.5/71.3 vs 连续 93.5/84.4/73.5) |
| F7 | 离散化粒度 | 粗粒度优于细粒度;256 bins 在效率和泛化上优于 1024 bins |
| F8 | 统一动作空间 | Direction Token + Value Token是移动操作系统最优解(真实移动操作 4/10 vs 2/10) |
四、OpenVLA(Stanford/CMU/Berkeley/DM)
消融规模:CoRL 2024,真机 BridgeData V2 + LIBERO 仿真
| 消融维度 | 结论 |
|---|---|
| OpenX 预训练混合 | 移除后 Bridge 任务从 76.3% 降到45.6%(↓30.7 点),是多机体多样化数据的主收益 |
| 双视觉编码器(SigLIP+DINOv2) | 去掉 DINOv2 降到 40.6%(↓5 点),空间细节有用但边际小于数据多样性 |
| 视觉编码器冻结 vs 微调 | 冻结显著更差(早期 Bridge 实验 80.0% vs 46.7%),VLA 不能照搬 VLM 的"冻结视觉"经验 |
| 输入分辨率 | 224px 与 384px 性能无明显增益,但 384px 训练慢 3 倍 |
| LoRA 微调 | rank=32 的 LoRA 可达全参数微调约 4% 参数差距内的性能 |
| 4-bit 量化 | 内存减 50%+,性能无损;8-bit 量化性能下降主要来自推理速度而非精度 |
| 训练节奏 | 固定 lr=2e-5、无 warmup、约 27 epoch 直到 action token acc > 95% |
📌 OpenVLA 最有工程价值的两条:OpenX 混合几乎不可省;VLA 必须微调视觉编码器。
五、Octo(Berkeley RAIL)
消融规模:25 个数据集组合 + 6 个新任务微调评估
| 消融维度 | 结论 |
|---|---|
| 架构 | Transformer-first(ViT 类)83%在大规模多样数据上优于 ResNet+小 Transformer 70%;但在小数据集上 ResNet 反超 ViT |
| 训练数据多样性 | RT-X 数据集混合 60% ≫ 单一 Bridge 43% ≫ Octo-Small baseline 83%,数据多样性至关重要 |
| 训练目标 | 扩散头 83%≫ 连续动作 MSE 35% ≫ 离散化动作 18% |
| 模型规模 | Octo-Base > Octo-Small,更大模型在场景感知和鲁棒性上更优 |
| 指令模态 | 目标图像指令比语言指令成功率高 25% |
| 微调效率 | 约 100 条演示 + 单卡 < 5 小时,平均成功率 72%(从零训练仅 20%,VC-1 仅 15%) |
六、SmolVLA(Hugging Face LeRobot)
消融规模:LIBERO 上全套消融
| 消融维度 | 结论 |
|---|---|
| 注意力结构 | CA+SA 交替 85.5%> 仅 CA 79.0% > 仅 SA 74.5% |
| 因果掩码 | 因果掩码 74.5% > 双向注意力 67.5%;防止动作"偷看未来",长时序任务从 23% 涨到 40% |
| VLM 层截断 | 用前 16 层 78.5%(仅比 32 层全量 80.3% 低 1.8 点),速度翻倍性价比极高;隔层采样优于小 VLM 但仍不如截前 N 层 |
| 训练目标 | Flow Matching 85.5%> L1 回归 75.25% |
| 动作分块大小 | 10-50 个动作的块大小在响应性和计算效率间取得平衡 |
| 异步推理 | 异步 73.3% vs 同步 78.3%,单任务耗时 13.75s → 9.7s(提速 30%),60s 内完成循环数 9→19 |
七、LingBot-VLA 2.0(蚂蚁灵波)
消融规模:4 个 GM-100 真机任务,聚焦动作表示与训练策略
| 消融维度 | 结论 |
|---|---|
| 动作目标 | 相对关节动作 55.0% ≫ 绝对关节动作 33.7%;相对动作把目标分布标准差从约 0.80 降到 0.28 |
| 动作归一化 | MeanStd 归一化最优;保住大幅修正动作(|x|>1.5 长尾不裁剪) |
| 损失函数 | L2 优于 L1(46.4% → 55.0%);relQpos 目标多在零附近,L2 更贴合高密度区;L1 仅在接触丰富/重尾的"挤番茄酱"任务上更好 |
| 分布对齐 | 提出"分布对齐 gap"指标解释 relQpos 收益:条码扫描任务关节动作 gap 远小于末端,关节动作成绩碾压(58.7 vs 24.0) |
💡 LingBot 的消融价值:把 VLA 里常被默认的"相对动作 + MeanStd + L2"组合给出了量化的、可复现的理由。
八、跨论文结论冲突与共识
把上面七份消融放一起看,有些点是共识,有些是冲突:
✅ 强共识
- 数据多样性 > 架构微调(OpenVLA、Octo、TRI 三篇一致)
- 扩散 / Flow Matching 训练目标优于 MSE / 离散分类(Octo、TRI、VLANeXt、SmolVLA、LLaVA-VLA 一致)
- VLA 必须微调视觉编码器(OpenVLA 明确,VLANeXt 通过线性投影器隐含)
- Action chunking 有益(VLANeXt chunk=4/8、LLaVA-VLA chunk=5、SmolVLA 10-50)
- 本体感受信号要显式注入(VLANeXt 注入 VLM 端最优、LLaVA-VLA token 化优于 MLP、LingBot 相对关节动作最优)
⚖️ 冲突点(取决于实验设置)
| 冲突点 | 立场 A | 立场 B |
|---|---|---|
| 参数规模 | VLANeXt:更大 VLM 骨干更好(Qwen3-VL-4B 95.8%) | LLaVA-VLA:0.5B 无预训练可媲美 7B |
| 解释 | VLANeXt 用了更大的 policy module 消化表征 | LLaVA-VLA 认为轻量 head 限制了大模型收益 |
| 离散动作 token | TRI:FAST/VQ-VAE 无显著收益 | LLaVA-VLA:配合 chunking 的粗粒度离散化可达媲美性能 |
| 时间观测历史 | VLANeXt:多帧历史反而引入噪声 | 多数 VLA:观测历史有益(但 VLANeXt 用当前帧+强 chunking 补偿了) |
⚠️ 单篇消融的局限性
- SmolVLA:消融主要在自己加的小模块上,没有换同尺度其他 VLM 做 backbone 对照——所以"小模型媲美大模型"的结论有内部有效性限制
- LingBot-VLA 2.0:消融聚焦动作表示 4 个选择,没有做数据规模 / 视觉骨干的消融
- TRI Co-training:结论是 4000 小时数据规模下的,低数据场景下单目 / 离散 token 可能仍有用(论文自己也承认潜在动作在低数据量下有效)
给新手的"消融结论查阅地图"
如果你的疑问是“XX 设计选择该不该用”,按下面这个映射去查对应论文的消融表:
- 数据怎么混合 →TRI Co-training
- 整个 VLA 架构怎么搭 →VLANeXt 12 条配方
- 小模型能不能打 →LLaVA-VLA 8 条结论
- 7B 级 VLA 工程化 →OpenVLA 消融表
- 通用机器人策略预训练 →Octo 表 II
- 高效 VLA(消费级 GPU)→SmolVLA LIBERO 消融
- 动作表示 / 归一化 / 损失 →LingBot-VLA 2.0 §6